今天 DeepSeek 开源的是一个自研的高速文件系统,对集群固态存储有很好的优化,也是我预测会开源的三个 infra 中的第二个(x
这个技术的重要性不亚于 FlashMLA,用户也可以明显感知到使用体验上的提升,其主要作用于 kvcache 的提速降本
使用过 DeepSeek API 的群友可能都会发现两个事情:API 的收费分输入和输出,其中输入「如果缓存击中,则价格打骨折」,这个缓存就是 kvcache
大家都知道现在的 causallm 都是相当于给出所有的上文(prefill),让模型预测下一个词;而由于 transformer 的无状态特性,每推理一个词模型都会需要把所有上文全部重新读一遍,非常浪费。kvcache 就是把重新读一遍前面部分的计算结果先暂存下来,来缓解这个问题
这个技术的重要性不亚于 FlashMLA,用户也可以明显感知到使用体验上的提升,其主要作用于 kvcache 的提速降本
使用过 DeepSeek API 的群友可能都会发现两个事情:API 的收费分输入和输出,其中输入「如果缓存击中,则价格打骨折」,这个缓存就是 kvcache
大家都知道现在的 causallm 都是相当于给出所有的上文(prefill),让模型预测下一个词;而由于 transformer 的无状态特性,每推理一个词模型都会需要把所有上文全部重新读一遍,非常浪费。kvcache 就是把重新读一遍前面部分的计算结果先暂存下来,来缓解这个问题