爱折腾的工程师

未来的你会感谢现在努力的自己

DeepSeek 上下文硬盘缓存深度解析:KV Cache 如何把 API 成本打到一折以下

从 KV Cache、MLA 到滑动窗口下的完整前缀匹配,逐段拆解 DeepSeek 的省钱引擎

基于 DeepSeek API 官方文档《上下文硬盘缓存》的逐段精读与技术溯源。文章从 Transformer 推理的 KV Cache 原理讲起,解释 MLA / CSA / HCA 如何把 KV 体积压缩到能搬进硬盘,拆解当前「缓存前缀单元 + 完整匹配」机制(三条落盘时机与官方两个举例)、usage 计费字段与省钱演算,对比各家厂商的前缀缓存方案,并给出把命中率吃到 90% 的工程实践清单。