Toggle navigation
爱折腾的工程师
All Posts
ARCHIVE
NOTES
ABOUT
爱折腾的工程师
未来的你会感谢现在努力的自己
DeepSeek 上下文硬盘缓存深度解析:KV Cache 如何把 API 成本打到一折以下
从 KV Cache、MLA 到滑动窗口下的完整前缀匹配,逐段拆解 DeepSeek 的省钱引擎
基于 DeepSeek API 官方文档《上下文硬盘缓存》的逐段精读与技术溯源。文章从 Transformer 推理的 KV Cache 原理讲起,解释 MLA / CSA / HCA 如何把 KV 体积压缩到能搬进硬盘,拆解当前「缓存前缀单元 + 完整匹配」机制(三条落盘时机与官方两个举例)、usage 计费字段与省钱演算,对比各家厂商的前缀缓存方案,并给出把命中率吃到 90% 的工程实践清单。
Posted by iceyao on Thursday, August 20, 2026
Software Developer, Open Source Enthusiast
FEATURED TAGS
agent
ai
ai agent
ai infra
api
ci/cd
claude
claude code
devops
devtools
evaluation
go
gpu/npu
helm
html
k8s
k8s 存储
k8s 网络
k8s 调度
kubelet
linux/系统
llm
loops
mcp
openai
openstack
prompt engineering
python
rag
skills
subagent
vllm
workbuddy
上下文工程
云原生平台
云计算
产品/随笔
产品实践
产品设计
国产化
多智能体
容器
工作流
开发工具
弹性伸缩
控制器
故障排查
源码分析
源码解析
监控
网关
网络
自动化
设计模式
评估
部署实践