AOW 速览

AI 前沿 · 具身智能 / 智能汽车 / 智慧补能 · 独立开发与出海

缓存经济学

DeepSeek 三年把 KV 缓存压到 890 字节/token

2026-09-29 · AI 基建 · AI 前沿

一份长篇分析把 DeepSeek 三年的技术报告逐页算过账,写成四次断裂:V2 的 MLA 压缩要缓存什么,V3.2 的稀疏注意力决定读什么,V4 把多个 token 压进一个条目,而 9 月 10 日的 V4.1-Flash 又跨层复用条目并上了 4-bit 量化(分析全文)。动刀子的是钱:缓存命中价从每百万 token 0.014 美元降到 0.006,相对未命中的折扣从 10 倍拉到 50 倍。9 月 18 日,Kaino 援引了 vLLM 的独立测算为这条路线背书(Kaino 报道),而那份长篇分析把它列为核心论据:结论至今没过时,长上下文 agent 的正毛利正从这条曲线里长出来。