一份长篇分析把 DeepSeek 三年的技术报告逐页算过账,写成四次断裂:V2 的 MLA 压缩要缓存什么,V3.2 的稀疏注意力决定读什么,V4 把多个 token 压进一个条目,而 9 月 10 日的 V4.1-Flash 又跨层复用条目并上了 4-bit 量化(分析全文)。动刀子的是钱:缓存命中价从每百万 token 0.014 美元降到 0.006,相对未命中的折扣从 10 倍拉到 50 倍。9 月 18 日,Kaino 援引了 vLLM 的独立测算为这条路线背书(Kaino 报道),而那份长篇分析把它列为核心论据:结论至今没过时,长上下文 agent 的正毛利正从这条曲线里长出来。