KV缓存是AI代理的重要瓶颈,新模型把用量砍到1/4
我是对的!再来确认一下我的论点。之前我一直说,KV Cache 会是 Agentic AI 的关键瓶颈之一。而最新的 DeepSeek V4.1-Flash 降低了 KV Cache 的使用量——HBM 只用了原来的1/4,SSD 只用了1/8。
一开始大家好像觉得「问题解决了」,但实际上,我觉得这反而更印证了我的论点,因为如果 KV Cache 不是问题,他们根本不需要这么重度地对它做优化……
现在发生的情况是:每个任务需要的 KV Cache 减少了 → AI Agent 成本变低了 → 使用的人变多了 → 上下文长度变长了 → 总推理量还是会继续增长。
我现在的论点是 → KV Cache 仍然会是瓶颈,但竞争正在从「谁的内存更大」转向「谁能以最正确、最高效的方式组织内存层级结构」。看到 DeepSeek 的这一动向后,我仍然看好 Memory、CXL、SSD、Networking、Inference Infra 这些赛道,认为它们还有相当大的增长空间。
简单总结一下,很多人可能觉得 KV Cache 的问题已经被解决了,但,就算问题被解决了,也不代表需求会消失啊(就像我说的连锁反应,越便宜,用的人越多,用的人越多,瓶颈就越明显,这是一个自循环),有时候甚至会让 AI 规模变得比之前更大。
---
DeepSeek V4.1 Flash 在 KernelBench-CUDA 上的表现。针对 RTX PRO 6000 的 DeepSeek 原生稀疏注意力达到密集等效屋顶线的0.50,在榜单上排第四。Fable 5.1 是1.06,Opus 5 是1.04,Fable 5 是0.73。
天花板按密集注意力计算,所以可靠单位是时间:六个形状的范围在0.059 到 0.736 毫秒之间。SM120 上的内联 PTX:`mma.sync` bf16、`ldmatrix`、异或交错的 `cp.async`,以及一个fp32块得分前8序融合到注意力核中,和参考值完全平局决胜。
然后它保留了稀疏性:在8K上下文下,语义大约需要因果块三角形的14%,而这个核执行了其中的78%。这种过度计算就是它和前三名的全部差距。
榜单其他结果:GLM-5.2 Fused MoE:达到屋顶线的9.5%,Opus 5 是10.7%。MegaQwen Decode:达到屋顶线的5.4%,Opus 5 是6.6%。Grid + MinGRU:达到屋顶线的29%,Opus 5 是196%。
对于 DeepSeek 的这个模型,我没用过很多次,所以我觉得至少在用之前要先测试它,但到目前为止,它作为通用任务委派者表现还不错。除了这个基准测试,我还没真试过 push 它的极限。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖