DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

2026-08-10 12:15

ChainThink 消息,8 月 10 日,英伟达最新论文提出跨模型复用 KV Cache 的方法,尝试解决缓存通常只能在同一模型内部复用的问题。

KV Cache 是模型读取上下文后的中间计算结果,长上下文会显著占用显存和带宽。

此前 DeepSeek-V2 通过 MLA 相比 DeepSeek 67B 将 KV Cache 减少 93.3%,Kimi Linear 相比全 MLA 最多减少 75%。

论文称,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显线性关系。

团队使用 500 段、每段 1024 Token 的文本校准后,可拟合映射,将一个模型算好的 KV Cache 转给另一个模型继续使用。

在 Qwen3-14B 切换至 32B 的测试中,32K 上下文重新计算约需 7 秒,转换缓存约需 0.28 秒,速度提升约 25 倍。

若该方法成熟,模型路由中长上下文 prefill 可更多由小模型完成,大模型在需要时直接接续生成。

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用
#AI巨头动态

免责声明:含第三方意见,不构成财务建议

推荐阅读

迈威尔科技盘前涨幅扩大至12%,公司与谷歌达成定制芯片协议

13 小时前
迈威尔科技盘前涨幅扩大至12%,公司与谷歌达成定制芯片协议

OpenAI营收67亿美元,运营亏损123亿美元:首次被Anthropic反超

17 小时前
OpenAI营收67亿美元,运营亏损123亿美元:首次被Anthropic反超

Anthropic四成ARR靠云厂商卖:650亿美元年化收入没那么好赚

17 小时前
Anthropic四成ARR靠云厂商卖:650亿美元年化收入没那么好赚

Claude下场造蛋白质:15个目标拿下14个

18 小时前
Claude下场造蛋白质:15个目标拿下14个

王力宏现身宇树IPO答谢宴首席,此前演唱会与宇树机器人同台引来马斯克赞赏

20 小时前
王力宏现身宇树IPO答谢宴首席,此前演唱会与宇树机器人同台引来马斯克赞赏

中国放松英伟达H200限制:字节腾讯各拿约1万颗

22 小时前
中国放松英伟达H200限制:字节腾讯各拿约1万颗

Claude Code周额度提高50%又续了,Anthropic本想直接变永久

23 小时前
Claude Code周额度提高50%又续了,Anthropic本想直接变永久