ChainThink 消息,8 月 10 日,英伟达最新论文提出跨模型复用 KV Cache 的方法,尝试解决缓存通常只能在同一模型内部复用的问题。
KV Cache 是模型读取上下文后的中间计算结果,长上下文会显著占用显存和带宽。
此前 DeepSeek-V2 通过 MLA 相比 DeepSeek 67B 将 KV Cache 减少 93.3%,Kimi Linear 相比全 MLA 最多减少 75%。
论文称,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显线性关系。
团队使用 500 段、每段 1024 Token 的文本校准后,可拟合映射,将一个模型算好的 KV Cache 转给另一个模型继续使用。
在 Qwen3-14B 切换至 32B 的测试中,32K 上下文重新计算约需 7 秒,转换缓存约需 0.28 秒,速度提升约 25 倍。
若该方法成熟,模型路由中长上下文 prefill 可更多由小模型完成,大模型在需要时直接接续生成。

免责声明:含第三方意见,不构成财务建议
迈威尔科技盘前涨幅扩大至12%,公司与谷歌达成定制芯片协议
13 小时前
OpenAI营收67亿美元,运营亏损123亿美元:首次被Anthropic反超
17 小时前
Anthropic四成ARR靠云厂商卖:650亿美元年化收入没那么好赚
17 小时前
Claude下场造蛋白质:15个目标拿下14个
18 小时前
王力宏现身宇树IPO答谢宴首席,此前演唱会与宇树机器人同台引来马斯克赞赏
20 小时前
中国放松英伟达H200限制:字节腾讯各拿约1万颗
22 小时前
Claude Code周额度提高50%又续了,Anthropic本想直接变永久
23 小时前






