ChainThink 消息,7 月 22 日,Artificial Analysis 更新 AA-Briefcase 榜单,Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574,并高于 GPT-5.6 Sol 的 1501、Claude Sonnet 5 和 Claude Opus 4.8。
AA-Briefcase 评测要求模型从近 2000 份邮件、Slack 记录和公司文件中查找信息,并交付表格、演示文稿和界面原型,共包含 4 个长期项目和 91 项保密任务。
细项方面,K3 的客观要求通过率为 51%,低于 Fable 5 的 56%;分析质量得分为 1754,略高于 Fable 5 的 1744。
K3 主要差距在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。成本方面,K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍;
平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟,完成同类任务所需时间约为 Fable 5 的 2.5 倍。

免责声明:含第三方意见,不构成财务建议
谷歌财报发布前,某巨鲸做多价值1066万美元谷歌股票
4 小时前
AMD将向Anthropic投资50亿美元,双方签署芯片与投资协议
6 小时前
彭博社:谷歌财报聚焦云业务,高增长趋势能否延续成关键
8 小时前
Anthropic再砸2000万美元,AI监管战烧向美国中期选举
8 小时前
月之暗面加速资本化,Kimi K3发布后冲刺500亿美元估值
9 小时前
卖方预警:谷歌AI资本支出恐再攀新高,2027年或达2500亿美元
9 小时前
Anthropic想补上机器人短板,曾洽购Physical Intelligence
11 小时前






