ChainThink 消息,7 月 25 日,据第三方评测机构 Artificial Analysis,Claude Opus 5 在综合 9 项测试的智能指数中得分 61 分,窄幅领先 Fable 5 的 60 分。
GPT-5.6 Sol 得分 59 分,Kimi K3 得分 57 分。成本方面,Opus 5 每项任务平均成本为 2.03 美元,较 Fable 5 的 2.75 美元低 26%。
该模型在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中排名第一,搭配 Claude Code 后并列获得编程 Agent 指数第一;
Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。Opus 5 提供 5 档推理强度。
从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo,用户可在性能与成本之间调整。
评测同时显示,Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,其幻觉率升至 50%,较 Opus 4.8 高 14 个百分点;
低推理档位性价比仍略低于 GPT-5.6 系列。
免责声明:含第三方意见,不构成财务建议
美国现货比特币 ETF 单周流入 10 亿美元创 4 月来新高
5 小时前
美国原油库存历史性下降至7.12亿桶,为1984年3月以来最低水平
6 小时前
做空1.02亿美元比特币的巨鲸遭部分清算,剩余仓位清算价约6.53万美元
6 小时前
Nansen创始人:比特币永远不会再跌破6万美元,全球货币宽松周期没有终结迹象
7 小时前
BitMart 创始人回应提币困难及员工欠薪:没有跑路,正在进行资产盘点
8 小时前
GSR:加密项目财库过度集中于原生代币,顺周期结构加剧熊市脆弱性
9 小时前
从安全危机到行情催化,彭博分析师称Coldcard黑客事件或成BTC市场转折信号
9 小时前






