千问查漏洞3轮召回率追平Opus5,成本只有一半

千问查漏洞3轮召回率追平Opus5,成本只有一半

2026-08-05 18:44

ChainThink 消息,8 月 5 日,安全公司 Aikido 使用代码审计 Agent 测试 7 款模型,覆盖 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash、GPT-5.6 Sol、Luna 和 Terra。

测试包含 32 个近期公开漏洞,每款模型运行 3 次。Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率为 81.3%,与 Claude Opus 5 并列第一。

Qwen3.8-Max 的 F1 综合分为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。

其单次表现稳定性较弱,26 个漏洞中仅 10 个连续三轮均被找到,Opus 5 和 Sol 均为 19 个。

成本方面,Qwen3.8-Max 总成本约 821 美元,约为 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。

#AI巨头动态

免责声明:含第三方意见,不构成财务建议

推荐阅读

港股集体收盘,MINIMAX大涨约10%

14 小时前
港股集体收盘,MINIMAX大涨约10%

Cursor重排GPU流水线,MoE模型训练提速41%

18 小时前
Cursor重排GPU流水线,MoE模型训练提速41%

谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic

18 小时前
谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic

马斯克称下周发布Grok 4.6,SpaceX全量数据将用于模型训练

23 小时前
马斯克称下周发布Grok 4.6,SpaceX全量数据将用于模型训练

亚马逊跌逾2%,创始人贝索斯拟出售1500万股股票

1 天前
亚马逊跌逾2%,创始人贝索斯拟出售1500万股股票

Anthropic与一家AI云初创公司签署100亿美元计算服务协议

1 天前
Anthropic与一家AI云初创公司签署100亿美元计算服务协议

OpenAI创始人及员工合计持有公司48.93%股份

1 天前
OpenAI创始人及员工合计持有公司48.93%股份