ChainThink 消息,8 月 5 日,安全公司 Aikido 使用代码审计 Agent 测试 7 款模型,覆盖 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash、GPT-5.6 Sol、Luna 和 Terra。
测试包含 32 个近期公开漏洞,每款模型运行 3 次。Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率为 81.3%,与 Claude Opus 5 并列第一。
Qwen3.8-Max 的 F1 综合分为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。
其单次表现稳定性较弱,26 个漏洞中仅 10 个连续三轮均被找到,Opus 5 和 Sol 均为 19 个。
成本方面,Qwen3.8-Max 总成本约 821 美元,约为 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。
免责声明:含第三方意见,不构成财务建议
港股集体收盘,MINIMAX大涨约10%
13 小时前
Cursor重排GPU流水线,MoE模型训练提速41%
17 小时前
谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic
17 小时前
马斯克称下周发布Grok 4.6,SpaceX全量数据将用于模型训练
22 小时前
亚马逊跌逾2%,创始人贝索斯拟出售1500万股股票
1 天前
Anthropic与一家AI云初创公司签署100亿美元计算服务协议
1 天前
OpenAI创始人及员工合计持有公司48.93%股份
1 天前






