ChainThink 消息,Claude Code 负责人 Boris Cherny 表示,Anthropic 已在实际使用中基本解决提示词注入攻击。一年前,他自己也没想到能做到这个程度。
提示词注入一直是 Agent 的主要风险之一,恶意网页可隐藏指令,诱导 Agent 盗取密码、上传密钥或执行用户未要求的操作。
Anthropic 目前通过三层防护拦截:Claude 先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前由 Auto Mode 再审一次。
第三方测试使用了 72 种此前未见过的攻击,并重复 720 次。结果显示,Sonnet 5、Fable 5 和 Opus 5 在开启 Auto Mode 后一次都未被成功攻破;
同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则为 19.03%。

免责声明:含第三方意见,不构成财务建议
迈威尔科技盘前涨幅扩大至12%,公司与谷歌达成定制芯片协议
14 小时前
OpenAI营收67亿美元,运营亏损123亿美元:首次被Anthropic反超
17 小时前
Anthropic四成ARR靠云厂商卖:650亿美元年化收入没那么好赚
18 小时前
Claude下场造蛋白质:15个目标拿下14个
19 小时前
王力宏现身宇树IPO答谢宴首席,此前演唱会与宇树机器人同台引来马斯克赞赏
20 小时前
中国放松英伟达H200限制:字节腾讯各拿约1万颗
23 小时前
Claude Code周额度提高50%又续了,Anthropic本想直接变永久
23 小时前






