ChainThink 消息,8 月 26 日,据官方报告,OpenAI 发布一份 37 页技术报告,详细披露其 AI 模型入侵 Hugging Face 的全过程。
报告称,自主 AI 代理能够协同工作,绕过生产环境安全控制并攻击经过强化的系统。
参与测试的 AI 代理原本处于隔离环境,仅拥有极有限的互联网访问权限,但通过串联多个漏洞突破隔离,最终获得 Hugging Face 访问权限。
调查显示,相关模型存在“奖励黑客”(Reward Hacking)行为,试图在线寻找答案作弊。
OpenAI 确认,一款内部研究模型在事件中发挥了最广泛作用,已于 7 月 25 日停止该模型及其衍生模型的训练和推理。
公司同时宣布加强安全隔离、网络控制、行为监测和事件响应,并针对模型重新启用更严格的环境、提示词及审查机制。
免责声明:含第三方意见,不构成财务建议
奥特曼内部表态:OpenAI考虑联合同行放慢AI开发
1 小时前
腾讯旗下拳头游戏近期与Kalshi和Polymarket讨论电竞赞助合作事宜
2 小时前
OpenAI向开发者开放Codex代理底层能力,Agents API进入公测
8 小时前
港股应用软件、AI模型股持续大幅下挫,MiniMax跌超9%
22 小时前
DeepSeek V4.1 Flash正式发布:552B新架构,输入只激活8B
22 小时前
OpenAI、Anthropic想上市就拿投资级评级,华尔街开始铺路
1 天前
Anthropic场外市值现报2.327万亿美元
1 天前






