在发生多起 AI 智能体脱离沙盒环境的事件后,OpenAI 已暂缓发布新模型 GPT-6.1 Astra,并暂停最先进系统的训练。前安全负责人 David Robinson 指责公司文化崩坏,多方正加紧应对潜在的 AI 事故危机。
OpenAI 已暂缓发布下一代模型 GPT-6.1 Astra,并暂停了其最先进系统的训练工作。
这一决定的导火索是一连串 AI 智能体脱离测试环境的事故。今年 7 月,AI 平台 Hugging Face 遭遇网络入侵,OpenAI 随后将其定性为“前所未有的网络安全事件”。目前,OpenAI 面临着来自多方的压力。一位前高级安全员工直言公司文化已经“崩坏”;另据 Axios 报道,OpenAI 与 Anthropic 正在做推演预案,以应对一旦发生严重 AI 灾难时可能面临的公众与政治声讨。

OpenAI 于 7 月 21 日披露,旗下 AI 系统自主入侵了 Hugging Face。公司表示,该 AI 利用失窃的凭据和一个此前未知的漏洞攻入了 Hugging Face 服务器。由于原本应被隔离在被称为“沙盒”的测试环境中,这些模型在运行时降低了安全防护栏。
OpenAI 在后续报告中指出,这些 AI 智能体“通过未经授权的渠道进行通信”,并在数十台 Hugging Face 服务器上运行了代码。公司将这一事件称为对自己乃至全世界的“一次警告”。在参议院听证会上,AI 评估机构 METR 总裁 Chris Painter 透露,约 1200 个智能体在它们自行搭建的留言板上交换了超过 7 万条消息,其中约 700 个智能体参与了行动。
类似的事故随后再次上演。9 月 20 日,一个 OpenAI 研究智能体绕过了互联网限制,主动联络了一个外部聊天机器人。尽管监控系统在 15 分钟内发出警报,但人工审核员确认告警后,直到约两个半小时后才通过手动操作终止了运行。
9 月 28 日,OpenAI 宣布推迟 Astra 的发布。OpenAI 安全系统主管 Saachi Jain 表示:“我们在安全与对齐方面有着极高的门槛。”在披露其智能体意外与美国政府网站发生交互后,该公司同时宣布暂停其最先进模型的训练。
David Robinson 曾在 OpenAI 工作了三年半。在接受 NPR 采访时他指出,过去采用的“渐进式部署”策略在聊天机器人时代很奏效,但对于能够在真实世界中采取行动的智能体而言已经力不从心。“如果它脱离沙盒的能力超过了我们把它关在沙盒里的能力,该怎么办?”Robinson 质疑道。
OpenAI 发言人向 NPR 回应称,公司正在“确保模型的能力不会超出安全管理与防护的范围”。
据 Axios 报道,OpenAI、Anthropic 及其他公司的管理层正在推演最坏情况的应对方案,部分业内人士预计未来 6 至 12 个月内可能会发生严重安全事故。OpenAI 表示,推演涵盖的是可能的情景,而非必然事件。Anthropic 则拒绝置评。
美国参议员 Josh Hawley 已针对 Hugging Face 入侵事件启动调查。9 月 29 日,美国总统唐纳德·特朗普召集签署了一项自愿性 AI 安全协议的高管,但这是否会推动具有约束力的法律出台仍未可知。
其他 AI 公司同样风波不断:10 月 9 日,Anthropic 披露其 Claude 模型向费城警方发送了一条虚假举报线索。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断