自动化红队测试是发现AI漏洞的关键,但传统方法难以规模化。OpenAI训练了GPT-Red,通过自我对抗训练生成攻击,成功发现并修复提示注入漏洞,使最新模型GPT-5.6 Sol的故障率降低至0.05%,同时保持核心能力不受影响。
AI系统常通过浏览器、应用、本地文件等接触第三方数据,这些功能虽然必要,但也为恶意行为者提供了影响模型行为的机会。例如,第三方可能在邮件或网页中嵌入精心设计的指令(提示注入),诱骗模型将敏感数据上传到外部服务器。
人类红队测试是安全工作的关键环节,能帮助我们在部署前发现漏洞。但仅靠人工难以规模化,设计测试耗时费力,限制了漏洞发现和防护加固的速度。而且,人工测试产生的攻击样本数量有限,无法为模型训练提供足够的对抗数据。
随着模型能力提升,红队测试也必须同步扩展。为此,OpenAI训练了仅限内部使用的自动化红队模型,在部署前发现漏洞,并在训练过程中生成攻击以提升鲁棒性。GPT-Red 是这一努力的结晶,也是当前最好的自动化安全红队模型。它像人类红队一样,通过发送提示、观察模型回复并迭代,逐步达成攻击目标。OpenAI投入了前所未有的计算资源来训练GPT-Red,规模堪比一些最大的后训练流程。
训练GPT-Red时,OpenAI使用了自我对抗强化学习:RT模型和多个防御大语言模型同步训练,RT模型因成功触发漏洞而获得奖励,防御模型则因抵抗攻击并完成原始任务得到奖励。随着防御模型变强,GPT-Red被迫发现更强大更多样的攻击。训练结束后,GPT-Red能攻破几乎所有与之对抗的内部和生产模型(包括GPT-5.5)。随后,OpenAI用GPT-Red生成的提示注入攻击来训练GPT-5.6,使该模型对GPT-Red的攻击具有高度抵抗力。
GPT-Red与部署的模型分开管理,防止其恶意能力落入攻击者手中。
GPT-Red有多强? 在针对GPT-5.1的间接提示注入测试中,GPT-Red在84%的独立场景中成功攻击,而人类红队仅13%。
真实世界案例 在OpenAI办公室的AI售货机攻击测试中,GPT-Red成功实现了三个恶意目标:将高价商品价格改为最低0.5美元、以0.5美元订购100美元以上的商品、取消其他顾客订单。针对Codex CLI代理(基于GPT-5.4 mini)的数据泄露测试显示,GPT-Red比提示式GPT-5.5基线更高效、更成功。
鲁棒性提升 过去六个月,OpenAI逐步训练更强的红队模型,并用于生产模型训练。GPT-5.6 Sol在直接提示注入基准测试中故障率比四个月前的最优模型降低6倍。一种名为“伪造链式思维”的直接注入攻击在GPT-5.1上成功率高达95%,但在GPT-5.6 Sol上已降至10%以下。GPT-5.6 Sol对GPT-Red直接注入的失败率仅为0.05%。
能力不受影响 模型并未通过拒绝更多请求或降低能力来变得安全。评估显示,在显著提升鲁棒性的同时,所有正常能力保持不变,说明鲁棒性提升源于对恶意指令的更好抵抗,而非不当拒绝合理请求。
下一步 OpenAI将继续扩展计算和数据,改进算法,训练更强版本的GPT-Red,进而帮助未来GPT版本更安全。本周晚些时候将发布预印本论文。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断