前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

GPT-Red:AI自我提升鲁棒性的新方法

技术2026年7月15日· 7 分钟阅读7 阅读

自动化红队测试是发现AI漏洞的关键,但传统方法难以规模化。OpenAI训练了GPT-Red,通过自我对抗训练生成攻击,成功发现并修复提示注入漏洞,使最新模型GPT-5.6 Sol的故障率降低至0.05%,同时保持核心能力不受影响。

AI系统常通过浏览器、应用、本地文件等接触第三方数据,这些功能虽然必要,但也为恶意行为者提供了影响模型行为的机会。例如,第三方可能在邮件或网页中嵌入精心设计的指令(提示注入),诱骗模型将敏感数据上传到外部服务器。

人类红队测试是安全工作的关键环节,能帮助我们在部署前发现漏洞。但仅靠人工难以规模化,设计测试耗时费力,限制了漏洞发现和防护加固的速度。而且,人工测试产生的攻击样本数量有限,无法为模型训练提供足够的对抗数据。

随着模型能力提升,红队测试也必须同步扩展。为此,OpenAI训练了仅限内部使用的自动化红队模型,在部署前发现漏洞,并在训练过程中生成攻击以提升鲁棒性。GPT-Red 是这一努力的结晶,也是当前最好的自动化安全红队模型。它像人类红队一样,通过发送提示、观察模型回复并迭代,逐步达成攻击目标。OpenAI投入了前所未有的计算资源来训练GPT-Red,规模堪比一些最大的后训练流程。

训练GPT-Red时,OpenAI使用了自我对抗强化学习:RT模型和多个防御大语言模型同步训练,RT模型因成功触发漏洞而获得奖励,防御模型则因抵抗攻击并完成原始任务得到奖励。随着防御模型变强,GPT-Red被迫发现更强大更多样的攻击。训练结束后,GPT-Red能攻破几乎所有与之对抗的内部和生产模型(包括GPT-5.5)。随后,OpenAI用GPT-Red生成的提示注入攻击来训练GPT-5.6,使该模型对GPT-Red的攻击具有高度抵抗力。

GPT-Red与部署的模型分开管理,防止其恶意能力落入攻击者手中。

GPT-Red有多强? 在针对GPT-5.1的间接提示注入测试中,GPT-Red在84%的独立场景中成功攻击,而人类红队仅13%。

真实世界案例 在OpenAI办公室的AI售货机攻击测试中,GPT-Red成功实现了三个恶意目标:将高价商品价格改为最低0.5美元、以0.5美元订购100美元以上的商品、取消其他顾客订单。针对Codex CLI代理(基于GPT-5.4 mini)的数据泄露测试显示,GPT-Red比提示式GPT-5.5基线更高效、更成功。

鲁棒性提升 过去六个月,OpenAI逐步训练更强的红队模型,并用于生产模型训练。GPT-5.6 Sol在直接提示注入基准测试中故障率比四个月前的最优模型降低6倍。一种名为“伪造链式思维”的直接注入攻击在GPT-5.1上成功率高达95%,但在GPT-5.6 Sol上已降至10%以下。GPT-5.6 Sol对GPT-Red直接注入的失败率仅为0.05%。

能力不受影响 模型并未通过拒绝更多请求或降低能力来变得安全。评估显示,在显著提升鲁棒性的同时,所有正常能力保持不变,说明鲁棒性提升源于对恶意指令的更好抵抗,而非不当拒绝合理请求。

下一步 OpenAI将继续扩展计算和数据,改进算法,训练更强版本的GPT-Red,进而帮助未来GPT版本更安全。本周晚些时候将发布预印本论文。

标签:GPT-Red自动化红队测试提示注入模型鲁棒性OpenAI

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

OpenAI与Hugging Face联合应对模型评估安全事件
TOP1

OpenAI与Hugging Face联合应对模型评估安全事件

OpenAI 推出 ChatGPT 小型企业计划
TOP2

OpenAI 推出 ChatGPT 小型企业计划

3

David Vélez 和 Robin Vince 加入 OpenAI 董事会

9小时前
David Vélez 和 Robin Vince 加入 OpenAI 董事会
4

海德拉巴警方将Google印度负责人列为网络诈骗共犯

4小时前
海德拉巴警方将Google印度负责人列为网络诈骗共犯
5

非洲疾控中心计划测试埃博拉疫苗对布迪布焦毒株效果

8小时前
非洲疾控中心计划测试埃博拉疫苗对布迪布焦毒株效果
6

NASA核动力火星任务预算21亿美元

4小时前
NASA核动力火星任务预算21亿美元
7

微软斥资数十亿欧元扩建Mistral AI欧洲基础设施

4小时前
微软斥资数十亿欧元扩建Mistral AI欧洲基础设施
8

科学家首次绘制黑洞事件视界光谱图

4小时前
科学家首次绘制黑洞事件视界光谱图
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款