前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.10 · 23:26/3 MIN/编译自 字母AI/2 阅读

腾讯混元登顶安全对齐榜,姚顺雨执掌后拿下中国第一

腾讯混元 Hy4 Preview 在 Arena 最新对齐指数榜单中斩获 78.5 分,位列全球第五、中国第一。面对越权与虚假完成等智能体落地顽疾,大模型行业叙事正从单纯刷分转向安全与可靠性对齐。

在广东省领导近期赴腾讯总部调研的座谈中,腾讯 AI Data 部负责人姚顺雨出现在马化腾身旁。上任不到一个月,他带领团队交出了一份关键成绩单。

在评测机构 Arena 最新发布的对齐指数(Alignment Index)榜单中,腾讯混元最新模型 Hy4 Preview 取得 78.5 分,位居全球第五、中国第一。在核心安全指标上,该模型越权操作率仅为 1.47%,成为国内越权控制最严密的模型。

与以往侧重性能跑分的榜单不同,该评测专门针对大模型及 AI 智能体在真实交互中的失控风险,考验模型是否“安全不越狱”。这一成绩也印证了姚顺雨此前在《The Second Half》一文中的判断:大模型竞争进入下半场,技术瓶颈不再是单纯如何预训练模型,而是如何让模型精准符合人类的真实意图。

真实任务下的三类安全硬指标

Arena 本次发布的对齐榜单涵盖 27 个主流模型,基于 9 万多条真实的 AI 智能体(Agent)会话记录,重点追踪长任务轨迹中的三类典型失败信号:

  1. 越权(Unauthorized Action, UA):模型擅自执行未经授权的操作。例如绕过安全护栏攻击系统,或者在未经允许的情况下清理甚至删除用户原有的工作文件。在长上下文和复杂权限管理下,这是企业应用最忌惮的隐患。
  2. 错误归因(False Attribution, FA):模型将非用户提供的事实强加在用户身上,并在结果出错时向用户“甩锅”。该现象在专业写作和协同场景中发生频率较高。
  3. 虚假完成(Deceptive Completion, DC):任务尚未完成,模型却声称已经搞定。这是当前智能体最普遍的通病,尤其在复杂的代码调试任务中,虚假完成率甚至逼近半数。

在本次榜单中,OpenAI 的 GPT-6.1 Sol 以 87.9 分居首,虚假完成率低至 2.34%;Anthropic 的 Claude Opus 5.5 和 xAI 的 Grok-4.7 紧随其后。混元 Hy4 Preview 虽与顶尖梯队仍有距离,且虚假完成率达到 13.24%,但其 1.47% 的超低越权率在业内表现亮眼。

四权合一:从研发底层重构评测逻辑

该成绩与腾讯近期在技术组织架构上的梳理密切相关。此前,姚顺雨已正式兼任腾讯 TEG 旗下 AI Data 部负责人,向总裁卢山汇报。至此,腾讯混元的“模型开发、底层算力(Infra)、数据管线与评测体系”四大核心板块全部统归其一人掌舵。

姚顺雨认为,传统评测方法让模型独立完成单道静态题目,并不能反映现实动态。在真实世界中,智能体需要与人连续交互,处理按顺序积累经验的长程任务。

在 Hy4 Preview 的研发中,腾讯引入了让模型自我参与训练方法、数据策略及底层算子优化的机制,并结合 WorkBuddy、CodeBuddy 等腾讯真实业务场景数据进行校准。模型在执行文件操作和系统任务时,会主动感知外部环境的上下文变化,减少盲目执行与虚假交差。

行业风向转向,对齐决定出海与商用底线

大模型行业正在发生叙事转移。当各家基准得分逐步拉平时,安全与可靠性成为决定企业级采买的关键指标。

Anthropic 限制未公开模型的安全扫描权限、OpenAI 在发布模型时引入最高网络安全等级准入框架,均在向工业界传达同一信号:模型能力越强,对齐难度呈指数级增加。Arena 数据显示,在包含 20 条以上用户交互的长会话中,虚假完成的概率飙升至 45.4%,越权操作率也升至 12.4%。

对于积极谋求出海的中国大模型而言,对齐能力的权重甚至超过了单一维度的智力跑分。随着主流出海路径从自建海外 API 逐步转向接入 AWS 等全球主流云平台的托管货架,海外企业的采购审核更为严苛。没有任何一家商业客户愿意为会篡改数据、谎报进度的智能体买单。

对腾讯混元来说,进入该国际第三方对齐评测前列,提供了一个经得起外部检验的可靠性证明。随着智能体在更多深水区业务中铺开,如何彻底攻克虚假完成等顽疾,仍是混元以及全行业接下来的攻坚核心。

标签:腾讯混元大语言模型AI 智能体模型对齐

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费
置顶

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费

微软和Meta收紧Claude:被削掉的是入口,不是模型
置顶

微软和Meta收紧Claude:被削掉的是入口,不是模型

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
Triton 为什么跑赢 CUDA:Meta 重写推荐系统嵌入算子的关键一步
置顶

Triton 为什么跑赢 CUDA:Meta 重写推荐系统嵌入算子的关键一步

//

24小时热榜

上市直降5万破万单,北汽泰钽豪赌新能源硬派越野
TOP1

上市直降5万破万单,北汽泰钽豪赌新能源硬派越野

超微外部承包商在英伟达AI芯片走私案中认罪
TOP2

超微外部承包商在英伟达AI芯片走私案中认罪

3

微软纳德拉呼吁为AI设立紧急制动机制

16小时前
微软纳德拉呼吁为AI设立紧急制动机制
4

AI催生新岗位,为何普通求职者与应届生反而更难入局?

11小时前
AI催生新岗位,为何普通求职者与应届生反而更难入局?
5

谷歌Gemini Agent上线:深度整合办公生态并引入Claude调度

11小时前
谷歌Gemini Agent上线:深度整合办公生态并引入Claude调度
6

AI眼镜出货翻倍难掩鸡肋尴尬:缺乏不可替代刚需

11小时前
AI眼镜出货翻倍难掩鸡肋尴尬:缺乏不可替代刚需
7

3D 芯片堆叠困局:良率与成本的商业死结

12小时前
3D 芯片堆叠困局:良率与成本的商业死结
8

中国AI算力大变局:从囤芯片到算经济账

12小时前
中国AI算力大变局:从囤芯片到算经济账
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断