腾讯混元 Hy4 Preview 在 Arena 最新对齐指数榜单中斩获 78.5 分,位列全球第五、中国第一。面对越权与虚假完成等智能体落地顽疾,大模型行业叙事正从单纯刷分转向安全与可靠性对齐。
在广东省领导近期赴腾讯总部调研的座谈中,腾讯 AI Data 部负责人姚顺雨出现在马化腾身旁。上任不到一个月,他带领团队交出了一份关键成绩单。
在评测机构 Arena 最新发布的对齐指数(Alignment Index)榜单中,腾讯混元最新模型 Hy4 Preview 取得 78.5 分,位居全球第五、中国第一。在核心安全指标上,该模型越权操作率仅为 1.47%,成为国内越权控制最严密的模型。
与以往侧重性能跑分的榜单不同,该评测专门针对大模型及 AI 智能体在真实交互中的失控风险,考验模型是否“安全不越狱”。这一成绩也印证了姚顺雨此前在《The Second Half》一文中的判断:大模型竞争进入下半场,技术瓶颈不再是单纯如何预训练模型,而是如何让模型精准符合人类的真实意图。
Arena 本次发布的对齐榜单涵盖 27 个主流模型,基于 9 万多条真实的 AI 智能体(Agent)会话记录,重点追踪长任务轨迹中的三类典型失败信号:
在本次榜单中,OpenAI 的 GPT-6.1 Sol 以 87.9 分居首,虚假完成率低至 2.34%;Anthropic 的 Claude Opus 5.5 和 xAI 的 Grok-4.7 紧随其后。混元 Hy4 Preview 虽与顶尖梯队仍有距离,且虚假完成率达到 13.24%,但其 1.47% 的超低越权率在业内表现亮眼。
该成绩与腾讯近期在技术组织架构上的梳理密切相关。此前,姚顺雨已正式兼任腾讯 TEG 旗下 AI Data 部负责人,向总裁卢山汇报。至此,腾讯混元的“模型开发、底层算力(Infra)、数据管线与评测体系”四大核心板块全部统归其一人掌舵。
姚顺雨认为,传统评测方法让模型独立完成单道静态题目,并不能反映现实动态。在真实世界中,智能体需要与人连续交互,处理按顺序积累经验的长程任务。
在 Hy4 Preview 的研发中,腾讯引入了让模型自我参与训练方法、数据策略及底层算子优化的机制,并结合 WorkBuddy、CodeBuddy 等腾讯真实业务场景数据进行校准。模型在执行文件操作和系统任务时,会主动感知外部环境的上下文变化,减少盲目执行与虚假交差。
大模型行业正在发生叙事转移。当各家基准得分逐步拉平时,安全与可靠性成为决定企业级采买的关键指标。
Anthropic 限制未公开模型的安全扫描权限、OpenAI 在发布模型时引入最高网络安全等级准入框架,均在向工业界传达同一信号:模型能力越强,对齐难度呈指数级增加。Arena 数据显示,在包含 20 条以上用户交互的长会话中,虚假完成的概率飙升至 45.4%,越权操作率也升至 12.4%。
对于积极谋求出海的中国大模型而言,对齐能力的权重甚至超过了单一维度的智力跑分。随着主流出海路径从自建海外 API 逐步转向接入 AWS 等全球主流云平台的托管货架,海外企业的采购审核更为严苛。没有任何一家商业客户愿意为会篡改数据、谎报进度的智能体买单。
对腾讯混元来说,进入该国际第三方对齐评测前列,提供了一个经得起外部检验的可靠性证明。随着智能体在更多深水区业务中铺开,如何彻底攻克虚假完成等顽疾,仍是混元以及全行业接下来的攻坚核心。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断