前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.08 · 17:28/3 MIN/编译自 允中/0 阅读

首个多学科论文复现基准发布:GPT最强模型成功率仅13.98%

UniPat AI发布多学科端到端论文复现基准PaperBenchX。在93个真实跨学科科学任务中,顶尖模型GPT-6 Astra完整复现率仅为13.98%,揭示了AI在迈向自主科研时面临的严峻瓶颈。

即便大语言模型能够解出复杂的千禧年数学难题,但距离成为真正合格的「AI科学家」依旧路途漫漫。

近期,UniPat AI发布了国际上首个跨多学科的端到端论文结果复现基准测试——PaperBenchX。在针对93个真实科研复现任务的测试中,当前表现最顶尖的GPT-6 Astra模型,完整复现率仅为13.98%。

测评总体与分阶段表现

这意味着,模型即便能够生成看似合理的数值,但在从头运行完整工作流、产出与论文一致且完全可验证的科学证据方面,成功率不足七分之一。

衡量科学AI,亟需全新标尺

数学领域尚有形式化验证工具Lean作为检验真伪的兜底机制。但在物理、化学、材料等广泛的自然科学领域,并不存在现成的验证器。一个与论文吻合的数字,背后可能是完全错误的物理模型、未收敛的数值仿真,或者是巧合凑出的结果。

在评估AI自主提出假设、设计实验之前,一个基础前提是:AI能否可靠地将一项已发表的科学研究重做一遍,并证明自己确实做对了?

任务分布与评分构成

PaperBenchX正是为此而设计。该基准从93篇研究论文中提炼出93个复现任务,涵盖电磁、光子、化学、材料、生物及机器人等12个研究方向,依托10种领域原生科学环境,设立了3168条经专家校验的评分项。

测试流程极为严苛:

  1. AI智能体(Agent)接收一篇真实论文、配置好特定专业软件的容器化环境以及复现任务书;
  2. AI智能体交付一份可执行的复现工作流;
  3. 评分系统在提交后清空全部输出并断开网络,在隔离环境中重新执行整条工作流,仅依据重放产物与原始证据链进行判定。

13.98%背后:科研复现难在何处?

通过对10组前沿模型与Agent框架的轨迹分析,研究团队指出了阻碍可靠复现的核心原因:

工作流阶段得分与轨迹分析

  • 局部跑通不等于完整复现:所有受测配置在建模和执行阶段的平均得分均超过60%,但在验证阶段仅有42.80%。多数Agent可以调用求解器产生文件,却无法保证整个科学流程串联后的有效性。
  • 交互轮数增加不代表表现更佳:频繁的交互往往源于报错恢复或在错误模型上徒劳计算,盲目重试无法弥补逻辑漏洞。
  • 前期决策具有决定性作用:若几何结构、边界条件或关键物理参数设定错误,求解器即使顺利运行数小时,得出的也是错误系统的无效数值。

真正对接领域原生工具的基准

以往诸如PaperBench等评测大多局限在机器学习与Python代码生态中。PaperBenchX的一大差异化在于要求Agent直接面对Ansys HFSS、Lumerical、Meep、PySCF以及ABACUS等真实的领域原生求解器。

任务构建与验证流程

在4至24小时的有限时间窗口内,Agent必须自主决定网格加密、容差设置、异常发散诊断等计算策略。这检验的是AI是否真正具备理解科学、执行仿真与判断结果可信度的综合工作流能力。

标签:OpenAIAI for Science大语言模型基准测试

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费
置顶

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费

微软和Meta收紧Claude:被削掉的是入口,不是模型
置顶

微软和Meta收紧Claude:被削掉的是入口,不是模型

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化
置顶

FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化

//

24小时热榜

Rembrandt:免费本地AI图片编辑器,开源替代Adobe Lightroom
TOP1

Rembrandt:免费本地AI图片编辑器,开源替代Adobe Lightroom

Robotaxi迎来合纵连横时代:单打独斗已成过去
TOP2

Robotaxi迎来合纵连横时代:单打独斗已成过去

3

Anthropic更新使用政策:禁止虐待Claude模型

5小时前
Anthropic更新使用政策:禁止虐待Claude模型
4

基因组研究揭秘夏威夷与复活节岛先祖航海迁徙史

6小时前
基因组研究揭秘夏威夷与复活节岛先祖航海迁徙史
5

四巨头筹资近4000亿元,锁定AI算力军备竞赛

7小时前
四巨头筹资近4000亿元,锁定AI算力军备竞赛
6

华为等多团队开源企业级AgentOS,加速智能体规模落地

7小时前
华为等多团队开源企业级AgentOS,加速智能体规模落地
7

Anthropic 发起网络安全使命:用 AI 护航关键基建与开源生态

10小时前
Anthropic 发起网络安全使命:用 AI 护航关键基建与开源生态
8

OpenAI端掉俄伊AI虚假信息网:伪造智库与记者渗透主流媒体

18小时前
OpenAI端掉俄伊AI虚假信息网:伪造智库与记者渗透主流媒体
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断