UniPat AI发布多学科端到端论文复现基准PaperBenchX。在93个真实跨学科科学任务中,顶尖模型GPT-6 Astra完整复现率仅为13.98%,揭示了AI在迈向自主科研时面临的严峻瓶颈。
即便大语言模型能够解出复杂的千禧年数学难题,但距离成为真正合格的「AI科学家」依旧路途漫漫。
近期,UniPat AI发布了国际上首个跨多学科的端到端论文结果复现基准测试——PaperBenchX。在针对93个真实科研复现任务的测试中,当前表现最顶尖的GPT-6 Astra模型,完整复现率仅为13.98%。

这意味着,模型即便能够生成看似合理的数值,但在从头运行完整工作流、产出与论文一致且完全可验证的科学证据方面,成功率不足七分之一。
数学领域尚有形式化验证工具Lean作为检验真伪的兜底机制。但在物理、化学、材料等广泛的自然科学领域,并不存在现成的验证器。一个与论文吻合的数字,背后可能是完全错误的物理模型、未收敛的数值仿真,或者是巧合凑出的结果。
在评估AI自主提出假设、设计实验之前,一个基础前提是:AI能否可靠地将一项已发表的科学研究重做一遍,并证明自己确实做对了?

PaperBenchX正是为此而设计。该基准从93篇研究论文中提炼出93个复现任务,涵盖电磁、光子、化学、材料、生物及机器人等12个研究方向,依托10种领域原生科学环境,设立了3168条经专家校验的评分项。
测试流程极为严苛:
通过对10组前沿模型与Agent框架的轨迹分析,研究团队指出了阻碍可靠复现的核心原因:

以往诸如PaperBench等评测大多局限在机器学习与Python代码生态中。PaperBenchX的一大差异化在于要求Agent直接面对Ansys HFSS、Lumerical、Meep、PySCF以及ABACUS等真实的领域原生求解器。

在4至24小时的有限时间窗口内,Agent必须自主决定网格加密、容差设置、异常发散诊断等计算策略。这检验的是AI是否真正具备理解科学、执行仿真与判断结果可信度的综合工作流能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断