联想天禧AI自研代码智能体框架TianxiCode联合DeepSeek模型,在国际权威软件工程评测SWE-bench-Live中以71%的问题解决率登顶全球第一,展现出工程级智能体架构在真实软件开发中的核心价值。
在贴近真实开发环境的国际权威软件工程评测 SWE-bench-Live(Lite 分榜)中,联想天禧AI自主研发的代码智能体框架 TianxiCode 联合 DeepSeek-v4.1-Flash 取得突破:以 71% 的问题解决率登顶全球榜首,并顺利通过官方审查认证。

这项成绩表明,联想自研代码智能体架构已经具备对抗全球顶尖方案的实力。作为联想天禧AI聚焦代码生成与软件开发的核心能力,TianxiCode 后续将逐步落地到联想各类 AI 硬件产品中。
不同于传统针对简单语法或单函数的评测,SWE-bench-Live 是当前全球软件工程领域极具权威性的动态评测基准。它以 GitHub 真实项目中的真实问题为基础,全面评估模型与 AI 智能体生成代码补丁、定位并修复缺陷的综合能力,并提供可复现的隔离执行环境。
为确保评测公正,SWE-bench-Live 设有严格的“Verified”核验机制。参评团队必须提交完整的智能体运行轨迹,由官方审查输入环境与隔离策略,彻底排除测试用例与标准答案泄露的可能。TianxiCode 与 DeepSeek-v4.1-Flash 此次通过核验,充分证明了其代码修复成绩的可复现性与含金量。
在完整的智能体系统中,基础大语言模型类似于负责理解语义和构思解法的大脑,而智能体框架则是负责敲代码、查日志的眼、手和工程工作流。面对复杂的现实工程,仅靠调用基础模型往往难以独立解决大型代码库中的 Bug,顶层架构的协同至关重要。
在实际软件工程任务中,TianxiCode 展现出三项核心工程能力:
代码智能体的长期价值不仅在于榜单成绩,更在于为一线开发者降低繁重的调试排错与工程协同成本。随着 TianxiCode 登顶 SWE-bench-Live,联想计划将这些智能体技术沉淀至实际开发者工具链中,进一步赋能其个人电脑等硬件生态。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断