前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
具身智能/09.30 · 15:54/4 MIN/编译自 henry/13 阅读

斯坦福HomeBody让宇树G1进厨房收拾杂物

斯坦福大学团队推出HomeBody项目,将大模型与宇树G1人形机器人结合。机器人无需在新厨房额外采集数据或训练策略,就能自主建立空间记忆、调用现成技能模块完成收纳、丢垃圾和开抽屉取药等连贯家务。

机器人的大模型进化时刻,正在从桌面测试走向真实生活场景。

斯坦福大学团队在最新研究项目 HomeBody 中,将 GPT 与宇树 G1 人形机器人连接,让机器人走进此前从未见过的厨房自主干活。

在没有新环境额外训练数据的情况下,G1 能够依照人类的自然语言指令,收拾台面杂物、丢弃指定包装盒,甚至凭记忆从不在视野内的抽屉中翻出药品递给人。

机器人正在执行厨房整理任务

此前机器人控制大多局限于桌面机械臂的抓取放置,而 HomeBody 将大模型控制机器人的范围扩展到了整个房间尺度。机器人不仅需要现场判断面前抓什么,还得记住物体的位置分布,并将导航移动、开闭抽屉和抓放操作无缝串联。

更关键的是,系统部署到新厨房时,无需采集新环境数据,也无须重新训练一套专用动作策略,展现出极强的通用泛化能力。

让大模型把机器人动作当工具调用

HomeBody 的核心逻辑非常清晰:让大模型把机器人的物理技能作为工具(Tool Call)直接调用。

大模型负责理解人类目标、规划任务步骤,底层则负责调用导航、抓取、开抽屉等现成技能。整个流程分为三个阶段:

第一步:全场巡视,构建空间记忆

机器人接收到的初始指令是:“你是一台厨房机器人,请探索这个空间。”

机器人在厨房内移动探索

随后,大模型自主选择值得观察的点位,指引 G1 移动。机器人一边行走,一边记录相机画面、激光雷达点云,以及关节姿态和轨迹坐标。借助 SLAM(同步定位与建图)技术,机器人构建出全局地图并确定自身位姿。这些视觉与空间数据不会随转身而丢失,而是形成长期空间记忆。

第二步:真实映射,在仿真器中复刻厨房

大模型随后扮演 Real2Sim 智能体角色,在 Isaac Sim 仿真平台中搭建出数字孪生厨房。

在仿真器中构建数字厨房

系统将 SLAM 实测的几何结构同步给模型,严格约束台面高度与通道宽度,确保机器人的可行走区域和伸手距离准确无误。接着,物理世界坐标系与数字厨房坐标系完成对齐,此前拍摄的画面、物品描述和三维坐标绑定在一起。机器人后续找物品时,就能从记忆索引线索,直接导航回对应坐标。

第三步:自主规划,技能流水线作业

完成准备后,用户下达复合指令,例如“把咖啡袋收拢到中间,丢掉指定的橙汁纸盒”。

任务规划与执行过程

大模型结合当前视角、空间地图、记忆数据以及手臂负重状态,按需调用技能库。比如用户让它“拿药”,哪怕药在视野外,大模型也能检索到此前抽屉的记录,接续调用“导航至抽屉—开抽屉—取药—递给人”这一串动作。

解耦架构:GPT 动脑,技能库动手

具身智能通常有清晰的分工层次:

  • System 2(高层决策):视觉语言模型,负责理解场景与规划任务;
  • System 1(动作策略):视觉语言动作模型(VLA),负责把视觉转换为具体动作指令;
  • System 0(底层控制):机器人控制器,负责全身关节协调与平衡。

具身控制架构分工示意图

HomeBody 最大的调整在于绕过了学习型 VLA:让 System 2 直接调度模块化技能库,再交由底层控制器执行。

这些技能包括导航、抓取、放置、开抽屉等,具备统一的输入输出接口:

大模型只需在画面中指定目标像素点并指派使用左手还是右手。

抓取技能解析与规划

抓取技能内部的感知模块自动估算深度、计算物体三维坐标和抓取姿态,随后由运动规划器规划机械臂避障轨迹,最终由底层执行。大模型决定“抓什么、用哪只手”,具体“手怎么伸、怎么握紧”完全由预设技能模块完成。

开抽屉技能的细分流程

每一步操作都会将结果反馈给大模型,形成闭环。下半身行走的平衡控制则由预训练的 AMO 策略承接,让下肢运动兼顾上肢操作负载。

这种解耦结构避免了为新场景反复训练专用神经网络的麻烦,但系统目前仍依赖搭载 RTX 4090 的笔记本承担边缘计算,远端模型推理亦存在延迟,同时机械硬件如手指舵机长时间工作也容易过热。机器人真正走进千家万户做家务,仍需感知、规划、算法与本体硬件的全面突破。

标签:具身智能人形机器人机器人大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费
置顶

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费

微软和Meta收紧Claude:被削掉的是入口,不是模型
置顶

微软和Meta收紧Claude:被削掉的是入口,不是模型

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化
置顶

FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化

//

24小时热榜

Rembrandt:免费本地AI图片编辑器,开源替代Adobe Lightroom
TOP1

Rembrandt:免费本地AI图片编辑器,开源替代Adobe Lightroom

Robotaxi迎来合纵连横时代:单打独斗已成过去
TOP2

Robotaxi迎来合纵连横时代:单打独斗已成过去

3

Anthropic更新使用政策:禁止虐待Claude模型

5小时前
Anthropic更新使用政策:禁止虐待Claude模型
4

基因组研究揭秘夏威夷与复活节岛先祖航海迁徙史

6小时前
基因组研究揭秘夏威夷与复活节岛先祖航海迁徙史
5

四巨头筹资近4000亿元,锁定AI算力军备竞赛

7小时前
四巨头筹资近4000亿元,锁定AI算力军备竞赛
6

华为等多团队开源企业级AgentOS,加速智能体规模落地

7小时前
华为等多团队开源企业级AgentOS,加速智能体规模落地
7

Anthropic 发起网络安全使命:用 AI 护航关键基建与开源生态

10小时前
Anthropic 发起网络安全使命:用 AI 护航关键基建与开源生态
8

OpenAI端掉俄伊AI虚假信息网:伪造智库与记者渗透主流媒体

18小时前
OpenAI端掉俄伊AI虚假信息网:伪造智库与记者渗透主流媒体
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断