Aether AI发布具身智能系统CRIS-0,将因果推理引入物理世界。机器人面对人手阻拦可在0.2秒内安全急停,面对外部强扰动2秒内完成重规划,从根本上解决端到端黑盒模型的长程累积误差难题。
关微波炉门时,人手突然插进来,机械臂瞬间悬停——整个反应时间仅为 0.2 秒。
而在另一组演示中,金属易拉罐被混在蛋糕盘里端向微波炉,机械臂会主动将易拉罐挑出放到一旁,确认盘内安全后再送入炉内。面对手电筒强光直射眼睛这类极端扰动,设备依然平稳作业。
这些操作并非预录轨迹回放,也不是依赖海量概率统计的碰巧命中,而是基于对物理世界因果规律的实时推理。驱动这套系统的核心架构代号为 CRIS-0,来自加州大学圣地亚哥分校(UCSD)助理教授、CMU 因果学派学者黄碧薇创立的因果智能企业 Aether AI。

在具身机器人落地场景中,传统方案面对突发扰动往往陷入两难:要么重复旧轨迹导致碰撞,要么全流程报错停机;而端到端黑盒模型在几十步的长程任务中,极易产生误差累积,一步走偏满盘崩溃。
CRIS-0 的核心思路在于让机器人从「看到什么」进化到「理解因果影响」:
在咖啡机抓取测试中,面对人为移位与光照突变,CRIS-0 平均在 2 秒内识别出关键因果变量的改变并完成实时重规划,在 10 次随机扰动中实现 9 次有效恢复。咖啡机被推开后,系统仅追踪「把手相对位姿」这一变量,只修正接近和抓取动作,无需全流程重置。
在长程任务「客厅寻物与整理」中,系统将数十步目标拆解为原子化、可验证的因果阶段。面对桌面清理,它会将普通书籍归置到茶几,而将涉及个人隐私的账单放入抽屉;面对两个外观相同的饮料罐,它先通过抓取晃动感知内部重量,确认为空罐后丢弃,感知到液体则放回原位。
在包含 20 条模糊指令的个性化测试中(例如「拿一瓶适合晨跑后喝的饮料」),系统取得 18 次精准抓放。它并非依靠关键词匹配,而是结合上下文将「运动后需补水且低糖」抽象为隐藏因果变量。
传统纯视觉或语言 Agent 方案在真实世界容易失效:物理世界的摩擦力、碰撞与重力瞬息万变,大模型若先把画面转为文本再慢速推理,往往错失反应时机。CRIS-0 采用了一套三层因果架构:

系统摒弃了对海量图像像素的死记硬背,将任务定义为因果状态推进过程。例如铺桌布时,机器人实时追踪夹爪抓持状态、角点位移与滑移情况。若桌布滑脱,「抓住」这一因果变量失效,任务立即局部回退到重新抓取,而不是机械地拉动空气或整体重启。

系统采用 Planner 统一调度多类工具模块:
与纯视频生成的常规世界模型不同,CausalWM 聚焦于动作对物理变量的改变。机械臂在发力前先推演「执行动作后把手是否会倾斜、杯子是否会倒」,确认变量演化符合预期后再下发底层控制指令。
任务执行遵循「状态识别 → 工具选择 → 执行 → 验证 → 调整」的动态任务图。每一步均有验证器兜底,遇到偏差先局部重试,再重规划,最后才提示人工接管。成功的调整路径还会沉淀回任务图中。

在关门动作中,突然伸入的人手会破坏安全前置条件,系统直接在状态层触发最高优先级阻断,实现 0.2 秒急停;而在递水任务中,伸来的人手则属于目标交互变量,不会触发误刹停。
此前,Aether AI 的因果 Agent 框架 RSIAgent 已在 OSWorld 2.0 评测中取得 78.98% 的成绩;因果世界模型 CausalWM 也在具身基准 TriWorldBench 登顶榜首。

大语言模型依靠海量文本统计拟合取得了突破,但物理世界的数据稀缺且遵循确定性规律。单纯依赖相关性拟合极易遭遇天花板,基于因果机制的表征与推理,正在成为具身智能迈向可靠落地的关键路径。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断