MirroS团队推出AgentGarten,将代码驱动的确定性物理引擎与实时神经渲染器连接,以超30 fps帧率打造可交互的试炼场。AI智能体通过第一人称视角探索、自主撰写手册复盘,仅用数轮即涌现出复杂博弈策略。
推开一块挡板,通道就此封闭;搬来一段坡道,高墙便有了越过的可能。
每一次行动都会改变世界,而改变后的世界,又成为AI智能体下一次决策的起点。当这样的世界可以由代码构建、由扩散模型实时绘出,AI便拥有了一座可以反复探索的“试炼场”:亲自行动,观察后果,验证猜想,再把经验带进下一轮。
MirroS团队发布的 AgentGarten 正是为此而生。它将可执行的代码环境与实时神经渲染器相连:代码定义物理规则,模型生成视觉反馈,以超过30 fps的吞吐量让智能体持续与世界交互。

想让AI真正理解物理世界,仅靠观看海量视频远远不够。就像学游泳不能只看录像,智能体必须亲自在环境中采取行动,观察实际结果并持续受其物理变化约束。
当前的两条主流技术路径各有局限:
MirroS的解法是:物理交给代码,光影交给神经模型。
在AgentGarten中,一次交互闭环极具条理:智能体给出动作指令;代码环境立即计算物理碰撞与状态更新,并从智能体的第一人称视角导出空间深度或表面法线等“几何草图”;随后神经渲染器结合视觉记忆,瞬间生成拟真的下一帧画面。

这种分工带来了两大优势:
更重要的是,渲染器支持流式生成,动作走一步、画面画一段,让决策像在现实中一样连贯。
在OpenAI 2019年著名的捉迷藏实验中,AI依靠强化学习从零摸索掩体搭建耗费了约2500万局,学会借坡道翻墙经历了约1亿局。

MirroS团队在AgentGarten中采用一对一设定重做了该实验。智能体通过Python代码控制动作,完全凭眼前生成的渲染画面做决策,对空间绝对坐标和对手位置一无所知。
结果显示,躲藏者在第4轮便学会搬动挡板搭建掩体,搜寻者在第10轮掌握了借坡道翻墙。在跳跃失败后,搜寻者还会主动推近坡道、调整位置重新尝试。
快速进化的核心在于智能体自己撰写的“实验手册”。演练被划分为四个环节:

翻阅手册可以发现严密的认知递进。例如躲藏者总结出“防守的核心在于堵住通道,而非仅挡住视线”;搜寻者则提炼出“搬东西前先微拉一下,确认抓稳而非卡死”的操作法则。
相同的闭环在另外四个任务中同样表现优异:

为了支撑这种高频交互,团队采用Adversarial Forcing训练法与精准重放机制,解决了长序列交互的时序漂移和画面伪影问题;同时手写定制Triton融合算子,结合CUDA Graph优化调度与轻量解码器,最终实现了480p分辨率下超过30 fps的超低延迟实时渲染。
免费获取企业 AI 成熟度诊断报告,发现转型机会
通过程序化代码定义规则、神经模型输出视觉、反思机制沉淀经验,AgentGarten为具身智能迈向物理世界的递归自我改进(Physical RSI)提供了崭新的研究范式。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断