当人形
机器人面对梅花桩、断桥、窄踏面楼梯等复杂地形时,真正横亘在它面前的考验,远不止“看清脚下”这么简单。
在连续平地上,一次不够准确的落脚通常还有调整空间;但在稀疏、离散、几何受限的落脚区域中,脚掌偏移几厘米就可能踩空。一旦机器人在瞬间作出错误选择,往往还没来得及调整,身体就已经失去平衡。
一个关键问题由此浮现:机器人能否在迈出当前这一步之前,提前判断这一步会把自己带向怎样的未来?
为了解决这一问题,地瓜机器人算法团队提出了World Model Augmented VisualLocomotion,简称 WM-LOCO。
WM-LOCO将面向未来视觉与运动状态预测的世界模型引入人形机器人复杂地形行走,在仿真中进行端到端联合训练,并且实现了zero-shot真机迁移。这意味着在仿真中训练好的策略可以直接部署到实体机器人上,无需二次调整。
WM-LOCO架构图:左侧为PPO策略,右侧为循环世界模型,二者共享编码器、端到端联合训练
简单来说,过去的机器人更多是基于“眼前所见”来决定下一步;WM-LOCO则让机器人学会了“先预测未来,再决定下一步怎么走”。
一、只理解过去,为什么还不够?
传统视觉强化学习通常将当前及历史视觉信息与机器人本体状态一同输入策略网络,再实时输出各关节控制指令。
这类基于观测历史的策略,能够“看到”机器人已经经历的信息,通过输入连续多帧图像或一段本体状态历史,可以判断机器人此前如何运动、地形如何变化,并据此生成当前动作。
但问题在于,策略利用的始终“过去式”信息,并不会显式地学习“某个动作可能带来的未来状态变化”。这一局限在平地和规则地形上尚不明显,可一旦面对梅花桩、断桥、窄踏面楼梯等这种落脚区域严格受限的地形时,基于观测历史进行决策的短板就会被急剧放大。
因为复杂地形行走,从来不是一串互不相关的单步动作的简单叠加。
当前这一脚踩在哪里,会持续影响身体重心、支撑关系、摆动腿轨迹,以及下一步还能到达哪些区域。一个此刻看似可行的动作,可能会让机器人在下一时刻陷入无路可走的状态。
所以,机器人不仅需要理解“此前发生了什么”,更需要预判:如果执行这个动作,接下来可能发生什么?
二、给策略装上对「未来」的理解
WM-LOCO同时接收机器人机载深度视觉与本体感知信息,并通过循环式世界模型,在隐空间中持续学习机器人、动作与环境之间的动态关系。
需要强调的是:这个世界模型的目的并不是生成一段供人观看的未来视频,而是学习更紧凑、更适合实时控制的未来状态表征。WM-LOCO在每一时刻尝试回答三个问题:
机器人和地形现在处于什么状态?
执行动作之后,视觉与身体状态会怎样变化?
这种变化是否有利于接下来的稳定行走?
在具体实现上,世界模型由一条确定性记忆轨迹和一个随机隐变量共同构成:前者沿时间循环累积历史,后者从当前观测中推断。
通过学习观测重建、潜在状态转移和任务反馈预测,世界模型逐步提炼出蕴含未来运动趋势的动态表征,并将这些信息回馈给PPO策略。
由此,策略获得的不再仅仅只是当前深度图像中的台阶、障碍物和落脚区域,也不只是一段历史运动轨迹,更包含了对机器人身体状态接下来可能如何演变的前瞻性信息。
GT 为真实下一帧深度,Recon. 为模型预测,Error 为逐像素误差
这正是WM-LOCO与普通多帧输入策略的核心区别。观测历史主要帮助策略理解“过去发生了什么”;世界模型则进一步学习观测、动作与未来状态之间的动态关系,使策略能够推演“接下来可能发生什么”。
由此,策略的决策不再只依赖历史信息,而真正具备了面向未来的预测能力。
三、端到端训练,告别繁琐流程
为了让机器人通过复杂地形,不少技术路线会将系统拆分为感知、落脚点规划、轨迹生成、教师策略和底层控制等多个模块。
部分方案还需要先用完整地形真值训练一个“开挂”的教师策略,再通过知识蒸馏,将能力迁移到使用机载传感器的学生策略。这类方案的代价在于训练链路更长、人工设计更多、数据构建成本更高,而且多个模块之间的误差可能逐级传递、层层放大。
相比之下,WM-LOCO选择了一条更直接简洁的路径:世界模型与行走策略在同一个训练过程中端到端联合优化。
整个系统不需要人工标注落脚点,不依赖预先规划好的足端轨迹,不需要教师—学生式多阶段蒸馏,不需要复杂的多专家结构,也不需要分别训练多个独立模块。从视觉输入到关节动作,训练一步到位。
世界模型所学习到的动态信息也不是为了重建而重建,而是直接服务于一个目标:帮助策略做出更好的下一步决策。
四、更高成功率,更自然的步态
在相同视觉输入和任务设置下,算法团队将WM-LOCO与基线PPO策略进行了对比。
随着落脚区域变得越来越稀疏、狭窄和不连续,两种方法显现出了明显的差距。仅依赖观测历史的纯PPO策略,更容易出现过早落脚、频繁试探、左右腿节奏不一致,以及局部动作可行、后续却无法继续的问题。在部分高难度地形中,单纯PPO甚至难以形成稳定的通过能力。
而引入世界模型后,机器人在梅花桩、断桥、窄踏面楼梯和独木桥等复杂场景中的成功率显著提升,在仿真中接近100%。与此同时,机器人减少了突兀修正和犹豫式步态。
换句话说,世界模型带来的不只是“能够走过去”,还让机器人在行走时表现出更连续、更稳定的运动意图——摆腿、落脚与身体重心转移更加连贯,左右腿节奏更加协调,整体运动也更加自然、更接近人类行走。
在真机上,同一套权重以zero-shot方式部署到Unitree G1:踏石、台阶、缝隙三类地形各测试10次,平均成功率93.3%。其中0.8米宽的缝隙,机器人以一个完整的“摆腿—跨越—落地”动作一步跨过——出于安全考虑,团队没有继续测试更宽的缝隙,但这已经是目前公开工作中少见的真机跨越距离。
五、真机现场验证:不止是Demo
市面上的工作普遍展示经过筛选的demo视频,往往难以完整反映算法在真实环境中的稳定性。
现场展示则完全不同。机器人需要面对真实传感器噪声、设备状态变化、光照干扰以及无法重来的单次运行。任何一次感知或控制失误,都会直接暴露在观众前。
在近期旭日S600媒体沟通会上,搭载WM-LOCO的人形机器人在现场完成了公开真机展示。算法在真实机器人、真实传感器和旭日S600计算平台上实时运行,完成了从视觉感知、世界建模到全身运动控制的完整闭环。
与以视频demo为主要展示形式的复杂地形行走演示相比,公开现场运行对算法的稳定性、实时性和部署可靠性提出了更高要求,进一步验证了WM-LOCO的工程可靠性、真实可部署性和高成功率。
世界模型不只是用来生成未来,也可以帮助机器人理解未来。
当机器人从基于观测历史进行决策,进一步走向主动预测动作后果,它的行走逻辑也随之发生变化:先预测未来,再迈出下一步。
(节选)