一篇读懂 Sim2Real:为什么机器人要先在仿真里练、域随机化怎么弥合现实差距

问题:真机练不了,仿真又不像

让机器人学会走路或抓取,最朴素的办法是强化学习——让它在环境里反复试错。可「环境」若是真机,问题立刻来了:真机试错速度是实时的一倍速、试错过程会摔坏硬件、还得有人守着复位。一个四足机器人学走路动辄需要数年「真机经验」,没人等得起。

仿真能解决速度与安全:物理引擎里时间可以无限加速,摔一万次也不心疼。但新的问题出现了——现实差距(reality gap)。仿真里的地面永远平整、摩擦系数永远精确、传感器永远没有噪声;策略在仿真里学到的「捷径」(比如利用不真实的吸附力)搬到现实立刻失效。Sim2Real 要回答的就是一个问题:怎么让仿真里练出的本事,搬到真机上不缩水。

域随机化:把现实变成「随机的另一种情况」

2017 年,UC Berkeley 与 OpenAI 的 Tobin 等人提出了一个反直觉的思路(IROS 2017):与其把仿真做得越来越像现实,不如故意把仿真做得「千奇百怪」——每次训练都随机更换物体的颜色、纹理、光照、位置,让神经网络见过足够多的变体之后,把真实世界当成「又一种没见过的变体」接受下来。这就是域随机化(domain randomization)。论文证明:纯用随机化仿真图像训练的检测器,不做任何真实图像微调,就能在真机抓取任务上工作。

这个思想后来被推到极致。2019 年 OpenAI 的 Dactyl 项目让机械手玩魔方,控制策略和视觉估计完全在仿真中训练,用的是自动域随机化(ADR):从一个简单环境出发,算法自动不断扩大随机化范围,让任务难度持续爬升,直到策略「被迫」学会泛化。论文声称,纯仿真训练的模型解决了一个前所未有的复杂度级别的真机操作问题,并在测试中表现出「元学习」式的适应能力——换上新的随机环境,策略能在几次尝试内自动调整。

动力学也要随机。 视觉之外的另一半是控制:把质量、摩擦、电机响应、延迟这些物理参数也做成随机区间,策略就会被逼成「无论物理世界长什么样都稳」的鲁棒控制器。今天遥操作数据和仿真预训练之外,几乎所有腿部运动控制论文都默认这套配方。

特权学习与 GPU 并行:两大工程突破

突破一:老师开卷考试,学生闭卷考试。 苏黎世联邦理工学院(ETH)2019 年发表在 Science Robotics 的 ANYmal 工作(Hwangbo 等)引入了「特权学习」:先训练一个能看到全部仿真内部状态(地形、摩擦、质量分布等真机上拿不到的信息)的老师策略,再把这些信息蒸馏给只能用机载传感器观测的学生策略。配合一个专门学出来的「执行器网络」(用真实数据拟合系列弹性执行器的怪癖),ANYmal 的四足步态直接从仿真迁移到真机,硬件上跑到 1.5 m/s。这套「老师—学生」蒸馏至今仍是腿足控制的标配。

突破二:一个 GPU 装下一万个世界。 2021 年 NVIDIA 的 Isaac Gym 实现了物理仿真全流程跑在 GPU 上,Rudin 等人在 CoRL 2021 的工作显示:单卡同时跑数千个并行环境,ANYmal 的行走策略几分钟就能练出来,训练速度比此前最优方法快约 10 倍,且策略零微调直接迁移到真机。并行把「随机化需要海量变体」和「训练要快」这对矛盾同时解掉了——变体越多越好,那就在一秒内模拟一万个变体。

工具链现状(截至 2026-10-07)

  • Isaac Lab:Isaac Gym 的继任者,NVIDIA 的开源机器人学习框架,支持数千个并行环境,接 PhysX、MuJoCo 等多个物理后端,是当前 Sim2Real 工作流事实上的标准底座之一。
  • Newton:2025 年 3 月 18 日 GTC 上,NVIDIA、Google DeepMind 与 Disney Research 联合宣布的开源 GPU 物理引擎,基于 Warp 内核、以 MuJoCo-Warp 为主后端,支持可微物理与软体接触;2025 年 9 月 29 日被捐入 Linux 基金会旗下开放治理。迪士尼已用它为自己的 BD-X 机器人做仿真。
  • 合成数据管线:NVIDIA GR00T N1 把仿真当「数据放大器」——88 小时遥操作生成 827 小时神经轨迹,仿真不再是练 RL 的专属,也成了 VLA 的预训练食材。

工程启示

第一,随机化范围不是越大越好:范围过宽,策略会过度保守、动作僵硬;范围要与任务不确定度匹配,这本身就是最重要的超参数。第二,能被「学出来」的东西(执行器特性、传感器偏差)不要靠随机化硬扛——用真实数据拟合一个校准模型,往往比加大随机化更有效。第三,Sim2Real 不是一次性交付,而是「仿真预训练 → 真机少量微调 → 差距回流修正仿真」的循环。

一句话总结:Sim2Real 的哲学不是「把仿真造得完美」,而是「把策略练得皮实」——现实世界只是随机分布中的一个采样点罢了。

相关阅读:InterEvolve:人形机器人移动操作奖励程序在测试时进化(仿真 RL 训练人形运动控制的前沿);苏黎世联邦理工学院研发出能用指尖行走的五指机械手(Sim2Real 训练的灵巧手新进展)。

本文时效性结论截至 2026-10-07。

参考资料

  1. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World(arXiv,IROS 2017)
  2. Solving Rubik's Cube with a Robot Hand(arXiv,OpenAI 2019)
  3. Learning agile and dynamic motor skills for legged robots(arXiv,Science Robotics 2019)
  4. Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning(arXiv,CoRL 2021)
  5. Announcing Newton, an Open-Source Physics Engine for Robot Learning(NVIDIA Developer)
  6. Isaac Lab 文档:仿真框架与 Sim2Real 工作流
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?