问题:回归出来的「平均动作」
用行为克隆教机器人做事,传统做法是把策略建成一个回归模型:输入观测,输出一个动作,让预测和人类演示的均方误差最小。这在任务只有一种标准解法时没问题,但真实演示天然是多峰的——绕过杯子,左边绕和右边绕都对;人类操作员交替使用两种手法,数据里就存在两个动作簇。
回归模型的职业病是把两个正确答案平均成一个错误答案:预测的动作既不是左绕也不是右绕,而是直愣愣撞向杯子。哥伦比亚大学与 TRI 的论文把这个失败模式记录得很清楚:LSTM-GMM 这类混合模型会卡在障碍物前,隐式策略 IBC 有模式偏向,Behavior Transformer 则「无法承诺」任何一种模式——在两个模式之间反复横跳。
扩散模型的答案:建模整个分布
Diffusion Policy(Chi 等,RSS 2023,后扩展为期刊版)的处理方式是:不预测「那个动作」,而是建模动作的整个条件分布——把图像观测作为条件,从一个噪声动作序列出发,反复去噪,收敛到一个符合分布的动作块。因为生成过程天然可以从任意噪声起点收敛到任意一个模式,模型学会了「多模态行为,但每次执行只承诺一种模式」——一次 rollout 里左绕就左绕到底。
论文在 4 个基准、12 个任务上验证,平均成功率比当时的最优方法提升 46.9%(论文口径)。拿论文里反复出现的 Push-T 任务(把一个 T 形积木推到目标位形)举例:回归类策略 LSTM-GMM 常在半路卡住,隐式策略 IBC 会过早冲进终点区——两种失败都是「模式平均/不敢承诺」的症状;而扩散策略学到多个解法后,每次执行稳定地走完其中一种。它贡献了三个让扩散模型在真机上能用的工程要点:
- 滚动时域控制:每次预测一小段未来动作,只执行开头几步,观测更新后重新预测——生成式模型推理慢,但滚动执行把慢藏进了闭环。
- 视觉条件化:去噪过程以相机图像为条件(观测特征在去噪步间共享),而不是把图像也当噪声迭代。
- 时序扩散 Transformer:动作序列的时间结构用 Transformer 建模,另有 CNN 变体,两者各有所长。
同期对手与后续演进
把几种模仿学习路线放在同一张表里看,差别一目了然:
| 路线 | 对多峰分布的处理 | 已知短板 |
|---|---|---|
| 均值回归(MSE) | 平均成无效动作 | 模式平均,卡在障碍物前 |
| LSTM-GMM 混合模型 | 显式建模多峰,但偏向单一模式 | 容易过早锁死模式 |
| IBC(隐式行为克隆) | 能量函数隐式建模 | 仍有模式偏向 |
| Behavior Transformer | 注意力检索历史模式 | 模式间反复横跳,不承诺 |
| ACT(CVAE + 分块) | CVAE 采样 + 时间集成 | 依赖较高质量演示 |
| Diffusion Policy | 去噪生成,rollout 内承诺单模式 | 推理步数带来延迟 |
公平地说,2023 年扩散并非唯一答案。斯坦福的 ACT(ALOHA 项目的策略)用 CVAE 处理多峰性,配合动作分块(action chunking)与时间集成,只用 50 条演示就在四个精细双手任务上拿到 96%、84%、64%、92% 的成功率(论文报告口径)。在双手精细操作上,ACT 以简单、快著称;扩散路线的强项是多峰鲁棒性。2024 年 Google DeepMind 的 ALOHA Unleashed 则证明扩散策略同样能拿下叠衣服这类含柔性物体的双手长程任务。
此后三年,Diffusion Policy 长成了一个小生态:
- DP3(RSS 2024):把视觉输入换成稀疏点云的紧凑 3D 表示,10 条以内演示就能学到跨视角、跨干扰物泛化的策略;论文报告在 73 个任务上平均成功率 98.7%(CNN 版扩散策略为 86.9%),训练快 5 到 13 倍。
- DPPO(NeurIPS 2024):把去噪过程展开成马尔可夫决策过程后套上 PPO,实现了对预训练扩散策略的在线强化学习微调,模拟任务上平均再涨 32.3%(论文口径),真机验证于腿足运动与敏捷操作。
- 进入 VLA 时代:扩散思想被吸收为 VLA 的动作头。Physical Intelligence 的 π0 用流匹配(扩散的近亲)以 10 步积分生成动作块,支撑 50Hz 灵巧控制;NVIDIA GR00T N1 的 System 1 就是一个扩散 Transformer(DiT);Figure 的 Helix System 1 以最高 200Hz 输出连续控制。此前用自回归离散 token 输出动作的 RT-2 一系,反而在高频操作上显露短板——π0 论文直言这类任务对自回归 VLA 是重大挑战。
为什么是扩散赢了
本文作者认为可以归结为三点。第一,动作空间的真实分布就是多峰的,生成式建模是「顺着数据的天性」;第二,扩散对高维输出(未来几十步、上百维的连续动作)训练稳定,回归模型在这种维度下容易病态;第三,工程上它与动作分块、滚动执行天然契合,推理步数可以换速度(π0 用 10 步流匹配积分、50Hz 控制,就是拿步数换延迟的例子)。
给工程实践者的选型建议:演示来自单一操作员、解法单一时,ACT 类模型简单可靠;演示来源杂、环境变化大、动作有内在多义性时,扩散/流匹配路线更稳;要做在线优化或仿真奖励微调,DPPO 一系已给出可行模板。框架层面,LeRobot 已内置 Diffusion Policy、ACT 与 π0 等实现,可以少造轮子。
相关阅读:扩散模型入门:从噪声里「雕刻」出图像(扩散模型本身的原理入门);苏黎世联邦理工学院研发出能用指尖行走的五指机械手(扩散/强化学习动作生成在真机上的最新应用)。
本文时效性结论截至 2026-10-07。
参考资料
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion(arXiv)
- Diffusion Policy 项目主页(哥伦比亚大学)
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(ALOHA / ACT 项目页)
- ALOHA Unleashed: A Simple Recipe for Robot Dexterity(arXiv)
- 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations(arXiv,RSS 2024)
- DPPO: Diffusion Policy Policy Optimization(arXiv,NeurIPS 2024)
- π0: A Vision-Language-Action Flow Model for General Robot Control(arXiv)
- π₀ 实现(LeRobot / Hugging Face 文档)
读者留言
COMMENTS 暂无还没有留言,来说第一句?