千次实验无一失败,RL-100框架融合模仿学习与强化学习,实现高性能机器人操作

编辑丨\O/

对于机器人而言,完成一个动作并不意味着真正掌握了一项技能。在实验室环境中,机器人已经能够完成越来越多复杂操作:抓取物体、整理物品、折叠衣物,甚至完成连续操作任务。

但当机器人进入真实环境时,问题会变得更加复杂。高成功率,高稳定性,高执行效率,三者缺一不可。

为支持机器人在现实任务中的强化学习,2026 年 7 月 22 日,发表于《Science Robotics》的研究「Performant robotic manipulation with real-world reinforcement learning」提出了 RL-100 框架,通过结合模仿学习(IL)与强化学习(RL),进一步优化了基于扩散模型的机器人控制策略。

论文链接:https://www.science.org/doi/10.1126/scirobotics.aed6267

优化机器人能力

近年来,机器人学习的重要路线之一,是让机器人通过观察人类示范获得技能。

这种方法称为模仿学习。研究人员通过遥操作设备控制机器人,让机器人记录关于移动、抓握等相关测试信息。随后,模型学习这些示范数据,并生成类似的人类操作策略。

理论上,强化学习可以通过不断试错,让机器人寻找更优策略。但在真实机器人环境中,直接使用强化学习并不容易。

RL-100 针对这一问题提出了一套统一优化框架。

研究团队没有直接替换原有策略,而是在已有模仿学习策略基础上进行强化学习微调:首先利用人类示范建立稳定的行为基础,随后通过离线强化学习利用已有数据优化策略;最后通过少量真实环境交互完成在线调整。

图 1:真实机器人快照展示了任务套件的多样性。

RL-100 将仿制和强化学习统一在一个截断的近端策略优化代理目标下,应用于去噪过程,从而在离线和在线阶段实现保守且稳定的改进。为了满足部署延迟,轻量级一致性蒸馏将多步扩散压缩为一步控制器,实现高频控制。

真实世界实验显示,RL-100 在所有八项任务中均实现了 100% 的成功率,并保持了长期稳定。根据团队预估的方案,RL-100 在 1000 次评估试验中也同样实现了 100% 的成功率。在效率方面,RL-100 完成时间接近人类远程操作水平,并在多项任务中与熟练操作员匹敌甚至超越。

八项实操评估

为了验证这一框架是否能够提升机器人实际操作能力,研究团队将 RL-100 应用于多种真实机器人任务。

实验覆盖了 8 项不同类型的操作任务,包括推动物体、保龄球操作、倾倒液体、毛巾折叠、螺丝旋拧、榨汁以及双臂盒子折叠等。

这些任务覆盖了机器人操作中的多个难点:包括控制精准度、动作协调连续性、涉及流体变化的动作等。相比简单的单步动作,这些任务要求机器人在连续过程中不断调整策略。

图 2:八个真实世界任务的推广轨迹。

研究团队首先利用人类遥操作数据训练初始策略,然后使用 RL-100 进行优化。实验结果显示,经过强化学习优化后的机器人策略,在测试任务中实现了稳定的操作表现,并且实现了比基线与人工操作更高的成功率和更短的完成时间。

在预设测试条件下,RL-100 完成了全部 8 项任务,并达到 100% 的成功率。

强化学习带来的提升

仅仅达到较高成功率,并不足以证明强化学习真正发挥了作用。对于机器人学习而言,一个更重要的问题是经过强化学习优化后,机器人是否能够超越原始示范策略?

为此,研究团队进一步比较了 RL-100 与单纯模仿学习策略在多个任务中的表现。

图 3:RL-100 与算法基线或人工操作员在部署时间任务完成效率方面的比较。

相比直接学习人类示范的策略,RL-100 能够减少操作过程中的失败行为,并逐渐形成更加稳定的动作方式。这种提升来自于强化学习对于任务目标的直接优化。强化学习更关注任务的反馈,当示范动作也不是最优解时,强化学习能帮助机器人调整原有动作。

这一点在与人类和人机协作的比较中也有体现。

图 4:RL-100 在竞争和服役环境中的应用。

在部分任务中,经过 RL-100 优化后的机器人策略表现已经接近甚至超过人工操作效率。这些结果表明,从强有力的人类先验出发,并用真实世界强化学习进行后期训练,使 RL-100 能够在完成时间效率方面达到甚至超越人类的专业表现,同时仍适合实际部署。

适用于现实的优化框架

该研究团队引入的新 AI 学习方法有望应用于其他机器人,并在更广泛的场景中进行测试。最终,它有望推动开发能够有效应对从制造步骤到食品准备和家务等各种任务的系统。

团队正在尝试调整他们的训练后强化学习方法,使其也能用于训练更大规模的视觉-语言-行动模型。如果成功,其框架有望应用于更复杂的机器人,使其能够应对更广泛的现实任务。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询