[ICRA 2026] MoDE-VLA:从“能抓取”到“能削皮”,灵巧手双机协作的新高度

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

总结
问题
方法
结果
要点
摘要

本文提出了一种结合分层强化学习与视觉-语言-动作模型(VLA)的机器人操控框架。通过引入 IMCopilot 原子技能库和 MoDE-VLA 混合专家架构,实现了双手 63 自由度机器人在苹果削皮等复杂、高接触任务中的自主协作,成功率较基线模型提升了一倍。

TL;DR

最近人工智能在机器人领域(VLA 模型)虽然大热,但大多还在玩“抓取-投放”的小儿科。本文提出了一套名为 MoDE-VLA 的系统,通过 RL-Augmented Teleoperation(强化学习增强遥操作) 和 Mixture-of-Dexterous-Experts(灵巧混合专家) 机制,让 63 自由度的双灵巧手机器人学会了像人一样削苹果——这不仅需要视觉引导,更需要极高精度的力觉补偿。

痛点深挖:为什么机器人“削苹果”这么难?

传统的视觉-语言-动作模型(VLA)在处理两指夹爪任务时表现出色,但面对类似“削苹果”这种任务时会瞬间熄火:

  1. 数据荒:你想想,用手柄控制 63 个电机去旋转一个苹果,这操作难度比开航天飞机还大,人类教员根本给不出高质量的演示数据。
  2. 多模态割裂:触觉、力矩信号和视觉信号的频率、物理含义完全不同。简单地把它们拼在一起输入模型,往往会起反作用。
  3. 技能跨度大:削皮既需要大范围的胳膊运动(粗略控制),也需要手指微调(精细控制),单一模型很难同时兼顾。

IMCopilot:机器人也需要“自动驾驶拨杆”

作者的第一个神来之笔是 IMCopilot。它是一组通过强化学习(PPO)预训练好的“原子技能”,比如“稳定抓取”和“物体原位旋转”。

模型架构图

  • 数据采集阶段:人类操作员只需控制胳膊的大方向,到了需要旋转苹果时,踩一下脚踏板切换到 IMCopilot,剩下的手指精细活由 AI 自动完成。这让高质量数据的采集变得可能。
  • 自主执行阶段:VLA 模型在输出动作时,会附带一个“触发开关”。当它觉得需要旋转物体时,直接调用 IMCopilot 原语。这种分层控制模拟了人类小脑(反射)与大脑(规划)的分工。

MoDE-VLA:触觉与力觉的“残差注入”

为了解决力觉反馈的融合问题,作者设计了 Mixture-of-Dexterous-Experts (MoDE) 模块。

需替换为架构图

该模块的核心逻辑在于:

  1. 异构处理:将机械臂的关节力矩(Arm Torque)和手指的视觉触觉(Tactile Force/Wrench)分别处理。
  2. 混合专家路由:使用 8 个稀疏专家 MLP。系统会根据当前是“刚接触”、“稳定推压”还是“空载运动”自动选择最合适的专家来调优动作。
  3. 残差注入:这些力觉专家不是直接给出动作,而是作为残差修正量。这意味着:在没有接触的空旷区域,VLA 依然靠视觉预训练知识走;在接触瞬间,触觉专家介入进行“微操”。

实验战绩:全自主削苹果首秀

研究人员在苹果削皮、试管重排、齿轮组装等 4 个硬核任务上进行了测试。

实验结果对比

  • 性能翻倍:MoDE-VLA 的平均成功率达到了 34%,相比基线模型(如 OpenPI-0)提升了 120%。
  • 削皮神器:在最难的削皮任务中,PCR(剥离率)达到了惊人的 73%。消融实验显示,如果去掉力觉反馈,机器人在削皮时会频繁出现“空削”(接触不良)或“滑脱”。

深度洞察与总结

MoDE-VLA 的成功揭示了一个深刻的趋势:VLA 模型的未来不在于“堆参数”,而在于“接传感器”。仅仅靠视觉是无法完成人类感官级别的操作的,力觉和触觉必须通过像 MoE 这样动态且非破坏性的方式注入到大模型中。

局限性:尽管表现优异,但 34% 的成功率离工业大规模应用仍有距离。此外,IMCopilot 目前还需要预定义的 RL 环境训练,如何将其泛化到所有未知物体(Zero-shot Object Manipulation)将是下一阶段的攻坚方向。

发现相似论文

试试这些示例

  • 查找最近其他尝试将 Mixture-of-Experts (MoE) 架构应用于多模态机器人感知和力触觉融合的 SOTA 论文。
  • 哪篇论文最早提出了这种基于 Residual Injection 的预训练模型微调方法,本文在机器人 Action Space 上做了哪些针对性改进?
  • 调研目前在双灵巧手(Dexterous Hands)领域,除了强化学习外,还有哪些利用生成式模型解决 In-hand Manipulation 任务的最前沿研究?
目录
[ICRA 2026] MoDE-VLA:从“能抓取”到“能削皮”,灵巧手双机协作的新高度
1. TL;DR
2. 痛点深挖:为什么机器人“削苹果”这么难?
3. IMCopilot:机器人也需要“自动驾驶拨杆”
4. MoDE-VLA:触觉与力觉的“残差注入”
5. 实验战绩:全自主削苹果首秀
6. 深度洞察与总结