[2026] UltraDexGrasp:突破双臂灵巧抓取极限,2000万帧数据驱动的通用策略

UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data

总结
问题
方法
结果
要点
摘要

本文提出了 UltraDexGrasp,这是一个针对双臂机器人通用灵巧抓取的研究框架。通过集成基于优化的抓取合成与基于路径规划的演示生成,作者构建了包含 2000 万帧的大规模多策略数据集 UltraDexGrasp-20M,并训练出一种在真实世界中具备 81.2% 成功率的 Zero-shot 闭环控制策略。

TL;DR

UltraDexGrasp 是一项针对双臂机器人通用抓取的突破性工作。它不仅开源了首个大规模双臂灵巧抓取数据集 UltraDexGrasp-20M,还设计了一个能够根据物体形状、重量自动选择“捏、握、抱”等不同模式的闭环控制策略。该策略在真实世界中达到了 81.2% 的抓取成功率,且完全基于仿真数据训练,展现了极强的 Zero-shot Sim-to-Real 迁移能力。


痛点深挖:为什么双臂灵巧抓取这么难?

在机器人领域,让机器人像人一样用两只手灵活抓取物体一直是“圣杯”级别的挑战。目前的局限性主要体现在:

  1. 数据鸿沟:灵巧手有极高的自由度(DoF),通过遥操作采集双臂协同数据成本极高。
  2. 策略单一:现有方法多针对单手抓取,无法处理超出单手尺寸的大型物体,也无法在“精细捏取”和“大负载抱持”之间灵活切换。
  3. 泛化瓶颈:面对从未见过的物体,如何保证抓取的物理稳定性(Force Closure)并避开自碰撞?

作者认为,解决之道的关键在于数据的规模化与多样性,以及一种能感知几何细节的通用策略架构。


核心方法:UltraDexGrasp 流水线

1. 多策略合成数据生成

UltraDexGrasp 的核心在于一套自动化的数据流水线(Pipeline)。它将抓取过程分为两个阶段:

  • 抓取合成(Synthesis):利用双层优化(Bilevel Optimization)计算最优触点。上层优化手部姿态(Pose),下层通过二次规划(QP)求解满足摩擦锥约束的接触力。
  • 演示生成(Demonstration):使用 cuRobo 库进行并行化的双臂碰撞检查和路径规划。

通过这套流程,研究人员针对 1,000 个物体生成了涵盖:**二指捏(Pinch)、三指鼎立(Tripod)、全掌抓(Whole-hand)和双臂抱(Bimanual)**四种策略的 2000 万帧数据。

数据生成流水线 图 1:UltraDexGrasp 数据流水线:从场景初始化到优化合成,再到路径规划。

2. 指尖触点定义的物理直觉

为了支持多策略,作者巧妙地定义了不同的活跃触点集(Active Contact Set)。例如,精细操作仅激活指尖触点,而大物体抓取则激活整个掌心和双臂的受力面积。

不同策略的触点分配 图 2:针对不同策略(捏、取、抱)定义的特定手部接触点。


策略架构:感知即控制

模型的策略架构追求“大巧若拙”。它直接以点云(Point Cloud)作为输入:

  • 特征提取:使用 PointNet++ 提取场景的层级特征。
  • 注意力机制:通过 Transformer Decoder 中的单向注意力(Unidirectional Attention)将动作 Query 与点云特征融合。
  • 概率建模:预测动作的有界高斯分布。这种随机性建模相比直接回归坐标,在处理多模态数据(即一个物体有多种合理抓法)时表现更稳定。

策略架构图 图 3:通用灵巧抓取策略架构:点云输入 -> PointNet++ -> Transformer -> 动作分布。


实验与结果:全方位的 SOTA

仿真性能

在 600 个测试物体(包含从未在训练集出现的类别)中,UltraDexGrasp 的表现令人惊艳:

  • 平均成功率 84.0%,远超扩散策略基线 DP3 (46.7%) 和 基于优化的 DexGraspNet (58.8%)。
  • 尺寸泛化:无论是长边小于 3cm 的微型部件,还是短边超过 50cm 的大箱子,系统都能稳定处理。

真实世界 Sim-to-Real

实验采用了两台 UR5e 机械臂和 XHand 灵巧手。通过加入机器人本体点云渲染(Imaged Point Cloud)和关节阻抗随机化,模型成功克服了现实世界的噪声。

真实世界对比 图 4:真实世界实验设置,涵盖了从轻质物体到重型容器的各种挑战。

策略小物体中物体大物体平均
DP337.3%56.0%46.7%46.7%
Ours72.0%82.2%89.3%81.2%

深度洞察与总结

UltraDexGrasp 的成功揭示了两个重要趋势:

  1. 合成数据的威力:对于复杂的双臂协同,真实数据的匮乏可以通过高性能物理仿真与先进优化算法产生的“合成专家演示”来弥补。
  2. 多策略融合的必然性:真正的通才机器人不应局限于一种抓取模式。UltraDexGrasp 通过统一的优化框架实现了策略的语义对齐,为未来更通用的具身智能(Generalist Embodied AI)奠定了基础。

局限性:目前系统主要关注抓取瞬间及其稳定性,对于抓取后的动态操控(如旋转物体、复杂的工具使用)仍有待进一步探索。

发现相似论文

试试这些示例

  • 查找最近其他试图解决双臂灵巧机器人协同操作中多策略自动切换问题的论文。
  • 哪篇论文最早提出了基于双层规划(Bilevel Optimization)的抓取合成方法,本文在其基础上做了哪些针对双臂的扩展?
  • 有哪些研究将基于点云的扩散模型(Diffusion Policy)与单向注意力机制结合,用于提升机器人操作的泛化性?
目录
[2026] UltraDexGrasp:突破双臂灵巧抓取极限,2000万帧数据驱动的通用策略
1. TL;DR
2. 痛点深挖:为什么双臂灵巧抓取这么难?
3. 核心方法:UltraDexGrasp 流水线
3.1. 1. 多策略合成数据生成
3.2. 2. 指尖触点定义的物理直觉
4. 策略架构:感知即控制
5. 实验与结果:全方位的 SOTA
5.1. 仿真性能
5.2. 真实世界 Sim-to-Real
6. 深度洞察与总结