[CVPR 2026] 2D 纹理还是 3D 几何?三阶段剪枝框架打破 MVLA 实时推理瓶颈

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

总结
问题
方法
结果
要点
摘要

本文提出了针对多视觉模态具身智能模型 (MVLA) 的三阶段 Token 剪枝框架。通过分析 2D/3D 模态在数据预处理、语义综合及动作迭代中的显著性差异,实现了高效的 Token 选择,并在 MLA 模型上取得了最高 2.55 倍的推理加速,且几乎无精度损失。

TL;DR

随着具身智能进入 3D 时代,多视觉模态 VLA 模型 (MVLA) 虽然增强了空间感知,却因 Token 爆炸导致推理速度龟速(仅 3-5 Hz)。本文提出了一种三阶段 Token 剪枝框架,通过深度剖析 2D/3D 模态在语义和时间维度上的显著性差异,成功实现了最高 2.55x 的端到端加速,且保持了极高的模型成功率。

核心速览

具身智能(Embodied AI)的核心在于快速响应。传统的纯 2D VLA 模型难以处理复杂的空间任务,因此引入 3D 点云(Point Cloud)已成趋势。然而,模态的扩张带来了计算量的灾难。

本文的研究直觉在于:并非所有 Token 都是平等的。在机器人抓取物体时,目标区域的 3D 几何至关重要,而桌布的背景 2D 纹理则是纯粹的噪声。


痛点深挖:为何直搬剪枝方法会“翻车”?

现有的 Token 剪枝方案(如 SP-VLA 或 VLA-Pruner)大多是为单模态设计的。当面对 2D+3D 的 MVLA 时,它们存在三大盲点:

  1. 显著性差异:2D 图像和 3D 点云对模型的贡献是不一致的。
  2. 语义集合失焦:背景区域占据了大量 Token,却对决策几乎没有贡献。
  3. 时间动态性:机器人动作是连续的,每一帧的显著 Token 指标都在大幅抖动。

三阶段数据利用范式 图 1:MVLA 推理中的三阶段数据利用流程


Methodology:三阶段显著性感知剪枝

作者将剪枝过程耦合进了 MVLA 的经典流程中:

1. 数据预处理阶段:双阈值过滤

通过计算最后一层特征的 范数,量化 2D 与 3D 模态的“主权”。通过特定的阈值 和 ,初步筛选出仅需 2D、仅需 3D 或双模态保留的候选集。

2. 语义综合阶段:正交分解去冗余

利用 Attention Score 将场景聚类为:目标物体 (Target Object)、机器人主体 (Robot Body) 和 背景 (Background)。

  • Insight: 作者发现 3D 信息中包含大量与 2D 重合的冗余。通过将 3D 注意力向量投影到 2D 的正交空间,仅保留那部分“独特的 3D 信息”,极大地精简了点云 Token。

三阶段剪枝架构图 图 2:三阶段 Token 剪枝框架总架构

3. 动作迭代阶段:EMA 平滑决策

物理世界的交互具有连贯性。作者引入了指数移动平均 (EMA) 机制,基于滑动窗口预测下一帧的显著性分布,有效防止了视频序列中的“掩码闪烁”现象,保证了动作控制的丝滑。


实验战绩:速度与精度的帕累托最优

在标准的 RLBench 仿真平台上,该方法展现了统治级的性能优势。

实验结果对比图 图 3:仿真基准测试结果对比

  • 性能提升:在 70% 剪枝率下,平均成功率(SR)保持在 46.3%(基线 48.8%),但推理延迟从 2.5 秒降至 1.05 秒。
  • 消融实验:结果显示,如果去掉语义阶段,成功率会剧降,这证明了“保护关键语义区域”是剪枝的前提。
  • 真实世界:在 Songling Piper 机械臂上的实测显示,剪枝过程对机器人的实时交互几乎无感知损耗。

深度洞察与总结

这篇论文的精妙之处在于它不仅提出了一个算法,还量化了一个具身智能的重要物理直觉:在不同任务阶段,由谁来“统治”显著性?

  • 结论是:2D 模态通常主导全局,但在机器人与物体接触的“关键交互瞬间”,3D 的几何显著性会瞬间爆发。

局限性与展望

虽然该框架表现优越,但目前的剪枝率仍然依赖预设的超参数。未来的研究方向应当在于如何通过强化学习或元学习,让模型在推理过程中“自动调节”这个剪枝浓度,从而在极其复杂的动态场景下(如快速移动或多目标避障)实现更极致的平衡。

总之,这为 MVLA 模型从实验室走向 20Hz+ 实时工业应用铺平了道路。

发现相似论文

试试这些示例

  • 查找最近其他试图解决多模态视觉语言推理模型中跨模态 Token 冗余及加速问题的论文。
  • 哪篇论文最早提出了在 Transformer 中使用特征范数或注意力得分进行 Token 剪枝,本文是如何将其扩展到具身智能动态场景的?
  • 有哪些研究将类似三阶段分析的方法应用到了多模态大模型的边缘侧与云端协作部署任务中?
目录
[CVPR 2026] 2D 纹理还是 3D 几何?三阶段剪枝框架打破 MVLA 实时推理瓶颈
1. TL;DR
2. 核心速览
3. 痛点深挖:为何直搬剪枝方法会“翻车”?
4. Methodology:三阶段显著性感知剪枝
4.1. 1. 数据预处理阶段:双阈值过滤
4.2. 2. 语义综合阶段:正交分解去冗余
4.3. 3. 动作迭代阶段:EMA 平滑决策
5. 实验战绩:速度与精度的帕累托最优
6. 深度洞察与总结
6.1. 局限性与展望