[Google & DeepMind] EgoReasoner:任务自适应逻辑模板,重塑第一人称 4D 推理
EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking
本文提出了 EgoReasoner,一个专门用于第一人称(Egocentric)4D 推理的二阶段框架。该方法通过“任务自适应思维模板”和“任务感知强化学习奖励”,显著提升了模型在空间定位、动作计数和轨迹追踪等复杂时空任务上的表现,在 HD-EPIC 基准测试中超越了更大规模的 Qwen2.5-VL-7B。
TL;DR
在第一人称视频(Egocentric Video)中,不仅世界在动,相机(你的头)也在动。传统的视频大模型(Video MLLMs)由于缺乏对这种 4D 动态环境的物理直觉,往往在复杂的时空推理中“翻车”。Google 和 Google DeepMind 的研究者通过 EgoReasoner 证明了:给模型一套“结构化思维模板”,并配合“任务感知的强化学习奖励”,一个 3B 的小模型就能在 4D 推理任务上轻松碾压 7B 的基线模型。
痛点深挖:为什么第一人称 4D 推理这么难?
在处理 HD-EPIC 等极具挑战性的任务时,模型需要回答诸如“烤箱在我 4 点钟方向”或“这个碗从水槽搬到了灶台”等问题。现有的方法存在三个短板:
- 相机漂移(Ego-motion):由于视角不断变换,传统的空间推理失效了,模型无法将视觉特征映射到动态的参考系中。
- 长时程账本(Long-term Bookkeeping):五分钟的视频,物体被多次移动,模型很容易丢失物体的身份(Entity Identity)或记错顺序。
- “一刀切”的优化:用同样的推理流程和奖励函数去处理“计数”和“定位”,往往会导致模型在某一方面过度优化而在另一方面退化。
核心方案:EgoReasoner 的两步走策略
1. 任务自适应思维模板 (Task-Adaptive Thinking Templates)
研究者认为,不同的认知任务需要不同的思考路径。例如,空间定位任务需要先确定“参考坐标系”,而轨迹追踪任务需要构建“时间日志”。EgoReasoner 为 6 种不同的 4D 任务设计了专门的推理脚手架(Scaffold),引导模型先从物理层面思考(如提取 BBOX 和时间点),再给出最终答案。

2. 基于元数据的强化学习 (Grounded RFT)
这是本文最惊艳的部分。作者利用 SLAM 技术结合 Detic 检测,生成了自动化的物理元数据(4D Descriptions)。在强化学习阶段(GRPO),模型生成的每一条推理链(CoT)都要经过三重严苛的审核:
- 实体奖励 (Entity Reward):你提到的是“平底锅”还是“锅盖”?名字对不上就扣分。
- 时间奖励 (Temporal Reward):你确定的动作发生时间与真实位置是否在窗口偏移内?
- 逻辑奖励 (Logic Reward):针对时钟方位任务,计算角度偏差;针对轨迹任务,验证序列长度。

实验战绩:小钢炮模型的高光时刻
实验结果表明,EgoReasoner 在多项任务上展现了统治力:
- 平均准确率:3B 模型从 SFT 阶段的 32.2% 提升至 RFT 阶段的 37.5%。
- 相比基线:在“物体移动计数”任务中,EgoReasoner 相比基线(Qwen2.5-VL-7B)准确率翻了近一倍。

消融实验 (Ablation Study) 显示,单纯的强化学习如果没有任务感知的奖励函数(Logic/Grounding Reward),模型性能甚至会随着训练步数的增加而出现明显的“退化”现象(不稳定波动),这进一步强调了物理约束引导在 MLLM 训练中的重要性。
深度洞察与总结
EgoReasoner 的成功为具身智能(Embodied AI)提供了一个重要的启示:推理的结构化(Structure)比算力的规模化(Scale)更重要。 在真实的物理世界中,任务的逻辑往往是多样的且确定的,通过思维模板固定逻辑边界,再通过 RL 强化物理对齐,是让模型具备“常识推理”和“空间感知”的捷径。
局限性:论文也指出,在超长视频(8-10 分钟以上)的“固定物体定位”任务中,模型仍面临挑战。这反映了当前模型在长上下文(Long Context)下的注意力瓶颈。
本文由资深学术技术主编重构。
