消费级 LiDAR 的“透视”超能力:基于运动诱导采样的非视距成像
Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling
本文提出了“运动诱导孔径采样”(MAS)模型,利用普通消费级 LiDAR(如智能手机、AR 设备)实现了非视距(NLOS)成像。该方法通过多帧融合策略,在低信噪比、低分辨率和设备运动的约束下,成功完成了隐藏目标的 3D 重建、多目标跟踪及相机定位任务。
TL;DR
麻省理工学院(MIT)的研究团队通过一种名为 MAS(Motion-Induced Aperture Sampling) 的物理模型,成功让 iPhone 等设备自带的低性能 LiDAR 拥有了“看”到墙后隐藏物体的能力。该研究不再要求实验室恒定的采样环境,而是通过物体和相机自身的运动来构建合成孔径,将感知成本从数万美元降至百元人民币以下。
背景:从实验室走向掌上感知
传统的非视距成像(NLOS)通常需要皮秒级精度、超高激光能量和极大的采样墙面。之前的 SOTA 工作虽然效果惊艳,但往往需要耗时数小时的扫描和昂贵的单光子探测器。
本文作者指出,消费级设备(如手机、扫地机器人)自带的 LiDAR 性能极差:
- 极低 SNR:为了眼安全,激光功率被控制在极低水平。
- 极低分辨率:通常只有 8x8 或 10x10 像素。
- 运动模糊:手持设备无法保持绝对静止。
但作者产生了一个直觉:既然设备在动,由于视角冗余和分集,为何不利用这种运动来合成一个“巨大”的虚拟光阑(Aperture)?
核心机制:MAS 模型与粒子滤波
作者提出了 运动诱导孔径采样 (MAS) 模型。其物理直觉在于利用光锥变换 (Light-Cone Transform, LCT) 的卷积不变性。
1. 物理分解
在 LCT 变换后的空间中,隐藏物体的回波信号可以表达为一个空间位移的卷积。作者将测量的时空脉冲响应(STIR)巧妙地解耦为:
- Canonical STIR:代表物体的固有形状。
- Delta (Δ):代表随时间变化的平移向量。
- Sampling Function:由相机位姿(Pose)决定的空间采样点。

2. 实时推理:粒子滤波
由于 NLOS 逆问题是高度非凸的,传统的迭代优化器在手机上跑不动。作者引入了粒子滤波 (Particle Filtering):
- 传播 (Propagation):基于运动先验(如恒定速度)预测下一帧位置。
- 评估 (Evaluation):利用 MAS 模型渲染一个“虚假”的测量值,并与实际 LiDAR 读取的数据进行对比(点积得分)。
- 重采样 (Resampling):剔除不符合物理定律的预测,锁定高概率路径。

实验战绩
研究展示了三种突破性的应用:
- 3D 重建:通过扫描墙面合成超大孔径,甚至可以分辨隐藏的人台形状。
- 动态跟踪:实现了隐藏物体的 3D 轨迹跟踪,误差仅 4.7 厘米。即使是弥散性的普通材料物体(而非反光贴纸),也能被检测到。
- NLOS 定位 (Localization):在面对白墙(缺乏视觉特征,传统 SLAM 失效)时,利用隐藏在拐角后的物体作为“地标”进行相机定位。

深度洞察
该工作的精妙之处在于将 “运动”从感知的敌人变成了感知的盟友。
- 抗混叠:多 bounce 的微弱信号虽然模糊,但在采样率极低的情况下,这种模糊反而充当了光学抗混叠滤波器,帮助恢复宏观形状。
- 即插即用:不同于前人需要复杂的校准,本文在 VL53L8CX 这种通用传感器上实现了秒级部署,真正推动了算法的民主化。
局限与展望
目前的模型主要处理刚体平移(Rigid-body translation),尚未考虑物体的旋转和形变。此外,对于高度复杂的漫反射环境,信号淹没在噪声中的问题依然存在。作者建议未来的研究可以结合机器学习来训练非手工定义的评分函数(Score Function),以应对真实世界的复杂 BRDF 特性。
总结 (Takeaway)
NLOS 成像不再是昂贵实验室的专利。利用运动诱导采样,每一台智能手机可能在不久的将来都具备“透视眼”,这不仅会改写自动驾驶和机器人导航,更可能为 AR 交互开辟全新的维度。
