消费级 LiDAR 的 NLOS 革命:利用运动让“盲区”可见
Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling
本文提出了基于消费级 LiDAR 的非视距(NLOS)成像框架,核心方法为运动诱导孔径采样(MAS)模型,并结合粒子滤波实现了多帧融合。在手持智能手机级 LiDAR 设备上实现了 NLOS 3D 重建、多物体实时追踪及厘米级精度的相机定位。
TL;DR
麻省理工学院(MIT)的研究团队最近证明,你手中仅价值几十美元的智能手机 LiDAR 元件,其实具备“隔墙观物”的潜力。通过引入 运动诱导孔径采样(Motion Induced Sampling, MAS) 模型,研究者将原本由于手部抖动和物体移动带来的“成像噪声”转变为提升分辨率的“虚拟孔径”,实现了 NLOS(非视距)环境下的实时 3D 追踪与重建。
挑战:消费级硬件的“先天不足”
NLOS 成像的物理直觉是利用墙面作为“虚拟镜子”,捕获物体多次反射回来的微弱光子(Time-of-Flight)。然而,消费级 LiDAR(如 iPhone 或平板机器人上的传感器)面临三大难关:
- 极低 SNR:为了人眼安全,激光功率极低,且曝光时间短。
- 分辨率贫瘠:通常只有 10x10 左右的像素,采样点极其稀疏。
- 运动模糊:手持设备的随机运动和物体的位移会彻底破坏测量相干性。
核心算法:MAS 模型与光锥变换(LCT)
作者的核心贡献在于发现:物体的位移在 LCT 空间 内可以简化为简单的卷积平移。

通过将深度(z)和时间()重映射到 LCT 空间,复杂的传播方程被解耦。MAS 模型将观测过程建模为:
- 物体形状:定义一个标准状态下的空间时间脉冲响应(Canonical STIR)。
- 物体运动:导致 STIR 函数的 3D 平移。
- 相机位姿:决定了对该平移后的 STIR 函数的随机空间采样。
实时推理:粒子滤波(Particle Filtering)
为了实现 30Hz 的实时追踪,作者弃用了昂贵的迭代优化算法,转而采用 粒子滤波。
- 传播(Propagation):利用等速或随机运动先验更新粒子的位置预测。
- 评估(Evaluation):计算测量值与 MAS 模型生成的渲染图之间的互相关得分。
- 重采样(Resampling):保留高权重粒子,消除不确定性。

这种方法不仅能追踪单物体,还能通过 K-means 聚类粒子群,在高度噪杂的 NLOS 信号中同时分离并追踪多个目标(如追踪盲区内的左右手动作)。
实验与应用:从重建到定位
实验采用了 ST VL53L8CX(一种极其廉价的 SPAD 传感器)。
- 结果对比:相比传统的 Backprojection 方法,该方法对噪声的稳健性显著增强,追踪误差控制在 5cm 以内。
- 视觉里程计(VO)增强:在白墙等缺乏纹理的极端环境下,传统的视觉算法会失效。本文展示了利用 NLOS 追踪隐藏的物体作为“地标”,反向推算相机自身位姿的能力。

总结与洞察
该工作的精妙之处在于它将不利因素(运动)转化为有利资源(合成孔径)。它告诉我们,NLOS 成像并不一定需要昂贵的实验室飞秒激光器。
局限性:目前模型仍依赖于物体具有较好的反光特性(实验多用逆反射材料),对于全吸收或极其复杂的非刚性物体,STIR 的建模精度仍有待提高。
未来展望:随着深度学习引入 Score function 的学习,未来的手机应用或许真的能像《蝙蝠侠》里的黑科技一样,通过简单的挥动扫描,实时勾勒出拐角后的世界。
