突破视界:利用消费级 LiDAR 也能看穿墙角?
Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling
本文提出了 MAS 模型,首次在消费级智能手机 LiDAR 手机(LCT 变换空间)上实现了非视距(NLOS)成像。通过多帧融合策略和粒子滤波,该方法成功达成了 3D 重建、多物体实时跟踪及相机定位任务,将昂贵的实验室级 NLOS 技术推向了插件化、低成本(< $100)的移动端应用。
TL;DR
长期以来,非视距(NLOS)成像一直是计算摄影领域的“黑科技”,依赖于动辄万美金的实验室设备。MIT 的研究团队近期发布了一项突破性工作:通过 MAS(Motion-Induced Aperture Sampling)模型,仅使用智能手机自带的廉价 LiDAR(成本不足 $100)和自然的手部晃动,即可捕捉墙角后的 3D 信息。
1. 痛点:为什么你的手机 LiDAR 以前做不到?
NLOS 的原理是将墙壁视为一块“粗糙的镜子”,分析光线经过二次反射回传的微弱信号(多跳反射,Multi-bounce)。然而,手机端的消费级传感器面临三个致命打击:
- 低信噪比 (Low SNR):为了人眼安全,激光功率极低,且曝光时间短,信号往往淹没在噪声中。
- 低空间分辨率:实验室设备有百万像素,手机 LiDAR 通常只有 8x8 或 10x10 的点阵。
- 运动模糊 (Motion Blur):手持拍摄时的抖动和隐藏物体的运动会让信号在时间轴上相互耦合。

2. 核心直觉:把“抖动”变成“超分辨率”
作者的灵感源于迸发摄影(Burst Photography)和合成孔径雷达(SAR)。如果单帧信号不够强,能不能通过连续捕捉多帧并利用运动轨迹来“拼凑”出一个巨大的探测孔径?
这就是 MAS 模型 的核心。它利用 光锥变换 (Light-Cone Transform, LCT) 将时间维度的飞行时间(ToF)与空间坐标对齐,把复杂的成像过程简化为一个 3D 卷积。 其物理内涵是:物体的形状投影是静态的,而运动只是在 LCT 空间中产生了一个平移。这个巧妙的分解,让实时处理成为了可能。
3. 算法架构:粒子滤波的奇袭
由于 NLOS 问题本质上是高度病态的逆问题(多个位置可能产生相似信号),作者引入了粒子滤波(Particle Filter):
- 传播(Propagation):基于运动先验(如恒定速度)预测下一时刻粒子的位置。
- 评估(Evaluation):根据 MAS 模型渲染每一颗粒子对应的模拟测量值,并与传感器实测值进行对比打分。
- 重采样(Resampling):保留高分粒子,剔除偏差较大的路径。
这种方法不仅极大地抑制了噪声,还能在信号缺失时保留不确定性(Probability Distribution),避免了传统 FBP 算法的伪影问题。

4. 实验战绩:全场景 NLOS 能力
该方法在三大任务上展现了惊人的效果:
- 3D 跟踪:实时追踪墙角后的移动物体,平均误差仅 4.7cm。
- 多物体追踪:甚至能同时分辨并追踪双手的运动路径(如图 4 所示)。
- 相机定位(Landmark-free Localization):在没有任何纹理的白墙环境中,利用墙角后的固定物体作为“锚点”来矫正相机的位姿,解决了传统 SLAM 的特征点缺失痛点。

5. 局限与展望
尽管该技术实现了“普及化”的跨越,但在处理**复杂材质(漫反射物体)**时信号依然非常微弱(见图 5)。此外,目前的打分函数(Cosine Similarity)对复杂背景的抗干扰能力有待加强。
总结:这项工作最伟大的地方在于它证明了——NLOS 并不需要昂贵的设备。利用算法的“软实力”来弥补硬件的“硬缺陷”,这种 软硬一体化 (Co-design) 的思路,正是未来智能感知设备的主战场。

