CityRAG:将 RAG 引入视频生成,打造真实物理世界的“任意门”

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation

总结
问题
方法
结果
要点
摘要

本文提出了 CityRAG,一种空间对齐(Spatially-Grounded)的视频生成模型,通过检索外部地理信息(RAG)来生成与真实世界物理布局一致的 3D 可导航环境。该方法基于 Wan 2.1 视频大模型,通过整合全球 10 个城市的 Street View 数据,实现了长达数分钟、物理一致的城市漫游视频生成。

TL;DR

传统的视频生成模型往往是“逻辑上的天才,现实中的路痴”——它们能生成漂亮的画面,但无法复刻真实的地理坐标。Google 与康奈尔等团队联合推出的 CityRAG 改变了这一现状。通过检索真实的街景数据作为“记忆锚点”,CityRAG 首次实现了与地理位置严格对应的 3D 一致性视频生成,支持在任意天气、动态环境下漫游真实的纽约或伦敦街头。

痛点与动机:为什么 AI 视频总是“不认路”?

在自动驾驶仿真或虚拟旅游中,我们需要的不仅是一个“看起来像城市”的视频,而是一个“就是那个路口”的环境。

  1. 扩散模型的局限性:Sora 或 Wan 2.1 等模型依赖训练权重的隐式记忆,一旦遇到长路径,街道就会开始“融化”或随机变异。
  2. 重建技术的僵硬性:NeRF 或 3D 现代模型需要对特定时刻进行密集采样,无法灵活切换“雨天”或“夜晚”模式,更难以生成真实的人流。

作者的逻辑直觉 (Insight):如果大语言模型可以通过 RAG(检索增强生成)查阅百科全书来减少幻觉,视频模型为什么不能查阅“地图街景”来对齐物理空间呢?

方法论:解耦“永恒”与“瞬间”

CityRAG 的核心在于其精妙的架构设计,它将场景拆分为:

  • 静态(Statics):建筑、路面、立交桥。这些通过检索街景数据库(Google Street View)获得。
  • 瞬态(Transients):当前的光照、降雨、行人、违停车辆。这些由用户输入的“第一张图”设定。

架构解析

模型基于 Wan 2.1 (14B) 架构。为了引入空间约束,作者做了两个关键改变:

  1. 轨迹条件(Trajectory Conditioning):将相机位姿矩阵通过 MLP 注入到 DiT 块中,确保镜头移动严格受控。
  2. 空间交叉注意力(Geospatial Cross-Attention):模型会同时“盯着”检索出来的老视频和当前要生成的画面。即使老视频里是晴天且停着旧车,模型也能提取出其中的建筑轮廓,并在生成时将其渲染为用户要求的“雪天”。

模型架构图

实验与结果:从“生成”到“模拟”

CityRAG 在极具挑战性的街区进行了测试,包括圣胡安、巴黎、旧金山等。

  • 复杂轨迹的韧性:在场景 B 中,即便检索视频因为堵车停滞了,模型仍能根据后续的轨迹参数,“预见性”地渲染出转角后的建筑。
  • 3D 一致性验证:当相机进行 180 度或 360 度大转弯回到原点时,建筑物的细节高度闭环,没有出现常见的漂移现象。

定性对比实验

在量化指标上(见下表),CityRAG 在评估真实感与空间一致性的 LPIPS-S 和 FID 维度上展现了碾压式的优势。

量化结果对比

深度洞察与总结

CityRAG 的意义在于它为“世界模型”提供了一种可扩展的路径。它不再试图让模型背下整个地球的所有细节,而是让模型学会**“查地图”**。这种“模型作为渲染器,外部数据作为几何源”的思想,极大地降低了长视频生成的逻辑幻觉。

局限性

  • 自回归累积误差:虽然支持分钟级视频,但由于是分段自回归生成,极远距离后仍可能存在微小错位。
  • 数据偏差:街景数据大多采样于良好天气,导致模型对极端恶劣天气(如大暴雨)的物理表现仍有待精进。

未来展望: 随着这种基于检索的视频生成技术成熟,未来的游戏可能不再需要庞大的美术资产包,只需一个小巧的模型加一个街景 API,就能实时渲染出一个 1:1 的真实世界虚拟化身。

发现相似论文

试试这些示例

  • 查找最近其他将检索增强生成 (RAG) 技术应用于视频扩散模型以提高时空一致性的相关研究。
  • 哪篇论文最早在街景生成领域提出了将静态背景与动态物体(Statics and Transients)进行解耦的理论框架?
  • 有哪些研究正尝试将 CityRAG 这种空间对齐的生成能力应用到自动驾驶仿真系统的封闭环测试 (Closed-loop Testing) 中?
目录
CityRAG:将 RAG 引入视频生成,打造真实物理世界的“任意门”
1. TL;DR
2. 痛点与动机:为什么 AI 视频总是“不认路”?
3. 方法论:解耦“永恒”与“瞬间”
3.1. 架构解析
4. 实验与结果:从“生成”到“模拟”
5. 深度洞察与总结