StreamingTalker:自回归扩散模型解锁 3D 数字人实时通话新高度
StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model
本文提出了 StreamingTalker,一种基于自回归扩散模型(Autoregressive Diffusion Model)的音频驱动 3D 面部动画生成框架。该方法实现了流式输出,在保持高保真口型同步的同时,显著降低了推理延迟并有效处理了超长音频序列。
TL;DR
浙江大学与蚂蚁集团的研究团队提出了 StreamingTalker,这是首个能够实现流式、长时、实时 3D 面部动画生成的自回归扩散模型。它解决了传统扩散模型处理长音频时的“高延迟”与“非训练时长外推失效”两大痛点,推理延迟仅为 25ms 且支持无限长音频。
背景定位:扩散模型的长序列困境
扩散模型(Diffusion Models)因其强大的连续分布建模能力,已成为 3D 动画生成的首选。然而,早期的 FaceDiffuser 或 DiffSpeaker 等 SOTA 模型大多采用 全序列去噪(Global Denoising) 模式。
- 计算瓶颈:随着音频变长,Transformer 的计算量呈二次方增长,导致首帧生成延迟高达数秒。
- 概括失效:当输入音频时长超过训练时的固定窗口(如 5 秒),模型往往因缺乏长程稳定性而崩坏。
核心直觉:自回归 + 轻量扩散头
StreamingTalker 的核心在于将“全局生成”转化为“步进式生成”。作者认为,每一帧的面部动作仅取决于有限的历史上下文和当前的音频激励。

1. 离散潜空间 (VQ-VAE)
首先,利用 VQ-VAE 将高维的 3D 顶点数据压缩为离散的 Latent Space。这不仅降低了生成难度,还为自回归建模提供了紧凑的特征表示。
2. 自回归条件预测器 (AR Condition Predictor)
这是模型的“大脑”。它接收过去 帧的运动潜码,通过集成 ALiBi (Attention with Linear Biases) 的 Transformer 解码器,融合 HuBERT 提取的音频特征,预测当前帧的条件向量 。
- 为什么要 ALiBi? 它允许模型在推理时外推出比训练时更长的序列,保证长效稳定性。
3. 轻量化扩散头
不同于前人使用复杂的 U-Net,StreamingTalker 仅使用一个 单层 MLP 作为扩散头。在 的引导下,仅需 50 步 DDIM 采样即可从高斯噪声中恢复出精准的 Latent,极大提升了渲染效率。
实验战绩:全方位的 SOTA
在 BIWI 这种包含丰富表情的数据集上,StreamingTalker 展现了极强的统治力。

- 口型精度:在 VOCASET 上的 LVE 仅为 2.7206,远优于 DiffSpeaker 的 3.1478。
- 实时性能:如图所示,StreamingTalker 的延迟(25ms)不随音频增长而变化,而传统的 FaceDiffuser 延迟随时间呈指数级上升。

深度洞察
StreamingTalker 之所以有效,是因为它成功地将扩散模型的 “生成质量” 与自回归模型的 “推理灵活性” 进行了软耦合。
- 消融实验启示:实验证明,如果去掉 Diffusion Head 直接用 MLP 预测动作,效果会大幅下降(LVE 上升)。这说明扩散过程在弥补动作连续性和细节质感方面不可替代。
- 流式架构的未来:结合 LLM 和 TTS,StreamingTalker 可以无缝接入实时对话系统。作者展示了一个集成 Demo,延迟极低,足以支撑自然的交互体验。
局限与挑战
尽管在口型上表现卓越,该模型目前对全脸情感表达的刻画仍有提升空间。目前主要依赖身份嵌入(Identity Embedding),对训练集外的人员泛化能力稍弱,未来可能需要引入更强大的 Cross-modal Style Encoder。
总结
StreamingTalker 证明了“小而美”的扩散头配合精心设计的自回归条件,完全可以覆盖复杂的 3D 说话人合成任务。它为移动端或低延迟云服务的数字人应用铺平了道路。
