[腾讯 AI Lab] Penguin-VL:打破 CLIP 迷思,用 LLM 架构重塑最强轻量级 VLM
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
本文推出了 Penguin-VL 系列小型多模态大模型(2B/8B),核心创新在于提出了 Penguin-Encoder。该编码器直接从仅文本的 LLM(Qwen3-0.6B)初始化,而非传统的 CLIP/SigLIP 视觉编码器,成功在文档 OCR、数学推理及长视频理解任务中达到 SOTA 水平。
TL;DR
在 2026 年的多模态竞争中,腾讯团队推出的 Penguin-VL 给出了一个异类却强悍的答案:最好的视觉编码器,其实可以是一个“瞎眼”的 LLM。 通过将仅文本的 LLM(Qwen3-0.6B)改造为视觉编码器,Penguin-VL 在 2B 和 8B 规模下刷新了文档理解、图表分析及长视频推理的多项纪录,甚至在特定任务上超越了体积大得多的模型。
动机:对比学习的“原罪”
长期以来,VLM 的标配是 CLIP 或 SigLIP。但作者指出,对比学习的本质是判别(Discrimination)——它倾向于提取全局的、类别级的特征(比如“这是一张猫的照片”),却会为了压缩特征而无意中过滤掉细微的视觉噪声。
然而,对于文档 OCR、数学几何、长视频因果推理来说,这些“噪声”恰恰是核心:
- 判别式特征:看到形状知道是图表。
- 生成式特征(LLM 视角):需要看清坐标轴上的每一个刻度和文字。

核心方法:Penguin-Encoder 的诞生
1. 从 Text-only 到 Vision-aware
作者没有去下载现成的视觉模型,而是直接拿来一个 Qwen3-0.6B(文本模型)。
- 双向改造:将 Causal Self-attention 改为 Bidirectional Full Attention,让视觉 Patch 能互相看到。
- 位置编码:引入 2D-RoPE,处理不同分辨率下的空间关系。
2. 混合监督预训练:三重损失函数
为了让 LLM 架构学会“看”,作者设计了一套精密的特征重建方案。除了常规的交叉熵,最亮眼的是 Relation Loss:
- 不仅仅要求单个 Patch 的特征对齐教师模型,更要求 Patch 之间的**相互关系(Self-correlation)**对齐。
- 实验证明,这让模型对图像的结构化信息(如表格线条、字符排列)极度敏感。

3. TRA:时空冗余感知压缩
视频处理的痛点是 Token 爆炸。Penguin-VL 引入了 Temporal Redundancy-Aware (TRA) 机制:
- 关键帧(Key Frames):分配高分辨率/多 Token。
- 过渡帧(Intermediate Frames):通过双线性插值大幅压缩。 这种动态预算分配方案,使得 2B 模型也能在保持高性能的前提下,处理长达数分钟的视频。
实验战绩:以小博大的典型
图像领域:文档与图表的王者
在 DocVQA(文档问答) 任务中,Penguin-VL 2B 跑出了 94.1% 的高分,不仅碾压了同体量的 InternVL3.5,甚至让许多闭源大模型感到压力。这意味着 LLM 初始化带来的“原生语义对齐”在处理文字密集的场景时具有天然优势。
视频领域:时间线的精确捕捉
在 Charades-STA(时间句子定位) 测试中,Penguin-VL 表现惊人,相比 InternVL3.5 提升了 34 个百分点。这证明了其 TRA 机制能精准锁定动作发生的起止时间点。

深度洞察:为什么这种做法有效?
- 原生对齐 (Native Alignment):视觉编码器的架构和下游 LLM 解码器几乎一致。视觉 Token 产生的特征直接就在 LLM 熟悉的语境空间里,省去了昂贵的映射成本。
- 知识继承:0.6B 的文本模型虽然小,但它已经具备了基础的逻辑和语言规律。在学习视觉特征时,它是在用“语言的逻辑”去理解“视觉的结构”。
总结与未来
Penguin-VL 证明了在多模态领域,“大力出奇迹”不再是唯一路径。通过精细的架构重用和数据配比(Data Mixture),小型模型也能在端侧设备上实现卓越的理解力。
局限性:尽管在感知上极强,但在处理极高难度的抽象数学逻辑(如 MathVerse)时,Penguin-VL 仍略逊于经过海量数学 SFT 的模型。未来的方向将聚焦于 RL(强化学习)后训练,进一步解锁其作为 GUI Agent(自动化操作代理)的潜力。
作者:资深学术技术主编
日期:2026年3月10日
