通义 DeepResearch:开启开源 AI 研究员时代,3.3B 激活参数下的深度检索巅峰

Tongyi DeepResearch Technical Report

2025-01-01
Tongyi DeepResearch Team, Baixuan Li, Bo Zhang, Dingchu Zhang, Fei Huang, Guangyu Li, Guoxin Chen, Huifeng Yin, Jialong Wu, Jingren Zhou, Kuan Li, Liangcai Su, Litu Ou, Liwen Zhang, Pengjun Xie, Rui Ye, Wenbiao Yin, Xinmiao Yu, Xinyu Wang, Xixi Wu, Xuanzhong Chen, Yida Zhao, Zhen Zhang, Zhengwei Tao, Zhongwang Zhang, Zile Qiao, Chenxi Wang, Donglei Yu, Gang Fu, Haiyang Shen, Jiayin Yang, Jun Lin, Junkai Zhang, Kui Zeng, Li Yang, Hailong Yin, Maojia Song, Ming Yan, Minpeng Liao, Peng Xia, Qian Xiao, Rui Min, Ruixue Ding, Runnan Fang, Shaowei Chen, Shen Huang, Shihang Wang, Shihao Cai, Weizhou Shen, Xiaobin Wang, Xin Guan, Xinyu Geng, Yingcheng Shi, Yuning Wu, Zhuo Chen, Zijian Li, Yong Jiang
总结
问题
方法
结果
要点
摘要

本文介绍了 Tongyi DeepResearch,这是一个由阿里巴巴通义实验室开发的 30.5B 参数(激活 3.3B)的智能代理大模型,专门用于处理长程、深度信息寻检任务。该模型通过端到端的 Agentic Mid-training 和 Post-training 框架,在 Humanity’s Last Exam 等多个深度研究基准测试中达到了 SOTA 性能。

TL;DR

阿里巴巴通义实验室(Tongyi Lab)近日发布了 Tongyi DeepResearch,这是一个旨在替代人类进行数小时网页调研的智能代理模型。它通过独创的“Agentic Mid-training(代理化中间训练)”和“Context Management(上下文管理)”技术,仅凭 3.3B 的激活参数量,就在包括 Humanity's Last Exam 在内的 7 个主流深度研究榜单上刷新了 SOTA 记录,甚至在多数指标上超越了 OpenAI o3 和 DeepSeek-V3.1。

1. 深度研究的“不可能三角”:复杂性、成本与开源

在 AGI 的演进中,“深度研究(Deep Research)”被视为最高级的代理能力。它要求模型在数十分钟内,自主规划、搜索信息、验证结论并撰写报告。然而,该领域面临三个核心痛点:

  • Inductive Bias 缺失:通用模型在海量文本上预训练,缺乏“工具调用-反馈-调整”的直觉。
  • 标注成本爆炸:一个高质量的研究轨迹往往包含数十个步骤,人工标注一个样本需要数小时。
  • 上下文窒息:长时间的网页浏览会产生海量无效信息,导致模型在处理 128K 窗口时依然会迷失。

2. 核心架构:像人类一样“分段思考”

通义团队认为,传统的 ReAct 模式在面对超长任务时会因上下文过载而失效。为此,他们引入了 Markovian State Reconstruction(马尔可夫状态重构) 机制。

上下文管理范式

模型不再被迫记忆所有的原始搜索结果,而是在每一步生成一个不断进化的报告(S_t)。这个报告充当了模型的“压缩内存”,每一步的决策仅基于: 当前报告 + 上一步动作 + 环境反馈。 这种设计不仅防止了上下文溢出,还强制模型在每一步进行信息的优先级排序和综合,模拟了人类研究员“一边查资料,一边改草稿”的习惯。

训练流水线 图 1:通义 DeepResearch 的端到端训练流程,包含 Mid-training、SFT 和 RL

3. 训练三部曲:从“模仿”到“自主”

不同于常见的预训练+微调,通义 DeepResearch 引入了三个关键阶段:

  1. Agentic Mid-training:在预训练模型基础上,使用大规模合成的代理行为数据(规划、推理、决策)进行持续预训练,让模型提前感知“代理行为”的模式。
  2. SFT 冷启动:通过 rejection sampling(拒绝采样)筛选高质量路径,让模型学会基本的工具调用。
  3. 大规模异步 RL:利用改进的 GRPO 算法,在真实和模拟环境中进行上万次的 Rollout。为了解决环境不稳定问题,团队构建了一个统一下控中心(Sandbox),通过自动重试和缓存屏蔽了 API 的波动。

合成数据管线 图 2:针对 Agentic CPT 的大规模代理行为数据合成流程

4. 实验战果:以小博大的极致效率

尽管 Tongyi DeepResearch 总参数量为 30.5B,但得益于 MoE 架构,每个 Token 仅激活 3.3B 参数。

  • 综合战局:在 Humanity’s Last Exam(被认为是人类最难的考试)上得分 32.9%,显著超过 OpenAI o3(24.9%)。
  • 中文深度检索:在 BrowseComp-ZH 榜单上不仅远超同量级模型,甚至在 Heavy Mode 下达到了 58.1% 的惊人准确率。
  • Heavy Mode(重度模式):通过部署 n 个并行代理自主探索不同路径,最后由一个合成模型进行信息归并。这种“测试时计算缩放(Test-time Scaling)”极大提升了处理高不确定性问题的上限。

性能对比 图 3:各主流 Benchmark 下的性能对比图

5. 局限性与展望

尽管表现强劲,通义团队坦言:128K 的上下文在处理极其复杂的科研任务时仍显局限,未来将探索更长窗口或更精细的记忆管理。同时,强化学习框架下的端到端训练仍然面临非平稳分布的挑战。

总结

Tongyi DeepResearch 的成功标志着:深度研究能力的习得不再仅仅依赖模型规模,而在于训练范式中对“交互过程”的深度建模。 通过开源模型、框架及解决方案,阿里通义实验室为社区提供了一个可落地、可复现的“数字研究员”蓝图。


相关资源:

  • 模型权重:[HuggingFace-Link]
  • 代码仓库:[GitHub-Link]

发现相似论文

试试这些示例

  • 查找最近关于在大模型训练中引入 Mid-training 阶段(中间训练)以增强特定任务 Inductive Bias 的相关研究。
  • 哪篇论文最早提出了基于状态重构(State Reconstruction)的 LLM 上下文管理机制,通义该工作如何在此基础上实现了长程任务的稳定性?
  • 有哪些研究将类似 GRPO 的强化学习算法应用于具有外部工具调用(Tool-use)的闭环 Agent 策略优化中?
目录
通义 DeepResearch:开启开源 AI 研究员时代,3.3B 激活参数下的深度检索巅峰
1. TL;DR
2. 1. 深度研究的“不可能三角”:复杂性、成本与开源
3. 2. 核心架构:像人类一样“分段思考”
3.1. 上下文管理范式
4. 3. 训练三部曲:从“模仿”到“自主”
5. 4. 实验战果:以小博大的极致效率
6. 5. 局限性与展望
7. 总结