MATHNET:当 AI 能解奥数题,它真的理解数学的本质吗?

MATHNET: A GLOBAL MULTIMODAL BENCHMARK FOR MATHEMATICAL REASONING AND RETRIEVAL

总结
问题
方法
结果
要点
摘要

本文推出了 MATHNET,这是一个大规模、多模态且多语言的奥数级数学竞赛基准测试。它包含来自 47 个国家、跨越 40 年的 30,676 道专家解答题目,支持解题(Problem Solving)、数学意识检索(Math-Aware Retrieval)及检索增强生成(RAG)三大任务。

TL;DR

MIT 等机构的研究者发布了 MATHNET,这是目前全球最大的多语言、多模态奥数竞赛基准测试。它包含 3 万多道由专家编写的高难度题目。研究发现了一个令人深思的现象:即便如 GPT-5、Gemini 1.5 Pro 等顶尖模型在解法生成上已渐入佳境,但在**识别两道数学题是否等效(数学检索)**这一基本能力上,几乎全军覆没。

1. 现状:被“刷榜”掩盖的数学黑盒

近年来,LLM 在 GSM8K 或 MATH 等数据集上的分数突飞猛进,甚至有报道称 AI 在 IMO(国际数学奥林匹克)中达到了金牌水平。然而,现有的 Benchmark 存在三个隐忧:

  1. 数据污染与局限:大多题目来自 AoPS 论坛,且集中于英语环境,模型可能只是背住了答案。
  2. 缺乏多模态:真实的数学竞赛充满了几何图形和图表,纯文本模型无法应对。
  3. “检索”能力的缺失:数学的核心在于“联想”,即发现当前问题与已知问题的结构共鸣。

MATHNET 总体概览 图 1:MATHNET 覆盖了全球 47 个国家、17 种语言,是一个真正的全球化评测基准。

2. 核心挑战:数学意识检索 (Math-Aware Retrieval)

MATHNET 最独特的贡献是提出了 Math-Aware Retrieval 任务。作者认为数学相似性分为三个层次:

  • Invariance(不变性):题目 A 和 B 只是换了变量名或代数变形。例如 与 。
  • Resonance(共鸣):题目不同,但可以使用相同的证明策略或引理。
  • Affinity(亲和性):同属于一个细分领域(如数论中的素数判定)。

痛点在于: 现有的 Embedding 模型(如 OpenAI 的 text-embedding-3)极其容易被“表面字符”欺骗。如果你搜索一个关于三角形的题目,搜索结果会给你一堆单词里带“Triangle”的题目,而忽略那些结构相同但表述为向量形式的等价题。

3. 技术路线:从官方文档到结构化知识库

为了保证数据质量,作者没有爬取网页,而是通过 dots-ocr 框架解析了 1595 本官方竞赛小册子和 2.5 万页 PDF。

模型架构图 图 2:三阶段数据提取管线。通过 LLM 进行分段、LATEX 格式化,并经过严格的 Rule-based 和人机协同验证。

4. 实验结果:检索性能的坍塌

在解题任务(Problem Solving)中,Gemini-3.1-Pro 展示了强大的统治力(78.4%),紧随其后的是 GPT-5(69.3%)。

但在检索任务中,情况急转直下:

  • Recall@1 惨不忍睹:所有模型的 Top-1 检索准确率都在 5% 左右。
  • 硬负样本的杀伤力:作者设计了“结构极其相似但数学本质完全不同”的干扰项(Hard Negatives),模型往往会把这些干扰项排在真正正确的等价题前面。

实验结果对比 表 1:嵌入模型在不同学科(代数、数论、几何等)上的检索表现,即便最强的 Gemini Embedding 也无法突破认知瓶颈。

5. RAG 的价值:结构对齐是关键

研究进一步探讨了“检索增强生成(RAG)”的应用。实验发现:

  1. 普通 RAG 效果有限:如果检索回来的题目只是表面相似,非但不能帮模型解题,反而会引入噪声。
  2. Oracle RAG 潜力巨大:当人工强制模型参考“结构对齐”的专家配对题目时,DeepSeek-V3.2-Speciale 的解题准确率跃升至 97.3%。这说明模型目前缺的不是“计算力”,而是“类比联想力”。

6. 深度分析:未来路向何方?

MATHNET 给学术界敲响了警钟:

  • 符号表征的匮乏:目前的 Embedding 模型是为自然语言设计的,对算式和符号结构的敏感度极低。
  • 几何仍然是重灾区:无论解题还是检索,几何题的表现(50%-60%)远低于代数题。
  • 从 Next-token 到符号推理:要解决奥数问题,模型必须能识别题目背后的物理直觉或逻辑不变量。

总结:MATHNET 不仅仅是一个评测集,它揭示了通往 AGI 的必经之路——AI 必须学会像数学家一样思考,而不仅仅像打字机一样堆砌符号。


更多详情请访问官方项目页:mathnet.mit.edu

发现相似论文

试试这些示例

  • 查找最近一年内针对大语言模型在奥数级几何证明(Geometry Reasoning)任务中表现的 SOTA 研究。
  • 哪篇论文最早系统性地定义了 Math-Aware Retrieval 任务,本文与其在结构化表示上有何改进?
  • 目前的对比学习或嵌入模型(如 mE5, BGE 等)在处理 LaTeX 符号等效性方面的最新进展有哪些?
目录
MATHNET:当 AI 能解奥数题,它真的理解数学的本质吗?
1. TL;DR
2. 1. 现状:被“刷榜”掩盖的数学黑盒
3. 2. 核心挑战:数学意识检索 (Math-Aware Retrieval)
4. 3. 技术路线:从官方文档到结构化知识库
5. 4. 实验结果:检索性能的坍塌
6. 5. RAG 的价值:结构对齐是关键
7. 6. 深度分析:未来路向何方?