MathArena 如何用各类数学竞赛题评测大语言模型的数学能力
MathArena 是一个用未被污染的数学竞赛基准来评测大语言模型(LLM)数学能力的平台。它把 AIME、HMMT、IMO、USAMO、Putnam、Project Euler 等竞赛题目组织成多个基准,按竞赛、时间、模型维度展示排行榜,并允许点击单元格查看模型的原始输出。如果你想判断某个模型在"真正的竞赛数学"上表现如何,而不是在可能已进入训练数据的旧题上刷分,MathArena 的价值就在于它强调基准的未污染性——用较新的竞赛题来降低模型"背过答案"的可能。
评测目标:为什么强调"未污染"
大语言模型在训练中会吸收大量公开文本,很多经典数学题(尤其是流传多年的竞赛题)很可能已经出现在训练语料里。这会导致模型在旧基准上分数虚高,却未必具备真正的推理能力。
MathArena 的做法是持续引入较新的竞赛题作为基准,例如 AIME 2025、AIME 2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、USAMO 2025、USAMO 2026、IMO 2025、Putnam 2025 等。这些题目在模型训练截止时间之后才公开,因此更能反映模型面对新问题时的真实数学能力。
两类竞赛的评测方式差异
MathArena 把竞赛基准分成两大类,评测方式不同:
| 类型 | 代表竞赛 | 评测重点 | 判定方式 |
|---|---|---|---|
| Final-Answer Comps(最终答案类) | AIME、HMMT、BRUMO、SMT、CMIMC、Apex | 能否算出正确答案 | 比对最终答案 |
| Proof-Based Comps(证明类) | USAMO、IMO、IMC、Miklós Schweitzer、Putnam | 能否写出完整严谨的证明 | 评估证明过程 |
最终答案类的题目有唯一数值或表达式答案,评测相对直接:模型给出答案,与标准答案比对即可。AIME 这类题目答案通常是 0–999 的整数,判定清晰。
证明类的题目没有唯一答案,需要评估证明的逻辑完整性、严谨性和正确性。这类评测更难自动化,通常需要更复杂的评判方式(如人工评审或专门的评判模型)。这也是为什么 MathArena 把两类分开呈现——它们的分数不能直接横向比较。
专项基准分别考察什么
除了按竞赛划分,MathArena 还提供几个专项基准,针对不同的数学能力维度:
- ArXivMath:按时间(12/2025、01/2026 至 08/2026 等)组织的基准,考察模型处理学术数学问题的能力。
- BrokenArXiv:同样按时间划分(02/2026 至 08/2026 等),名称暗示其可能涉及"有缺陷"或"需要纠错"的数学内容,考察模型识别和处理问题缺陷的能力。
- Visual Math:视觉数学基准,包含 Kangaroo 2025 各年级(1-2、3-4、5-6、7-8、9-10、11-12),考察模型处理带图形或视觉信息的数学题的能力。
- Project Euler:编程与数学结合的题目,考察模型用计算方法解决数学问题的能力。
这些专项基准让你可以针对特定能力维度(学术数学、视觉数学、计算数学)查看模型表现,而不只是看综合竞赛分数。
如何查看排行榜与模型输出
MathArena 的界面围绕"选择竞赛 → 加载表格/排行榜"的逻辑组织:
- 选择竞赛:从下拉菜单选择你想看的竞赛或基准,例如 AIME 2026、IMO 2025、Project Euler 等。
- 查看排行榜:选定后加载对应的排行榜,展示各模型在该竞赛上的得分。
- 查看原始输出:点击单元格可以看到该模型在该题上的原始输出。这是理解模型"为什么得分/失分"的关键——分数只是结果,原始输出能让你看到模型的推理过程、是否跳步、是否在最后一步算错。
按时间维度,你可以对比同一模型在不同年份竞赛上的表现,观察其能力是否随版本更新而提升。
Deprecated 分类的含义
MathArena 中多个分类标注了 (Deprecated),包括:
- 👁️ Visual Math (Deprecated)
- 🔢 Final-Answer Comps (Deprecated)
- ✍️ Proof-Based Comps (Deprecated)
- 💻 Project Euler (Deprecated)
Deprecated 意味着这些分类已被弃用,平台可能已用新的组织方式替代它们。但弃用不等于数据无价值——这些分类下仍保留了具体竞赛的结果(如 Visual Math 下的 Kangaroo 2025 各年级、Final-Answer Comps 下的 AIME 2025/HMMT Feb 2025 等、Proof-Based Comps 下的 USAMO 2025/IMO 2025/Putnam 2025 等、Project Euler 下的题目视图)。
参考这些旧分类时需要注意:它们反映的是当时的评测口径,可能与当前基准的组织方式或判定标准不同,因此不宜与最新结果直接混用比较。把它们当作历史参考更合适。
使用建议
- 想看模型真实数学能力:优先看较新的竞赛(AIME 2026、HMMT Feb 2026、USAMO 2026 等),污染风险更低。
- 想比较不同能力维度:最终答案类看解题正确率,证明类看证明质量,两者分开评估。
- 想理解分数背后的原因:点击单元格查看原始输出,比只看分数更有信息量。
- 看到 Deprecated 分类:可以查看历史数据,但注意评测口径可能已变化,不要与当前结果直接对比。