MathArena 如何用 Olympiads 竞赛题评测大语言模型的数学能力
MathArena 是一个用未污染(uncontaminated)数学基准来评测大语言模型(LLM)的平台,其核心思路是把真实数学竞赛的题目作为测试集,观察模型在这些题目上的表现。它覆盖的 Olympiads 类竞赛包括 AIME、HMMT、BRUMO、SMT、CMIMC、Apex、USAMO、IMO、IMC、Miklós Schweitzer、Putnam 等,并按题型分为最终答案题、证明题、视觉数学题和 Project Euler 等类别。如果你想知道某个模型在真实竞赛难度下的数学能力,或者想比较不同模型在同类竞赛上的差异,可以按下面的方式理解和使用它。
MathArena 是什么
根据网站资料,MathArena 的定位是“Evaluating LLMs on Uncontaminated Math Benchmarks”,即用未被模型训练数据污染的数学基准来评测大语言模型。这一点很关键:如果测试题已经出现在模型的训练语料里,模型可能靠记忆而非推理答对,评测结果就会失真。MathArena 选择竞赛题作为基准,正是为了尽量降低这种污染风险。
Olympiads 覆盖哪些竞赛
从页面证据看,MathArena 的竞赛列表相当完整,可以按难度和类型大致分为几类:
| 类别 | 竞赛示例 |
|---|---|
| 中学竞赛 | Kangaroo 2025(1-2 到 11-12 各年级)、AIME 2025/2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、BRUMO 2025、SMT 2025、CMIMC 2025、Apex、Apex Shortlist |
| 高阶证明竞赛 | USAMO 2025/2026、IMO 2025、IMC 2025、Miklós Schweitzer 2025、Putnam 2025 |
| 其他 | Project Euler、ArXiv 相关基准(ArXivLean、BrokenArXiv、ArXivMath) |
可以看到,从 Kangaroo 这类入门竞赛到 IMO、Putnam 这类顶级竞赛都有覆盖,读者可以根据自己关心的难度层级选择对应的排行榜。
评测如何分类
MathArena 把评测按题型分成几个大类,页面证据中标注了部分类别为 Deprecated(已弃用),说明平台在持续调整评测体系:
- 🔢 Final-Answer Comps(最终答案题):AIME 2025、HMMT Feb 2025、BRUMO 2025、SMT 2025、CMIMC 2025、HMMT Nov 2025、AIME 2026、HMMT Feb 2026、Apex、Apex Shortlist。这类题只看最终答案是否正确,评测相对客观。
- ✍️ Proof-Based Comps(证明题):USAMO 2025、IMO 2025、IMC 2025、Miklós Schweitzer 2025、Putnam 2025、USAMO 2026。这类题需要完整证明,评测难度更高,也更接近真实数学研究能力。
- 👁️ Visual Math(视觉数学题):Kangaroo 2025 各年级。这类题涉及图形理解。
- 💻 Project Euler:以编程方式求解的数学问题。
- ArXiv 相关:ArXivLean、BrokenArXiv、ArXivMath,按月份(如 02/2026、03/2026 等)划分。
这种分类的意义在于:一个模型可能在最终答案题上表现很好,但在证明题上差距明显,分开看才能得到更准确的判断。
如何查看结果
根据页面证据,MathArena 的交互方式如下:
- 选择竞赛:页面提示“Select a competition to load tables”和“Select a competition to load leaderboard”,即先选定一个竞赛,再加载对应的表格和排行榜。
- 查看排行榜:选定竞赛后加载 leaderboard,可以看到各模型在该竞赛上的排名。
- 查看原始输出:页面提示“Click on a cell to see the raw model output”,点击排行榜中的某个单元格,可以看到该模型在这道题上的原始输出。
这意味着你不仅能看分数,还能追溯模型具体是怎么答题的,这对判断模型是真正推理还是碰运气很有帮助。
这些评测结果能说明什么
MathArena 的评测结果可以帮助你:
- 横向比较模型:在同一个竞赛基准上,不同模型的得分差异反映了它们在同类数学任务上的能力差距。
- 区分能力维度:最终答案题、证明题、视觉题、编程题分开评测,能看出模型在哪类任务上更强或更弱。
- 观察时间趋势:ArXiv 相关基准按月份划分(如 12/2025 到 08/2026),可以观察模型能力的演变。
需要注意的局限
- 页面证据中多个类别标注为 Deprecated,说明部分评测体系可能已被替代或调整,使用时应注意当前有效的评测类别。
- 竞赛题作为基准虽然降低了污染风险,但并不能完全排除模型见过类似题目的可能。
- 排行榜反映的是特定时间点的评测结果,模型更新后排名可能变化。
- 证明题的自动评测本身存在难度,评分标准可能影响结果的可比性。
如果你关心某个具体模型在特定竞赛上的表现,建议直接进入对应竞赛的排行榜,点击单元格查看原始输出,再结合题型分类来判断这个分数对你是否有参考价值。