MathArena 的 Leaderboards 排行榜怎么看:按竞赛和模型比较 LLM 数学能力

MathArena 的 Leaderboards 是一组按数学竞赛和基准分类组织的模型成绩表,用来比较不同大语言模型在未被污染的数学题上的表现。它适合想知道“某个模型在 AIME、IMO、Putnam 这类具体竞赛上表现如何”的读者。使用方式是先在页面选择竞赛或基准类别,加载对应排行榜表格,再按模型逐项查看成绩;点击单元格还能看到该模型的原始输出。需要注意,页面中标注为 Deprecated(已弃用)的榜单属于旧分类,不应与当前主榜混用。

排行榜解决什么问题

MathArena 的定位是“用未被污染的数学基准评测 LLM”。排行榜把评测结果按竞赛来源和题型组织成可切换的表格,让读者能回答两类问题:

  • 同一个模型在不同竞赛上的表现差异有多大;
  • 同一场竞赛里,不同模型谁更强。

由于榜单按竞赛和时间段切分,它也能反映模型在特定年份、特定月份题目上的表现,而不是只给一个笼统的总分。

榜单的分类结构

从页面可见的选项看,Leaderboards 主要分为以下几类,每类下再按具体竞赛或时间段细分:

类别 说明 细分示例
ArXivLean 与 Lean 相关的 arXiv 基准 03/2026、06/2026
BrokenArXiv arXiv 基准的另一组切分 Overall 及各月份(02/2026–08/2026)
ArXivMath arXiv 数学基准 Overall 及 12/2025–08/2026 各月
👁️ Visual Math(已弃用) 视觉数学题 Overall,以及 Kangaroo 2025 各年级
🔢 Final-Answer Comps(已弃用) 只要求最终答案的竞赛 AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等
✍️ Proof-Based Comps(已弃用) 要求写证明的竞赛 USAMO、IMO、IMC、Miklós Schweitzer、Putnam
💻 Project Euler(已弃用) 编程数学题 Project Euler

其中 Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 都带有 Deprecated 标记,说明这些是旧分类。当前主榜应优先看 ArXivLean、BrokenArXiv、ArXivMath 这类未标注弃用的类别。

如何按竞赛和时间段筛选

页面提供“Choose competition”选择器,可选的竞赛覆盖多个层级:

  • 入门与年级类:Kangaroo 2025 的 1-2、3-4、5-6、7-8、9-10、11-12 各年级组;
  • 高中竞赛类:AIME 2025、AIME 2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、BRUMO 2025、SMT 2025、CMIMC 2025、Apex、Apex Shortlist;
  • 高阶证明类:USAMO 2025、USAMO 2026、IMO 2025、IMC 2025、Miklós Schweitzer 2025、Putnam 2025;
  • 编程类:Project Euler。

时间维度上,ArXivMath 和 BrokenArXiv 都按月份切分(如 12/2025、01/2026 一直到 08/2026),并各自提供 Overall 汇总。这样既能看单月表现,也能看整体表现。

操作步骤

  1. 打开 MathArena 的 Leaderboards 区域。
  2. 在“Choose competition”中选择想看的竞赛或基准类别。
  3. 页面加载对应的排行榜表格(未选择时提示“Select a competition to load tables / leaderboard”)。
  4. 在表格中按模型查看成绩,横向比较不同模型。
  5. 点击某个单元格,查看该模型在这道题上的原始输出,判断它是真解出来还是碰巧答对。

常见卡点

  • 把已弃用榜单当主榜:Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 都标了 Deprecated,比较当前模型能力时应优先用未弃用的类别。
  • 忽略时间切分:同一类别下不同月份的题目不同,跨月直接比分数可能不公平,需要看清是 Overall 还是单月。
  • 只看总分不看原始输出:点击单元格能看到模型原始输出,这是判断模型是否真正理解题目的关键,只看分数容易高估。
  • 未选竞赛时页面为空:表格和排行榜都需要先选择竞赛才会加载,看到空白提示属于正常状态。
matharena.ai
MathArena: Evaluating LLMs on Uncontaminated Math Benchmarks