网站深度测评
MathArena是什么网站?
MathArena 是一个评测大语言模型数学能力的公开基准网站,重点放在“未被污染”的数学题目上:用较新的竞赛题和论文题来检验模型是真会做数学,还是只记住了训练数据里的答案。
它评测什么
按竞赛来源和题型分成几类,可以在页面上按比赛切换查看榜单:
- ArXiv 系列:ArXivLean、BrokenArXiv、ArXivMath,取材自论文相关数学内容。
- 视觉数学:Visual Math,题目含图,例如 Kangaroo 袋鼠竞赛各年级组。
- 只写最终答案的竞赛:AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等。
- 需要写证明的竞赛:USAMO、IMO、IMC、Miklós Schweitzer、Putnam。
- 工程计算类:Project Euler。
页面上标注了“Deprecated”的类别,说明该评测方式已被弃用,但历史结果仍可查看。
怎么用
适合这几类人:
- 想比较不同模型数学水平的研究者或开发者,直接看总榜和分赛事榜。
- 关注某个具体竞赛(如 IMO 2025、AIME 2026)的人,选对应比赛加载表格。
- 想核查模型答案的人,点击表格中的单元格可以看到模型的原始输出,判断它是真推理还是蒙对。
选择时看什么
如果你在意“模型有没有被题目污染”,优先看它标注的新近赛事和 ArXiv 类目;如果你关心模型能不能写严格证明,看 Proof-Based 那一组,而不是只看最终答案类的分数。两类分数含义不同,不能直接横向比较。
如何在MathArena上查看某个数学竞赛的模型排行榜?
在 MathArena 查看某个数学竞赛的模型排行榜,核心操作是:先选竞赛类别,再选具体赛事,页面会加载对应的模型成绩表。
操作步骤
- 进入 MathArena 的排行榜区域,页面会提示 “Select a competition to load leaderboard”。
- 从竞赛列表中选一个具体赛事,例如 AIME 2025、HMMT Feb 2025、IMO 2025、Putnam 2025 或 Project Euler。
- 选择后,页面会加载该竞赛的模型对比表;表格按模型列出成绩。
- 想看某个模型在某题上的原始输出,点击对应单元格即可查看 raw model output。
怎么选到想要的榜
MathArena 把数学评测分成几类,选的时候注意区分:
| 类别 | 包含内容 | 适合看什么 |
|---|---|---|
| ArXivMath / ArXivLean / BrokenArXiv | 按月份划分的 arXiv 相关评测 | 研究型数学与形式化证明能力 |
| Visual Math | Kangaroo 2025 各年级组 | 图形化、视觉数学题表现 |
| Final-Answer Comps | AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等 | 只看最终答案的竞赛题 |
| Proof-Based Comps | USAMO、IMO、IMC、Miklós Schweitzer、Putnam | 需要写证明的竞赛 |
| Project Euler | Project Euler 题目 | 编程与数学结合的解题能力 |
使用情境
- 想比较模型在奥赛证明题上的水平,选 Proof-Based Comps 下的 IMO 2025 或 USAMO 2025。
- 想快速看模型做标准竞赛选择题/填空题的能力,选 Final-Answer Comps 下的 AIME 2026 或 HMMT Feb 2026。
- 想追踪同一类评测随时间的变化,选带月份标签的 ArXivMath 或 BrokenArXiv 子项。
注意
页面中标注 “Deprecated” 的类别(如 Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler)仍可查看,但属于旧版分类;如果只想看当前主推的评测,优先选未标 Deprecated 的 ArXiv 系列和对应月份。
同类站点也可以对照参考,例如 LiveBench 侧重多领域综合评测,LMArena 侧重人类投票对战,而 MathArena 更专注数学竞赛与证明题。
MathArena中的“未污染基准测试”是什么意思?
“未污染基准测试”指的是:用来评测大模型的数学题,尽量没有提前出现在模型的训练数据里,或者至少能通过时间切分把“背过答案”与“真正解题”区分开。MathArena 的定位就是 Evaluating LLMs on Uncontaminated Math Benchmarks。
为什么需要它
大模型训练语料常包含历年竞赛题、题解和讨论。如果测试题早已在网上流传,模型可能靠记忆拿高分,而不是靠推理。未污染基准测试要减少这种“数据泄漏”带来的虚高。
MathArena 怎么做到
从页面证据看,它把评测按竞赛和时间切片组织,例如 AIME 2025、HMMT Feb 2025、USAMO 2025、IMO 2025、Putnam 2025、Project Euler 等,并标注 12/2025、01/2026、02/2026 这类时间。这样做的用途是:让同一模型在不同时间窗口、不同竞赛上的表现可比较,也便于观察新题是否真的构成挑战。
谁在什么情况下用
- 模型研究者:想验证模型在数学推理上的真实能力,而不是记忆能力。
- 评测发布者:需要一套相对干净、可追踪的竞赛题基准。
- 关注排行榜的人:看模型在 AIME、HMMT、IMO、USAMO、Putnam 等不同难度和题型上的差异。
使用时要注意
“未污染”不等于绝对干净。它更多是一种设计目标与时间控制手段。看结果时,建议结合具体竞赛、时间切片和题型一起判断,而不是只看 Overall 排名。
MathArena上各模型在不同数学竞赛中的表现如何对比?
MathArena 的核心用途就是在同一套数学竞赛题目上横向对比不同大模型的表现,并按竞赛类型、时间批次和榜单维度呈现结果。
它怎么组织对比
页面把题目分成几类评测集,每类下有具体竞赛或批次,可单独切换查看:
| 评测集 | 包含内容 |
|---|---|
| ArXivLean | 按 03/2026、06/2026 等时间批次 |
| BrokenArXiv | Overall 及 02/2026–08/2026 各月批次 |
| ArXivMath | Overall 及 12/2025–08/2026 各月批次 |
| Visual Math(已弃用) | Kangaroo 2025 各年级组(1-2 至 11-12) |
| Final-Answer Comps(已弃用) | AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等 |
| Proof-Based Comps(已弃用) | USAMO、IMO、IMC、Miklós Schweitzer、Putnam |
| Project Euler(已弃用) | Project Euler 题目 |
选择某个竞赛后会加载对应榜单和表格;点击单元格可以看到该模型的原始输出。
对比时能看出什么
- 同一模型在“最终答案题”和“证明题”上的表现往往不在一个水平,前者看答案对错,后者看推理与书写过程。
- 按时间批次(如 ArXivMath 的 12/2025 到 08/2026)看,能观察模型版本迭代带来的变化。
- Visual Math 面向 Kangaroo 这类带图形或分年级的题目,和纯文本竞赛的难度分布不同。
- 榜单按 Overall 与单场竞赛并列,适合先看总排名,再点进具体竞赛定位强弱项。
适合谁用
想选模型做数学推理任务的人,可以先用 Overall 榜筛出候选,再对照自己关心的竞赛类型(答案题还是证明题、是否含图)看细分成绩。关注模型进展的人,则适合按月份批次追踪同一模型在 ArXivMath、BrokenArXiv 上的走势。
使用建议
先确定你的任务更接近哪类评测集,再进入对应竞赛查看榜单;对某个分数存疑时,点开单元格看原始输出,判断是推理错误还是格式或表述问题。已标记为 Deprecated 的评测集仍可参考历史结果,但不宜作为当前能力的唯一依据。
MathArena为什么将某些竞赛类别标记为已弃用?
MathArena 把部分竞赛类别标为“已弃用”(Deprecated),是因为它的评测重心已经转向按时间切分、更不容易被训练数据污染的基准,而旧的分类方式不再作为主榜展示。
具体原因与表现
- 评测框架升级:MathArena 强调“Uncontaminated Math Benchmarks”,即用新近竞赛题来减少模型见过题目的可能。页面上的主榜已改为按时间维度组织,例如 ArXivMath 的 12/2025、01/2026 到 08/2026,以及 BrokenArXiv 的分月榜单。旧类别被归入 Deprecated,说明它们不再是当前主推的评测方式。
- 旧类别仍可查但不再主推:被标记的包括“👁️ Visual Math (Deprecated)”“🔢 Final-Answer Comps (Deprecated)”“✍️ Proof-Based Comps (Deprecated)”。这些类别下仍列有具体竞赛,如 Kangaroo 2025、AIME 2025、HMMT Feb 2025、USAMO 2025、IMO 2025、Putnam 2025、Project Euler 等,但入口被放在弃用区。
- 避免误导排名:当评测方法或题目新鲜度标准变化后,继续把旧类别与新版榜单并列,容易让读者把不同标准的成绩直接比较。标为弃用是一种提示:这些结果可以参考,但不应当作当前主榜结论。
对使用者的影响
如果你要判断某个模型当前的数学能力,优先看未标 Deprecated 的 ArXivMath、BrokenArXiv、ArXivLean 等按时间更新的榜单。若你关心的是特定竞赛本身,比如 IMO 2025 或 Putnam 2025,仍可在弃用区找到对应表格和原始模型输出,但要注意它们反映的是当时的评测口径。
MathArena的排行榜数据多久更新一次?
资料中没有给出固定的更新周期,只显示 MathArena 按比赛场次和月份组织榜单。例如 ArXivMath 下分列 12/2025、01/2026、02/2026……08/2026,BrokenArXiv 也按 02/2026 至 08/2026 分列,说明数据是按新增评测批次滚动补充,而不是每天或每周定时刷新。
什么时候会看到新数据
- 有新比赛或新评测集加入时:如 AIME 2026、HMMT Feb 2026、USAMO 2026 等条目出现,对应榜单会随之更新。
- 同一赛事有多个时间点时:ArXivMath、BrokenArXiv 会按月份分别列出,方便看模型在不同批次的成绩变化。
- 旧类别停止维护时:Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 被标为 Deprecated,这些榜单不再作为主要更新对象。
想确认最新状态
直接看页面顶部的 Overall 与最新月份列,通常能判断最近一次纳入的数据批次。若需要精确到某场比赛,选择对应比赛后查看表格即可;点击单元格还能看到原始模型输出。
用户评价(0)