网站资料 · 技术情报 · 相似站点

matharena.ai

暂未发现付费内容

分类: AI工具

MathArena: Evaluating LLMs on Uncontaminated Math Benchmarks

访问网站

更新时间:2026-10-06 10:57 语言:未知(默认) 网站访问:正常

站内浏览 3 次 访问跳转 0 次
MathArena 首页完整截图
编辑评测

网站深度测评

MathArena是什么网站?

MathArena 是一个评测大语言模型数学能力的公开基准网站,重点放在“未被污染”的数学题目上:用较新的竞赛题和论文题来检验模型是真会做数学,还是只记住了训练数据里的答案。

它评测什么

按竞赛来源和题型分成几类,可以在页面上按比赛切换查看榜单:

  • ArXiv 系列:ArXivLean、BrokenArXiv、ArXivMath,取材自论文相关数学内容。
  • 视觉数学:Visual Math,题目含图,例如 Kangaroo 袋鼠竞赛各年级组。
  • 只写最终答案的竞赛:AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等。
  • 需要写证明的竞赛:USAMO、IMO、IMC、Miklós Schweitzer、Putnam。
  • 工程计算类:Project Euler。

页面上标注了“Deprecated”的类别,说明该评测方式已被弃用,但历史结果仍可查看。

怎么用

适合这几类人:

  • 想比较不同模型数学水平的研究者或开发者,直接看总榜和分赛事榜。
  • 关注某个具体竞赛(如 IMO 2025、AIME 2026)的人,选对应比赛加载表格。
  • 想核查模型答案的人,点击表格中的单元格可以看到模型的原始输出,判断它是真推理还是蒙对。

选择时看什么

如果你在意“模型有没有被题目污染”,优先看它标注的新近赛事和 ArXiv 类目;如果你关心模型能不能写严格证明,看 Proof-Based 那一组,而不是只看最终答案类的分数。两类分数含义不同,不能直接横向比较。

如何在MathArena上查看某个数学竞赛的模型排行榜?

在 MathArena 查看某个数学竞赛的模型排行榜,核心操作是:先选竞赛类别,再选具体赛事,页面会加载对应的模型成绩表。

操作步骤

  1. 进入 MathArena 的排行榜区域,页面会提示 “Select a competition to load leaderboard”。
  2. 从竞赛列表中选一个具体赛事,例如 AIME 2025、HMMT Feb 2025、IMO 2025、Putnam 2025 或 Project Euler。
  3. 选择后,页面会加载该竞赛的模型对比表;表格按模型列出成绩。
  4. 想看某个模型在某题上的原始输出,点击对应单元格即可查看 raw model output。

怎么选到想要的榜

MathArena 把数学评测分成几类,选的时候注意区分:

类别 包含内容 适合看什么
ArXivMath / ArXivLean / BrokenArXiv 按月份划分的 arXiv 相关评测 研究型数学与形式化证明能力
Visual Math Kangaroo 2025 各年级组 图形化、视觉数学题表现
Final-Answer Comps AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等 只看最终答案的竞赛题
Proof-Based Comps USAMO、IMO、IMC、Miklós Schweitzer、Putnam 需要写证明的竞赛
Project Euler Project Euler 题目 编程与数学结合的解题能力

使用情境

  • 想比较模型在奥赛证明题上的水平,选 Proof-Based Comps 下的 IMO 2025 或 USAMO 2025。
  • 想快速看模型做标准竞赛选择题/填空题的能力,选 Final-Answer Comps 下的 AIME 2026 或 HMMT Feb 2026。
  • 想追踪同一类评测随时间的变化,选带月份标签的 ArXivMath 或 BrokenArXiv 子项。

注意

页面中标注 “Deprecated” 的类别(如 Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler)仍可查看,但属于旧版分类;如果只想看当前主推的评测,优先选未标 Deprecated 的 ArXiv 系列和对应月份。

同类站点也可以对照参考,例如 LiveBench 侧重多领域综合评测,LMArena 侧重人类投票对战,而 MathArena 更专注数学竞赛与证明题。

MathArena中的“未污染基准测试”是什么意思?

“未污染基准测试”指的是:用来评测大模型的数学题,尽量没有提前出现在模型的训练数据里,或者至少能通过时间切分把“背过答案”与“真正解题”区分开。MathArena 的定位就是 Evaluating LLMs on Uncontaminated Math Benchmarks。

为什么需要它

大模型训练语料常包含历年竞赛题、题解和讨论。如果测试题早已在网上流传,模型可能靠记忆拿高分,而不是靠推理。未污染基准测试要减少这种“数据泄漏”带来的虚高。

MathArena 怎么做到

从页面证据看,它把评测按竞赛和时间切片组织,例如 AIME 2025、HMMT Feb 2025、USAMO 2025、IMO 2025、Putnam 2025、Project Euler 等,并标注 12/2025、01/2026、02/2026 这类时间。这样做的用途是:让同一模型在不同时间窗口、不同竞赛上的表现可比较,也便于观察新题是否真的构成挑战。

谁在什么情况下用

  • 模型研究者:想验证模型在数学推理上的真实能力,而不是记忆能力。
  • 评测发布者:需要一套相对干净、可追踪的竞赛题基准。
  • 关注排行榜的人:看模型在 AIME、HMMT、IMO、USAMO、Putnam 等不同难度和题型上的差异。

使用时要注意

“未污染”不等于绝对干净。它更多是一种设计目标与时间控制手段。看结果时,建议结合具体竞赛、时间切片和题型一起判断,而不是只看 Overall 排名。

MathArena上各模型在不同数学竞赛中的表现如何对比?

MathArena 的核心用途就是在同一套数学竞赛题目上横向对比不同大模型的表现,并按竞赛类型、时间批次和榜单维度呈现结果。

它怎么组织对比

页面把题目分成几类评测集,每类下有具体竞赛或批次,可单独切换查看:

评测集 包含内容
ArXivLean 按 03/2026、06/2026 等时间批次
BrokenArXiv Overall 及 02/2026–08/2026 各月批次
ArXivMath Overall 及 12/2025–08/2026 各月批次
Visual Math(已弃用) Kangaroo 2025 各年级组(1-2 至 11-12)
Final-Answer Comps(已弃用) AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等
Proof-Based Comps(已弃用) USAMO、IMO、IMC、Miklós Schweitzer、Putnam
Project Euler(已弃用) Project Euler 题目

选择某个竞赛后会加载对应榜单和表格;点击单元格可以看到该模型的原始输出。

对比时能看出什么

  • 同一模型在“最终答案题”和“证明题”上的表现往往不在一个水平,前者看答案对错,后者看推理与书写过程。
  • 按时间批次(如 ArXivMath 的 12/2025 到 08/2026)看,能观察模型版本迭代带来的变化。
  • Visual Math 面向 Kangaroo 这类带图形或分年级的题目,和纯文本竞赛的难度分布不同。
  • 榜单按 Overall 与单场竞赛并列,适合先看总排名,再点进具体竞赛定位强弱项。

适合谁用

想选模型做数学推理任务的人,可以先用 Overall 榜筛出候选,再对照自己关心的竞赛类型(答案题还是证明题、是否含图)看细分成绩。关注模型进展的人,则适合按月份批次追踪同一模型在 ArXivMath、BrokenArXiv 上的走势。

使用建议

先确定你的任务更接近哪类评测集,再进入对应竞赛查看榜单;对某个分数存疑时,点开单元格看原始输出,判断是推理错误还是格式或表述问题。已标记为 Deprecated 的评测集仍可参考历史结果,但不宜作为当前能力的唯一依据。

MathArena为什么将某些竞赛类别标记为已弃用?

MathArena 把部分竞赛类别标为“已弃用”(Deprecated),是因为它的评测重心已经转向按时间切分、更不容易被训练数据污染的基准,而旧的分类方式不再作为主榜展示。

具体原因与表现

  • 评测框架升级:MathArena 强调“Uncontaminated Math Benchmarks”,即用新近竞赛题来减少模型见过题目的可能。页面上的主榜已改为按时间维度组织,例如 ArXivMath 的 12/2025、01/2026 到 08/2026,以及 BrokenArXiv 的分月榜单。旧类别被归入 Deprecated,说明它们不再是当前主推的评测方式。
  • 旧类别仍可查但不再主推:被标记的包括“👁️ Visual Math (Deprecated)”“🔢 Final-Answer Comps (Deprecated)”“✍️ Proof-Based Comps (Deprecated)”。这些类别下仍列有具体竞赛,如 Kangaroo 2025、AIME 2025、HMMT Feb 2025、USAMO 2025、IMO 2025、Putnam 2025、Project Euler 等,但入口被放在弃用区。
  • 避免误导排名:当评测方法或题目新鲜度标准变化后,继续把旧类别与新版榜单并列,容易让读者把不同标准的成绩直接比较。标为弃用是一种提示:这些结果可以参考,但不应当作当前主榜结论。

对使用者的影响

如果你要判断某个模型当前的数学能力,优先看未标 Deprecated 的 ArXivMath、BrokenArXiv、ArXivLean 等按时间更新的榜单。若你关心的是特定竞赛本身,比如 IMO 2025 或 Putnam 2025,仍可在弃用区找到对应表格和原始模型输出,但要注意它们反映的是当时的评测口径。

MathArena的排行榜数据多久更新一次?

资料中没有给出固定的更新周期,只显示 MathArena 按比赛场次和月份组织榜单。例如 ArXivMath 下分列 12/2025、01/2026、02/2026……08/2026,BrokenArXiv 也按 02/2026 至 08/2026 分列,说明数据是按新增评测批次滚动补充,而不是每天或每周定时刷新。

什么时候会看到新数据

  • 有新比赛或新评测集加入时:如 AIME 2026、HMMT Feb 2026、USAMO 2026 等条目出现,对应榜单会随之更新。
  • 同一赛事有多个时间点时:ArXivMath、BrokenArXiv 会按月份分别列出,方便看模型在不同批次的成绩变化。
  • 旧类别停止维护时:Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 被标为 Deprecated,这些榜单不再作为主要更新对象。

想确认最新状态

直接看页面顶部的 Overall 与最新月份列,通常能判断最近一次纳入的数据批次。若需要精确到某场比赛,选择对应比赛后查看表格即可;点击单元格还能看到原始模型输出。

MathArena 是什么?它如何评测大语言模型的数学能力

MathArena 是一个用未被污染的数学基准来评测大语言模型(LLM)的网站。它把评测拆成多个板块,按比赛、时间版本和模型组织成排行榜,适合想比较不同模型在真实数学竞赛和论文题目上表现的人。它的核心价值在于"未污染":题目来自竞赛和论文,模型很难在训练阶段提前见过答案,因此分数更能反映真实的推理能力,而不是记忆能力。

评测覆盖哪些数学内容

MathArena 的板块按题目类型和来源划分,从小学竞赛到研究级论文都有:

  • ArXiv 相关:ArXivLean、BrokenArXiv、ArXivMath,面向论文和形式化数学内容,按月份版本(如 02/2026、03/2026)组织。
  • 可视化数学(Visual Math):Kangaroo 2025 的 1-2 到 11-12 年级分组,题目带图形。
  • 最终答案竞赛(Final-Answer Comps):AIME 2025/2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、BRUMO 2025、SMT 2025、CMIMC 2025、Apex、Apex Shortlist 等,只看最终答案对错。
  • 证明题竞赛(Proof-Based Comps):USAMO 2025/2026、IMO 2025、IMC 2025、Miklós Schweitzer 2025、Putnam 2025,需要完整证明。
  • Project Euler:编程与数学结合的题目。

这些板块覆盖了从 Kangaroo(袋鼠数学)到 Putnam、IMO 的完整难度梯度,读者可以按自己关心的难度层选择。

排行榜怎么读

排行榜的读法有三个维度,理解它们才能正确解读分数:

  1. 按比赛选择:页面提示"Select a competition to load leaderboard",先选具体比赛(如 AIME 2025 或 IMO 2025),才会加载对应榜单。
  2. 按时间版本:同一类比赛有多个时间切片。例如 ArXivMath 有 12/2025 到 08/2026 的逐月版本,还有 Overall 汇总。时间版本的意义在于,新题目会持续加入,避免模型靠旧数据刷分。
  3. 按模型查看得分:每个单元格是一个模型在该比赛上的成绩。点击单元格可以看到该模型的原始输出,这是 MathArena 比较实用的一点——分数之外还能看到模型实际写了什么,判断它是真推理还是碰运气。

读榜时要注意:不同板块的分数不可直接横向比较。最终答案题只看结果,证明题看过程,两者的评分逻辑不同。

哪些板块已标记为 Deprecated

页面中多个板块带有 Deprecated(已弃用) 标记,包括:

  • 👁️ Visual Math (Deprecated)
  • 🔢 Final-Answer Comps (Deprecated)
  • ✍️ Proof-Based Comps (Deprecated)
  • 💻 Project Euler (Deprecated)

这意味着这些板块可能不再更新,或已被新的组织方式取代。解读结果时要注意:Deprecated 板块的历史分数仍可参考,但不代表当前最新的评测状态。如果你要比较模型的最新能力,应优先看未标记弃用的板块(如 ArXiv 系列和当前的竞赛分组)。

适合谁用

  • 想了解某个 LLM 在真实数学竞赛上表现的研究者或开发者。
  • 需要按难度层(小学竞赛到研究级)筛选模型能力的选型者。
  • 想查看模型原始输出、判断推理质量的人。

使用时先明确你要看的是哪类题(最终答案还是证明)、哪个时间版本,再点进单元格看原始输出,这样得到的结论才可靠。

AI 在数字生活里到底能做什么?普通人可以从哪些场景开始用

AI 在数字生活里的实际用途,可以归为四类:把零散信息整理成可用结构、把初稿或素材快速做出来、把重复操作交给自动化、把选择范围缩小到可比较的几项。适合普通人的起点不是学完所有工具,而是挑一个每周都会遇到的高频任务,先让 AI 参与其中一环,再判断它是否值得长期留在流程里。涉及事实核对、隐私数据和最终决策的环节,仍需要自己把关。

四个最常见的日常场景

信息整理:从一堆材料到一份可读的笔记

典型任务:把会议记录、网页摘录、聊天记录汇总成要点,或把长文压缩成可执行的清单。

适合交给 AI 的部分是归类和压缩:让它按主题分组、提取待办、标出重复内容。不适合直接采信的是它补出来的细节——如果原文没写,AI 可能用看起来合理的说法填上。做法是要求它只基于你给的文本输出,并保留原文出处,自己再抽查几条。

写作与表达:把初稿这一步变快

典型任务:写邮件、写说明、把口语化的想法改成正式表达、给同一段内容换几种语气。

AI 在这里的价值是提供可修改的起点,而不是最终稿。有效用法是先给它明确的读者、目的和长度,再让它给两三个不同版本供你挑。判断标准很简单:改起来比自己从零写快,就继续用;改的时间超过自己写,就说明这个任务不适合交给它。

图像与素材处理:处理已有素材,而不是凭空生成

典型任务:抠图、去背景、放大低清图、给图片配文字说明、把截图整理成演示用图。

这类任务的预期结果比较直观,容易验证,适合作为入门场景。需要注意的是生成类图像在文字、手部、细节一致性上仍容易出错,用于正式场合前要逐张检查。

自动化:把重复操作串起来

典型任务:定时汇总信息、批量重命名、把某个来源的新内容自动整理成固定格式。

自动化的门槛比前三个场景高,因为它要求流程本身是稳定的。建议先把流程手动跑通两三遍,确认每一步的输入输出都清楚,再考虑交给工具执行。流程没稳定就自动化,出问题时更难定位。

哪些任务适合交给 AI,哪些要自己把关

任务特征 建议
有明确输入、结果容易验证 适合交给 AI,例如改写、归类、格式转换
需要事实准确、涉及具体数字或条款 AI 只做初筛,结论自己核对原始来源
涉及个人隐私、账号、未公开资料 不输入,或先去掉可识别信息
需要承担后果的决定 AI 提供选项和理由,决定自己做
流程本身还没跑通 先手动跑通,再考虑自动化

一个实用的判断方法是问自己:如果 AI 给的结果错了,我能不能在几分钟内发现?能发现,就可以放心让它先做;发现不了,就要么换任务,要么加上核对步骤。

用 AI 辅助筛选数字工具,减少选择成本

工具太多、挑不过来,是数字生活里很常见的消耗。AI 可以在这件事上帮上忙,但用法有讲究。

有效的做法是先把条件说清楚,再让它按条件筛:

  • 说明你的使用场景和频率,比如“每周用两三次,主要处理表格”
  • 说明限制条件,比如设备、是否愿意付费、是否需要多人协作
  • 要求它给出对比维度,而不是直接推荐一个名字
  • 让它说明每个选项在什么条件下更合适

这样得到的是一份可比较的清单,而不是一个结论。最终判断仍要回到自己的实际使用:先用一两个候选跑一遍真实任务,比看十篇评测更快。

开始时的三个注意点

隐私:把资料交给任何工具前,先去掉姓名、联系方式、账号、未公开的业务信息。不确定对方怎么处理数据时,就当它会被留存。

准确性:AI 的输出在语言流畅度和正确性之间没有必然关系。越是具体的事实、数字、引用,越要回到原始来源确认。

依赖:如果某个环节离开 AI 就完全做不下去,说明你把判断力也交出去了。保留自己动手做一遍的能力,尤其是在你最常使用的那一两个场景里。

从哪个场景开始

选一个你每周至少遇到一次、结果容易验证、不涉及敏感信息的任务,让 AI 参与其中一环,连续用两周。两周后回看:它省下的时间是否稳定,出错时你是否能及时发现。两个答案都是肯定的,再考虑扩展到下一个场景。一次只加一个,比同时铺开五六个工具更容易判断哪个真正有用。

MathArena 如何用各类数学竞赛题评测大语言模型的数学能力

MathArena 是一个用未被污染的数学竞赛基准来评测大语言模型(LLM)数学能力的平台。它把 AIME、HMMT、IMO、USAMO、Putnam、Project Euler 等竞赛题目组织成多个基准,按竞赛、时间、模型维度展示排行榜,并允许点击单元格查看模型的原始输出。如果你想判断某个模型在"真正的竞赛数学"上表现如何,而不是在可能已进入训练数据的旧题上刷分,MathArena 的价值就在于它强调基准的未污染性——用较新的竞赛题来降低模型"背过答案"的可能。

评测目标:为什么强调"未污染"

大语言模型在训练中会吸收大量公开文本,很多经典数学题(尤其是流传多年的竞赛题)很可能已经出现在训练语料里。这会导致模型在旧基准上分数虚高,却未必具备真正的推理能力。

MathArena 的做法是持续引入较新的竞赛题作为基准,例如 AIME 2025、AIME 2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、USAMO 2025、USAMO 2026、IMO 2025、Putnam 2025 等。这些题目在模型训练截止时间之后才公开,因此更能反映模型面对新问题时的真实数学能力。

两类竞赛的评测方式差异

MathArena 把竞赛基准分成两大类,评测方式不同:

类型 代表竞赛 评测重点 判定方式
Final-Answer Comps(最终答案类) AIME、HMMT、BRUMO、SMT、CMIMC、Apex 能否算出正确答案 比对最终答案
Proof-Based Comps(证明类) USAMO、IMO、IMC、Miklós Schweitzer、Putnam 能否写出完整严谨的证明 评估证明过程

最终答案类的题目有唯一数值或表达式答案,评测相对直接:模型给出答案,与标准答案比对即可。AIME 这类题目答案通常是 0–999 的整数,判定清晰。

证明类的题目没有唯一答案,需要评估证明的逻辑完整性、严谨性和正确性。这类评测更难自动化,通常需要更复杂的评判方式(如人工评审或专门的评判模型)。这也是为什么 MathArena 把两类分开呈现——它们的分数不能直接横向比较。

专项基准分别考察什么

除了按竞赛划分,MathArena 还提供几个专项基准,针对不同的数学能力维度:

  • ArXivMath:按时间(12/2025、01/2026 至 08/2026 等)组织的基准,考察模型处理学术数学问题的能力。
  • BrokenArXiv:同样按时间划分(02/2026 至 08/2026 等),名称暗示其可能涉及"有缺陷"或"需要纠错"的数学内容,考察模型识别和处理问题缺陷的能力。
  • Visual Math:视觉数学基准,包含 Kangaroo 2025 各年级(1-2、3-4、5-6、7-8、9-10、11-12),考察模型处理带图形或视觉信息的数学题的能力。
  • Project Euler:编程与数学结合的题目,考察模型用计算方法解决数学问题的能力。

这些专项基准让你可以针对特定能力维度(学术数学、视觉数学、计算数学)查看模型表现,而不只是看综合竞赛分数。

如何查看排行榜与模型输出

MathArena 的界面围绕"选择竞赛 → 加载表格/排行榜"的逻辑组织:

  1. 选择竞赛:从下拉菜单选择你想看的竞赛或基准,例如 AIME 2026、IMO 2025、Project Euler 等。
  2. 查看排行榜:选定后加载对应的排行榜,展示各模型在该竞赛上的得分。
  3. 查看原始输出:点击单元格可以看到该模型在该题上的原始输出。这是理解模型"为什么得分/失分"的关键——分数只是结果,原始输出能让你看到模型的推理过程、是否跳步、是否在最后一步算错。

按时间维度,你可以对比同一模型在不同年份竞赛上的表现,观察其能力是否随版本更新而提升。

Deprecated 分类的含义

MathArena 中多个分类标注了 (Deprecated),包括:

  • 👁️ Visual Math (Deprecated)
  • 🔢 Final-Answer Comps (Deprecated)
  • ✍️ Proof-Based Comps (Deprecated)
  • 💻 Project Euler (Deprecated)

Deprecated 意味着这些分类已被弃用,平台可能已用新的组织方式替代它们。但弃用不等于数据无价值——这些分类下仍保留了具体竞赛的结果(如 Visual Math 下的 Kangaroo 2025 各年级、Final-Answer Comps 下的 AIME 2025/HMMT Feb 2025 等、Proof-Based Comps 下的 USAMO 2025/IMO 2025/Putnam 2025 等、Project Euler 下的题目视图)。

参考这些旧分类时需要注意:它们反映的是当时的评测口径,可能与当前基准的组织方式或判定标准不同,因此不宜与最新结果直接混用比较。把它们当作历史参考更合适。

使用建议

  • 想看模型真实数学能力:优先看较新的竞赛(AIME 2026、HMMT Feb 2026、USAMO 2026 等),污染风险更低。
  • 想比较不同能力维度:最终答案类看解题正确率,证明类看证明质量,两者分开评估。
  • 想理解分数背后的原因:点击单元格查看原始输出,比只看分数更有信息量。
  • 看到 Deprecated 分类:可以查看历史数据,但注意评测口径可能已变化,不要与当前结果直接对比。
Pedagoguery Software 的 Macintosh 与 Windows 数学软件:有哪些、怎么试用和购买

Pedagoguery Software 是一家自 1988 年起持续开发数学与几何类软件的公司,当前产品面向 Macintosh 和 Windows 电脑。根据其官网信息,你可以通过网站导航栏或页面链接查看当前产品、下载评估版(evaluation copies)、查看价格与购买方式,以及书籍推荐。官网列出的当前产品名称包括 GrafEq、Poly、Poly Pro、Tess、COGS 等,早期产品则针对 Apple // 和 IBM PC 兼容机。

当前面向 Macintosh 和 Windows 的产品

官网“Overview of Products”及页面链接中出现的产品名称如下:

产品 说明
GrafEq 官网当前产品之一
Poly 官网当前产品之一
Poly Pro 官网当前产品之一
Tess 官网当前产品之一
COGS 官网当前产品之一

官网明确说明“current software products are for Macintosh and Windows computers”,即当前产品同时面向这两个平台。但页面证据中并未逐个列出每个产品具体支持哪些平台版本、系统要求或功能细节,因此无法在此确认某一款软件是否同时提供 Mac 与 Windows 两个版本,需要进入对应产品页面查看。

早期产品(GrafEq、Tickedy-Boo、Z80 CP/M Turbo Enhancer、Vector Nector 面向 Apple //;Sin ’n Conics 面向 IBM PC 兼容机)属于历史产品,不代表当前可获取的版本。

如何下载试用版

官网提供了下载评估版(evaluation copies)的入口,路径为网站导航栏或页面中的下载链接。

操作思路:

  1. 打开 peda.com。
  2. 使用导航栏(需启用 JavaScript 才能使用导航菜单)或页面正文中的链接。
  3. 进入下载区域,获取你所需产品的评估版。
  4. 按产品页面说明安装并试用。

预期结果:获得该软件的评估副本,用于在购买前体验功能。官网未在证据中说明评估版的功能限制、试用期限或是否需注册,这些需以产品页面实际说明为准。

如何查看价格与购买

官网设有“Prices & Purchasing”入口,用于查看价格和购买相关信息。

  1. 在导航栏或页面链接中找到“Prices & Purchasing”。
  2. 查看各产品的价格与购买方式。
  3. 官网还提供书籍推荐(book recommendations),可与软件一并参考。

需要注意:页面证据中未列出具体价格数字、支付平台或购买流程细节,因此无法在此给出金额或支付方式。价格与购买条件请以“Prices & Purchasing”页面的实时内容为准。

政策与许可

官网提供“policies and licenses”链接,可查看公司的政策与授权条款。购买或部署前建议先阅读该部分,确认授权范围。

联系与背景信息

如需进一步咨询,官网给出的联系方式:

  • 邮箱:[email protected]
  • 语音留言:604 629 7589
  • 传真:778 373 4963
  • 邮寄地址:Pedagoguery Software Inc., 4446 Lazelle Ave., Terrace, B.C. V8G 1R8, Canada

公司自 1988 年起开发软件,早期产品覆盖 Apple // 与 IBM PC 兼容机,当前产品线转向 Macintosh 和 Windows。

常见卡点

  • 导航菜单依赖 JavaScript:官网提示“To use the navigation menus, enable JavaScript”,若菜单无法展开,请检查浏览器是否启用了 JavaScript,或改用页面正文中的链接。
  • 平台确认:官网只说明当前产品面向 Macintosh 和 Windows,未逐款标注,下载前请在对应产品页确认你的系统是否受支持。
  • 价格与试用限制未在首页证据中给出:具体金额、试用期限、功能限制需进入“Prices & Purchasing”和产品页面查看。
MathArena 的 Leaderboards 排行榜怎么看:按竞赛和模型比较 LLM 数学能力

MathArena 的 Leaderboards 是一组按数学竞赛和基准分类组织的模型成绩表,用来比较不同大语言模型在未被污染的数学题上的表现。它适合想知道“某个模型在 AIME、IMO、Putnam 这类具体竞赛上表现如何”的读者。使用方式是先在页面选择竞赛或基准类别,加载对应排行榜表格,再按模型逐项查看成绩;点击单元格还能看到该模型的原始输出。需要注意,页面中标注为 Deprecated(已弃用)的榜单属于旧分类,不应与当前主榜混用。

排行榜解决什么问题

MathArena 的定位是“用未被污染的数学基准评测 LLM”。排行榜把评测结果按竞赛来源和题型组织成可切换的表格,让读者能回答两类问题:

  • 同一个模型在不同竞赛上的表现差异有多大;
  • 同一场竞赛里,不同模型谁更强。

由于榜单按竞赛和时间段切分,它也能反映模型在特定年份、特定月份题目上的表现,而不是只给一个笼统的总分。

榜单的分类结构

从页面可见的选项看,Leaderboards 主要分为以下几类,每类下再按具体竞赛或时间段细分:

类别 说明 细分示例
ArXivLean 与 Lean 相关的 arXiv 基准 03/2026、06/2026
BrokenArXiv arXiv 基准的另一组切分 Overall 及各月份(02/2026–08/2026)
ArXivMath arXiv 数学基准 Overall 及 12/2025–08/2026 各月
👁️ Visual Math(已弃用) 视觉数学题 Overall,以及 Kangaroo 2025 各年级
🔢 Final-Answer Comps(已弃用) 只要求最终答案的竞赛 AIME、HMMT、BRUMO、SMT、CMIMC、Apex 等
✍️ Proof-Based Comps(已弃用) 要求写证明的竞赛 USAMO、IMO、IMC、Miklós Schweitzer、Putnam
💻 Project Euler(已弃用) 编程数学题 Project Euler

其中 Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 都带有 Deprecated 标记,说明这些是旧分类。当前主榜应优先看 ArXivLean、BrokenArXiv、ArXivMath 这类未标注弃用的类别。

如何按竞赛和时间段筛选

页面提供“Choose competition”选择器,可选的竞赛覆盖多个层级:

  • 入门与年级类:Kangaroo 2025 的 1-2、3-4、5-6、7-8、9-10、11-12 各年级组;
  • 高中竞赛类:AIME 2025、AIME 2026、HMMT Feb 2025、HMMT Nov 2025、HMMT Feb 2026、BRUMO 2025、SMT 2025、CMIMC 2025、Apex、Apex Shortlist;
  • 高阶证明类:USAMO 2025、USAMO 2026、IMO 2025、IMC 2025、Miklós Schweitzer 2025、Putnam 2025;
  • 编程类:Project Euler。

时间维度上,ArXivMath 和 BrokenArXiv 都按月份切分(如 12/2025、01/2026 一直到 08/2026),并各自提供 Overall 汇总。这样既能看单月表现,也能看整体表现。

操作步骤

  1. 打开 MathArena 的 Leaderboards 区域。
  2. 在“Choose competition”中选择想看的竞赛或基准类别。
  3. 页面加载对应的排行榜表格(未选择时提示“Select a competition to load tables / leaderboard”)。
  4. 在表格中按模型查看成绩,横向比较不同模型。
  5. 点击某个单元格,查看该模型在这道题上的原始输出,判断它是真解出来还是碰巧答对。

常见卡点

  • 把已弃用榜单当主榜:Visual Math、Final-Answer Comps、Proof-Based Comps、Project Euler 都标了 Deprecated,比较当前模型能力时应优先用未弃用的类别。
  • 忽略时间切分:同一类别下不同月份的题目不同,跨月直接比分数可能不公平,需要看清是 Overall 还是单月。
  • 只看总分不看原始输出:点击单元格能看到模型原始输出,这是判断模型是否真正理解题目的关键,只看分数容易高估。
  • 未选竞赛时页面为空:表格和排行榜都需要先选择竞赛才会加载,看到空白提示属于正常状态。

网站信息概览

现有迹象表明,页面指纹和 HTTP 信息共同暴露了实现方式;即使暂未命中已知漏洞,这些线索也可能提高针对性探测的效率。依据当前可见线索,多项搜索或分享字段同时缺失时,平台可能自行截取标题、正文和图片,最终展示更不稳定,也可能削弱用户的点击判断。

域名与注册信息

域名处于正常锁定状态,可降低未经授权转移的风险。该域名已有约 1 年注册历史,仍需结合当前配置判断。依据当前可见线索,域名由 NameCheap, Inc. 管理,可通过其标准渠道处理注册事务。注册联系信息在 RDAP 中可见,公开透明度较高。该网站采用常见域名后缀 .ai。

DNS 与邮件配置

SPF、DKIM、DMARC 未全部覆盖,缺项为 DMARC。现有迹象表明,名称服务器由 Namecheap 提供,使用专业 DNS 托管。从当前可见信息判断,MX 记录使用 registrar-servers.com 企业邮箱服务。该主机名未使用别名记录。当前未检测到 DNSSEC 签名。

TLS 与证书

证书公钥采用 EC 256 位算法。服务器返回了完整证书链。证书未包含组织名称,按现有字段归为 DV 域名验证证书。依据当前可见线索,当前证书颁发者为 Let's Encrypt。证书总有效期约 89 天,符合短周期自动续期模式。

HTTP 响应

Server 响应头暴露了具体软件版本:nginx/1.18.0 (Ubuntu)。未检测到常用浏览器安全响应头。HTTP 头没有直接暴露后端框架。HTTP 字段未显示敏感内部网络标识。HTTP 响应没有提供边缘代理证据。

技术栈分析

从当前可见信息判断,从公开特征看,网站大概率由 jQuery、nginx 1.18.0 等组件支撑,且精确版本暴露数量为 1。这类信息会减少外部人员识别技术环境所需的试探步骤。

SEO 与社交分享

页面缺少描述标签,搜索平台可能自行截取正文。首页未检测到 Canonical 规范链接。OG 信息可用但未覆盖全部核心字段。Twitter/X 分享卡片信息可用。页面标题长度为 9 个字符,处于常用展示范围。

主机和电子邮件

DNSNamecheap
主机Hetzner Online GmbH
电子邮件registrar-servers.com
位置 Germany 国旗Nuremberg, Bavaria, Germany 116.203.195.153

用户评价(0)

  • 暂无评价。

页面、搜索与分享信息

页面描述未检测到
规范链接未检测到
语言未知(默认)
Twitter Cardsummary_large_image

社交分享预览

12 个字段

未发现 robots.txt

暂未发现 Sitemaps

域名登记事实 RDAP / WHOIS

注册商NameCheap, Inc.
注册时间2025-02-05
到期时间2027-02-05
域名状态client transfer prohibited
名称服务器dns1.registrar-servers.com、dns2.registrar-servers.com
DNSSECunsigned

DNS 记录

类型名称值TTL优先级
Amatharena.ai116.203.195.1531799—
MXmatharena.aieforward1.registrar-servers.com180010
MXmatharena.aieforward2.registrar-servers.com180010
MXmatharena.aieforward3.registrar-servers.com180010
MXmatharena.aieforward4.registrar-servers.com180015
MXmatharena.aieforward5.registrar-servers.com180020
NSmatharena.aidns1.registrar-servers.com1800—
NSmatharena.aidns2.registrar-servers.com1800—
TXTmatharena.aiv=spf1 include:spf.efwd.registrar-servers.com ~all1800—

TLS 与证书

定性结果配置正常
支持协议TLSv1.2、TLSv1.3
协商协议TLSv1.3
证书主题matharena.ai
颁发者Let's Encrypt
有效期至2027-01-01T19:06 · 记录时剩余 87 天
验证事实证书信任:通过 · 域名匹配:通过

HTTP 响应标头

标头值
content-typetext/html; charset=utf-8
servernginx/1.18.0 (Ubuntu)

已识别技术

jQuerynginx 1.18.0