所有评测
推理与知识竞赛数学

AIME 2025

使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。

10 次重复 pass@1%数值越高越好

评测要点

评测设置一览

01
题目数量
30 题
02
领域
代数、几何、数论、组合
03
答案格式
000–999 的整数表示
04
重复次数
每题 10 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

该竞赛面向高中数学拔尖学生,题目要求在没有选择项的情况下完成高难度计算与数学洞察。

2025 配置包含两套试卷的全部 30 道题,答案以严格的三位整数格式提交。

能力范围

  • 完成奥林匹克级代数、几何、数论和组合推理。
  • 逐步推导并控制复杂计算的准确性。
  • 从完整推理中提炼严格的整数最终答案。

测试设置

  • 运行 2025 年两套试卷共 30 道题,每题重复 10 次。
  • 提示要求逐步求解,并把最终答案放入 LaTeX 的 boxed 标记中。
  • 答案先由脚本和符号归一化检查,必要时再使用等价性判定作为后备。

运行流程

  • 逐题提交原始数学问题,模型生成推导并在 boxed 中给出最终答案。
  • 提取数值答案并做符号归一化,再与标准整数答案比较。
  • 脚本无法稳定判定时,只检查两个答案是否等价;每题共运行 10 次。

计分方式

  • 每次回答按首答是否正确记为 pass@1,不因后续修正追加尝试。
  • 最终分数汇总 30 道题各 10 次运行的正确比例。

结果呈现

  • 主指标为重复运行后的平均正确率。
  • 同时报告输入、推理、答案 Token 与评测成本。

解读限制

  • 固定年份只有 30 道题,单题波动会明显影响总分。
  • 严格数值格式可能让数学思路正确但最终表达不合规的回答失分。
  • 重复 10 次用于观察输出方差,不能代表更长时间或其他年份的竞赛表现。

示例任务

进位制整除问题

求所有大于 9 的整数进位制 b,使以 b 为底的两位数 17 能整除两位数 97,并计算所有这类 b 的和。

成功条件

  • 给出可核对的逐步数学推导。
  • 最终结果是有效整数,并放在 boxed 标记中。