所有评测
推理与知识竞赛数学
AIME 2025
使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。
10 次重复 pass@1%数值越高越好
评测要点
评测设置一览
01
题目数量
30 题
02
领域
代数、几何、数论、组合
03
答案格式
000–999 的整数表示
04
重复次数
每题 10 次
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
该竞赛面向高中数学拔尖学生,题目要求在没有选择项的情况下完成高难度计算与数学洞察。
2025 配置包含两套试卷的全部 30 道题,答案以严格的三位整数格式提交。
能力范围
能力范围
- 完成奥林匹克级代数、几何、数论和组合推理。
- 逐步推导并控制复杂计算的准确性。
- 从完整推理中提炼严格的整数最终答案。
测试设置
测试设置
- 运行 2025 年两套试卷共 30 道题,每题重复 10 次。
- 提示要求逐步求解,并把最终答案放入 LaTeX 的 boxed 标记中。
- 答案先由脚本和符号归一化检查,必要时再使用等价性判定作为后备。
运行流程
运行流程
- 逐题提交原始数学问题,模型生成推导并在 boxed 中给出最终答案。
- 提取数值答案并做符号归一化,再与标准整数答案比较。
- 脚本无法稳定判定时,只检查两个答案是否等价;每题共运行 10 次。
计分方式
计分方式
- 每次回答按首答是否正确记为 pass@1,不因后续修正追加尝试。
- 最终分数汇总 30 道题各 10 次运行的正确比例。
结果呈现
结果呈现
- 主指标为重复运行后的平均正确率。
- 同时报告输入、推理、答案 Token 与评测成本。
解读限制
解读限制
- 固定年份只有 30 道题,单题波动会明显影响总分。
- 严格数值格式可能让数学思路正确但最终表达不合规的回答失分。
- 重复 10 次用于观察输出方差,不能代表更长时间或其他年份的竞赛表现。
示例任务
进位制整除问题
求所有大于 9 的整数进位制 b,使以 b 为底的两位数 17 能整除两位数 97,并计算所有这类 b 的和。
成功条件
- 给出可核对的逐步数学推导。
- 最终结果是有效整数,并放在 boxed 标记中。