所有评测
推理与知识多学科
MMLU-Pro
以 12,032 道、14 个学科领域的十选一研究生级问题,检验高级知识、理解与更深层推理。
pass@1 正确率%数值越高越好
评测要点
评测设置一览
01
题目数量
12,032 题
02
学科数量
14 个领域
03
答案形式
10 个选项(A–J)
04
重复次数
每题 1 次
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
原有多学科选择题评测逐渐接近饱和,MMLU-Pro 扩充到十个选项并删除简单或噪声题,更强调推理而非单纯知识回忆。
实验显示,相比原版本,模型准确率下降 16%–33%;在 24 种提示风格下,分数波动从 4%–5% 降至约 2%。
能力范围
能力范围
- 跨 14 个学科调用高阶知识并完成多步推理。
- 在十个相近选项中辨别正确结论。
- 按严格格式提炼并提交最终选择。
测试设置
测试设置
- 运行全部 12,032 道十选一题,每题只运行 1 次。
- 提示要求最后一行使用“Answer: A/B/C/D/E/F/G/H/I/J”格式。
- 评测为文本多项选择,不开放工具调用。
运行流程
运行流程
- 向模型提交问题与 A–J 十个选项并收集完整回答。
- 先提取单字母或“Answer: X”,失败时依次检查 boxed、自然语言、选项行和结尾字母等格式。
- 存在自我修正时取最后一次匹配,再与标准选项比较。
计分方式
计分方式
- 每题首次回答提取出的选项与标准答案一致则记 1,否则记 0。
- 采用 pass@1,最终分数为 12,032 题的平均正确率。
结果呈现
结果呈现
- 主指标为总体选择题正确率。
- 同时报告输入、推理、答案 Token 与评测成本。
- 提供分数与模型发布日期的关系,观察高阶知识能力变化。
解读限制
解读限制
- 十选一格式仍允许随机命中,不能替代开放式知识表达评测。
- 正则提取依赖最终答案格式;多阶段回退只能缓解、不能消除表达歧义。
- 该分数仅代表本项测试,不等同于综合能力。
示例任务
跨学科十选一问题
给出一道关于环的特征的数学问题,并提供 A–J 十个候选答案。模型可以推理,但必须提交一个最终选项。
成功条件
- 选择与标准答案一致的选项。
- 最后一行使用“Answer: 字母”格式,字母范围为 A–J。