所有评测
推理与知识多学科

MMLU-Pro

以 12,032 道、14 个学科领域的十选一研究生级问题,检验高级知识、理解与更深层推理。

pass@1 正确率%数值越高越好

评测要点

评测设置一览

01
题目数量
12,032 题
02
学科数量
14 个领域
03
答案形式
10 个选项(A–J)
04
重复次数
每题 1 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

原有多学科选择题评测逐渐接近饱和,MMLU-Pro 扩充到十个选项并删除简单或噪声题,更强调推理而非单纯知识回忆。

实验显示,相比原版本,模型准确率下降 16%–33%;在 24 种提示风格下,分数波动从 4%–5% 降至约 2%。

能力范围

  • 跨 14 个学科调用高阶知识并完成多步推理。
  • 在十个相近选项中辨别正确结论。
  • 按严格格式提炼并提交最终选择。

测试设置

  • 运行全部 12,032 道十选一题,每题只运行 1 次。
  • 提示要求最后一行使用“Answer: A/B/C/D/E/F/G/H/I/J”格式。
  • 评测为文本多项选择,不开放工具调用。

运行流程

  • 向模型提交问题与 A–J 十个选项并收集完整回答。
  • 先提取单字母或“Answer: X”,失败时依次检查 boxed、自然语言、选项行和结尾字母等格式。
  • 存在自我修正时取最后一次匹配,再与标准选项比较。

计分方式

  • 每题首次回答提取出的选项与标准答案一致则记 1,否则记 0。
  • 采用 pass@1,最终分数为 12,032 题的平均正确率。

结果呈现

  • 主指标为总体选择题正确率。
  • 同时报告输入、推理、答案 Token 与评测成本。
  • 提供分数与模型发布日期的关系,观察高阶知识能力变化。

解读限制

  • 十选一格式仍允许随机命中,不能替代开放式知识表达评测。
  • 正则提取依赖最终答案格式;多阶段回退只能缓解、不能消除表达歧义。
  • 该分数仅代表本项测试,不等同于综合能力。

示例任务

跨学科十选一问题

给出一道关于环的特征的数学问题,并提供 A–J 十个候选答案。模型可以推理,但必须提交一个最终选项。

成功条件

  • 选择与标准答案一致的选项。
  • 最后一行使用“Answer: 字母”格式,字母范围为 A–J。