所有评测
推理与知识前沿学术

Humanity's Last Exam

以专家核验的前沿学术问题检验数学、自然科学与人文学科中的高难度闭合式推理。

pass@1 正确率%数值越高越好

评测要点

评测设置一览

01
完整版本
2,500 题
02
当前评测
2,158 道纯文本题
03
题型
多项选择与短答案
04
覆盖领域
数学、自然科学、人文等数十个学科
05
主指标
单次作答 pass@1
06
重复次数
每题 1 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

题目由领域专家核验,要求真正理解而非快速资料检索;完整版本同时包含多项选择、短答案与多模态题。

为保证不同模型可比,当前口径只运行 2025 年 5 月修订版中的 2,158 道纯文本题。

能力范围

  • 前沿学科知识与跨学科推理。
  • 处理答案唯一、但无法靠浅层检索解决的问题。
  • 在多项选择和短答案格式中给出可核验结论。

测试设置

  • 从完整 2,500 题中排除多模态题,保留 2,158 道纯文本题。
  • 每题有明确且可验证的参考答案。
  • 数值题的等价判定允许小幅数值容差。
  • 每道题独立运行 1 次。

运行流程

  • 模型对每题只提交一次答案。
  • 等价性判分模型将答案与参考答案比较。
  • 逐题记录正确或错误,再汇总全部纯文本题。

计分方式

  • 采用 pass@1:每个模型每题生成一个答案。
  • 判分模型判断答案与参考答案是否等价,数值答案允许小幅容差。
  • 最终成绩是被判为正确的答案占 2,158 题的比例。

结果呈现

  • 报告 pass@1 正确率及随发布日期的变化。
  • 报告输入、推理和答案 Token 总量。
  • 报告完整评测成本及输入、推理、答案成本拆分。

解读限制

  • 当前结果排除了多模态题,不能代表完整 2,500 题版本。
  • 短答案依赖等价性判分模型,数值答案还涉及容差设置。
  • 该评测聚焦闭合式学术问题,不覆盖开放式研究或长期任务执行。

示例任务

水凝胶蛋白的光谱解释

根据升温和浓度变化下多个红外峰的增强、肩峰与消失现象,从九个候选解释中判断蛋白二级结构在凝胶化过程中的变化。

成功条件

  • 同时使用升温趋势与浓度滴定趋势。
  • 把峰位变化映射到对应二级结构。
  • 选择与参考答案一致的唯一选项。