所有评测
推理与知识前沿学术
Humanity's Last Exam
以专家核验的前沿学术问题检验数学、自然科学与人文学科中的高难度闭合式推理。
pass@1 正确率%数值越高越好
评测要点
评测设置一览
01
完整版本
2,500 题
02
当前评测
2,158 道纯文本题
03
题型
多项选择与短答案
04
覆盖领域
数学、自然科学、人文等数十个学科
05
主指标
单次作答 pass@1
06
重复次数
每题 1 次
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
题目由领域专家核验,要求真正理解而非快速资料检索;完整版本同时包含多项选择、短答案与多模态题。
为保证不同模型可比,当前口径只运行 2025 年 5 月修订版中的 2,158 道纯文本题。
能力范围
能力范围
- 前沿学科知识与跨学科推理。
- 处理答案唯一、但无法靠浅层检索解决的问题。
- 在多项选择和短答案格式中给出可核验结论。
测试设置
测试设置
- 从完整 2,500 题中排除多模态题,保留 2,158 道纯文本题。
- 每题有明确且可验证的参考答案。
- 数值题的等价判定允许小幅数值容差。
- 每道题独立运行 1 次。
运行流程
运行流程
- 模型对每题只提交一次答案。
- 等价性判分模型将答案与参考答案比较。
- 逐题记录正确或错误,再汇总全部纯文本题。
计分方式
计分方式
- 采用 pass@1:每个模型每题生成一个答案。
- 判分模型判断答案与参考答案是否等价,数值答案允许小幅容差。
- 最终成绩是被判为正确的答案占 2,158 题的比例。
结果呈现
结果呈现
- 报告 pass@1 正确率及随发布日期的变化。
- 报告输入、推理和答案 Token 总量。
- 报告完整评测成本及输入、推理、答案成本拆分。
解读限制
解读限制
- 当前结果排除了多模态题,不能代表完整 2,500 题版本。
- 短答案依赖等价性判分模型,数值答案还涉及容差设置。
- 该评测聚焦闭合式学术问题,不覆盖开放式研究或长期任务执行。
示例任务
水凝胶蛋白的光谱解释
根据升温和浓度变化下多个红外峰的增强、肩峰与消失现象,从九个候选解释中判断蛋白二级结构在凝胶化过程中的变化。
成功条件
- 同时使用升温趋势与浓度滴定趋势。
- 把峰位变化映射到对应二级结构。
- 选择与参考答案一致的唯一选项。