所有评测
智能体评测终端任务

Terminal-Bench Hard

在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。

平均 pass@1%数值越高越好

评测要点

评测设置一览

01
测试规模
Hard 子集 44 项任务
02
重复次数
每项 3 次
03
交互上限
每次最多 100 个执行回合
04
资源上限
每项 7,200 秒、每次 100 万输入 Token

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

该评测面向真实终端使用模式,任务包括编译代码、训练模型、配置服务器、调试系统、数据处理和游戏操作,结果由任务自带的验证脚本程序化检查。

当前 Hard 配置基于 2025 年 8 月 14 日的固定快照;少量存在外部依赖问题的任务被排除,因此实际评测 44 项。

能力范围

  • 理解开放式目标并在终端中规划多步操作。
  • 完成软件工程、系统管理、模型训练与数据处理任务。
  • 根据运行反馈定位错误并把环境推进到可验证的最终状态。

测试设置

  • 每项任务在隔离的容器化终端环境中运行,并使用统一的终端智能体运行器。
  • 每项任务附带专用测试套件,模型不能直接改写最终判定规则。
  • 每项运行 3 次;单次最多 100 个执行回合、7,200 秒和 100 万累计输入 Token。

运行流程

  • 模型读取任务说明,在终端中检查环境、执行命令、修改文件并验证中间结果。
  • 运行在完成、达到回合上限或超时后结束,再执行该任务的验证测试。
  • 对同一任务重复 3 次,并汇总三次首轮任务尝试的结果。

计分方式

  • 只有任务测试套件中的全部测试均通过时,该次运行才记为成功,否则记为失败。
  • 每项采用 pass@1,最终分数为 44 项任务各 3 次运行结果的总体平均。

结果呈现

  • 主指标为平均任务通过率百分比。
  • 同时报告可见答案 Token 与可获得的推理 Token 用量。
  • 按模型发布日期展示分数,辅助区分能力提升与发布时间差异。

解读限制

  • 固定快照与被排除任务限制了结果对完整任务库的代表性。
  • 回合、超时和输入 Token 上限主要截断陷入循环的运行,但仍可能影响极长任务。
  • 该历史 Hard 配置已经被更新版本替代,适合用于历史横向比较。

示例任务

离线缓存模型

在默认缓存位置准备指定基础模型及其分词器,使后续航班离线环境仍能直接加载。

成功条件

  • 模型文件和分词器文件都已完整缓存。
  • 两者均能在 local_files_only=True 的离线模式下成功加载。