所有评测
智能体评测终端任务
Terminal-Bench Hard
在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。
平均 pass@1%数值越高越好
评测要点
评测设置一览
01
测试规模
Hard 子集 44 项任务
02
重复次数
每项 3 次
03
交互上限
每次最多 100 个执行回合
04
资源上限
每项 7,200 秒、每次 100 万输入 Token
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
该评测面向真实终端使用模式,任务包括编译代码、训练模型、配置服务器、调试系统、数据处理和游戏操作,结果由任务自带的验证脚本程序化检查。
当前 Hard 配置基于 2025 年 8 月 14 日的固定快照;少量存在外部依赖问题的任务被排除,因此实际评测 44 项。
能力范围
能力范围
- 理解开放式目标并在终端中规划多步操作。
- 完成软件工程、系统管理、模型训练与数据处理任务。
- 根据运行反馈定位错误并把环境推进到可验证的最终状态。
测试设置
测试设置
- 每项任务在隔离的容器化终端环境中运行,并使用统一的终端智能体运行器。
- 每项任务附带专用测试套件,模型不能直接改写最终判定规则。
- 每项运行 3 次;单次最多 100 个执行回合、7,200 秒和 100 万累计输入 Token。
运行流程
运行流程
- 模型读取任务说明,在终端中检查环境、执行命令、修改文件并验证中间结果。
- 运行在完成、达到回合上限或超时后结束,再执行该任务的验证测试。
- 对同一任务重复 3 次,并汇总三次首轮任务尝试的结果。
计分方式
计分方式
- 只有任务测试套件中的全部测试均通过时,该次运行才记为成功,否则记为失败。
- 每项采用 pass@1,最终分数为 44 项任务各 3 次运行结果的总体平均。
结果呈现
结果呈现
- 主指标为平均任务通过率百分比。
- 同时报告可见答案 Token 与可获得的推理 Token 用量。
- 按模型发布日期展示分数,辅助区分能力提升与发布时间差异。
解读限制
解读限制
- 固定快照与被排除任务限制了结果对完整任务库的代表性。
- 回合、超时和输入 Token 上限主要截断陷入循环的运行,但仍可能影响极长任务。
- 该历史 Hard 配置已经被更新版本替代,适合用于历史横向比较。
示例任务
离线缓存模型
在默认缓存位置准备指定基础模型及其分词器,使后续航班离线环境仍能直接加载。
成功条件
- 模型文件和分词器文件都已完整缓存。
- 两者均能在 local_files_only=True 的离线模式下成功加载。