所有评测
智能体评测终端智能体
Terminal-Bench v2.1
在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。
pass@1%数值越高越好
评测要点
评测设置一览
01
任务数量
89 项
02
任务领域
软件工程、系统管理、数据处理、模型训练、安全
03
重复次数
每项任务 3 次
04
执行环境
隔离的真实终端沙箱
05
主指标
3 次重复的平均 pass@1
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
v2.1 是对 v2.0 的核验刷新,保留 89 项人工策划任务,并修补容器环境与任务说明问题;约十余项任务修正了依赖缺失或说明与测试不一致的情况。
每项任务都有独立环境、人工解法与完整验证套件,结果强调是否真正完成终端任务,而不是只评判文字回答。
能力范围
能力范围
- 在命令行中规划并执行多步骤操作。
- 调试软件、系统服务、数据流程与安全配置。
- 根据验证反馈修复环境并交付可运行结果。
测试设置
测试设置
- 为每项任务启动隔离沙箱,并载入该任务的唯一终端环境。
- 任务随附机器可执行的验证套件;智能体通过终端执行框架与环境交互。
- 每个模型对每项任务运行 3 次。
运行流程
运行流程
- 向智能体提供任务说明和终端访问权限。
- 智能体在环境内创建、修改、运行并排查所需资源。
- 任务结束后运行随题验证套件,记录本次是否通过。
计分方式
计分方式
- 单次运行由验证套件给出通过或未通过。
- 每项任务取 3 次重复的 pass@1,再对全部 89 项任务求平均。
- 主成绩以百分比报告,数值越高表示完成任务的稳定性越强。
结果呈现
结果呈现
- 报告 pass@1 总分及随发布日期的变化。
- 报告每任务平均输出 Token,并拆分推理 Token 与答案 Token。
- 报告每任务成本和加权平均解码时间;时间不包含首 Token 等待与额外开销。
解读限制
解读限制
- 结果只覆盖这 89 项终端任务,不等同于所有软件工程或运维工作。
- 通过与否依赖随题验证套件能够观察到的最终状态。
- v2.1 修复了旧版环境与说明问题,跨版本比较时应区分任务版本。
示例任务
多分支 HTTPS 部署
配置一个支持密码登录的 Git SSH 服务,把 main 与 dev 两个分支分别部署到根路径和 /dev 路径,并使用自签名证书;每次推送都由 post-receive 钩子触发部署。
成功条件
- SSH 服务接受指定密码并允许克隆和推送。
- 两个分支分别在对应 HTTPS 路径返回预期页面内容。
- 推送后 3 秒内完成部署。