所有评测
智能体评测终端智能体

Terminal-Bench v2.1

在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。

pass@1%数值越高越好

评测要点

评测设置一览

01
任务数量
89 项
02
任务领域
软件工程、系统管理、数据处理、模型训练、安全
03
重复次数
每项任务 3 次
04
执行环境
隔离的真实终端沙箱
05
主指标
3 次重复的平均 pass@1

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

v2.1 是对 v2.0 的核验刷新,保留 89 项人工策划任务,并修补容器环境与任务说明问题;约十余项任务修正了依赖缺失或说明与测试不一致的情况。

每项任务都有独立环境、人工解法与完整验证套件,结果强调是否真正完成终端任务,而不是只评判文字回答。

能力范围

  • 在命令行中规划并执行多步骤操作。
  • 调试软件、系统服务、数据流程与安全配置。
  • 根据验证反馈修复环境并交付可运行结果。

测试设置

  • 为每项任务启动隔离沙箱,并载入该任务的唯一终端环境。
  • 任务随附机器可执行的验证套件;智能体通过终端执行框架与环境交互。
  • 每个模型对每项任务运行 3 次。

运行流程

  • 向智能体提供任务说明和终端访问权限。
  • 智能体在环境内创建、修改、运行并排查所需资源。
  • 任务结束后运行随题验证套件,记录本次是否通过。

计分方式

  • 单次运行由验证套件给出通过或未通过。
  • 每项任务取 3 次重复的 pass@1,再对全部 89 项任务求平均。
  • 主成绩以百分比报告,数值越高表示完成任务的稳定性越强。

结果呈现

  • 报告 pass@1 总分及随发布日期的变化。
  • 报告每任务平均输出 Token,并拆分推理 Token 与答案 Token。
  • 报告每任务成本和加权平均解码时间;时间不包含首 Token 等待与额外开销。

解读限制

  • 结果只覆盖这 89 项终端任务,不等同于所有软件工程或运维工作。
  • 通过与否依赖随题验证套件能够观察到的最终状态。
  • v2.1 修复了旧版环境与说明问题,跨版本比较时应区分任务版本。

示例任务

多分支 HTTPS 部署

配置一个支持密码登录的 Git SSH 服务,把 main 与 dev 两个分支分别部署到根路径和 /dev 路径,并使用自签名证书;每次推送都由 post-receive 钩子触发部署。

成功条件

  • SSH 服务接受指定密码并允许克隆和推送。
  • 两个分支分别在对应 HTTPS 路径返回预期页面内容。
  • 推送后 3 秒内完成部署。