所有评测
智能体评测SaaS 工作流

AutomationBench

在模拟 SaaS 环境中测试跨应用工作流自动化,以完成目标且不破坏业务护栏后的目标完成比例作为主分数。

AutomationBench Score%数值越高越好

评测要点

评测设置一览

01
任务数量
657 个
02
业务领域
6 类
03
模拟应用环境
40 个
04
评分断言
近 12,000 条
05
重复次数
1 次
06
单任务上限
50 轮

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

任务来自真实业务工作流模式,覆盖财务、人力资源、市场、运营、销售和支持。一个任务可能同时跨越客户关系、邮箱、表格、日历、消息、客服和项目管理系统。

评测同时要求智能体自主发现所需应用端点、遵守分层业务规则,并在含有无关或误导记录的环境中写入正确结果。

能力范围

  • 跨应用编排多步骤业务流程
  • 发现并调用正确的结构化工具端点
  • 在完成目标的同时遵守不可破坏的业务护栏

测试设置

  • 使用版本 1.0 的 657 项私有留出任务,在 40 个模拟应用环境中运行。
  • 每条评分断言被分类为必须实现的目标,或初始已满足且不得破坏的护栏。
  • 应用环境包含真实业务系统的模拟数据、无关记录和可能误导的记录。

运行流程

  • 每项任务运行一次,最多 50 轮。
  • 模型通过结构化工具调用自行发现并操作需要的应用端点。
  • 运行结束后只检查各系统的最终状态,不根据对话过程评分。

计分方式

  • 若任务触发任意护栏违规,该任务得 0 分。
  • 若没有护栏违规,任务得分等于已完成目标所占百分比。
  • 基础设施错误或缺失任务同样记 0;“任务完成率”要求全部目标完成且没有违规。

结果呈现

  • 报告护栏调整后的主分数、完整任务完成率和未调整目标完成率。
  • 展示每任务违规、每次违规对应的完成目标数,以及领域和应用拆分。
  • 同时报告轮数、工具调用、token、成本与发布日期关系。

解读限制

  • 正式任务来自私有留出集,无法公开逐项复核。
  • 每项只运行一次,无法直接估计同一模型的重复稳定性。
  • 任一护栏违规即整项归零,主分数对单次错误非常敏感。