所有评测
智能体评测SaaS 工作流
AutomationBench
在模拟 SaaS 环境中测试跨应用工作流自动化,以完成目标且不破坏业务护栏后的目标完成比例作为主分数。
AutomationBench Score%数值越高越好
评测要点
评测设置一览
01
任务数量
657 个
02
业务领域
6 类
03
模拟应用环境
40 个
04
评分断言
近 12,000 条
05
重复次数
1 次
06
单任务上限
50 轮
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
任务来自真实业务工作流模式,覆盖财务、人力资源、市场、运营、销售和支持。一个任务可能同时跨越客户关系、邮箱、表格、日历、消息、客服和项目管理系统。
评测同时要求智能体自主发现所需应用端点、遵守分层业务规则,并在含有无关或误导记录的环境中写入正确结果。
能力范围
能力范围
- 跨应用编排多步骤业务流程
- 发现并调用正确的结构化工具端点
- 在完成目标的同时遵守不可破坏的业务护栏
测试设置
测试设置
- 使用版本 1.0 的 657 项私有留出任务,在 40 个模拟应用环境中运行。
- 每条评分断言被分类为必须实现的目标,或初始已满足且不得破坏的护栏。
- 应用环境包含真实业务系统的模拟数据、无关记录和可能误导的记录。
运行流程
运行流程
- 每项任务运行一次,最多 50 轮。
- 模型通过结构化工具调用自行发现并操作需要的应用端点。
- 运行结束后只检查各系统的最终状态,不根据对话过程评分。
计分方式
计分方式
- 若任务触发任意护栏违规,该任务得 0 分。
- 若没有护栏违规,任务得分等于已完成目标所占百分比。
- 基础设施错误或缺失任务同样记 0;“任务完成率”要求全部目标完成且没有违规。
结果呈现
结果呈现
- 报告护栏调整后的主分数、完整任务完成率和未调整目标完成率。
- 展示每任务违规、每次违规对应的完成目标数,以及领域和应用拆分。
- 同时报告轮数、工具调用、token、成本与发布日期关系。
解读限制
解读限制
- 正式任务来自私有留出集,无法公开逐项复核。
- 每项只运行一次,无法直接估计同一模型的重复稳定性。
- 任一护栏违规即整项归零,主分数对单次错误非常敏感。