所有评测
智能体评测企业运营

EnterpriseOps-Gym

让智能体在可重置的企业系统中执行有状态、多步骤工作流,并以最终数据库状态的严格验证结果评估任务是否真正完成。

严格任务成功率%数值越高越好

评测要点

评测设置一览

01
当前评测任务
1,117 个
02
完整任务集
1,150 个
03
业务领域
8 类
04
数据库表
164 张
05
功能工具
512 个
06
重复次数
3 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

评测覆盖客户服务、人力资源、IT 服务、邮件、日历、团队协作、云盘及跨系统混合任务。智能体通过实时工具改变企业系统状态,而非只给出文字建议。

当前运行 1,117 个 oracle 模式任务;完整任务集含 1,150 个专家策划任务。任务的真实难点来自跨步骤依赖、政策遵循和避免副作用。

能力范围

  • 在有状态系统中规划并执行多步骤企业流程
  • 跨业务系统协调工具调用并维护数据完整性
  • 满足权限、流程和政策约束,同时避免非预期更改

测试设置

  • 每项任务使用隔离、可重置的沙箱和任务专属合成数据库副本。
  • 相关企业系统以实时工具服务器提供操作能力,运行之间互不影响。
  • 只运行 oracle 工具模式:直接提供任务所需工具,不加入干扰工具。

运行流程

  • 智能体以标准“推理—行动”循环操作,每项任务最多 100 轮。
  • 每项任务运行 3 次,完成后快照保存最终数据库状态。
  • SQL 验证器检查目标完成、状态与完整性、权限和流程合规,以及是否存在非预期副作用。

计分方式

  • 主指标为严格 pass@1:只有全部验证器通过,该次任务才算成功。
  • 三次重复的成功率取平均形成最终任务成功率。
  • 同时报告验证器通过率,即全部单项检查中通过的比例。

结果呈现

  • 报告总体严格任务成功率与八个领域的成功率。
  • 展示单项验证器通过率、平均轮数、输出 token、成本和估算时间。
  • 提供分数与发布日期的关系,用于观察企业智能体能力演进。

解读限制

  • 只运行 oracle 工具模式,不测量从大量干扰工具中发现正确工具的能力。
  • 严格全通过规则会把只遗漏一个约束的任务整体记为失败。
  • 结果针对当前沙箱、提示和工具配置,不应与其他实现直接等同。

示例任务

外部审计准备

在云盘创建受保护的审计文件夹并放入四份指定资料,为两位外部审计员设置限时只读权限,同时把两个 IT 事件改为“已解决但未关闭”,并删除过期资料。

成功条件

  • 两个事件最终状态均为已解决而非已关闭
  • 审计文件夹存在且恰好包含四份文件
  • 两位审计员拥有仍有效的查看权限