所有评测
智能体评测企业运营
EnterpriseOps-Gym
让智能体在可重置的企业系统中执行有状态、多步骤工作流,并以最终数据库状态的严格验证结果评估任务是否真正完成。
严格任务成功率%数值越高越好
评测要点
评测设置一览
01
当前评测任务
1,117 个
02
完整任务集
1,150 个
03
业务领域
8 类
04
数据库表
164 张
05
功能工具
512 个
06
重复次数
3 次
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
评测覆盖客户服务、人力资源、IT 服务、邮件、日历、团队协作、云盘及跨系统混合任务。智能体通过实时工具改变企业系统状态,而非只给出文字建议。
当前运行 1,117 个 oracle 模式任务;完整任务集含 1,150 个专家策划任务。任务的真实难点来自跨步骤依赖、政策遵循和避免副作用。
能力范围
能力范围
- 在有状态系统中规划并执行多步骤企业流程
- 跨业务系统协调工具调用并维护数据完整性
- 满足权限、流程和政策约束,同时避免非预期更改
测试设置
测试设置
- 每项任务使用隔离、可重置的沙箱和任务专属合成数据库副本。
- 相关企业系统以实时工具服务器提供操作能力,运行之间互不影响。
- 只运行 oracle 工具模式:直接提供任务所需工具,不加入干扰工具。
运行流程
运行流程
- 智能体以标准“推理—行动”循环操作,每项任务最多 100 轮。
- 每项任务运行 3 次,完成后快照保存最终数据库状态。
- SQL 验证器检查目标完成、状态与完整性、权限和流程合规,以及是否存在非预期副作用。
计分方式
计分方式
- 主指标为严格 pass@1:只有全部验证器通过,该次任务才算成功。
- 三次重复的成功率取平均形成最终任务成功率。
- 同时报告验证器通过率,即全部单项检查中通过的比例。
结果呈现
结果呈现
- 报告总体严格任务成功率与八个领域的成功率。
- 展示单项验证器通过率、平均轮数、输出 token、成本和估算时间。
- 提供分数与发布日期的关系,用于观察企业智能体能力演进。
解读限制
解读限制
- 只运行 oracle 工具模式,不测量从大量干扰工具中发现正确工具的能力。
- 严格全通过规则会把只遗漏一个约束的任务整体记为失败。
- 结果针对当前沙箱、提示和工具配置,不应与其他实现直接等同。
示例任务
外部审计准备
在云盘创建受保护的审计文件夹并放入四份指定资料,为两位外部审计员设置限时只读权限,同时把两个 IT 事件改为“已解决但未关闭”,并删除过期资料。
成功条件
- 两个事件最终状态均为已解决而非已关闭
- 审计文件夹存在且恰好包含四份文件
- 两位审计员拥有仍有效的查看权限