所有评测
智能体评测专业服务

APEX-Agents

在投资银行、管理咨询和公司法律环境中测试长流程、跨应用专业任务;只有全部量表项目满足时,一次运行才算成功。

APEX-Agents Pass@1%数值越高越好

评测要点

评测设置一览

01
评测任务
452 个
02
公开任务总量
480 个
03
专业领域
3 类
04
重复次数
3 次
05
单任务上限
200 轮
06
主指标
严格 Pass@1

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

APEX-Agents 聚焦需要跨文件和工作场所工具完成的长流程任务,覆盖投资银行、管理咨询与公司法律。现行评测使用公开 480 项中的 452 项。

两个依赖外部运行条件的投资银行任务世界被排除,以避免无法稳定复现的环境因素进入排名。

能力范围

  • 跨应用检索、计算、文件编辑与状态管理
  • 从专业材料中提取证据并完成长流程工作
  • 严格遵循多项量表要求并产出正确最终状态

测试设置

  • 智能体进入包含文件和工作场所工具的隔离环境,通过实时工具网关操作。
  • 初始只提供精简元工具,用于列出、检查、添加和移除任务所需工具。
  • 另提供待办事项与完成工具;单次工具调用限时 60 秒,超长输出按固定预算截断。

运行流程

  • 每项任务独立运行 3 次,每次最多 200 轮。
  • 智能体自行管理工具与待办事项,并通过完成工具提交最终答案和完成状态。
  • 评分同时检查最终答案与初始、最终文件系统之间的差异。

计分方式

  • 每次运行都按任务量表逐项判定;只有所有项目通过,该次运行才记为成功。
  • 主分数是三次重复中成功运行的平均比例,即严格 pass@1。
  • 量表评审使用单一评分模型;未完全满足量表的运行不计部分成功。

结果呈现

  • 报告严格 pass@1、输出 token、每任务成本与估算时间。
  • 按发布日期对比分数,并展示代表性任务、量表和示例输出。
  • 任务结果保留到专业领域层级,便于区分法律、咨询与投行能力。

解读限制

  • 公开数据集共有 480 项;排除两个依赖外部运行条件的任务世界,共 28 项任务,最终评测 452 项。
  • 全量表通过才算成功,无法反映接近完成但遗漏单项要求的程度。
  • 评分包含模型评审,可能存在判定误差。

示例任务

公司法:不可抗力条款

因行政命令引发骚乱并导致工厂关闭,买方主张供应商不能依据主供应协议的不可抗力条款免责;智能体需回答是或否并简述理由。

成功条件

  • 明确回答买方的主张不正确
  • 指出行政命令属于条款覆盖的政府行为
  • 说明供应商可能因此免于履行义务