所有评测
智能体评测长流程知识工作

Briefcase

通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。

Briefcase EloElo数值越高越好

评测要点

评测设置一览

01
正式项目
4 个
02
任务总数
91 个
03
每周任务
2–5 个
04
单任务上限
500 轮
05
运行次数
每任务 1 次
06
核心评分
Elo + 二元量表

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

评测把数据科学、产品管理、公司战略等工作组织为连贯的多周项目。任务共享组织背景与资料池,要求产出表格、演示文稿、备忘录等真实工作成果。

每个任务仍以单独运行完成,不继承模型在先前任务中的自有提交;后续任务可获得统一的基准文件,以维持项目连续性和横向可比性。

能力范围

  • 从大量混杂资料中发现要求、证据与跨文件冲突
  • 完成长流程分析并生成可编辑的专业交付物
  • 兼顾可验证正确性、分析严谨度和专业呈现

测试设置

  • 每周在隔离、无网络的沙箱中运行,只能访问共享资料和当周资料。
  • 资料包含聊天记录、表格、PDF、访谈、市场研究、标准文档、董事会材料和邮件等真实、增强或合成内容。
  • 提供代码执行、提交和放弃工具;支持视觉的模型还可查看图片。

运行流程

  • 智能体接收当前任务说明和可访问资料,在最多 500 轮内完成指定文件。
  • 完成后提交摘要与交付文件的绝对路径;未提交的文件不参与评分。
  • 每项任务分别接受二元量表检查,以及分析质量和呈现质量的盲配对比较。

计分方式

  • 量表检查为严格的通过/失败,不提供部分分;只依据提交成果中的证据判定。
  • 分析质量比较更深入、结构更清晰且证据更充分的成果;呈现质量比较更专业的成果。
  • 主指标把分析质量 Elo、呈现质量 Elo 和量表通过率转换后的 Elo 合并;Elo 与 95% 置信区间下限均不低于 0。

结果呈现

  • 报告综合 Elo、量表通过率、分析质量 Elo 和呈现质量 Elo。
  • 按 Excel、PowerPoint、PDF、Word 与其他文件类型拆分表现。
  • 同时报告每任务成本、工具调用、资料探索覆盖率和发布日期关系。

解读限制

  • 四个正式项目的完整任务与资料不公开;第五个公开场景只用于说明结构,不计入正式成绩。
  • 任务独立运行,因此不测量模型跨周记忆自身成果的能力。
  • 评分包含模型评审,虽采用平衡抽样与盲化,仍可能存在判断不确定性。

示例任务

尽职调查:市场结构图

智能体从一周的尽调资料池中筛选相关文件,完成市场结构分析,并提交规定名称的 PDF 与源文件。

成功条件

  • 交付物覆盖任务量表要求并引用具体证据
  • 分析结构完整、结论受到材料支持
  • 最终成果达到专业汇报所需的呈现质量