所有评测
智能体评测长流程知识工作
Briefcase
通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。
Briefcase EloElo数值越高越好
评测要点
评测设置一览
01
正式项目
4 个
02
任务总数
91 个
03
每周任务
2–5 个
04
单任务上限
500 轮
05
运行次数
每任务 1 次
06
核心评分
Elo + 二元量表
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
评测把数据科学、产品管理、公司战略等工作组织为连贯的多周项目。任务共享组织背景与资料池,要求产出表格、演示文稿、备忘录等真实工作成果。
每个任务仍以单独运行完成,不继承模型在先前任务中的自有提交;后续任务可获得统一的基准文件,以维持项目连续性和横向可比性。
能力范围
能力范围
- 从大量混杂资料中发现要求、证据与跨文件冲突
- 完成长流程分析并生成可编辑的专业交付物
- 兼顾可验证正确性、分析严谨度和专业呈现
测试设置
测试设置
- 每周在隔离、无网络的沙箱中运行,只能访问共享资料和当周资料。
- 资料包含聊天记录、表格、PDF、访谈、市场研究、标准文档、董事会材料和邮件等真实、增强或合成内容。
- 提供代码执行、提交和放弃工具;支持视觉的模型还可查看图片。
运行流程
运行流程
- 智能体接收当前任务说明和可访问资料,在最多 500 轮内完成指定文件。
- 完成后提交摘要与交付文件的绝对路径;未提交的文件不参与评分。
- 每项任务分别接受二元量表检查,以及分析质量和呈现质量的盲配对比较。
计分方式
计分方式
- 量表检查为严格的通过/失败,不提供部分分;只依据提交成果中的证据判定。
- 分析质量比较更深入、结构更清晰且证据更充分的成果;呈现质量比较更专业的成果。
- 主指标把分析质量 Elo、呈现质量 Elo 和量表通过率转换后的 Elo 合并;Elo 与 95% 置信区间下限均不低于 0。
结果呈现
结果呈现
- 报告综合 Elo、量表通过率、分析质量 Elo 和呈现质量 Elo。
- 按 Excel、PowerPoint、PDF、Word 与其他文件类型拆分表现。
- 同时报告每任务成本、工具调用、资料探索覆盖率和发布日期关系。
解读限制
解读限制
- 四个正式项目的完整任务与资料不公开;第五个公开场景只用于说明结构,不计入正式成绩。
- 任务独立运行,因此不测量模型跨周记忆自身成果的能力。
- 评分包含模型评审,虽采用平衡抽样与盲化,仍可能存在判断不确定性。
示例任务
尽职调查:市场结构图
智能体从一周的尽调资料池中筛选相关文件,完成市场结构分析,并提交规定名称的 PDF 与源文件。
成功条件
- 交付物覆盖任务量表要求并引用具体证据
- 分析结构完整、结论受到材料支持
- 最终成果达到专业汇报所需的呈现质量