所有评测
智能体评测经济价值任务

GDPval v2

让智能体完成 44 种职业、9 个主要行业中的 220 项真实专业任务,以盲配对比较形成锚定人类专家基线的 Elo。

GDPval v2 EloElo数值越高越好

评测要点

评测设置一览

01
任务数量
220 个
02
职业数量
44 种
03
行业数量
9 个
04
单任务上限
250 轮
05
人类基线
Elo 1000
06
指数权重
20%

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

任务由具有行业经验的专业人士设计,要求生成文档、幻灯片、图表、示意图和电子表格等完整工作成果,而不是回答简短问题。

v2 扩充了沙箱依赖、修正少量环境与提示问题、把轮数上限提高至 250,并以三位评审组成的评审池替代单一评审。

能力范围

  • 把复杂职业要求转化为可交付文件
  • 结合参考文件、网页检索、计算和视觉信息完成任务
  • 在长流程中规划、检查并提交多个成果文件

测试设置

  • 每项任务初始化新的隔离 Linux 沙箱,放入对应参考文件和文档处理、科学计算与排版工具。
  • 智能体可使用网页获取、网页搜索、图片查看、代码执行、完成提交和放弃任务六类工具。
  • 部分无法正常打开的办公文件仅修复缺失元数据或关系项,不改变正文、幻灯片内容与版式。

运行流程

  • 智能体在最多 250 轮内读取材料、生成一个或多个文件,并通过完成工具提交。
  • 上下文使用超过 70% 时先总结当前状态,再压缩早期历史并继续任务。
  • 同一任务的两份匿名提交进入盲配对;先平衡抽样,再优先比较 Elo 接近的模型。

计分方式

  • 每次比较由三位评审组成的评审池中抽取一位,选择较优提交或判为平局。
  • 所有配对结果用 Bradley–Terry 最大似然模型拟合;平局各计半胜,置信区间使用 sandwich estimator。
  • Elo 锚定人类专家成果为 1000;模型加入综合指数时会冻结当时的 Elo,再使用 clamp((Elo - 500) / 2000) 归一化。

结果呈现

  • 报告 Elo、95% 置信区间及代表性任务提交。
  • 展示每任务成本、总成本、输出 token、平均轮数和发布日期关系。
  • 保留匿名配对结果用于解释 Elo 的相对差异。

解读限制

  • 每个任务只运行一次,单次沙箱或生成波动会直接进入结果。
  • Elo 是相对指标,会随比较池与新增提交变化。
  • 模型评审能够处理复杂文件,但仍存在评审偏差和不确定性。

示例任务

巡演乐队舞台布置图

作为巡演音视频技术人员,根据五位乐手的麦克风、返听、乐器、DI 盒和输入输出需求,制作一页横向 PDF 舞台图。

成功条件

  • 舞台正面位于页面底部,成员与设备位置清晰
  • 所有麦克风、返听、IEM 分线、功放和 DI 盒均有图标与标签
  • 顶部包含按舞台位置对应编号的输入与输出列表