所有评测
智能体评测法律工作

Harvey LAB

用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。

Harvey LAB 全通过率%数值越高越好

评测要点

评测设置一览

01
正式任务
120 个
02
法律领域
24 类
03
公开示例
5 个
04
重复次数
1 次
05
单任务上限
200 轮
06
主指标
全通过率

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

每项任务给出合伙人式指令与案件文档,要求智能体制作备忘录、披露清单、证词摘要、修订稿等完整法律成果,而非回答孤立法律问题。

正式结果来自横跨 24 个法律执业领域的 120 个私有任务;五个公开任务仅用于展示任务、资料与成果形态。

能力范围

  • 跨合同、协议、备忘录和证词材料进行法律分析
  • 按精确文件名生成可用的专业法律交付物
  • 逐项满足任务特定、原子化的实质性标准

测试设置

  • 每项任务在无网络的隔离 Linux 沙箱中运行,输入文档只读。
  • 环境预装办公文档、PDF 与电子表格处理工具;支持视觉的模型可额外查看图片。
  • 智能体获得任务说明、输入文件和精确交付文件名,不提供执行期间的实时反馈。

运行流程

  • 智能体把只读案件材料复制到工作区,读取并处理后在最多 200 轮内生成指定文件。
  • 交付物必须使用任务指定的精确文件名;若某条标准声明的交付物全部缺失,该标准直接失败;若只缺少部分文件,其余内容仍参与评审,并将缺失文件标记为缺失。
  • 从交付物中提取文本,与任务说明和每条匹配标准一起交给单一评审逐项判定。

计分方式

  • 每条标准等权且只能通过或失败,不提供部分分。
  • 全通过率是所有标准均通过的任务比例;任一标准失败则该任务不计成功。
  • 标准通过率是全部原子标准中通过项目的平均比例,用作更细粒度指标。

结果呈现

  • 报告全通过率、标准通过率及其随发布日期的变化。
  • 展示每任务成本、输出 token、估算时间与平均轮数。
  • 公开示例展示输入材料、预期文件和模型交付物。

解读限制

  • 正式 120 项任务不公开,外部只能通过五个示例理解任务结构。
  • 评分只读取交付物提取出的文本,视觉排版质量不会被完整捕捉。
  • 精确文件名和全通过规则较严格,近似文件名或单项遗漏都会显著降低成绩。

示例任务

并购控制权变更分析

审阅收购数据室中的合同与内部备忘录,分析控制权变更和转让条款,并提交一份规定名称的综合交易团队报告。

成功条件

  • 覆盖目标公司重要合同中的控制权变更与转让条款
  • 结论可追溯到提供的合同和交易资料
  • 生成并提交指定名称的 Word 报告