所有评测
智能体评测法律工作
Harvey LAB
用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。
Harvey LAB 全通过率%数值越高越好
评测要点
评测设置一览
01
正式任务
120 个
02
法律领域
24 类
03
公开示例
5 个
04
重复次数
1 次
05
单任务上限
200 轮
06
主指标
全通过率
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
每项任务给出合伙人式指令与案件文档,要求智能体制作备忘录、披露清单、证词摘要、修订稿等完整法律成果,而非回答孤立法律问题。
正式结果来自横跨 24 个法律执业领域的 120 个私有任务;五个公开任务仅用于展示任务、资料与成果形态。
能力范围
能力范围
- 跨合同、协议、备忘录和证词材料进行法律分析
- 按精确文件名生成可用的专业法律交付物
- 逐项满足任务特定、原子化的实质性标准
测试设置
测试设置
- 每项任务在无网络的隔离 Linux 沙箱中运行,输入文档只读。
- 环境预装办公文档、PDF 与电子表格处理工具;支持视觉的模型可额外查看图片。
- 智能体获得任务说明、输入文件和精确交付文件名,不提供执行期间的实时反馈。
运行流程
运行流程
- 智能体把只读案件材料复制到工作区,读取并处理后在最多 200 轮内生成指定文件。
- 交付物必须使用任务指定的精确文件名;若某条标准声明的交付物全部缺失,该标准直接失败;若只缺少部分文件,其余内容仍参与评审,并将缺失文件标记为缺失。
- 从交付物中提取文本,与任务说明和每条匹配标准一起交给单一评审逐项判定。
计分方式
计分方式
- 每条标准等权且只能通过或失败,不提供部分分。
- 全通过率是所有标准均通过的任务比例;任一标准失败则该任务不计成功。
- 标准通过率是全部原子标准中通过项目的平均比例,用作更细粒度指标。
结果呈现
结果呈现
- 报告全通过率、标准通过率及其随发布日期的变化。
- 展示每任务成本、输出 token、估算时间与平均轮数。
- 公开示例展示输入材料、预期文件和模型交付物。
解读限制
解读限制
- 正式 120 项任务不公开,外部只能通过五个示例理解任务结构。
- 评分只读取交付物提取出的文本,视觉排版质量不会被完整捕捉。
- 精确文件名和全通过规则较严格,近似文件名或单项遗漏都会显著降低成绩。
示例任务
并购控制权变更分析
审阅收购数据室中的合同与内部备忘录,分析控制权变更和转让条款,并提交一份规定名称的综合交易团队报告。
成功条件
- 覆盖目标公司重要合同中的控制权变更与转让条款
- 结论可追溯到提供的合同和交易资料
- 生成并提交指定名称的 Word 报告