所有评测
推理与知识长上下文

长上下文推理(LCR)

衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。

平均通过率%数值越高越好

评测要点

评测设置一览

01
题目数量
100 题
02
重复次数
每题 3 次
03
文档长度
10k–100k Token
04
长度口径
cl100k_base 分词
05
题型
开放式答案
06
评分
逐题通过/未通过

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

题目覆盖学术论文、公司文件、政府咨询、法律文件、行业报告与营销材料等长文档类型。

每题要求跨多个分散段落进行多步推理与综合,目标是区分真实长文理解和简单信息抽取。

能力范围

  • 在长文档中定位分散证据。
  • 连接跨章节、跨材料的信息并完成多步推理。
  • 生成明确、可核对的开放式答案。

测试设置

  • 为每道题提供对应长文档集合,输入长度处于 10k 至 100k Token。
  • 保留文档的领域结构与格式,让模型在完整上下文中作答。
  • 每题配有标准答案,用于判断语义等价性。
  • 每道题独立运行 3 次。

运行流程

  • 模型阅读文档和问题,从不同位置提取相关信息。
  • 模型完成必要计算、排序或综合后提交一个开放式答案。
  • 判分模型比较提交答案与标准答案是否等价。

计分方式

  • 每题采用通过/未通过判定。
  • 答案被判定与标准答案等价时记为通过。
  • 最终成绩是 100 道题、每题 3 次运行的平均通过率。

结果呈现

  • 报告平均通过率及随发布日期的变化。
  • 报告完整评测的输入、推理和答案 Token 用量。
  • 报告完整评测成本,并按输入、推理和答案成本拆分。

解读限制

  • 开放式答案依赖语义等价判分模型的判断。
  • 文档范围集中在列出的专业材料类型,不能代表全部长上下文场景。
  • 大上下文窗口只表示容量,不保证在本评测中获得高分。

示例任务

公司文件中的权益差额

根据给定公司文件,找出两家主要公司的股东权益,并计算它们在 2023 年 6 月 30 日的差额,结果以千美元报告。

成功条件

  • 定位两家公司及正确报告日期。
  • 从分散文件中提取对应股东权益数值。
  • 完成差额计算并使用指定单位。