所有评测
推理与知识长上下文
长上下文推理(LCR)
衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。
平均通过率%数值越高越好
评测要点
评测设置一览
01
题目数量
100 题
02
重复次数
每题 3 次
03
文档长度
10k–100k Token
04
长度口径
cl100k_base 分词
05
题型
开放式答案
06
评分
逐题通过/未通过
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
题目覆盖学术论文、公司文件、政府咨询、法律文件、行业报告与营销材料等长文档类型。
每题要求跨多个分散段落进行多步推理与综合,目标是区分真实长文理解和简单信息抽取。
能力范围
能力范围
- 在长文档中定位分散证据。
- 连接跨章节、跨材料的信息并完成多步推理。
- 生成明确、可核对的开放式答案。
测试设置
测试设置
- 为每道题提供对应长文档集合,输入长度处于 10k 至 100k Token。
- 保留文档的领域结构与格式,让模型在完整上下文中作答。
- 每题配有标准答案,用于判断语义等价性。
- 每道题独立运行 3 次。
运行流程
运行流程
- 模型阅读文档和问题,从不同位置提取相关信息。
- 模型完成必要计算、排序或综合后提交一个开放式答案。
- 判分模型比较提交答案与标准答案是否等价。
计分方式
计分方式
- 每题采用通过/未通过判定。
- 答案被判定与标准答案等价时记为通过。
- 最终成绩是 100 道题、每题 3 次运行的平均通过率。
结果呈现
结果呈现
- 报告平均通过率及随发布日期的变化。
- 报告完整评测的输入、推理和答案 Token 用量。
- 报告完整评测成本,并按输入、推理和答案成本拆分。
解读限制
解读限制
- 开放式答案依赖语义等价判分模型的判断。
- 文档范围集中在列出的专业材料类型,不能代表全部长上下文场景。
- 大上下文窗口只表示容量,不保证在本评测中获得高分。
示例任务
公司文件中的权益差额
根据给定公司文件,找出两家主要公司的股东权益,并计算它们在 2023 年 6 月 30 日的差额,结果以千美元报告。
成功条件
- 定位两家公司及正确报告日期。
- 从分散文件中提取对应股东权益数值。
- 完成差额计算并使用指定单位。