所有评测
推理与知识知识可靠性

Omniscience

同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。

Omniscience 指数-100 至 100数值越高越好

评测要点

评测设置一览

01
题目数量
6,000 题
02
主题数量
42 个
03
领域数量
6 个
04
指数范围
-100 至 100
05
重复次数
每题 1 次
06
零分含义
正确答案数与错误答案数相同

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

六个领域为商业、人文与社会科学、科学工程与数学、健康、法律和软件工程;题目由自动化问题生成流程构建,以扩大覆盖面并保持问题明确。

该评测奖励正确事实、惩罚错误猜测,并允许模型在不确定时拒答,以观察知识可靠性与校准能力。

能力范围

  • 跨专业领域的事实回忆。
  • 识别自身知识边界并在不确定时克制回答。
  • 在准确率与错误猜测之间保持可靠校准。

测试设置

  • 从 42 个经济相关主题中组织 6,000 道事实问题。
  • 回答结果区分正确、部分回答、错误与未作答。
  • 同一批结果用于计算指数、准确率和幻觉率。
  • 每道题独立运行 1 次。

运行流程

  • 逐题向模型提问,模型可以直接回答或明确表示不知道。
  • 将响应归类为正确、部分回答、错误或未作答。
  • 按统一定义汇总全体题目和各领域结果。

计分方式

  • 指数奖励正确答案、惩罚错误答案,拒答不受惩罚;范围为 -100 至 100。
  • 准确率为正确答案占全部 6,000 题的比例,不因模型拒答而改变分母。
  • 幻觉率 = 错误 /(错误 + 部分回答 + 未作答),越低越好。

结果呈现

  • 报告主指数、准确率和幻觉率。
  • 报告六大领域的指数,并提供按领域归一化的横向比较。
  • 报告输入、推理、答案 Token 及对应成本。

解读限制

  • 指数零分不等于零准确率,而是正确与错误数量相抵。
  • 自动化生成的题目集中于 42 个经济相关主题,并非无限领域知识普查。
  • 不同领域表现差异明显,总指数不能替代具体领域结果。

示例任务

异步模型中的单任务并发术语

询问在 Rust 2024 版异步模型中,单个任务内部的并发相对于任务之间并发所使用的标准术语。

成功条件

  • 给出与标准答案一致的术语。
  • 不以宽泛的线程并发概念替代目标术语。
  • 无法确定时可以明确拒答,避免错误猜测。