所有评测
推理与知识知识可靠性
Omniscience
同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。
Omniscience 指数-100 至 100数值越高越好
评测要点
评测设置一览
01
题目数量
6,000 题
02
主题数量
42 个
03
领域数量
6 个
04
指数范围
-100 至 100
05
重复次数
每题 1 次
06
零分含义
正确答案数与错误答案数相同
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
六个领域为商业、人文与社会科学、科学工程与数学、健康、法律和软件工程;题目由自动化问题生成流程构建,以扩大覆盖面并保持问题明确。
该评测奖励正确事实、惩罚错误猜测,并允许模型在不确定时拒答,以观察知识可靠性与校准能力。
能力范围
能力范围
- 跨专业领域的事实回忆。
- 识别自身知识边界并在不确定时克制回答。
- 在准确率与错误猜测之间保持可靠校准。
测试设置
测试设置
- 从 42 个经济相关主题中组织 6,000 道事实问题。
- 回答结果区分正确、部分回答、错误与未作答。
- 同一批结果用于计算指数、准确率和幻觉率。
- 每道题独立运行 1 次。
运行流程
运行流程
- 逐题向模型提问,模型可以直接回答或明确表示不知道。
- 将响应归类为正确、部分回答、错误或未作答。
- 按统一定义汇总全体题目和各领域结果。
计分方式
计分方式
- 指数奖励正确答案、惩罚错误答案,拒答不受惩罚;范围为 -100 至 100。
- 准确率为正确答案占全部 6,000 题的比例,不因模型拒答而改变分母。
- 幻觉率 = 错误 /(错误 + 部分回答 + 未作答),越低越好。
结果呈现
结果呈现
- 报告主指数、准确率和幻觉率。
- 报告六大领域的指数,并提供按领域归一化的横向比较。
- 报告输入、推理、答案 Token 及对应成本。
解读限制
解读限制
- 指数零分不等于零准确率,而是正确与错误数量相抵。
- 自动化生成的题目集中于 42 个经济相关主题,并非无限领域知识普查。
- 不同领域表现差异明显,总指数不能替代具体领域结果。
示例任务
异步模型中的单任务并发术语
询问在 Rust 2024 版异步模型中,单个任务内部的并发相对于任务之间并发所使用的标准术语。
成功条件
- 给出与标准答案一致的术语。
- 不以宽泛的线程并发概念替代目标术语。
- 无法确定时可以明确拒答,避免错误猜测。