所有评测
综合指数综合指标

综合智力指数

把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。

综合智力指数分(0–100)数值越高越好

评测要点

评测设置一览

01
职业任务
220 项 × 1 次;权重 20%
02
银行智能体
97 项 × 5 次;权重 14%
03
终端任务
89 项 × 3 次;权重 16%
04
科学编程
288 个子问题 × 3 次;权重 8%
05
长上下文
100 项 × 3 次;权重 6%
06
知识可靠性
6,000 项 × 1 次;准确率 8% + 非幻觉率 4%
07
前沿学术
2,158 项 × 1 次;权重 12%
08
研究生科学
198 项 × 5 次;权重 6%
09
研究级物理
70 项 × 5 次;权重 6%
10
评测语言
英语纯文本

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

综合智力指数覆盖推理、知识、数学、编程、任务约束遵循与多步骤任务完成。组合指标的目的,是降低模型只针对某一狭窄题型优化所造成的偏差。

当前版本强调智能体任务:真实知识工作与银行工作流合计占 34%;其余权重分配给编程、科学推理和通用能力。

能力范围

  • 长流程任务规划、工具使用与可验证结果交付
  • 终端编程、科学代码与研究级问题求解
  • 知识准确性、非幻觉表现和长文本推理
  • 跨学科科学推理与严格答案格式遵循

测试设置

  • 采用纯文本、英语评测套件;图像、语音和多语言能力另行评估。
  • 非推理模型通常使用温度 0;推理模型通常使用温度 0.6,若模型另有推荐设置则从其推荐。
  • 不同子评测保留各自的任务数量、重复次数、工具环境和原始评分方式。

运行流程

  • 先运行九项子评测,并按各自规则得到原始成绩。
  • 将各项成绩转换为可合成的标准分,再按智能体 34%、编程 24%、科学推理 24%、通用能力 18% 加权。
  • 发布综合分的同时保留各子评测结果,便于识别模型能力结构。

计分方式

  • 最终结果为 0–100 分的加权综合分,数值越高表示总体表现越强。
  • 当前九项权重分别归入四类;知识准确性与非幻觉表现作为两个独立贡献项计算。
  • 基于部分模型超过 10 次的重复实验,综合指数的估计 95% 置信区间小于 ±1%;单项结果的区间可能更宽。

结果呈现

  • 报告综合智力指数与九项子评测明细。
  • 同时展示运行所用输入、推理与回答 token,以及按公开价格估算的成本。
  • 提供分数与模型发布日期的关系,观察能力随时间的变化。

解读限制

  • 该指数仅覆盖英语纯文本能力,不能替代多语言、视觉或语音测试。
  • 综合分适合总体比较,但具体业务仍应优先查看与场景最接近的子评测。
  • 单项评测的不确定性可能高于综合指数。

示例任务

零售门店每日任务清单

作为零售电子门店的部门主管,根据提供的任务文档制作一份每日任务清单 PDF,供不同班次员工分配、签认和归档。

成功条件

  • 清单能够记录每项任务的负责人
  • 包含员工完成签认以及经理姓名和日期签核区域
  • 为任务备注保留空间,并以 PDF 形式提交最终成果