所有评测
综合指数综合指标
综合智力指数
把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。
综合智力指数分(0–100)数值越高越好
评测要点
评测设置一览
01
职业任务
220 项 × 1 次;权重 20%
02
银行智能体
97 项 × 5 次;权重 14%
03
终端任务
89 项 × 3 次;权重 16%
04
科学编程
288 个子问题 × 3 次;权重 8%
05
长上下文
100 项 × 3 次;权重 6%
06
知识可靠性
6,000 项 × 1 次;准确率 8% + 非幻觉率 4%
07
前沿学术
2,158 项 × 1 次;权重 12%
08
研究生科学
198 项 × 5 次;权重 6%
09
研究级物理
70 项 × 5 次;权重 6%
10
评测语言
英语纯文本
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
综合智力指数覆盖推理、知识、数学、编程、任务约束遵循与多步骤任务完成。组合指标的目的,是降低模型只针对某一狭窄题型优化所造成的偏差。
当前版本强调智能体任务:真实知识工作与银行工作流合计占 34%;其余权重分配给编程、科学推理和通用能力。
能力范围
能力范围
- 长流程任务规划、工具使用与可验证结果交付
- 终端编程、科学代码与研究级问题求解
- 知识准确性、非幻觉表现和长文本推理
- 跨学科科学推理与严格答案格式遵循
测试设置
测试设置
- 采用纯文本、英语评测套件;图像、语音和多语言能力另行评估。
- 非推理模型通常使用温度 0;推理模型通常使用温度 0.6,若模型另有推荐设置则从其推荐。
- 不同子评测保留各自的任务数量、重复次数、工具环境和原始评分方式。
运行流程
运行流程
- 先运行九项子评测,并按各自规则得到原始成绩。
- 将各项成绩转换为可合成的标准分,再按智能体 34%、编程 24%、科学推理 24%、通用能力 18% 加权。
- 发布综合分的同时保留各子评测结果,便于识别模型能力结构。
计分方式
计分方式
- 最终结果为 0–100 分的加权综合分,数值越高表示总体表现越强。
- 当前九项权重分别归入四类;知识准确性与非幻觉表现作为两个独立贡献项计算。
- 基于部分模型超过 10 次的重复实验,综合指数的估计 95% 置信区间小于 ±1%;单项结果的区间可能更宽。
结果呈现
结果呈现
- 报告综合智力指数与九项子评测明细。
- 同时展示运行所用输入、推理与回答 token,以及按公开价格估算的成本。
- 提供分数与模型发布日期的关系,观察能力随时间的变化。
解读限制
解读限制
- 该指数仅覆盖英语纯文本能力,不能替代多语言、视觉或语音测试。
- 综合分适合总体比较,但具体业务仍应优先查看与场景最接近的子评测。
- 单项评测的不确定性可能高于综合指数。
示例任务
零售门店每日任务清单
作为零售电子门店的部门主管,根据提供的任务文档制作一份每日任务清单 PDF,供不同班次员工分配、签认和归档。
成功条件
- 清单能够记录每项任务的负责人
- 包含员工完成签认以及经理姓名和日期签核区域
- 为任务备注保留空间,并以 PDF 形式提交最终成果