综合智力指数
把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。
Keygate 评测体系
按测试对象、任务设置、计分方式与结果解释,完整拆解每项指标。
把智能体、编程、科学推理与通用能力九项评测合成为 0–100 分,用于观察模型的整体能力,而不是用单一题型代替综合判断。
从模型可获得性、许可条件、训练数据透明度和方法透明度衡量开放程度,并统一换算为 0–100 分。
通过多周业务项目、数千份输入材料和 91 个交付任务,评估智能体完成复杂知识工作的正确性、分析质量与呈现质量。
让智能体完成 44 种职业、9 个主要行业中的 220 项真实专业任务,以盲配对比较形成锚定人类专家基线的 Elo。
在投资银行、管理咨询和公司法律环境中测试长流程、跨应用专业任务;只有全部量表项目满足时,一次运行才算成功。
在模拟 SaaS 环境中测试跨应用工作流自动化,以完成目标且不破坏业务护栏后的目标完成比例作为主分数。
用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。
让智能体在可重置的企业系统中执行有状态、多步骤工作流,并以最终数据库状态的严格验证结果评估任务是否真正完成。
在约 700 份互相关联的银行政策中检索依据,并通过多步骤工具调用完成可验证的客户支持工作流。
在真实终端环境中检验智能体完成软件工程、系统管理、数据处理、模型训练与安全任务的能力。
衡量模型从 10k 至 100k Token 的长文档中提取、连接并综合分散信息的能力。
同时衡量事实知识、知识边界识别与错误猜测,区分准确回答、拒答和幻觉。
以真实科研问题检验科学知识、推理与代码合成能力,答案由可执行测试验证。
以专家核验的前沿学术问题检验数学、自然科学与人文学科中的高难度闭合式推理。
用未公开的研究级物理问题检验完整科研推理,并以抗猜测、机器可验证的答案格式评分。
使用最困难的研究生级物理、生物和化学选择题检验真正的科学推理,而非检索技巧。
在离线 Kubernetes 事故快照中定位导致故障的实体,评估智能体的站点可靠性工程根因分析能力。
通过更难猜测的十选一问题和视觉输入,检验模型跨学科整合图像与文本信息的能力。
通过 58 类全新、可验证的域外约束,检验模型能否在单轮回答中精确满足计数、格式和句子变换等输出要求。
在隔离终端环境中执行高难度软件工程、系统管理、数据处理、模型训练和游戏任务,以自动化测试验证最终结果。
在电信技术支持场景中分别模拟客服智能体与用户,让双方共同改变共享状态,检验规划、工具使用、沟通和用户引导。
以 12,032 道、14 个学科领域的十选一研究生级问题,检验高级知识、理解与更深层推理。
持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。
以 500 道高中竞赛级数学题测试逐步推理和精确作答,覆盖代数、几何、数论、预备微积分与概率。
使用 2025 年两套邀请赛的全部 30 道题,检验代数、几何、数论和组合数学中的高难度推理与精确整数作答。
用约 6,000 道四选一题衡量 17 种语言中的知识与推理,并同时报告总体平均和逐语言成绩。