AI 大模型测评与排行榜, 一眼选出最适合你的模型
用中文直观比较 ChatGPT、Claude、Gemini、DeepSeek 等主流 AI 模型的智力、速度、价格与真实表现,覆盖文本、图像、视频和语音,选模型不再靠广告和猜测。
榜单速览
当前领先模型
快速查看智力、速度与成本领先模型。
输出速度
12 个模型单任务成本
12 个模型覆盖主流 AI 模型生态
从 586 款模型中自由选择,把不同厂商放进同一套对比。
AI 模型对比
把想选的 AI 模型,放在一起比清楚
同时对比智力、编程、速度、价格、上下文和多模态能力,用真实数据快速找到更适合你的模型。

01 · 智力
智力
综合比较智力、编程与智能体能力;数值越高越好。
默认展示主流模型,可搜索添加更多型号
02 · 智力明细
智力明细
查看 18 项细分评测,仅展示已有结果。
GDPval-AA v2
前 10τ³-Banking
前 10Terminal-Bench v2.1
前 10SciCode
前 10Humanity’s Last Exam
前 10GPQA Diamond
前 10CritPt
前 10全知准确率
前 10全知非幻觉率
前 10AA-LCR
前 10AA-Briefcase
前 10AutomationBench-AA
前 10Harvey LAB-AA
前 10EnterpriseOps-Gym-AA
前 10IFBench
前 10APEX-Agents-AA
前 8ITBench-AA
前 10MMMU-Pro
前 1003 · AA-Briefcase
Briefcase 长任务能力
比较复杂、长周期专业任务的总体 Elo、评分项通过率、分析质量和呈现质量。
默认展示主流模型,可搜索添加更多型号
04 · 全知指数
全知指数
同时看模型回答知识问题的准确性与避免幻觉的能力。
默认展示主流模型,可搜索添加更多型号
05 · 开放性
开放性
比较模型可获得性、训练数据与方法透明度;指数越高,开放程度越高。
开放性构成
满分 18 分:预训练数据 3 分 + 后训练数据 3 分 + 方法透明度 6 分 + 模型可获得性 6 分。0 分表示公开披露有限;— 表示暂无评分。
06 · 智力对照
智力指数对照
对照智力与成本、速度和价格,快速权衡性能与投入。
默认展示主流模型,可搜索添加更多型号
07 · Token 用量
Token 用量
比较每项任务的回答与推理 Token 用量。
默认展示主流模型,可搜索添加更多型号
08 · 价格与成本
价格与成本
比较单任务成本、整套评测成本与 API 单价。
默认展示主流模型,可搜索添加更多型号
09 · 上下文窗口
上下文窗口
模型一次请求可处理的最大上下文长度,单位为 tokens。
默认展示主流模型,可搜索添加更多型号
10 · 速度
速度
比较输出速度与单任务耗时。
默认展示主流模型,可搜索添加更多型号
11 · 延迟
首个回答 token 延迟
从请求开始到首个回答 token 的时间,拆分为输入处理与推理等待。
默认展示主流模型,可搜索添加更多型号
12 · 端到端响应时间
端到端响应时间
一次完整响应的输入处理、推理和输出耗时。
默认展示主流模型,可搜索添加更多型号
13 · 模型规模
模型规模
比较模型总参数与推理时实际激活参数,单位为十亿参数。
默认展示主流模型,可搜索添加更多型号
关于 AI 模型选择的常见问题
帮助你更快看懂榜单、比较候选型号,并做出适合自己场景的选择。