586 款 AI 模型 · 排行榜自动更新

AI 大模型测评与排行榜, 一眼选出最适合你的模型

用中文直观比较 ChatGPT、Claude、Gemini、DeepSeek 等主流 AI 模型的智力、速度、价格与真实表现,覆盖文本、图像、视频和语音,选模型不再靠广告和猜测。

更新至 07/26 05:50

榜单速览

当前领先模型

快速查看智力、速度与成本领先模型。

智力

12 个模型

输出速度

12 个模型

单任务成本

12 个模型

覆盖主流 AI 模型生态

586 款模型中自由选择,把不同厂商放进同一套对比。

AI 模型对比

把想选的 AI 模型,放在一起比清楚

同时对比智力、编程、速度、价格、上下文和多模态能力,用真实数据快速找到更适合你的模型。

01 · 智力

智力

综合比较智力、编程与智能体能力;数值越高越好。

默认展示主流模型,可搜索添加更多型号

02 · 智力明细

智力明细

查看 18 项细分评测,仅展示已有结果。

GDPval-AA v2

10

τ³-Banking

10

Terminal-Bench v2.1

10

SciCode

10

Humanity’s Last Exam

10

GPQA Diamond

10

CritPt

10

全知准确率

10

全知非幻觉率

10

AA-LCR

10

AA-Briefcase

10

AutomationBench-AA

10

Harvey LAB-AA

10

EnterpriseOps-Gym-AA

10

IFBench

10

APEX-Agents-AA

8

ITBench-AA

10

MMMU-Pro

10

03 · AA-Briefcase

Briefcase 长任务能力

比较复杂、长周期专业任务的总体 Elo、评分项通过率、分析质量和呈现质量。

默认展示主流模型,可搜索添加更多型号

04 · 全知指数

全知指数

同时看模型回答知识问题的准确性与避免幻觉的能力。

默认展示主流模型,可搜索添加更多型号

05 · 开放性

开放性

比较模型可获得性、训练数据与方法透明度;指数越高,开放程度越高。

开放性构成

满分 18 分:预训练数据 3 分 + 后训练数据 3 分 + 方法透明度 6 分 + 模型可获得性 6 分。0 分表示公开披露有限;— 表示暂无评分。

06 · 智力对照

智力指数对照

对照智力与成本、速度和价格,快速权衡性能与投入。

07 · Token 用量

Token 用量

比较每项任务的回答与推理 Token 用量。

默认展示主流模型,可搜索添加更多型号

08 · 价格与成本

价格与成本

比较单任务成本、整套评测成本与 API 单价。

默认展示主流模型,可搜索添加更多型号

09 · 上下文窗口

上下文窗口

模型一次请求可处理的最大上下文长度,单位为 tokens。

默认展示主流模型,可搜索添加更多型号

10 · 速度

速度

比较输出速度与单任务耗时。

默认展示主流模型,可搜索添加更多型号

11 · 延迟

首个回答 token 延迟

从请求开始到首个回答 token 的时间,拆分为输入处理与推理等待。

默认展示主流模型,可搜索添加更多型号

12 · 端到端响应时间

端到端响应时间

一次完整响应的输入处理、推理和输出耗时。

默认展示主流模型,可搜索添加更多型号

13 · 模型规模

模型规模

比较模型总参数与推理时实际激活参数,单位为十亿参数。

默认展示主流模型,可搜索添加更多型号

XiaomiMiMoXiaomiKlingThinking MachinesMinimaxMiniMaxAntGroupInclusionAICohereCohereNvidiaNVIDIADeepSeekDeepSeekAI21AI21 LabsOpenAIOpenAIZ.aiZ AI

关于 AI 模型选择的常见问题

帮助你更快看懂榜单、比较候选型号,并做出适合自己场景的选择。

看懂榜单

选择与对比