所有评测
多模态评测多模态理解

MMMU-Pro

通过更难猜测的十选一问题和视觉输入,检验模型跨学科整合图像与文本信息的能力。

多模态正确率%数值越高越好

评测要点

评测设置一览

01
题目数量
3,460 题
02
学科数量
30 个
03
核心领域
6 类
04
候选项
由 4 项扩展为 10 项
05
输入形式
图文组合与视觉化问题

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

评测先过滤可由纯文本模型回答的问题,再把每题选项从 4 个扩展为 10 个,并加入把题目嵌入截图或照片的视觉输入形式。

3,460 题覆盖艺术与设计、商业、科学、健康与医学、人文与社会科学、技术与工程六大类,共 30 个学科。

能力范围

  • 同时读取图像、图表和文字问题。
  • 在 30 个学科中完成多模态知识推理。
  • 在十个相近选项中识别正确结论。

测试设置

  • 排除不看图也能回答的题目,减少文本捷径。
  • 每题提供 10 个候选答案,降低猜测带来的得分。
  • 部分设置把问题本身嵌入截图或照片,要求模型完成视觉读取。

运行流程

  • 模型读取题目关联图像及文字内容。
  • 结合视觉证据与学科知识完成推理。
  • 从 A 至 J 的十个候选项中提交一个答案。

计分方式

  • 选择与标准答案一致时记为正确。
  • 主成绩为全部 3,460 题的正确比例。
  • 成绩以百分比报告,数值越高表示多模态理解与推理越强。

结果呈现

  • 报告多模态正确率及随发布日期的变化。
  • 报告输入、推理和答案 Token 总量。
  • 报告完整评测成本及输入、推理、答案成本拆分。

解读限制

  • 内容集中在六类学术领域,不等同于开放世界视觉理解。
  • 多项选择成绩不能直接代表图像描述或内容生成质量。
  • 视觉化问题会同时受到视觉识别、文字读取和知识推理误差影响。

示例任务

历史图像中的整体趋势

查看一张历史类图像,判断图中丝绸之路相关变化的整体趋势,并从政治、疾病、贸易、气候、迁徙等十个候选解释中选择最符合图像证据的一项。

成功条件

  • 正确读取图像中的趋势,而不是只依据题干关键词猜测。
  • 结合历史语境比较十个候选解释。
  • 提交与标准答案一致的单一选项。