所有评测
多模态评测多模态理解
MMMU-Pro
通过更难猜测的十选一问题和视觉输入,检验模型跨学科整合图像与文本信息的能力。
多模态正确率%数值越高越好
评测要点
评测设置一览
01
题目数量
3,460 题
02
学科数量
30 个
03
核心领域
6 类
04
候选项
由 4 项扩展为 10 项
05
输入形式
图文组合与视觉化问题
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
评测先过滤可由纯文本模型回答的问题,再把每题选项从 4 个扩展为 10 个,并加入把题目嵌入截图或照片的视觉输入形式。
3,460 题覆盖艺术与设计、商业、科学、健康与医学、人文与社会科学、技术与工程六大类,共 30 个学科。
能力范围
能力范围
- 同时读取图像、图表和文字问题。
- 在 30 个学科中完成多模态知识推理。
- 在十个相近选项中识别正确结论。
测试设置
测试设置
- 排除不看图也能回答的题目,减少文本捷径。
- 每题提供 10 个候选答案,降低猜测带来的得分。
- 部分设置把问题本身嵌入截图或照片,要求模型完成视觉读取。
运行流程
运行流程
- 模型读取题目关联图像及文字内容。
- 结合视觉证据与学科知识完成推理。
- 从 A 至 J 的十个候选项中提交一个答案。
计分方式
计分方式
- 选择与标准答案一致时记为正确。
- 主成绩为全部 3,460 题的正确比例。
- 成绩以百分比报告,数值越高表示多模态理解与推理越强。
结果呈现
结果呈现
- 报告多模态正确率及随发布日期的变化。
- 报告输入、推理和答案 Token 总量。
- 报告完整评测成本及输入、推理、答案成本拆分。
解读限制
解读限制
- 内容集中在六类学术领域,不等同于开放世界视觉理解。
- 多项选择成绩不能直接代表图像描述或内容生成质量。
- 视觉化问题会同时受到视觉识别、文字读取和知识推理误差影响。
示例任务
历史图像中的整体趋势
查看一张历史类图像,判断图中丝绸之路相关变化的整体趋势,并从政治、疾病、贸易、气候、迁徙等十个候选解释中选择最符合图像证据的一项。
成功条件
- 正确读取图像中的趋势,而不是只依据题干关键词猜测。
- 结合历史语境比较十个候选解释。
- 提交与标准答案一致的单一选项。