所有评测
推理与知识17 种语言

Global-MMLU-Lite

用约 6,000 道四选一题衡量 17 种语言中的知识与推理,并同时报告总体平均和逐语言成绩。

多语言平均正确率%数值越高越好

评测要点

评测设置一览

01
题目数量
约 6,000 题
02
语言规模
17 种语言,每种约 400 题
03
答案形式
4 个选项(A–D)
04
重复次数
每题 1 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

该轻量多语言子集从多学科语言理解题中筛选并适配多种语言,兼顾全球通用主题与区域相关知识。

覆盖英语、中文、印地语、西班牙语、法语、阿拉伯语、孟加拉语、葡萄牙语、印尼语、日语、斯瓦希里语、德语、韩语、意大利语、约鲁巴语和缅甸语等 17 种语言。

能力范围

  • 在多种语言中理解学术与常识类问题。
  • 跨文化语境调用知识并完成选择题推理。
  • 比较同一模型在不同语言上的能力稳定性。

测试设置

  • 使用约 6,000 道题,每种支持语言约 400 道。
  • 每题提供 A–D 四个选项,只运行 1 次且不开放工具。
  • 所有语言使用一致的多项选择答案提取与 pass@1 规则。

运行流程

  • 按题目语言提交问题和四个选项,收集模型完整回答。
  • 通过多阶段正则提取最终选项;若回答自我修正,取最后一次有效匹配。
  • 逐题与标准选项比较,再分别汇总各语言和全部语言的成绩。

计分方式

  • 每题首次回答的最终选项正确记 1,错误或无法提取记 0,采用 pass@1。
  • 报告逐语言正确率,并以全部支持语言的结果形成总体平均分。

结果呈现

  • 核心结果包括全部语言平均分和 17 种语言的分项分数。
  • 同时报告输入、推理、答案 Token,成本与每任务时间。
  • 结合模型发布日期展示多语言能力变化。

解读限制

  • 每种语言约 400 题,是轻量抽样而非完整语言能力测试。
  • 四选一正确率不能覆盖生成质量、对话自然度或长文本写作。
  • 单次 pass@1 对偶然输出更敏感,语言间题目差异也会影响直接比较。

示例任务

大学化学多语言选择题

以英文询问哪一种材料属于 n 型半导体,并提供硅、金刚石、碳化硅和掺砷硅四个选项。

成功条件

  • 从 A–D 中提交与标准答案一致的选项。
  • 最终选项可被答案提取规则明确识别。