MMMLU数据集概述
MMMLU(Multilingual Massive Multitask Language Understanding)是OpenAI于2024年9月在Hugging Face上发布的多语言评估数据集,仓库名为openai/MMMLU。该数据集基于广泛使用的MMLU基准构建,旨在评估大语言模型在多语言环境下的通用知识、推理和理解能力。
数据集构成
MMMLU是MMLU测试集的专业人工翻译版本,覆盖了从基础到高级专业主题的57个类别,包括法律、物理、历史、计算机科学等。每个语言子集包含14,042道四选一选择题,与原始MMLU测试集划分一致,14种语言总计约196,588个示例。数据集的列结构统一,包含翻译后的问题、A-D选项、正确答案字母以及英文主题标识(如abstract_algebra或professional_law)。
语言覆盖
MMMLU包含14种语言,每种语言用带地区的语言标签标识:阿拉伯语(AR_XY)、孟加拉语(BN_BD)、德语(DE_DE)、西班牙语(拉丁美洲,ES_LA)、法语(FR_FR)、印地语(HI_IN)、印度尼西亚语(ID_ID)、意大利语(IT_IT)、日语(JA_JP)、韩语(KO_KR)、葡萄牙语(巴西,PT_BR)、斯瓦希里语(SW_KE)、约鲁巴语(YO_NG)和简体中文(ZH_CN)。
翻译方法
据OpenAI介绍,MMMLU的翻译由专业人工翻译完成,而非机器翻译,目的是提高翻译准确性,特别是对于约鲁巴语等低资源语言和技术词汇。这一做法有助于确保评估结果反映模型的语言能力而非翻译误差。
评估与使用
OpenAI在其开源的simple-evals仓库中提供了评估代码,run_multilingual_mmlu函数从Hugging Face加载每个语言子集,并通过精确匹配模型输出的答案字母进行评分,通常在零样本设置下进行,随机基线为25%。MMMLU已被集成到多个第三方评估框架中,如ModelScope的EvalScope和斯坦福大学的HELM场景库。
模型表现
OpenAI公布了其模型在MMMLU上的各语言准确率。例如,o3(高推理)在14种语言上的平均准确率为88.8%。结果显示,罗曼语族语言(如意大利语)得分较高,而低资源非洲语言得分较低,约鲁巴语表现最差,这凸显了多语言模型在不同语言上的性能差距。
相关导航
数据评估
关于MMMLU特别声明
本站深度导航提供的MMMLU都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。