MMMLU

MMMLU

MMMLU是OpenAI发布的多语言MMLU测试集,含14种语言,用于评估多语言大语言模型。

打开网站

MMMLU数据集概述

MMMLU(Multilingual Massive Multitask Language Understanding)是OpenAI于2024年9月在Hugging Face上发布的多语言评估数据集,仓库名为openai/MMMLU。该数据集基于广泛使用的MMLU基准构建,旨在评估大语言模型在多语言环境下的通用知识、推理和理解能力。

数据集构成

MMMLU是MMLU测试集的专业人工翻译版本,覆盖了从基础到高级专业主题的57个类别,包括法律、物理、历史、计算机科学等。每个语言子集包含14,042道四选一选择题,与原始MMLU测试集划分一致,14种语言总计约196,588个示例。数据集的列结构统一,包含翻译后的问题、A-D选项、正确答案字母以及英文主题标识(如abstract_algebra或professional_law)。

语言覆盖

MMMLU包含14种语言,每种语言用带地区的语言标签标识:阿拉伯语(AR_XY)、孟加拉语(BN_BD)、德语(DE_DE)、西班牙语(拉丁美洲,ES_LA)、法语(FR_FR)、印地语(HI_IN)、印度尼西亚语(ID_ID)、意大利语(IT_IT)、日语(JA_JP)、韩语(KO_KR)、葡萄牙语(巴西,PT_BR)、斯瓦希里语(SW_KE)、约鲁巴语(YO_NG)和简体中文(ZH_CN)。

翻译方法

据OpenAI介绍,MMMLU的翻译由专业人工翻译完成,而非机器翻译,目的是提高翻译准确性,特别是对于约鲁巴语等低资源语言和技术词汇。这一做法有助于确保评估结果反映模型的语言能力而非翻译误差。

评估与使用

OpenAI在其开源的simple-evals仓库中提供了评估代码,run_multilingual_mmlu函数从Hugging Face加载每个语言子集,并通过精确匹配模型输出的答案字母进行评分,通常在零样本设置下进行,随机基线为25%。MMMLU已被集成到多个第三方评估框架中,如ModelScope的EvalScope和斯坦福大学的HELM场景库。

模型表现

OpenAI公布了其模型在MMMLU上的各语言准确率。例如,o3(高推理)在14种语言上的平均准确率为88.8%。结果显示,罗曼语族语言(如意大利语)得分较高,而低资源非洲语言得分较低,约鲁巴语表现最差,这凸显了多语言模型在不同语言上的性能差距。

若有收获,就点个赞吧

相关导航

数据评估

MMMLU浏览人数已经达到30,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:MMMLU的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找MMMLU的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于MMMLU特别声明

本站深度导航提供的MMMLU都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。