C-Eval

C-Eval

C-Eval是一个全面的中文基础模型评估套件,包含13,948道多项选择题,覆盖52个学科和四个难度级别。

打开网站

C-Eval 简介

C-Eval 是一个全面的中文基础模型(大语言模型)评估套件,旨在评估模型在中文语境下的高级知识和推理能力。该套件由上海交通大学、清华大学和爱丁堡大学的研究人员创建,相关论文发表于 NeurIPS 2023(数据集和基准测试轨道)。官方代码仓库维护在 github.com/hkust-nlp/ceval,官方网站为 cevalbenchmark.com。

数据集构成

C-Eval 包含 13,948 道多项选择题,涵盖 52 个不同学科和四个难度级别。题目分为四个难度级别:初中(1,409 题)、高中(1,594 题)、大学(6,249 题)和专业(4,696 题)。学科分为四大类:STEM(20 个学科,4,495 题)、人文学科(11 个学科,2,676 题)、社会科学(10 个学科,2,845 题)和其他领域(11 个学科,3,932 题)。每个学科的问题分为开发集(每个学科五个示例,共 260 题)、验证集(1,346 题)和测试集(12,342 题)。每道题有四个选项,只有一个正确答案。

C-Eval Hard

C-Eval Hard 是一个独立的基准测试,由 C-Eval 中八个具有挑战性的数学、物理和化学学科组成:高等数学、离散数学、概率与统计、大学化学、大学物理、高中数学、高中化学和高中物理。这些学科通常涉及复杂的 LaTeX 方程,需要非平凡的推理能力。在初始评估中,GPT-4 在 C-Eval Hard 上的零样本准确率仅为 53.3%,使其成为当时 GPT-4 表现不佳的少数基准之一。

评估方法

模型在 C-Eval 上以零样本和五样本设置进行评估,使用仅答案或思维链提示,以准确率作为指标。答案标记通过正则表达式从生成结果中提取,或通过计算 A/B/C/D 的概率并取最可能的一个。测试集的真实标签保持私有,用户需要将模型预测提交到 cevalbenchmark.com 以自动获得公共排行榜上的测试准确率。C-Eval 已集成到 EleutherAI 的 lm-evaluation-harness 中,支持对 Hugging Face 模型在验证集上进行评估。

数据构建与许可

为降低网络爬取预训练语料库造成的数据污染风险,C-Eval 主要基于模拟考试和小规模本地考试构建,而非官方国家考试(如中国高考)的真题。大多数样本来自互联网上的 PDF 或 Microsoft Word 文档,经过解析和作者仔细标注,包括将复杂的数学符号手动转换为 LaTeX。C-Eval 代码以 MIT 许可证发布,数据集采用知识共享署名-非商业性使用-相同方式共享 4.0 国际许可证(CC BY-NC-SA 4.0)。项目提供 NeurIPS 2023 论文的引用信息,并要求用户在使用数据集时引用。

排行榜状态

C-Eval 公共排行榜曾在官方网站上维护,提供各学科和平均测试结果,涵盖开放访问和受限访问模型,并列出零样本或少样本提示的结果。2025 年 7 月 26 日,C-Eval 团队宣布已将完整测试集公开发布在 Hugging Face 上,停止维护排行榜,并计划未来从网站移除排行榜部分,以便用户直接在 C-Eval 测试集上进行评估。

若有收获,就点个赞吧

相关导航

数据评估

C-Eval浏览人数已经达到27,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:C-Eval的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找C-Eval的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于C-Eval特别声明

本站深度导航提供的C-Eval都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。