项目简介
LLMEval3(LLMEval-3)是复旦大学自然语言处理实验室(FDU-NLP Lab)发起的大语言模型评测项目,其官方网站 llmeval.com 承载评测平台与排行榜。该项目定位为学术评测框架与研究平台,早期成果 LLMEval-1(AAAI 2024)覆盖17个大类453道题、动员2186名标注者产生24万余条人工标注,项目还陆续推出 LLMEval-2、LLMEval-Fair/LLMEval-3 以及 LLMEval-Med、LLMEval-Logic 等系列评测和数据集。
评测体系
LLMEval3 聚焦大模型专业知识能力评测,覆盖教育部划定的13个学科门类(哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学)及50余个二级学科,题库约含20万道标准化生成式问答题目,并计划扩充至100万道。题目主要来源于本科课后作业、期中期末考试与研究生入学考试等非公开渠道以减少预训练数据暴露,题型包括简答、计算、判断、辨析、写作等生成式形式,而非选择题模式。
动态评测与防作弊机制
LLMEval3 采用动态评测与防作弊机制:每个参与评测的系统需完成从总题库中随机抽样的1000道题,针对同一机构的模型确保每次评测题目不重复,评测在线进行且题目逐题串行发送以防恶意爬取。其自动化流程还包含抗污染数据管理、双层防作弊架构(外层以 JWT 做认证与访问控制,内层约束试题配额、分配与作答顺序),从而降低“刷榜”“刷分”与数据污染风险。
评分机制
LLMEval3 的评分由大模型裁判自动完成:每题按0–3分打分,聚焦回答的核心正确性与解释正确性(0分为答案与解释均错误,3分为答案与解释均正确),并以 GPT-4 系模型为当前裁判模型;同时给出归一化到百分制的绝对分数和相对当前最强模型(SOTA)的相对分数。经校准的裁判流程与人类专家一致性约达90%。
纵向研究
基于 LLMEval3 的纵向研究(早期版本报告为20个月、近50个主流模型,修订版扩展为约30个月、近60个模型)发现:顶尖模型在知识记忆类任务上趋于约90%以上的性能天花板,且在工学、管理学、经济学等学科表现较强,在文学、医学、军事学等学科相对薄弱;模型在公开静态基准上可回忆的题目量远高于其在 LLMEval3 私有题库上的记忆量,暴露出静态基准无法检测的数据污染隐患。
开放与参与
LLMEval3 评测面向公众开放,机构评测需在 llmeval.com 注册账号后联系管理员完成认证并申请评测权限,除特殊情况外评测结果完成后会加入排行榜。完整基准数据集已在 GitHub 仓库的 data/ 目录公开,相关数据集也可通过 Hugging Face 的 llmeval-fdu 组织获取;网站设有论文(Papers)、排行榜(Leaderboard)、博客(Blog)等板块。
相关研究
LLMEval3 的方法论论文于2025年8月以《LLMEval-3: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models》(arXiv:2508.05452)为题发布,构建了一个自有的22万道研究生级题库,并为每次评测动态抽样未见过的测试集;论文后续修订版更名为 LLMEval-Fair,并于2026年被 ACL 2026 主会接收,代码与数据公开在 github.com/llmeval/llmeval-3。
相关导航
数据评估
关于LLMEval3特别声明
本站深度导航提供的LLMEval3都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。