

Papers with Code(paperswithcode.com)是一个汇集机器学习论文、代码实现和性能评测结果的学术资源平台,其MMLU基准页面专注于展示大规模多任务语言理解(Massive Multitask Language Understanding)的评测数据。该页面由UC Berkeley研究人员于2020年9月提出,旨在通过57项涵盖初等数学、美国历史、计算机科学、法律等领域的英文任务,系统评估大模型的知识覆盖范围和语义理解能力。用户可在此查看不同模型的MMLU得分、排名变化及论文引用信息,是研究大模型能力的重要参考工具。
官方入口
https://paperswithcode.com/sota/multi-task-language-understanding-on-mmlu
核心功能
- 排行榜查看:按MMLU总分排序展示各模型性能,支持按日期过滤最新结果
- 任务细分对比:可查看模型在57个具体子任务(如法律、计算机科学)上的单独得分
- 论文关联:每个模型条目链接至原始论文,方便查阅技术细节
- 代码资源:提供模型实现代码的GitHub仓库链接,便于复现实验
- 历史趋势:展示模型性能随时间变化曲线,追踪领域进展
- 筛选与排序:支持按模型类型、参数量、发布时间等条件筛选列表
用户群体
该页面主要面向人工智能研究者、大模型开发人员、学术评估人员以及关注自然语言处理进展的爱好者。研究者在对比模型能力时,可使用此页面快速获取权威的MMLU基准数据;开发者在选择预训练模型时,可依据排名和任务细分做出决策;学生或教育工作者也能通过该页面了解当前大模型的知识覆盖水平。
使用教程
页面数据由Papers with Code团队自动从论文中提取并人工校验,每日更新。用户无需登录即可访问完整排行榜,但若需提交新模型结果,需通过论文关联流程。以下为常见操作步骤:
- 打开上述网址,页面顶部显示当前MMLU总榜前三名及分数
- 点击任意模型名称,可跳转至论文详情页,查看方法介绍和实验设置
- 使用页面左侧筛选栏,按“提交日期”或“模型类型”缩小范围
- 点击“Expand”展开某个模型,可查看其在57个子任务上的具体得分
- 如需对比两个模型,可勾选列表前的复选框,页面将生成对比视图
- 点击“Code”图标,可直接访问模型的开源代码仓库
总结定位
paperswithcode.com的MMLU页面是当前公开可查的大模型语言理解基准数据库,它整合了论文、代码和评测结果,为研究者提供了一个标准化的对比平台。其核心价值在于将分散的学术成果转化为直观的排名和细分数据,降低了横向比较的门槛。对于需要评估模型知识广度的用户,该页面是首选参考来源。以下为同类平台对比:
| 平台 | 主要定位 | 数据覆盖 | 更新频率 |
|---|---|---|---|
| Papers with Code MMLU页 | MMLU基准排行榜 | 57项任务,模型结果 | 每日更新 |
| Hugging Face Open LLM Leaderboard | 多基准综合排名 | 多种任务,含MMLU | 每周更新 |
| Eval Harness | 评测工具与数据集 | 多种基准测试 | 不定期更新 |
这个网站地址是由,心动导航网用户自主提交,或网络收集来的,如有违规或者是打不开的情况,请及时反馈!!
数据统计
数据评估
本站薄荷网 – 精品网址导航,互联网实用网站合集提供的MMLU–大规模多任务语言理解基准都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由薄荷网 – 精品网址导航,互联网实用网站合集实际控制,在2026年8月28日 下午9:32收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,薄荷网 – 精品网址导航,互联网实用网站合集不承担任何责任。
为这篇文章评分
相关导航


SuperCLUE–中文大模型测评基准

稿定PPT–PPT模板资源库

呜哩–AIGC创意生产力平台

稀土掘金–技术内容社区
言情小说吧–原创言情小说平台

百度文库AI助手–智能文档助手

