大模型基准测试发展现状、共性与差异分析

大模型基准测试发展现状、共性与差异分析

最佳答案 匿名用户编辑于2024/07/22 16:55

蓬勃发展的大模型基准测试。

据中国信息通信研究院(以下简称“中国信通院”)统计,截止 到 2023 年底,产学研各界已经报道 325 个大模型基准测试的相关数 据集、方法和榜单等研究成果。其中,使用频次较高的评测数据集包 括加州大学伯克利分校的 MMLU、Open AI 的 GSM8K、上海交通大 学的 C-Eval 等;大模型基准测试体系和工具包括美国斯坦福大学的 HELM 和 HEIM、上海 AI 实验室的 OpenCompass、北京智源研究院 的 FlagEval、ChineseGLUE 的 SuperCLUE、清华大学的 SuperBench等;大模型评测榜单包括Hugging Face推出的Open LLM Leaderboard、 加州大学伯克利分校的 Chatbot Arena、斯坦福大学的 AlpacaEval 等。 通过对现有成果进行梳理,观察到如下现象。 一是从测试领域占比来看,如图 2 所示,由于大语言模型是当前 产业应用的主流,因此针对大模型的通用语言类评测数据集最多,占 比超过 50%,多模态大模型评测数据集数量仅占 13%。面向行业类的 评测数据集 2023 年也迎来爆发式发展,其中 80%也针对语言类任务 构建。而对于模型安全、可靠性和鲁棒性评测的数据集较少,需要持 续投入。此外,当前对大模型产业应用效果的评测数据集和方法论相 对缺乏,亟需产学研各界重点关注。

二是从发布时间来看,2023 年不但是大模型的涌现年,也是大模 型基准测试的爆发年。如图 3 所示,仅 2023 年一年出现的大模型基 准测试数据集的数量远远超过之前 5 年,达到 209 个。预计在 2024 年,大模型基准测试数据集的数量仍会持续攀升。三是从大模型基准测试数据集的使用频次来看,如表 1 所示,通 过对 GPT-4、LLaMA 2、LLaMA 3、Gemini、Claudes 3、Mixtral 8x7B、 GLM4 等大模型官方发布结果中使用的评测数据集进行统计,MMLU、 GSM8K、ARC、HumanEval、Math、BBH、WinoGrande、HellaSwag 等基准的使用频次较高,其中大部分为传统的自然语言处理评测数据 集,并主要针对大模型的英文能力进行测试。对于多模态大模型, LLaVA-Bench、VisIT-Bench、MMBench 等使用较为广泛。

四是从发布机构上来看,学术机构在此领域的研究中扮演了重要 角色。如图 4 所示,清华大学和斯坦福大学位于发布评测数据集数量 的第一名和第三名,其中清华大学的成果大多集中在 2023 年。美国 艾伦人工智能研究所(AI2)由于在传统自然语言处理数据集上的贡 献,仍然位居前列。谷歌、阿里巴巴、Meta 和腾讯成为上榜的四家企 业。五是从发布国家来看,如图 5 所示,中美发布数量旗鼓相当,占 比均为 47%左右。2023 年,国内大模型基准测试数据集“井喷式”发 展,推出包括 C-Eval、CMMLU 等评测数据集 100 多个,在中文评测 领域具有显著的影响力。虽然国内提出的基准数据集在数量上有明显 提升,但与美国提出的基准测试数据集相比,在国际上的影响力仍然 差距明显。

六是从测试数据集开源状况来看,如图 6 所示,开源测试数据集 更多,占比达到 69%,而闭源数据集仅占 31%。评测数据集开源对其 推广影响很大,产学研各界只有充分获取数据才可以高效进行测试。 但同时数据的开源会容易导致模型“作弊”的现象发生。因此,如何 在保证数据充分开放的前提下,对模型的数据污染状况进行检测成为 当前研究的热点。

当前人工智能测试已经由机器学习、深度学习测试时期进入大模 型测试时期,未来还将迈向通用人工智能(AGI)测试时期。产学研 各界推出的大模型基准测试数据集众多,这些数据集的构成和测试重 点各不相同,但表现出一些共性: 一是通用能力测试为主。目前产学研各界所发布的大模型基准测 试数据集大都侧重于模型的通用能力,包括大模型理解、生成、推理、 知识能力等,MMLU 和 GSM8K 等成为当前大模型最常用的评测基 准,而近期面向行业和应用的评测数据集已得到产业界广泛关注。 二是通过考试方式执行。虽然 Chatbot Arena 等采用“模型对战” 的方式完成评测,但当前大模型基准测试主要仍以考试方式为主,通 过在考题上的表现来衡量大模型能力。AGIEval、KoLA 等利用客观 选择题评测大模型知识能力,PubMedQA 等通过问答题评测生成能力。

三是测试数据构成类似。大模型基准测试的输入通常为测试数据, 常见的测试数据类型包括单选、多选、问答等。为提升自主测试效率,数据集还会提供标准答案、Prompt 样例和测试脚本等。同时,评测数 据集中通常还会包含一定量的模型微调数据来提升大模型表现。 四是测试结果仍需主观评估。当测试题目为客观选择题,测试结 果评估可以通过脚本高效执行。当测试题目为主观题或开放问答时, 仍然需要人工主观评估。虽然大模型已经作为“裁判”参与结果评估, 但据论文《Large Language Models are not Fair Evaluators》研究表明, 使用 GPT-4 进行结果评估容易受到“答案顺序”等因素影响。

除了上述共性外,大模型基准测试数据集也表现出一定差异性, 主要为:一是评测数据数量上的差异,知识类考察数据集的题目数量 通常会超过 1 万,例如 MMLU 和 C-Eval 的题目数量分别为 15858 和 13948,而代码类评测数据集中题目数量较少,如 MBPP 和 HumanEval 的题目数量仅为 974 和 164。二是评测环境上的差异,对语言大模型 的评测通常以考试的方式进行,而对于 AI 智能体(AGENT)或具身 智能系统的评测通常需要搭建仿真环境。三是评测目标上的差异,大 模型的训练可分为预训练、监督式微调、强化学习训练等几个阶段, 不同的评测数据集所针对的目标模型不相同。四是评测方法上不统一, 根据提示工程中提供样例多少,大模型可通过 zero-shot、few-shot 等 方式进行评测,但各大模型在评测方式上并不统一。

参考报告REPORT

大模型基准测试体系研究报告(2024年).pdf

大模型基准测试体系研究报告(2024年)。近几年,大模型推动人工智能技术迅猛发展,极大地拓展了机器智能的边界,展现出通用人工智能的“曙光”。如何准确、客观、全面衡量当前大模型能力,成为产学研用各界关注的重要问题。设计合理的任务、数据集和指标,对大模型进行基准测试,是定量评价大模型技术水平的主要方式。大模型基准测试不仅可以评估当前技术水平,指引未来学术研究,牵引产品研发、支撑行业应用,还可以辅助监管治理,也有利于增进社会公众对人工智能的正确认知,是促进人工智能技术产业发展的重要抓手。全球主要学术机构和头部企业都十分重视大模型基准测试,陆续发布了一系列评测数据集、框架和结果...

我来回答
分享至