大模型基准测试体系包括哪些?

大模型基准测试体系包括哪些?

最佳答案 匿名用户编辑于2024/07/22 16:55

2023 年,大模型基准测试迎来飞速发展的一年,大模型的评测体 系、数据集、方法、工具如雨后春笋般出现。

与传统认为 Benchmark 仅包含评测数据集不同,大模型基准测试 体系包括关键四要素:测试指标体系、测试数据集、测试方法和测试 工具。指标体系定义了“测什么?”,测试方法决定“如何测?”, 测试数据集确定“用什么测?”,测试工具决定“如何执行?”。

1. 测试指标体系 在进行大模型基准测试时,首先需要确定测试的指标体系,明确 评测的维度和对应指标。大模型评测的指标体系可以按照四层结构进行构建。测试场景定义了待测试模型的外在 环境条件的组合,如通用场景、专业场景、安全场景等。测试能力决 定了模型的测试维度,如理解能力、生成能力、推理能力、长文本处 理能力等。针对待测试的能力,可以通过多种任务完成测试。如语言 大模型的理解能力可以重点考察在文本分类、情感分析、阅读理解、 自然语言推理、语义歧义消解等任务中的表现。对于不同的测试任务, 需要与不同的指标进行关联。如文本分类可以计算准确率、召回率等 指标,而阅读理解可以利用准确率、F1 Scores、BLUE、ROUGE 等进 行考察。

2. 测试数据集 按照大模型可处理的信息模态,可以将大模型分为语言大模型、 多模态模型、语音大模型等。其中,语言大模型和多模态大模型的研 究和应用最为广泛。语言大模型的输入和输出均为自然语言,多模态 大模型的输入和输出为不同模态的数据。下面对语言大模型和多模态 模型评测中常用数据集进行梳理和介绍。 对语言大模型的通用能力进行评测需要考察理解能力、生成能力、 推理能力、知识能力、学科能力、多语言能力、长文本能力、思维链 能力、角色扮演能力、工具使用能力、可靠性、鲁棒性等。代表性的 评测数据集如附录表 1 所示,包括 MMLU、BBH、GSM8K 等。对语 言大模型的行业能力进行评测需要考察行业通用能力、行业知识能力、 行业场景能力、行业安全能力等。代表性的评测数据集如附录表 2 所 示,包括 FinEval、PubMedQA、JEC-QA 等。对语言大模型的应用能 力进行评测需要考察大模型在智能客服、知识管理、数据分析、办公助手、内容创作、网页助手、代码助手、任务规划、智能代理、具身 智能等应用中的效果。代表性的评测数据集如附录表 3 所示,包括 GAIA、APPS、AgentBench 等。对语言大模型的安全能力进行评测需 要考察大模型内容安全、伦理安全、隐私安全、模型安全等,代表性 的评测数据集如附录表 4 所示,包括 SafetyBench、TOXIGEN、JADE 等。当前对多模态大模型的评测主要集中在通用能力,主要包括视觉 问答、视觉推理、视觉处理、视觉描述、视觉生成、可靠性等。代表 性评测数据集如附录表 5 所示,包括 MMBench、LLaVA-Bench、POPE、 OCRBench 等。

3. 测试方法 大模型基准测试方法的研究主要集中在大模型的整体评测流程 或评测方式的创新。如图 8 所示,大模型的评测流程包括测试需求分 析、测试环境准备、测试数据构建、基准测试执行、测试结果评估和 测试结果展示等。本报告对每个环节涉及的内容进行介绍。

 

测试需求分析通常是大模型测试过程中的第一步,通过对测试需 求进行全面和准确的覆盖,有助于确保测试活动的有效性和高效性。 大模型测试需求分析需要完成以下任务:确定评测目的,预评估待测 模型,测试体系设计,测试方案设计,测试输入(输出)分析,测试可实施性分析等。 测试环境准备是大模型测试的基础,需要搭建配套的软硬件平台 保证测试顺利执行。首先,根据被测模型的实际性能要求需要搭建测 试软硬件环境。其次,对于单一模型的少样本测试,可利用脚本完成 测试,而对于多个模型的大数据量测试,需要使用测试框架,可将其 部署在单一服务器或集群中。再者,对私有化部署大模型,需要将其 部署在环境中。最后,可使用少量测试数据对测试环境功能进行验证。 大模型评测数据可以通过人工构建、题目自动化扩充和智能算法 生成三种方式进行定期补充或更新。人工构建方式主要是通过人工采 集、标注的方式构建测试数据。面向大模型的测试数据的构建流程一 般包括方案设计、数据采集、数据标注、数据清洗、数据增强、数据 规范化和数据存储等环节。在实际大模型评测中,应针对模型的薄弱 点定期进行评测数据集的更新工作,以保证评测数据的有效性。

题目自动扩充主要利用“模板”化信息提取算法或对抗样本生成 对题库中题目的可变量进行“替换”,从而“衍生”生成相似题目。 其在一定程度上防止大模型通过“刷题”和“记题”方式获取更高的 分数,并验证大模型的鲁棒性。微软提出动态测试框架 DyVal,利用 有向无环图动态生成测试数据,减少测试数据被大模型记忆的可能。 PromptBench 对大模型的提示工程词进行字符级别、单词级别、句子 级别和语义级别的黑盒攻击,来对语言大模型的鲁棒性进行评测。智 能算法生成主要是利用一些先进的人工智能技术(如大模型)自动化 生成一定量的新题目。目前基于大模型的智能出题已有实际的应用范例,例如考试星推出的智能考试命题服务中,使用大模型对一段长文 本进行自动化出题,涉及题型包括单选、多选、问答等。香港中文大 学推出了数学推理问题的合成数据方法 MathGenie,通过训练一个反 向翻译模型对种子试题集的增广解决方案进行反演,从而得到更多的 数学题目。目前智能算法生成的题目质量很难保证,需要人工进行核 验,以确保测试题目质量。

为了保证测试结果的公正性,大模型评测数据集应该提供统一、 标准的提示工程(Prompt)范例,支持 Zero-shot、Few-Shot 等多种评 测模式。通过优化提示工程词内容可以提升大模型的表现,但为了保 证结果的可比性,推荐使用评测数据集所提供的提示工程样例,并且 所有的大模型所使用的评测提示工程词应该保持一致。 测试执行阶段需要将测试数据输入被测模型,并观察被测模型的 输出结果。从执行方式上,根据实际需求(测试数据量、测试成本等) 可使用单点和分布式两种方式执行。单点执行在单台服务器上将测试 数据依次输入大模型,并收集大模型的输出结果。分布式执行通过中 心节点对测试任务和数据集进行切分,再分发至单点服务器上分布式 执行,最后通过中心节点对大模型输出结果进行汇总并统计,测试成 本相对较高。

对于大模型生成的结果需要使用合理的评估指标进行衡量,以确 保生成内容的正确性和准确性。大模型生成内容的评估方式可以分为 自动化评估和人工评估。传统自动化评估通过计算特定指标完成模型 生成内容和标准答案的对比。对客观类评测题目(如选择题)的结果评估相对简单,若模型的回答不满足提示工程词要求,会采取特定的 策略(如正则匹配)完成答案的对比。由于大模型生成内容较为灵活, 对主观类题目(如问答题)进行自动化评估难度较高。若生成内容较 为规范,如机器翻译和文本摘要等,可以计算 BLEU、ROUGE 等指 标。但对于较复杂或专业的生成内容,需要专家对结果的正确性和准 确性进行人工评判,其对评估人员资质和具体评测方式等有一定要求, 如评估人员需要具有专业化背景、评估人员数量要充足等。

现有研究尝试将大模型作为自动化结果评估工具来对其它模型 的生成内容质量进行评估,例如 AlpacaEval 等采用 GPT-4 对其它模 型的生成结果进行质量分级。根据《Benchmarking Foundation Models with Language-Model-as-an-Examiner》等论文结果,这种评估方式有 望成为人工评估的有效替代。其按照技术原理可分为基于提示工程词 和模型微调两种方式。前者一般会设计高质量的提示词,利用大模型 来对生成内容进行打分。该方式可通过优化提示词内容或构建大模型 裁判网络来提升评估效果。中科院在论文《Wider and deeper llm networks are fairer llm evaluators》中以大模型作为神经元搭建“裁判” 网络 WideDeep,人机评估一致率达到 93%。基于模型微调的方式主 要利用相关数据对大模型进行训练以提升评判的准确率。代表性的成 果包括清华大学的CRITIQUELLM和北京智源研究院的JudgeLM等。

大模型基准测试结果可以通过测试报告、模型榜单、雷达图、柱 状图等多种形式进行展示。大模型测试报告中需要包含评测目标、数 据集描述、测试任务描述、测试环境描述、评估指标、量化结果、可化结果、对比分析、评测结论、建议提升方向、错误样例等内容。 4. 测试工具 测试工具是测试方法的落地实践方式,是提升大模型评测效率的 重要手段。大模型基准测试工具通常需要支持数据集管理、模型库管 理、API 管理、测试任务分发、测试指标计算、测试结果分析、测试 结果展示等多种基础功能。图 9 展示了由卡塔尔计算研究所所提出的 开源大模型基准测试评测工具 LLMeBench 原理图。从图中可以发现, 其包含数据加载模块、提示工程词模块、模型执行模块、后处理模块 和结果评估模块,与大模型的基准测试流程基本一致。当前大模型的 基准测试工具在测试数据集构建和测试结果评估阶段仍然需要人工 参与,全自动化的基准测试工具仍是产业界的迫切需求。

 

参考报告REPORT

大模型基准测试体系研究报告(2024年).pdf

大模型基准测试体系研究报告(2024年)。近几年,大模型推动人工智能技术迅猛发展,极大地拓展了机器智能的边界,展现出通用人工智能的“曙光”。如何准确、客观、全面衡量当前大模型能力,成为产学研用各界关注的重要问题。设计合理的任务、数据集和指标,对大模型进行基准测试,是定量评价大模型技术水平的主要方式。大模型基准测试不仅可以评估当前技术水平,指引未来学术研究,牵引产品研发、支撑行业应用,还可以辅助监管治理,也有利于增进社会公众对人工智能的正确认知,是促进人工智能技术产业发展的重要抓手。全球主要学术机构和头部企业都十分重视大模型基准测试,陆续发布了一系列评测数据集、框架和结果...

我来回答
分享至