大模型基准测试发展意义、总结与展望分析

大模型基准测试发展意义、总结与展望分析

最佳答案 匿名用户编辑于2024/07/22 16:55

近几年,大模型推动人工智能技术迅猛发展,极大地拓展了机器 智能的边界,展现出通用人工智能的“曙光”,全球各大科技巨头和创 新型企业纷纷围绕大模型加强布局。

1.大模型基准测试的重要意义

当前,基准测试已赋能大模型“建用管”全生命周期的多个阶段, 在大模型研发、应用和管理中扮演重要角色,主要表现在: 一是指引学术研究。 过去一年,在 ChatGPT 的引领下,国内外 的大模型企业也从最初摸索和尝试,逐渐步入研发和应用深水区。大 模型研发迭代周期正在缩短,OpenAI 在一年时间内先后发布 ChatGPT、GPT4、GPT-4V 等多款大模型,Meta 的 LLaMA 大模型一 经发布便迅速带动了 Alpaca、Vicuna 等几十个开源大模型,形成“羊 驼”开源大模型生态圈。在如此高的迭代频率下,大模型基准测试可 以验证模型研发效果,快速挖掘大模型当前的不足与痛点问题,推动 大模型能力持续提升。并且,大模型评测不应该是开发流程的终点,而应该作为起点驱动模型开发。构建以能力提升为目标的评估 (Enhancement-Oriented Evaluation)策略对大模型发展十分重要,建 立“开发-部署-应用-测试”的闭环流程将缩短产品迭代周期。

二是指导产品选型。近期,商业公司和研究机构等纷纷推出大模 型榜单来对大模型的能力进行排序,大模型“打榜”逐渐成为各界关 注的话题。国外大模型榜单 Open LLM Leaderboard 使用 4 个公开数 据集对大模型进行综合测评。加州大学伯克利分校借鉴 Elo 评分系统 推出了 Chatbot Arena,采用众包方式对大模型进行匿名、随机化的对 战,得到模型的能力分级。斯坦福大学的 AlpacaEval 使用强大的语言 模型(如 GPT-4)对大模型进行评估,提升评测效率。国内的 OpenCompass、FlagEval、SuperCLUE、SuperBench 等分别发布大模 型评测榜单,对中文大模型进行重点评测。大模型能力“榜单”确实能 够在一定程度上反映出大模型能力,对于大模型的科学研究和能力提 升提供正向借鉴意义。此外,在大模型的实际应用中,大模型的使用 方需要综合考虑业务需求、花费成本、系统架构、安全要求等因素进 行大模型的产品选型(POC)测试。大模型基准测试利用客观数据集 对模型能力进行全面、客观的验证,这已经成为 POC 测试的主要落 地方式,在大模型行业和应用落地中扮演重要角色。

三是支撑行业应用。近期,“人工智能+”行动的开展驱动了大 模型在各应用场景中落地。大模型已经在金融、医疗、软件工程、教 育、法律、科研、政务、电信、能源、工业、汽车、机器人等行业领 域中取得一定的应用成果。同时,面向行业的大模型基准测试也取得显著进展,目前已推出多种面向行业应用的评测数据集,例如金融领 域的 FinEval,医疗领域的 PubMedQA,软件领域的 MBPP、HumanEval 等。用户在进行大模型行业应用时,无论通过外部采购或自主研发的 方式构建大模型能力,都需要利用基准测试对备选大模型进行量化评 估,才能保障大模型的行业应用效果。 四是辅助监管治理。随着大模型性能的不断提升,安全隐患和威 胁的阴影始终如达摩克里斯之剑悬在人类头顶。近期,人工智能专家 Geoffrey Hinton 在接受《60 分钟》公开采访中表示了对人工智能存在 的安全隐患的担忧,并担心人类将会被其接管。目前随着 TOXIGEN、 CVALUES 等数据集推出,对大模型的内容合规评测等已经取得一定 进展,但在大模型的诚实性、自主意识和隐私保护等方面仍缺乏高质 量基准。大模型基准测试对保障模型内容安全和能力监控发挥重要作 用,可以引导其朝着更健康、更安全的方向发展,让大模型的成果惠 及全人类。

2.总结与展望

伴随着大模型基准测试的蓬勃发展,针对大模型各个维度的测试 方法如雨后春笋般出现。大模型基准测试不应该仅仅作为大模型研发 的终点,以发布测试榜单为目的,更重要的是切实发现大模型问题, 驱动大模型能力的提升,指导大模型的研究方向和应用路线。因此, 产学研各界应该在探索新的测试方法、构建自动化测试平台以及共享 高质量评测数据集等方面协同发力。未来,对 AGI 进行全方位、科学 化的评估,将成为人工智能领域亟待解决的重要问题。

(一)形成面向产业应用的大模型评测体系 随着人工智能技术的不断发展,大模型的应用日益广泛,为各行 各业带来了巨大的变革和可能性。在金融、医疗、法律、交通、教育 等各个领域,大模型展现出了巨大的应用潜力,有望提升工作效率, 优化应用效果。此外,基于大模型的 AI 原生应用也逐渐进入人们的 视野,大模型不仅能完成智能客服、知识管理、数据分析等简单任务, 还可借助外部工具助力人类进行网络购物、旅行规划、餐馆预定等复 杂活动。然而,由于当前产业应用数据大多在行业用户的手中。因此, 虽然行业测评基准已初步建立,但面向大模型应用评测的评测数据集 仍较为缺乏。 随着“人工智能+”行动的开展,各行业将以大模型实际落地的 效果为评估目标,形成不同行业和应用效果评估的体系和方法论,积 极建立面向产业场景化应用的评测数据集,探索面向行业和场景化应 用的新型评测方法,切实推动大模型基准测试在行业场景中进行落地,全面正向驱动大模型的发展与应用。

(二)构建超自动化的大模型基准测试平台 大模型基准测试的流程包括测试需求分析、测试环境准备、测试 数据构建、基准测试执行、测试结果评估、测试结果展示等。其中, 测试数据准备和测试结果评估这两步均需要投入大量人力,工作繁琐。 并且,大基准测试执行可通过单点、分布式等方式进行,不同的硬件 环境将直接影响模型的评测效率。由于评测结果会直接指引下一步研 发方向,因此基准测试的自动化、工程化和批量化处理非常关键,可 直接决定大模型整体的迭代效率。如何全自动化地完成大模型的测试、 快速挖掘大模型缺陷、降低测试人力的投入是该领域值得深入研究的 问题。 基准测试不应该仅作为 AI 应用开发的终点,而是要成为一个新 起点,驱动大模型的能力持续提升。未来将会出现企业级的自动化大 模型基准测试平台,保证从测试需求分析到测试结果统计的全流程质 量把控。其不仅需要具备测试任务高效分发、分布式批量执行、测试 结果自动统计等基础功能,还应该支持流程中的测试数据构建和测试 结果评估等工作。例如,当前自动生成的测试数据质量很难保证,需 要人工进行复核,上述操作可以在平台页面上完成。测试平台中可以 集成已训练好的“裁判”大模型,助力大模型生成内容的正确性评估, 降低评估的人力成本。

(三)探索 AGI 等先进人工智能的评测技术人工智能技术发展迅速,大模型、RAG、AGENT、具身智能、 AGI 等新概念和新技术层出不穷。大模型基准测试作为研究较为深入 的领域,将带动其他新技术的研究。当前虽然 AGI 仍未有明确的定 义,但针对 AGI 的探索性评测研究已有初步成果。例如微软发布论 文《通用人工智能的火花:GPT-4 的早期实验》,通过数学、编程、 视觉、医学、法律、心理学等复杂度较高的任务证明 GPT-4 已经进入 AGI 的早期阶段。北京通用人工智能研究院发布《通智测试:通用人 工智能具身物理与社会测试评级系统》,提出一种基于能力和价值维 度的 AGI 的评测方法。中国科学院和美国俄亥俄州立大学等先后推 出 AGIBench 和 MMMU 评测数据集,从多模态、多学科、多粒度等 维度衡量大模型距离 AGI 的差距。虽然当前 AGI 的发展仍然处于初 期阶段,但通过基准测试的研究,可以为未来 AGI 的发展方向提供 思路,并对 AGI 的能力进行监控以指引其正向发展。

参考报告REPORT

大模型基准测试体系研究报告(2024年).pdf

大模型基准测试体系研究报告(2024年)。近几年,大模型推动人工智能技术迅猛发展,极大地拓展了机器智能的边界,展现出通用人工智能的“曙光”。如何准确、客观、全面衡量当前大模型能力,成为产学研用各界关注的重要问题。设计合理的任务、数据集和指标,对大模型进行基准测试,是定量评价大模型技术水平的主要方式。大模型基准测试不仅可以评估当前技术水平,指引未来学术研究,牵引产品研发、支撑行业应用,还可以辅助监管治理,也有利于增进社会公众对人工智能的正确认知,是促进人工智能技术产业发展的重要抓手。全球主要学术机构和头部企业都十分重视大模型基准测试,陆续发布了一系列评测数据集、框架和结果...

我来回答
分享至