大模型评价基准概念与类型梳理

大模型评价基准概念与类型梳理

最佳答案 匿名用户编辑于2025/07/18 10:10

近年来,随着越来越多的公司推出大模型,不同模型之间的侧重点越来越细分,模型评价与筛选越来越成为一个重要的工作。

以 OpenAI 公司的 ChatGPT 系列为例,截至目前OpenAI 将旗下模型分为:推理模型、旗舰模型、成本优化模型、实时模型、图片生成模型、文生语音模型、语音转录模型、特定工具模型、Embedding 模型、适度微调模型、较早前模型。除去特定场景使用模型,仅考虑推理模型、旗舰模型、成本优化模型三类模型,现阶段就有 17 个模型可供选择。在如此之多的选择下,如何在合理评价的基础上选择合适的模型已成为必不可少的环节。

而客观、量化的评价大模型离不开大模型评价基准(benchmark)。没有明确的评价标准时,选择模型通常依靠直觉或厂商宣传,容易误选不适合自身需求的模型;与此同时,在众多企业都追求大模型本地化的当下,大模型的部署和维护成本通常较高,盲目选择可能导致资源浪费。 我们常见的大模型评价基准可以按能力维度进行分类,包括:代码能力、数学与逻辑推理能力、指令遵循能力、工具/函数调用能力以及通用知识与多任务推理能力。

LiveCodeBench 是由 UC Berkeley、MIT 等机构提出的一个综合且无数据污染的代码能力评测基准。它持续收集最新的编程竞赛问题,并设计多种场景测试代码相关的不同能力。LiveCodeBench 不仅包含传统的代码生成(根据问题描述生成正确工作的代码),还扩展到代码自我修复(模型对自己生成的错误代码进行调试修改)、代码执行(预测代码运行的结果)、测试输出预测(根据代码和输入推测单元测试的输出)等多方面。这使评测更全面,反映真实编程场景中的多种需求。 截至 2025 年 4 月,LiveCodeBench(release_v6)已收录了1055道高质量编程题目。这些题目来自 LeetCode、AtCoder、Codeforces 三大竞赛平台,每道题都有明确的问题描述和对应的参考解答/测试,用于自动评估代码正确性。题目难度覆盖简单到高难,能够区分不同水平模型的性能。基准允许按题目发布日期筛选,以评估模型在训练截止后出现的新题上的泛化能力,从而检测训练数据泄漏(污染)情况。 在评分过程中,LiveCodeBench 采取 Pass@K 打分模式,即根据模型在K次尝试中是否能够至少有一次成功给出正确的解答来计算,具体步骤为:1. 模型生成代码:模型针对同一个任务多次生成代码。2. 运行代码并评测结果:执行每次生成的代码并对其进行评测。3. 计算 Pass@k:根据在前 k 次生成的代码是否成功,通过标准单元测试来判断 Pass@k。 LiveCodeBench 还会进行思维链评估,部分任务要求模型输出推理步骤(Chain-of-Thought),再生成代码,以检验逻辑严谨性。

数学问题评测可考查模型的多步推理、定量计算和逻辑思维能力,通常通过提出需要推导过程才能得出结果的题目。AIME 全称为American InvitationalMathematics Examination(美国数学邀请赛),由于题目难度高、形式严谨,AIME近年来被广泛用于评估 LLM 的数学推理能力。

AIME 的问题涉及各类高中奥林匹克数学领域,包括代数、几何、组合数学、数论等高级数学知识和巧妙解题技巧,要求模型输出0-999 范围内的整数答案。数据集包含 30 道竞赛级数学题,题目难度呈梯度分布:前5 题对应AMC12中等难度水平;中段题目需要综合应用多个数学领域知识;后5 题达到国际数学奥林匹克(IMO)预选题难度。

对于 AIME 这类填空题,评测只需将模型最终答案与标准答案比对即可。由于答案是整数,准确匹配即可计分。评测可自动完成,无需人工判断。值得注意的是,模型在 AIME 题上很容易出错在推理中途。为了提高准确率,评测者有时会让模型生成多个答案尝试(如所谓的 pass@k 指标)。还有研究使用投票验证或链式思维技术提升模型表现。OpenAI 等机构报告显示,即使最强模型GPT-4,在未特殊训练下 AIME 题的正确率也远低于人类满分水平,但借助特殊技巧可逐步提升。

BFCL(Berkeley Function-Calling Leaderboard)基准是由UCBerkeleyGorilla 团队开发的大模型评价基准,旨在系统评估LLM 在函数调用场景下的表现,被认为是首个全面测试模型工具使用能力的基准。目前是AI 智能体(AIAgent)领域最具影响力的评测基准之一。

参考报告REPORT

金融工程行业专题报告:基于大模型外部评价指标体系框架介绍.pdf

金融工程行业专题报告:基于大模型外部评价指标体系框架介绍。构建评价大模型金融问答能力的基准:为系统性地评估大模型在金融领域的专业问答能力,本报告首先梳理了现有通用及金融领域评价基准的特点与不足。在此基础上,我们构建了一个全新的、专注于逻辑推理的金融问答能力评价基准。该基准围绕金融相关的计算、财务报表分析、权益投资等九大核心类别,构建了包含188道高质量单项选择题的题库。每道题目附带了平衡了客观性与代表性的、可验证的推理过程(思维链),旨在深入考察模型的逻辑推理与专业知识应用能力。评测实验:为检验模型的实际表现,我们设计了全面的评测实验。实验选取了DeepSeek、混元、Qwen、GLM等国内主...

我来回答
分享至