数据丰富度与质量塑造大模型知识深度与广度。
一、软硬协同持续推动大模型能力提升
1.大模型发展对算力需求成井喷式增长大规模的训练和推理需要强大的高性能算力供应,高端AI 芯片是大模型高效训练和应用落地的核心,是决定大模型发展能力高低的关键。人工智能大模型参数规模和训练数据量巨大,需千卡以上 AI 芯片构成的服务器集群支撑,据测算,在 10 天内训练 1000 亿参数规模、1PB 训练数据集,约需 1.08w 个英伟达 A100 GPU,因大模型对高端AI 芯片需求激增及高端芯片进口供应受限,英伟达等高端芯片已供不应求。据《金融时报》估算,我国企业对英伟达A800、H800两款 GPU 产品的需求达 50 亿美元。
GPT-3 的训练使用了 128 台英伟达A100 服务器(练34天)对应 640P 算力,而 GPT-4 的训练使用了3125 台英伟达A100 服务器(练 90—100 天)对应15625P 算力。GPT-4模型的参数规模为 1.9 万亿,约为GPT-3 的10 倍,其用于训练的 GPU 数量增加了近 24 倍(且不考虑模型训练时间的增长)而目前正在开发的 GPT-5 模型预计参数量也将是T-4模型的 10 倍以上,达到 10 万亿级别,这将极大地提升大模型训练的算力需求。同时,各应用单位、科研院所科技企业的自研模型需求逐步增长,据工业和信息化部赛迪研究院发布的研究报告预测,到2024 年年底我国将有5%—8%的企业大模型参数从千亿级跃升至万亿级,算力需求增速会达到320%。
此外,未来在 AI 算力基础设施领域,将有越来越多的厂商采用定制化算力解决方案。在摩尔定律放缓的大背景之下,以往依靠摩尔定律推动着性能效益提升的途径越来越难以为继,要想得到最佳的计算性能,必须依靠针对特定应用和数据集合的体系架构。特别是在AI 大模型领域,不同厂商均有着不同的差异化需求,越来越多公司发现,一体适用的解决方案不再能满足其计算需求。为把每一颗芯片的性能、效率都发挥到极致,做到最佳优化,需要根据算法模型、工作负载等进行针对性优化。
2.AI芯片自研和算力优化成为应对算力需求的重要手段算力芯片是大模型的算力“发动机”,拥有算力资源的企业具备更强的竞争力,强大的算力资源可以加速模型训练、提升市场响应速度,强力支撑更复杂、更深层次的模型训练,从而提高模型的预测精度和整体性能。在大模型的高算力需求推动下,大厂加强AI 芯片研发力度,持续优化大语言模型所用的transformer 架构。如,谷歌为其最新款的 Pixel 手机装上了自研Tensor G3 芯片,让用户可以在手机端解锁生成式 AI 应用。微软宣布推出两款自研芯片 Maia100 和 Cobalt100。Maia100 用于加速AI亚马逊推出专为训练人工智能系统而设计的第二代AI 芯片Trainium2,以及通用 Graviton4 处理器,Trainium2 的性能是第一代 Trainium 的四倍,能源效率是其前身的两倍,相当于每个芯片可提供 650teraflops(每秒执行一万亿次浮点运算)的计算能力,由 10 万个 Trainium 芯片组成的集群可以在数周内训练出 3000 亿参数的大语言模型。亚马逊以40亿美金投资大模型创企 Anthropic 后,要求其使用亚马逊自研AI 芯片来构建、训练和部署大模型。OpenAI 也表示正尝试自研AI 芯片,并已开始评估潜在的收购目标。近年来,我国AI芯片技术能力不断提升,涌现出百度昆仑芯、海思昇腾、寒武纪、燧原科技、壁仞科技、海光、天数智芯、沐曦、芯动科技、摩尔线程等代表企业,并实现产品商业化。如百度昆仑芯 1 代 AI 芯片于 2020 年实现量产,已在百度搜索、小度助手、文心大模型推理业务等自有场景实现规模应用,已应用于互联网、工业制造、智慧金融等领域;针对大语言模型训练场景,百度昆仑芯可提供一整套精调的训练策略,其解决方案已通过某能源行业 SFT 训练模式,客户短期可打造专属行业大模型。 计算任务,帮助人工智能系统更快处理执行识别语音和图像等任务。
3.计算、存储、网络协同支持大模型训练大模型的研发训练高度依赖高端芯片、集群及生态,高计算性能、高通信带宽和大显存均是必要能力,计算、存储、网络任一环节出现瓶颈将导致运算速度严重下降。大语言模型的训练和推理受限于芯片通信速度,随着大模型的吞吐量大幅增长,芯片内部、芯片之间形成“存储墙”,其通信速度正成为计算瓶颈。因此,需要计算、存储、网络协同,提供更好的算力支持。主要包括以下四方面:一是分布式训练技术支撑训练需求。由于大模型的计算量非常大,单个计算节点很难满足训练需求。因此,需要使用分布式训练技术,将模型训练任务分配到多个计算节点上进行并行计算。这要求算力统筹具备高效的分布式训练框架和算法。二是算力管理和调度确保资源充分利用。随着大模型规模的不断扩大,算力管理和调度变得尤为重要。有效的算力管理和调度策略可以确保计算资源的充分利用,避免资源浪费,并提高训练效率。这包括合理的任务分配、负载均衡、资源监控和动态调整等。三是高速的内存和存储有效提升训练效率。大模型在训练过程中需要快速读取和写入大量数据,因此要求具备高速的内存和存储设备。例如,使用DDR4内存和NVMeSSD等高速存储设备可以显著提高训练效率。四是网络连接和通信影响训练速度。在分布式训练中,各个计算节点之间需要高速的网络连接来传输数据和同步梯度信息。因此,网络连接和通信的速度和稳定性对大模型的训练效率具有重要影响。目前,业界在计算、存储、网络的协同方面已开展有效工作。在分布式训练中,GPU 在机间和机内不断地进行通信, 5 利用 IB、RoCE 等高性能网络为机间通信提供高吞吐、低时延的服务,同时还需要对服务器的内部网络连接,以及集群网络中的通信拓扑进行专门设计,以满足大模型训练对通信的要求。英伟达GPU彼此之间的数据传输速率高达600GB/s,通过 8 个或 16 个 GPU 组成一个服务器主机,可以较好地实现高速数据传输,以支撑大规模的模型训练。百度智能云与NVIDIA 共同建成大规模高性能GPU/IB 集群,经过专门设计和优化,发挥集群的整体算力。
4.深度学习框架是大模型研发训练的关键支撑在当前的数字科技领域,算力的发展已经达到了万卡级别的庞大规模,即单体智算集群拥有上万个GPU计算节点。这种前所未有的强大算力为深度学习等复杂计算任务提供了坚实的算力支撑。而在训练过程中,高效的深度学习框架则扮演着至关重要的角色,不仅提供了简洁易用的编程接口,还能够在万卡集群上高效地分配和管理计算资源,确保大模型训练的稳定性和效率。如,百度飞桨(PaddlePaddle)集核心框架、基础模型库、端到端开发套件、丰富的工具组件于一体,实现了动静统一的框架设计,兼顾科研和产业需求,在开发便捷的深度学习框架、大规模分布式训练、高性能推理引擎、产业级模型库等技术上具备优势。在硬件适配方面,飞桨结合大模型适配需求,全面升级硬件适配方案,更好地支持硬件厂商灵活定 6 制、软硬协同深度优化,通过端到端自适应混合并行训练技术以及压缩、推理、服务部署的协同优化,通过支持硬件算子的编译和多 Stream 并行计算,减少等待和阻塞,实现了自定义融合策略和加速算子,支持硬件厂商灵活接入不同颗粒度算子。飞桨深度学习平台提供了高效的分布式训练架构,在万卡集群上,飞桨能够支持超大规模的模型训练任务,实现大量计算节点之间的高效协同,更好地完成大模型的训练任务,这不仅提高了训练效率,而且降低了训练成本。
5.大规模算力集群的创新应用与突破我国骨干厂商积极探索打造高性能算力集群,并通过协同优化、工具支持等实现高效稳定的大模型训练,提高算力使用效率。百度百舸 2.0 在 AI 计算、AI 存储、AI 容器等模块上进行了能力增强和功能丰富,并发布了AI 加速套件。AI 加速套件通过存训推一体化的方式,对数据的读取和查询、训练、推理进行加速,进一步提升AI 作业速度。为了提升集群通信效率,百度发布了弹性RDMA 网卡,相比传统专用的 RDMA 网络,弹性 RDMA 网络和VPC 网络进行了融合,使得用户的使用成本更低,同时通信延时降低了2-3倍。此外,百度在万卡集群的运维和稳定性方面也进行了大量优化工作,如通过自研的集群组网故障管理机制,降低了工程师在容错和故障恢复上的时间成本,优秀的运维能力和稳定性为大模型的训练提供了有力的保障。腾讯云发布新一代HCC领域。基于新一代集群,腾讯团队在同等数据集下,将万亿参数的 AI 大模型混元 NLP 训练由50 天缩短到4 天。其自研星脉高性能计算网络和高性能集合通信库TCCL,具备业界最高的 3.2TRDMA 通信带宽,在搭载同等数量的GPU情况下,为大模型训练优化 40%负载性能,消除多个网络原因导致的训练中断问题。浪潮信息AI 团队在2023 年相继研发了OGAI(Open GenAl Infra)大模型智算软件栈、源2.0大模型,从软硬协同层面去持续提升基础大模型的能力,同时通过开放算力发展生态去探索可能突破的场景。OGAI 面向以大模型为核心技术的生成式 AI 开发与应用场景,提供从集群系统环境部署到算力调度保障和大模型开发管理的全栈全流程的软件,从而降低大模型算力系统的使用门槛、优化大模型的研发效率,保障大模型的生产与应用。
二、数据丰富度与质量塑造大模型知识深度与广度
1.大模型对数据数量、质量提出新要求(1)海量高质量数据是大模型泛化涌现能力的基础从行业前沿趋势来看,大模型训练使用的数据集规模呈现爆发式的持续增长。根据公开资料显示,2018 年GPT-1数据集约4.6GB,2020年GPT-3数据集达到了753GB,而2021年 Gopher 数据集已达 10550GB,2023 年GPT-4 的数据量更是 GPT-3 的数十倍以上。同时,大模型快速迭代对训练数据的数据量、多样性和更新速度方面也提出了更高的要求。高质量的数据集在提取有效特征、训练精确模型以及提升跨场景学习能力等方面起到至关重要的作用,将成为突破模型和算法能力瓶颈的关键。约 1/3 的算法模型每月至少更新一次,约 1/4 的算法模型每日至少更新一次。算法模型的持续更新和升级,将不断提升对训练数据的数据量、多样性及更新速度等方面的需求。 大语言模型是基于注意力机制的预训练模型,足够多的用于自监督学习过程的基础训练数据是大模型区别于传统人工智能算法模型的主要特点,海量数据可以为模型提供更多的学习样本和更广泛的知识覆盖,有助于模型学习到更多的特征和关系。只有海量多源的数据支持预训练,大模型在后续的专门任务中才会表现出更强大的性能和更具启发性的生成能力。
数据的丰富性对大模型的后续的泛化和涌现能力至关重要,大语言模型对数据的多样性和复杂性。如果数据过于单一或简单,模型可能只能学习到有限的特征和模式,导致其在面对新数据时泛化能力较差。丰富的数据可以为模型提供更多的学习场景和挑战,有助于模型学习到更复杂的特征和关系,从而提高其泛化能力。大模型的目标是能够适应各种不同的输入,并对未见过的数据进行准确的预测。通过使用多维度的训练数据,模型可以学习更广泛的上下文和语言 9 规律,提高其泛化能力,节约资源和时间,使模型更具有实用性和可靠性。数据维度多样性的提升能够推动大模型从单一领域向多领域知识的跃迁,而非仅仅是单纯数量的增加,如果是简单的同类型数据反馈,单条数据反馈和十条同类型数据反馈,虽然在数据的数量上增加了10 倍,但模型的智能并没有得到拓展和增加,因此数据维度多样性可直接提升大模型在跨领域知识理解和应用的深度,实现了从单一领域向多领域知识迁移的质变。
数据的质量对模型的训练结果至关重要。数据存在大量的噪声、错误或冗余,模型可能会学习到错误的特征和关系,导致其性能下降。高质量的数据可以为模型提供更准确、更可靠的学习样本,有助于模型学习到更真实的特征和关系,从而提高其性能和泛化能力。数据时效性对于大模型的即时学习和适应能力具有显著作用,随着数据需求种类日益丰富,数据时效性对于大模型的即时学习和适应能力至关重要。通过提高数据服务交付时效提升数据服务开发效率,实现大模型对新兴趋势和紧急事件的快速响应。 海量丰富高质量的数据是大模型泛化涌现能力的基础。只有具备以上条件,大模型才能在训练过程中学习到更多的知识和规律,从而在面对新数据时表现出更好的性能和泛化能力。高质量数据集的构建成为提升大模型预测准确性和决策可靠性的关键,数据质量已成为影响模型性能的决定性因素。训练数据影响了模型的“基因”,在大模型快速发展的时代,谁能产出更多样、更复杂的高质量预训练数据集,从源头上决定着大模型研发的效果,也成为国内外厂商聚焦竞争的第一个战场。这也是为什么在训练大模型时,需要花费大量的时间和精力来收集、清洗和标注数据的原因。
(2)我国人工智能发展数据需求持续增长目前,于国内数据要素市场发展尚处于初级阶段,我国人工智能领域数据供给生态不健全,数据流通规则和数据供需对接机制未有效建立,目前国内尚末形成高效完整的人工智能数据产品供应链。训练数据一是数据资源加工成本高。在模型训练过程中,通常 80%的工作是数据构建和准备高质量数据,人工智能企业需要花费大量的人力和物力进行数据采集、清洗和标注,成本极高。同时,人工智能企业通常难以获取行业高质量数据集,常陷入“寻数无门”的困境。二是国内人工智能领域高质量数据集缺乏。当前,主流大模型预训练数据主要来源于公开数据集和大规模网络数据,虽然我国已有部分中文开源数据集,但在数量上远远少于国际英文公开数据集,在数据质量方面参差不齐、部分内容十分陈旧。由于高质量数据集的缺乏,部分国内大模型采用“英文数据集+翻译软件”的方式生成中文语料库,导致训练结果不佳。
2.产业各方加快构建高质量丰富数据集(1)各地政府、研究机构积极推进构建高质量数据集在地方政府层面,北京等加大高质量数据集供给,抢跑大模型发展赛道,2023 年 7 月,北京市发布“北京市人工智能大模型高质量数据集”,包括《人民日报》语料数据集、国家法律法规语料数据集、两会参政议政建言数据集、“科情头条”全球科技动态数据集、中国科学引文数据库数据集、科技文献挖掘语义标注数据集等,涵盖经济、政治、文化、社会、生态等不同领域,总规模超过500T。同年8 月,北京市人工智能大模型高质量数据集(第二批)发布,涉及医学、生物、农业、金融、政务、互联网、智慧城市、自动驾驶、科技服务、商业分析、产业研究、市场营销等多个领域,数据总量规模约 112TB(数据储存单位),为通用大模型和行业大模型训练及应用落地提供了坚实有力的“资源”保障。在研究机构层面,2023 年11 月中科大和上海AI Lab的研 究 者 们 推 出 了 具 有 开 创性意义的大型图文数据集ShareGPT4V。ShareGPT4V 数据集包含120 万条“图像-高度详细的文本描述”数据,囊括了世界知识、对象属性、空间关系、艺术评价等众多方面,在多样性和信息涵盖度等方面超越了现有的数据。
(2) 深入生产生活场景挖掘高质量数据集数据是日常活动的科学记录,人工智能之所以能够发挥 12 支撑和驱动数字经济的重要作用,本质上在于忠实而有效地处理现实数据。深入生产生活场景中挖掘高质量数据集,是数据驱动时代的关键任务。 以明确的目标为先导,通过精准的数据采集策略,从源头获取真实、全面的原始数据。在数据清洗与预处理环节,要运用专业技术和细致的分析,去除噪声、填补缺失值,确保数据的准确性和完整性。以制造业为例,企业可收集设备型号、维修记录等静态数据,以及温度、振动等实时动态数据,经过清洗和标注后,用于训练预测模型。数据集的划分同样重要,需确保训练集、验证集和测试集的合理分布,以充分验证模型的性能和泛化能力。此外,数据集的文档编写和元数据管理也不容忽视,它们为数据集的长期维护和更新提供了坚实的基础。
在实际操作中需要面对数据来源的多样性、数据质量的参差不齐、数据采集和处理成本的高昂问题,需要制定周密的数据采集计划,选择合适的数据源,并运用先进的数据清洗和预处理技术,以确保数据的准确性和一致性。同时,还需要注重数据的时效性和动态性,及时更新和维护数据集,以适应业务的发展和变化,从海量数据中提炼出有价值的信息,为业务决策和模型训练提供有力支持。同时,在数据集构建全流程过程中,人的因素同样重要。需要组建专业的数据团队,具备深厚的数据分析能力和丰富的业务知识,能够 13 深入理解业务需求,从海量数据中挖掘出有价值的信息。与此同时,还需要建立科学的数据管理制度和流程,确保数据的安全性和隐私性,防止数据泄露和滥用。能够反映生产生活实际中深层次现实规律的数据是具有天然价值的,而对齐进行科学的加工和处理则使其具备了工程上的利用价值,需要专门的团队以科学的态度、专业的能力和严谨的精神,不断探索和实践。
三、算法优化与创新推动大模型能力升级
1.多阶段对齐促进大模型更符合人类价值观为了确保模型与人类的判断和选择更加贴合,大模型研发企业如百度、讯飞等采用了一系列先进的技术,包括有监督精调、偏好学习和强化学习等,以进行多阶段对齐。这一综合性的方法旨在逐步校准模型的行为,使其能够更准确地反映人类的意图和偏好。基于有监督精调、偏好学习和强化学习等多阶段对齐技术,能够有效地保证模型与人类的判断和选择更加一致。这种综合性的方法不仅提高了模型的性能,还增强了其与人类交互的可用性和可靠性。一是利用有监督精调技术对模型进行初步优化。在这一阶段,使用大量标注过的数据集来训练模型,使其能够学习并理解人类对于特定任务的判断标准。通过不断迭代和调整模型的参数,逐步提升其对于任务的准确性,为后续的对齐工作奠定坚实基础。 二是采用偏好学习技术来进一步校准模型。偏好学习关注于捕捉人类对于不同选项或结果的偏好程度。通过设计精巧的实验和收集用户反馈,构建一个包含偏好信息的数据集。然后,利用这些数据来训练模型,使其能够学习到人类的偏好模式,并在后续的任务中考虑到这些因素。三是引入强化学习技术来优化模型的行为。强化学习通过让模型在与环境的交互中学习和优化行为策略,以实现特定目标。开发者将人类的判断和选择作为环境的反馈信号,通过调整模型的奖励函数来引导其向更符合人类期望的方向发展。通过不断试错和调整策略,模型逐渐学会了如何在各种情况下做出符合人类偏好的选择。
2.运用知识增强提升模型准确性现实世界中仅依靠模型从原始数据中学习远远不够。知识增强可以将人类已有的知识、经验和规则融入模型中,为模型提供额外的信息和指导。这有助于模型更好地理解数据的本质和上下文,从而做出更准确的预测和决策。为提升大模型的准确性,大模型可以在输入、输出两个阶段都运用知识点增强,具体做法为在输入端对用户输入的问题进行理解, 16 并拆解所需的知识点,然后在搜索引擎、知识图谱、数据库中获取准确知识,最后把得到的知识组装进prompt 送入大模型;输出端会对大模型的输出进行“反思”,从生成结果中拆解出知识点,然后利用搜索引擎、知识图谱、数据库及大模型本身进行确认,修正偏差。主要表现在以下三方面:一是知识增强可以提高模型的泛化能力。在训练数据有限或分布不均的情况下,模型很容易出现过拟合现象,即过于依赖训练数据中的特定模式而忽视了一般规律。通过引入外部知识,可以帮助模型捕捉到更广泛、更本质的特征,使其在未见过的数据上也能表现出良好的性能。二是知识增强还有助于提升模型的解释性。随着人工智能技术的不断发展,模型的可解释性逐渐成为人们关注的焦点。通过融入人类知识,可以使模型在做出决策时更符合人类的思维方式和逻辑习惯,从而提高模型的可解释性和可信度。 三是知识增强也是实现人机协同的重要手段。在未来的智能化系统中,人类和机器将更加紧密地合作。通过运用知识增强技术,可以使机器更好地理解和利用人类的知识与智慧,从而实现更高效、更智能的人机协同工作。