具体涵盖业务需求分析与资源评估、行业数据与大模型共建、行业大模型微调与优化部署等关键环节。
1.行业需求分析与资源评估
构建行业大模型首先需要对业务需求和资源进行评估,具体包括包括业务需求评估、算力层评估、算法层评估、数据层评估和工程层评估等。
业务需求评估
业务需求评估主要是明确业务的具体需求,将业务需求转换为明确、可量化的目标,从而确定行业模型构建的基本方向。行业用户可以结合实际场景和需求,对以下三点进行明确:(1)业务数据:明确需要处理的数据模态。不同的数据模型影响基础大模型的选择; (2)业务指标:将业务需求初步细化为多个子任务,明确各子任务的期望指标; (3)业务服务方式:明确行业用户需要的服务方式。服务方式包括私有化部署或公有化部署,行业用户可以基于技术服务商提供的基础大模型进行私有化部署,也可以利用自有的大模型,通过技术服务提供商提供的模型工具,丰富私有化的部署手段。同样,采用公有云部署的行业用户,也可以根据实际业务需要,确定使用自有的大模型或是由技术服务提供商提供的基础模型。
算力层评估
算力层评估主要是确定行业大模型在实际训练和部署中需要使用的算力资源类型和大小,从而对成本和进行时间预估。在算力评估方面,行业用户需要重点评估计算、存储和网络三部分。

一是计算能力,需要考量不同算力上的行业大模型训练时长和成本情况。训练所需要的资源,通常与模型的参数量级,标注后的数据集大小相关。结合训练所采用的芯片、所支持计算网络,以及所选用的精调算法,可以评估单次训练时长。算力层评估可以在模型训练和部署层面上分别进行评估:
(1)模型训练算力评估,以通用单卡芯片为例,计算能力可达到 312 TFLOPS,若基础大模型参数为百亿,采用有监督的参数精调(SFT)方式,标注后数据集为 1GB,采用RDMA 100G网络,这通常需要 32 张卡,每次训练耗时 2 至 3 周;若精调采用Lora 方式,每次训练耗时可缩短到 1 周。 (2)模型推理算力评估,推理所需要的算力资源,通常以QPS(每秒查询数)评估,这与模型参数、芯片型号和数量相关。生成类模型的推理性能,一般以每秒生成的 token 数衡量。若模型参数达到百亿,运行大小 30G,在 2 卡条件下,QPS 约可达到130 tokens/s。
二是存储方案,训练数据和大模型需要大量的存储空间,行业用户可以根据训练数据的大小,评估所采用的存储方案。当前,有多类的存储方案可以选择,包括: (1)对象存储 COS(Cloud Object Storage),读取模式可谓下载数据到训练机器本地,读写速度可以超过0.42GB/s,若采用COS+GooseFS 存储方案,可以提供基于对象存储的多层缓存加速,IOPS 可达 20 万; (2)文件存储 CFS(Cloud Files Storage),IOPS 可达3 万,若采用 CFS Turbo 方案,IOPS 可达 300 万。通常训练数据小于 50GB 时,行业用户可采用COS 或CFS方案。当训练数据大于 50GB 时,行业用户可采用COS+GooseFS或CFSTurbo 的方案。
三是网络通信,当前大模型主要采用分布式训练的方式,训练节点间的通信问题严重影响训练效率。行业用户可以根据模型的参数量级和训练数据量,选择所采用的网络技术。行业大模型的训练需要高性能的网络支持,通常需要至少支持 RDMA 100G 的网络。RDMA技术是为解决网络传输中服务器数据处理的延迟而应用的技术,其支持跨过操作系统的内核开销,直接访问到网卡。支持RDMA网络的主流技术包括 RoCE 和 InfiniBand: (1)RoCE 是在以太网上实现 RDMA,目前的RoCEv2 协议已经可以实现 RDMA 路由在第三层以太网络中传输,可以支持高性能和横向扩展架构;(2)InfiniBand 可以实现更高的传输性能,实现网络网卡间的无损通信,需要专用交换机。InfiniBand 的网络延迟极低,可达100ns。
算法层评估
目前基础大模型和微调算法众多,算法层评估主要根据业务需求和算力资源的限制,确定最适合业务场景的大模型和精调算法。在基础大模型选择方面,首先,行业用户应参照业务需求,根据需要处理的数据类型,选择基础的语言大模型、视觉大模型或语音大模型等;其次,根据需要完成的任务,选择对应任务版本大模型,例如,需要完成客服任务,应该选择已经在对话数据集上微调过的基础大模型;随后,根据部署的硬件资源要求,选择大模型的参数版本。在精调算法选择方面,结合算力和时间要求,可以选择不同的精调算法。在评估精调算法时,可以采用少量的样本数据先行进行评估,以保证精调的效果。以大语言模型精调为例,当前可采用的精调算法包括有监督的参数精调(SFT)或参数高效精调(Parameter-Efficient Fine-Tuning,PEFT)。
数据层评估
行业用户应根据业务的实际情况以及期望目标,明确数据规模、数据质量和数据安全隐私等问题,从而完成数据层的评估。在数据规模方面,需要行业用户有一定的数据积累,通常行业大模型建设需要 400—500 万条数据,根据不同的场景可以有一定的浮动。数据规模一般以 GB 或条数进行量化,其中一条数据是指行业用户在指定场景下的一次最小单元场景的实现过程。例如,在公文写作场景,一条数据就是一篇完整的公文;在客服场景,一条数据就是一次问答或是一次客服多轮对话的过程。在进行数据准备时,可以先使用少量数据进行评估,例如 300—500 条。
在数据质量方面,由于其对模型的效果影响会很大,推荐引入人工的标注和确认,至少从原始数据中挑选一定比例进行标注,从而构建并严重高质量的数据集。行业用户正式归档或是正式业务系统标注留存的数据,通常质量较高。 在数据安全和隐私保护方面,行业用户需要评估数据是否包含个人信息、敏感信息等,必要时需要对原始数据进行脱敏处理。在数据格式方面,需确定具体数据格式包括哪些。如文本数据、音频数据或是其他格式类型。无监督数据,即原始数据,数据的格式可以是网页数据、PDF、WORD、PPT 或是语音类;有监督数据,即经过标注的数据,数据格式可以为 json 或Query 格式。
工程层评估
在构建行业大模型时,行业用户可以选择配套工具或第三方平台提升模型构建效率。因此,需要根据需求目标和构建成本对工程工具和平台等进行选择。行业用户需要评估模型训练所需的算法模型平台,确定平台适配性和训练流程。通常模型训练平台具有从数据预处理、模型训练、自动学习、模型评估到模型发布部署的全流程支持能力。具体可以考虑以下几个方面: (1)模型训练平台是否包含需要的基础大模型或基础行业大模型,例如金融行业基础大模型、文旅行业基础大模型等;(2)数据标注平台是否可以提供数据标注作业、场景数据挖掘等数据生产服务; (3)训练和部署加速库是否具有加速组件,相应加速组件会有效提升模型训练的效率; (4)数据应用平台是否支持快速接入模型、数据和智能设备,提供模型服务、应用工作流编排、云边端调度等;(5)部署兼容性,行业用户需要评估希望部署的平台与行业大模型的兼容性,确认能否能够通过升级的方式进行更新;(6)模型加密,行业用户需要确认是否需要针对内置的模型加密,以防止模型本身的泄露问题。
2.行业数据与大模型共建
行业数据与大模型共建包括明确场景目标、模型选择、训练环境搭建、数据处理等环节。
明确场景目标
明确行业大模型实际应用场景及模型评价目标。例如金融领域,覆盖的业务场景可以包括风险控制、客服顾问、投资行研等。不同的业务场景,对于模型的评价目标会有不同。在风控场景,模型的评价目标主要为风险预警精确率、召回率、F1 值等;在客服顾问场景,模型的评价目标主要为平均响应时间、客户满意度等;在投资行研场景,模型的评价目标主要为数据准确性、成本效益等。与金融领域类似,在文旅领域,覆盖的业务场景可以包括行程定制、文案策划、讲解互动等。在行程制定场景,模型的评价目标主要为推荐准确性、定制匹配度等;在文案策划场景,模型的评价目标主要为信息覆盖度、文案创新性等;在讲解互动场景,模型的评价目标主要为响应时间、互动准确度等。在传媒、政务、教育等其他领域,明确实际应用场景及模型评价目标也都是关键环节。
模型选择
明确模型选型。根据大模型的基础应用领域,大模型可分为NLP大模型、CV 大模型、多模态大模型等。行业客户应根据大模型的基础应用领域,确定所选择的模型。 NLP 大模型主要用于自然语言处理,可以在客户服务、智能助手、问答文稿生成等领域,理解问题和需求,提供准确的解答和建议。如果行业用户的场景目标为智能客服领域,模型应选择NLP 大模型。在此基础上,结合训练资源情况,选择所处行业优化适配的行业基础大模型,如 LLaMA、ChatGLM 等。
CV 大模型主要用于机器视觉,CV 大模型可以在图像分类、目标检测、图像分割、视频修复等领域,完成相应任务。CV大模型的构建通常基于卷积神经网络、循环神经网络和注意力机制等,通常基于预训练模型,输出目标特征,并结合特征聚合模块,增强模型的全局图像感知能力,支持文字粒度、文本框粒度、整图粒度的特征表示,支持信息的抽取和识别。如果行业用户的场景目标为图像识别、视频修复,模型应选择 CV 大模型,并在此基础上,结合训练资源情况,选择所处行业优化适配的行业基础大模型。
多模态大模型主要用于跨模态场景,其相较于NLP 类大模型,融合了文字、图像、三维物体、声音等多维度的处理能力,可以有更丰富的应用场景。多模态大模型通过多模态语义理解、跨模态推理、多模态生成等技术进行构建,以实现跨模态的信息表达和交互,实现高精度、细粒度的模态融合。如果行业用户的场景目标为跨模态场景,如文生图、语音生成文案等,可选择多模态大模型,并根据训练资源情况,选择所处行业优化适配的行业基础大模型。多模态大模型的训练,通常对数据和算力方面的要求较高,所需的数据量和多样的数据类型较大,在训练和推理阶段消耗的资源较高。
训练环境搭建
搭建模型训练环境,包括硬件环境的搭建和软件平台的构建。其中硬件环境的搭建主要涉及计算、存储、网络等方面;软件平台的构建主要涉及模型训练平台的选择、数据标注、加速组件等环境的建设。在硬件方面,行业用户可以根据资源及需求情况配置训练所需的计算、存储和网络资源,可优选支持容器GPU 共享技术的计算资源;优选配置分布式的存储架构,配置多层次的存储加速引擎;优选支持GPU 直连的高吞吐量的 RDMA 网络。行业客户可以配置向量数据库,以支持 10 亿级的向量规模,日处理千亿级的检索能力。在软件方面,行业用户需要结合自身情况,选择优质的模型训练平台。优质的模型训练平台,可以提升模型训练、优化、评估、部署的整体效率。模型训练平台会预置多种AI 任务的预训练模型及调优流程,支持用户数据准备与设置超参数,支持多种训练任务的调度和管理,支持自动化完成训练流程。行业用户可以应用独立的数据标注平台,完善数据集管理和数据标注的能力。加速组件应配置支持异步调度优化、显存优化、计算优化的环境,支持数据并行及模型并行。
数据处理
数据处理,将数据加工为模型训练所需数据,包括原始数据处理、数据标注、数据集划分等步骤。 行业用户处理原始数据主要包括三个步骤,首先,对原始数据进行脱敏处理,以保证隐私及数据合规使用。原始数据可以来自公开数据集或是由实际业务系统收集的数据。其次,对数据进行预处理,包括去除噪声、去重、文本清洗、数据标注、切块等步骤。最后,通过数据转换、数据清洗、数据增强等,减少数据异常、缺失、冗余的问题,保证数据集的高质量。
数据可分为结构化数据和文本、图像、音视频等非结构化数据。结构化的数据预处理包括去重、处理缺失值和无效值等;文本数据的预处理包括降低字频、补充生僻字等;图像数据的预处理包括旋转、翻转、裁切等;音频数据的预处理包括降噪等;视频数据的预处理包括抽帧等。 数据标注,当使用文本、图像等非结构化数据时,需要对处理好的数据进行标注。例如,文本类对象需要标注文字检测框、文字内容等;图像类对象需要标注目标检测框、实例分割块、关键点等;视频类对象需要标注目标识别框、语音分割块等;音频类对象需要标注语音、语调、音素等。
数据集划分,数据集可以划分为训练集、验证集、测试集,其中训练集用于训练模型,通常包括无监督训练集和少量精标数据集;验证集可以用于模型超参数(hyper-parameter)的调整,以及过拟合情况的评估;测试集可以用于评估模型的最终性能。
模型训练共建
模型训练共建,对选定模型进行训练。模型训练中的核心要点是快速找到模型的最佳算法及对应的超参数。超参数的选择方法通常包括手动搜索、自动搜索等。 行业大模型的训练过程,需要通过大规模的行业无监督数据进行自监督训练和有监督数据进行有监督的调优得到。在行业大模型的预训练过程中,可以通过增加有监督精调的数据,在预训练阶段就学习到更多的知识。
模型训练应采用分布式并行训练技术,在训练过程中使用GPU集群(多机多卡)来提升训练速度。并行训练,包括数据并行、模型并行的训练模式,数据并行是指在多个设备上拷贝一份完整的模型参数,输入不同的数据参与计算,同步梯度,并行处理完成数据的训练;模型并行是指在多个设备上切分模型参数到各个GPU,每个设备输入相同数据,同步参数,并行处理完成训练。模型训练共建流程为由行业用户将数据上传训练平台、准备训练代码和环境、发起模型训练任务、存储训练后的模型、测评训练后的模型。数据上传过程中,如采用公有云的部署方式,需要开通相应的存储资源,如采用本地化的部署方式,需要提前配置相应的私有化原件和服务。在准备训练代码前,需要配置完成相应的计算资源,可以根据不同的应用场景和模型特性,调整启动方式,配置对应的模型路径和数据路径。在结束模型训练后,需要经过必要的测评,才能部署发布。
3.行业大模型精调与优化部署
行业大模型精调与优化部署包括模型精调、模型评估、模型重训优化、模型联调部署、模型应用运营等阶段。
模型精调
模型精调,首先选择合适的精调算法,精调算法选定后,利用前期准备的特定行业特定场景数据进行大模型的训练精调。目前行业大模型常用的精调算法,包括有监督精调算法和参数高效精调算法等。有监督精调(SFT)根据不同的任务及目标,将预训练模型的权重全部更新。有监督精调的具体做法是为目标模型添加一个大小为目标数据集类别个数的输出层,并随机初始化该层的模型参数。在精调过程中,通过反向传播算法等对模型参数进行更新,使得模型在目标任务上表现更好。有监督精调,需要大量的标注数据用于目标任务,通常其所需的资源和时间会较多。

参数高效精调(PEFT)一般针对特定的参数进行有效微调。常用的参数高效精调技术,包括模型蒸馏(distillation)、适配器训练(adapter training)、渐进收缩(progressive shrinking)等。模型蒸馏,主要通过训练一个较小的模型,模仿较大的预训练模型,将预训练模型生成的预测结果,训练生成较小的模型,结合较大模型的知识学习情况,无需存储所有参数。适配器训练,是指在预训练模型中增加小型神经网络,用于特定任务的精调。这些适配器只占原始模型的一小部分,通常训练更快,对内存的需求更低。适配器可以针对多种任务进行训练,然后插入到预训练模型中以执行新任务。渐进收缩,主要涉及在精调期间逐渐减小预训练模型的大小。从一个大模型开始,逐渐减少参数的数量,直到达到所需的性能。这种方法可以产生比从头开始训练的模型性能更好的小型模型。
目前在行业大模型精调中,参数高效精调(PEFT)的主流方法包括 P-tuning v2、LORA 等。其中 P-tuning v2 是由Prefix-tuning和Prompt-tuning优化而来。P-tuning v2在每一层都加入了Prompts tokens作为输入,而不是仅仅加在输入层,可以更多可学习的参数,同时也保证参数高效,通过加入到更深层结构中的Prompt 能给模型预测带来更直接的影响。P-tuning v2 有更多的可优化的特定任务参数,以允许更多的每个任务容量,而它仍比原预训练语言模型会小得多。LORA 精调方法,通过低秩分解来模拟参数的改变量,从而以极小的参数量来实现大模型的间接训练。该方法通过在权重矩阵中增加低秩适配层,降维和升维矩阵,模拟特征秩。在任务训练时,固定模型的其他参数,只优化两个矩阵的权重参数,更新低秩适应层,这允许模型在不改变其一般知识的情况下有效地学习特定于任务的信息。

模型评估
模型评估,在精调生成对应任务的大模型后,对模型进行评估,以判断模型是否满足应用要求。通常包括功能和性能两方面评估。根据应用场景和任务类型的不同,大模型的评估维度会有所不同。对于 NLP 类型大模型而言,其评估维度可以包括功能覆盖度、性能优越度。其中功能评估可以评估其是否涵盖词法分析、句法分析、语义分析、语义消岐、机器翻译、文本分类、文本生成、内容推荐、阅读理解、摘要生成、文本纠错等功能。性能评估包括对应任务的准确率、召回率、F1 值等,必要时需要引入人工进行主观判断,以保证评估的完整性。
对于 CV 类大模型而言,其评估维度可包括功能覆盖度、性能优越度。其中功能评估包括是否涵盖字符识别、图像识别、动作识别、图像分类、内容推荐、目标检测、语义分割、实例分割、视觉检索等功能。性能评估可以通过准确率、召回率、F1 值、命中率、平均交并比、检测准确率、分类准确率等维度进行评价,必要时需要引入人工进行主观判断。 对于多模态类大模型而言,其评估的维度可以包括功能覆盖度、性能优越度。其中功能评估可以包括是否涵盖图文检索、图文生成、视频文本相关度匹配等功能,性能评估可以通过命中率、准确度、匹配度等维度进行评价,可以引入人工进行主观判断。在模型评估过程中,可以引入更多的测试数据集,保证数据集的全面性、完整性、多样性,以保证模型评估的效果准确,更好的优化模型。
模型重训优化
模型重训优化,根据模型评估的情况,通常需要对模型进行多轮迭代训练优化。可以应用强化学习方式进行模型的重训,通过人工标注答案满意度,选出最符合人类思考交流习惯的答案,循环更新生成大模型。行业用户可以将重训得到的模型在模型训练平台上提交至模型仓库,并进行模型的验证测试,验证后可以正式发布并应用。模型重训可以分为离线重训和在线重训。对于实时性要求较高的某些场景,可以选择在线重训。对于安全性要求较高的场景以及当对模型进行较大更替时可选择离线重训。模型重训可以减少由于数据、内容漂移等因素对模型性能的影响,也可以根据模型应用进程对模型进行即时调优。 模型重训优化可以根据模型评估的结果触发,也可以在模型运营阶段根据监控指标触发,即当监控指标低于阈值时,自动触发请求或以人工方式,触发模型重训迭代。
模型联调部署
模型联调部署,包括推理服务部署、服务配置、应用服务联调等阶段。模型联调部署前,行业用户可以对预训练大模型及精调后的大模型做加密,训练框架同样可以做加密封装。在模型部署过程中,需要先将模型、配置、代码等进行封装,随后将封装好的模型服务部署至目标环境并配置对应的 API,以保证后续应用服务的联调,保证模型服务与实际业务系统的对接。
模型部署需要支持更新策略,以保证新版本的模型服务可以持续部署更新于目标环境。支持对已部署的模型服务配置相应的管理策略,以保证模型的正常运行,并不断驱动模型的优化。
模型应用运营
模型应用运营,在生产环境中为已上线的模型服务提供监控、管理、运营维护等能力。模型的应用运营应覆盖大模型构建的全生命周期,全面记录模型运行状态。应支持模型的注册、纳管、风险管理;支持模型版本控制、更新、回滚;支持自动化通知告警,智能化分析和自动化处置。 在模型应用运营环节,可以通过构建仓库的管理方式,通过构建元数据仓库、特征仓库、模型仓库、代码仓库、参数仓库等,提供访问、复用、追溯等能力,实现对模型资产的有序管理。