数据服务提供商在产业链各环节的任务分别是什么?

数据服务提供商在产业链各环节的任务分别是什么?

最佳答案 匿名用户编辑于2025/05/22 14:00

数据服务提供商通常需要完成 数据集结构/流程设计、数据处理、数据质检等工作,为下游客户提供通用数据集、 定制化服务、数据闭环工具链等,其在产业链中各环节的任务分别为:

1. 训练阶段,提供大量的原始数据

高质量的数据是人工智能算法训练的重要底座,原始数据的获取、清洗、标注对 大模型训练效果至关重要。比如数据清洗则是检查和修正数据中的错误,确保数 据准确无误。这包括去除重复数据、填补缺失值、处理异常值和转换数据格式等 操作。数据清洗的目的是提高数据的准确性和可靠性,为后续的数据分析和建模 提供坚实的基础。数据清洗确保了训练数据的准确性,避免了因为数据错误导致 的模型偏差。干净、准确的数据是训练出高性能 AI 模型的关键。数据标注的工作 是从数据源采集包括图像、语音、文本、点云等形式在内的算法所需数据,通过 标注,将非结构化数据转化为计算机语言下的结构化数据。结构化数据是人工智 能算法开发的基石它帮助机器学习算法理解数据的特征、属性、结构和关系等方 面的信息,从而更好地进行数据分析和建模。

因此,随着大模型对数据需求呈指数增长,也将会带动常规数据训练服务的需求 增长。2024 年底,我国数据标注企业数量逾 4000 家,年均复合增长率达 11.3%。 其中“专精特新”企业占比 12%,上市公司(包括海外上市)占比 3%。从增长趋 势上看,近 20 年可以分为 3 个阶段,第一阶段 2005-2013,企业数量年增长率处于 10%~12%区间,第二阶段 2014~2018,数据标注新增企业数量快速增长,2018 年 增长率高达 17%;第三阶段 2019-至今,增长逐步缓和,受制于宏观经济和外部冲 击,2022 年增长率降至 5%。这三个阶段分别对应了数据标注产业的成长期、快速 增长期、平稳高质量发展期。值得注意的是,新增企业数量在经历了 2021-2023 年的快速回落后,于 2024 年出现了明显的反弹,背后可能的原因是 2024 年我国人工 智能产业的爆发式增长对数据标注行业有效拉动的结果。

即使是以监督学习为主的 DeepSeek,在训练初期也用了冷启动数据。及时人工标注 几千条高质量解题示范(带标准格式和清晰步骤),让 AI 先临摹,再自主发挥。在 DeepSeek-R1 的研发过程中,为了避免强化学习训练初期的这种不稳定冷启动阶段, 通过构建长思维链数据和采用特定的数据收集与处理方法,有效地缓解了这一挑 战。这些数据通过带有详细反思和验证步骤的提示生成,并用于微调模型。同时, DeepSeek 还收集了 DeepSeek-R1-Zero 的输出,并由人类标注者进行精炼和优化。 人类标注者在这里扮演了重要的角色。他们不仅需要对收集到的数据进行清理和 整理,还需要对数据进行进一步的优化和精炼,以确保模型在训练过程中能够充 分利用这些数据。

2. 强化学习阶段,提供模型的反馈及打分

目前主流大模型普遍采用无监督自动学习机制,然而对其进行对齐、调优仍需要 收集人类反馈。BERT、GPT、Transformer 等模型已经可以直接处理原始的非结构 化数据,通过自注意力机制、位置编码等技术,能够捕捉到非结构化数据中的复杂模式和关系。然而,机器学习在预训练、无监督学习过程中容易产生模型幻觉、 价值取向等等问题,需要人类反馈来进行对齐。RHLF(Reinforcement Learning from Human Feedback,人类反馈强化学习)指模型需要加入人工打分环节,以保 证模型能够给出符合逻辑的高质量答案,能让大模型更好地与人类指令保持一致。

针对此类需求,数据服务商也会提供数据、反馈、打分等服务来强化训练模型。 给大模型输出打分是为了评估其生成内容的质量和准确性。具体来说,打分可以 帮助我们理解模型的优缺点,并指导模型的改进。例如图片描述可以从识别准确度、内容涵盖度、表述质量等几个维度进行打分,并输出最终整体打分结果,将 人类的偏好转化为数字奖励信号,进而引导模型的行为更加符合人类的期望。

RLHF 标注需要非常专业的人士,而大模型厂商通常会将此类工作外包给人员管 理能力更强的第三方数据服务商。例如,OpenAI 招了几十名 PhDs 来做 RLHF 的 标注,数据服务公司 ScaleAI 作为 OpenAI 的上游供应商,也招聘了几十名 PhDs 为 OpenAI 服务,具体的分工是 ScaleAI 负责标注,而 OpenAI 负责质量检测。

3. 应用阶段,提供专业化、全流程的高质量数据训练

随着人工智能进入多元行业和场景落地阶段,自动驾驶、医疗、法律、金融等有 一定专业性要求的垂直化场景将成为主要需求,从而带动行业进一步朝着垂直化、 定制化方向发展。这将使得专业性要求越来越高,市场准入门槛显著提高。数据 服务商在根据不同行业和企业要求进行改造,并提供需求数据的同时,还应该基 于行业理解,与企业共同制定相关的标注规范和规则,从而让算法发挥出更高的 识别效率。此外,还要深度参与到客户人工智能算法从预研立项、定制开发到部 署投放的全过程中,凭借自身的数据服务能力,在不同阶段为客户提供自制数据 集,定制化的数据采集、数据清洗和数据标注服务以及数据中台集成能力。

数据是 AI Agent 发展的关键要素:AI Agent 的构建主要依赖于大型语言模型和交 互能力两大核心要素,而高质量的数据是训练高效大语言模型的关键。AI Agent 行 业对数据的需求不仅在于数量,更在于多样性和质量,以确保模型能够适应不同 的语言环境和应用场景。

确保数据质量:数据标注厂商具有专业的标注团队和严格的标注流程,能够 对数据进行清洗、分类、标注等处理,确保数据的准确性、一致性和规范性。 海天瑞声在数据清洗和标注方面持续发力,通过制定严格的数据清洗规则和 标注流程,能够为客户提供高质量的数据,满足大模型训练的需求。

实现数据多样性:数据标注厂商可以采集和标注各种类型的数据,包括文本、 图像、音频、视频等,为 AI Agent 厂商提供丰富的数据来源,帮助模型更好 地学习和理解不同模态的信息,提升 AI Agent 在多模态任务中的表现。

节省成本和时间:数据标注是一项耗时费力的工作,需要大量的人力和物力 投入。AI Agent 厂商如果自行建立数据标注团队,需要花费大量的时间和资源 来招聘、培训人员,购买设备和软件等。而与数据标注厂商合作,可以将这 些工作外包出去,节省自身的成本和时间,专注于 AI Agent 的核心技术研发 和产品创新。 同时部分有 AI 需求的下游非科技型企业并不具有算法研发能力,这也需要第三方 厂商提供帮助提供全生命周期服务,为数据服务商开拓新的市场空间。在研发阶 段,企业一般使用开源数据集或数据集产品进行训练,数据标注需求量大,标注 内容倾向于标准化;在训练阶段,企业通常需要部署私有化标注平台以及较强的 数据安全管理流程,对数据标注内容需求更多、更丰富,准确性要求更高;在产 品落地阶段,企业不仅需要部署私有化标注平台,对采标的数据内容有特殊指向, 对服务方稳定性和效率也有较高要求。

同时在目前的产业模式中,产业链上中下游界限逐渐模糊,数据服务商能力开始 向上下游渗透。从商业模式来看,当前基础数据服务的商业模式包括两大类。一 类是提供基础的数据服务模型,如数据出售、数据 API服务、数据标注服务、数据 工具和软件出售等,这类商业模式适用于通用类的数据服务,其定价依据数据大 小量、标注难度等,价格在几千至几十万之间。这一类商业模式适合数据采集和 标注的门槛较低的场景,以及通用性较强的场景。第二类是全栈式商业模式,如百度智能云提供的数据闭环解决方案及工具链平台,研发闭环包括两个环,一个 是中间层小环,数据产生之后,经过数据管理平台,包括一些仿真测试、仿真云、 再到车端部署,实现仿真的场景。另一个是外面的大环,主要做一些数据管理的 工作,经过标准、加工、模型训练以及最后的车端部署,来实现这样一个大环。 将上面的数据闭环链路拆解到架构层来看,可以把自动驾驶的数据研发分为如下 五层:从最底下的基础设施,到中间的 PaaS 工具链,再到上面的一些 AI 运营服务。

随大模型向行业应用发展的趋势,数据服务商将从提供基础数据服务模式为主转 变为提供全栈式服务模式。随着下游应用方的下场参与和 AI 进入到 AI Agent 的时 代,下游应用方算法能力积累较少,而同时面临算法能力快速部署与迭代的需求, 进而催生出了对包括云资源、算法工具链等全栈式工具服务的需求。数据服务商 在根据不同行业和企业要求进行改造,并提供需求数据的同时,还应该基于行业 理解,与企业共同制定相关的标注规范和规则,从而让算法发挥出更高的识别效 率。此外,还要深度参与到客户人工智能算法从预研立项、定制开发到部署投放 的全过程中,凭借自身的数据服务能力,在不同阶段为客户提供自制数据集,定 制化的数据采集、数据清洗和数据标注服务以及数据中台集成能力。

参考报告REPORT

海天瑞声研究报告:国内领军数据服务商,人工智能产业卖铲人.pdf

海天瑞声研究报告:国内领军数据服务商,人工智能产业卖铲人。数据服务商直接受益于人工智能产业发展,人工标注短期仍不可替代。自动化标注技术在现阶段还存在一定的局限性,如对某些类型的数据的识别准确率不高、对复杂场景的处理能力有限等。对于一些需要专业知识判断的标注任务,如医学影像标注、法律文本标注等,人工标注能做出更准确、合理的标注。大模型领域的发展对数据服务提供商主要的推动力包括:(1)预训练阶段,需要数据服务商提供大量的原始数据;(2)强化学习阶段,大模型的对齐需要数据服务商提供调优、反馈等服务;(3)应用阶段,企业需要针对自身业务特点和需求训练专用的小模型,需要数据服务商提供专业化、全流程数据服...

我来回答
分享至