阿里大模型发展沿革及架构框架介绍

 阿里大模型发展沿革及架构框架介绍

最佳答案 匿名用户编辑于2024/03/12 16:09

阿里入局 AI 大模型,从 M6 到通义大模型的进阶之路。

1 发展沿革:从 M6 到通义大模型,阿里大模型的迭代进阶之路

1.1 阿里大模型的迭代进阶之路

项目启动阶段:M6 项目于 2020 年启动,同年 6 月推出 3 亿参数的基础模型,2021 年 1 月,模型参数规模达百亿,成为世界最大的中文多模态模型。

万亿模型阶段:2021 年 5 月,达摩院发布万亿参数模型 M6 并正式投入使用,追上 谷歌发展脚步。M6 在多模态 GreenAI、文到图生成、商业化领域并肩世界一流水平, 与英伟达、谷歌相比,M6 仅用 480 卡 V100 32G GPU 就实现了万亿模型,节省算 力资源超 80%,训练效率提升近 11 倍。

十万亿模型阶段:2021 年 10 月,M6 进一步升级成为全球首个 10 万亿参数的多模 态大模型,并应用于天猫虚拟主播等 40 多个创造相关场景中;在绿色低碳方面,相 比 GPT-3,M6 实现了同等参数规模下,能耗仅为 1%。

大模型阶段:2022 年 9 月,达摩院发布“通义”大模型系列,打造业界首个 AI 统一底 座,并构建了大小模型协同的层次化人工智能体系,其中,统一底座 M6-OFA 模型 在不引入新增结构情况下,可同时处理 10 余项单模态和跨模态任务,通义大模型的 出现将为 AI 从感知智能迈向知识驱动的认知智能提供先进基础设施。

1.2 阿里达摩院年度科技趋势:阿里对 AI 大模型高度重视

达摩院每年都会发布对当年的十大科技趋势预测,在最近两年的科技趋势预测中,充分体 现阿里对 AI 技术及大模型的重视:

2022 年,达摩院在十大科技趋势中提到多项 AI 相关内容,包括 AI for Science(将 AI 应用于高技术领域科学研究)、大小模型协同进化、绿色能源 AI(基于 AI 算力对 资源消耗严重的现实,从降本增效角度提出了绿色能源 AI 新概念)等。

2023 年,达摩院在十大科技趋势中,将多模态预训练大模型放在首位,足以显现其 对大模型的重视。CLIP 和 BEiT-3 等多模态模型实现技术突破,多模态融合的通用人 工智能成为未来发展趋势。多模态预训练的发展将重塑人工智能商业模式。多模态统 一建模,目的是增强模型的跨模态语义对齐能力,打通各模态之间的关系,促使模型 逐步标准化。基于多领域知识,构建统一的、跨场景、多任务的多模态基础模型将成 为未来人工智能的重点发展方向。

2.通义大模型:统一技术底座,实现架构、模态、任务三位一体

2.1 基础框架:统一技术底座+通用模型层,赋能下游千行百业

统一技术底座主要由 M6-OFA 模型和模块化设计两部分构成。1)M6-OFA 模型,可 在不引入任何新增结构的情况下,同时处理图像描述、视觉定位、文生图、视觉蕴含、 文档摘要等 10 余项单模态和跨模态任务,并达到国际领先水平,完成升级后可处理 超过 30 种跨模态任务。2)模块化设计,借鉴了人脑模块化设计,以场景为导向灵 活拆拔功能模块,实现高效率和高性能。

通用模型层主要包含通义-M6、通义-AliceMind、通义-视觉三种通用模型。1)通义 -M6 是国际首个参数规模达到 10 万亿的全球最大预训练模型。2)通义-AliceMind 作为开源深度语言模型体系,形成了从文本 PLUG 到多模态 mPLUG 再到模块化统 一模型演化趋势。3)通义-视觉可在电商行业实现图像搜索和万物识别等场景应用, 并在文生图以及交通和自动驾驶领域发挥作用。

2.2 统一技术底座-三位一体:M6-OFA 为通义大模型底座,实现架构、模态、任务三 方面统一

通义大模型在国内率先构建 AI 统一底座,在业界首次实现模态表示、任务表示、模型结 构的统一,统一学习范式 OFA 是通义大模型背后的核心技术支撑。

架构统一:M6-OFA 采用了 Transformer Encoder-Decoder + ResNet Blocks 架构, ResNet Blocks 用于提取图像特征,Transformer Encoder 负责多模态特征的交互, Transformer Decoder 采用自回归方式输出结果。无需增加任何任务特定的模型层, 即可实现预训练与微调的相同学习模式。

模态统一:M6-OFA 构建了一个涵盖不同模态的通用词表,以便模型使用该词表表 示不同任务的输出结果。其中 BPE 编码的自然语言 token 用于表示文本类任务或图 文类任务的数据;图片中连续的横纵坐标编码为离散化 token,用于表示视觉定位、 物体检测的数据;图片中的像素点信息编码为离散化 token,用于表示图片生成、图 片补全等任务的数据。

任务统一:通过设计不同的 instruction,M6-OFA 将涉及多模态和单模态(即 NLP 和 CV)的所有任务都统一建模成序列到序列(seq2seq)任务。M6-OFA 覆盖了 5 项 多模态任务,视觉定位、定位字幕、图文匹配、图像字幕和视觉问答;2 项视觉任务, 检测和图像填补和 1 项文本任务,即文本填补。

2.3 通用模型层-通义语言模型 AliceMind

作为阿里达摩院的开源深度语言模型体系,通义-AliceMind 包含了通用语言模型 StructBERT、生成式 PALM、结构化 StructuralLM、超大中文 PLUG、多模态 StructVBERT、多语言 VECO、对话 SPACE 1.0/2.0/3.0 和表格 STAR 1.0/2.0,过 程中形成了从文本 PLUG 到多模态 mPLUG 再到模块化统一模型演化趋势。

AliceMind 在中文语言理解水平达到新的高度。2021 年 8 月,AliceMind 在 VQA 上 以 81.26%的准确率创造全球记录,首次超过人类基准线 80.83%。在中文语言理解 测评基础 CLUE 上,通义 AliceMind 于 2022 年 8 月获得了分类榜单、机器阅读理解 榜单和总榜单三榜第一,2022 年 11 月再次刷新纪录并以 86.685 的总分首次超越人 类成绩(86.678)。

2.4 通用模型层-通义视觉大模型

通义-视觉大模型自下往上分为了底层统一算法架构、中层通用算法和上层产业应用。在 应用层面,通义-视觉大模型可以在电商行业实现图像搜索和万物识别等场景应用,并在 文生图以及交通和自动驾驶领域发挥作用。

参考报告REPORT

AI行业专题研究:阿里通义千问重磅发布,生态入口优势有望落地全域智能.pdf

AI行业专题研究:阿里通义千问重磅发布,生态入口优势有望落地全域智能。4月11日上午,阿里AI大模型“通义千问”于2023阿里云峰会重磅发布。阿里巴巴集团CEO张勇表示,基础大模型的核心是能够支撑各行各业,阿里希望能够为客户与合作伙伴提供面向千行百业的专属大模型。阿里巴巴表示,所有产品未来都要接入大模型进行全面的升级,所有行业和所有服务都值得重新做一遍。从M6项目到“通义千问”的发展之路。阿里AI大模型“通义千问”前身系阿里达摩院M6项目,阿里达摩院于2020年6月发布3亿参数基础模型,21年1月模型参数规模达百亿,同年5...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至