生成式人工智能工作原理和技术机制介绍

生成式人工智能工作原理和技术机制介绍

最佳答案 匿名用户编辑于2023/10/07 14:46

生成式人工智能是一种技术集合,它基于生成对抗网络(GAN)和大型预训练 模型等人工智能技术,利用已有数据来寻找规律,并通过适当的泛化能力来生成 相关内容。

根据监督学习的方法差异,机器学习领域具有判别式(Discriminative)和生成式(Generative)两种典型模型:判别式模型是对条件概率建模,学习 不同类别之间的最优边界,从而完成分类任务;生成式模型则面向类建立模型,计 算基于类的联合概率,然后根据贝叶斯公式分别计算条件概率,进而根据输入数 据预测类别。GAN模型出现后,人们开始利用生成式机器学习模型实现文本、图 像、语音等内容的智能合成,学术界将其定义为生成式AI(Generative AI)。

算法端方面,人工智能的两个重要阶段为机器学习和深度学习,机器学习主 要以神经网络为标志,深度学习则在神经网络基础上构造更深层次的结构对更高 维度的数据进行学习。同时这两者可以相互结合,称为深度强化学习(DRL)。 时间方面,神经网络的概念出现较早,在人工智能概念提出前的1943年就已 经具有雏形。1943年,心理学家麦卡洛克(McCulloch)和数学家皮茨(Pitts)最早 将生物学中的神经网络中的最基本的成分⸺“神经元模型”抽象为简单模型,即 MP模型。该模型中,神经元从其他神经元或外部环境接收二进制输入并加权相 加,将结果与阈值进行比较。如果输入的总和超过阈值,则神经元发射,产生1的二 进制输出,否则神经元保持不活动,产生0的输出;由于它只能表示二进制的输出 结果,局限性较大。1986年,辛顿(Hinton)以此为基础提出第二代神经网络,利用 误差的反向传播算法来训练模型,算法效率大幅提升;算力上通过并行计算和 GPU加速等技术,已实现可以处理更大规模的数据和更加复杂的问题。1989年,Yann LeCun等提出LeNet-5模型已实现数字识别。1997年,长短时记忆网络(LSTM) 作为循环神经网络(RNN)的改进型被提出,主要用于解决传统循环神经网络中 遇到的梯度消失和梯度爆炸问题,使得神经网络可以更好地处理长序列数据。 2006年,辛顿首次提出了深度置信网络(Deep Belief Network,DBN),它的训练 分为无监督预训练和有监督微调两个阶段,其中对无监督特征的强调成为深度学 习的雏形。2014年,新的生成对抗网络(GAN)被提出,它的基本思想是将生成器 网络和判别器网络同时进行训练,通过竞争来逐步提高生成器网络的生成能力。 训练过程进化为生成器网络的训练和判别器网络的训练两个阶段,通过对真假不 断判断和挑战提高相关精度。该阶段在商业化的里程碑事件就是2016年AlphaGo击败围棋世界冠军李世石,表明了算法在商业化落地后的巨大力量。

随后,模型的发展方向主要聚焦长序列的处理和计算效率的提升,代表就是 2017年谷歌Transformer模型的发布。它是一种基于自注意力机制的编码-解码 模型,解决序列到序列(Sequence-to-Sequence)学习任务中的长序列问题,例 如机器翻译、语音识别、文本摘要等任务。2017年6月,Google Brain在神经信息 处理系统大会(NeurIPS)发表论文《Attention is all you need》,首次提出了基于 自我注意力机制(self-attention)来提高训练速度的Transformer模型,将其用于 自然语言处理。Transformer由编码器和解码器两部分构成,其中编码器用于将 输入序列转换为一系列特征向量,解码器则将这些特征向量转换为输出序列。编 码 器 和 解 码 器 都 由 多 个 相 同 的 层 次 组 成,每 个 层 次 包 含 多 头 注 意 力 机 制 (Multi-Head Attention)和全连接前馈网络(Feed-Forward Network)两个子层 次。该架构的优点是可以并行处理输入序列的所有元素,能够捕捉长距离的依赖 关系,此架构奠定了大语言模型(LLM)的强大基础。

生成式人工智能的基础架构是大语言模型。它是在大量数据集上进行预训练,且没有针对特定任务调整数据,另外可以对自然语言进行建模,以便于生成文 本、语音识别、文本分类、机器翻译等任务。它的优点在于可以生成高质量的自然 语言,同时还可以理解和处理复杂的语言结构。其路线主要分为三种:1)编码器路 线;2)编解码器路线;3)解码器路线。三条线在发展初期都处于各自探索阶段,但 2020年GPT-3模型的编译及其表现出的优异性能,解码器逐渐占据主导优势。同 时模型闭源逐渐成为头部玩家的发展趋势,包括Google、OpenAI、META(原 Facebook)等公司都在推进。

在算法端,Transformer的自注意力机制是特殊情况下的注意力机制。在一 般任务的编码-解码(Encoder-Decoder)框架中,输入(Source)和输出(Target)内容是不一样的,例如对于英-中机器翻译来说,输入是英文句子,输出是对 应地翻译出的中文句子。注意力机制发生在输出的元素Query和输入中的所有元 素之间。而自注意指的不是输入和输出之间的注意力机制,而是输入内部元素之 间或者输出内部元素之间发生的注意力机制,即“Target=Source”这种特殊情况 下的计算机制。自注意力机制更容易捕获句子中长距离的相互依赖的特征,且对 于增加计算的并行性也有直接帮助作用。OpenAI的GPT系列模型,均是基于 Google提出的Transformer模型的解码器(Decoder)架构,每代模型仅对架构进 行微调。从模型参数量和训练数据集维度看,在GPT-3模型之前,参数量和训练数 据量均呈现快速增长态势,尤其是GPT-3模型参数量为1750亿,达到阶段性巅峰。

最新框架中,指示学习(Instruction tuning)成为下一步发展的方式,其最早 由2022年论文《Finetuned Language Models Are Zero-Shot Learners》提出论 述。该模型需要学习如何在给定的输入条件下,输出与专家行为相似的结果,较类 似于人类学习新技能的方式,例如观察和模仿专家的行为,从而逐渐掌握新的技 能。此外,指示学习还可以避免一些传统强化学习方法中的问题,例如训练不稳定、难以收敛等问题。 总结对比来看,大语言模型发展主要基于以下三大主要阶段:1)模型微调 (Fine-tuning):以GPT-1为代表,需要大量的微调数据集样本,特定模型解决特 定任务;2)提示学习(Prompt-learning):以GPT-3为代表,需要少量的微调数据 样本,模型小样本学习(few-shot Learning)能力更强;3)指示学习(Instruction-learning):以FLAN、InstructGPT、ChatGPT为代表,它可以通过模仿专家 行为,快速地学习如何完成复杂的任务。

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至