2024年AI行业OpenAI o1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加

  • 来源:中信建投证券
  • 发布时间:2024/09/20
  • 浏览次数:745
  • 举报
相关深度报告REPORTS

AI行业OpenAI o1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加.pdf

AI行业OpenAIo1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加。OpenAI发布新的具有深度思考能力的o1推理模型,模型在复杂问题上花更多时间进行思考而非直接回应,具有改善和调整策略的能力,在科学、代码和数学等复杂问题上表现出色。OpenAIo1融合思维树和强化学习,实现思维模式的深度探索。Openo1在模型推理侧同样满足scalinglaw,即模型推理时间越久模型处理复杂问题能力愈强,通过不断的思维树检索和反复自我博弈,o1呈现出类人的逻辑思维潜力。由于推理过程的反复博弈,新架构下推理侧算力消耗将大幅增加。OpenAIo1具备深度思考能力,在复杂问题上表现出色。从ChatGPT爆...

大语言模型发展历史

2017年,Google在Transformer模型中引入注意力机制,在自然语言的理解和生成也取得了巨大的成功,当前已经成为自 然语言处理领域最常见的基础模型。 2022年底,OpenAI发布的具备类人对话体验的ChatGPT爆火整个社交网络,2023年3月,GPT-4能力再度提升,基础能力和 专业知识全面升级,微软亚洲研究院称GPT-4爆发出通用人工智能火花。 2023年,随着大语言模型进入到相对成熟的阶段,大模型逐步进入到多模态的发展阶段,GPT-4V具备了多模态输入的能 力,结合DALL·E等模型,GPT-4 turbo同时具备了多模态的输出能力。

提示词工程:提升回答效果

在大语言模型中,提示工程是指设计和编写提示文本,以引导模型生成符合特定要求的语言输出。提示工程可以包括选 择合适的词汇、语法、上下文和主题等元素,以及使用不同的技巧和策略来影响模型的生成行为和结果。 提示工程的作用: 提升大语言模型处理复杂任务场景的能力,如问答和算术推理能力。 通过提示工程设计、研发强大的工程技术,实现和大语言模型或其他生态工具的高效接轨。

概念一:思维链和思维树

思维链(CoT)提示通过中间推理步骤实现了复杂的推理能力。通过将其与少样本提示相结合,以获得更好的结果,以便 在回答之前进行推理的更复杂的任务。对于需要探索或预判战略的复杂任务来说,传统或简单的提示技巧是不够的。 Yao提出了思维树(Tree of Thoughts,ToT)框架,该框架基于思维链提示进行了总结,引导语言模型探索把思维作为 中间步骤来解决通用问题。思维树中思维由连贯的语言序列表示,这个序列就是解决问题的中间步骤。使用这种方法, 大语言模型能够自己对严谨推理过程的中间思维进行评估。大语言模型将生成及评估思维的能力与搜索算法(如广度优 先搜索和深度优先搜索)相结合,在系统性探索思维的时候可以向前验证和回溯。

概念二:强化学习

强化学习是人工智能重要的研究领域。强化学习中,有两个可以进行交互的对象:智能体和环境,智能体和环境交互以 获得经验,智能体从中学习执行最佳行动,从而最大化其奖励。 智能体(Agent)可以感知外界环境的状态(State)和反馈的奖励(Reward),并进行学习和决策。智能体的决策功能是指根 据外界环境的状态来做出不同的动作(Action),而学习功能是指根据外界环境的奖励来调整策略。 环境(Environment)是智能体外部的所有事物,并受智能体动作的影响而改变其状态,并反馈给智能体相应的奖励。 强化学习的基本要素包括:状态、动作、策略、状态转移概率、即时奖励。

Q-learning

Q-learning是人工智能领域的基本概念,特别是强化学习领域。它是一种无模型强化学习算法,旨在学习特定状态下动 作的价值。Q学习的最终目标是找到一个最优策略,定义在每个状态下采取的最佳行动,从而随着时间的推移最大化累积 奖励。 Q-learning基于Q函数的概念,也称为状态-动作值函数。该函数需要两个输入:状态和操作,它返回对预期总奖励的估 计,从该状态开始,采取该行动,然后遵循最优策略。

思维树+Q-learning=OpenAI o1

选择:从根节点开始,算法根据特定策略浏览有希望的子节点,直到到达叶节点为止。 扩展:在叶子节点处,除非它代表了博弈的终结状态,否则会添加一个或多个可行的新子节点,以说明未来可能采取的 行动。 模拟或评估:从新添加的节点开始,算法进行随机模拟--通常称为 “滚动”--通过任意选择棋步直到博弈结束,从而评 估节点的潜力。 反向传播:模拟后,结果(胜、负或和)会传播回根节点,更新每个遍历节点的统计数据(如胜、负),为未来决策提 供依据。

过程监督反馈奖励函数

奖励模型可用于强化学习流程来区分期望输出和不期望输出,研究如何有效训练可靠的奖励模型非常重要。 存在两种不同的奖励模型训练方法:结果监督和过程监督。结果监督奖励模型仅使用模型思路链的最终结果进行训练, 而过程监督奖励模型则会接收思路链中每一步的反馈,它提供更精确的反馈,因为指定了发生的错误的确切位置,它更 容易被人类解释,并且它更直接地奖励遵循人类认可的思路链的模型。在逻辑推理领域,使用结果监督训练的模型经常 使用错误的推理来得出正确的最终答案。 OpenAI构建了一个用于过程监督的PRM800K数据集,其中包括了75000个问题中的800000个解决步奏的标签,同时通过主 动学习策略降低了标签搜集的难度,数据获取效率大约提升了2.6倍。

OpenAI o1

OpenAI o1是经过强化学习训练来执行复杂推理任务的新型语言模型。o1在回答之前会思考,可以在响应用户之前产生一 个很长的内部思维链。该模型在作出反应之前,需要像人类一样,花更多时间思考问题。通过强化学习训练,大模型学 会完善自己的思维过程,尝试不同的策略,并认识到自己的错误。 在OpenAI的测试中,该系列后续更新的模型在物理、化学和生物学这些具有挑战性的基准任务上的表现与博士生相似。 OpenAI还发现它在数学和编码方面表现出色。在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅正确解答了13%的问题, 而o1模型正确解答了83%的问题。模型的编码能力也在比赛中得到了评估,在Codeforces比赛中排名89%。

为了突出相对于GPT-4o的推理性能改进,OpenAI在一系列不同的人类考试和机器学习基准测试中测试了o1模型。实验结 果表明,在绝大多数推理任务中,o1的表现明显优于GPT-4o。o1在广泛的基准测试上比GPT-4o有所改进,包括54/57 MMLU子类别。

推理侧Scaling law的发现

推理过程中的Scaling Law:o1的性能随着更多的强化学习(训练时间计算)和更多的思考时间(测试时间计算)投入不断提 高,推理过程中的Scaling Law发现意味着大模型的逻辑推理能力有望大幅提升。 基于o1进行了初始化并进一步训练了其编程技能后,OpenAI 训练得到了一个非常强大的编程模型(o1- ioi)。该模型在 2024年国际信息学奥林匹克竞赛(IOI)赛题上得到了213分,达到了排名前49%的水平。并且该模型参与竞赛的条件与2024 IOI的人类参赛者一样:需要在10个小时内解答6个高难度算法问题,并且每个问题仅能提交 50 次答案。 当每个问题允许10000次提交时,即使没有任何测试时间选择策略,该模型也获得了362.14分——高于金牌门槛。

OpenAI o1的多个版本

OpenAI o1具备多个不同版本。OpenAI还发布了mini版OpenAI o1-mini,成本比o1-preview低80%。o1-mini在预训练期 间针对STEM推理进行了优化。在使用与o1相同的强化学习(RL)训练后,o1-mini在许多有用的推理任务上实现了相媲美的 性能,同时成本效率显著提高。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至