GPT-5有哪些预期?

GPT-5有哪些预期?

最佳答案 匿名用户编辑于2024/07/18 10:44

基 于对全球大模型发展趋势的研究和把握,提出几个 GPT-5 可能的预期和展望.

1.预期#1:MoE 架构将延续,专家参数和数量或变大

MoE 是现阶段实现模型性能、推理成本、模型参数三者优化的最佳架构方案。1)MoE 将 各种专家通过路由(router)机制有机整合,在各种下游任务上,能够充分利用每个专家的 专业能力,提高模型表现;2)MoE 天然的稀疏架构,使得 MoE 模型与同参数稠密模型在 推理成本上有较大节省;3)同理,在推理成本固定的情况下,MoE 模型相比稠密模型,能 够把模型参数堆到更大,同样能够提升模型性能。 我们认为,OpenAI 在 GPT-5 模型迭代时仍将采用 MoE 架构,或有部分改进。相比 GPT-4, GPT-5 的 MoE 架构或将有以下改进:1)每个专家的参数更大,例如每个专家大小与 GPT-4 相同,近 2T 参数。即使 OpenAI 无法将单个 2T 参数专家做成稠密架构,也可以使用 MoE 嵌套 MoE 的方式实现。2)专家数量变多,例如幻方旗下 DeepSeek V2 模型即使用改进的 DeepSeekMoE 架构,采取了更细粒度的专家结构,将专家数扩展到 160+,以适应更加丰 富和专业的下游任务。3)MoE 架构本身可能有改进,例如 Google DeepMind 提出了 Mixture of Depth(MoD)架构,向 Transformer 的不同层(layer)引入类似 MoE 的路由机制,对 token 进行选择性处理,以减少推理成本。MoD 可以和 MoE 混合使用,相当于对 MoE 进 行了改进。OpenAI 或也会有类似的改进技术。

2.预期#2:GPT-5 及之后模型的训练数据集质量更高、规模更大

OpenAI 不断加速与私有高质量数据公司的合作进度,为训练大模型做数据储备。2023 年 11 月,OpenAI 即官宣推出数据合作伙伴计划,将与各类组织合作生成用于训练 AI 模型的 公共和私有数据集,包括冰岛政府、非营利法律组织“Free Law Project”等。2024 年, OpenAI 在 4-5 月先后与英国金融时报、程序员交流网站 Stack Overflow、论坛网站 Reddit 宣布合作,相关数据覆盖了新闻、代码、论坛交流等场景。我们认为,OpenAI 在早期的数 据储备中,已经将网络公开可获得的数据进行了充分的开发,根据 OpenAI 的 Scaling Law 和 Google Chinchilla 的结论,随着模型参数的增大,想要充分训练模型,必须增大训练数 据规模,这也从 OpenAI 的广泛数据合作关系中得到印证。我们认为,GPT-5 及之后模型 的训练数据集,将有望吸纳更多高质量的私域数据,数据规模也将变得更大。

3.预期#3:在思维链 CoT 的基础上,再加一层 AI 监督

思 维 链 能 够 在 不 改 变 模 型 的 情 况 下 提 高 其 表 现 性 能 。 2022 年 , Jason Wei 在 《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中首次提出 思维链(chain of thought,CoT)概念,使模型能够将多步骤问题分解为中间步骤。通过 思维链提示,足够规模(~100B 参数)的语言模型可以解决标准提示方法无法解决的复杂 推理问题,提高各种推理任务的表现。以算数推理 MultiArith 和 GSM8K 为例,当使用思维 链提示时,增加 LaMDA 和 PaLM 模型参数可以显著提高性能,且性能大大优于标准提示。 此外,思维链对于模型的常识推理任务(如 CommonsenseQA、StrategyQA 和 Date Understanding 等)同样有明显的性能提升作用

OpenAI 探索了过程监督对模型的性能提升,有望与 CoT 结合,进一步提高推理能力。23 年 5 月,OpenAI 官方 blog 宣布训练了一个奖励模型,通过奖励推理的每个正确步骤(“过 程监督”),而不是简单地奖励正确的最终答案(“结果监督”),来更好的解决模型的数学推 理能力和问题解决能力。与结果监督相比,过程监督有优势:1)过程监督相当于直接奖励 了模型遵循对齐的 CoT,流程中的每个步骤都受到精确的监督;2)过程监督更有可能产生 可解释的推理,因为它鼓励模型遵循人类思考的过程。最终的 MATH 测试集结果中,过程 监督能够提升相对于结果监督 5pct 以上的正确率。我们认为,这种基于 CoT 的过程监督方 法,有可能帮助 GPT-5 进一步提高模型推理的正确性,压制模型幻觉。

4.预期#4:支持更多外部工具调用的端到端模型

GPT-5 有望在 GPT-4 少量的外部工具基础上,增加更多的可调用工具,扩展能力边界。目 前基于 GPT-4 系列的 ChatGPT,能够调用 Bing 搜索、高级数据分析(原代码解释器)、 DALL-E 文生图等外部工具,并且在 23 年 11 月推出 All Tools 能力,让 ChatGPT 在与用户 对话时自主选择以上三种工具。外部工具调用使得模型在性能基本保持不变的情况下,能 力边界得到扩展,其实质与 Agent 调用工具类似。此外,曾在 23 年 3 月推出的 ChatGPT Plugins 功能,本质也是外部工具,但是由于 GPT-4 能力的有限,导致能够在单个对话中使 用的 Plugins 只有三个,因此 Plugins 逐渐被 GPTs 智能体取代。我们认为,随着 GPT-5 推理能力的进一步提高,将有能力更好的自主分析用户需求,以更合理的方式,调用更多 的外部工具(100-200 个),如计算器、云存储等,从而进一步扩展 GPT-5 的模型能力边界。

GPT-4o 已经打下多模态端到端的基础,GPT-5 将延续。我们认为,GPT-4o 验证了头部厂 商大模型原生多模态的发展趋势,这一趋势不会轻易改变,因为端到端的原生多模态,很 好的解决了模型延时(如 GPT-4 非端到端语音响应平均时间超 5s,而 4o 端到端语音响应 时间平均仅 320ms)、模型误差(由于误差是不可避免的,级联的模型越多,误差累计越大, 端到端仅 1 份误差)等问题,因此 GPT-5 将延续端到端多模态结构,或将有部分改进。如 进一步降低端到端的响应延迟,优化用户使用体验;加入更多的模态支持,如深度、惯性 测量单位(IMU)、热红外辐射等信息,以支持更复杂的如具身智能等场景。

5.预期#5:多种大小不同的参数,不排除推出端侧小模型

Google 和 Anthropic 均在同代模型中推出参数大小不同的版本,GPT-5 有望跟进。Google 和 Anthropic 均采取了同代模型、不同大小的产品发布策略,以平 衡用户的成本和性能体验。据海外开发者 Tibor Blaho 信息,ChatGPT 安卓版安装包 1.2024.122 版本中发现了三个新的模型名称:gpt-4l,gpt-4l-auto,gpt-4-auto,其中 l 代表 “lite”(轻量),或是 OpenAI 开始考虑布局大小不同的模型矩阵。由于 Google 官方已经实 现了最小参数的 Gemini Nano 模型在 Pixel 8 Pro 和三星 Galaxy S24 系列实装,且据 Bloomberg 信息,OpenAI 与 Apple 正在探索端侧模型上的合作,我们预测,GPT-5 也有可 能推出端侧的小参数模型版本。

6.预期#6:从普通操作系统到 LLM 操作系统

LLM 操作系统是 Agent 在系统层面的具象化。LLM OS 是前 OpenAI 科学家 Andrej Karpathy 提出的设想,其中 LLM 将替代 CPU 作为操作系统核心,LLM 的上下文窗口是 RAM,接受用户指令并输出控制指令,在 LLM 核心外部有存储、工具、网络等各种“外设” 供 LLM 调用。我们认为,从结构上看,LLM OS 和图表 67 所示的 Agent 架构十分相似, 可以看做 Agent 在操作系统领域的具象化。LLM OS 的核心就是模型能力,随着 GPT-5 推 理性能的不断提升,我们认为 LLM 和 OS 结合的范式将更有可能实现,届时人类和 OS 的 交互方式将不再以键鼠操作为主,而会转向基于 LLM 的自然语言或语音操作,进一步解放 人类双手,实现交互方式的升级。

7.预期#7:端侧 AI Agent 将更加实用和智能

OpenAI 和 Google 已经将模型的重点使用场景定位到端侧 AI Agent。24 年 5 月 13-14 日, OpenAI 和 Google 分别召开发布会和开发者大会,其中最值得关注和最亮眼的部分就是端 侧 AI Agent。OpenAI 基于最新的端到端 GPT-4o 模型打造了新的 Voice Mode,实现了更 拟人、更个性化、可打断、可实时交互的 AI 助手,并能够使用 4o 的视觉能力,让助手针 对用户看到的周围环境和PC场景进行推理;Google的Project Astra也实现了类似的效果, 并且能够根据模型“看到”的场景进行 recall。我们认为,头部模型厂商遵循了模型边迭代、 应用边解锁的发展路径,目前已经将模型的使用场景聚焦到了端侧。结合 OpenAI 与 Apple 的合作进展看,端侧 AI 或将在 24 年下半年成为重点。

更加智能的 GPT-5 能够将 AI Agent 能力推上新的台阶。我们认为,OpenAI 在第四代 GPT 的大版本下,已经通过端到端的 4o 实现了 AI Agent 更实时、更智能的多模态交互。但是基 于目前模型的推理性能,AI Agent 在实现多任务、多步骤的自主任务执行时成功率仍不够 高。以 PC 端基于 GPT-4 的 AI 软件工程师智能体 Devin 为例,在 SWE-Bench 基准测试(要 求 AI 解决 GitHub 上现实世界开源项目问题)上进行评估时,Devin 在没有人类协助的情况 下能正确解决 13.86%的问题,远远超过了之前最好方法对应的 1.96%正确率,即使给出了 要编辑的确切文件,Claude 2 也只能成功解决 4.80%的问题。但是 13.86%的成功率,仍 然距离实用较远,究其原因还是模型的智能能力“不够”。我们认为,随着 GPT-5 核心推理 能力进一步提高,或能将“类 Devin”产品正确率提升到 80%以上,AI Agent 将变得更加 实用和智能。

参考报告REPORT

计算机行业深度研究: 全球大模型将往何处去?.pdf

计算机行业深度研究:全球大模型将往何处去?大模型头部格局基本确定,AIAgent将加速AGI进程。我们认为,海外闭源大模型已经形成OpenAI为首,Google、Anthropic等紧随的格局。在头部闭源模型之下,Meta引领开源模型生态,开源闭源模型差距逐步缩小。为了适配端侧需求,小参数模型也在快速发展。国内看,模型百花齐放,但技术辨识度不高,23年头部互联网厂商和科技企业进展较快,24年以来初创公司开始发力长文本、MoE等领域。展望后续,ScalingLaw+Transformer仍将长期有效,合成数据或逐渐成为关键数据来源。此外,AIAgent能够极大提高现有模型的表现,是实现AGI的重...

我来回答
分享至