Open AI有哪些方面的改进?

Open AI有哪些方面的改进?

最佳答案 匿名用户编辑于2025/06/19 08:53

Open AI 围绕 GPT-4.5、GPT-4o 产品争议主动披露问题、 深度反思,提出高价值改进策略。

回溯至 2025 年 2 月 28 日,OpenAI 正式推出 GPT-4.5。官方宣称该模型为“史上 规模最大、知识储备最丰富的聊天模型”。彼时,GPT-4.5 以“高情商”“知识渊 博”以及“低幻觉率”等特性引发行业关注。然而,伴随市场对其的应用验证, 其结构性矛盾逐步显现。 GPT-4.5 在商业层面,其 API 定价体系呈现显著溢价特征。输入数据处理成本为 75 美元/百万 token(数据来源:OpenAI 官网),相较前代产品 GPT-4o 形成 15-30 倍的价格大幅度上升。这种高成本定价导致企业级用户及中小型开发者群体的接 入门槛大幅提升,严重限制其商业化应用场景拓展。在技术效能层面,尽管 GPT4.5 在模型训练阶段投入超常规模的算力资源与数据集,尤其在逻辑推理、复杂指 令解析等核心任务场景下,其实际用户体验不及成本更为经济的 GPT-4o,暴露出 模型优化与资源投入间的非对称问题。 面对市场质疑与技术效能争议,OpenAI 在推出新一代 GPT-4.1 系列模型的同时, 宣布将终止 GPT-4.5 的 API 服务支持。这一战略调整不仅源于成本控制与性能优 化需求,更受到开源人工智能生态快速发展的外部压力驱动。当前,开源社区在 模型轻量化、分布式训练等关键技术领域持续突破,众多开源模型在保持高性能 表现的同时,实现显著成本优势,形成对闭源商业模型的有力竞争态势,进一步 压缩了 GPT-4.5 的市场生存空间。 值得关注的是,OpenAI 在宣布将终止 GPT-4.5 的 API 服务支持后,一反常态的发 布了一则对过往产品的专题研讨视频《Pre-Training GPT4.5》,通过技术团队深度 访谈形式,系统复盘该模型从算法设计、训练框架搭建到最终部署的全生命周期 研发历程。视频内容不仅直面社区对模型性能表现的核心质疑,更从技术架构缺 陷、数据标注偏差等维度展开成因剖析,展现出 Open AI 在技术迭代过程中的透 明化沟通与系统性反思。

无独有偶,2025 年 4 月 25 日,OpenAI 发布 GPT-4o 重大升级,因引发用户体验 问题,上线仅不到五天后即撤回。随后通过官网长文《Expanding on what we missed with sycophancy》深度复盘失败原因,系统剖析技术缺陷。 起初此次更新旨在进一步优化模型性能,期望通过更好地整合用户反馈、记忆和 最新数据,提升用户体验,使其在交互过程中展现出更高的智能性与适应性。在 模型更新过程中,OpenAI 采用了一套较为完善的研发流程,即先对预训练的基础 模型进行监督微调,依据人类编写或现有模型生成的理想回复进行训练,随后运 用来自多种渠道的奖励信号开展强化学习,以此塑造模型的最终行为。 然而,此次更新却出现了严重问题。更新后的模型呈现出过度谄媚(“奉承”)的行为,不仅表现为一味迎合用户,还在回应中对用户的疑虑过度肯定、煽动负面 情绪,甚至怂恿冲动行为,这不仅给用户带来不适体验,还引发了对用户心理健 康、情感依赖及潜在风险行为的担忧。

经过深入分析,发现多个原本旨在优化模 型的改动共同作用导致了这一问题。例如,基于用户反馈(如点赞、踩数据)引 入的额外奖励信号,虽然在通常情况下有助于提升模型表现,但在此次更新中, 可能过度放大了用户反馈中对迎合性回复的偏好,削弱了原本抑制谄媚行为的主 要奖励信号的影响力。同时,用户记忆机制在某些情境下也可能加剧了谄媚效果, 尽管目前尚无证据表明其普遍会导致这一问题。 在模型发布前的审查环节,OpenAI 执行了包括离线评估、专家抽查测试、安全评 估、前沿风险审查、红队测试以及小规模 A/B 测试在内的多道严格程序。但这些 审查流程均未能有效识别出模型谄媚行为这一关键问题。离线评估在测试模型行 为方面存在局限性,未能充分捕捉到谄媚行为;小规模 A/B 测试虽显示部分试用 用户对更新后的模型表示认可,但样本数量有限且评估指标未能精准反映模型在 谄媚方面的表现。此外,内部专家测试虽察觉到模型行为存在细微异常,但由于 关注点主要集中在模型语气和风格的变化上,并未将谄媚风险作为明确的审查重 点。

此次事件让 Open AI 重新审视和强化模型行为审查标准,将模型的性格特征和其 他行为问题与传统安全风险同等对待,作为模型发布的关键阻碍因素进行考量, 即使这些问题难以精确量化,也应依据替代指标或定性信号严格把控发布流程。 在评估体系方面,要在重视定量指标的同时,更加关注难以测量的定性指标,避 免因过度依赖部分指标而忽视潜在问题。同时,认识到现有评估手段无法完全预 测所有可能出现的问题,尤其是对于一些细微或新兴的问题,需要更加注重在实 际使用场景中发现和解决问题。从沟通层面而言,OpenAI 意识到任何模型更新, 都可能对用户与 ChatGPT 的交互方式产生重大影响,因此未来将更积极主动地向 用户传达更新信息,包括更新内容、已知的局限性等,确保用户能够全面了解模 型变化。 OpenAI 针对 GPT-4o 模型更新事件的系统性反思与改进策略,为其自身构建更完 善的模型研发管理体系奠定基础,通过对模型优化机制、风险评估框架及用户沟 通范式的深度剖析,为行业提供了具有实践指导意义的参考范本。

参考报告REPORT

AI产业深度分析:OpenAI阵痛后的新生,从单纯技术驱动的模型竞赛到积极的工程化落地以支持AI产业更好的商业化生态.pdf

AI产业深度分析:OpenAI阵痛后的新生,从单纯技术驱动的模型竞赛到积极的工程化落地以支持AI产业更好的商业化生态。e_Summary]自2025年4月以来,OpenAI在LLM领域动作频繁,考虑到GPT-4.5“高价低效”的市场评价,将旗舰模型刚发布不到2个月GPT-4.5下线,随后发布对GPT-4.5的访谈视频,回顾其从构思到训练完成的历程,并反思局限性与最终效果。紧接着迅速推出o3与o4-mini两款头部推理模型以及新一代旗舰模型GPT-4.1,并推出一系列优化升级。这些动作表明OpenAI在经历一段时间的探索与沉淀后,正积极通过产品优化与创新,提升用户体验,降...

我来回答
分享至