多模态类型、厂商布局与优势分析

多模态类型、厂商布局与优势分析

最佳答案 匿名用户编辑于2025/10/15 13:55

多模态技术尚未收敛,生成视频、多模态实时交互为未来方向。

多模态大模型融合了多种感知路径和表达形态,能够同时处理文本、图像、语音等多种数据,并进行深度的语义理解和交叉模态处理,具备深度人机交互和全面智能应用 的潜力。当前,多模态大模型主要分为理解和生成两种类型,技术路线尚未收敛,成为国内外大模型厂商重点突破方向之一。

多模态理解模型:多模态理解模型对齐视觉特征与文本特征实现跨模态的统一理解,分为以下两类技术路线:1)一方面,基于语言大模型底座,配合多类外部专家模型共 同实现多模态处理;2)另一方面,通过跨模态特征对齐学习,实现多模态输入的统一和融合,例如OpenAI的CLIP模型通过对比学习,将图像与文本通过各自的与训练模 型获得的编码向量在向量空间上对齐,从而理解和推理图像和文本之间的关系。

多模态生成:多模态生成模型基于对不同模态信息的理解,具备文本、图像、视频、语音信息的生成能力,分为两类技术路线:1)一方面,DiT结合扩散模型与 Transformer优势,成为视频生成模型主流架构;2)另一方面,端到端统一多模态架构,实现跨模态生成与实时交互响应,例如GPT-4o与Gemini均采用端到端原生多 模态单体模型的方式学习文本、视觉、语音等不同模态的统一表征,实现跨模态实时交互响应。

图片:继GPT-4o原生图像生成功能掀起使用热潮后,谷歌最新Gemini 2.5 Flash Image迅速登顶多个主流图像排行榜;Meta也宣布将从初创企业Midjourney授权AI图 像模型,以跟随OpenAI与谷歌步伐。

3月底,GPT-4o集成多模态原生图像生成功能,效果良好引爆用户使用热情。GPT-4o原生图像生成,意味着图像生成不再依赖于单独的DALL-E 3模型,而是直接集成到 了GPT-4o的核心能力中,这种集成带来了更流畅的用户体验和更强大的图像生成、修改能力,具备更好的文本集成、增强的上下文理解、改进的多对象绑定、多样化风格 适应等优势。得益于超预期的效果,GPT-4o原生图像功能上线不到72小时,OpenAI CEO奥特曼宣布ChatGPT图像生成功能开始暂时受限。

8月底,谷歌发布了最新的图像生成和编辑模型Gemini 2.5 Flash Image,成为新晋性能冠军,单图片生成成本仅0.039美元。2.5 Flash Image相较2.0 Flash Image, 在图像质量、编辑控制和应用场景上有大幅改进。用户不仅可以对人物和宠物进行精准编辑,保持其特征一致,还能实现多图合成、多轮次修改与风格迁移等复杂操作。 在大模型竞技场LMArena的文生图与图像编辑两个场景,谷歌的图像模型均拿下全球第一,在图像编辑榜单上模型表现尤为出色,获得1362的高分。

25年开年,DeepSeek多款模型通过算法的系列创新提升算力利用率,以成本、低价、性能等特征显著出圈,带来了模 型平权和应用加速。

DeepSeek以开源方式加速追赶闭源模型,API低价推动“大模型平权”。2024年12月,深度求索推出的DeepSeekV3以极低的训练成本,实现了与GPT-4o和Claude Sonnet 3.5等顶尖模型相媲美的性能;2025年1月,DeepSeek推出 推理模型DeepSeek R1,在后训练阶段大规模使用了RL技术,在仅有极少标注数据的情况下,在数学、代码、自然语 言推理等任务上,性能比肩OpenAI o1正式版。R1 API输出16元/百万tokens,而GPT o1为438元/百万tokens。

模型能力和推理成本迎来拐点,国内Agent应用企业积极接入DeepSeek API,把握AI应用需求爆发红利。2月,国内 万兴科技、易点天下、泛微网络等AI应用厂商相继宣布自身产品接入DeepSeek模型系列,并取得良好的协同赋能。

参考报告REPORT

人工智能行业研究框架:大模型白热化,应用加速分化.pdf

人工智能行业研究框架:大模型白热化,应用加速分化。大模型:加速多模态研发,闭源模型逐步逆袭开源。多模态技术路线尚未收敛,国内外大模型厂商持续刷新SOAT。图片领域,GPT-4o图像生成功能引发热潮后,谷歌Gemini2.5FlashImage登顶多主流图像榜,Meta也从Midjourney授权AI图像模型;视频领域,阿里字节等刷新能力高度,谷歌将视频模型推进至实时交互通用世界模型阶段。Deepseek开源浪潮推动模型平权与应用加速,浪潮后闭源模型逐渐维持性能领先,且借开源策略打造生态入口。一方面,预训练模型ScallingLaw增速放缓使闭源与开源模型性能差距收窄,但OpenAI、谷歌等闭源...

我来回答
分享至