2024年AI行业更新报告:大模型“开源、轻量、端侧”化,视频与语音加速落地

  • 来源:国泰君安证券
  • 发布时间:2024/08/12
  • 浏览次数:773
  • 举报
相关深度报告REPORTS

AI行业更新报告:大模型“开源、轻量、端侧”化,视频与语音加速落地.pdf

AI行业更新报告:大模型“开源、轻量、端侧”化,视频与语音加速落地。大模型能力提升阶段性放缓之际,我们提示关注“AI落地”进展:如大模型侧“开源”“轻量”“端侧”化趋势显著,视频、音频等领域AI自6月以来更新频出。大模型侧:开源能力快速提升,轻量化趋势显著。2024年以来,大模型发展呈现三大趋势:1)开源模型发展,能力快速接近闭源产品水平;2)“轻量化”,模型“性价比”快速提升;3)端侧模型发展,AI硬件已经开始布局。这些都意味...

1. 大模型侧:开源能力快速提升,轻量化趋势显著

1.1. 趋势一:开源模型发展,能力快速接近闭源产品水平

开源模型 Llama3.1 发布,追平 GPT-4o 和 Claude 3.5 Sonnet。2024 年 7 月 23 日,Meta 推出 Llama3.1,将上下文长度扩展到 128K,增加了对八种语 言的支持,共包括 8B、70B 和 405B 三个尺寸。其 405B 的版本从性能上已 经可媲美 GPT-4o 和 Claude 3.5,而其 8B 和 70B 版本都均超越同等尺寸的 其他开源模型。

顶尖的开源模型趋近顶尖的闭源模型,Llama3.1 或标志行业转折点。整体 来看,开源大型语言模型在功能和性能方面仍大多落后于闭源模型,但开源 模型的成长性有更高的斜率,随着时间推进,开源模型的能力在快速赶上, 如在 MMLU 的测试维度中,最新的 Llama3.5 405B 就已经非常接近 Cluade 3.5 Sonnet。开源模型更为开放,在学习和成长上来源丰富,其与闭源模型 的差距有望持续缩小,甚至超越。

2024 年以来开源模型频现,能力不断刷新。7 月,Mistral AI 发布最新模型 Mistral Large 2,参数 123B,用不到三分之一的参数量性能比肩 Llama 3.1 405B,也不逊于 GPT-4o、Claude 3 Opus 等闭源模型。2024 年以来推出的开 源模型不在少数,性能上足以媲美当前领先的闭源模型。

1.2. 趋势二:“轻量化”,模型“性价比”快速提升

大模型性价比逐年提升,优秀轻量模型层出不穷。成本更低的模型往往表 现也更弱,但是随着相关研究推进,2022-2024 年在同等成本下的大模型表 现逐年提升,2024 年轻量模型赛道也吸引了各家机构的关注,各类轻量模 型层出不穷。

1.3. 趋势三:端测模型发展,AI 硬件已经开始布局

人工评估显示 Apple Intelligence 优于同等大小模型及大模型。苹果 AI 包 括两大基础语言模型:约 30 亿参数的端侧模型 AFM-on-device,和在云服 务器中运行的更大参数模型。其中,端侧模型具有 30 亿参数,能够完成文 本撰写和润色、优先处理和总结通知、创建图像,以及执行应用内操作以简 化跨应用的交互。从苹果在 iPhone 15 Pro 上的测试结果来看,如果用户向 模型发送 1000 个 token 的 prompt,模型将需要 0.6 秒开始响应,之后它将 以每秒 30 个 token 的速度生成结果。相比于 Gemma-2B、Mistral-7B、Phi-3B-Mini 和 Gemma-7B 等大多数竞争对手模型,苹果 AI 的模型更受人类 评分者的青睐。

Apple Intelligence 支持摘要、写作帮助、工具使用和代码等广泛功能。2024 年 7 月 30 日,iOS 18.1 Beta 版上线,同时发布了苹果 AI 的部分功能: 1)文本生成,只要使用标准输入文本系统,在第三方应用程序当中也能够 实现文本总结、校对和重写,另外结合 iOS 18 Beta 的语音备忘录中已经上 线的音频转录功能,文本生成系统还可以为录音生成摘要; 2)Siri:新的 Siri 可以理解两个查询之间的上下文,而无需重述正在谈论的 内容; 3)相册:相册更新后,用户可以用自然语言搜索特定照片,甚至是视频当 中的具体时刻。

三星公布系列 AI 功能,包括图像、翻译等。2024 年 7 月 10 日,三星新品 发布会上重点展示 AI 系列功能。在具体 AI 功能上,在三星折叠屏手机 Galaxy Z Fold6 和 Galaxy Z Flip6 上搭载了多项 AI 功能,如 AI 画圈即搜、 AI 翻译、AI 图像生成等。其中,AI 画圈即搜可以让用户直接在相机取景框 中圈出感兴趣的物体,AI 就会自动识别并提供相关信息;AI 翻译则可以实 时翻译多种语言,并支持面对面交流时使用折叠屏的外屏显示翻译结果;AI 图像生成功能允许根据用户的几笔笔迹, 生成精美的图片。此外,三星 AI 也具备 AI 改写等功能。

Vivo X100 Pro 在主流厂商旗舰手机中综合得分最高。2024 年 4 月,移动发 布《主流旗舰手机 AI 功能评测报告》,其中出厂内置蓝心小 V 的 vivo X100 Pro 在五款主流厂商旗舰手机(OPPO Find X7 Ultra、vivo X100 Pro、荣耀 Magic6 Pro、三星 S24 Ultra、小米 14 Pro)中整体表现最佳,提供了文生 图、图片作诗等图像 AI 功能,给用户 AI 体验最佳。 1)图片功能上,vivo X100 Pro 文生图的表现相对优秀; 2)文字功能上,vivoX100Pro 的蓝心小 V 在文字创作和总结摘要功能方面 都明显领先其他手机; 3)识屏功能上,vivo X100 Pro 在屏幕朗读和识别人物、物品内容的 AI 功 能上表现优秀; 4)语音功能上,vivo X100 Pro 整体表现较好,AI 字幕识别语言种类较多, 面对面翻译和语音助手方面的 AI 功能表现较为优秀。

2. AI 生成视频:能力兑现有望加速

2.1. sora 打破以往时长限制,树立行业标准

2.1.1. sora 的“高度一致性”、“60s 时长”为行业树立全新的标准

sora 推出前,大多数 AI 视频产品采用“逐帧预测”思路,视频动态相对保守, 时长也多在 3 内,通过延伸功能难以保持一致性;而自从 2024 年 2 月, OpenAI 放出 sora 的技术报告与演示视频,其展现出高度的“一致性”,时长 方面超过 5 秒甚至长达 60 秒,画面动态有明显提升、穿梭镜头、光影表现 也非常出众,这使得“AI 生成视频”赛道的行业标准被迅速拔高。

2.1.2. 采用 DiT 思路,大规模训练下体现出“涌现”能力

采用多视频编码形式训练,效果突出。Sora 最早于 2024 年 2 月 16 日公开, OpenAI 一次给出多达 48 个由 sora 直接生成、未经修改的视频,最长的时 长可达 59 秒,远高于主流模型的 3-4 秒的时长和 15-16 秒的极限时长,风 格上涵盖写实、动画、剪纸、3D、风景、微观、细节特写等多种。不同于传 统视频类 AI 采用单帧画面逐帧预测的方式,OpenAI 在 sora 的训练中采用 了 diffusion Transformer 的思路,参考 LLM 的 token 思路,将多种视频编码 成统一格式,形成 visual patches,然后借助 DALLE3 中采用重新标注技术, 对视频形成标注,基于大规模训练数据达成了较为稳定的一致性。根据 OpenAI CTO 穆拉蒂 4 月接受采访的消息,sora 预计在 24 年末上线。

2.2. 6 月以来多家“AI 视频”产品推出,产业呈现加速发展

国内外多个知名团队在 6-7 月推出“AI 视频”产品。包括国内大厂如快手(可 灵)、AI 大模型公司如智谱(清影)、创业团队如爱是科技(PixVerse)、生 数科技(Vidu),海外团队如 Luma(Dream Machine)、Runway(Gen-3 Alpha), 整体呈现加速迭代趋势。

2.3. 快手可灵:已有多次升级,面向全球并尝试商业化

自 6 月初发布以来,已多次迭代。快手可灵 AI 自 2024 年 6 月 6 日发布后 不断升级,6 月 21 日新增图生视频和视频续写功能,7 月 24 日,国际版 1.0 上线,全球用户可用邮箱注册,同日国内方面则是再次升级,升级后画面构 图、色调、以及美观程度显著提升;运动表现也明显提升。国内方面还开始 尝试商业化,用户每日登录免费得 66 点“灵感值”,可用于兑换平台内指定 的功能使用权或增值服务,单个视频生成需要耗费 10 点“灵感值”。

快手可灵具备多项出色功能: 1)最长 10 秒的文生视频; 2)5 秒时长的图生视频:新增运镜控制、自定义首尾帧等功能; 3)最长 3 分钟的视频续写:单次让视频运动延续 4.5 秒,支持连续多次的 续写,最长可生成 3 分钟的视频。

快手可灵推出会员体系,国内 AI 进入“付费时代”。2024 年 7 月 24 日, Kling AI 宣布上线会员体系,目前分为黄金、铂金、钻石三个类别,区别主 要在获得灵感值的数量,按照享受时长可选择月卡、季卡、半年卡、年卡等 多种套餐。以月卡为例,三档会员价格分别为 66 元、266 元和 666 元,分 别可生成约 66 个、300 个或 800 个标准视频。

2.4. 智谱“清影”:AI 大模型团队的“视频”领域尝试

国产大模型独角兽公司智谱发布“清影”,为首家入局“AI 视频领域”的 AI 大模型公司。2024 年 7 月 26 日,作为首家入场文生视频的国产大模型独角 兽的智谱 AI 对视频生成模型进行全新升级,正式上线了 AI 视频生成功能 “清影”,支持文生视频、图生视频。清影此次面向所有用户全量上线,无需预约,人人可用。智谱大模型开放平台 bigmodel.cn 也部署了“清影”。企业 和开发者可通过 API 调用式,体验并使用“清影”的文本生成视频和图像生 成视频功能。 “清影”的生成速度和指令遵循程度较为亮眼。 1)快速生成:仅需 30 秒即可完成 6 秒视频的生成。 2)高效的指令遵循能力:即使是复杂的 prompt,清影也能准确理解并执行。 3)内容连贯性:生成的视频能够较好地还原物理世界中的运动过程。 4)画面调度灵活性:镜头能够流畅地跟随画面中的主要物体或人移动。

作为国内 AI 大模型独角兽公司,智谱的产品之前已涵盖文本、写作、图片、 代码等多形态。智谱已经构建了健全的大模型产品矩阵,包括 GLM-4 系列 模型、CodeGeeX、CogView、CogVLM 等,旗下 AIGC 产品包括智谱清言、 写作蛙、智谱手语等,不仅服务于普通用户,也适用于大模型技术极客、专 业工程师以及寻求专业大模型技术服务的企业。

2.5. Runway Gen-3 Alpha:视频领域“老将”,继续画质领跑

Runway Gen-3 Alpha 保持一贯的“高质量”水准。7 月 2 日,Runway Gen-3 Alpha 正式向用户开放使用,生成速度快、质量高,截止 7 月底版本,Gen3 Alpha 的“文生视频”可以提供如 Motion Brush、Advanced Camera Controls、 Director Mode 等功能,生成的视频画幅比例支持 16:9。 2024 年 7 月 31 日,Gen-3 Alpha 正式推出图生视频功能,支持生成的视频 最长为 11 秒。这一功能让用户能够轻松将任意图像转化为视频的首帧,无 论是单独使用图像还是结合文本提示,都能迅速生成视频。

2.6. Luma Dream Machine:3D 资产经验助力“AI 视频”拓展

Dream Machine 视频质量及生成速度俱佳。2024 年 6 月 13 日,Luma AI 首 发其视频生成模型 Dream Machine,可以通过文字或图片生成高质量的逼真 视频。此外,API 对全球免费开放,每个用户每月有 30 次免费生成的额度, 每条视频时长为 5 秒。 1)从视频质量上,Dream Machine 可生成堪比电影级别的视频效果,在画面的清晰度、色彩的饱和度和及光影的变化俱佳。与此同时,Dream Machine 还支持自由变换摄像机视角,实现追踪、环绕和俯视等效果。 2)从生成速度上,Dream Machine 能够在 120 秒内生成一个包含 120 帧的 高质量视频,目前单个视频最长为 5 秒,用户等待时间大大缩短,创作效 率提升。

Dream Machine 新增“关键帧”和“Loops”功能。6 月 29 日,Dream Machine 新增“关键帧”功能,并向所有用户免费开放使用。关键帧相当是一个视频生 成可视化控制功能,可以帮助大模型框定生成的内容,同时在文本的引导下 生成内容的效果、场景切换、运镜也更精准,极大地满足了媒体制作人员的 需求。7 月 22 日,Luma AI 正式推出了其 Dream Machine 平台的新功能 “Loops”。此创新举措显著提升了内容创作与数字营销的便捷性,用户得以 轻松构建无限循环的视频内容,无需顾虑画面中的剪辑痕迹或过渡不连贯 问题。

Luma 有长期的“AI 生成 3D”相关积累。Luma 团队自 2022 年以来就长期从 事各类 3D 视频和 3D 资产的生成,在 3D 重建方面积累丰富,这一经验对 于团队开发视频生成类 AI 工具有所帮助,特别是在保持一致性方面。

3. 语音功能:或助推 AI 产品迭代

3.1. 以 GPT-4o 语音为代表,相比传统 TTS 信息更多

3.1.1. GPT4-o:无延迟对话、理解和表达情感

根据官方演示效果,GPT-4o 能实现: 1)实时响应:GPT-4o 能够在最短 232 毫秒、平均 320 毫秒的时间内响应音 频输入,反应速度几乎与人类对话时相同,实现用户的自然交流。与演示者 即时交流; 2)真实情感模拟:GPT-4o 具备识别用户情绪变化的能力,甚至能够察觉人 的喘息声和呼吸频率。此外,它还能表现出类似人类的情感反应,对于愉悦、 悲伤和愤怒情绪采用合适的语气回应; 3)通过摄像头实时捕捉和分析环境中的视觉信息:GPT-4o 根据摄像头输入 实时互动解答问题,无需传统的上传图片步骤,实现直接通过打开摄像头来 实时观察周围发生的事情。相比下,之前的 GPT 只能进行单轮次的语言对话、单张照片输入,也无法 理解和表达语言情绪,语音沟通的实现是通过“语音转文字”、“文字理解 (GPT4)”、“文字转语音”的方式进行文本信息的处理。GPT-4o 所有输入 和输出由同一个神经网络处理,能够同时理解文本、图像、音频等,并能将 其任何组合作为输入或输出。

GPT-4o 高级语音、视频等功能开始测试,语音功能后续有望向所有付费用 户开放。北京时间 2024 年 7 月 31 日凌晨, OpenAI 宣布开始向一小部 分 ChatGPT Plus 用户推出高级语音模式,根据测试用户反馈来,部分用户 利用 GPT-4o 进行口语练习,GPT-4o 将针对用户发音进行实时评分,多种 语言测试下都有稳定表现;情感方面,在对 GPT-4o 讲笑话时,它将提供笑 声陪伴,及时给予情绪 反馈;GPT-4o 能实现在讲故事的同时创建背景声, 增加沉浸感;有用户结合视频功能向 GPT-4o 展示了宠物猫的情况,GPT4o 也能够积极回应。本次测试将主要搜集安全、功能方面的反馈,随后, OpenAI 还会发布视频和屏幕共享新功能。语音功能预计今年秋天会向所有 ChatGPT Plus 用户开放。

3.1.2. 字节跳动 Seed-TTS:可在表现力上接近人类水平

Seed-TTS 是一种基于自回归 Transformer 的模型。2024 年 6 月,字节跳 动推出 AI 模型 Seed-TTS,其能够合成自然度和表现力达到人类水平的语 音。Seed-TTS 模型的工作包含四个模块:1)语音 token 化器将语音信号转 换成语音 token 序列,然后基于其训练一个 token 语言模型。2)在推理期 间,该模型则以自回归方式生成语音 token。3)生成的 token 交由扩散模 型处理,以增强其声学细节。4)其输出后,再经过声学声码器处理,得到 最终声波波形。

Seed-TTS 自然度、表现力、稳定性更佳。相比之前的模型,Seed-TTS 有两 大优势: 1)Seed-TTS 合成的语音都有更好的自然度和表现力,考虑多种不同场景(包 括怒吼、哭喊、声情并茂演讲等高难度场景)。使用 t-SNE 绘制 25 个说话 人的真人语音和合成语音的说话人嵌入,结果显示来自同一说话人的真人 语音与合成语音紧密地聚类在一起,证明 Seed-TTS 的语音生成质量很好, 并且与真人语音很相似。 2)Seed-TTS 解决了基于语言模型的 TTS 系统普遍存在的不稳定问题。SeedTTS 在稳定性上的卓越表现得益于 token 和模型设计的提升、改进过的训练 和推理策略、数据增强和强化学习后训练。因此,Seed-TTS 在测试集上的 表现出了显著更优的稳健性。

3.1.3. ChatTTS:流畅语音合成,可预测和控制细粒度的韵律特征

2024 年 5 月,ChatTTS 文本转语音项目在 GitHub 上引起极大关注,最大模 型使用了超过 10 万小时的中英文数据进行训练。在 HuggingFace 中开源 的版本为 4 万小时训练且未经特定领域微调(SFT)的版本。其能够产生中英 文语音、复刻逝去的人的绝版声音、支持多说话人。此外,其在韵律方面超 过大部分开源模型支持细粒度控制,并允许加入笑声、说话间停顿及语气词。

ChatTTS 可自动为文本生成韵律及停顿,但处理长文本能力略有欠缺。实 际使用时,在文本框内输入文本后,ChatTTS 会自动生成韵律和停顿,还会 加入一些“然后”之类的语气词。如果在输入时在文本中加入 [laugh] 和 [uv_break],就能手动控制 ChatTTS 在说话间产生笑声。但是,当前 ChatTTS 处理长文本能力略有欠缺,生成超 30 秒音频时需要手动修复,此外,在处 理长文本时分词也会出现问题。

3.2. 应用端:可显著提升教育和情感陪伴应用体验

3.2.1. 口语等教学场景质量有望提升

多邻国:双智能体协同作用,提供沉浸式学习体验。2023 年 3 月,多邻国 嵌入 GPT-4 后新增两项功能: 1)Role Play(角色扮演):学习者可以在与虚拟角色对话中练习口语及听力技能,互动后,学习者将从虚拟角色处得知他们回答的准确性和复杂性、未 来对话的建议等反馈。这种按需支持的对话模式能给学生们提供即时、准确 的帮助。 2) Explain my Answer(解释我的答案):在某些练习类型后,学习者可以 通过点击钮,了解为什么他们的答案正确或错误的简单解释,并可以请求示 例或进一步的澄清。

可汗学院 Khanmigo:实现学生与虚拟人物对话。可汗学院(Khan Academy) AI 在线教育工具 Khanmigo 可以作为学生的虚拟导师,也可以作为教师的 课堂助手,帮助学生学习数学、科学和人文等课程。此外,Khanmigo 还可 以让学生与历史人物或虚构角色进行虚拟对话,增强他们的兴趣和理解。

网易有道 Hi Echo :对用户口语练习进行实时反馈与点评。Hi Echo 是由网 易有道推出的 AI 英语学习应用,利用国内首个教育大模型“子曰”技术,提 供 24 小时在线的虚拟人口语教练服务。2024 年 5 月 29 日,网易有道推出 “英语口语练习神器”Hi Echo3.0,此次更新后,用户练习口语时将展现实时 评分结果,以便及时了解自己的发音及语法问题,同时还能获得该句详细点 评及地道润色。

3.2.2. 情感陪伴:有望增加情感认同及潜在付费点

Character AI 的“智能 NPC 语音通话”功能广受用户好评。2024 年 3 月, 情感陪伴应用 Character.AI 推出了 “角色声音 ”功能,用户可以在一对一聊 天时听到角色说话。2024 年 6 月 28 日,Character.AI 宣布允许用户与人工 智能角色通话。该功能目前支持多种语言,包括英语、西班牙语、葡萄牙语、 俄语、韩语、日语和中文。在该功能测试期间,就有 300 多万用户拨打了 2000 多万个电话。用户只需轻点按钮,就能直接与用户生成的人工智能角 色发起通话,未来,该功能可用于练习语言技能、模拟面试,或将其加入角 色扮演游戏的玩法中。随着 GPT4-o 语音功能的实现,有望增加情感陪伴应 用的情感认同及付费点。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至