2024 年 11 月至今,国内外 AI 视频图像模型不断迭代。
按照模型源代码及内部 细节是否公开,可分为闭源模型和开源模型。目前海外头部 AI 大模型厂商已发布多 款新版本视频及图像生成模型,包括 OpenAI GPT-image-1、Runway Gen-4、 Midjourney V7、Google Veo 2、Adobe TransPixar 等,国内快手发布可灵 2.1 及可 图 2.0,字节跳动 Seaweed-7B 和 Seedream3.0、阿里通义 QVQ-72B-Preview、腾 讯混元 HunyuanVideo 和 FastHunyuan 等。 未来 AI 视频图像模型技术发展将聚焦于 3D 生成模型、多模态融合、参数性能 提升,例如 Roblox Cube 3D 模型、深势科技 Uni-3DAR、趣丸科技 Kiss3DGen、 VAST TripoSG 和 TripoSF 等聚焦 3D 生成,推动影视游戏内容生成、场景设计及 3D 建模自动化;Owen2.5-Omni-7B、Gemini Flash 2.0 等模型强调多模态融合,文本、 视频、图像联合训练,支持更灵活的跨模态生成;腾讯混元 HunyuanVideo、阿里通 义 QVQ-72B-Preview 模型参数规模迅速扩大,计算能力及复杂场景处理性能不断 提升。 开源与闭源生态并行:海外及国内 AI 巨头(如 Google、Adobe、OpenAI、字 节跳动)闭源模型竞争日趋激烈,加速渗透大型商业化市场如广告、影视制作等;开 源模型降低中小开发者门槛,在游戏、短视频等交互场景中推动技术普惠化。

3D 生成模型未来或成为重要竞争领域,推动影视、游戏内容生成、科学研究领域 3D 建模自动化。今年以来,在传统 AI 视频生成模型版本技术更迭的同时,众多 AI 技术厂商开始发布基于 3D 对象的生成模型: 1)3 月 18 日,Roblox 发布开源 3D 生成模型 Cube,主要用于为游戏开发者及 时构建 3D 对象和场景,在开源 Cube 3D 中,可以直接从文本和未来的图像输入生 成 3D 模型和环境,生成的对象与当今游戏引擎完全兼容,核心技术突破在于 3D 标 记化;2)3 月 25 日,深势科技、北京科学智能研究院及北京大学发布 3D 生成模型 Uni-3DAR,未来可应用于构建通用科学智能体,核心技术是统一微观与宏观 3D 结 构、统一生成和理解的自回归框架,后期可以引入多模态信息并结合大语言模型与 科学文献知识,为构建通用科学智能体提供理论基础;3)3 月 26 日,香港科技大 学(广州)与趣丸科技推出 3D 生成框架 Kiss3DGen,可应用于游戏开发和影视制 作中角色及场景设计、VR 和 AR 内容创作等,核心技术包括重新利用 2D 扩散模型、 3D Bundle Image、法线图增强等;4)3 月 28 日,VAST 发布开源 3D 生成模型 TripoSG 和 TripoSF,TripoSG 用于基础 3D 生成,TripoSF 专注于高分辨率三维重 建和生成任务,未来应用场景包括影视与游戏创作、3D 打印与制造业等,核心技术 是全新 3D 表示法 SparseFlex、视锥体感知训练策略及动态拓扑支持与开放生态。
3D 生成模型应用雏形初现,游戏与 3D 打印领域将成为未来焦点。1 月 21 日 腾讯混元宣布开源 3D 生成大模型 2.0 版本,支持文字、图像生成 3D 资产,几何结 构更加精细,纹理色彩更加丰富,目前 3D 生成大模型已应用于腾讯游戏业务中; VAST 与拓竹、纵维立方等 3D 打印行业领先厂商合作,引入 AI 自动建模功能,大 幅提高生成效率并降低人工建模成本,通过 AI 重构 3D 创作流程实现技术突破,应 用领域覆盖消费级市场和工业制造,在手办潮玩、课程教育、定制化设计等细分领 域应用雏形初现。
在游戏领域,AI 陪伴为目前 AI 模型主流应用场景。1)3 月 15 日,米哈游创始 人蔡浩宇新公司 Anuttacon 发布新款 AI 游戏《Whispers from the Star》,同时针对 美国地区玩家 iOS 平台开启封闭测试招募。游戏核心机制是通过实时对话推动剧情 发展,玩家任务是帮助主角 Stella 在外星星球生存并找到回家的路,在此过程中 Stella 对话由实时生成,根据玩家输入 Stella 反应、情绪和动作会发生变化,玩家也 可以通过视频、语音和文字多模态输入与 Stella 互动,每次选择都可能影响故事走 向和 Stella 命运,实现玩家自定义的开放剧情,更加具备沉浸式游戏体验。2)恺英 网络投资的自然选择公司推出首款 3D AI 伴侣游戏产品《EVE》,内容层面通过游戏 级别的剧情设计提供丰富的交互体验,是基于 AI 技术的虚拟恋爱陪伴产品;技术层 面通过自研 AI 对话模型 Vibe 深度理解用户输入,专为情感陪伴设计并满足用户在 情感交流中的需求,自研 AI 记忆模型 Echo 记录用户细微需求和过往互动细节,为 用户提供更个性化服务和深度互动。恺英网络作为《EVE》产品的投资方,未来将在 AI 大模型和 AI 交互应用两大板块持续进行研发投入,持续深化 AI 技术在游戏行业 应用。
“AI+影视动画”合作成果初现,AI 技术赋能传统经典 IP。 “未来影像计划·AI 动 画创作周”由上海电影和即梦 AI 于 3 月共同发起,设立三大评选赛道:1)以《大闹 天宫》为代表的中国经典角色形象;2)《宝莲灯》为代表的中国经典动画故事;3) 《鹿铃》、《山水情》为代表的中式美学风格。上海电影与即梦 AI 未来将以“科技赋能 内容,创新驱动未来”为核心,从 AI 动漫短剧共创、AI 青年创客培育、AI 内容城市 展厅三个维度逐步落地双方的战略合作。上海电影与即梦 AI 将继续深度探索“AI+影 视动画”,推进 AI 技术在影视内容生成、IP 运营、宣发模式等全链条的创新应用。
AI 图像及视频生成持续赋能广告营销领域,创意营销引领潮流。AI 视频及图像 生成模型已应用于广告营销行业,2024 年龙年春节各大厂商抓住春节契机,通过 AI 图像及视频生成赋能传统经典 IP,如生肖、春联等,广告营销创意不断更新,从 AI 生成平面海报到多媒体互动,对消费者实现精准营销甚至用户共创。1)天猫联动 20 多位明星与多个热门 IP,发起 AI 共创年画活动,用户通过 AI 互动在明星或 IP 制作 的年画添加自己的一笔,创作出带有个人创意的年画,“明星联动+个性定制”的互动 模式吸引大量粉丝参与,持续助力品牌营销;2)康师傅 AI 写春联并引入定制数字 人形象,用户可以生成带有个人形象的海报;3)可口可乐春节互动营销,引入 AI 视 频生成技术,用户不仅可以生成个人数字形象,还能选择个性化语音生成动画视频, 说出新年祝福;4)伊利短片《千年江南》,通过 AI 视频生成技术实现场景快速切换, 特效丝滑且有质感;5)二手玫瑰与京东家电合作《我要开花 AIGC 版》,使用 AI 视 频生成技术制作明星数字形象,配合独特的主题视觉以及辨识度极高的音乐。
“AI+设计”探索新质生产力,AI 建筑设计、品牌包装设计方兴未艾。去年以来, 国内建筑设计研究院已将 AI 辅助设计软件应用于建筑设计领域,包括校园新校区设 计、建筑外观设计等;2025 年 5 月,LiblibAI 发布全球首个设计类 AI 智能体(AI Agent)Lovart,创始人陈冕曾任字节跳动剪映全球商业化负责人:聚焦品牌设计, 从 LOGO、海报到品牌 VI 系统,Lovart 支持一站式生成;根据用户提供产品图和创 意方向完成广告与视频制作;支持文创与个性化内容创作。1)中南建筑设计院设计 师通过“Giant AI”软件(建筑创意具现软件)勾画,使得需要设计师数日渲染修改的 复杂建筑场景图在 4 小时内即可辅助设计人员实现设计快速成型,目前 Giant AI 辅 助设计已应用于武汉警官职业学院新校区、天门石家河遗址博物馆、陕西省政务和 公安大数据中心等省内外多个项目;鄂州花湖机场是我国首个采用 BIM 模型搭建、 深度应用数字化建设的机场,机场运用“数字孪生”理念,通过一套模型实现了项目的 全生命周期管理,实现设计的“图模一致”到建造的“物模一致”;2)Lovart 支持从创意 拆解到专业交付的全链路设计,给出具体英文提示即可设计出一款前卫、时尚的包 包;同理给出具体风格要求及建议即可设计一款宠物食品品牌,如名称为“Billy”、卷 毛贵宾犬、充满趣味的线描插画、手绘涂鸦风格并保留笔触感。