AI 辅助设计环节 Adobe 享精修+可控需求利好。
AI 辅助设计为专业设计师提供更多创意空间。目前来看,Midjourney、Dall-E3 等软件仅在 图像生成功能上有较强竞争优势,但是几乎没有编辑功能,限制了设计师对图片自定义自 由度的发挥,经过已有数据训练的模型难以突破人类对创意设计的想象空间以及美学理解 的边界。一方面,Photoshop 等产品定位在“专业级图像处理”方面,其付费用户很多都 是文化创意产业内的公司级客户,对图片创意、细节以及商业价值具有远高出 AI 生图的要 求,因此 AI 生图一定程度上难以挤出图像处理软件;另一方面,AI 生图侧重于生成图片, 而不在于编辑修改图片,因此大量的生成图片或为图像处理软件带来利好。
以 2023 年 12 月更新的 Midjourney v6 版本为例,除了图像生成能力的进一步提升外,v6 还着重提升了细节精确度、局部控制和文字解读等能力,核心目的都是为了进一步提升生 成对生成图像内容的精准控制。从下图 v5.2 与 v6 的对比可知,prompt 中共包含 7 个核心 细节,v5.2 仅能捕捉到其中 2 个,而 v6 则可以在画面中将细节全部展现出来,展现了精准 控制文字-图像对应关系的能力,多模块协同能力进一步提升。由此可见,在各个模型基础 的生成能力逐步趋同之后,如何精准控制并局部修改生成的图像内容将成为各个 AI 原型生 成模型的主战场,也是未来模型走向大规模商业化的必经之路。
Adobe 对 AI 工具的布局深度、广度均远超竞品。图像创意设计领域,除了最基本的文生 图、AI 原型生成模型等,还布局了矢量图模型、文生矢量图、生成式填充、生成式配对、 文字效果处理和生成式色彩改变等。另外,根据 Adobe Firefly 宣传视频所披露的信息来看, 未来 Firefly 将集成视频和音频的生成,可以做到“文字-图片-视频-音频”的全流程转换, 大大提升创意领域的工作效率。
对图像生成精确度要求更高,Firefly 优势更为明显,Adobe 未来的发展前景更可观。Adobe Firefly 未来的竞争优势来源于集成度高的应用和图像可控性领域的长久积累。未来的 AIGC 图像生成赛道中,除了直接生成图像的精确度外,核心竞争要素还包括如何将精准图像生 成及细节修改引入现有平台工作流之中,生成符合商用要求的图像。依托目前的平台护城 河,Adobe 未来的发展前景最为可观。
精准控制的前提是界定图像修改的具体需求,并对此进行模块化集成,提高模型可用性, 降低学习成本。如前文分析,Adobe 的工具深度和工具广度在创意设计领域都处在领先地 位,Adobe 能够迅速洞察创意工作者的新需求并及时针对其进行模块化集成开发。Adobe Firefly 也延续了 Adobe 软件开发的一贯风格,对生成图片后的图像精准控制和修改需求均 进行了模块化集成,细分功能覆盖全面,操作简便。此外,生成式 AI 也为生成图像之后的 局部修改提供了更多可能性。例如,创作者如果需要去掉原有图像上的内容,使用 Photoshop 只能实现一种修改方案,但是生成式 AI 可以提供三种不同效果的方案供创作者选择,实现 了更高的创作自由度,达成了创意工具低门槛、高自由度的统一。
Midjourney、DALL-E 等其他 AI 原型生成模型模块集成能力较弱,目前仅能覆盖工作流的 图像生成部分,无法做到像素级别的图像修改。Midjourney 的特点在于风格化图片的生成 能力,并未将图像生成中的流程和图像生成的具体需求进行模块化更新和迭代,主要依赖 创作者提供符合预期结构的prompt来保证生成的图像符合预期,这抬高了模型的学习成本, 但保证了生成图像的自由度。Dall·E 的特点在于集成了 ChatGPT 的原生模型,对话交互能 力强,可以直接输入自然语言生成图片,且可以通过对话的方式对图片整体和局部进行针 对性修改,因此 Dall·E 的学习成本低,交互体验好,但是生成图像可控性依然有限。
Adobe 通过理解满足用户需求提升工具深度进一步提高可控性。基础的通过文本提示符模 板化的进行 AI 图像生成以及传统图像编辑已经难以满足创造者的需求,根据 Adobe Max 2023,Adobe 工具不断通过技术创新更迭提升达到质量效果齐增。例如,ProjectFastFill 通过 AI 改变视频其中一帧则可以被应用到整个序列当中,对修改部位不仅是运动追踪,并 且做到随着原场景的光线变化、运动幅度等融入变化;ProjectSceneChange 升级视频合成 技术,通过导入提取的场景点云将原来的摄像机运动被保留下来,更新背景并且遵循相同 的相机运动,使构图无缝干净;ProjectResup 通过预测视频、图片丢失的高保真细节,增 强视频纹理和细节,可以应用于超小分辨率和旧视频以及图片还原;ProjectdSeeThrough 能够去除反射,清理倒影,还原照片中被隐藏的信息,利用 AI 自动恢复照片中由于反射而 隐藏的细节。
Adobe 通过融入美学理解降维打击传统机器学习的排列组合效果。AI 辅助设计通常通过输 入描述性提示词来生成图像,生成效果主要依靠训练数据库的容量以及对 prompt 识别的敏 感度,这种方式生成的图像有限并且难以满足创作者自身对美的理解。而 Adobe 进一步升 级机器学习效果,通过视觉提示扩充文本,将创作者自身的美学理解融合到生产过程中, 加强模型对美学的理解,完成模型+数据+美学理解的完整辅助设计环节。
Adobe“美学积累”将开启可控性下一阶段——定制化。Adobe 凭借其长期以来的庞大市 场用户能较快抓取更多不同类型及专业水平的用户对美学的理解数据,并且将 Adobe Research 和产品团队结合促使更多技术落地构筑更强大的创意设计软件版图。Adobe Research 正在研究生成式 AI 的下一阶段,例如如何让所有技能水平的人都更容易使用 Firefly 并且更易于根据每个艺术家的美学意识进行定制,以及增加图像编辑的可控性和精 准性。例如,Adobe 正在试验通过渐进式可控图像合成,用户可以使用简单的标记(例如 用手写笔绘制的线条)编辑图像,只需几笔即可实现更改;通过可定制的扩散可以让创作 者通过选择哪些图像为生成式人工智能提供信息,将自己独特的风格应用到他们的作品中。 这可以为用户提供更多的控制权,并使其更容易在工作主体中创建统一的风格。

Prompt 输入及生成是目前模型交互能力的具象化体现,也是目前 T2I 生成的第一步。目前 主流的三个 AI 原型生成模型对 prompt 的生成和理解流程各有不同。Adobe Firefly Image 2.0 在输入开头之后可以根据关键词生成后续文字内容的提示,帮助创作者拓宽思维,激发 创作者灵感。Midjourney 精准控制图像需要严格遵守官方推荐的 prompt 结构,v6 共包含 6 个部分,分别是风格、生成主体、图像内容描述、图像结构、光影和其他信息,这提高了 创作者直接使用 Midjourney 的门槛。因此,Midjourney v6 也重点更新了自然语言输入的图 像生成能力,提升模型的交互性。而 DALL·E 3 对输入的 prompt 内容没有严格的限制,且 因为集成 ChatGPT 的底层模型,对 prompt 解读能力强于其他 AI 原型生成模型。DALL·E 3 可以直接以“讲故事”的方式输入 prompt,实现高质量的协同交互。
可控性要求越高,Adobe 未来发展前景越好。与其他 AI 图像大模型相比,Adobe Firefly 优势在于依托 Adobe 体系,护城河更深,创作者具有使用惯性,对图像生成精确度要求更 高,Firefly 优势更为明显,Adobe 未来的发展前景更可观。Adobe Firefly 未来的竞争优势 来源于集成度高的应用和图像可控性领域的长久积累。随着 AIGC 图像生成领域的技术能 力逐渐面临瓶颈,prompt 扩充和利用自然语言 prompt 进行局部细节精准控制的发展将迎 来挑战。未来的 AIGC 图像生成赛道中,除了直接生成图像的精确度外,核心竞争要素还 包括如何将精准图像生成及细节修改引入现有平台工作流之中,生成符合商用要求的图像。 随着 AIGC 图像模型的逐步完善,未来创作者对于可控性的要求将进一步升级,在这一赛 道之中,依托目前的平台护城河,Adobe 未来的发展前景非常可观。
Adobe 商业化变现潜力更高,主要体现在版权积累方面。Adobe Firefly 模型训练数据集内 容完全来自有版权保护的图片,比如 Adobe Stock 和公共图库中没有版权保护的图片。与 此相比,Midjourney 因为训练集引发的版权争议,已经面临了超过 2000 位艺术家的集体诉 讼,为 to B 商业化变现蒙上了一层阴影。在模型后续大规模商业化变现的过程中,Adobe Firefly 的版权优势免去了后顾之忧,能够和更多的 PGC、PUGC 内容创作者达成合作,商 业化变现潜力更高。