AI模型及应用解读

AI模型及应用解读

    标签
  • AI
最佳答案 匿名用户编辑于2024/02/21 10:04

从文本生成辅助决策到视频生成。

1.文字生成及辅助决策类应用模型:从RNN到Transformer

文字生成及辅助决策类应用:17年以前NLP领域中应用最为泛的模型是基于RNN架构的Seq2Seq模型,但RNN为序列模型,训练时间 开销较大,且难以实现并行处理;2017.6谷歌提出了Transformer模型,解决了RNN不能并行处理的问题,可以堆高模型参数,大大 提高了训练和推理的速度。

1)文本生成类-Copy.ai(文本生成工具)

Copy.ai是基于GPT3的文本生成工具,可应用于商业文章写作、营销文案、产品描述等场景。

2)文本生成类-Notion.AI(智能在线文档编辑工具)

功能:具有智能化的协作、搜索、分类和推荐功能,具体包括生成新内容、编辑现有内容、总结内容、翻译内容 ;模型:基于GPT3 ;应用场景:被广泛应用于知识管理、团队协作、个人笔记等领域。

2.图像生成类应用:从GAN到diffusion model再到SAM类模型

图像生成类应用:原本以CV领域中的GAN模型为主,现以多模态模型中的diffusion model为主(diffusion model解决了GAN模 型效果不稳定的问题);4月以来,SAM、SegGPT、Grounded-SAM模型接连诞生,可以识别图像和视频中的一切物体,CV领域或 将迎来GPT-3时刻。

1)图像生成类-Stable Diffusion(文生图)+Stable Diffusion Reimagine(图生图)

Stable Diffusion和Stable Diffusion Reimagine都是Stability.ai创作的AI生成图像模型/工具。 Stable Diffusion:是Stability AI公司开源的AI文生图扩散模型,通过DreamStudio的API将Stable Diffusion货币化。用 户只用输入提示文本或者拼合的素材图+文本就可以获得完整的的设计图,可用于创造新颖和独特的设计、辅助场景构图等。 ·Stable Diffusion Reimagine:2023年3月17日,StabilityAI推出Stable Diffusion Reimagine,用图像编码器取代了原来 的文本编码器,只要上传一张图片,就可以创作无数张外观相似、但细节和构图不同的图像,该功能目前由Clipdrop工具实现。

2)图像生成类-Midjourney (文生图+图生文)

功能:Midjourney是一款图片生成应用,输入prompt即可生成图像。该产品搭载于Discord社区,用户可通过与机器人Midjourney bot进行对话式交互,并选择不同的主题、风格和分辨率,来生成图像作品,可广泛应用于游戏、影视等领域;4月5日Midjourney是 上线新功能“/describe”,可从图像中反推prompt,极大的节省了创作者学习prompt的时间、提升了图片输出的精准度。

模型:2023年3月16日,Midjourney宣布推出V5模型,与前一代V4相比,V5拥有更多风格选择、更高分辨率、拥有刻画更丰富细节 比如手部细节的能力、对Prompt指令的理解力更强。

3.视频生成类-Runway Gen-2 (文生视频、图生视频、文+图生成视频)

功能:Runway是一款视频生成应用,其Gen-1版本功能为视频生视频,Gen-2版本功能包括文生视频、文本+参考图像生视频、 静态图片转视频,该工具目前搭载于Discord社区。模型:23年2月公司推出模型Gen-1,通过提供初始视频、叠加文字提示语或图片提示,生成新的视频;23年3月20日,首个多 模态视频生成模型Gen-2诞生,相比Gen-1,Gen-2可实现从零开始自动创作短视频的功能,大幅缩短视频制作周期。应用领域:生成式AI视频有望在游戏、影视、营销等领域实现广泛应用。

3D生成类-Luma(文生3D、图生3D、视频生3D)

功能:Luma是一款3D内容方案平台,具有文生3D模型、图生3D、视频生3D等功能。模型:基于NeRF(神经辐射场)模型,其原理是利用深度神经网络,从多个角度拍摄的图片中学习一个连续的三维场景表示, 该表示可以用于合成任意视角下的新图片。Luma使用了NeRF的改进版本,可以在移动设备上实时运行,并提供了一些便捷功能, 如自动对齐、背景消除、模型编辑等。

代码生成类-GitHub Copilot X(代码补全、代码建议、代码测试等功能)

功能:GitHub Copilot X是微软与OpenAI共同推出的一款AI编程类开发工具,能够实现代码补全、代码建议、代码测试、代 码重构、生成代码文档等功能 。模型:23年3月22日推出的CopilotX基于GPT-4 模型,21年推出的GitHub Copilot基于OpenAI的Codex模型(GPT-3模型的低配 版),帮助开发者提高了55%的开发速度。功能更新:相比GitHub Copilot,CopilotX新增了聊天和语音功能等,具体包括: 1)Copilot Chat聊天功能:集成与VS Code和Visual Studio的聊天界面,帮助分析代码、生成单元测试和修复bug 2)Copilot Voice 语音功能:开发者通过口头指令进行自然语言陈述意图,Copilot Voice即可生成代码片段。

参考报告REPORT

AIGC行业研究框架与投资逻辑.pdf

AIGC行业研究框架与投资逻辑。一方面,生成式AI带来的是生产效率的提升,将大家从重复性劳动解放,生产内容更快,将更多精力放在创意等更重要的事情;同时降低用户的学习成本,吸引更多的用户来生产内容或者消费内容,也会改变与商品的交互方式,从而促成交易转化,以上两点将同时提升活跃用户数及提高市场规模,如游戏、电影、有声书、电商平台等多领域,建议关注布局大模型的阿里巴巴-SW、腾讯控股、百度集团-SW等。“从通用到专业?”还是“从专业到通用?”,建议在关注大模型的同时,同时关注NLP领域参数量相对较小的特定领域模型及其应用,有望通过低成本的方式加速落地,...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至