月之暗面经营看点在哪?

月之暗面经营看点在哪?

最佳答案 匿名用户编辑于2024/05/28 14:12

月之暗面 (Moonshot AI) 创立于 2023 年 3 月,致力于寻求将能源转化为智能的最优 解,通过产品与用户共创智能,2023 年 10 月推出全球首个支持输入 20 万汉字的智能助 手产品 Kimi。

根据21世纪经济报道官方百家号,月之暗面团队成立不到2个月就获得了红杉中国、 今日资本、真格基金、砺思资本等知名 VC 投资,目前团队人数已超 80 人。 创始人杨植麟被多家头部 VC 寄予厚望饱受期待。杨植麟是 Transformer-XL 与 XLNet 等热门论文的第一作者,两者均为大语言模型领域的核心技术。同时也是中国 35 岁以下 NLP 领域引用最高的研究者;另外两位联合创始人周昕宇和吴育昕,则有超过 10000+的 Google Scholar 引用。 根据月之暗面官微,Monolith 砺思资本创始合伙人曹曦表示:“杨植麟是全球大模 型领域里最被认可的华人技术专家,其团队在人工智能技术,特别是大语言模型 LLM 领 域拥有深厚的技术积累,并已在国际上获得了广泛认可”。 真格基金合伙人戴雨森也表示:“杨植麟作为 XLNet 等多项知名科研工作的第一作 者,具备相当丰富的科研和实践经验,多年来他一直坚信通过大模型实现对高维数据的 压缩是人工智能发展的必经之路,也团结了一支人才密度超高,配合默契,又充满挑战 巨头摇滚精神的创业团队。” 月之暗面在多模态相关技术上多有储备,团队成员曾发明了包括基于对比学习的视觉预训练范式 MoCo、最高效的视觉网络结构之一 ShuffleNet 等,也有团队成员主导开发 了 detectron2,后者是一个被广泛使用的视觉开源项目,曾被集成到 Meta 全线 VR/AR 产品中。

创始人杨植麟毕业于清华大学,师从唐杰教授;之后获得卡内基梅隆大学计算机博 士学位,师从苹果公司人工智能负责人 Ruslan Salakhutdinov。“月之暗面”这个名字,来 源于摇滚乐队 PinkFloyd 的著名专辑《The Dark Side of the Moon》(月之暗面)。据创始人 杨植麟介绍,这个名字象征着神秘与未知,与公司在人工智能领域的探索精神相契合, 此外公司成立的日期正好是这张专辑发行的 50 周年。 根据钛媒体 AGI 官微,融资方面,成立不到一年内,月之暗面就已完成两笔融资, 总额超过 13 亿美元,投资方包括红杉中国、真格基金、小红书、美团、阿里等。2024 年 2 月的一笔融资成为国内 AI 大模型公司迄今获得的单轮最大金额融资。两轮投资后, 目前,月之暗面公司估值或达 25 亿美元。 技术产品层面,成立至今,月之暗面已完成从通用大模型到上层应用的布局。其中, 大模型基础层,月之暗面已训练千亿级别的自研通用大模型,并获得了国内大模型备案 审批。 而在应用层,2023 年 10 月 10 日,月之暗面发布了首个支持输入 20 万汉字的智能 助手产品 Kimi Chat。(注:Kimi Chat 后改名为 Kimi 智能助手,下文 Kimi Chat、Kimi、 Kimi 智能助手均指同一产品)

根据月之暗面官微的口径,20 万汉字是当时(2023 年 10 月 10 日)全球市场上能 够产品化使用的大模型服务中所能支持的最长上下文输入长度,标志着月之暗面在“长文 本”这一重要技术上取得了世界领先水平。 从技术视角看,参数量决定了大模型支持多复杂的“计算”,而能够接收多少文本输 入(即长文本技术)则决定了大模型有多大的“内存”,两者共同决定模型的应用效果。 支持更长的上下文意味着大模型拥有更大的“内存”,从而使得大模型的应用更加深入和 广泛:比如通过多篇财报进行市场分析、处理超长的法务合同、快速梳理多篇文章或多个网页的关键信息、基于长篇小说设定进行角色扮演等等,都可以在超长文本技术的加 持下,成为人们工作和生活的一部分。 相比当前市面上以英文为基础训练的大模型服务,Kimi Chat 具备较强的多语言能 力。例如,Kimi Chat 在中文上具备显著优势,实际使用效果能够支持约 20 万汉字的上 下文,2.5 倍于 Anthropic 公司的 Claude-100k(实测约 8 万字),8 倍于 OpenAI 公司 的 GPT-4-32k(实测约 2.5 万字)。 同时,Kimi Chat 通过创新的网络结构和工程优化,在千亿参数下实现了无损的长程 注意力机制,不依赖于滑动窗口、降采样、小模型等对性能损害较大的“捷径”方案。

在月之暗面公司看来,当前大模型输入长度普遍较低的现状对其技术落地产生了很 大制约。例如: 目前大火的虚拟角色场景中,由于长文本能力不足,虚拟角色会轻易忘记重要信息, 例如在 Character AI 的社区中用户经常抱怨“因为角色在多轮对话后忘记了自己的身份, 所以不得不重新开启新的对话”。 对于大模型开发者来说,输入 prompt 长度的限制约束了大模型应用的场景和能力 的发挥,比如基于大模型开发剧本杀类游戏时,往往需要将数万字甚至超过十万字的剧 情设定以及游戏规则作为 prompt 加入应用,如果模型输入长度不够,则只能削减规则 和设定,从而无法达到预期游戏效果。 在另一个大模型应用的主要方向——Agent 中,由于 Agent 运行需要自动进行多轮 规划和决策,且每次行动都需要参考历史记忆信息才能完成,这会带来了模型输入的快 速增加,同时也意味着不能处理更长上下文的模型将因为无法全面准确的基于历史信息 进行新的规划和决策从而降低 Agent 运行成功的概率。 在使用大模型作为工作助理完成任务的过程中,几乎每个深度用户都遇到过输入长 度超出限制的情况。尤其是律师、分析师、咨询师等职业的用户,由于常常需要分析处 理较长的文本内容,使用大模型时受挫的情况发生频率很高。

月之暗面公司认为,走这些捷径无法达到理想的产品化效果。为了真正做出可用、 好用的产品,就应该直面挑战。 具体来看。训练层面,想训练得到一个支持足够长上下文能力的模型,不可避免地 要面对如下困难: 如何让模型能在几十万的上下文窗口中,准确的 Attend 到所需要的内容,不降低 其原有的基础能力?已有的类似滑动窗口和长度外推等技术对模型性能的损害比较大, 在很多场景下无法实现真正的上下文。 在千亿参数级别训练长上下文模型,带来了更高的算力需求和严重的显存压力,传 统的 3D 并行方案已经难以无法满足训练需求。 缺乏充足的高质量长序列数据,如何提供更多的有效数据给模型训练?

推理层面,在获得了支持超长上下文的模型后,如何让模型能服务众多用户,同样 要面临艰巨挑战: Transformer 模型中自注意力机制(Self Attention)的计算量会随着上下文长度的增 加呈平方级增长,比如上下文增加 32 倍时,计算量实际会增长 1000 倍,这意味着如果 只是用朴素的方式实现,用户需要等待相当长的时间才能获得反馈。 超长上下文导致显存需求进一步增长:以 1750 亿参数的 GPT-3 为例,目前最高单 机配置( 80 GiB * 8 )最多只能支持 64k 上下文长度的推理,超长文本对显存的要求可见 一斑。 显著的显存带宽压力:英伟达 A800 或 H800 的显存带宽高达 2-3 TiB/s,但面对如 此长的上下文,朴素方法的生成速度只能达到 2~5 tokens/s,使用的体验相当卡顿。 在过去 Kimi 发布前半年多的时间里,月之暗面的技术团队进行了极致的算法和工程 优化,克服上述重重困难,终于完成了大内存模型的产品化,带来了首个支持 20 万字 输入的千亿参数 LLM 产品。 月之暗面创始人杨植麟此前在接受采访时曾表示,无论是文字、语音还是视频,对 海量数据的无损压缩可以实现高程度的智能。

无损压缩的进展曾深度依赖「参数为王」模式,该模式下压缩比直接与参数量相关, 这大大增加了模型的训练成本和应用门槛,而月之暗面认为:大模型的能力上限(即无 损压缩比)是由单步能力和执行的步骤数共同决定的。单步能力与参数量正相关,而执 行步骤数即上下文长度。 月之暗面相信,更长的上下文长度可以为大模型应用带来全新的篇章,促使大模型 从 LLM 时代进入 Long LLM (LLLM)时代: 每个人都可以拥有一个具备终身记忆的虚拟伴侣,它可以在生命的长河中记住与你 交互的所有细节,建立长期的情感连接。 每个人都可以拥有一个在工作环境与你共生(co-inhabit)的助手,它知晓公域( 互 联网)和私域(企业内部文档)的所有知识,并基于此帮助你完成 OKR。 每个人都可以拥有一个无所不知的学习向导,不仅能够准确的给你提供知识,更能 够引导你跨越学科间的壁垒,更加自由的探索与创新。 当然,更长的上下文长度只是月之暗面在下一代大模型技术上迈出的第一步。月之 暗面计划凭借该领域的领先技术,加速大模型技术的创新和应用落地,不断取得更多突 破。

Kimi 智能助手初次亮相后,凭借约 20 万汉字的无损上下文能力,帮助用户解锁了 很多新的使用场景,包括专业学术论文的翻译和理解、辅助分析法律问题、一次性整理 几十张发票、快速理解 API 开发文档等,获得了良好的用户口碑和用户量的快速增长。 根据 AI 产品榜统计,Kimi 的 2 月上榜访问量已经达到 305 万,仅次于阿里通义千问 的 365 万和百度文心一言的 1006 万,排名国内总榜第三。

与此同时,Kimi 访问量增速也在国内超百万月上榜访问量的 AI 产品中位居第一,2 月达到 107.60%的环比增速,远超同级别产品。而在全球增速榜中,Kimi 的上榜访问量 增速依然排名第一。 根据钛媒体 AGI 官微,月之暗面工程副总裁许欣然更是表示,目前 Kimi 平均每个月 可能都有 100%以上的增速。

2024 年 3 月 18 日,月之暗面宣布 Kimi 智能助手在长上下文窗口技术上再次取得 突破,无损上下文长度提升了一个数量级到 200 万字。与此同时,支持 200 万字上下 文的 Kimi 已启动“内测”。对大模型超长无损上下文能力有需求的用户,可到 Kimi 智能 助手网页版 kimi.ai 首页申请抢先体验。 从 20 万字到 200 万字,由于没有采用常规的渐进式提升路线,月之暗面团队遇 到的技术难度也是指数级增加的。为了达到更好的长窗口无损压缩性能,月之暗面的研 发和技术团队从模型预训练到对齐、推理环节均进行了原生的重新设计和开发,不走“滑 动窗口”、“降采样”等技术捷径,攻克了很多底层技术难点。

月之暗面相信,大模型无损上下文长度的数量级提升,也会进一步帮助大家打开对 AI 应用场景的想象力,包括完整代码库的分析理解、可以自主帮人类完成多步骤复杂任 务的智能体 Agent、不会遗忘关键信息的终身助理、真正统一架构的多模态模型等等。 月之暗面也放出了几个超长无损上下文的使用场景示例: 用户上传几十万字的经典德州扑克长篇教程后,让 Kimi 扮演德扑专家为自己提供 出牌策略的指导;上传一份完整的近百万字中医诊疗手册,让 Kimi 针对用户的问题给 出诊疗建议;上传英伟达过去几年的完整财报,让 Kimi 成为英伟达财务研究专家,帮 用户分析总结英伟达历史上的重要发展节点;上传一个代码仓库里的源代码,可以询问 Kimi 关于代码库的所有细节,即便是毫无注释的陈年老代码也能帮助你快速梳理出代 码的结构。

根据月之暗面的口径,过去要 10000 小时才能成为专家的领域,现在只需要 10 分 钟,Kimi 就能接近任何一个新领域的初级专家水平。用户可以跟 Kimi 探讨这个领域 的问题,让 Kimi 帮助自己练习专业技能,或者启发新的想法。有了支持 200 万字无 损上下文的 Kimi,快速学习任何一个新领域都会变得更加轻松。 快速整理大量的资料是很多用户在工作中经常遇到的挑战。现在 Kimi 能够一口气 精读 500 个,甚至更多数量的文件,帮助用户快速分析所有文件的内容,并且支持通 过自然语言进行信息查询和筛选,大大提高了信息处理效率。例如,公司 HR 可以基于 业务需求,快速从最近的 500 份简历中,让 Kimi 快速找出有某个行业从业经历,同 时从计算机类专业毕业的求职者,更加高效地筛选和识别合适的候选人。 从长篇小说、故事或剧本中,重新发现值得玩味的蛛丝马迹,进行深层细节的挖掘, 是很多影视娱乐 IP 的爱好者热衷的事情。如果将甄嬛传全集几十万字的剧本传给 Kimi,Kimi 能在不同时间段、各个场景的故事情节中,深入挖掘甄嬛、果郡王的情感线 以及和他们孩子的真相。

我来回答
分享至