Nebius全栈垂直整合模式与开源模型Token优化路径研究

  • 来源:国信证券
  • 发布时间:2026/07/25
  • 浏览次数:54
  • 举报
相关深度报告REPORTS

人工智能行业专题(19):从Nebius看新兴云与开源模型Token优化.pdf

研究背景与目的国信证券海外市场专题报告,聚焦Nebius作为全栈自研AI原生云代表厂商的商业模式与竞争壁垒,分析其如何通过"裸金属算力→多租户云→TokenFactory托管推理→智能代理层"的四层架构,推动AI推理从闭源模型依赖向开源模型替代的结构性迁移。核心数据Nebius脱胎于Yandex,继承20年分布式基础设施能力与上千名工程师团队;2025年底ARR突破12.5亿美元,2026年全年营收指引30-34亿美元,年底ARR目标70-90亿美元;签约电力容量3.5GW,年底目标4GW;毛利率从2025Q1的52%提升至2026Q1的74%;2026年资本开支指引200-250亿美元。对比...

新兴AI云范式崛起:从资源切分走向算力聚合

传统云计算架构以虚拟化、多租户隔离为核心,将单台物理服务器切分为数十个虚拟机售予不同客户。AI训练与推理场景对计算资源的需求特征发生根本性转变——客户往往需要整租、长周期占用大规模GPU集群,追求极致的原始性能而非资源碎片化。传统云厂商在GPU虚拟化实例中,hypervisor拦截GPU命令、内存请求及网络包带来的性能损耗率在AI负载下放大至显著水平。Nebius等新兴AI云厂商直接提供裸金属服务器,去除虚拟化软件层,采用InfiniBand直连网络与Slurm调度系统,实现单租户独占机柜或整厂的物理隔离模式。

传统云厂商背负数百种通用云服务的研发与运维成本,这些隐性开支摊销至GPU租金中。Nebius的内部成本结构仅包含GPU硬件、数据中心与AI云平台三项,无需为大量非AI服务分摊开销。在能源成本方面,Nebius芬兰自营数据中心具备低电价优势,自研液冷方案进一步降低服务器功耗。综合比较,传统云厂商在微调场景的总拥有成本较Nebius高出显著幅度,推理场景差距更为悬殊。

Nebius四层产品架构与战略演进路径

Nebius构建从物理基础设施到智能代理层的四层产品架构。第一层裸金属基础设施按兆瓦计费,面向超大规模客户;第二层多租户AI云按GPU小时计费,服务数百至数千家研究团队;第三层Token Factory托管推理平台按Token计费,支持六十余个开源模型;第四层智慧代理层处于规划阶段,拟按任务计费实现自动模型调用路径决策。该架构的核心逻辑在于越往上层,可服务客户群数量呈十倍级增长,软件附加值与差异化程度同步提升。

公司脱胎于Yandex体系,继承上千名分布式软件工程师与二十年大厂全栈技术积累。管理层由Yandex联合创始人Arkady Volozh带领,覆盖从技术研发到商业化运营的完整经验链条。2024年完成业务重组后,公司以"NBIS"代码重返纳斯达克,2025年完成私募融资加速全球化布局。

硬件层垂直整合:自研ODM与液冷构建成本护城河

Nebius是新兴云领域唯一采用定制ODM机箱的厂商,同步开发专有固件,避免继承性设计问题推高故障率与排障开销,预计节省OEM溢价幅度在十个至十五个百分点区间。液冷系统采用空气自由冷却与闭环液冷并存的混合方案,配合创新的冷却布局,服务器功耗较标准OEM方案降低约五分之一。

硬件优化能力源于三重支撑:Yandex转移而来的硬件团队具备十五年以上的超大规模基础设施设计经验;Yandex曾是英伟达在欧洲最大客户之一,形成深度合作关系;算力资产以自营为主,芬兰75MW已投产、310MW在建,保障自主可控度。

编排层创新:弹性打包与双栈调度提升资源利用率

Nebius在GPU直通之上叠加VM弹性打包层,Kubernetes调度器将闲置GPU即时分配至其他租户,跨所有租户维护共享缓冲池,仅需少量容量用于自动修复,实现"裸金属性能×云原生利用率"的融合。相较于纯裸金属方案需为每个租户单独预留较高比例的节点作为替换冗余,该机制显著降低空闲功耗。

K8s与SLURM双栈编排系统使同一套GPU硬件同时服务互联网推理用户与高性能计算训练用户,训练作业填补推理低谷,集群利用率最大化。两类用户在各自熟悉工具上零学习成本接入,无需适应新的调度环境。

Token Factory:模型层全栈优化与开源替代路径

Token Factory于2025年11月推出,定位并非简单的模型聚合超市,而是将开源模型进行精加工的"模型工厂"。平台覆盖DeepSeek、Llama、Qwen等主流开源模型,通过系统级优化将推理成本最高削减七成,以透明Token定价输出。该降本效果并非单一层面优化结果,而是ODM硬件、Eigen CUDA Kernel、推理调度三层垂直整合的叠加效应。

2026年5月,Nebius以约6.43亿美元收购Eigen AI,三位MIT HAN Lab联合创始人加入。Eigen拥有AWQ 4-bit量化与SpAtten稀疏注意力两项核心技术,收购前已与Nebius联合优化多个主流模型。整合后Token Factory覆盖几乎所有主流开源模型,在基准测试中跑出行业前列的Token吞吐成绩。

Eigen优化栈从模型层与系统层双维度提升效率。模型层通过量化压缩至四分之一显存占用、稀疏注意力剪除冗余计算路径;系统层通过自定义CUDA Kernel、推测解码、连续批处理等手段让GPU始终处于高吞吐状态。综合优化后单卡Token产出提升至基准水平的二至三倍,在Token价格不变情况下,同等硬件成本可产生更多收入。

开源替代闭源模型的经济性验证

Revolut案例显示,随着用户规模从三千万增长至七千万,闭源模型Token用量暴涨导致成本不降反升、利润率受挤压。该公司从顶尖闭源模型全面迁移至Token Factory托管的Kimi 2.5,通过专用端点锁定稳定性,配合LoRA微调仅调整少量参数适配不同任务,实现训练与推理一体化部署。其金融犯罪检测AI Agent月处理两百万任务,拦截数百万欺诈交易;客服编排月处理一百二十万工单,自动化率持续提升。

Cosine面向银行、国防、核工业等数据不出墙客户,闭源API的黑盒特性与数据出境限制使其无法采用。Nebius通过Token Factory后训练能力,将Llama 3.3 70B调教至接近顶尖闭源模型的编程Agent性能水平,在完全私有环境交付企业级服务。

非Nebius案例同样印证趋势方向。Shopify将Qwen3-32B微调为具备工具调用能力的专用Agent,推理速度提升至原闭源前沿模型的2.2倍,成本下降近七成,已承载其Flow Agent的大部分生产流量。Coinbase构建"开源模型承接常规调用、闭源模型处理复杂任务"的分层架构,在Token使用量持续增长情况下AI支出接近减半。

财务扩张与盈利路径

Nebius签约电力容量从2025年8月的1GW起步,每三个月跃升一档,八个月内翻三倍有余,当前签约3.5GW、年底目标4GW。两座美国超级基地规划1.2GW容量,预计2027至2028年逐步投产。

2026年一季度营收同比大幅增长,季末现金储备达93亿美元。年度经常性收入2025年底突破12.5亿美元,全年营收指引为30至34亿美元区间,年底ARR目标设定在70至90亿美元区间,预计实现约七倍增长。公司绑定微软五年期、Meta五年期两份超大规模长期合同,以及英伟达战略投资,预计前述两家客户占2026年收入约半数。

毛利率由2025年一季度52%提升至2026年一季度74%,提升动力来自三方面:卖方市场下直接提价叠加GPU利用率拉满,所有投产算力售罄且存在多家客户争抢;自有算力占比提升结构性降低成本,自研液冷使电力成本较竞品低近五分之一;高附加值软件产品拉高毛利,Token Factory等PaaS服务边际成本趋近于零,单卡Token产出倍增变相提升单卡毛利。

新兴云扩张期面临高资本开支、折旧压力与利息压力。Nebius 2026年资本开支指引上调至200至250亿美元,其中六成靠自筹资金、四成依赖外部融资。经营利润率从深度负值区间显著减亏,规模效应随长期合同收入放量逐步体现。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至