2025年互联网电商行业深度报告:生成式推荐,AI时代互联网技术皇冠上的明珠
- 来源:浙商证券
- 发布时间:2025/10/20
- 浏览次数:905
- 举报
互联网电商行业深度报告:生成式推荐,AI时代互联网技术皇冠上的明珠.pdf
互联网电商行业深度报告:生成式推荐,AI时代互联网技术皇冠上的明珠。生成式推荐有巨大的技术潜力和商业价值:推荐系统的代际式进步意味着信息匹配成本的降低、更多的流量(用户留存、用户停留时长)、更好的变现空间(提升广告加载率、广告转化率)等。我们认为生成式推荐是AI时代互联网技术皇冠上的明珠,主要基于以下4点原因:1)缩放定律有效性。生成式推荐模型随着规模的扩大,带来效果提升(ScalingLaw有效);2)数据和特征的扩充,能进一步提升效果的天花板。3)用统一的框架端到端生成推荐结果,统一优化目标,带来效果收益的同时简化工程结构,带来工程综合成本的下降。4)生成式推荐支持多样性推荐,打破信息茧房...
1 生成式推荐:突破传统瓶颈的全新推荐范式
推荐系统的核心:通过算法降低信息成本。推荐系统通过分析用户画像和历史行为, 推断用户兴趣,从而推荐商品、短视频、新闻等内容。推荐系统是帮助用户应对海量信息 的重要工具,对电商、社交网络、流媒体和新闻聚合平台的成功起到了关键作用。 传统多阶段级联架构经历了机器学习、深度学习的快速发展阶段后,发展遇到瓶颈, 存在阶段割裂(各阶段优化目标不一致)、信息茧房,跨阶段特征难以协同等问题。 过去一年,生成式推荐 (Generative Recommendations, GRs) 在工业界取得了显著的 进展。GRs 利用大语言模型 (Large Language Models, LLMs) 的序列建模与推理能力, 大幅度提升了推荐效果。基于 LLMs 的 GRs 正形成一种全新的范式,展现出取代传统依 赖复杂特征的推荐系统的潜力。
1.1 传统推荐系统回顾:深度学习带来国内互联网平台的带来大幅收益
传统推荐系统通常采用多阶段级联架构 (召回 Recall、预排序 Pre-ranking、排序 Ranking) 以平衡效率与精度。

1.1.1 机器学习时期主要技术和收益
机器学习时期主导模型主要有 LR(逻辑回归)、GBDT(梯度提升决策树)、SVM (支持向量机)、CF(协同过滤)等,模型结构相对简单,适合结构化数据,依赖人工特征工程。该时期主要的互联网厂商以 Google、Baidu 为代表,他们主导了 PC 互联网时代搜 索入口。
2005–2015 年间,Google、百度与 Yahoo 在广告收入增长上出现明显分化,印证了 在机器学习推荐时期,掌握技术优势的 Google、百度实现了显著突出的商业化表现。根据 Bloomberg 数据,在此期间,Google 广告收入十年复合增长率为 23.9%,百度则高达 70.3%,而 Yahoo 为 -1.6%。百度在早期凭借流 量红利和市场扩张实现了高速增长,Google 保持稳健的中高速增长,而 Yahoo 广告收入 则呈现长期下滑趋势。
1.1.2 深度学习时期主要技术和收益
在 2012-2015 期间,机器学习团队深陷特征工程泥潭之际,以 Wide&Deep、DIN、 Two Tower 为代表的深度学习技术似一束破晓之光拨开了迷雾,化作驱动业务提速的核心 引擎。
从互联网大厂广告收入增速/电商货币化率提升能看出深度学习技术曾带来的明显收 益: Google 广告业务增速 2015-2019 期间相比于 2011-2015 期间提升了 4.5PCT。 同样对比 2015-2019 时期,Google 广告业务增速相比于 Microsoft 搜索广告业务 平均增速高出 4.7pct。 阿里巴巴电商业务在 2015-2020 期间,非佣金的货币化率提升了 1.13pct。

1.2 生成式推荐:AI 时代互联网技术皇冠上的明珠
传统的深度学习推荐模型基本上都是判别式模型,核心都是解决 “排序与匹配” 问 题。而生成式推荐核心是解决“创造与生成”的问题,是利用用户的行为历史序列,基于 生成式模型生成下一个用户最有可能交互的物品的推荐过程。
从 2021 年开始,头部的搜推团队大部分受限于两个问题: 1. 缩放定律失效:模型结构的进一步复杂化难以带来推荐效果的显著提升;例如阿 里从最开始的 DIN 取得了非常大的提升,到后面 MIMN,SIM 等等效果逐渐收 敛。 2. 推荐系统的级联结构越来越复杂,维护成本越来越高,各级之间的通信、缓存的 代价越来越大(快手在 One Rec 论文中提及,传统级联架构服务过程中,50%的 资源分配给了通信和存储,而非高精度计算)。
近年来,大语言模型的兴起推动了 GRs 的发展。相关研究如 UCSD 的 SASRec、Meta 的 HSTU、谷歌的 TIGER、快手的 OneRec、美团的 MTGR 和 UNM 等。这些模型不断优化 模型结构,提升了工业级推荐系统的效果。 我们认为生成式推荐会成为 AI 时代互联网技术皇冠上的明珠,主要基于以下 4 点原 因。 1)缩放定律有效性。生成式推荐模型随着规模的扩大,带来效果提升(Scaling Law 有效)。 2)数据和特征的扩充,能进一步提升效果的天花板。过去的深度学习模型更多是利 用上下文特征,用户,物品近期数据生成的 embedding,即使有序列特征,由于模型复杂 度的限制,也不可能做的很长。生成式推荐模型善于处理序列特征,如果能够把超长的用 户序列加入到模型中去,能提升效果天花板。
3)用统一的框架端到端生成推荐结果,统一优化目标,带来效果收益的同时简化工 程结构,带来工程综合成本的下降。 统一端到端框架可以避免传统架构的多元目标冲突、跨阶段建模冲突等问题。 根据快手 One Rec 技术报告的数据:LLMs 的 MFU 约 40%,而传统推荐模型的 训练和推理 MFU 仅 4.6%、11.2%。 4)生成式推荐支持多样性推荐,打破信息茧房。 虽然生成式推荐模型现阶段的收益提升幅度不是革命性的,但它是推荐系统架构的革 新以及推荐系统团队组织架构的革新。 生成式推荐的工业化落地仍存在局限,包括以下几点: 1)数据的不稳定性:互联网推荐数据不仅仅是静态数据,还有动态交互数据,在数据 处理阶段需要大量的方法研究。 2)泛化与过拟合:不同业务场景(电商、视频、广告)数据分布差异大,单一大模型 难以同时适应。 3)推理延迟要求极低:大规模 LLM 或 Transformer 推理延迟过高,无法满足毫秒级响 应需求。 4)存储与计算成本:大模型的计算量往往非线性增长,工业落地需要优化资源的利用 效率。
2 生成式推荐系统中的标杆
从 2023 至今,许多公司和高校提出了多种生成式推荐系统,在工业场景中取得了显著 成效。目前,GR 在在线推荐中的应用主要分为两类: 一是将生成模型融合到传统系统的召 回或排序模块中;二是直接落地端到端推荐。 其中,Meta 的 HSTU 是第一个工业级生成 式推荐系统,而快手的 One Rec 则是国内首个工业级端到端生成式推荐落地方案,美团外 卖推荐算法团队也基于 HSTU 提出了 MTGR 框架。 架构路线的选择,是技术能力、业务需求、资源投入与组织架构匹配的综合权衡。 Meta 的 HSTU 与快手的 OneRec 采用端到端生成式架构(E2E-GR),而字节的 HLLM 和 阿里的 LUM 则选择生成-判别式架构。 E2E-GR 的核心优势在于其一体化建模能力与系统性优化逻辑:前者通过单模型直接 实现从用户行为、内容特征到最终推荐结果的全链路建模,核心是消除中间环节的信息损 耗;后者则通过统一损失函数将用户体验、业务指标等目标纳入同一优化框架,避免了传 统架构中“各阶段目标冲突”的痛点。
2.1 端到端生成式架构(E2E-GR)
2.1.1 HSTU:Meta 首创工业级生成式推荐系统
Meta 借鉴 LLM 思想重塑推荐系统的工作 HSTU《Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations》于 2024 年 2 月发 表。该工作第一次脱离了过去 10 年工业级主流的深度学习推荐系统架构,使用 LLM 思想 探索生成式推荐系统,并首次验证了大语言模型的 Scaling Law 同样适用于推荐系统,是 工业级推荐系统生成式推荐与大规模 scaling 的开创性工作。 工业界主流的深度学习推荐模型(DLRM)依赖大量的特征和海量用户行为,但难以 进一步对模型规模 scaling。Meta 最大的创新点是提出了生成式推荐器 GR 取代 DLRM。 1) Meta 对 DLRM 中的异构特征空间进行统一,将推荐系统的召回排序重新表达为 GR 中的序列参数。这使得模型可以以生成式的方式进行,在相同计算量的情况 下训练更多数据。
2) 用新的编码器 HSTU(Hierarchical Sequential Transduction Unit)将 GRs 扩展到大 型、非平稳词汇表的工业级推荐系统。核心创新点包含: 用单个模块替换 DLRM 的异构模块,通过 HSTU 层实现成对注意力 (Pairwise attention)和目标感知池化(target-aware pooling)。 引入新的点向聚合归一化注意力机制,并通过随机长度(SL)提高用户历史 序列的稀疏性,最小化激活内存使用量,并提出 M-FALCON 算法,在排序 任务中使得模型复杂度跟传统 DLRM 排序对象数量呈线性增长,实现了在推 理预算不变的情况下,虽然模型计算复杂度高出了 285 倍,但是模型的吞吐 量(QPS)提高了 1.5-3 倍。 3) 从实验结果来看:在具有数十亿日活跃用户的大型互联网平台部署,验证了方法 的有效性(排序模型和召回模型分别相比于 DLRM 提升 6.2%和 12.4%),且成功 验证了推荐算法上的 scaling law,证明了 GR 显著更好的可扩展性。
Meta 在 2025 年 8 月发表的最新文章《Realizing Scaling Laws in Recommender Systems:A Foundation–Expert Paradigm for Hyperscale Model Deployment》,该文章在继 2024 年提出生成式推荐器 HSTU 之后,进一步探索如何将 Scaling Law 高效的落地到工业 级推荐系统部署,并提出了“Foundation–Expert Paradigm”替代监督微调/知识蒸馏,旨在 解决超大规模推荐系统中基础模型部署的效率和扩展性难题,并提高了模型的泛化能力。 核心创新点包含: 1) Foundation–Expert 两阶段范式:将通用的“Meta Knowledge”获取集中在基础 模型(FM)中,然后再通过目标感知嵌入有效的转移到轻量级专家模型中提升效 率,实验显示指标迁移率高达 0.64-1.0。 基础模型:HSTU 作为共享的基座模型,建模用户长期跨平台历史数据和候 选物品,生成“目标感知 embeddings”; 专家模型(加快迭代周期、专注特定优化):接收基础模型的“目标感知 embeddings”,专家模型也有自身轻量级的 HSTU 捕捉短期的、不同业务场 景(广告、电商、视频推荐等)的信号; 融合模块:FM 融合模块将代表长期兴趣的处理后嵌入与专家自身 HSTU 模 块输出的代表短期兴趣的嵌入相结合。

2) 构建 HyperCast 端到端基础设施系统:实现了 FM 和专家模型的迭代解耦、支持 在线流式训练,能实现了几分钟内刷新模型,且不中断服务。 3) 实验结果显示:模型性能优势突出、FM 向 Expert 知识传递率达 0.64-1.0,且泛化 能力验证有效。在 “点赞、分享、视频完播” 等核心任务中,TAE 的 NE 降低 幅度(2.13-3.02%)是传统用户嵌入(0.64-1.15%)的 2.8-3.3 倍。并且在 Meta 大规模推荐场景 AB Test 中,点击率(CTR)、转化率(CVR)和收益指标全面 提升。参数冗余降低超过 30%,推理延迟也保持在毫秒级。
2020-2024 年期间,Meta 广告收入增速受“苹果隐私新规”影响降速后,后靠自身推 荐系统改善恢复高速增长,且增速超过 Google。 Google 与 Meta 在苹果隐私新规出台后的表现分化明显。2021 年 iOS 14.5 推出 App Tracking Transparency(ATT)政策后,Meta 广告业务受冲击最大,精准投放能力下降, 2022 年广告收入增速大幅下滑至 3.3%。相比之下,Google 广告业务更多依赖搜索和 YouTube 等自有生态的数据,受影响相对较小,韧性更强。 2023-2025 年, Meta 广告收入增速维持双位数,持续优于谷歌,其业内首个生成式推荐 系统 HSTU 通过精准推荐、拉长用户时长、提升广告转化效率,构建“内容-推荐-广告”协 同闭环,成为驱动增速领先的核心引擎,体现 AI 驱动的广告效率提升。 根据 Meta 公布的 2025 二季报,AI 驱动的广告推荐模型提升效率,Instagram 广告转 化率提升 5%、Facebook 提升 3%;生成式 AI 广告贡献可观收入,对小型广告主价值显 著。
2.1.2 OneRec: 快手首个工业级端到端生成式推荐落地方案
2025 年 2 月,快手团队发表了《OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment》,6 月发表的《OneRec Technical Report》 公布了更多细节。快手主要推出了一个端到端生成式推荐系统 OneRec,该系统采用 Encoder-Decoder 架构,引入了基于奖励机制的偏好对齐方法,借助强化学习增强模型效 果,可在奖励模型引导下直接生成契合用户偏好的视频内容。在推荐场景,OneRec 第一 个实现了真正的端到端,完整地将召回、粗排、精排这样的级联架构淘汰并成功运行,以 达到工业级别的实际应用落地。
OneRec 的核心在于利用 Encoder 压缩用户全生命周期行为序列实现兴趣建模,同时基 于 MoE 架构的 Decoder 实现超大规模参数扩展,确保短视频推荐的端到端精准生成。同时 配合定制化强化学习框架和极致的训练/推理优化,使模型实现效果和效率的双赢。目前, 该系统在以下几个方面的效果显著: 可以用远低于线上系统的成本,采用更大的模型,取得更好的推荐效果(模型 FLOPS 提升 10 倍,MFU 在训练和推理阶段分别实现了 23.7%、28.8%,运营成 本仅为传统推荐 10.6%)。 在一定范围内,找到了推荐场景的 scaling law; 过去很难影响和优化推荐结果的 RL 技术在这个架构上体现出了非常高的潜力。 目前该系统从训练到 serving 架构以及 MFU 水平都和 LLM 社区接近,LLM 社区的很 多技术可以很好地在这个系统上落地。
OneRec 在快手主站/极速双端 app 的短视频推荐主场景上均进行了严格实验。通过为 期一周 5%流量的 AB 测试,纯生成式模型(OneRec)仅凭 RL 对齐用户偏好即达到原有复 杂推荐系统同等效果,而叠加奖励模型选择策略(OneRec with RM Selection)后更实现停 留时长提升 0.54%/1.24%、7 日用户生命周期(LT7)增长 0.05%/0.08%的显著突破(在快 手体系中,0.1%停留时长或 0.01% LT7 提升即具统计显著性)。 更值得关注的是,模型在点赞、关注、评论等所有交互指标上均取得正向收益,证明 其能规避多任务系统的"跷跷板效应"实现全局最优。该系统目前已经在短视频推荐主场景 承担 25%的 QPS。
除了短视频推荐的消费场景之外,OneRec 在快手本地生活服务场景同样表现惊艳: AB 对比实验表明该方案推动 GMV 增长 21.01%、订单量提升 17.89%、购买用户数增长 18.58%,其中新客获取效率更实现 23.02%的显著提升。目前,该业务线已实现 100%流量 全量切换。值得注意的是,全量上线后的指标增长幅度较实验阶段进一步扩大,充分验证 了 OneRec 在不同业务场景的泛化能力。 快手团队在 2025 年 9 月发布《OneRec-V2 Technical Report》,通过架构革新与技术优 化进一步释放生成式推荐的潜力,推动系统向更高效率、更泛化能力的方向演进。OneRecV2 实现了两大核心改进,分别从架构设计与偏好对齐层面实现突破。
1) 惰性纯解码器架构(Lazy-Decoder-Only):采用简化的纯解码器设计,去除了编码器 瓶颈、简化了交叉注意力,轻量解码器相比 V1,总计算量降低 94%,训练资源 减少 90%,在同等算力预算下支持参数规模从 0.5B 扩展至 8B。Lazy-DecoderOnly 的设计原则包括:
上下文处理器:将异构用户特征路径转化成统一的上下文表示,进行归一 化,生成用于交叉注意力的层共享键对值;按时间顺序组织数据,但仅将训 练损失应用于最新的曝光项(new impression) 。 惰性解码器块 Lazy Decoder Block:结合分组查询注意力(GQA),共享键 值对减少内存占用,且无需键值投影,进一步降低计算开销。
2) 基于真实用户交互的偏好对齐。包括时长感知奖励塑形(Duration-Aware Reward Shaping)与梯度有界策略优化(GBPO),解决奖励偏置与训练不稳定问题。 3) 实验结果:线上 A/B 测试显示,其在快手主站/极速版处理 25%总 QPS,App 停 留时间分别提升 0.467%/0.741%,推理 MFU 达 62%,OPEX 保持极低水平,验证 了其在性能与效率上的双重突破。 4) 亚线性模型缩放:从 0.1B 到 8B 参数,模型收敛损失持续下降(3.57→3.19), 其中 0.1B 到 1B 的损失降幅达 0.3,2B 到 4B 降幅收窄至 0.03,显示亚线性缩放 规律,仍待进一步探索。
2.2 融合式生成式推荐
当前 E2E-GR 技术尚未成熟,尚未具备传统深度推荐模型(DLRMs)在工程实践中的 成熟优势:其一,DLRMs 具备推荐结果的可追溯性(例如能解释“为何推荐 A 而非 B”),而 E2E-GR 的黑箱特性削弱了这一能力;其二,E2E-GR 的训练成本显著更高;其 三,其需要全新的生成式模型部署架构,与现有特征系统、召回系统的兼容性较差,迁移 成本极高,导致大部分厂商难以快速替代现有 DLRMs 方案。 因此,部分厂商选择生成-判别式架构,正是为了保留 DLRMs 在工程落地中的成熟经 验。从短期看,生成-判别式在复杂场景中仍具不可替代性,二者将长期共存、相互借鉴。
2.2.1 TIGER:Google 最早提出生成式检索范式
《Recommender Systems with Generative Retrieval》是 Google 团队在 2023 年 5 月发表 的论文,这篇文章提出了一种新的生成式检索推荐系统的范式 TIGER,是在生成式推荐 领域里程碑式的突破,不同于之前单纯是 LLM+Rec 的工作,TIGER 首次实现了“生成式 检索+Transformer Decoder”和推荐系统的融合。 1) 主要创新在“检索阶段”:提出用于序列推荐的生成式检索模型 Tiger,采用端到 端的生成式模型,直接预测候选 ID。首先为每个项目分配语义 ID,然后训练一 个检索模型来预测用户可能会参与的下一个 item 的语义 ID。 2) 生成式检索的这种新范式在序列推荐系统中具有两个优点:1)能够推荐新的和长 尾的 item,从而改善冷启动问题;2)能够使用可调参数生成多样的推荐结果。 3) 实验结果:在亚马逊的三类数据集上训练,Tiger 序列推荐性能指标均大幅优于基 准模型,且能轻松执行冷启动、且在解码过程中基于温度的采样能有效控制模型 预测的多样性。

2.2.2 LLM&RankMixer: 字节分层次 LLM 的生成式推荐方案
字节 2024 年 9 月发表了基于 LLM 的推荐系统落地方案 HLLM《HLLM: Enhancing Sequential Recommendations via Hierarchical Large Language Models for Item and User Modeling》。提出一种将 user 和 item 通过 LLM 解耦的方式来做生成式推荐,是国内第一 个对标 Meta HSTU 的生成式推荐模型,但它更多是判别式和生成式融合的方法。 HLLM 首先使用 LLM 提取 item 特征,然后这些特征会被输入到 user LLM 中来建模 用户兴趣并预测未来的行为。通过大量的物品描述转换为简洁的嵌入向量,行为序列的长 度被缩减到与基于 ID 的模型相当,大大降低了计算复杂度。 HLLM 在线 A/B 测试时融合了判别式推荐。在排序任务的实验中 HLLM 关键指标显 著提升了 0.705%,并且在模型参数更大时表现出优异的可扩展性。与 HSTU 的对比:仅需 要 1/6~1/4 的数据就可达到 HSTU 的同等水平。
字节在 2025 年 7 月发表了推荐系统精排模型《RankMixer: Scaling Up Ranking Models in Industrial Recommenders》,文章针对工业级推荐系统中特征交叉表达能力不足、深层 DNN 训练效率低下的问题,提出了一种面向 GPU 的特征交叉方法,突破了传统 MLP 和 DeepFM 等方法在模型扩展性与算力利用率(MFU)上的瓶颈,是国内第一个在工业级大 规模环境下实现高 MFU 与大参数规模统一的精排模型。 RankMixer 是一种基于特征交叉新范式的混合器(Mixer)结构,结合 Token Mixing + Per-token FFN + MoE。 Multi-Head Token Mixing(特征混合层):替代自注意力机制,将传统 Transformer 中的二次复杂度自注意力机制替换为无参数高效混合操作实现特 征交叉,极大提升并行效率。 Per-token Feed-Forward (PT-FFN):针对每个特征 token 配备独立 FFN,单独 建模,目的是减少冗余参数,缓解特征主导效应,提高计算并行性,增强模 型表达能力。 Mixture-of-Experts (MoE):在部分层引入稀疏专家机制(只激活一部分子网 络),将模型扩展至十亿级参数规模,大幅提升模型容量而不增加推理成 本。
在字节多个实际业务场景(广告、推荐)中,RankMixer 带来了显著效果: 1)MFU 提升 10 倍(4.5% → 45%),GPU 利用效率大幅提高; 2)模型规模扩展超过两个数量级,但推理延迟保持稳定; 3)在线 A/B 实验中,用户活跃天数提升约 0.3%,总使用时长提升约 1.08%。模型 质量指标(ΔAUC)和收入指标 ADVV(广告商价值)。
2.2.3 LUM:阿里基于三步范式构建推荐系统的大用户模型
阿里技术团队于 2025 年 2 月发表了《Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model》。阿里技术团 队在论文中提出,端到端生成式推荐(E2E-GR)方法往往优先考虑理想化目标,损失了传 统基于深度学习的推荐模型(DLRMs)所提供的实践优势。因此阿里引入了一种大型用户 模型(LUM),通过一个三步范式来解决这些限制,该范式旨在满足工业环境的严格要求,同时释放可扩展推荐的潜力。实验表明,LUM 的性能优于最先进的 DLRMs 和 E2EGR 方法。值得注意的是,LUM 展现出出色的可扩展性,随着模型规模扩大到 70 亿参 数,性能仍有提升。阿里已成功将 LUM 部署到工业应用中,在 A/B 测试中取得了显著收 益,进一步验证了其有效性和实用性。 LUM 的核心是通过生成式预训练学习用户兴趣分布,再将学到的知识迁移到下游的 判别式任务(如 CTR 预估)。具体分为三个阶段: 1) 知识构建:使用自回归的“下一条件-物品预测”任务预训练 Transformer 架构,将 用户行为序列中的每个物品分解为条件标记(condition token)和物品标记(item token),例如 [场景 1, 物品 A, 场景 2, 物品 B]。这种设计使模型能学习用户兴 趣与场景的联合概率分布。 2) 知识查询:通过提示工程从预训练模型中提取用户兴趣的稠密表征(如兴趣向 量)。 3) 知识利用:将生成的用户兴趣表征作为特征输入传统深度学习推荐模型 (DLRM),完成排序任务。
LUM 在公共数据集上 AUC 显著提升,表明其三步范式有效捕捉用户兴趣,提高 DLRMs 预测准确性。

工业场景:LUM 较最佳基线在 AUC、R@10、R@50 分别提升 +0.0176、+0.0133、 +0.0134,得益于生成-判别式设计。 最后进行了在线 A/B 实验,在排序任务中测试 LUM。关键性能指标点击率(CTR) 和每千次展示收益(RPM)分别有 2.9% 和 1.2% 的显著提升。
2.2.4 GenRank:小红书推荐系统生成式精排的落地实践
小红书团队于 2025 年 5 月发表了《Towards Large-scale Generative Ranking》。这篇论 文聚焦生成式精排问题,详细介绍了小红书在落地生成式精排时的一些思考和实践经验。 小红书在信息流推荐排序中成功应用了 Meta 的 HSTU 模型,并对其进行了优化,形成了 创新性生成架构 GenRank。GenRank 解决了大规模工业级场景中生成式推荐的有效性和可行性问题,通过理论与实证研究,验证了生成式排序相比当前工业级推荐系统的性能优 势,主要得益于生成式架构本身。在计算资源消耗与现有生产系统基本持平的情况下, GenRank 显著提升了用户满意度指标。 GenRank 的优化包括: 1) 时空偏置优化:通过引入仅需线性 I/O 操作的设计方案,避免了 HSTU 中随序列 长度呈平方级增长的计算瓶颈。 2) 三重嵌入体系:包括位置编码、请求索引嵌入和前 req 时间嵌入,确保训练和预 估的一致性,同时增强模型对用户活跃度的表征能力。 3) ALiBi 增强设计:融合 Flash Attention 与无参数的相对位置-时间偏置,减少了计 算开销,避免了 O(N²)内存访问问题。
通过 Item-Action Organization 和 Position & Time Biases 两种机制, 实现了+94.8%加速, 同时离线 AUC 指标提升 0.06%。 在线 A/B 实验显示,GenRank 在停留时长、阅读量、互动量和 7 日留存率方面均有显 著提升。
3 生成式推荐的商业价值天花板
推荐系统的代际式进步意味着进一步降低信息匹配成本,能带来了更多的流量(用户 留存、用户停留时长)和更好的变现空间(提升广告加载率、广告转化率等)。 同时,更高效的推荐系统可以让“标的物(商品、广告、内容等)”得到更高效率的 分发,提升整个平台的运营效率,有效节省公司资源。
3.1 生成式推荐渐行渐近,哪类互联网公司更受益?
1、符合海量信息分发与匹配、用户数据连贯性高、数据相对稳定的场景最为受益,综 合各项因素,在相对落地较快的三个互联网场景中,我们认为最先获得的更高收益的平台 排序为:电商>内容推荐>广告。
电商平台:用户购买兴趣相对稳定,实时反馈需求低因而对推理的实时性要求不 高,且全站推产品打通了商业流量池和自然流量池。
内容平台(尤其是短视频平台):生成式推荐可发挥多样性优势,但是数据稳定 性相对低(推荐依赖用户实时交互)、但数据质量高(用户行为连续)。
广告平台:用户行为数据定义较为复杂。
2、从目前的理论研究成果来看,相比于传统推荐,生成式推荐降低了模型对特征的强 依赖,能一定程度消弭中型团队与大厂在数据质量和特征数量上的差距。因此中型厂商有 望在生成式推荐浪潮中更大程度的受益(更低的 Baseline)。
3.2 不同互联网业务类型收益弹性测算
3.2.1 电商:“全站推”产品打通商业流量池和自然流量池,生成式推荐带动货币化率 提升
全站推是电商平台(如快手、阿里妈妈、拼多多等)推出的全域流量整合型广告产 品,核心逻辑是打通商业流量与自然流量,以“全站 ROI(投入产出比)”为优化目标, 通过 AI 算法自动分配流量,帮助商家在保障利润的前提下最大化 GMV。其本质是用技术 重构流量运营逻辑,解决传统推广中“流量割裂、ROI 不稳定、操作复杂”的痛点。
以阿里巴巴为例,我们先回顾深度学习模型技术红利期,公司电商业务的表现。 FY2015-2020 年 5 年期间,阿里巴巴 GMV5 年复合增速达 22%,电商客户管理收入 5 年复 合增速高达 33.2%,其中货币化率提升了 1.34pct。

考虑到公司战略与电商线上化渗透率已经较高,虽然商品推荐系统(含广告)的匹配 效率必然首先对 GMV 成交带来收益,提升商家 ROI,再对货币化率形成正向影响。但是 为了简化测算,我们对 GMV 份额提升暂不做假设,主要考虑生成式推荐对电商业务中客 户管理收入的货币化率带来显著提升进而带来的商业收益。若未来 4 年货币化率提升 30%/50%,其他假设条件不变的情形下,阿里巴巴电商客户管理收入的增量收入分别是 80 亿元/158 亿元,对阿里巴巴 CMR 复合增速的提升分别是 4.7pct/8.8pct,阿里巴巴集团收 入复合增速的提升分别为 1.5pct/2.9pct。若考虑 GMV 份额的提升,公司收益会更显著。
3.2.2 短视频平台:用户数已接近天花板,提升时长、ad load、转化率和电商 take rate 是关键
短视频流量平台的 DAU 均已经接近天花板,但是不同平台的 DAU 时长、广告加载率 和电商货币化率有显著的差异。 以快手为例,考虑到目前 One Rec 在生成式推荐架构的领先性和已经获得的收益,我 们假设 2027 年 DAU 时长和 AD Load 均增长 10%/20%,则对应广告收入 2024-2027 年的增 速 CAGR 会提升 7.5pct/14.6pct;公司整体收入 2024-2027 年增速 CAGR 会提升 4.5pct/8.9pct。(快手电商的广告收入计入公司广告收入,因此电商 take rate 提升隐含在 AD Load 提升假设中)。
3.2.3 互联网广告平台:成熟平台流量接近天花板,广告转化率提速带动收入增长提速
我们在前文回顾了 Google 广告在深度学习技术红利期(2015-2019 年),Google 广告 业务增速 2015-2019 期间相比于 2011-2015 期间提升了 4.5PCT。我们对腾讯的非短视频广 告、bilibili 的广告收入增速分别假设提速 3pct/5pct,对腾讯视频号的时长和广告加载率分 部假设提速 10%/20%,对应敏感性测算结果如下。
腾讯控股:情形 2/情形 3 相比于基础情形,营销收入 2024-2027 年 3 年 CAGR 提升 4.6pct/8.6pct;公司整体收入 2024-2027 年 CAGR 提升 0.9pct/1.8pct。 Bilibi: 情形 2/情形 3 相比于基础情形,营销收入 2024-2027 年 3 年 CAGR 提升 3pct/5pct;公司整体收入 2024-2027 年 CAGR 提升 1.1pct/1.8pct。若考虑 Bilibili 较低的 Baseline,我们提高其广告收入增速的假设至 8pct/15pct(情形 4/情形 5),则公司整体收 入 2024-2027 年 CAGR 提升 3pct/5.8pct。
编辑:火腿肠- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 6 房地产行业专题报告:城市更新推动高质量发展.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年7月A股回调归因与底部布局策略分析
- 2 2026年上半年小红书六大热门行业消费趋势洞察
- 3 2026上半年小红书六大热门行业消费数据洞察
- 4 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
- 10 2026年8月投资组合报告:从极致抱团到均衡修复
