推荐系统架构 “生成式推荐” 原理与技术细节
生成式推荐(Generative Recommendation, GR):原理与技术细节
文档信息
- 版本:v1.0
- 适用场景:推荐系统架构演进研究、生成式推荐技术选型
- 核心读者:推荐算法工程师、架构师、技术管理者
一、范式定义与核心逻辑
1.1 什么是生成式推荐
生成式推荐(Generative Recommendation, GR)是将推荐问题重新定义为序列生成问题的新范式。其核心思想是:基于用户的历史行为序列,直接预测下一个可能交互的物品,类似于大语言模型预测下一个Token。
大语言模型的快速发展引发了推荐系统设计的范式转变,正在将传统的判别式排序架构转变为统一的生成式框架。新兴的生成式推荐系统将推荐表述为序列生成任务,利用Transformer架构和tokenized item表示,在单一生成骨干中统一召回、排序和推理。
1.2 为什么需要范式革新
传统多阶段级联架构虽然取得了显著的工业成功,但存在系统性的效率问题:
- 语义鸿沟:召回阶段查询和物品的分离编码阻止了深度交叉特征交互。双塔架构分别编码查询和物品,无法在匹配时进行深度特征交互。
- 阶段不一致:不同模块采用冲突的优化目标或容量预算,导致预测差异逐级累积。
- 特征碎片化:各阶段特征工程独立,信息损失逐级累积。
- 缺乏Scaling Law:碎片化的DLRM架构通过分别设计的模块处理高基数、异构特征,质量随模型容量和计算量增长而饱和,不表现出LLM风格的scaling law。
生成式推荐通过端到端统一生成建模来缓解这些问题,优化超越局部用户行为的多维偏好目标。
从更具体的工程角度看,传统级联式推荐将召回、粗排、精排与重排割裂,反馈难以闭环,模块间不一致持续累积,令算力利用效率长期偏低,成为技术与业务演进的共同瓶颈。
二、核心技术一:语义ID
2.1 为什么需要语义ID
传统推荐系统使用原子ID(Atomic ID)表示物品,每个物品被分配一个唯一的整数标识符。这种方式存在严重缺陷:
- 无法表达语义关系:随机分配的数字ID无法表达物品之间的语义相似性。两件相似的T恤可能拥有完全不相关的ID。
- 嵌入表爆炸:物品数量增长时,嵌入表线性膨胀,参数量巨大。
- 冷启动困难:新物品没有交互数据,原子ID的嵌入无法有效学习。
语义ID(Semantic ID, SID)通过将物品的内容特征量化为一组离散的层次化编码来解决上述问题,让相似的物品拥有相似的语义ID。
2.2 RQ-VAE:标准语义ID生成方法
RQ-VAE(Residual Quantized Variational Autoencoder)是将物品连续嵌入转化为层次化语义ID的标准方法。
其工作流程如下:
- 内容编码:使用预训练内容编码器(如Sentence-T5)将物品的内容特征(标题、图像、标签等)转化为稠密语义嵌入向量 z。
- 残差量化:物品的语义嵌入向量 z 首先通过第一层量化器得到量化向量 c₁,然后计算残差 r₁ = z - c₁。残差再输入第二层量化器得到 c₂,此过程重复 L 层,最终得到语义ID (c₁, c₂, ..., c_L)。
- 唯一性保证:为了避免多个物品映射到同一个语义ID,通常在RQ-VAE生成的3元组后面追加一个额外的token,用于确保所有物品存在唯一ID。
RQ-VAE的优势在于:分层量化使相似的物品在高层语义上共享前缀,同时低层编码区分细节,兼顾了语义表达和区分度。
2.3 RQ-Kmeans:工业界的替代方案
快手OneRec采用了一种工业化的替代方案——协同感知多模态分词器,通过融合视频标题、图像等多维信息与用户行为,利用RQ-Kmeans分层生成语义ID。
与RQ-VAE的区别在于:
- RQ-Kmeans使用K-Means聚类替代VAE的量化过程,训练更稳定、更易部署。
- “协同感知”意味着分词器不仅利用内容特征,还融合了用户行为信号,使语义ID同时编码语义相似性和协同过滤信号。
2.4 语义ID的局限性
值得注意的是,最新研究表明SID-based GR存在显著瓶颈。当模型规模增大时,SID-based GR的性能很快饱和,原因是SID编码物品语义信息的能力有限。相比之下,直接使用LLM作为推荐器(LLM-as-RS)的范式展现出更优的scaling特性,通过规模扩展可实现比SID-based GR最佳性能提升多达20%的效果。
三、核心技术二:模型架构
3.1 HSTU(Hierarchical Sequential Transduction Unit)
HSTU是Meta提出的生成式推荐架构,专为高基数、非平稳的流式推荐数据设计。
核心原理:HSTU将用户之前交互的物品ID及其对应动作(如点赞、分享、跳过)视为token,通过多层编码器处理来预测候选物品或动作。
关键技术创新:
- 点式聚合注意力(Pointwise Aggregated Attention) :使用点式归一化机制替代Softmax归一化,更适合流式场景中的非平稳词汇表。
- 性能优势:在合成和公开数据集上,HSTU的NDCG最高优于基线65.8%,在8192长度序列上比基于FlashAttention2的Transformer快5.3至15.2倍。
- 长序列压缩:将百万级历史压缩为数百个摘要token进行缓存,下游仅对这些缓存token执行轻量级注意力,使训练和推理成本保持恒定,已在Meta服务数十亿用户的推荐平台上部署。
3.2 TIGER(Transformer Index for GEnerative Recommenders)
TIGER是Google提出的生成式检索推荐框架,首次将GR引入推荐领域。
核心流程:
- 为每个物品分配唯一的语义ID(通过RQ-VAE生成)。
- 训练一个序列到序列的Transformer模型,预测用户感兴趣的下一个物品的语义ID。
- 推理时,模型以自回归方式直接预测下一个物品的语义ID,然后通过前缀查找映射回实际物品。
关键设计:TIGER并行预测Top-K语义ID前缀(非自回归解码),然后通过前缀→物品的索引查找检索候选,实现大规模快速候选生成。
3.3 OneRec(快手端到端生成式架构)
OneRec采用Encoder-Decoder架构,将推荐问题转化为序列生成任务,由四个核心部分组成:分词器、编码器、解码器,外加一个在后续训练中用来微调的奖励系统。
架构细节:
- 分词器:协同感知多模态分词器,融合视频标题、图像等多维信息与用户行为,利用RQ-Kmeans分层生成语义ID。
- 编码器:Behavior Transformer对用户行为序列及相关特征进行处理。
- 解码器:采用混合专家(MoE)架构,具备大规模参数扩展能力。
- 推理优化:首创计算复用架构——Encoder单次前向 + Beam间KV共享 + Decoder层KV Cache,支撑512大Beam Size生成需求,并基于Float16混合精度与MoE/Attention算子深度融合提升吞吐。
- 偏好对齐:引入基于强化学习(RL)的偏好对齐方法,通过DPO增强迭代偏好对齐,仅需1%的DPO训练比例即可实现显著效果提升。
OneRec在核心场景实现了“更大模型、却更低成本”的跃迁,服务成本降至原系统的1/10,算力利用效率大幅提升。
3.4 腾讯TGR(Tencent Generative Recommendation)
TGR是腾讯提出的工业框架,沿三个耦合方向推进生成式范式:
TGR-GenRank(精排升级) :生产模型CCFormer结合统一特征令牌化、可扩展Transformer骨干网络、特征域分离交叉注意力、长序列子空间令牌混合和层级序列压缩,同时保留逐项多任务输出以支持无缝部署。CCFormer在公开基准和40亿样本的生产数据集上优于HSTU、OneTrans和STCA,以约HSTU一半的GFLOPs实现可预测扩展,训练速度提升2.21倍,在全部五个A/B测试场景中实现统计显著提升,其中视频推荐场景CTR提升3.57%,广告排序场景广告收入提升1.71%。
TGR-GenRec(端到端生成) :探索两条互补的生成路径。在下一Token预测(NTP)方向下,BARGE通过物品上下文感知注意力、层级路径重排序和正交双路径解码,弥合了层级语义ID生成中的两个结构性鸿沟——多Token物品展平时物品边界丢失和早期前缀错误导致的语义漂移。BARGE在两个工业场景中Hit@5优于OneRec 10.2-16.9%。在下一列表预测(NSP)方向下,HiGR将推荐从逐项解码重新表述为整列生成,并协同设计前缀结构语义ID以实现可控规划。
TGR-Reason(推理增强) :通过潜在多步监督摊销LLM推理。离线时,LatentRec训练的Think模型物化完整的语义ID推理Token;Direct Reasoning Injection将这些Token作为层级对齐的提示来条件化在线解码,无需请求时推理展开。
3.5 Netflix GenRec(LLM原生排序器)
Netflix的GenRec是一款基于自研基础大语言模型构建的LLM驱动推荐排序器,采用两阶段框架:
- 第一阶段:将开源大语言模型适配至Netflix自有数据,使其深入理解平台内容目录与会员行为。
- 第二阶段:利用面向推荐排序任务的特化数据、标注样本及奖励信号进行后训练,使排序器更好地契合业务目标并提升会员长期满意度。
核心创新:将推荐问题重构为“语言条件下的排序决策”,用统一LLM backbone替代多特征融合+GBDT/深度排序模型。输入设计强调“上下文口语化”——将用户行为序列、设备、时间等结构化信号转化为自然语言描述而非token拼接。
服务优化:提出“仅预填充”(prefill-only)推理方式,跳过自回归解码,仅计算一次KV缓存,解决LLM低延迟推理瓶颈。仅使用传统模型1/10量级的标注样本即实现统计显著的线上提升(观看时长+1.2%,点击率+0.8%)。
四、训练与优化
4.1 三阶段训练范式
生成式推荐借鉴了LLM的“预训练-指令微调-偏好对齐”三阶段范式:
- 预训练阶段:通过因果语言建模在大规模数据上建立通用生成能力。模型学习预测用户行为序列中的下一个物品语义ID。
- 指令微调阶段:将通用生成能力对准特定推荐任务,如好友推荐、内容推荐等。
- 偏好对齐阶段:通过RLHF/PPO/DPO让模型输出符合业务目标和用户长期价值。
4.2 偏好对齐方法
DPO(Direct Preference Optimization) :最大化选中物品相对被拒绝物品的分数,无需训练独立的奖励模型。OneRec采用DPO增强的迭代偏好对齐,仅需1%的DPO训练比例。
RLHF(Reinforcement Learning from Human Feedback) :通过结果奖励最大化生成物品或物品列表的奖励。
GRPO及其变体:Netflix的研究探索了优势加权监督微调等方法,传统RLHF方法如PPO或DPO在大规模推荐系统中直接应用面临挑战,包括静态数据集容易过拟合和固定候选集限制等问题。
4.3 测试时Scaling
PROMISE框架提出了过程奖励模型(Process Reward Model, PRM)在生成式推荐中的应用。其核心发现是:生成式推荐中存在“语义漂移”问题——早期高层Token的错误会不可逆地将生成轨迹引向无关语义子空间。
PROMISE通过轻量级PRM评估中间推理步骤的质量,结合PRM引导的Beam Search策略,利用密集反馈动态剪枝错误分支。这一方法解锁了推荐系统的测试时Scaling Law:通过增加推理计算量,较小模型可以匹配或超越较大模型。
五、工业实践与部署
5.1 工业部署核心挑战
延迟与吞吐:推荐系统是典型的低延迟、高并发服务,需要实时响应海量请求。与LLM可以容忍自回归解码延迟不同,推荐需要毫秒级响应。生成式推荐通过编码器-解码器分离、KV Cache复用、MoE架构等方式优化推理效率。OneRec通过Encoder单次前向+Beam间KV共享+Decoder层KV Cache,支撑512大Beam Size生成需求。
成本覆盖:在推荐任务中引入大模型,在线推理成本能否由业务收益覆盖是核心问题。只要引入大模型后效果提升、收益增加且可覆盖算力成本,就存在明确的商业驱动力。
可解释性:生成式推荐系统的黑箱特性导致推荐逻辑不可解释、难以调试与部署,尤其在超大规模工业场景中,可解释性与推理效率存在根本性权衡。
5.2 冷启动与长尾问题
生成式推荐通过语义ID和内容理解能力部分缓解了冷启动问题。新物品即使没有交互数据,也可以通过内容编码生成语义ID,利用语义相似性获得曝光机会。但存在初始推荐效果不佳的风险,需要结合准入控制和基于分数的驱逐策略来管理。
5.3 Scaling Law验证
生成式推荐的Scaling Law已在多个维度得到验证:
- 训练Scaling:模型质量随训练计算量呈幂律增长,跨三个数量级,达到GPT-3/LLaMa-2规模。在0.6B至8B参数、163B token的规模范围内,持续预训练的LLM展现出稳健的幂律scaling。
- 模型Scaling:LLM-as-RS范式具有优越的模型scaling特性,通过规模扩展可实现比SID-based GR最佳性能提升多达20%的效果。
- 测试时Scaling:通过增加推理计算量,较小模型可以匹配或超越较大模型。
六、评估体系
6.1 双维度评估
生成式推荐需要双维度评估体系,覆盖推荐准确性和生成质量。
准确性指标:
- Recall@K、NDCG@K、MRR、Hit@K
- AUC、PR-AUC
生成质量指标:
- 多样性、惊喜度
- 语义一致性
- 幻觉率(生成不存在的物品)
在线指标:
- CTR、观看时长、互动率
- 负反馈率、举报率
- 用户留存
6.2 评估挑战
生成式推荐引入了新的评估挑战,可分为两类:
- 现有问题的加剧:偏见、隐私等传统推荐系统问题在生成式范式中被放大。
- 全新风险:物品幻觉(生成不存在的物品)、矛盾解释等生成模型特有问题。
当前领域缺乏标准化基准来系统评估生成式推荐方法,阻碍了对其实效性和实际部署的理解。
七、前沿趋势与开放挑战
7.1 三大汇聚趋势
生成式推荐领域正在形成三大汇聚趋势:
- 召回与排序在共享生成式架构下统一:用单一生成骨干替代多阶段级联,实现端到端优化。
- 偏好对齐、奖励驱动的学习目标整合:从监督式下一Token预测转向强化学习驱动的偏好优化。
- 多模态和跨域基础模型的快速采用:利用预训练多模态模型提供更强的物品表示和世界知识。
7.2 开放挑战
- 延迟-可扩展性权衡:工业级推荐需要毫秒级响应,生成式模型的自回归解码增加了延迟压力。
- 分布漂移下的鲁棒性:流式推荐数据具有非平稳性,模型需要持续适应。
- 生成式推理的可解释性:黑箱决策在工业场景中难以调试和审计。
- 多模态集成:如何有效融合文本、图像、视频等多模态信号仍是活跃研究方向。
- 语义漂移:早期Token错误导致生成轨迹偏离,是语义ID-based GR的核心问题。
7.3 短期务实判断
尽管生成式推荐发展迅速,绝大多数工业系统仍运行在多阶段级联架构上。一个可能的混合架构是:召回层保留多路融合以保证性能和覆盖度,粗排和精排逐步被生成式模型替代以提升效果,重排层保留规则策略以满足业务约束。
附录:关键术语表
| 术语 | 全称 | 说明 |
|---|---|---|
| GR | Generative Recommendation | 生成式推荐 |
| GRS | Generative Recommender Systems | 生成式推荐系统 |
| SID | Semantic ID | 语义ID,离散层次化物品编码 |
| RQ-VAE | Residual Quantized VAE | 残差量化变分自编码器 |
| HSTU | Hierarchical Sequential Transduction Unit | 分层序列转导单元(Meta) |
| TIGER | Transformer Index for GEnerative Recommenders | 生成式检索推荐框架(Google) |
| DPO | Direct Preference Optimization | 直接偏好优化 |
| RLHF | Reinforcement Learning from Human Feedback | 人类反馈强化学习 |
| PRM | Process Reward Model | 过程奖励模型 |
| NTP | Next Token Prediction | 下一Token预测 |
| NSP | Next Slate Prediction | 下一列表预测 |
| MoE | Mixture of Experts | 混合专家 |
| MCA | Multi-Stage Cascading Architecture | 多阶段级联架构 |
| MFU | Model FLOPs Utilization | 模型算力利用率 |
最后更新于 2026-09-13 04:53:58 并被添加「推荐系统」标签,已有 17 位童鞋阅读过。
本站使用「署名 4.0 国际」创作共享协议,可自由转载、引用,但需署名作者且注明文章出处
此处评论已关闭