推荐系统最容易制造一种错觉:模型越新,系统就越先进。
真正做过推荐的人会知道,模型只是水面上的一小部分。水面之下还有曝光偏差、延迟预算、特征新鲜度、库存约束、探索风险和反事实评估。大语言模型(LLM)确实给推荐系统增加了新的语义入口,却没有替我们消除这些旧问题。它甚至会带来新的麻烦:成本更高、输出不稳定、解释可能看似合理却与排序依据无关。
因此,问题不该是“要不要把推荐系统升级成 LLM”,而应该是:
哪一段决策缺少语义,哪一段仍应服从行为数据,哪一段必须通过真实实验,而不是语言模型的自信来证明?
本文依据截至 2026 年 7 月可查的论文与官方技术资料,整理一条从基线到上线的工程路线。对于 2025 年前后的新研究,我会明确区分预印本实验、公开基准和工业线上证据。论文中的 SOTA 不是生产环境的通行证。
先给结论:LLM 不是推荐系统的替代品
一个可靠的推荐系统通常仍然是多阶段漏斗:
行为日志、物品内容、业务约束
│
多路召回:CF / 双塔 / 图 / 语义检索
│
粗排与精排:相关性、转化、价值
│
重排:多样性、新颖性、公平性、库存
│
展示、反馈、实验与持续监控
LLM 更适合嵌入这条链路,而不是吞掉整条链路:
- 在内容理解中提取主题、属性、风格与约束,帮助新物品冷启动。
- 在语义召回中理解自然语言需求,并把查询映射到物品空间。
- 在对话层中追问含糊意图、组织候选结果、生成有依据的解释。
- 在离线数据生产中辅助标注、扩展属性和蒸馏轻量模型。
而高吞吐召回、逐候选精排、业务约束和最终线上验证,通常仍由可控、低延迟的专用模型与规则承担。Google 公开的 YouTube 推荐架构早已展示了候选生成与排序分离的工业逻辑;LLM 改变了其中一些特征和交互方式,没有让容量与延迟约束消失。
一、先建立不能被新模型绕过的基线
协同过滤仍然回答“人群共同选择了什么”
矩阵分解、ItemCF、双塔和 LightGCN 的价值,不在于它们“经典”,而在于它们直接学习用户与物品的共同交互结构。语言模型擅长理解“这本书写了什么”,却不会天然知道“喜欢这本书的人还长期买了什么”。
内容语义和协同信号不是同一种知识:
| 信号 | 擅长回答 | 典型短板 |
|---|---|---|
| 协同信号 | 相似人群共同消费了什么 | 新用户、新物品、稀疏长尾 |
| 内容语义 | 物品在讲什么、约束是什么 | 缺少真实偏好与转化关系 |
| 上下文信号 | 用户此刻为什么来 | 容易被短期噪声影响 |
| 业务信号 | 什么能展示、履约或合规 | 可能损伤纯相关性指标 |
工程上的第一条原则,是先保留一个简单且可信的基线。数据稀疏时,ItemCF、矩阵分解或双塔往往比端到端 LLM 更容易训练、解释和回滚。只有当语义信息确实补足了冷启动、长尾或复杂查询,融合才有意义。
DIN 不是 Transformer
原文曾把 DIN 与 Transformer 模型并列为“基于 Transformer 的排序模型”,这是错误的。
DIN(Deep Interest Network)发表于 2017 年。它在 Embedding & MLP 范式上加入面向目标广告的局部激活单元,用候选物品对历史行为加权,得到随候选变化的兴趣表示。它使用注意力思想,但不是 Transformer 架构。
SASRec 才是基于自注意力的序列推荐模型;BERT4Rec 则使用双向 Transformer 和 Cloze 任务建模行为序列。三者解决的问题也略有不同:
- DIN:面向某个候选物品,从历史中挑出相关兴趣,常用于 CTR 预估。
- SASRec:用单向自注意力预测下一次交互。
- BERT4Rec:用双向上下文恢复被遮蔽的物品,更偏向序列表示学习。
“用了 attention”不等于“是 Transformer”。架构名称一旦混淆,模型成本、训练方式和在线服务设计都会被误判。
二、语义表示应该补位,而不是覆盖行为
物品侧:从内容嵌入开始
LLM 或视觉语言模型可以把标题、描述、属性、图片等内容编码成向量。它们对三类场景尤其有价值:
- 新物品还没有交互,却已有足够内容。
- 用户用自然语言提出组合约束,例如“适合雨天、节奏慢、不要爱情主线的电影”。
- 目录的人工标签粗糙,无法描述风格、主题和使用情境。
但不要直接把原始内容向量当作最终排序分数。更稳妥的做法,是先把它作为一路召回或一组特征,与 ID embedding、热度、价格、库存和上下文共同进入排序模型。语义相似只说明“内容像”,不说明“用户愿意点、愿意买、愿意长期留下”。
用户侧:压缩历史不等于理解用户
把用户历史拼进 Prompt 很直观,却会迅速遇到长度、噪声、隐私和时效性问题。可用的用户状态通常至少分为两层:
- 长期状态:稳定品类、价格带、反复出现的主题,按天或按周更新。
- 会话状态:最近查询、点击、跳过和当前入口,按秒或分钟更新。
长期画像不应该因为一次偶然点击被重写;短期意图也不该被多年历史淹没。实践中可以让轻量序列模型维护短期向量,让批处理画像提供长期先验,再用门控或注意力融合。LLM 适合把复杂历史压缩成可读摘要,但摘要必须带来源时间、可撤销,并接受下游任务评估。
UQABench 正是在追问“用户 embedding 是否真的保留了对个性化有用的信息”。它把评估拆为序列理解、行为预测和兴趣感知三类任务。这个思路比只看一项 Recall@K 更完整,但需要注意:UQABench 是 2025 年提出的研究基准,不是已经建立行业共识的生产验收标准。
协同知识与语义空间如何结合
SeLLa-Rec 研究了一个真实矛盾:协同模型能区分稀疏 ID,LLM 却更熟悉自然语言语义;两者的表示空间并不天然对齐。论文将协同知识投影为特殊 token,再通过语义对齐融合到 LLM Prompt 中,并在 MovieLens-1M 与 Amazon Book 两个公开数据集上报告提升。
这个结果说明“对齐后融合”值得研究,但证据边界也很明确:
- 论文是 2025 年预印本。
- 结果来自两个公开离线数据集。
- 它没有证明在十亿级目录、严格延迟和持续分布漂移下仍然占优。
因此,SeLLa-Rec 更适合作为融合方案的候选原型,而不是直接替代生产排序器的理由。
三、Semantic ID 的价值与边界
传统 ID embedding 有两个常见问题:参数表随物品增长,高频物品与长尾物品训练不均;若用随机哈希控制参数量,又会发生无意义碰撞。
Semantic ID 的方向,是依据内容 embedding 对物品做层次聚类,让相近物品共享有语义的前缀。2025 年的 Semantic ID prefix n-gram 论文进一步把层次前缀组合为 token 参数,试图让碰撞发生在语义相近的物品之间。
这项工作的证据比一般公开基准更强:作者不仅报告离线实验,也描述了在 Meta 广告排序系统中的生产接入与线上收益。因此可以把它归为工业证据。但“有工业证据”仍不等于“对所有目录有效”:
- 内容 embedding 的质量决定聚类质量。
- 商品属性变化时,Semantic ID 的重算与版本迁移会影响稳定性。
- 共享前缀可能改善长尾,也可能抹平对业务至关重要的细粒度差异。
- 广告排序的分布、目标和约束不能直接外推到新闻、音乐或电商。
上线前应做三类检查:长尾分桶效果、ID 版本切换期间的表示漂移、线上延迟与内存变化。若团队连普通 ID 模型的特征新鲜度都无法监控,先引入 Semantic ID 只会让故障更难定位。
四、RAG 与对话推荐:让生成服从候选集
对话推荐最有吸引力的地方,不是让模型凭记忆报出十个商品名,而是让用户能表达传统筛选器装不下的需求。可靠流程应该是:
自然语言需求
↓
提取硬约束与软偏好
↓
检索实时目录、库存、价格和规则
↓
专用模型排序与重排
↓
LLM 基于候选证据组织答案和追问
RAG 在这里主要解决事实接地问题:推荐只能来自当前可用目录,价格和库存来自实时数据,解释引用实际属性。它不能自动解决个性化排序,也不能保证检索结果完整。
需要把三类输出分开:
- 事实:价格、库存、上映时间等,必须来自检索结果。
- 推断:为什么候选可能符合偏好,需要标明依据。
- 偏好追问:当约束不足时,继续向用户确认,而不是编造确定性。
推荐解释也应当“忠实”,而不只是“顺口”。若排序模型因为促销权重把某商品排在前面,LLM 却说“因为最符合你的长期偏好”,这种解释就是虚构。解释生成必须读取真正参与决策的特征或规则,并过滤敏感画像。
五、强化学习:先分清优化信号来自哪里
推荐中的 RL 不等于 RLHF
推荐系统使用强化学习,通常是为了优化一段时间内的累积价值,例如留存、多样性或用户长期满意度。它面对延迟奖励、离线策略评估、曝光偏差和在线探索风险。
RLHF 则特指用人类偏好反馈训练奖励模型或直接优化策略的一类方法。它在 LLM 后训练中广为人知,但不能据此得出“推荐系统已普遍实施 RLHF”。多数生产推荐系统仍主要依靠隐式反馈、监督学习、规则、Bandit 和 A/B 测试;高质量成对偏好昂贵,奖励模型还可能学到标注偏差。
Rec-R1 不是标准 RLHF
Rec-R1 使用固定的黑盒推荐模型给 LLM 生成结果反馈,再进行强化学习优化。奖励来自推荐模型或任务指标,而不是人类偏好标注,因此更准确的称呼是来自推荐模型反馈的强化学习,而不是标准 RLHF。
论文在产品搜索和序列推荐任务上报告了相对于 Prompt、SFT 与若干判别基线的提升,也讨论了保持通用能力的效果。但它目前属于 2025 年预印本的离线实验。把固定推荐器当奖励源还会继承该推荐器的偏差:如果老师只奖励 NDCG,学生不会自动学会公平、多样或长期满意。
MA-RLHF 与推荐系统没有直接工业证据
MA-RLHF 把多个 token 或更高层语言单元视为“宏动作”,缓解长文本上的信用分配问题。论文在摘要、对话、问答和代码生成等任务上验证训练效率;它没有报告推荐系统实验,更没有推荐场景的线上部署证据。
这项工作可以启发对话推荐的后训练,却不能当作“推荐系统 RLHF 已成熟”的证据。研究之间可以迁移思想,但不能迁移结论。
从 Bandit 开始通常更务实
如果目标只是为 Banner、频道或重排槽位平衡探索与利用,上下文 Bandit 往往比完整 RL 更容易:
- 奖励和动作边界较清楚。
- 可以控制探索流量和风险。
- 反事实评估与回滚相对简单。
只有当动作显著改变后续用户状态、长期奖励确实重要,并且团队具备可靠模拟、离线策略评估和安全探索能力时,才值得引入更完整的 RL。复杂模型无法修复模糊的奖励函数。
六、评估:离线分数只是上线前的证词
指标必须覆盖整个漏斗
单一 NDCG 或 CTR 不足以描述一个推荐系统。建议按层建立指标:
| 层级 | 核心指标 | 常见误区 |
|---|---|---|
| 召回 | Recall@K、覆盖率、长尾召回、延迟 | 只看平均值,忽略分群和新物品 |
| 排序 | NDCG、MRR、AUC、校准度 | 离线提升被曝光偏差污染 |
| 重排 | 多样性、新颖性、重复率、约束满足率 | 用多样性换来的业务损失不可见 |
| 生成 | 事实正确率、候选忠实度、拒答率、成本 | 只用 LLM-as-a-Judge 自评 |
| 在线 | CTR、转化、留存、负反馈、投诉 | 只优化短期点击 |
| 系统 | P50/P95/P99、超时率、降级率、单请求成本 | 平均延迟掩盖尾延迟 |
离线数据还必须按时间切分,避免未来信息泄露;对展示日志要考虑位置偏差与选择偏差。新模型应与简单强基线比较,而不只是与作者容易击败的模型比较。
A/B 测试仍是最终验证
离线指标回答“在历史日志的假设下可能更好”,A/B 测试才回答“改变系统后用户会怎样”。推荐系统会影响它下一轮看到的数据,这种反馈回路使纯离线结论尤其脆弱。
一个完整实验至少包含:
- 明确主指标、护栏指标和最小可检测效应。
- 按用户稳定分桶,防止跨组污染。
- 预先确定实验周期,覆盖工作日与周末。
- 同时观察短期互动、长期留存和负反馈。
- 为超时、成本、投诉和库存异常设置自动止损。
不要因为 A/B 测试被称为“黄金标准”就忽略实验设计。错误分桶、反复窥视显著性或同时改变多项策略,都能让线上结果失真。
七、从零到生产的决策路线
阶段 0:先问是否真的需要推荐
目录很小、用户意图明确时,搜索、筛选和热门榜单可能已经足够。推荐模型的收益必须覆盖数据管道、实验平台与长期维护成本。
阶段 1:建立可解释基线
- 统一曝光、点击、停留、购买与负反馈事件定义。
- 用热门度、ItemCF、矩阵分解或双塔建立基线。
- 建立时间切分的离线数据集与用户分群指标。
- 打通灰度、回滚、实验和监控。
阶段 2:建设多阶段漏斗
- 并行使用热门、协同、内容与规则召回。
- 在排序层融合用户、物品和上下文特征。
- 在重排层处理去重、多样性、库存与合规。
- 为每一路召回记录来源,才能解释覆盖率与故障。
阶段 3:只在语义缺口处引入 LLM
优先选择离线或异步任务:
- 为新物品生成结构化属性与 embedding。
- 解析自然语言查询中的硬约束和软偏好。
- 把长历史压缩为有时间戳、可撤销的画像候选。
- 用大模型蒸馏训练轻量分类器或 reranker。
只有这些方案带来可复现增益后,再考虑在线 LLM 重排或对话生成。
阶段 4:为生成链路设计降级
在线调用 LLM 时,要提前回答:
- 超时后返回什么:专用排序结果、缓存还是空页面?
- 模型不可用时,硬约束是否仍能执行?
- 解释缺少证据时,是省略还是编造?
- Prompt、检索文档和用户画像是否含敏感数据?
- 单次请求的 token、GPU 和尾延迟预算是多少?
好的降级不是“系统坏了时凑合用”,而是承认概率模型必然会失败,并提前定义失败的形状。
阶段 5:谨慎引入探索和长期优化
先用小流量 Bandit 验证探索价值,再考虑离线 RL 或带人类偏好的训练。奖励中必须包含负反馈、重复曝光和生态约束,不能只奖励点击。任何强化学习方案都需要保守策略、离线评估、流量上限和一键回滚。
八、上线检查清单
数据
- 曝光是训练样本的一等公民,而不只记录点击。
- 用户删除、同意撤回和数据保留策略能真正执行。
- 训练/验证按时间切分,特征不存在未来泄露。
- 新用户、新物品、低活跃和高活跃用户分别评估。
模型
- 有热门度或协同过滤基线。
- 内容语义与协同信号做过消融实验。
- DIN、SASRec、BERT4Rec 等模型按真实架构比较。
- 预印本结果没有被写成工业事实。
系统
- 召回、排序、重排分别有延迟和错误预算。
- LLM 超时或限流时存在确定性降级路径。
- embedding 模型与 Semantic ID 有版本和回滚机制。
- 成本按用户、场景、模型和实验组可观测。
评估
- 同时监控准确性、多样性、长尾、负反馈和公平性。
- 生成解释能追溯到候选事实与实际决策信号。
- A/B 测试预设主指标、护栏、周期与停止条件。
- 线上收益覆盖新增延迟、推理成本与运维复杂度。
九、如何阅读 2025 年以来的新工作
截至 2026 年 7 月,本文涉及的新研究可以这样归类:
| 工作 | 它真正证明了什么 | 证据等级 | 不能推出什么 |
|---|---|---|---|
| SeLLa-Rec | 语义对齐可帮助融合协同知识与 LLM | 预印本;两个公开数据集 | 已适合大规模生产 |
| Semantic ID prefix n-gram | 有语义的层次 ID 可改善稳定性与长尾,并报告 Meta 线上结果 | 预印本 + 工业部署证据 | 对所有推荐场景都更优 |
| Rec-R1 | 可用固定推荐模型反馈训练生成 LLM | 预印本;离线任务实验 | 它是标准 RLHF;已验证长期用户价值 |
| UQABench | 可从多维任务评估用户 embedding 对个性化 LLM 的作用 | 新研究基准 | 已成为行业统一验收标准 |
| MA-RLHF | 宏动作可改善通用语言任务中的信用分配与训练效率 | 预印本;非推荐任务 | 已在推荐系统中验证或部署 |
判断论文价值时,我更看重四件事:数据是否贴近自己的分布,基线是否足够强,收益是否包含成本,以及是否有线上或长期证据。新名词本身不产生复利,可复现的工程能力才会。
结语:推荐不是替用户决定
推荐系统的目标,不应是让用户永远停留,而是降低他们找到合适事物的成本。点击率很容易测量,于是它常被误认为价值本身;语言模型很会解释,于是流畅又常被误认为理解。
真正可靠的系统会保留这种克制:协同数据告诉我们人群做过什么,语义模型帮助理解内容与意图,规则保护现实边界,实验检验我们的判断。每一种技术都只拥有一部分真相。
当模型越来越会说话,工程师更需要记得,推荐的责任不是替用户决定,而是让选择变得更清楚。
参考资料
以下仅保留论文原页、会议论文或机构官方技术页面;2025 年新工作按预印本理解。
- Covington, Adams, Sargin, Deep Neural Networks for YouTube Recommendations , ACM RecSys 2016.
- Cheng et al., Wide & Deep Learning for Recommender Systems , 2016.
- Zhou et al., Deep Interest Network for Click-Through Rate Prediction , 2017.
- Kang and McAuley, Self-Attentive Sequential Recommendation , 2018.
- Sun et al., BERT4Rec: Sequential Recommendation with Bidirectional Encoder Representations from Transformer , 2019.
- Wang et al., Enhancing LLM-based Recommendation through Semantic-Aligned Collaborative Knowledge , SeLLa-Rec, 2025 preprint.
- Zheng et al., Enhancing Embedding Representation Stability in Recommendation Systems with Semantic ID , 2025 preprint.
- Liu et al., UQABench: Evaluating User Embedding for Prompting LLMs in Personalized Question Answering , 2025 preprint.
- Lin, Wang, Qian, Rec-R1: Bridging Generative Large Language Models and User-Centric Recommendation Systems via Reinforcement Learning , 2025 preprint.
- Chai et al., MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions , 2024 preprint.
- Sanner et al., Large Language Models are Competitive Near Cold-start Recommenders for Language- and Item-based Preferences , ACM RecSys 2023.
- Qin et al., Attribute-based Propensity for Unbiased Learning in Recommender Systems , KDD 2020.





读者回响