推荐算法日报 - 2026-08-01

[生成式推荐进入"反馈闭环"时代]:今日多篇论文(Kuaishou 的 Feedback-Grounded Policy、Alibaba 的 LoopMemGR、MBZUAI/JD 的 Personalized NL)共同指向一个趋势:生成式推荐不再满足于"用 LLM 理解用户",而是开始将推荐决策本身作为可学习的对象,通过引入反馈信号、经验记忆、协同信号来弥合"理解"与"行动"之间的鸿沟,并借助知识蒸馏实现 LLM-free 的工业级在线推理。; [推理效率成为工业级落地的核心战场]:Meta

推荐算法日报 - 2026-07-31

生成式推荐进入"多目标可控"时代:今日多篇工业界论文(快手 Multi-Decoder OneRec、阿里 Gwhere、快手 PSG)不约而同地聚焦于生成式检索/重排的工程化落地。核心不再是"能不能生成",而是"如何在同一框架下解耦多目标(时长、互动、冷启动)、显式控制配额、并保证候选互补性"。LoRA 专家隔离 + 协调解码 + 约束束搜索成为标配方案。; 位置编码与推理效率成为生成式推荐的新瓶颈:Google 的 ClockRoPE 从理论层面证明任意注意力调制函数可由其傅里叶变换诱导的随

推荐算法日报 - 2026-07-30

生成式推荐进入价值对齐与工程优化深水区:今日多篇论文聚焦生成式推荐,但已从“如何生成”转向“如何生成得更好”。RGD 提出奖励引导解码,在不重训模型的前提下对齐业务价值;SPARC 和 TopoGR 则分别从属性压缩和拓扑结构保留角度优化语义 ID 的表示质量。这表明生成式推荐正从概念验证走向工业级精细化调优。; LLM 赋能推荐系统走向“轻量化”与“解耦化”:Meta 的 LLM 双塔论文证明,将 LLM 作为语义表示骨干而非生成引擎,可兼顾效率与效果;Spotify 的假设驱动货架生成系统将

推荐算法日报 - 2026-07-29

生成式推荐走向全链路统一与工业级落地:今日多篇论文(OxygenREC-v2、UniR²、LaRec)聚焦于用生成式范式统一召回与排序,甚至将多目标优化内化到单一Decoder-only模型中。京东和快手分别展示了3B MoE和统一序列架构的线上收益,标志着生成式推荐从概念验证进入大规模工业部署阶段。; LLM/Agent推荐从“大脑”转向“纠错系统”:Melo和SMART等工业论文揭示了一个关键洞察:LLM推荐在工业规模下的瓶颈不再是模型推理能力,而是如何检测和修复实体幻觉、长尾退化等运行时错

推荐算法日报 - 2026-07-28

全链路冷启动与去偏成为工业界标配:Pinterest 的 PinEqualizer 展示了从召回、粗排、精排到重排的全漏斗冷启动与去偏方案,已部署两年并显著提升探索与用户参与。这表明工业界正从单点优化转向端到端系统级设计,以系统性解决新内容曝光不足和模型偏置问题。; 跨域与图粗化技术应对数据稀疏与规模挑战:面对数据稀疏和探索不足,Cross-Domain OPE/L 通过引入源域数据增强目标域策略评估与学习。同时,针对大规模图推荐的可扩展性瓶颈,图粗化+标签传播方案在电信场景下实现了 NDCG@

推荐周报 2026-W30

本周推荐系统研究围绕三条技术主线展开。生成式推荐从侧重“能生成”转向“生成得好且经济”——BARGE 解决了语义 ID 的单序列扁平化问题,TSGR 将商业价值嵌入检索过程,DLMRec 用扩散替代自回归。排序模型侧向于统一架构与不确定性建模:WHALE 融合 Wukong 和 HSTU 两种高性能主干,UAME 将预测不确定性用作标签偏差的校正项。LLM 应用从纯推理转向状态化与闭环优化:RecGPT-V3 引入持续用户记忆,RECAP 用 GRPO 优化用户画像。 生成式推荐从“能跑”走向“跑得稳”: 腾讯的 BARGE 识别出生成式推荐的两个结构性缺陷——多 token ID 序列化破坏物品级结构、分层码本训练推溯不一致导致语义漂移。BARGE 通过 Item Context-Aware Attention(ICA)恢复物品级上下文,配合 Hierarchical Path Reranking 和 Dual-Path Decoding 将线上 CTR 提升 0.60%。与此同时,阿里巴巴的 TSGR 从另一个角度切入:让语义 ID 编码过程本身就对商业价值敏感,线上 GMV 增长 1.64%。两篇的共同指向是——生成式推荐的核心瓶颈不在生成能力,而在 ID 设计与解码结构。 排序模型走向架构统一与可解释的不确定性: Meta 的 WHALE 将 Wukong(高阶非序列特征交互)和 HSTU(长用户行为序列)在每一层通过注意力融合模块连接,让高阶特征交叉能反复从长历史中检索细粒度证据。不替换现有主干,而是让它们协同工作。快手的 UAME 改变了一个基础假设:用户满意度标签本身就是有偏的行为代理,模型不应该忽略这种不确定性。UAME 将预测建模为高斯分布,用不确定性程度加权样本损失,在短视频推荐上用户满意度提升 0.32%。 LLM 应用从辅助工具到推荐核心引擎: 淘宝的 RecGPT-V3 是一个里程碑式的系统级更新——Memory Hub 将用户建模计算削减 55.8%,Latent Intent Reasoning 将输出 token 成本降低 200 倍,同时 GMV 增长 3.97%。它证明多模态推理可以在线上以可接受的资源代价运行。快手的 RECAP 用 GRPO 优化 LLM 生成的用户画像,线上用户使用时长提升 0.139%。结合之前的研究,LLM 在推荐中的应用正在从“能不能用”转向“怎么用得既好又省”。

推荐算法日报 - 2026-07-24

[LLM推理降本成为工业界核心痛点]:今日多篇论文聚焦于降低LLM在推荐/问答系统中的推理成本。Amazon提出带护栏的聚类方法,通过对用户/输入进行聚类,仅对代表点调用LLM,实现50倍降本;AFIR则通过检索工程优化(而非增大生成器)在极低资源下构建全本地RAG系统。这表明,在工业大规模部署中,如何让LLM“少干活、干对活”是当前最迫切的需求。; [检索优化比生成器升级更具性价比]:无论是Amazon的聚类+代表点策略,还是AFIR的混合检索+意图路由+嵌入微调,都证明了在资源受限或大规模场

推荐算法日报 - 2026-07-23

生成式检索的商业价值对齐:以淘宝的 TSGR 为代表,工业界生成式检索正从纯语义匹配转向价值感知。通过将商业指标(如 GMV)编码进语义 ID 构建和排序模块,统一检索与粗排,实现端到端的业务目标优化。这标志着生成式检索在电商场景的实用化迈出关键一步。; 排序与检索中的轻量化反馈机制:无论是 PLAID-PRF 利用质心向量实现低开销的伪相关反馈,还是 Exposure-Based RL for LTR 通过曝光分布抽象实现自动微分的强化学习排序,都体现了用更轻量、更稳定的方法引入反馈信号来提升

推荐算法日报 - 2026-07-22

工业级精排架构的「大一统」趋势:今日多篇论文(Meta WHALE、快手 UAME)表明,工业界正从分离建模非序列特征和序列行为,转向在精排阶段进行深度融合。WHALE 将 Wukong 和 HSTU 统一,UAME 则将不确定性建模融入多目标集成排序,都旨在更精细地刻画用户真实偏好,且均已上线验证。; 生成式推荐进入「系统级」优化阶段:以 BONSAI 为代表的生成式推荐研究,不再仅关注如何生成更好的物品 ID,而是开始系统性地优化解码过程本身(如 Trie 树结构)。这表明该领域正从模型设计

推荐算法日报 - 2026-07-21

LLM推荐系统进入“状态化+混合模态”时代:今日两篇高分工业论文(RecGPT-V3、RECAP)均聚焦于解决LLM推荐系统在工业部署中的效率与效果瓶颈。核心思路从“用LLM做推理”转向“用LLM管理用户状态”,通过Memory Hub或结构化语义画像,将长周期行为压缩为紧凑表示,大幅降低计算开销。同时,混合模态(文本+Semantic ID)成为连接开放世界知识与具体物品的关键桥梁。; 强化学习(GRPO)成为优化LLM推荐的新范式:RECAP首次将GRPO(Group Relative Po

推荐周报 2026-W29

本周推荐系统研究集中在四条技术主线:生成式推荐进入工业深水区、排序模型向长序列和细粒度语义演进、召回系统在异构索引和因果优化上取得突破、LLM增强推荐从实验走向工程落地。34 篇论文中有 23 篇来自工业界(含 18 篇已部署),13 篇报告了线上 A/B 结果。 主线 1 "生成式推荐从 DocID 设计到微调对齐": 阿里巴巴的 CRID 将业务价值排序直接编入 DocID,在 300M 商品库上全流量 GMV +1.06%。GFlowGR 用 GFlowNet 微调生成式推荐,在淘宝搜索广告实现年收入 +0.4%。美团 NONTP 通过时序对比学习和跨域学习扩展 NTP 训练信号,线上 CTR +1.8%、GMV +2.1%。三篇的共同指向是——生成式推荐正从 "能生成" 转向 "会优化"。 主线 2 "排序模型追求深度解耦与长时建模": Meta 的 SlimPer 将个性化排序建模为 <user, item> 知识库迭代精炼,支持 10k+ 历史事件且 O(N) 复杂度,部署于 Instagram。Yandex 的 Long-History User Transformers 通过离线编码 + 缓存 + 轻量在线模型解耦长历史推理,搜索广告 +2.77%。阿里 SAM 用饱腹感门控显式建模兴趣生命周期,将购买后重复率降低 60%。 主线 3 "召回系统的工程与因果范式": Pinterest 的因果检索框架减少 85% 购物触发器而不损关键会话。MESH 通过模块化架构和门控偏置校正,使新鲜物品缩放指数提升 14 倍,用户留存 +0.46%。Microsoft 的 FlashTrie 将生成式检索的约束解码全量迁移至 GPU,800M 关键词库 <3ms,线上收入 +0.71%。 主线 4 "LLM 推荐的轻量化和 Agent 化": Vrbo 用训练免费的 LLM 合成查询解决长尾覆盖问题,缩小 3B 模型与 API 模型的召回差距至 <1%。QuintoAndar 的 LLM 重排序融合对话上下文在房产搜索中 CTR +5.3%。Kuaishou 的 RashomonLLM 将解释生成与预测耦合,在直播 CTR 上 AUC +2.3% 且解释质量提升 8.7%。

推荐算法日报 - 2026-07-18

因果推断与长期优化成为工业界标配:今日多篇工业界论文(Pinterest、Yandex)将因果推断、Uplift建模和长期用户留存作为核心优化目标,从传统的CTR/CVR短期信号转向更复杂的因果效应和长期价值建模,且均已在生产系统大规模部署验证。; 大模型(LLM/Transformer)在推荐链路中落地加速:LLM和Transformer不再仅用于特征工程,而是直接嵌入到重排序(QuintoAndar)和历史编码(Yandex)等核心环节。工业界正探索如何将大模型的语义理解能力与严格的延迟约束