推荐周报 2026-W34

本周(2026-08-16 ~ 2026-08-22)推荐系统研究围绕三条主线展开:工业级系统从"分场景模型"走向"统一架构"、生成式推荐从"能离线跑"转向"可上线服务"、Agent 化推荐进入工程化和评估规范化阶段。 主线1:统一架构加速整合多业务流。 小红书的 OneModel 用单个模型统一自然推荐、广告和商家三条流量线,线上广告侧 CTR 提升 8.18%;Meta 的 UniDot 从 FM 点积视角统一序列建模与特征交互。两篇工作的共同指向是——存储和算力红利消退后,多场景碎片化部署的工程成本成为主要矛盾。 主线2:生成式推荐加速落地。 快手的 OGR 实现了端到端生成有序 slate,线上 Effective Views 提升 1.120%,NDCG@5 在工业数据上提升 48.2%。EchoRec 将多 token 预测从效率工具拓展为密集监督信号。生成式推荐本周的关键词是"产出物"——不只是生成单个 item,而是生成有序列表。 主线3:Agent 化推荐系统的工程化。 阿里巴巴的 PILOT 将 LLM agent 用于实验管理和策略搜索,搜索效率从 53.3% 提升到 93.3%;微软的 AdsWorldEngine 在对话广告场景让 agent 与工具协同进化,线上 RPM 提升 22%。Agent 推荐正在从单点推理走向流程治理。

推荐算法日报 - 2026-08-22

[量化压缩成为检索系统降本增效的核心战场]:今日多篇论文聚焦 Embedding 量化压缩,但思路已从"均匀比特分配"转向"结构感知"。Microsoft 提出基于 Matryoshka 几何结构的可变比特分配(PQ 提升 8%、SQ 提升 18%),Virginia Tech 的 CrossQ 则通过任务对齐的跨 token 条件量化,在 4 B/token 下实现 64x 存储压缩且保留 98% 全精度 MRR@10。核心洞察:量化不应只最小化重建误差,而应服务于检索排序目标——"winne

推荐算法日报 - 2026-08-21

LLM 从"编码器"走向"推理体":今日多篇论文(PILOT、TTP、GateDiffInt、rEDMRec)不再将 LLM 当作静态文本编码器,而是让其扮演主动推理、意图解耦、实验设计等角色。LLM 正从特征提取工具升级为推荐系统的"大脑",通过推理蒸馏、Agent 协作等方式在控制成本的前提下注入深度语义理解。; 多模态与多场景走向"大一统":Netflix 用多模态嵌入统一五类画布资产模型,小红书 OneModel 统一自然推荐/广告/商家三大业务流排序。业界正从"每个场景/模态一个模型"

推荐算法日报 - 2026-08-20

[生成式推荐从"生成候选"走向"端到端生成结果":今日多篇论文(OGR、DEPT)不再将生成式模型局限于召回阶段,而是直接端到端生成最终推荐结果(有序 Slate)或统一"查询扩展+检索"。核心挑战从"如何生成"转向"如何让生成目标与最终排序/检索目标对齐"——OGR 用列表级偏好规划 + 奖励引导策略优化,DEPT 用文档嵌入保持微调解决"移动目标"问题。工业落地价值极高,尤其 OGR 已在快手线上验证。; [紧凑 LLM 成为落地主角,效率与效果之争进入新阶段:FLEXRec、CARA 等论

推荐算法日报 - 2026-08-19

[工业级系统落地成为主旋律]:今日多篇重磅论文来自 Google、Meta、Amazon、PayPal 等一线大厂,且均已在生产环境部署验证。Google Discover 的 SDF 系统将内容过时问题分解为 supersession 和 decay 两种机制并分别建模,两年部署用户投诉下降 54.9%;Meta 的 UniDot 统一特征交互与序列建模,斩获 KDD Cup 2026 工业赛道亚军。工业界正从"单点模型优化"转向"全链路系统级问题拆解",且更强调可部署性和推理成本控制。; [

推荐算法日报 - 2026-08-18

对话式推荐进入 Agent 化与可靠性双轨时代:今日多篇论文聚焦对话式推荐,但技术路线明显分化。Microsoft 的 AdsWorldEngine 走全 LLM Agent 路线,通过 Orchestrator 与 Tool 协同进化实现自改进;而 Stanford/MIT/Amazon 的 MACS 则走混合路线,将语言理解交给 LLM、把约束执行交给确定性模块。两条路线都强调"可靠性"——前者用 Opportunity Gate 控制广告侵入性,后者用确定性过滤保证硬约束不漂移。对工业界而

推荐周报 2026-W33

本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。 主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。 主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。 主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。

推荐算法日报 - 2026-08-15

测试时优化与推理效率成为新战场:从 TTT-Embed 在冻结模型嵌入空间中学习轻量向量、无需权重访问即可复用排序奖励,到 Prof-K 用单遍过滤实现 1.5-10 倍 top-k 加速,再到 Search-R1 用结构化停止判断减少检索调用——业界正从"训练更大的模型"转向"在推理/测试阶段用更少的算力榨取更多性能"。对工业推荐系统而言,这意味着可以在不重新训练大模型的前提下,通过轻量适配层或算法优化实现召回/排序的即时增益。; 鲁棒性与去偏从"单点"走向"全链路":DrEM 处理上游多任务

推荐算法日报 - 2026-08-14

[生成式推荐进入精细化RL阶段] 今日多篇论文聚焦生成式推荐/检索的强化学习优化,且不约而同指向同一痛点:序列级奖励过于粗糙。HCGRec 通过 hint-conditioned 机制解决语义 ID 生成中的零奖励稀疏问题,Token-Level Credit Assignment 则直接提出 token 级奖励分配。两者均采用 GRPO 作为优化器,标志着生成式推荐正从"能否生成"迈向"如何精细分配 credit"的新阶段。; [LLM/Agent 与协作信号深度融合] 两条路线并行:GALL

推荐算法日报 - 2026-08-13

LLM 从"特征工程"走向"上下文工程",并开始接受工业级检验:Netflix 的 GenRec 和 Meta 的 ConnectionMind 不约而同地展示了 LLM 在精排/全链路中的落地路径。GenRec 明确提出范式转变——用自然语言化的用户历史替代数千个手工特征,从特征工程转向上下文工程;ConnectionMind 则将社交图谱与 LLM 推理结合,通过 SFT+RL 两阶段训练实现可解释推荐。两者均有线上 A/B 验证,标志着 LLM 推荐已从学术探索进入工业验证期。; 单一生成

推荐算法日报 - 2026-08-12

生成式推荐进入"策略生成"新范式:今日多篇工业界论文(IntHQ、MetaStrategy、PushDualGen)不再直接生成物品序列,而是转向生成可执行策略(JSON策略包、语义ID+解释copy)或优化多任务交互。这一转变使生成式推荐能无缝集成现有预测模型、业务规则和护栏,大幅降低落地门槛,成为工业界探索的核心方向。; Agent/LLM 从"旁路"走向"元控制":DREAM 提出在现有级联流水线之上叠加智能体元控制层(M1-M2-M3 分层推理),MetaStrategy 用 LLM 策

推荐算法日报 - 2026-08-11

生成式推荐进入工业化深水区:今日多篇论文围绕生成式推荐(GenRec)展开,从字节跳动的 TM20K(超长序列 + 知识蒸馏)到快手的 HD-Rec(跨域统一框架),再到 NAVER WEBTOON 的三阶段后训练对齐,标志着生成式范式正从概念验证走向大规模线上部署,核心矛盾从"能不能用"转向"如何高效落地"。; 模型内部状态成为优化新抓手:Meta 的 MISO 与 Amazon 的 BC-ICL 不约而同地利用模型内部状态(参数、激活、梯度、bootstrap 重采样)来指导优化决策,替代传