为什么LayerNorm+AdamW成了深度网络的标准配置?从尺度不变性到梯度动力学

深度网络依赖LayerNorm(RMSNorm),这创造了局部的尺度不变性(Scale Invariance),它带了独特的梯度动力学(Gradient Dynamics)。在这个独特的动力学场域中,我们关于机器学习的直觉被颠覆了,Norm的物理含义从特征强度表示变成了学习进度的旋钮,Norm理论上稳步增加,SGD自带学习率衰减,但是刹车踩的太狠导致了学习的早停,而Weight Decay从正则化项进化为有效学习率的动态调节阀。AdamW如何成为标配:Adam做到了梯度的步长恒定,有效学习率的平缓刹车;Warmup来处理训练早期的权重过小(梯度爆炸)和二阶矩估计不准的问题;AdamW修正了L2正则的问题,引入Weight Decay,把“方向更新”和“进度控制”拆成两个干净的旋钮。

从RL比SFT更不容易遗忘到反观推荐系统缺陷

最近陆续有了一些研究LLM中RL相比SFT更不容易造成灾难性遗忘的工作,清晰地支出是RL的On-Policy特性带来了参数的稳定,而SFT将模型参数推向与预训练分布差异很大的方向,导致了遗忘问题(如图,遗忘问题的衡量就是随着新任务的学习,旧任务的平均表现下降)。 这一清晰地结论,点亮了我对很多事情的理解,推荐系统原来孤立的问题也有可能连成一片,有了更深层次的支撑。 本文包括: • LLM领域,RL比SFT更不容易造成灾难性遗忘的工作解读 • 推荐系统是标准的off-policy 监督学习,(猜想)许多缺陷也应当由此而生

推荐周报 2026-W36

本周推荐系统研究围绕三条主线展开:生成式推荐从单点召回组件走向覆盖排序与推理的工业级框架;CTR 建模范式重新组织上下文单元以对齐真实决策过程;召回侧则在多兴趣与多模态的叠加下重新收敛效率与成本。 主线 1:生成式推荐从“解码物品”走向“统一生成与推理”。 腾讯的 TGR 将生成式范式推进到排序、端到端生成和推理注入三个方向,其中 CCFormer 在五个 A/B 场景取得显著提升;百度 ICGR 把查询意图一致性贯穿 SID 构建、SFT 与偏好优化全链路,线下 Recall@20 提升 21.7%。共同指向是——生成式推荐不再止步于“用模型替代索引”,而是开始重构排序与召回之间的边界。 主线 2:统一 CTR 模型开始以“上下文”为基本单元。 美团 UniCon 把请求上下文当作同质单元,统一历史与目标的结构,线上 RPM 提升 3.09%;字节 ReST 则在行为序列上验证了 LLM 式 Transformer 在基准上饱和后仍可沿推荐原生设计继续扩展。两篇的共同指向是——推荐特有的信号噪声与计算不对称需要架构级的重新设计,而非简单搬用 NLP 缩放法则。 主线 3:召回侧的成本意识回归。 Snap 的 SetMIR 把多兴趣召回建模为集合预测,用 presence score 动态削减 33% 的 ANN 查询;同一团队的 CAMIE 用单个多模态编码器替换碎片化的 I2I 检索栈;Mubadala 的 PULSAR 用两阶段池化索引把中位向量检索延迟降低 15.1 倍。三者的共同逻辑是——召回的性能度量不再只有准确率,查询预算和索引体积正在成为一等的优化目标。

推荐周报 2026-W35

本周推荐系统研究围绕三条技术主线展开:语义 ID(Semantic ID)的工程化打磨进入深水区、检索系统从"静态管道"转向"查询自适应"、以及 LLM/Agent 在推荐链路中的角色从"增强组件"演化为"闭环决策者"。 主线 1:语义 ID 从"能生成"走向"能用、好维护、不漂移": 快手的两篇工作分别从码本结构和动态更新入手——单级大码本替代多级残差量化,把三级 SID 压成两级,自回归解码 FLOPs 降了 47.93%-48.70%,在线消费指标 +0.792%;TAGR 则针对直播广告场景设计了动态语义 ID(LSID),进房率 +8.5%、收入 +16.1%。腾讯的 Tlow 用 flow-based 变换替代 RQ-VAE 解决码本依赖问题,在微信多模态检索中 CTR 提升 10.32%。三篇工作共同指向一个判断——SID 的工程稳定性(而非生成准确率)已经成为落地瓶颈。 主线 2:检索效率从"一刀切"转向"查询与场景自适应": Alibaba 的 TransRetrieval 用加权平均聚合解决特征异质性导致的 token-norm 发散,在 40 亿交互数据集上验证了 log-linear scaling,线上收入 +2.53%。AdaWidth 则更进一步——为不同查询动态分配不同维度的嵌入宽度,在 6 个任务上以 55%-84% 更少的维度持平 SOTA 的 NDCG@10。VK 的多哈希用户嵌入将 ID 嵌入表缩减 98%,单节点时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k)。效率优化的粒度正在从"系统级"下探到"查询级"。 主线 3:LLM/Agent 从"推荐引擎"走向"系统自我进化的驱动者": Alibaba 的 Astar 把"提出演化方向"这个此前依赖资深专家的环节交给模型——Astar-8B 在真实执行评估中单次提案成功率 0.6786,是人类专家(0.3229)的两倍。PayPal 的 SCOUT 则把 MCP 工具暴露重构为上下文选择问题,工具 token 消耗从 140.2k 降到 1.3k(降 99%)。这两篇都指向同一个趋势:LLM 不再只是推荐模型的一部分,而是开始接管推荐系统自身的迭代过程。

推荐周报 2026-W34

本周(2026-08-16 ~ 2026-08-22)推荐系统研究围绕三条主线展开:工业级系统从"分场景模型"走向"统一架构"、生成式推荐从"能离线跑"转向"可上线服务"、Agent 化推荐进入工程化和评估规范化阶段。 主线1:统一架构加速整合多业务流。 小红书的 OneModel 用单个模型统一自然推荐、广告和商家三条流量线,线上广告侧 CTR 提升 8.18%;Meta 的 UniDot 从 FM 点积视角统一序列建模与特征交互。两篇工作的共同指向是——存储和算力红利消退后,多场景碎片化部署的工程成本成为主要矛盾。 主线2:生成式推荐加速落地。 快手的 OGR 实现了端到端生成有序 slate,线上 Effective Views 提升 1.120%,NDCG@5 在工业数据上提升 48.2%。EchoRec 将多 token 预测从效率工具拓展为密集监督信号。生成式推荐本周的关键词是"产出物"——不只是生成单个 item,而是生成有序列表。 主线3:Agent 化推荐系统的工程化。 阿里巴巴的 PILOT 将 LLM agent 用于实验管理和策略搜索,搜索效率从 53.3% 提升到 93.3%;微软的 AdsWorldEngine 在对话广告场景让 agent 与工具协同进化,线上 RPM 提升 22%。Agent 推荐正在从单点推理走向流程治理。

推荐周报 2026-W33

本周推荐系统研究以工业部署论文领跑。Netflix、Yandex、Meta、LinkedIn、快手、阿里、字节各自拿出了线上 A/B 结果,密集程度在本年度少见的。如果只看一个趋势——生成式推荐正在从实验室验证阶段转向"用单一模型替换整个生产级联"的系统工程阶段。 主线 1(生成式推荐的两个方向): Yandex Music 的 Sona 用单一生成式模型替换了超过 15 个候选生成器加预排序/排序的完整级联,Active Users +4.53%。Netflix 的 GenRec 走了另一条路——不替换级联,而是用 LLM 排序器作为精排层,A/B 中相对生产排序器取得统计显著提升。同一周内两条路线并行验证,是本周论文密度最高的信号。而快手的 PushDualGen 则在解决生成式推荐的可解释性:生成 SID 后附带一段可跳过的 copy 作为解释,有效播放率 +8.50%,不满率 -37.70%。 主线 2(因果推断从理念走向部署): LinkedIn 的决策中心因果优化框架在 Feed 营销流量上实现 +7.20% 长期价值提升,把因果效应估计、贝叶斯 bandit 和线性规划分配统一到一个目标下。Meta 的 MARCO 更微观——用点击类型作为自由行为标签分解点击意图,每点击转化 +2.80%。两篇的共同指向:因果推荐不再只是论文里的去偏技巧,而是生产系统里可落地的收益来源。 主线 3(多任务与全链路优化的系统工程化): 阿里的 IntHQ 在高德部署,处理生成式推荐里多任务学习的三个 collapse 问题,UVCTR +1.60%。阿里的 DREAM 则在淘宝首页用智能体元控制架构在现有流水线之上叠加策略层,IPV +2.06%。字节的 TM20K 把电商行为序列扩展到 2 万长度,ADSS +1.036% 而服务延迟只增 5.6%。

推荐周报 2026-W32

本周推荐系统研究围绕三条技术主线展开:生成式推荐从概念验证走向端到端工程落地、LLM 从排序辅助进入核心决策环节、预训练-持续刷新范式重新定义知识归属。工业界论文过半,Yandex、快手、字节、腾讯、Snap、Shopee、LinkedIn、京东、微软、华为均有部署论文,且大多附带线上 A/B 数据。 主线 1:生成式推荐走出「生成即召回」原型,向端到端单模型演进。 Yandex 的 Gryphon-v2 用单个模型替代 15 个候选生成器、粗排与精排的完整级联,活跃用户 +1.41%;Snap 把 LLM 生成式召回推进到短视频场景,View Time +0.37%。两者共同指向——生成式架构的工程瓶颈(排序目标传递、推理成本、资格约束)正在被逐个拆解。 主线 2:LLM 从排序辅助进入高风险决策环节。 腾讯 SeqLLM 为支付风控注入行为序列建模,商户筛查精度从 92.0% 提到 97.5%;快手 HOBA 用 LLM 推理超参数、SARSA 选专家、专家池执行,三层结构让竞价决策在线自适应,目标成本 +3.6%。百度 QDET 用 7B 模型在时间线摘要任务上追平 DeepSeek-R1-671B,CTR +5.5%。 主线 3:预训练-持续刷新的范式开始重划「知识」与「几何」的归属。 Shopee 的 KGD 用行为多 token 预测清洗预训练知识、锚定校准残差解耦任务几何,GMV/用户 +1.75%,90 天生产流验证无衰减。这条线指向一个判断:预训练推荐模型的下一个战场不是更大的模型,而是如何在持续分布漂移中守住已学知识、同时让下游适配不被梯度干扰。

推荐周报 2026-W31

本周推荐系统研究呈现三条交织的技术主线:生成式推荐的工业部署密度达到新高,多家公司密集披露线上收益;LLM 推荐从显式推理转向潜在推理,推理成本成为规模化部署的首要约束;工业基础设施论文集中解决训练-服务不一致、推理计算复用和冷启动问题。三条线共同的指向是——推荐系统正从"模型能力竞赛"转向"系统工程竞赛"。 主线 1:生成式推荐进入多目标、可控的工业化阶段。 快手的 Multi-Decoder OneRec 用多解码器结构解耦共享表示与目标特化,线上 app 使用时长 +0.37%、冷启动 +2.09%;京东的 OxygenREC-v2 以 3B 参数 MoE 将判别信号内化进生成式骨干,GMV 提升 2.8%-6.8%。生成式推荐的竞争焦点从"能不能召回"转向"能不能控方向、调目标"。 主线 2:LLM 推荐的推理方式从显式 CoT 转向潜在推理。 快手的 WhisperRec 将教师 CoT 压缩为潜在 token,SID@64 提升 17.44%,在线推理吞吐量提升超 10 倍;LaRec 用个性化高斯混合分布采样推理起点,探索多路径潜在推理。显式推理的质量天花板仍在,但推理成本决定了谁能在线上活下来。 主线 3:工业推荐系统的工程深化。 Meta 的 ROCS 将请求侧计算共享从特征交互扩展到序列模型,检索模型 QPS 提升 3 倍;Memory Layer 用与模型共训的键值缓存统一训练-服务表示,NE gap 缩小 86%。训练和服务的结构性对齐,正在成为比模型结构更重要的优化杠杆。

推荐周报 2026-W30

本周推荐系统研究围绕三条技术主线展开。生成式推荐从侧重“能生成”转向“生成得好且经济”——BARGE 解决了语义 ID 的单序列扁平化问题,TSGR 将商业价值嵌入检索过程,DLMRec 用扩散替代自回归。排序模型侧向于统一架构与不确定性建模:WHALE 融合 Wukong 和 HSTU 两种高性能主干,UAME 将预测不确定性用作标签偏差的校正项。LLM 应用从纯推理转向状态化与闭环优化:RecGPT-V3 引入持续用户记忆,RECAP 用 GRPO 优化用户画像。 生成式推荐从“能跑”走向“跑得稳”: 腾讯的 BARGE 识别出生成式推荐的两个结构性缺陷——多 token ID 序列化破坏物品级结构、分层码本训练推溯不一致导致语义漂移。BARGE 通过 Item Context-Aware Attention(ICA)恢复物品级上下文,配合 Hierarchical Path Reranking 和 Dual-Path Decoding 将线上 CTR 提升 0.60%。与此同时,阿里巴巴的 TSGR 从另一个角度切入:让语义 ID 编码过程本身就对商业价值敏感,线上 GMV 增长 1.64%。两篇的共同指向是——生成式推荐的核心瓶颈不在生成能力,而在 ID 设计与解码结构。 排序模型走向架构统一与可解释的不确定性: Meta 的 WHALE 将 Wukong(高阶非序列特征交互)和 HSTU(长用户行为序列)在每一层通过注意力融合模块连接,让高阶特征交叉能反复从长历史中检索细粒度证据。不替换现有主干,而是让它们协同工作。快手的 UAME 改变了一个基础假设:用户满意度标签本身就是有偏的行为代理,模型不应该忽略这种不确定性。UAME 将预测建模为高斯分布,用不确定性程度加权样本损失,在短视频推荐上用户满意度提升 0.32%。 LLM 应用从辅助工具到推荐核心引擎: 淘宝的 RecGPT-V3 是一个里程碑式的系统级更新——Memory Hub 将用户建模计算削减 55.8%,Latent Intent Reasoning 将输出 token 成本降低 200 倍,同时 GMV 增长 3.97%。它证明多模态推理可以在线上以可接受的资源代价运行。快手的 RECAP 用 GRPO 优化 LLM 生成的用户画像,线上用户使用时长提升 0.139%。结合之前的研究,LLM 在推荐中的应用正在从“能不能用”转向“怎么用得既好又省”。

推荐周报 2026-W29

本周推荐系统研究集中在四条技术主线:生成式推荐进入工业深水区、排序模型向长序列和细粒度语义演进、召回系统在异构索引和因果优化上取得突破、LLM增强推荐从实验走向工程落地。34 篇论文中有 23 篇来自工业界(含 18 篇已部署),13 篇报告了线上 A/B 结果。 主线 1 "生成式推荐从 DocID 设计到微调对齐": 阿里巴巴的 CRID 将业务价值排序直接编入 DocID,在 300M 商品库上全流量 GMV +1.06%。GFlowGR 用 GFlowNet 微调生成式推荐,在淘宝搜索广告实现年收入 +0.4%。美团 NONTP 通过时序对比学习和跨域学习扩展 NTP 训练信号,线上 CTR +1.8%、GMV +2.1%。三篇的共同指向是——生成式推荐正从 "能生成" 转向 "会优化"。 主线 2 "排序模型追求深度解耦与长时建模": Meta 的 SlimPer 将个性化排序建模为 <user, item> 知识库迭代精炼,支持 10k+ 历史事件且 O(N) 复杂度,部署于 Instagram。Yandex 的 Long-History User Transformers 通过离线编码 + 缓存 + 轻量在线模型解耦长历史推理,搜索广告 +2.77%。阿里 SAM 用饱腹感门控显式建模兴趣生命周期,将购买后重复率降低 60%。 主线 3 "召回系统的工程与因果范式": Pinterest 的因果检索框架减少 85% 购物触发器而不损关键会话。MESH 通过模块化架构和门控偏置校正,使新鲜物品缩放指数提升 14 倍,用户留存 +0.46%。Microsoft 的 FlashTrie 将生成式检索的约束解码全量迁移至 GPU,800M 关键词库 <3ms,线上收入 +0.71%。 主线 4 "LLM 推荐的轻量化和 Agent 化": Vrbo 用训练免费的 LLM 合成查询解决长尾覆盖问题,缩小 3B 模型与 API 模型的召回差距至 <1%。QuintoAndar 的 LLM 重排序融合对话上下文在房产搜索中 CTR +5.3%。Kuaishou 的 RashomonLLM 将解释生成与预测耦合,在直播 CTR 上 AUC +2.3% 且解释质量提升 8.7%。

推荐周报 2026-W28

本周推荐系统研究围绕三条技术主线展开:生成式检索的工业落地与理论深化、LLM/Agent从概念验证走向真实部署、以及精排/联邦学习在工业环境中的鲁棒性优化。 生成式检索加速落地与多兴趣精细化: 快手在推送通知系统中部署了异构生成式架构 HGenPush,采用非自回归多token预测替代传统自回归解码,实现DAU提升0.181%。Walmart将库存感知RAG引入赞助搜索,InvAwr-RAG将广告填充率提升68%。理论层面,BACH通过贝叶斯混合头解决多兴趣双塔的路由坍塌问题,在三个基准上刷新召回率;DaV-Gen提出draft-and-verify机制统一生成式检索的效率与精度。此外,Signed MaxSim首次从理论上证明MaxSim的表达力不低于向量内积,并扩展至任意实值内积。 LLM/Agent推荐从原型走向生产: Meta的 SCOReD 是本周最突出的部署工作——通过学生感知的CoT优化将教师推理轨迹适配到小模型,线上获得NDCG+1.56%和Recall@5+1.9%,同时推理长度减少27.3%。Walmart使用LLAMA2 7B+LoRA做广告相关性三分类,准确率89.43%超越GPT-4。学术方面,MMEACR提出双轨记忆架构加强Agent的视觉推理能力;LBR系统性地揭示了LLM推荐中的长度偏差,并提出轻量校正方案(NDCG@5提升16.82%);综述论文Autonomous Information Seeking为Agent推荐建立了三范式分类法。 工业级精排与联邦学习优化: 快手的 PIT-SUN 是一种可直接部署的经验边际变换框架,通过对重尾目标进行概率积分变换与期望一致性恢复,在线上全面改善点精度和校准。FeLiX则针对联邦学习中客户端流失问题,提出流式感知可用性层级和延迟鲁棒聚合,将收敛时间缩短2.37倍。

推荐周报 2026-W27

本周24篇论文中,4篇来自工业在线部署(Meta、Netflix、阿里巴巴、快手),覆盖召回、排序、重排、全链路生成阶段。核心技术密度的分布逻辑在变——生成式推荐从"能生成"走向"能推理",召回从嵌入匹配转向导航式探索,排序阶段则在约束和解释之间寻找平衡。 生成式推荐进入"推理+强化学习"时代: GR2、ShopX和GenPage在同一周展示了三种不同的生成式架构走向。GR2在重排阶段首次引入推理链(CoT)和RL后训练,在工业流量上R@1提升18.7%。ShopX将生成式推荐从候选生成推向"意图到物品"的端到端执行,在淘宝Agent场景下复杂请求满足率提升55-75%。GenPage走得最远——用单Transformer替代Netflix整套多阶段主页流水线,核心指标+0.24%的同时延迟降低20%。三篇的共同指向是:生成式推荐的核心壁垒已从"能否生成"转向"能否在推理质量与部署效率之间找到工业可行解"。 召回从静态匹配走向动态图探索: Meta的硬负采样通过LLM聚类生成实时同簇负样本,在线召回率+8.5%、流行度偏差-12.3%。快手的IID-Nav将召回建模为自主图探索,支持间接无限深度遍历。Kuaishou的POEM利用多任务排序分数构建偏序序列,实现请求级别的实时兴趣更新。三条技术路径共享一个趋势:召回正从静态嵌入查询转向动态、上下文感知的行为建模。 约束优化与可解释性重回视野: Avito的PermR在5600万搜索查询上证明了相邻交换法能在生产延迟内逼近整数规划收益。KakaoBank的ChunkGroupSHAP用分组Shapley值弥合了词级解释与密集排序器之间的粒度鸿沟。这两个工作提醒行业:在大模型热潮中,渐进式工程优化和可解释性工具仍能产出具象收益。