type
Post
status
Published
date
Aug 29, 2026 05:33
slug
rec-weekly-2026-W35
summary
本周推荐系统研究围绕三条技术主线展开:语义 ID(Semantic ID)的工程化打磨进入深水区、检索系统从"静态管道"转向"查询自适应"、以及 LLM/Agent 在推荐链路中的角色从"增强组件"演化为"闭环决策者"。 主线 1:语义 ID 从"能生成"走向"能用、好维护、不漂移": 快手的两篇工作分别从码本结构和动态更新入手——单级大码本替代多级残差量化,把三级 SID 压成两级,自回归解码 FLOPs 降了 47.93%-48.70%,在线消费指标 +0.792%;TAGR 则针对直播广告场景设计了动态语义 ID(LSID),进房率 +8.5%、收入 +16.1%。腾讯的 Tlow 用 flow-based 变换替代 RQ-VAE 解决码本依赖问题,在微信多模态检索中 CTR 提升 10.32%。三篇工作共同指向一个判断——SID 的工程稳定性(而非生成准确率)已经成为落地瓶颈。 主线 2:检索效率从"一刀切"转向"查询与场景自适应": Alibaba 的 TransRetrieval 用加权平均聚合解决特征异质性导致的 token-norm 发散,在 40 亿交互数据集上验证了 log-linear scaling,线上收入 +2.53%。AdaWidth 则更进一步——为不同查询动态分配不同维度的嵌入宽度,在 6 个任务上以 55%-84% 更少的维度持平 SOTA 的 NDCG@10。VK 的多哈希用户嵌入将 ID 嵌入表缩减 98%,单节点时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k)。效率优化的粒度正在从"系统级"下探到"查询级"。 主线 3:LLM/Agent 从"推荐引擎"走向"系统自我进化的驱动者": Alibaba 的 Astar 把"提出演化方向"这个此前依赖资深专家的环节交给模型——Astar-8B 在真实执行评估中单次提案成功率 0.6786,是人类专家(0.3229)的两倍。PayPal 的 SCOUT 则把 MCP 工具暴露重构为上下文选择问题,工具 token 消耗从 140.2k 降到 1.3k(降 99%)。这两篇都指向同一个趋势:LLM 不再只是推荐模型的一部分,而是开始接管推荐系统自身的迭代过程。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周推荐系统研究围绕三条技术主线展开:语义 ID(Semantic ID)的工程化打磨进入深水区、检索系统从"静态管道"转向"查询自适应"、以及 LLM/Agent 在推荐链路中的角色从"增强组件"演化为"闭环决策者"。
主线 1:语义 ID 从"能生成"走向"能用、好维护、不漂移": 快手的两篇工作分别从码本结构和动态更新入手——单级大码本替代多级残差量化,把三级 SID 压成两级,自回归解码 FLOPs 降了 47.93%-48.70%,在线消费指标 +0.792%;TAGR 则针对直播广告场景设计了动态语义 ID(LSID),进房率 +8.5%、收入 +16.1%。腾讯的 Tlow 用 flow-based 变换替代 RQ-VAE 解决码本依赖问题,在微信多模态检索中 CTR 提升 10.32%。三篇工作共同指向一个判断——SID 的工程稳定性(而非生成准确率)已经成为落地瓶颈。
主线 2:检索效率从"一刀切"转向"查询与场景自适应": Alibaba 的 TransRetrieval 用加权平均聚合解决特征异质性导致的 token-norm 发散,在 40 亿交互数据集上验证了 log-linear scaling,线上收入 +2.53%。AdaWidth 则更进一步——为不同查询动态分配不同维度的嵌入宽度,在 6 个任务上以 55%-84% 更少的维度持平 SOTA 的 NDCG@10。VK 的多哈希用户嵌入将 ID 嵌入表缩减 98%,单节点时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k)。效率优化的粒度正在从"系统级"下探到"查询级"。
主线 3:LLM/Agent 从"推荐引擎"走向"系统自我进化的驱动者": Alibaba 的 Astar 把"提出演化方向"这个此前依赖资深专家的环节交给模型——Astar-8B 在真实执行评估中单次提案成功率 0.6786,是人类专家(0.3229)的两倍。PayPal 的 SCOUT 则把 MCP 工具暴露重构为上下文选择问题,工具 token 消耗从 140.2k 降到 1.3k(降 99%)。这两篇都指向同一个趋势:LLM 不再只是推荐模型的一部分,而是开始接管推荐系统自身的迭代过程。
生成式推荐与语义编码
本周语义 ID 相关的工作密度很高,且几乎全部有工业背景。核心争论从"如何生成更好的 SID"转向"SID 系统如何应对动态流量、如何控制解码成本、如何跨架构迁移"。
AMBER(Meta)** — 把视角从"物品"抬升到"事件"。每个交互不是一个 token,而是该时刻的完整时间快照(用户、物品、上下文、结果信号),AMBER 将这个快照压缩成单个 Event Token。这引入了新的扩展维度——快照分辨率(snapshot resolution),即每个事件编码的信息量。Event Token 预计算并缓存,快照分辨率与服务时计算解耦。在工业级 ranking 和 retrieval 基准上,AMBER 推进了计算-质量帕累托前沿。值得注意的结果是:在足够容量下,单一统一 tokenizer 甚至优于为每个实体类型单独设计的 tokenizer,说明不同实体类型之间存在正迁移。Event Token 还能作为历史特征注入非 LLM ranker 并带来统计显著提升——这暗示语义编码的收益不限于生成式架构。与 TIGER 的自回归语义 ID 生成、LlamaRec 的序列建模不同,AMBER 把"每个位置编码什么"这个问题的答案从"物品"改成了"事件"。
TAGR(快手)** — 针对直播广告场景的三层时间自适应框架。静态语义 ID 无法追踪快速变化的直播内容,TAGR 提出 Live Semantic-Collaborative ID(LSID):周期性根据当前直播场景和推广商品刷新每个活跃广告的 SID,同时保留稳定的分层 token 词表用于自回归生成。意图层面用多时间粒度的进房历史作为主意图序列,auxiliary 行为单独输入,并用请求后意图证据和商业价值给 next-token prediction 加权。对齐层面用 Intermittent On-Policy Preference Optimization(IOPO)——周期性从当前策略采样新鲜候选组做偏好更新,与监督 NTP 维护交错进行。线上效果:进房率 +8.5%、加购率 +7.4%、收入 +16.1%。对比 DualGR 的长期/短期兴趣分离,TAGR 的差异在于把"时间自适应"做进了 tokenizer 本身,而非仅做行为建模。
Tlow(腾讯)** — 从分布角度解决 RQ-VAE 的码本依赖问题。RQ-VAE 的码本间存在固有依赖,解码效率低;而 OPQ 等高效独立 tokenizer 又无法处理语义嵌入的维度相关性和分布复杂度。Tlow 用 flow-based 变换把原始语义嵌入映射到标准正态分布的隐空间,获得维度独立和分布简化的双重收益,在变换后的隐空间上做独立 tokenization。另引入 codebook guidance 对齐码本空间与 token 嵌入空间。在微信多模态检索任务中,token ID 检索模型提升用户 CTR 10.32%(全局)、11.64%(新物品)。相比 PIT 的个性化动态 tokenizer,Tlow 的切入点是分布形态本身——先把嵌入空间"变简单",再谈量化。
单级大语义码本(快手)** — 直接挑战多级残差量化的结构假设。三级 SID 压缩为两级:一个语义 token + 一个协同消歧 token。同时引入曝光感知动态更新机制——时间权重衰减、EMA 中心更新、曝光加权惩罚——解决静态码本与流量漂移的失配。在 OneRec-V1/V2 上 Recall@10 提升 5.0%-8.8%,NDCG@10 提升 4.1%-8.5%。三种 serving 架构下,更短的 SID 减少自回归解码 FLOPs 47.93%-48.70%,单卡 QPS 提升 28.57%-47.0%。五天在线 A/B(2.5% 流量)消费指标 +0.792%。这个工作与 GRank 的 generate-rank 框架形成互补——GRank 解决生成后的排序问题,这篇解决生成本身的码本效率问题。
PRQ-KMeans — 把残差量化看作"渐进式共性移除"过程,并指出三个局限:语料全局共享分量会消耗第一级容量、硬分配忽略邻近码字的渐变相似度、全码本减法会在残差中保留选中码字方向上的变化。解法:去除全局均值分量、Top-k 相似度加权更新质心、用投影残差替代全码本减法。在工业搜索数据集上 HitRate 提升 7.4%、MRR 提升 11.8%。与 RQ-MoE 的 MoE 化量化不同,PRQ-KMeans 保持 RQ 的渐进结构,但修正了残差计算的几何错误。
SST(语义子词 tokenization) — 识别出固定长度 SID 的一个被忽视的问题:intra-item attention overload——过多注意力花在低层 intra-item 依赖上,而非高层 inter-item 行为转换。SST 用 Item-level Subword Tokenization(IST)把稳定的相邻原子 token 合并为紧凑语义子词,再用 Behavior-induced Co-occurrence Augmentation(BCA)注入粗粒度语义前缀迁移信号。在三个公开数据集和三个生成式推荐 backbone 上,SST 优于固定长度和可变长度 SID 基线。这本质上是把 NLP 里 BPE 的思路迁移到 SID 空间——但注意,NLP 的 subword 有明确的语言学动机,这里的"合并"标准需要更多理论支撑。
The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness(Spotify)** — 一篇反直觉的实证研究。2x2 因子设计(SID vs. 自然语言标题 × 最小 vs. 广泛 SID 对齐)发现:引入显式描述性推理轨迹反而降低传统离线推荐效果——即使自然语言标题产生了更 grounded 的轨迹。广泛的 SID 对齐改善轨迹质量但不改善推荐效果。这说明推理轨迹质量与推荐效果之间存在脱节,为生成式推荐中的 CoT 应用敲了警钟。与 SCoTER 将 CoT 模式蒸馏进 backbone 的做法形成对照——SCoTER 在腾讯广告平台 GMV +2.14%,而这篇发现推理轨迹的直接监督训练反而有害。
检索与向量化效率
本周检索效率的工作有两个明确方向:一是把系统级的效率优化下沉到查询级(AdaWidth、RetrievalRouter),二是解决图模型和 Transformer 在工业规模下的扩展瓶颈(Multi-Hash、TransRetrieval)。
Multi-Hash 图神经网络(VK)** — 在 1.94 亿用户、280 亿边的社交图上部署端到端 GNN 排序系统。两个关键设计:多哈希 ID 嵌入(减少 ID 嵌入表大小 98%)和时间戳排序 CSR 存储 + 二分查找(时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k))。线上 A/B:好友添加 +16%,唯一添加用户 +11.5%。这个工作的价值在于工程决策的系统性——多哈希并非新技术,但在工业 GNN 中作为主节点表示而非辅助特征,这需要验证与全量嵌入表的质量差距,论文用消融确认了无损。
TransRetrieval(阿里巴巴)** — 直接回应"Transformer 的 scaling law 为什么在推荐检索中不成立"。根本原因:异构字段导致 token-norm 发散,破坏了 Transformer 依赖的同质 token 假设。解法是加权平均聚合(恢复同质性假设)、目标 token 压缩(减少 85% per-candidate FLOPs)、位置风格域嵌入(多域统一,把跨域数据变成 scaling 资产)。在 40 亿交互工业数据集上,从 0.1 到 2 MFLOPs per target 的扩展带来 Recall@2000 +19.3/+22.2pt,确认 log-linear scaling。线上收入 +2.53%。对比 EGR 的共享 LLM 嵌入方案,TransRetrieval 更关注特征工程层面的可扩展性——不改变 backbone,而是修复输入分布。
AdaWidth — 查询自适应的嵌入维度宽度。正交前缀适配器对查询和文档施加同一个学习到的旋转,把判别信号集中到前导坐标(保持全宽度内积不变),轻量路由器读取查询已有排名的 order statistics,只对 top 结果会变化的查询评估更多维度。理论分析给出前缀充分性的边界:所需维度随语料库大小对数增长、随检索深度对数减少、跨查询呈重尾分布。在 6 个检索任务和 5 个冻结编码器上,用 55%-84% 更少的维度匹配 SOTA 降维方法的 NDCG@10。相比 Matryoshka Representation Learning 的固定截断和 JPQ 的查询无关量化,AdaWidth 第一次把"多少维度够用"变成查询级别的动态决策。
RetrievalRouter — 证明不存在跨查询统一最优的检索管道。轻量级查询感知路由器从查询文本预测最优管道(模态 + 架构),单一可调参数暴露完整准确率-延迟前沿。对每个静态基线,RetrievalRouter 都有同时更准更快的操作点:比最佳静态基线准确率高 2.5%、快 12.4 倍。本质是把传统 pipeline 设计的"系统级选择"变成"查询级选择"。
PUMA — 对冻结的通用多模态嵌入做事后稀疏化。两阶段:预训练阶段保留稠密点积几何,之后微调稀疏编码器用于检索。在 Qwen3-VL-Embedding-2B 上,五个基准中四个与稠密检索统计无差异或更优。存储减少 8-16 倍,大候选池上推理比精确稠密打分快 25 倍。识别出两个失败模式:pre-TopK 支持不足和检索不对齐的活动支持。稀疏化的价值在于:不需要重训骨干网络就能获得存储和推理收益。
RetrievalFormer(Amazon)** — 双塔编码器在共享搜索-推荐索引中的系统性评估。核心发现:在严格零泄漏冷启动协议下,内容塔达到 0.172 Recall@20,是最强专用冷启动方法的 1.4 倍(0.124)——无需冷启动特定训练。但揭示了采样 InfoNCE 与全 softmax 训练的权衡:全 softmax 在 MIND-small 上 Recall@20 提升 54%,但 24 万物品时耗尽加速器内存。近似最近邻搜索无法解释剩余差距。这篇的价值不在方法创新,而在诚实的规模-质量边界刻画——全 quality 训练在目录规模下的不可行性是生成式推荐和双塔检索共同面对的问题。
Retrieval Needs Multivectors — 理论工作。首次给出显式的查询-文档集合构造,单向量嵌入需要指数级大小才能正确排序,而多项式级多向量嵌入即可。并构建 ANDOR 基准实例化这些硬例子——SOTA 单向量模型零样本表现差,微调后仅边际改善;多向量模型一致超越且微调显著提升。
LLM/Agent 增强的推荐与推理
本周 LLM/Agent 方向最值得关注的变化:Agent 开始介入推荐系统自身的迭代过程(Astar),以及检索编排从固定管道变为 LLM 生成的可执行程序(ProRetrieval)。
Astar(阿里巴巴/Lazada)** — 本周工业界最激进的工作之一。AI 系统迭代循环中的"提出演化方向"环节此前依赖资深专家。Astar 从工业系统历史提交中学习演化方向生成:数据侧用成对样本扩展和噪声过滤构建大规模演化语料;模型侧用 mid-training、SFT、RL 训练,层次化提示引导演化方向生成,RL 中的奖励模型作为快速替代评估器。Astar-8B 单次提案成功率 0.6786,远超人类专家(0.3229)和 GPT-5.5(0.3071)。在 Lazada 广告系统部署后,引导了连续 20 次迭代(两周),离线 Hitrate@200 +23.6%,在线 GMV +4.86%、广告收入 +1.82%。这篇工作把 Aligning LLMs for Controllable Recommendations 的 RL 对齐思路从"推荐行为对齐"提升到"系统演化方向对齐"。
ProRetrieval — 将 LLM 训练为检索编排器。给定自然语言查询,模型合成可执行程序——混合 DSL 交错 SQL 操作符(结构化字段)和向量检索原语(文本和图像),SQL 本身提供融合异构候选集的逻辑代数。Qwen3-4B 用 GRPO 和 DAPO 训练,层次化四项奖励。4B 模型超越 GPT-5.5(电商 Hit@1 0.81 vs. 0.69;邮件 0.91 vs. 0.86)。与 Search-R1 的 RL 检索推理不同,ProRetrieval 的动作空间不是"下一步检索什么"而是"整个检索程序的组合结构"。
CoVeMem — 把 Agent 的文本记忆换成向量记忆。现有 agentic 推荐系统的记忆是文本叙述,由 LLM 调用维护——每次交互一次重写,无法利用完整交互历史;协作证据(整个目录上的梯度相似度)在翻译成句子时丢失。CoVeMem 用冻结的 LightGCN 用户和物品状态构成记忆库,候选集自身检索最相关的历史状态作为 soft token 进入 LLM 上下文。对比对齐到物品语义锚点 + 掩码候选的列表式协同训练,使模型学会读取这些状态并通过它们排序。19/20 指标单元达到或超过最强文本记忆 agent,且零额外 LLM 记忆维护调用。核心贡献是让记忆可梯度更新——完整交互历史终于可以作为训练数据,而不只是上下文。
DuELRec(SK Telecom)** — 领域门控双专家框架解决跨域序列推荐中的负迁移。单域专家限制注意力在域内物品,跨域专家允许跨全域,门控机制用单域信号减少跨域噪声。双采样 token-to-item 对比学习让 LLM 捕捉 item 级协作信号。在 26 个 SOTA 方法的对比中胜出,线上 CTR +47.6%。与 LLMRec 的纯 token 级建模相比,DuELRec 的关键是把 item 级协作信号显式注入 LLM——token 粒度对齐不足是 LLMRec 负迁移的根源。
SCOUT(PayPal)** — MCP 网关上工具暴露的上下文选择问题。全量工具 schema 会饱和上下文窗口(PayPal 部署中 140.2k tokens,占上下文的 70.1%),SCOUT 把工具暴露重构为上下文选择问题——只注入当前步骤相关的工具。混合检索(BM25 + 密集向量 + RRF)暴露两个 MCP meta-tools(tool_search 和 execute_tool),零停机目录更新管道支撑。生产环境 token 消耗从 140.2k 降至 1.3k(0.8%),降 99%。作为标准 MCP 工具暴露,模型无关。
SWIM — 列表级评估器,把用户行为建模为有限时域前缀会话级生存过程。SWIM 将当前列表对会话级目标的贡献分解为递归生存分布和到达位置条件奖励,用因果掩码 Transformer 并行估计,满足工业延迟约束。比 point-wise 聚合评估器更准确——后者隐含曝光独立性假设,忽略了上下文依赖、用户延续和重复内容的边际效用递减。
The Laws of Context Allocation — 揭露 RAG 中的一个"诊断幻觉":标准相关性代理指标在硬负样本上灾难性失败。用因果留一探针替换,准确隔离生成依赖并正式校准 LLM 注意力的结构性稀释。关键结论:单块上下文拓宽是"架构陷阱"(被相关性衰减惩罚),相反,在多个顺序生成中迭代分配计算带来 16.7-20.5 个绝对百分点的组合召回提升,扩展到 32B 模型仍稳健。
AGR — LLM Agent 用于群组推荐。token-based 哈希表记忆模块动态管理群组/用户历史交互,支持插入、更新、检索、遗忘和摘要。推理模块执行四步:群组兴趣收集、共识细化、多维度评估、可解释推荐生成。SFT 让模型学会调用记忆/推理模块,GRPO 增强自主协调能力。在 LastFM 和 Douban 上显著超越 SOTA。与 STAR 的教师轨迹蒸馏不同,AGR 保留显式的多步推理过程而非内化到单步。
多模态与工业系统架构
DCEO(阿里巴巴)** — 用 actor-critic 替代人工设计的多目标融合权重。现有电商搜索通过手工设计的融合权重组合点击、加购、购买、交易额等 item 级目标,无法个性化且与用户级长期目标对齐差。DCEO 先把 item 级代理分数组装成用户级代理指标,用相对因果效应量化其与终极目标的对齐,然后 actor 动态生成上下文相关的融合权重,直接优化相对因果效应。41 天在线 A/B,GMV +0.36%。相比 ESMM 和 MMoE 的静态多目标结构,DCEO 把"如何融合"本身变成可学习的问题。
CRRN(阿里巴巴)** — Trigger-Introduced Recommendation(TIR)场景:用户点击感兴趣的商品(trigger),后续页面推荐相关目标物品。trigger 包含较强即时兴趣,但比搜索词更模糊隐式。CRRN 三个组件:Trigger-Target Interaction 层(个性化门控提取交互特征)、Cascading Interest Fusion 模块(显式估计用户 trigger 意图、自适应融合即时和个性化兴趣)、Category-assisted Pairwise Loss(利用 trigger 和目标间的品类关联增强相关性)。在工业与公开数据集上均优于 SOTA,线上 A/B 验证有效。延续 DIN 的注意力兴趣建模,但把"trigger 与 target 的相关性"作为显式建模对象。
Native Multimodal Representation(阿里巴巴)** — 发现端到端联合训练多模态编码器和 CTR 模型并不带来提升。原因:原始 CTR 数据中的用户行为由多模态语义和非多模态因素共同驱动,导致监督模糊和编码器更新不一致。解法是 Mine-Then-Train——从 CTR 数据中挖掘多模态可解释的高质量训练样本,用它们微调编码器以对齐用户点击偏好。这个发现的普适意义在于:多模态预训练的目标函数与 CTR 任务的目标函数之间存在系统性错位,直接端到端不是答案。
HEGM(VK)** — 复现研究暴露了 EGMN(Exponential-Gaussian Mixture Network)的三个失效模式:方差坍缩、组件冗余、非活动组件。HEGM 通过层次化 skip-watch 分解、KL 方差正则化、结构化初始化修复。1.5 个月生产 A/B 确认统计显著的参与度提升。这是少见的、对已有 SOTA 方法的系统性失败模式分析——对从业者的价值在于"别把 SOTA 当黑盒"。
值得关注的方向
语义 ID 的"生命周期管理"正在成为独立研究问题。 本周四篇工业论文(TAGR 的 LSID 动态刷新、Kuaishou 的曝光感知码本更新、Tlow 的分布变换、PRQ-KMeans 的残留修正)从不同角度处理 SID 系统在动态流量下的漂移问题。静态码本在推新、流量变化、季节性波动面前的失配,已被多个团队独立识别为瓶颈。后续值得关注:SID 的增量更新协议、多场景共享码本的冲突消解、以及 SID 与 RQ-VAE 类方法的效率对比是否能出现统一评估基准。
查询级自适应从"要不要"进入"怎么做"。 AdaWidth 证明不同的查询需要不同的维度宽度,RetrievalRouter 证明不同的查询需要不同的管道,CoVeMem 证明不同的候选需要不同的记忆读取方式。三篇工作的共同信号是:检索系统的资源分配粒度正在从系统级和请求级下探到更细的单位。这个方向的实际价值在于推理成本优化——当嵌入表超过 200GB、候选池达数十亿时,按查询动态分配计算能直接转化为延迟和成本收益。
Agent 介入系统自我迭代的闭环初步验证。 Astar 在 Lazada 的 20 次连续迭代展示了"AI 提出演化方向 + 自动化执行 + 自动评估"的可行性。虽然单次提案成功率 0.6786 仍非完美,但已经超过人类专家一倍。这个方向如果成立,将改变推荐系统的研发范式——从"人提出方向、系统验证"变为"系统提出方向、人审核"。目前 Astar 聚焦广告系统,扩展到推荐全链路的泛化性、以及演化方向的多样性(避免局部最优)是接下来需要观察的问题。
本周论文速览
生成式推荐与语义编码
AMBER — Meta 提出事件中心范式,将每个时间快照压缩为单个 Event Token;统一 tokenizer 在足够容量下优于专用 tokenizer。
TAGR — 快手针对直播广告提出三层时间自适应生成式推荐;进房率 +8.5%、收入 +16.1%。
Tlow — 腾讯用 flow-based 变换解决 RQ-VAE 码本依赖;微信多模态检索 CTR +10.32%、新物品 +11.64%。
单级大语义码本 — 快手用单级大码本替代多级残差量化,暴露感知动态更新;消费指标 +0.792%,解码 FLOPs 降 48%。
PRQ-KMeans — 投影残差量化改进语义 ID 生成;工业搜索 HitRate +7.4%、MRR +11.8%。
SST — 语义子词 tokenization 解决 intra-item attention overload;三个数据集上超越固定长度 SID 基线。
The Disconnect Between Reasoning Trace Quality and Recommendation Effectiveness — Spotify 的 2x2 因子实验发现推理轨迹质量与推荐效果脱节。
PrismRec — 频谱分解 + 流匹配框架用于微视频推荐;超越 SOTA 最高 22.65%,推理成本最低。
ANR-DiffRec — 将物品共现矩阵作为协作先验融入离散扩散训练,物品级自适应噪声重调度。
CodeHID — 层次语义索引 + 双阶段生成引导用于生成式代码检索。
GRAFT — 图蒸馏生成式检索用于科学文献探索;恢复图教师 91% Recall@20,方面标签精度 0.922。
Adaptive Item-based Collaborative Structures — 物品级自适应噪声重调度 + 协作先验引导的离散扩散推荐。
检索与向量化效率
Multi-Hash GNN — VK 在 1.94 亿用户、280 亿边社交图部署 GNN 排序;多哈希嵌入减表 98%,好友添加 +16%。
TransRetrieval — 阿里巴巴加权平均聚合 + 目标 token 压缩 + 位置风格域嵌入;40 亿交互验证 log-linear scaling,线上收入 +2.53%。
RetrievalRouter — 查询感知路由器联合选择模态和架构;比最佳静态基线准 2.5%、快 12.4 倍。
AdaWidth — 查询自适应嵌入宽度;用 55%-84% 更少维度匹配 SOTA NDCG@10。
AnchorQE — 无训练查询扩展集成方法,分别编码原查询与扩展后插值;提升最高 12.89%。
PUMA — 冻结多模态嵌入的事后稀疏化;存储减 8-16 倍,推理快 25 倍。
RetrievalFormer — Amazon 双塔共享搜索-推荐索引;严格冷启动 Recall@20 达 0.172(1.4 倍专用方法)。
Retrieval Needs Multivectors — 首次证明单向量嵌入在排序任务上需要指数级大小,构建 ANDOR 基准验证。
LLM/Agent 增强的推荐与推理
Astar — 阿里巴巴/Lazada 从迭代历史学习演化方向生成;Astar-8B 提案成功率 0.6786(人类 0.3229),在线 GMV +4.86%。
ProRetrieval — Qwen3-4B 通过程序合成做检索编排;Hit@1 超越 GPT-5.5 和 Claude Opus 4.7。
CoVeMem — 协作向量记忆替代文本记忆,记忆可梯度更新;19/20 指标达到或超过最强文本记忆 agent。
DuELRec — SK Telecom 领域门控双专家解决跨域负迁移;超越 26 个 SOTA,线上 CTR +47.6%。
SCOUT — PayPal 将 MCP 工具暴露重构为上下文选择问题;工具 token 消耗降 99%。
SWIM — 列表级评估器建模有限时域前缀会话级生存过程。
MoPLEx — 混合 Plackett-Luce 模型用于多目标对齐;聚类准确率 +43.7%、排序准确率 +15.2%。
CRAMER — 请求感知掩码控制冻结骨干网络参数,实现即时请求适应且避免重训练。
The Laws of Context Allocation — 因果留一探针揭示标准相关性指标的失效;迭代上下文分配带来 16.7-20.5pt 召回提升。
AGR — 记忆增强推理的 LLM Agent 用于群组推荐;SFT + GRPO 训练。
Risk-Aware Reranking — 工具检索中建模查询条件相关性和工具级暴露风险,显式权衡安全与效用。
FashionKG-RAG — 领域级时尚知识图谱 + 双层路径重排名 RAG 框架。
CAIRO — 用户上下文感知物品画像框架,动态选择用户-物品对相关信息。
Clarify-Then-Search — 百度构建深度搜索澄清基准(518 实例);澄清显著改进端到端效用。
WARP — Wasserstein-1 距离校准 RAG 意见总结;分布误差降低至少 43%。
Storage-Retrieval Gap in Parametric KG Memory — 将知识图谱编译为 LoRA 适配器库可行,但相似性检索无法恢复存储知识。
多模态与工业系统架构
DCEO — 阿里巴巴用 actor-critic 动态生成多目标融合权重,直接优化相对因果效应;41 天 A/B,GMV +0.36%。
CRRN — 阿里巴巴级联相关性驱动模型用于 Trigger 引入推荐;工业与公开数据集均超 SOTA,线上验证有效。
Native Multimodal Representation — 阿里巴巴发现端到端多模态 CTR 训练失效,提出 Mine-Then-Train 方法微调编码器。
HEGM — VK 修复 EGMN 的方差坍缩、组件冗余、非活动组件问题;1.5 个月 A/B 验证显著提升。
D3ER — 梯度提升首次引入多模态推荐,解耦同质/异质判别信息。
HSR — 将序列推荐建模为耗散哈密顿系统,频域闭式解 + 可学习耗散。
MOSAIC — 元评论聚合邻居证据解决 UGC 稀疏和不完整问题。
从 GBT 到深度推荐器 — Intuit 将生产客服推荐系统从梯度提升树迁移到 pairwise-binary 深度推荐器,后期对话阶段超越基线。
One Hierarchy, Two Systems — DoorDash 用单一层次化语义 ID 同时支持发现面排序和查询改写,在线验证有效。
AdaptedKG — 用结构匹配的 KG 证据做行为去噪,离线计算、推理时无需 KG。
职业路径推荐 — TCS 用 LSTM 无监督学习职业事件嵌入,结合 Levenshtein 对齐实现个性化职业路径推荐。