推荐周报 2026-W36
2026-9-5
| 2026-9-5
字数 7916阅读时长 20 分钟
type
Post
status
Published
date
Sep 5, 2026 05:33
slug
rec-weekly-2026-W36
summary
本周推荐系统研究围绕三条主线展开:生成式推荐从单点召回组件走向覆盖排序与推理的工业级框架;CTR 建模范式重新组织上下文单元以对齐真实决策过程;召回侧则在多兴趣与多模态的叠加下重新收敛效率与成本。 主线 1:生成式推荐从“解码物品”走向“统一生成与推理”。 腾讯的 TGR 将生成式范式推进到排序、端到端生成和推理注入三个方向,其中 CCFormer 在五个 A/B 场景取得显著提升;百度 ICGR 把查询意图一致性贯穿 SID 构建、SFT 与偏好优化全链路,线下 Recall@20 提升 21.7%。共同指向是——生成式推荐不再止步于“用模型替代索引”,而是开始重构排序与召回之间的边界。 主线 2:统一 CTR 模型开始以“上下文”为基本单元。 美团 UniCon 把请求上下文当作同质单元,统一历史与目标的结构,线上 RPM 提升 3.09%;字节 ReST 则在行为序列上验证了 LLM 式 Transformer 在基准上饱和后仍可沿推荐原生设计继续扩展。两篇的共同指向是——推荐特有的信号噪声与计算不对称需要架构级的重新设计,而非简单搬用 NLP 缩放法则。 主线 3:召回侧的成本意识回归。 Snap 的 SetMIR 把多兴趣召回建模为集合预测,用 presence score 动态削减 33% 的 ANN 查询;同一团队的 CAMIE 用单个多模态编码器替换碎片化的 I2I 检索栈;Mubadala 的 PULSAR 用两阶段池化索引把中位向量检索延迟降低 15.1 倍。三者的共同逻辑是——召回的性能度量不再只有准确率,查询预算和索引体积正在成为一等的优化目标。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1

本周概览

本周推荐系统研究围绕三条主线展开:生成式推荐从单点召回组件走向覆盖排序与推理的工业级框架;CTR 建模范式重新组织上下文单元以对齐真实决策过程;召回侧则在多兴趣与多模态的叠加下重新收敛效率与成本。
主线 1:生成式推荐从“解码物品”走向“统一生成与推理”。 腾讯的 TGR 将生成式范式推进到排序、端到端生成和推理注入三个方向,其中 CCFormer 在五个 A/B 场景取得显著提升;百度 ICGR 把查询意图一致性贯穿 SID 构建、SFT 与偏好优化全链路,线下 Recall@20 提升 21.7%。共同指向是——生成式推荐不再止步于“用模型替代索引”,而是开始重构排序与召回之间的边界。
主线 2:统一 CTR 模型开始以“上下文”为基本单元。 美团 UniCon 把请求上下文当作同质单元,统一历史与目标的结构,线上 RPM 提升 3.09%;字节 ReST 则在行为序列上验证了 LLM 式 Transformer 在基准上饱和后仍可沿推荐原生设计继续扩展。两篇的共同指向是——推荐特有的信号噪声与计算不对称需要架构级的重新设计,而非简单搬用 NLP 缩放法则。
主线 3:召回侧的成本意识回归。 Snap 的 SetMIR 把多兴趣召回建模为集合预测,用 presence score 动态削减 33% 的 ANN 查询;同一团队的 CAMIE 用单个多模态编码器替换碎片化的 I2I 检索栈;Mubadala 的 PULSAR 用两阶段池化索引把中位向量检索延迟降低 15.1 倍。三者的共同逻辑是——召回的性能度量不再只有准确率,查询预算和索引体积正在成为一等的优化目标。

生成式推荐与语义索引

生成式推荐本周的工业进展集中在同一个问题上:当语义 ID 成为物品信息的唯一通道,如何保证这个通道不丢失对排序和召回至关重要的信息。腾讯、百度、美团各自给出了不同层级的回答。
TGR(Tencent)— 一个同时覆盖生成式排序、端到端生成与推理注入的工业框架。它的排序组件 CCFormer 做了三件事:统一特征 tokenization 把用户画像、物品属性和行为序列全部转成同构 token;可扩展 Transformer backbone 替代传统精排的 MLP 塔;层次序列压缩在长行为序列上降低计算量,同时保留多任务输出。在五个 A/B 场景中 CCFormer 均显著提升,其中视频场景 CTR +3.57%、广告收入 +1.71%,已在两个场景全量上线。
生成组件这边,TGR 收敛了两条技术路线。BARGE 和 HiGR 的起点一致——都是把物品编码为层次化语义 ID,再用自回归方式解码。差异在生成粒度。BARGE 用 item context-aware attention 和正交双路径解码解决“物品边界丢失”问题,即层次 SID 生成时,多级 token 之间的级间语义漂移;离线 Hit@5 相对基线提升 10.2%-16.9%,全量上线后 CTR +0.60%。
HiGR 值得单独说明,因为它本质上回答了一个更深的问题:生成式推荐一定要逐个物品解码吗?它的做法是引入列表级规划——先生成一个代表整个推荐列表的规划 token,再逐物品解码。推理时使用 prefix-structured SID 和粗到细解码,离线槽位质量提升 15.9%-21.3%,推理加速 5 倍。这里的参照物是 DualGR(快手)和 HiGR,两者都在同一方向上探索长短期兴趣分离与分层生成,但 TGR 是首个把两条路线放进同一生产框架的尝试。
TGR 的第三个方向是 TGR-Reason——把推理从在线阶段移到离线。它离线生成语义 ID 的 reason tokens,在线解码时直接注入,不需要 request-time rollout。冷启动新用户的 Hit@1 提升 477.8%,线上有效消费 +1.75%,新用户曝光到转化 +13.09%。这个方向的实际价值在于绕开了"在线推理代价 vs 推理收益"的经典权衡。需要说明的是,TGR-Reason 与 PROMISE 的测试时 scaling 逻辑形成对照——后者用过程奖励模型在解码时动态剪枝,前者则把推理前置到离线。两种路线短期内会在工业界并行。
ICEGR(Baidu)— 意图连贯的端到端生成式检索框架,针对电商搜索。ICEGR 的三个组件分别对应训练管线三阶段各自的意图漂移问题。
第一是 Intent-Aware SID 构建。传统 SID 只从静态物品信息学习,ICEGR 把 query-intent 信号纳入 SID 学习过程,让 SID 编码"物品是什么"之外还编码"用户为什么搜它"。第二是合成查询增强的统一 SFT。电商场景中低曝光物品缺少真实 query-to-SID 监督,ICEGR 用合成查询补充这部分稀疏监督,同时把多个 SFT 任务统一在 query-to-SID 目标下。第三是相关性校准的偏好优化——在 margin-adaptive 的偏好目标里同时注入 query-product relevance 和业务信号,避免偏好优化偏向高热物品而牺牲相关性。
这种"训练管线全覆盖"的设计直接回应了生成式检索部署中的一个真问题:如果只改模型结构不改训练目标,语义 ID 的意图漂移会在不同阶段反复出现。ICEGR 把它拆成三个可独立优化的环节。离线 Recall@20 提升 21.7%,NDCG@20 提升 26.6%;线上 CTR +3.52%,订单量 +15.96%,GMV +7.53%。这项工作的对照是 Gryphon(工业音乐服务)——后者解决的是 SID 序列似然与排序相关性目标的错位,两者共享同一判断:生成式检索的瓶颈不在解码,而在训练目标的正确分解。
CHAP(Meituan)— 从另一个角度切入同一个问题。ICEGR 关注意图一致性,CHAP 关注语义保真与推理效率。它的核心观察是:现有 SID 用物品内容离散化,但查询意图是动态的,两者存在语义鸿沟;且生成式召回的自回归解码延迟过高。CHAP 的 Hierarchical Semantic Alignment 模块对齐查询隐空间与物品量化路径,在多个粒度上同步语义;个性化部分融合离散 SID 与连续表示,SID 提供结构引导,连续表示承载细粒度语义。
最有工程价值的是 Residual Cascading Generation:把多步 Transformer 解码限制为单次推理。做法是用残差级联——后续层只建模前一层未能表达的语义增量,从而不需要逐步自回归。在三个公开数据集、一个美团工业数据集和在线 A/B 测试上验证,CTR +1.2%、GMV +0.8%。这个"单步生成"方向可以和 xGR 的 serving 优化对照:xGR 通过分阶段计算和 KV 缓存分离来压低生成式推荐的延迟,CHAP 则从模型结构侧消解多步依赖。两条技术路线都可以在 50ms 内完成生成式召回,但优化的起点不同。
语义 ID 保真度的边界探索: 本周有两篇工作把 SID 的容量问题推向更细的粒度。HF-SID(Alibaba AMAP)针对 LBS 场景,指出 LLM 嵌入连续坐标的方式不连续——数值差不能反映真实地理距离。它把坐标转为连续 3D 笛卡尔形式,用 Geo-CPT 和 Num-CPT 做类型感知编码,在 3-token SID 下把平均地理距离降低 95.9%,线上 PV_CVR +6.74%。HypRQ-VAE 则直接把物品索引从欧氏空间搬到双曲空间——指数级的体积增长天然适配长尾分布,在 Amazon Beauty、Sports 和 MovieLens-1M 上 tail items 的推荐提升显著。HF-SID 延续了 RQ-VAE 的残差量化框架但重构了编码空间,HypRQ-VAE 则在同样的框架上换了几何空间。两条路线共同说明一件事:SID 的信息保真问题已经从"选哪个 tokenizer"变成"在什么空间做离散化"。

排序与 CTR 建模范式

本周排序方向的两篇工业论文有一个共同前提:传统 CTR 建模把行为序列和非序列特征当作异质信号处理,但用户行为本质上是一个同质决策序列——历史和当前请求的区别只在于结果是否已观测。基于这个判断,两篇文章给出了不同的统一方案。
UniCon(Meituan)— 上下文中心建模范式。它把请求上下文作为基本建模单元,历史行为和预测目标组织成同质的 context units。Intra-context attention 建模单元内物品的局部耦合,inter-context attention 建模决策状态在上下文间的动态演化。这相当于在序列维度上做了一次语义切分——不是按固定时间窗口切 session,而是按决策上下文切单元。
这个设计与 DSIN(Deep Session Interest Network)有清晰的承继关系。DSIN 按 30 分钟间隔切 session,用 Bi-LSTM 建模 session 间兴趣演化;UniCon 的切分逻辑不再是时间而是决策上下文——一次请求、一次浏览、一次比较构成一个单元。这个变化的意义在于对齐了推荐系统的真实决策过程:电商场景中用户在一个页面上的行为(比较多个商品、翻看详情)构成一个完整的决策上下文,跨页面的行为演化是另一个维度。美团搜索广告的场景正好放大了这个优势——瀑布流 feed 的上下文长度和商品耦合度都高于传统场景。线上 AUC 提升 0.0139,RPM +3.09%,CTR +2.07%,收入 +2.95%。
ReST(ByteDance)— 推荐原生 Transformer 缩放框架。它的出发点是两个推荐与 NLP 的结构性差异。信号质量上,行为序列噪声大、时间不规则、监督稀疏,LLM 风格 Transformer 的缩放收益在行为序列上会更快饱和;计算不对称上,一次请求要对多个候选打分,共享同一份用户历史,但延迟预算严格。ReST 针对前者设计了 dual-gated attention、rotary temporal embedding 和训练期辅助目标;针对后者把排序分解为重编码器加轻解码器——用户历史的编码只做一次,多个候选共享前缀解码。
这个"compute-once, decode-many-times"的设计在系统层面切中了排序的根本矛盾。论文没有停留在离线验证:在工业广告平台上的一周 A/B 测试中,线上 AUC +1.31%,核心收入指标 +11.93%,在 50ms P99 延迟预算内完成,并且已全量部署。这条线与 RelayGR 的接力推理思路存在呼应——RelayGR 用跨阶段接力把长序列生成拆到多个推理阶段,ReST 则把用户历史编码(重)与候选打分(轻)在架构上彻底分离。两者都是在行为序列长度与延迟预算之间重新划分配置。
放到一起看,UniCon 和 ReST 代表了统一 CTR 模型的两条路径。UniCon 从建模单元入手——把"上下文"变成一等的结构概念;ReST 从计算不对称入手——把"共享历史编码"变成系统设计的第一原则。两条路径都隐含一个判断:CTR 模型继续涨点靠的不是把更多特征塞进同一个 backbone,而是重新组织输入结构和计算分配。这个判断与 HSTU 一脉相承——后者首先提出行为序列建模需要专门的架构设计而非直接套用 LLM decoder。本周两篇工业论文给出了在同一研判下的落地证据。

召回与向量检索优化

召回方向的工业进展呈现在"减"而非"加":减少冗余查询、减少编码器数量、减少索引体积。三项工作都在多个维度上压缩召回成本。
SetMIR(Snap)— 多兴趣召回从"固定数量的 embedding"变成"动态数量的集合预测"。传统多兴趣召回(如 MIND 的多向量方案)有两个结构性问题:兴趣坍缩——多个 embedding 学到同一个兴趣;静态分发——明明某些兴趣向量用不上,serving 时仍然要发同等数量的 ANN 查询。SetMIR 用 Hungarian matching 做一对一的 query-to-interest 分配,强迫每个 query 学到不同的兴趣;presence head 学习哪些 query 在当前请求下是激活的。serving 时用 presence score 加 query 级 NMS 只对激活且不冗余的兴趣发 ANN 查询。
数字上,相比 4 个学习的多兴趣召回基线,SetMIR 在每个指标上占优,同时每个请求的 ANN 查询减少 33%。部署为 Snap DPA 生产栈中的新增召回源后,整体 CVR +3.1%;与同 embedding、同索引的 item-to-item 召回源对比,CTR 提升 44%,CVR 提升 51%。这个对比尤其能说明问题——同样的物品 embedding、同样的 ANN 基础设施,只是查询的构造方式从"给定一个物品找相似"变成"给定用户历史解码兴趣集合",转化效果就出现了数量级的差距。
CAMIE(Snap)— 共参与感知的多模态物品嵌入。DPA 的 I2I 召回此前的问题是:视觉、文本、多模态编码器各司其职,检索栈碎片化;且纯内容训练让 embedding 没有对齐真正驱动转化行为的共参与信号。CAMIE 的解法是把检索栈统一到一个多模态编码器上,用共参与物品对微调。方法层面最值得注意的细节是它复用了 LLM/MLLM 的原生多模态接口,没有为推荐任务改造骨干网络——图像的视觉 token 和物品元数据的文本 token 直接进同一个 backbone。
效果上,CAMIE 在 Recall@10 上超过最强的商用多模态 embedding 模型,而且同一个 checkpoint 支持纯文本检索,质量损失极小。线上替换两个内容型 I2I 编码器后,对比多模态对照组 CTR +0.390%、CVR +10.832%;对比文本对照组 CTR +18.958%、CVR +13.12%。对比基线 CLIPSigLIP 这类通用图文模型,CAMIE 的关键差异是训练信号——不是"图片和文本是否配对",而是"两个物品是否被同一用户旅程共参与"。这个信号对齐逻辑和 HyMiRec 中把轻量推荐器的粗粒度兴趣与 LLM 的细粒度兴趣解耦的做法形成互补,两者都在回答"行为信号应该以什么粒度注入内容表示"。
PULSAR(Mubadala Investment Company)— 池化两阶段 late-interaction 索引。它解决的场景是金融投研中的高密度视觉文档检索——pitch decks、board packs 这类图表密集、改动频繁的材料。传统 OCR 加图表标注的管线更新成本高且会丢失图表细节。PULSAR 用冻结的 ColPali 风格骨干直接索引页面图像,核心工程创新是 pooled two-stage late-interaction 索引:紧凑的页面摘要做初筛,精排阶段在更细的池化表示上做精确 MaxSim 重打分。
性能数字值得细看。ViDoRe V3 上对比 unpooled 配置,中位向量检索延迟降低 15.1 倍,NDCG@10 和 Recall@10 的损失都小于 0.01 绝对点;生产环境的中位延迟是 156ms。并发负载下,pooled 索引的 QPS 是 unpooled 的约 88 倍。这套设计的工程价值在于,它把 late-interaction 的两阶段成本分布做了显式的优先级排序——首轮检索要便宜,末轮重排要准。与 Col-Bandit 的查询时剪枝方向互补:Col-Bandit 在运行时减少 MaxSim 计算,PULSAR 在索引时就把昂贵的表示池化好。
两个值得关注的现象: 一是召回侧的增量开始从纯算法转向工程与算法的联合优化,SetMIR 的 33% 查询削减和 PULSAR 的 88 倍 QPS 都来自联合设计而非单一模型改进。二是多模态召回的统一趋势明显——CAMIE 用一个编码器替代三个,与 BiListing 在 Airbnb 用单嵌入向量替代多模态栈的做法方向一致。

LLM 与 Agent 增强的推荐推理

本周 LLM/Agent 方向没有出现已部署的大规模系统,几篇工作集中在推理效率、模拟器与蒸馏的边界问题上。相比前几周的"LLM 直接做推荐"的叙事,本周的论文更多在回答一个反向问题:LLM 的推理能力要在什么条件下、以什么方式进入推荐系统才是可负担的。
推理的成本问题是核心约束。SelfDR 直接面对这个约束——它把推理增强预测蒸馏回直接推荐模型。教师模型先用下游性能做奖励训练 reasoner,生成 rationale 后加入输入;同基座的学生模型通过自蒸馏学习,动态加权策略在训练中调整蒸馏强度。这个设计的优点是不依赖外部模型——教师学生共享同一个 backbone。与 ReRec 用强化学习微调让 LLM 生成推理的思路相比,SelfDR 的差异在于把推理当作"训练期的脚手架"而非"推理期必备的步骤"。这是对"推理必须在线发生"这个隐含假设的直接挑战。
另一个方向的探索是用模拟器替代真实在线反馈。WMG-RL(ByteDance 与高校合作)提出用户参与世界模型 UEWM——把推荐物品当作 agent action,用户反馈当作环境观测,用历史参与数据推断用户特定动态,再应用到候选物品。下游策略对同一历史提出多个候选物品,UEWM 并行预测参与反馈,转换为密集奖励用于策略优化。实验显示 1.7B 学生策略可以匹配或超越更大的 LLM。这条路线可以追溯到语言世界模型的思路,但应用到用户参与模拟还需要解决模拟器偏差问题——如果 UEWM 预测的参与反馈与真实反馈系统性偏离,策略优化就会放大这个偏差。
在对话推荐方向上,本周有一个值得注意的方法论反思。CLEAR 指出对话检索中一个系统性的可回答性差距——主题相关的段落不一定是支持正确答案的段落。CLEAR 用蕴含蒸馏把答案-段落的蕴含监督转移到 cross-encoder 重排序器,让重排序器在推理时不需要答案就能区分"支持答案的段落"和"主题干扰项";配套的基于段落的溯因召回模块用 LLM 从段落反推可回答的查询,把低相似度但可回答的段落拉进候选池。在 TopiOCQA、QReCC 和域外 TREC CAsT 上,CLEAR 一致提升 top-ranked precision,主题噪声越大的对话增益越大。这个"主题相关性不等于可回答性"的区分,对推荐场景中"相关不等于会点击"的老问题有直接的方法论映射。
LLM4AIGQ(Alibaba)— 用 LLM 做电商引导查询(AIGQ)生成。它在近线生成、在线读取的架构上,先按用户画像和历史行为切分兴趣,再对每个子兴趣推断消费意图,最后生成对应的引导查询。训练管线是 SFT + RL + DPO 的后训练组合,辅以多级奖励设计;部署上采用 nearline-generation 满足延迟约束。在阿里电商搜索场景离线评估和线上 A/B 中都验证了有效性。这里的多级奖励设计延续了 RecThinker 中多步工具调用奖励分解的思路,但落点从推荐本身移到查询生成。
这些工作合在一起显示LLM 推荐的研究重心正在从"能不能用 LLM 提升效果"转移到"如何控制 LLM 进入推荐系统的边际成本"。SelfDR 把推理移出在线路径;WMG-RL 把反馈移进模拟器;LLM4AIGQ 把生成移入近线。三个"移"指向同一个目标——让 LLM 的语义理解能力以可控成本进入推荐链路。

值得关注的方向

长尾与冷启动成为生成式推荐的主战场。 本周的多个工作把长尾表现当作核心度量:TGR-Reason 让冷启动新用户 Hit@1 提升 477.8%,ICEGR 用合成查询补充低曝光物品的监督信号,HypRQ-VAE 在双曲空间提升 tail items 的表示保真度,MERIT 在 250k+ 兴趣类别上处理长尾匹配。这个集中的原因是生成式推荐的结构特性——SID 编码质量直接决定模型对低频物品的感知能力,而长尾物品恰恰是 SID 最容易失真的区域。后续值得跟踪:当 TGR 已证明 reason token 可以离线注入,长尾冷启动是否会成为生成式推荐首个稳定的工业价值锚点。
索引效率正在成为检索优化的度量核心。 SetMIR 的 query 级 NMS、CHAP 的残差级联单步解码、PULSAR 的 pooled index、HF-SID 的 3-token SID——每个工作都在压缩生成或检索链路中的一个环节。但有一个尚未被统一回答的问题:这些技术各自优化了本地延迟或吞吐,如果组合部署在同一个系统里,收益是叠加还是互相牵制?例如 CHAP 的单步生成配合 PULSAR 的池化索引可以同时减少解码步数和重排成本,但两者的错误传播会如何相互作用,目前还没有系统研究。
行为序列的"上下文切分"正从工程启发走向理论框架。 DSIN 按时间切 session 是工程启发,UniCon 按决策上下文切单元开始具备理论一致性,ReST 的 shared-prefix 解码则把切分逻辑延伸到计算分配。三者的演进暗示:行为序列建模的下一个增量可能不来自更好的 attention 机制,而来自对序列结构的更准确建模——什么构成一个完整的决策单元,不同单元之间如何演化。这和 Modern Transformers 中 Head-wise Hybrid 架构的"head 级功能分化"发现可以相互印证:模型内部的功能组织如果与任务的结构一致,效率和效果可以同步提升。

本周论文速览

生成式推荐与语义索引
TGR — Tencent 提出统一生成与推理的工业框架;CCFormer 视频场景 CTR +3.57%、广告收入 +1.71%,BARGE 离线 Hit@5 提升 10.2%-16.9%,HiGR 推理加速 5 倍,TGR-Reason 冷启动新用户 Hit@1 提升 477.8%。
ICEGR — Baidu 提出意图连贯的生成式检索框架;离线 Recall@20 +21.7%,线上 CTR +3.52%、GMV +7.53%。
CHAP — Meituan 提出跨组件层次语义对齐,残差级联生成实现单步推理;线上 CTR +1.2%、GMV +0.8%。
HF-SID — Alibaba AMAP 用 Geo-CPT/Num-CPT 恢复地理与数值保真度;平均地理距离降低 95.9%,线上 PV_CVR +6.74%。
HypRQ-VAE — 学术团队提出首个双曲空间物品索引框架,利用指数体积扩展适配长尾分布;tail items 推荐提升显著。
EPIC — 学术团队在 SID 扩散推荐中引入显式物品级后验条件化,冻结预训练骨干无额外解码前向;四个 Amazon 基准一致提升。
TAAL — 学术团队提出时间自回归对齐缓解早期 beam pruning;NDCG@10 提升 6.7%-39.5%。
MERIT — Amazon 提出置换不变多目标损失缓解生成式 XMC 暴露偏差;全局召回 +11.9%,生产 A/B 用户转化 +0.26%。
CoGR — Apple 让 LLM 直接生成查询与物品侧关键词,协同进化 RL 优化两端;内部数据集 F1 +10.9%、WANDS +36.1%。
Joint Embedding-Codebook — Alibaba 联合训练 embedding 与 codebook 并引入同产品簇监督,缓解两阶段级联错误。
排序与 CTR 建模范式
UniCon — Meituan 提出上下文中心统一建模;线上 AUC +0.0139,RPM +3.09%、CTR +2.07%、收入 +2.95%。
ReST — ByteDance 提出推荐原生 Transformer 缩放框架;线上 AUC +1.31%、核心收入 +11.93%,已全量部署。
HubMixer — Kuaishou 提出潜在 hub 特征交互架构;简历提交转化率 +5.48%,已全量部署。
PRIME — Ant Group/Alibaba 提出 Dense-anchored 残差 MoE 缓解子组优化竞争;AUC 中位增益 +0.0022/+0.0066。
SwapRec — Albatross AI 在训练时用最相似温物品替换冷物品交互;三个推荐域显著提升冷物品准确率。
TS-SSM — 学术团队提出双侧面状态空间模型建模非随机评论反馈;Recall@20 相对提升 14.8%-18.8%。
Adaptive Doubly Robust — 学术团队提出结合自适应重要性加权与奖励回归的排序 OPE 估计器;合成实验中 MSE 一致优于 AIPS。
Bandits in Prod — Tiime 把推理时配置优化形式化为无穷臂 bandit,提出 IMABO/IMOSS 并证明累积 quantile-regret 界。
召回与向量检索优化
SetMIR — Snap 将多兴趣召回建模为集合预测,presence score 动态削减 33% ANN 查询;线上整体 CVR +3.1%。
CAMIE — Snap Inc. 用共参与信号微调多模态编码器,统一 I2I 检索栈;线上 CTR +18.958%、CVR +13.12%。
PULSAR — Mubadala 部署池化两阶段 late-interaction 索引;中位检索延迟降低 15.1 倍,生产 QPS 提升约 88 倍。
PAO — Alibaba 提出仅正优势梯度更新,在冻结索引约束下避免 embedding 几何坍塌;显著优于标准 RL 和蒸馏基线。
MIDR — Bloomberg 提出索引时多模态推理框架替代 serving 时视觉 late-interaction;平均 nDCG 0.6219,索引内存减少约 9 倍。
Closed Forms and Synthetic Twins — 学术团队提出从 embedding 统计预测 ANN 召回率的理论框架,百万文档语料预测误差在 0.03 以内。
Surface-Form Bias — 学术团队揭示 embedding 检索在结构任务中的表面形式偏差,数学领域 Hit@1 低至 0.0%。
RePair — 学术团队将检索失败转化为反事实硬样本,LLM 引导编辑构建难负对;数据效率提升 26%-75%。
Edge Spectrum — 学术团队证明 choice-derived item graphs 中强弱边编码不同关系,形式化平滑算子与排序梯度的符号不匹配。
MULTI3IR — 学术团队构建多视角多领域多模态检索基准(104.9K 查询),提出 SPIN 方法提升视角覆盖。
ITER — 学术团队提出交互感知检索器,用 agent 轨迹信号训练;InfoSeek-Eval +7.5%、BrowseComp-Plus +13.5%。
AMUR — 学术团队提出信息论指导的选择性模态-兴趣对齐;三个真实数据集 Recall@20 提升约 5%-8%。
LLM/Agent 增强的推荐推理
LLM4AIGQ — Alibaba 用 LLM 做多兴趣挖掘与引导查询生成,SFT+RL+DPO 后训练;离线评估与线上 A/B 均验证有效性。
SelfDR — 学术团队提出自蒸馏框架,把推理增强预测转移到直接推荐模型,推理时不产生额外成本。
WMG-RL — ByteDance 与高校提出用户参与世界模型生成反事实奖励;1.7B 策略匹配或超越更大 LLM。
CLEAR — 学术团队用蕴含蒸馏把对话检索从主题相关性转向可回答性;主题噪声大的对话增益最大。
DREAMS — 学术团队用双节点 MCTS 树结构建模对话推荐的偏好演化与利用。
AgentMMRec — 学术团队把 LLM 作为知识整合器与利用器,生成的知识先转为图结构再进入推荐;三个 Amazon 数据集一致提升。
Beyond Ranking Accuracy — Walmart Global Tech 评估 LLM 复购解释的排序价值,LLM 不应作为独立排序器,但可以作为验证过的解释组件。
其他
Modern Transformers — 学术团队提出 RFIS/RPD 指标揭示 RoPE Transformer 中 retrieval 与 positional heads 的完整分类,据此设计 HwH 混合架构。
RATL — 学术团队提出残差检索与反馈校正范式,把检索对象从目标值转为基模型历史预测残差。
SOMTab — 学术团队提出 Set-Order Mamba 架构做表格上下文学习,分离表示构建与查询条件检索,在效率-精度上取得更优权衡。
PMFRec — 学术团队提出个性化多视图联邦冷启动推荐,正交目标消除跨视图冗余,显著减少通信开销。
  • 推荐系统
  • 周报
  • 论文
  • AI周报 2026-W36推荐算法日报 - 2026-09-05
    Loading...