本周推荐系统研究围绕三条主线展开:生成式推荐从单点召回组件走向覆盖排序与推理的工业级框架;CTR 建模范式重新组织上下文单元以对齐真实决策过程;召回侧则在多兴趣与多模态的叠加下重新收敛效率与成本。 主线 1:生成式推荐从“解码物品”走向“统一生成与推理”。 腾讯的 TGR 将生成式范式推进到排序、端到端生成和推理注入三个方向,其中 CCFormer 在五个 A/B 场景取得显著提升;百度 ICGR 把查询意图一致性贯穿 SID 构建、SFT 与偏好优化全链路,线下 Recall@20 提升 21.7%。共同指向是——生成式推荐不再止步于“用模型替代索引”,而是开始重构排序与召回之间的边界。 主线 2:统一 CTR 模型开始以“上下文”为基本单元。 美团 UniCon 把请求上下文当作同质单元,统一历史与目标的结构,线上 RPM 提升 3.09%;字节 ReST 则在行为序列上验证了 LLM 式 Transformer 在基准上饱和后仍可沿推荐原生设计继续扩展。两篇的共同指向是——推荐特有的信号噪声与计算不对称需要架构级的重新设计,而非简单搬用 NLP 缩放法则。 主线 3:召回侧的成本意识回归。 Snap 的 SetMIR 把多兴趣召回建模为集合预测,用 presence score 动态削减 33% 的 ANN 查询;同一团队的 CAMIE 用单个多模态编码器替换碎片化的 I2I 检索栈;Mubadala 的 PULSAR 用两阶段池化索引把中位向量检索延迟降低 15.1 倍。三者的共同逻辑是——召回的性能度量不再只有准确率,查询预算和索引体积正在成为一等的优化目标。
本周推荐系统研究围绕三条技术主线展开:语义 ID(Semantic ID)的工程化打磨进入深水区、检索系统从"静态管道"转向"查询自适应"、以及 LLM/Agent 在推荐链路中的角色从"增强组件"演化为"闭环决策者"。 主线 1:语义 ID 从"能生成"走向"能用、好维护、不漂移": 快手的两篇工作分别从码本结构和动态更新入手——单级大码本替代多级残差量化,把三级 SID 压成两级,自回归解码 FLOPs 降了 47.93%-48.70%,在线消费指标 +0.792%;TAGR 则针对直播广告场景设计了动态语义 ID(LSID),进房率 +8.5%、收入 +16.1%。腾讯的 Tlow 用 flow-based 变换替代 RQ-VAE 解决码本依赖问题,在微信多模态检索中 CTR 提升 10.32%。三篇工作共同指向一个判断——SID 的工程稳定性(而非生成准确率)已经成为落地瓶颈。 主线 2:检索效率从"一刀切"转向"查询与场景自适应": Alibaba 的 TransRetrieval 用加权平均聚合解决特征异质性导致的 token-norm 发散,在 40 亿交互数据集上验证了 log-linear scaling,线上收入 +2.53%。AdaWidth 则更进一步——为不同查询动态分配不同维度的嵌入宽度,在 6 个任务上以 55%-84% 更少的维度持平 SOTA 的 NDCG@10。VK 的多哈希用户嵌入将 ID 嵌入表缩减 98%,单节点时序邻居采样成本从 O(deg(v)+k) 降到 O(log(deg(v))+k)。效率优化的粒度正在从"系统级"下探到"查询级"。 主线 3:LLM/Agent 从"推荐引擎"走向"系统自我进化的驱动者": Alibaba 的 Astar 把"提出演化方向"这个此前依赖资深专家的环节交给模型——Astar-8B 在真实执行评估中单次提案成功率 0.6786,是人类专家(0.3229)的两倍。PayPal 的 SCOUT 则把 MCP 工具暴露重构为上下文选择问题,工具 token 消耗从 140.2k 降到 1.3k(降 99%)。这两篇都指向同一个趋势:LLM 不再只是推荐模型的一部分,而是开始接管推荐系统自身的迭代过程。