按主题¶
采用“研究方向 → 方法簇 → 论文”的两级结构。同一篇论文可以出现在多个方法簇下; 每次出现都独占一行,并说明它与该方法簇相关的主要机制。
展示层生成与个性化¶
标题与展示内容优化¶
- GESE:集合级生成探索后按请求上下文选择标题。
排序与长序列建模¶
预训练与参数高效迁移¶
- LazFormer:可迁移生成式预训练与轻量排序残差适配。
大模型能力与推荐融合¶
LLM / Foundation model + Recommendation¶
- ConnectionMind:让 LLM policy 在 typed 社交图上逐步扩展证据路径,并以 SFT、GRPO 和 GNN 蒸馏兼顾推理质量与流量成本。
- DREAM:以 LLM Meta Engine 将三层用户意图编译为安全的推荐策略覆盖,并通过 Reward Dual Loop 持续沉淀有效结论。
- Netflix GenRec:把用户历史、内容和请求上下文文本化,以 LoRA 后训练 causal LLM,再由 catalog-aware head 输出全目录分数。
- Open Web UFM:在开放网页行为上联合双裁剪对比学习与 next-item 目标预训练共享 user encoder,再迁移到广告 CTR 和访问率任务。
- RecoReward:用行为推荐器产生 RAS reward 来优化多模态内容描述,但 serving 不读取用户行为。
- Melo:将 LLM 音乐 Agent 与实体 grounding、检索校验和反思重试组合为生产 playlist 流程。
- EGR:以同一 LLM 表征 item 索引与用户查询,并联合 item representation learning 和 next-item prediction。
- RECAP:用 causal Transformer 更新固定容量语义画像,再通过双塔反馈评价器与 GRPO 让画像直接服务未来推荐。
- RecGPT-V3:让 LLM 读取可演化用户记忆并联合生成文本/SID,再以 latent token 重建蒸馏与排序反馈降低显式推理成本。
- Prompt Generation:把异构推荐特征转成 Qwen 生成提示,并通过 token 压缩与配置化合并完成召回。
- Apple Music ELISE:将多语言语义向量召回与 token index 通过分位数匹配融合。
- NEXT:训练面向推荐的 8B VLM 生成 next-intent query,并把高置信 directed edges 离线物化为 NKG。
- TokenMinds:把观看、搜索与场景信号编码为稠密用户向量和 SID 用户 token,以双输出和 multi-context decoding 支持下游排序与跨场景复用。
- Atomic Intent Reasoning:用大模型离线拆分层级原子意图,在线只检索和聚合缓存意图链。
- ToolRec:为大模型助手显式校准工具相关性与调用成本,抑制无效工具触发。
- Pinterest Complementary LLM Predictor:对广告主列表进行 SFT/GRPO,让 LLM 补充传统召回和排序特征。
- L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation:用个性化双视图 LoRA-MoE 分别适配语义和行为,再自适应融合。
- MuChator:从多轮会话发现潜在推荐意图,并融合显式与隐式反馈更新候选。
- AKT-Rec:用真实 LLM 对齐物品共现和用户兴趣,再以 Semantic ID 支持面向长尾的非对称知识迁移。
- HARNESS-LM:通过强 teacher、L2 embedding alignment 与冻结文档索引精修构造非对称轻量检索器。
- TubiFM: Unified Item, Carousel, and Search Ranking for Streaming Discovery:以统一 user story 和任务提示让同一模型完成 item、carousel 与 search 排序。
- LLM Retrieval:用 domain SFT 生成层级广告属性,构建语义图并约束召回稳定性。
- FLUID:用多模态大模型编码直播切片,经 RQ-KMeans 与 prefix n-gram 形成 LUCID,最终移除候选 item ID。
- MM-LLM:把多模态内容转为 LLM caption/token 特征,再注入推荐排序模型。
- UniVA:以 Commercial SID 和 generation-as-ranking 统一广告生成,再用价值对齐 RL 优化收益。
- RecGPT-Mobile:用端侧 LoRA+INT8 LLM 将近期行为生成为下一意图 query,并依据意图漂移按需触发推理。
- Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations:从中间层抽取任务相关表征,显式解耦推荐适配与低维压缩。
- LWGR:把个性化 soft instruction 注入 LLM 世界知识,并用拉格朗日约束完成分数融合。
- SOLARIS:预测未来请求并异步缓存 foundation-model latent,把大模型计算移出线上请求路径。
- Cross-domain KD:把源域大模型知识蒸馏到目标推荐域,实现零样本跨域迁移。
- IDProxy:把多模态 LLM 内容表征对齐到协同 item-ID 空间,再通过多层 proxy 和 gate 注入工业排序。
- SIGMA:用 LLM 做多视角 grounding,并以混合 SID/ID token 训练七任务生成模型。
- Generative Pseudo-Labeling for Pre-Ranking with LLMs:LLM 为未曝光候选生成伪标签,线上预排序器不增加 LLM 时延。
- RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems:用真实排序模型偏好指导潜在 query 的 SFT 与 DPO 对齐。
- S-GRec:用 LLM 个性化语义 judge 产生偏好监督,再以 A2PO 蒸馏到轻量生成器。
- Self-Evolving RecSys:本地指令 LLM 读取实验 journal,逐轮选择未尝试的优化器、门控与 reward 配置,再以 validation 反馈晋级。
- Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment:以 RAG、SFT 和 DPO 同时优化补全相关性、安全与 groundedness。
- LLaTTE:用 BERT 语义特征、MLA 上游压缩、候选感知在线 attention 和 DHEN 门控连接多阶段序列。
- RecGPT-V2:以层级 multi-agent、meta-prompt 和约束偏好 RL 生成淘宝用户意图标签与解释。
- CRSD:用领域 LLM 产生标签与 reasoning 视图,通过同一学生的双视图对比自蒸馏把推理能力压入低延迟排序模型。
- PLUM:对 LLM 进行推荐语料 CPT 与 SFT,再以 Semantic ID 生成物品序列。
- PinFM:构建推荐 foundation model,并通过预训练—微调适配多个流量场景。
- FilterLLM:让 LLM 从新品文本直接预测用户词表分布,避免逐候选判断。
- SERAL:用 LLM 认知画像表示用户兴趣,再通过 IPO 与 nearline 链路优化惊喜度推荐。
- LUM:通过 next-condition-item 与 group query 学习用户知识,再把生成表征注入判别模型。
- MIM:多模态内容预训练和内容兴趣感知 SFT 把协同偏好对齐到内容空间。
- MSD:把 teacher 知识自回归蒸馏到 student,并用 LoRA 对齐 CTR 目标。
- PRECISE:联合 LLM 语义 token 与协同 ID,通过 top-k MoE 和两阶段训练建模用户序列。
- LEADRE:以意图感知 Semantic ID 表示广告,并用 DPO 对齐展示与转化偏好。
- LEARN:冻结 LLM 生成内容增强表征,并用协同域适配改善冷启动。
- BAHE:缓存原子行为的浅层语言编码,只在线执行高层行为聚合。
- LSVCR:用 LoRA 学习 LLM 偏好,再通过 SSC/VCC 双序列目标对齐评论与行为。
- NoteLLM:把内容压缩到特殊 token,以 GCL 注入协同信号,并用 CSFT 保持生成能力。
- BEQUE:生成 query rewrite,并用离线反馈、自采样和 PRO 优化改写质量。
- KAR:让 LLM 生成用户偏好和物品事实知识,再由 hybrid-expert adapter 融合进推荐器。
- M6-Rec:把多种推荐任务统一成自然语言形式,并以 option-adapter 轻量适配预训练模型。
生成、排序与冷启动¶
- ANGLE:以层次文本标识、三目标联合训练和请求侧动态约束实现一步广告检索。
搜索、召回与长期价值¶
- MIMA:用同请求多正例与排他一对一匹配显式监督互补兴趣,并以 activation routing 校准召回通道。
- VK Friend-GNN:以多哈希共享表压缩超大用户 embedding,并用时序邻接与 cutoff 避免邻居采样泄漏未来边。
- DCEO:用直接因果效应替代短期相关性代理,并以动态多目标权重优化长期用户价值。
- TransRetrieval:通过 target-token 压缩、多域参数化与深层 Transformer 扩展工业检索。
- Policy-Grounded Dynamic Facet Suggestions:离线构建 facet taxonomy,在线按 query/member 召回并在策略约束下排序关键词。
- HILL:用跨层 residual quantization 学习 coarse-to-fine 检索索引,减少候选打分量。
- GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce:联合生成搜索分面和改写 query,再以检索满意度执行偏好对齐。
生成式召回与端到端推荐¶
- TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning:统一分层语义 ID 生成、列表排序和离线 reason token 注入,在一套框架中覆盖生成与推理。
- TAGR:用稳定两级语义/协同 ID、多尺度用户兴趣和行为价值门控,在直播广告中生成兼顾相关性与商业价值的候选。
- From a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation:用曝光加权动态大码本替代多级小码本,并保留独立碰撞码以缩短 SID 解码。
- Sona:以历史压缩、层级 Semantic ID 生成和 item ranking 统一原有音乐推荐级联。
- MetaStrategy:让 LLM 产生 typed ranking strategy,再由确定性 compiler 执行请求级多目标排序。
- PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation:先生成可服务 SID,再按需生成可解释 copy,并在在线侧融合两种表示。
- Gryphon-v2:共享生成和排序 encoder,以当前 rollout 与真实曝光双路 teacher distillation 统一召回、预排和精排。
- HRPO:将序列总奖励拆成层级 Semantic ID 前缀的 residual credit-to-go,以细粒度组相对更新改善生成推荐轨迹。
- SnapLGR:以共参与 PPR 监督 residual SID,并经 token grounding 与序列 SFT 生成内容。
- OxygenREC-v2:以目标行为 instruction 直接控制 SID 候选生成,再以训练期未来交互做熵感知自蒸馏。
- UniR²:把用户 prefix、SID 轨迹和 item features 放入单一 decoder,以 DQ-PCA 和 ranking-only LoRA 同时完成生成召回与多目标排序。
- Dual-purpose Semantic IDs:以分层协同 SID 统一检索 token 与可重建的内容 embedding,减少推荐模型 I/O。
- EGR:共享向量空间原生支持 item indexing 与 query retrieval。
- BARGE:以 ICA 保留 item 内多 token 结构,用 HPR 修正逐层 beam 漂移,并融合两个正交量化通道的候选。
- TSGR:用 residual semantic prefix 和并行价值码同时表达商品语义、全局价值与 query 条件价值,再联合训练 VRM。
- RecGPT-V3:用两级 RQ-VAE 建立 SID 模态,联合记忆驱动意图与 latent reasoning 生成可直接检索的商品标识。
- NONTP:用 EMA 未来状态对比和跨域池化补充 NTP 监督,并在推理时移除全部辅助分支。
- Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap:把时空历史编码为 SID,并以课程训练和长期反馈优化下一 POI 生成。
- Prompt Generation:把异构特征压缩为生成提示,并以配置驱动方式支持多种召回合并策略。
- CMSL:以可学习 lenses 切分多兴趣 strand,再使用 HSTU 生成推荐结果。
- Recommendation as Generation:以解耦 Semantic ID 让推荐意图可同时驱动候选选择和个性化视频生成。
- G2Rec:联合 soft graph 与生成式双目标学习结构化用户—物品关系。
- SSRLive:用静态/动态 Semantic ID 和用户—直播间交叉模块生成可随实时状态变化的直播表示。
- DeGRe:用离线前瞻列表价值产生 dense prefix labels,再蒸馏到低延迟在线生成器。
- From Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark:把 query-item 联合序列交给 Linear HSTU,并融合稀疏交叉特征做生成式搜索。
- GrowthGR:把新品长期 uplift 纳入生成式召回 reward,以 MoPO 平衡即时和长期价值。
- CQ-SID:以类目约束残差 Semantic ID 缩小生成空间,再由专家奖励引导 group-relative 策略更新。
- UniVA:使用 Commercial SID、generation-as-ranking 和价值引导 trie beam 生成广告候选。
- GloRank:全局 SID action space、listwise SFT 与组相对奖励共同优化全库生成重排。
- Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale:依据碰撞负载、语义相容性和训练阶段动态调节 SID 重叠约束。
- GenRec:把整页作为 NTP 目标,并以 GRPO-SR 和 NLL 约束联合优化 page policy。
- LWGR:把 LLM 世界知识与推荐分数做约束融合,生成兼顾相关性与知识性的候选。
- UniRec: Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute:先生成属性链再生成容量受限 SID,并以 RFT/DPO 对齐业务目标。
- MBGR:以 business-aware SID、共享专家和动态标签路由联合多个业务生成目标。
- RCLRec: Reverse Curriculum Learning for Modeling Sparse Conversions in Generative Recommendation:把转化相关行为逆序组成短课程,为稀疏转化增加中间监督。
- GateSID: Adaptive Gating for Semantic-Collaborative Alignment in Cold-Start Recommendation:用冷启动感知门控动态融合语义 SID 与协同行为信号。
- AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation:组合 Direct/Reasoning query 生成、IL-GRPO 与混合在线服务。
- GLIDE:用 residual Semantic ID 与长短期双 prompt 直接生成召回候选,强化非习惯内容探索。
- Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale:按业务资格信号设定碰撞 margin,提升冷启动 SID 可辨识度。
- GRC:用结构化反思标签、轨迹 GRPO 和熵调度纠正 Semantic ID 自回归错误。
- GR4AD:结合用户感知 Semantic ID、LazyAR 和可变长度生成完成广告召回。
- SIGMA:以多视角 grounding 和混合 SID/ID token 进行多任务生成式推荐。
- MFLI:把语义、新鲜度等多个索引 facet 联合学习,并以请求相关 allocation 完成快速召回。
- Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following:将多步消费前瞻蒸馏到单步召回,并在注意力内注入业务指令。
- S-GRec:用 LLM judge 生成个性化偏好监督,再通过 A2PO 蒸馏到 SID 生成器。
- DiffuReason: Bridging Latent Reasoning and Generative Refinement for Sequential Recommendation:将 Thinking Tokens、扩散去噪和 GRPO 组成端到端序列推荐。
- PIT: A Dynamic Personalized Item Tokenizer for End-to-End Generative Recommendation:按用户动态组合 item token,使生成式推荐的语义 ID 同时表达个体偏好。
- DOS:以协同/语义双流和正交 residual quantization 对齐 SID codebook 与生成空间。
- OneMall:以场景 prompt、Semantic ID 和跨行为融合统一多个电商生成推荐场景。
- S2GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation:把语义引导逐步写入潜空间推理,增强生成式推荐的中间决策。
- PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations:以过程奖励监督生成式推荐的中间推理,而非只依赖最终命中。
- HiGR:通过层级 Semantic ID、粗到细 slate decoder 和 ORPO 生成整组推荐结果。
- DualGR:以长短兴趣路由、约束 SID 前缀和曝光惩罚改善生成召回。
- IntSR:用显式 query、隐式会话意图与时间上下文统一搜索和推荐生成。
- OnePiece:在级联推荐中加入 context token、块级 latent reasoning 与渐进多任务训练。
- OneRec-V2:用 lazy decoder 提升生成效率,并通过真实反馈 RL 与 GBPO 优化序列。
- GenRank:把点击、互动等动作编码成生成目标,以 action-oriented generation 完成排序。
- PinRec:根据目标 outcome 条件生成多 token 物品表示,直接完成召回。
- COBRA:级联稀疏生成与稠密生成,在逐级缩小空间的同时保持精排能力。
- OneRec:把推荐建模为 session Semantic ID 序列生成,并用 MoE 与偏好优化对齐反馈。
- SessionRec:按 session 自回归生成候选,并结合曝光负例与 hard negative 训练。
- LEADRE:生成意图感知 Semantic ID,并用 DPO 对齐广告序列的业务偏好。
- HSTU:用分层顺序转导单元和生成式目标统一超长序列推荐。
- TIGER:先用 RQ-VAE 构造层级 Semantic ID,再自回归生成目标物品。
排序网络与长序列¶
- ChronicleRec:以非均匀历史合并、因果 query 锚点和多 horizon alignment 生成可缓存的长期用户 token。
- From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs:用双门控时序编码抑制行为噪声,并将重型用户编码与轻量候选交叉解耦,实现请求内共享计算。
- OneModel:将推荐、广告与商家混合行为映射到共享序列模型,并以 SAIM 场景门控兼顾迁移和专门化。
- DrEM:在 logit 扰动下反演 pair-label 翻转风险,并以一致性融合降低多目标排序漂移。
- IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation:让多个业务任务在长短双流的不同层级执行交互查询,而非仅共享底层编码。
- Netflix GenRec:用 prefill-only LLM 取代逐 token 解码,联合 catalog head、language loss 和 reward-weighted ranking loss 执行大目录精排。
- TM20K:教师保留完整历史,学生把连续行为合并到固定 token 预算并蒸馏注意力。
- TransX:离线缓存行为流,在线候选只对 global-local cache 做 cross-attention。
- CCFormer:以字段分离的 ID/content 编码和门控融合增强冷内容泛化,再分层压缩远期 token、保留近期行为细节。
- HA-MoE:用内容异构性控制多门控 MoE,在同一排序器内平衡通用与领域专长信号。
- ROCS:把 request-side encoder 与 candidate-side late interaction 解耦,使同一表征路径覆盖大候选检索和精排序批量打分。
- ClockRoPE:从周期 kernel 的 Fourier 变换采样旋转频率,让 attention 同时识别 recency 与日/周 routine。
- TWICE:以点击/转化双时钟和单调 delay CDF 处理长期转化反馈未成熟问题。
- CORE:将有序相关性拆成 High/Non-High 与条件 Mid/Low 两道边界,并把 step-GRPO reasoning 经 PostCoT 蒸馏给在线双头排序器。
- Mosaic:把不同归纳偏置的 user embedding 作为可独立演进的 specialist fleet,用 MRM 复合监督和去冗余损失增加下游有效信息。
- SpecFormer:以可学习谱软化和谱残差位置编码缓解 embedding/attention collapse。
- YouTube Freshness:联合训练去偏与 serving 探索,专门改善新发行内容的曝光反馈闭环。
- WHALE:逐层耦合 Wukong 高阶交互和门控 HSTU 序列状态,避免双分支只在末端融合。
- Long-History User Transformers:把长历史异步压缩成固定缓存,线上只运行近期事件 Transformer,兼顾历史容量与实时延迟。
- TMallGS:对异构字段使用独立 QKV、噪声门控、FiLM 和 progressive loss,统一特征交互与序列建模。
- DANet:联合兴趣网络、折扣时频表征和用户/促销分布修正预测转化率。
- MESH:用异构模块塔、信号放大与 RGBC 缓解 fresh/tail 梯度被头部内容淹没的问题。
- SAM:预测品类补货周期并动态屏蔽购买前已满足意图,降低购买后重复推荐。
- SlimPer:以固定 knowledge slots 反复访问原始用户 token,把逐层状态从序列长度中解耦并支持 request-only 共享。
- ZoRRO:无需训练,用 recency、semantic 和 category 关系直接排序新闻候选。
- UniFormer:在特征空间和任务空间中组织统一语义 token 与交互模块。
- JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling:统一编码长短 guest journey 与事件时间,在生产搜索中替代手工序列特征。
- OneRank:将结构特征、任务 token 和任务私有通道放入同一 Transformer-native ranking 架构。
- Memento:用 query-conditioned MMR 动态平衡相关性与多样性。
- Effective Knowledge Transfer for Multi-Task Recommendation Models:按任务相似度把 CTR 知识迁移到多个 CVR 塔,并抑制难例负迁移。
- Semantic-Native Long Sequence Modeling:以层级语义 ID、bigram、时间折叠和 global-local pooling 扩展视频长历史。
- RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems:随机置换多 embedding、全局 token 和任务解耦共同提升表征有效秩。
- UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking:以 Entire-Space 数据和分层异构融合协同扩展搜索排序模型。
- HAP:按候选难度分配轻量或强分支并对齐异构预排输出。
- SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders:系统优化 token 化、注意力和 FFN,统一替代工业 DLRM 排序。
- OneRanker:用 fake item token 和一致性损失统一 generation/value/ranking。
- Beyond the Flat Sequence: Hierarchical and Preference-Aware Generative Recommendations:以 session 层级预训练和偏好引导稀疏注意力建模长行为序列。
- HiSAC:用层级投票压缩超长历史,再以 query-conditioned soft routing 选择兴趣 agent。
- ULTRA-HSTU:以半局部 attention、LBSL 逐层扩窗和 Mixture of Transducers 扩展 16k 用户历史。
- MixFormer:在统一网络中融合 dense 特征交互和序列建模,并按预算选择训练模块。
- An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking:用工业长序列推荐器重写 LinkedIn Feed 排序与服务链路。
- Compress, Cross and Scale: Multi-Level Compression Cross Networks for Efficient Scaling in Recommender Systems:分层压缩并交叉低维特征,在受控计算量下扩大推荐网络容量。
- Compute Only Once: UG-Separation for Efficient Large Recommendation Models:拆分用户侧与通用计算,使大规模推荐模型复用只需计算一次的表示。
- Kunlun:在每层组合 GDPA Transformer 与分层 seed/global interaction block,并以 CompSkip 稳定深层训练。
- MDL:把 feature、scenario 和 task token 化,让领域与任务参与每层特征交互。
- MSN:把大容量参数放入稀疏 Product-Key Memory,只激活 top-k 槽位控制计算。
- TokenMixer-Large:用 mixing/reverting、双粒度 SwiGLU、interval residual 和辅助监督扩展工业精排。
- Zenith: Scaling up Ranking Models for Billion-scale Livestreaming Recommendation:以 Prime Token Fusion 和 Boost 扩展直播排序模型的深度与宽度。
- Unleashing the Potential of Sparse Attention on Long-term Behaviors for CTR Prediction:组合全局、转移和局部稀疏注意力,建模千级长期行为序列。
- HyFormer:联合用户序列与 query decoding,通过 query boosting 强化搜索排序。
- OneTrans:用统一因果 Transformer 覆盖多场景排序,并复用 KV cache。
- ARGUS:分解用户反馈与物品表示,在 Transformer 中建模超长音乐序列。
- RankMixer:交替使用 token mixing 与逐 token FFN,并探索稀疏 MoE 扩容。
- Click A, Buy B:联合 CABA/CABB 分支和商品 taxonomy 重构电商转化归因。
- MGOE:把多任务相关性编码成宏观图,再由 graph experts 和任务塔联合预测。
- TransAct V2:以候选感知终身序列和 next-action 多任务目标增强排序。
- SORT-Gen:以 causal ordered regression 学习列表前缀的 CLICK/PAY 价值,通过多目标队列和内嵌 MMR 生成最终重排列表。
- LONGER:结合混合注意力、InnerTrans、token merge 与 KV cache 扩展超长序列。
- FuXi-α:用多通道注意力和 multi-stage FFN 扩展特征交互模型容量。
- AdaF²M²:用 feature-mask 多次前向和 state-aware adapter 改善特征学习与状态适配。
- TWIN-V2:把百万级生命周期行为离线压缩为层次兴趣簇,再以候选相关粗搜和精确注意力恢复原始行为信号。
- CWM:估计统一时长干预下的反事实观看收益以抵消 duration bias。
- PLE:把共享与任务专属 experts 分开,并以 CGC gate 渐进抽取多任务表示。
- DCN-V2:使用低秩专家混合显式构造特征交互,并与 deep tower 联合排序。
- SIM:用候选条件 GSU 从超长历史中搜索相关子序列,再由 ESU 计算精确候选—行为交互。
- BST:让 Transformer 联合编码候选商品与带位置的行为序列。
- DIEN:用辅助监督抽取兴趣状态,再让候选相关门控驱动兴趣演化。
- SASRec:以因果自注意力编码行为序列,并预测下一物品。
- MMoE:共享一组 experts,但由每个任务的独立 gate 学习不同专家组合。
- ESMM:用 CTR 与 CTCVR 的 entire-space 联合目标学习 CVR,避免只看点击样本造成选择偏差。
- DIN:使用候选感知局部激活从历史行为中提取相关兴趣,是经典 CTR 排序结构。
- DeepFM:让 FM 二阶交互与 deep 分支共享 embedding,端到端覆盖低阶和高阶特征组合。
- YouTube DNN:把观看历史聚合为用户向量并经非线性塔变换,以 item embedding 点积完成候选召回。
- Wide & Deep:联合显式 wide 交叉与 deep 表征,是工业精排从线性模型向深度模型过渡的经典骨架。
冷启动与语义-行为对齐¶
- LLM Thompson Priors:把 LLM 对新评论质量的语义判断编码为分群 Beta 先验,再让真实曝光反馈逐步覆盖先验。
- PinEqualizer:在 corpus、召回、排序和 utility 全漏斗识别 fresh 内容瓶颈,以内容特征、engagement dropout、cohort calibration 和 UCB 打破曝光反馈回路。
- Pin-SCALE:以 engagement-aware residual codebook 和多视角对齐把 Semantic ID 接入判别式召回。
- Proximity Features:以自适应群体地理 key 聚合行为,为匿名和首次访问用户提供冷启动特征。
- Taiji:自适应融合语义匹配与协同信号,在冷启动覆盖和成熟内容精度之间选择 Pareto 工作点。
- LLM Retrieval:生成 creative 层级语义属性,并用 primary/shadow 机制稳定广告召回。
- SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search:以层级 SID、目标感知 HID–SID 门控和兴趣对齐增强长尾泛化。
- PinCLIP:把图文 contrastive learning 与 Pin-Board 共现邻居对齐,改善 fresh 内容表示。
- Podcast MTL:共享 organic stream 与 ads/promotion 表征,把高资源任务知识迁移到冷启动 podcast。
- SaviorRec:用行为监督训练内容 encoder,生成 RQ Semantic ID,再通过多行为模块对齐冷启动物品。
- PRECISE:联合 LLM 语义 token 与协同 ID,并针对冷启动物品进行序列预训练。
训练目标与决策优化¶
采样、蒸馏与强化学习¶
- LLM Thompson Priors:用 LLM 初始化分群 bandit 先验,并由 Thompson Sampling 在持续反馈下完成可校正的冷启动决策。
- KGD:以 BMTP 和冻结知识分支保留可刷新的预训练信息,并用正交 ACR 控制它与协同几何的干扰。
- HRPO:依据层级生成前缀的后续收益分配 residual credit,使组相对策略优化不再只依赖整序列标量奖励。
- RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems:用 bandit 在有限预算下路由候选结构实验,并把验证反馈写回下一轮。
- From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation:从真实反馈发现生成策略,再用双空间关系蒸馏到轻量线上排序器。
- ASARL:用多 Agent 校验与补齐长尾 relevance 数据,执行 SCT、交互偏好优化和在线 student 蒸馏。
- Reward Guided Decoding:用 reward 对生成先验做指数倾斜,并以 KL 温度限制策略偏离。
- RAMP:以富个性化路径为 teacher,通过 feature mask 和 KL alignment 改善仅有公共字段的流量。
- UAME:利用 Gaussian 排序不确定性识别多 pxtr 冲突样本,并自适应提高高偏差 pair 的训练权重。
- Downstream Rewards:先筛选预测长期参与度的候选奖励,再将独立 reward heads 与即时目标联合优化。
- Cluster GOOBS:用在线聚类感知的 sampler 扩大样本覆盖并缓解头部集中。
- SCALR:学习跨域条件分布并概率采样合成训练事件,替代覆盖度较低的确定性 top-k 翻译。
- Rec-Distill:结合 batch/stream teacher,把大模型知识蒸馏到轻量 student。
- Pinterest Complementary LLM Predictor:先用 SFT 学习广告主列表,再以 GRPO 奖励优化列表质量。
- Stochastic Primal-Dual Decoding:在逐 token 解码中同步更新随机约束乘子,以无需重训的方式控制序列级业务目标。
- MDCNS:从多种负样本分布协同采样,并通过双模型交替更新减少偏差。
- UniVA:在请求内归一化 eCPM reward,并交替执行监督学习与强化学习。
- AgenticRecTune:用 Actor–Critic 生成和审查配置,以 Online agent 回收实验反馈并由 SkillHub 跨轮复用。
- LWGR:用 reference confidence 约束融合结果,并通过 primal-dual 更新拉格朗日乘子。
- Cross-domain KD:把源域 teacher 知识蒸馏到目标域,减少跨域冷启动监督需求。
- SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search:用满意度奖励和双重相对优势优化短视频搜索多任务融合。
- GR4AD:通过 RSPO 优化可变长度广告生成,并结合 LazyAR 降低推理成本。
- S-GRec:只采样少量 PSJ 反馈,并用 advantage 符号门控和幅度约束稳定 A2PO。
- DRL-PUT:使用 logged propensity 和策略梯度自动调节广告排序 utility 权重。
- MPFormer:目标 token 与动态 quota 让多任务检索共享训练/serving 资源。
- OneRec-V2:利用真实时长反馈和 GBPO 对生成序列进行强化学习。
- SERAL:通过 IPO 对齐惊喜度偏好,并在 nearline 链路应用认知画像。
- LEADRE:使用 DPO 对齐 Semantic ID 生成与广告转化偏好。
- BEQUE:结合离线检索反馈、自采样和 PRO,优化生成式 query rewrite。
因果推断与长期价值¶
- From Prediction to Incrementality:估计潜在结果差与不确定度,在同一触达预算下优化增量价值。
- SWAG:把七日滑窗长期目标编码为 future plan,并门控影响当前广告 bid。
- Adaptive Ad Load Design for Sponsored Search Markets: Evidence, Theory, and Deployment:从随机现场实验学习收入—转化曲线,再按请求动态选择广告数量。
- Downstream Rewards:筛选能预测未来参与度的长期 reward,再以独立 reward heads 注入多个推荐 surface。
- Causal Retrieval:用 doubly-robust uplift 估计触发 shopping candidate generator 的增量收益,并同时考虑召回成本。
- Causal Representation Learning for Generalisable Recommendation:从表征中残差化环境混杂信号,保留可跨环境迁移的因果偏好。
- PEARL: Unbiased Percentile Estimation via Contrastive Learning for Industrial-Scale Livestream Recommendation:通过多样本对比估计低方差行为 percentile,并扩展到多个直播目标。
- DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems:冻结成熟 watch-time 模型,学习分布感知乘性残差且保持服务接口不变。
- GrowthGR:把新品长期 ItemLTV 纳入生成式召回 reward,平衡即时反馈与长期价值。
- PA-Bridge:约束主动搜索与被动推荐的分布距离,并保留两域各自可辨识的偏好信号。
- A Long-term Value Prediction Framework In Video Ranking:组合位置去偏、会话归因与作者周期任务建模长期价值。
- Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning:通过功能角色和反事实转化路径寻找能激活休眠用户的桥接物品。
- Jointly Optimizing Debiased CTR and Uplift for Coupons Marketing: A Unified Causal Framework:联合学习去偏 CTR 与因果 uplift,并显式估计 treatment 和 counterfactual 响应。
- Hierarchical Contextual Uplift Bandits for Catalog Personalization:用层级上下文 uplift bandit 在目录个性化中学习增量收益。
多阶段排序与混排¶
实时序列与 listwise 重排¶
- SequenceO1:将远期超长历史压成固定预算 prototype sketch,再与近期行为分支融合。
- POEM:用当前请求的多路 rank signal 构造偏序序列,补充纯时间历史。
- PIANO:query-driven interest refiner 选择相关历史,information node 汇总候选列表并条件化 item score。
召回、粗排与精排协同¶
- UniRec:联合预排与精排融合,以纵向偏好对齐、紧凑 pairwise 聚合和组相对正则协调级联阶段。
- SPEAR:以双 embedding 和乘法选择门把 query rewrite 与 item relevance 端到端对齐,同时保留原 query residual。
- STEPS:以 planning、execution、filter 三 Agent 联合决定推送动作和下一次系统唤醒时刻。
- ROCS:把 request-side encoder 与 candidate-side late interaction 解耦,使同一表征路径覆盖大候选检索和精排序批量打分。
- OneShot:把索引 assignment 与排序目标共同训练,再在命中路径内执行比点积更强的 neural scoring。
- SlimPer:以固定 knowledge slots 反复读取用户历史,让 request-only 表征可跨候选复用,再进行候选相关精排。
- CS3:在保持双塔 ANN 召回兼容的前提下,通过循环修正、跨塔同步和级联教师增强交互能力。
- COBRA:先执行稀疏生成缩小候选空间,再用稠密生成细排,形成级联召回—排序路径。
重排、混排与多目标页面决策¶
- Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs:以统一语义-协同 ID 生成整张 slate,再用列表反馈做保守策略对齐。
- DEGR:用 cohort 内 embedding 多样性、adaptive reward ORPO 和 greedy selection 控制跨曝光重复。
- Twitch Multi-Objective Ranking:以 fresh/delayed 标签、生命周期 gate 和共享专家统一直播场景的多目标排序,显式平衡即时互动与滞后价值。
- DIRECTOR:以最优运输协调位置分布,再用硬全局匹配消除重复候选。
- PSG:将两个有序 item 编成 pair token,使六 item slate 仅需三步生成。
- LLM-Based Re-Ranking for Real Estate Search:结合对话需求、房源属性、文本描述与候选集合统计执行 LLM 重排。
- GenPage: Towards End-to-End Generative Homepage Construction at Netflix:用一个模型直接生成整页,并以长期用户奖励和业务约束进行后训练。
- Pinterest Complementary LLM Predictor:把 LLM advertiser prior 与常规候选按 validation 选择的 quota 混合,再作为排序特征使用。
- DeGRe:将离线 lookahead 的列表价值蒸馏为在线 dense prefix labels,降低生成式重排延迟。
- Memento:用 query-conditioned MMR 在相关性和多样性之间动态调整混排权重。
- A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems:以双头 Q 网络和 Pareto 扫描选择可治理的个性化多目标 utility 策略。
- GenRec:把整页结果作为生成目标,并联合 page reward 与 NLL 约束优化页面级决策。
- Dual-Rerank:AR 教师刻画顺序依赖,NAR 学生并行推理并联合列表效用蒸馏。
- Constraint-Aware Generative Re-ranking for Multi-Objective Optimization in Advertising Feeds:在自回归重排中直接执行约束感知奖励剪枝。
- Rethinking Multi-objective Ranking Ensemble in Recommender System: From Score Fusion to Rank Consistency:用关系感知注意力和一致性约束协调多阶段工业排序。
- DRL-PUT:利用 logged propensity 和策略梯度自动调节广告混排 utility 权重。
- SORT-Gen:以 ordered regression 估计列表前缀价值,再按 CLICK/PAY 队列、mask 和 MMR 生成混排结果。
- CDM:用 MMR 教师生成可控多样性列表并蒸馏上下文边际收益。
内容理解、审核与风险控制¶
内容理解与语义表征¶
- CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval:用共同互动商品对训练对称多模态向量,使内容表征同时保留用户旅程中的行为相似性。
- Multimedia Asset Personalization via Multimodal Embeddings at Netflix:把冻结多模态 embedding 接入统一资产双塔,并用查询相似度增强搜索画布打分。
- DME:以对比预训练建立统一向量空间,再用 typed latent reasoning 和双向重建保留检索相关的细粒度多模态证据。
- GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System:通过三元组预训练、GRPO 行为对齐和 ID/多模态门控形成可部署表示。
- FLUID:把直播内容切片量化为两级 LUCID,以内容表示替代生命周期很短的候选 ID。
- MM-LLM:把图像、视频等内容转换为 caption/token 特征,再注入推荐模型增强内容理解。
- TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation:用用户兴趣手册约束细粒度多模态标签,并把生成能力蒸馏到小模型。
- PinCLIP:把图文对比学习与 Pin-Board 共现邻居目标结合,改善 fresh 内容表示。
- IDProxy:把多模态内容先对齐到 item-ID 协同空间,再通过多层 proxy 与 gate 接入排序。
- RQ-GMM: Residual Quantized Gaussian Mixture Model for Multimodal Semantic Discretization in CTR Prediction:以残差高斯混合量化替代硬聚类,用概率语义 ID 增强多模态 CTR。
- SARM: LLM-Augmented Semantic Anchor for End-to-End Live-Streaming Ranking:离线 MLLM 生成语义 anchor,轻量非对称模块注入直播排序。
- MIM:以遮盖多模态预训练和内容兴趣感知 SFT 对齐内容与协同空间。
- PRECISE:联合 LLM 语义 token 与协同 ID,并针对冷启动内容进行序列预训练。
相关性审核与数据质量¶
- ASARL:以 Reason、Critic 和 Gen Agent 审核、修复长尾 relevance 数据,再蒸馏到线上 student。
- CORE:把 High/Mid/Low 相关性拆成级联边界,用 step-GRPO 训练 reasoning 后蒸馏给在线审核/排序头。
- MESH:通过异构塔与 residual gated bias correction 防止 fresh/tail 内容信号被头部样本淹没。
- Cluster GOOBS:用在线聚类感知采样扩大训练覆盖,降低头部内容对数据分布的支配。
隐私、策略约束与风险控制¶
审核风控覆盖边界
当前实现主要覆盖相关性审核、训练数据质量、隐私受限特征与策略约束;内容安全、 作弊/欺诈和广告合规仍是明确缺口,不能用相关性模型冒充已实现。
- SIRF:通过 EntiGraph、MAGA 与账户级 CoT 合成长尾规则训练数据,把 trigger/exemption 关系内化进风控模型并按 P95 门槛出 verdict。
- RAMP:训练个性化/公共双路径,并用 feature mask 与预测对齐适配隐私受限和字段缺失流量。
- UAME:显式建模多目标不确定性和标签冲突,降低高分歧样本对排序策略的风险。
- Causal Retrieval:用 doubly-robust uplift 同时评估触发候选源的增量收益与调用成本,控制无效干预。
- Proximity Features:以隐私合规的群体地理特征服务匿名用户,避免依赖持久用户 ID。
Serving 与研究基础设施¶
自主研究与反馈闭环¶
- AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems:以多专家评审、证据加权预算和确定性晋级门串联研究、实验与上线评审。
- CORAL:在预算与执行约束下让 LLM 连续提出推荐配置,并以最近实验记忆和生产反馈驱动下一轮优化。
- RecEvolve:以知识库驱动候选提案、隔离实验、critic gate、冠军继承和回滚,形成可审计的推荐自主进化闭环。
Serving / efficiency¶
- ROCS:请求表征只计算一次,候选相关交互延后并批量执行;本地同时报告排序质量和进程内候选评分吞吐。
- Memory Layer:把 cache 纳入模型训练,以 eta=1 writeback 和 always-on 属性表征消除训练服务偏差与冷启动缺口。
- Prompt Generation:训练和 serving 共享特征配置,并通过 event replay 与 token compression 控制延迟。
- NOVA:用四级验证、失败方向和 architecture gradient 提高自动架构进化的有效通过率。
- RankGraph-2:离线预计算 popularity-corrected PPR 并用 cluster index 压缩线上图召回。
- EvoRec:把历史实验蒸馏为可复用 skill memory,使自动研究方法本身跨代进化。
- Pinterest Complementary LLM Predictor:离线批量生成 advertiser prior,线上作为传统候选生成的补充信号。
- UniVA:按请求构造个性化 trie,并用 value-guided beam search 约束有效广告路径。
- CS3:在保持双塔 ANN 兼容的前提下,以循环修正、跨塔同步和教师协同补充交互能力。
- LWGR:在 nearline 阶段缓存世界知识,线上只执行轻量 cross-attention 融合。
- SIGMA:使用 prefix-local item retrieval 和 nearline U2I 控制生成检索成本。
- S-GRec:LLM judge 只在训练期调用,线上仅部署轻量 SID generator。
- OneTrans:在多场景间共享因果 Transformer,并复用 KV cache 加速线上推理。
- OneRec-V2:用 lazy decoder 和并行策略降低生成式推荐延迟。
- RADAR:将高成本全排序移到请求后异步执行,并缓存为下一请求召回候选。
- LONGER:通过 token merge、混合注意力和缓存降低超长序列 serving 成本。
- MSD:把 teacher 知识蒸馏到小模型,并以 LoRA 与缓存表征控制 CTR serving 成本。
- BAHE:缓存原子行为的浅层编码,只在线执行高层序列聚合。
- BEQUE:将检索反馈放在离线训练阶段,线上只保留轻量 query 生成。
- M6-Rec:冻结大部分预训练语言模型,仅用 option-adapter 适配推荐任务。
广告与商业决策¶
- BAFF:用广告排名差和出价差的双轴过滤,降低 RTB A/B 对侧策略造成的训练日志干扰。
- PinDCO:组件专塔预测创意增量分数,PAM 对创意尺寸施加整页像素惩罚,并结合候选预筛和探索反馈。
- CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer:以候选后上下文条件化的 Decoder-only Transformer 统一广告 CTR。
- ML-DCN: Masked Low-Rank Deep Crossing Network Towards Scalable Ads Click-through Rate Prediction at Pinterest:用可学习 mask 与低秩交叉扩大 DCN 容量并保持线上成本中性。
召回、触发与多通道路由¶
- Beyond Co-purchase Relation: Evolution of Complementary Recommendations at Allegro:用 ComCat 互补类别图、类别约束双塔和 Category Adapter 过滤共购噪声。
- SetMIR: Multi-Interest Retrieval as Set Prediction:把多兴趣召回改写为集合预测,以 presence gate 和 query-level NMS 动态减少重复 ANN 请求。
- CAPTS: Channel-Aware, Preference-Aligned Trigger Selection for Multi-Channel Item-to-Item Retrieval:以价值感知匹配和跨渠道自适应路由选择 I2I 召回 trigger。
- Applying Embedding-Based Retrieval to Airbnb Search:用旅程级检索和多阶段排序统一 Airbnb 的体验推荐链路。
多任务学习与多目标优化¶
- SMES: Towards Scalable Multi-Task Recommendation via Expert Sparsity:用渐进式稀疏路由和去重执行,为不同任务动态分配专家容量。
- Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation:用独立 LoRA 与多任务路径把稀疏问卷满意度接入持续在线学习。