跳转至

按主题

采用“研究方向 → 方法簇 → 论文”的两级结构。同一篇论文可以出现在多个方法簇下; 每次出现都独占一行,并说明它与该方法簇相关的主要机制。

展示层生成与个性化

标题与展示内容优化

  • GESE:集合级生成探索后按请求上下文选择标题。

排序与长序列建模

预训练与参数高效迁移

  • LazFormer:可迁移生成式预训练与轻量排序残差适配。

大模型能力与推荐融合

LLM / Foundation model + Recommendation

  • ConnectionMind:让 LLM policy 在 typed 社交图上逐步扩展证据路径,并以 SFT、GRPO 和 GNN 蒸馏兼顾推理质量与流量成本。
  • DREAM:以 LLM Meta Engine 将三层用户意图编译为安全的推荐策略覆盖,并通过 Reward Dual Loop 持续沉淀有效结论。
  • Netflix GenRec:把用户历史、内容和请求上下文文本化,以 LoRA 后训练 causal LLM,再由 catalog-aware head 输出全目录分数。
  • Open Web UFM:在开放网页行为上联合双裁剪对比学习与 next-item 目标预训练共享 user encoder,再迁移到广告 CTR 和访问率任务。
  • RecoReward:用行为推荐器产生 RAS reward 来优化多模态内容描述,但 serving 不读取用户行为。
  • Melo:将 LLM 音乐 Agent 与实体 grounding、检索校验和反思重试组合为生产 playlist 流程。
  • EGR:以同一 LLM 表征 item 索引与用户查询,并联合 item representation learning 和 next-item prediction。
  • RECAP:用 causal Transformer 更新固定容量语义画像,再通过双塔反馈评价器与 GRPO 让画像直接服务未来推荐。
  • RecGPT-V3:让 LLM 读取可演化用户记忆并联合生成文本/SID,再以 latent token 重建蒸馏与排序反馈降低显式推理成本。
  • Prompt Generation:把异构推荐特征转成 Qwen 生成提示,并通过 token 压缩与配置化合并完成召回。
  • Apple Music ELISE:将多语言语义向量召回与 token index 通过分位数匹配融合。
  • NEXT:训练面向推荐的 8B VLM 生成 next-intent query,并把高置信 directed edges 离线物化为 NKG。
  • TokenMinds:把观看、搜索与场景信号编码为稠密用户向量和 SID 用户 token,以双输出和 multi-context decoding 支持下游排序与跨场景复用。
  • Atomic Intent Reasoning:用大模型离线拆分层级原子意图,在线只检索和聚合缓存意图链。
  • ToolRec:为大模型助手显式校准工具相关性与调用成本,抑制无效工具触发。
  • Pinterest Complementary LLM Predictor:对广告主列表进行 SFT/GRPO,让 LLM 补充传统召回和排序特征。
  • L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation:用个性化双视图 LoRA-MoE 分别适配语义和行为,再自适应融合。
  • MuChator:从多轮会话发现潜在推荐意图,并融合显式与隐式反馈更新候选。
  • AKT-Rec:用真实 LLM 对齐物品共现和用户兴趣,再以 Semantic ID 支持面向长尾的非对称知识迁移。
  • HARNESS-LM:通过强 teacher、L2 embedding alignment 与冻结文档索引精修构造非对称轻量检索器。
  • TubiFM: Unified Item, Carousel, and Search Ranking for Streaming Discovery:以统一 user story 和任务提示让同一模型完成 item、carousel 与 search 排序。
  • LLM Retrieval:用 domain SFT 生成层级广告属性,构建语义图并约束召回稳定性。
  • FLUID:用多模态大模型编码直播切片,经 RQ-KMeans 与 prefix n-gram 形成 LUCID,最终移除候选 item ID。
  • MM-LLM:把多模态内容转为 LLM caption/token 特征,再注入推荐排序模型。
  • UniVA:以 Commercial SID 和 generation-as-ranking 统一广告生成,再用价值对齐 RL 优化收益。
  • RecGPT-Mobile:用端侧 LoRA+INT8 LLM 将近期行为生成为下一意图 query,并依据意图漂移按需触发推理。
  • Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations:从中间层抽取任务相关表征,显式解耦推荐适配与低维压缩。
  • LWGR:把个性化 soft instruction 注入 LLM 世界知识,并用拉格朗日约束完成分数融合。
  • SOLARIS:预测未来请求并异步缓存 foundation-model latent,把大模型计算移出线上请求路径。
  • Cross-domain KD:把源域大模型知识蒸馏到目标推荐域,实现零样本跨域迁移。
  • IDProxy:把多模态 LLM 内容表征对齐到协同 item-ID 空间,再通过多层 proxy 和 gate 注入工业排序。
  • SIGMA:用 LLM 做多视角 grounding,并以混合 SID/ID token 训练七任务生成模型。
  • Generative Pseudo-Labeling for Pre-Ranking with LLMs:LLM 为未曝光候选生成伪标签,线上预排序器不增加 LLM 时延。
  • RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems:用真实排序模型偏好指导潜在 query 的 SFT 与 DPO 对齐。
  • S-GRec:用 LLM 个性化语义 judge 产生偏好监督,再以 A2PO 蒸馏到轻量生成器。
  • Self-Evolving RecSys:本地指令 LLM 读取实验 journal,逐轮选择未尝试的优化器、门控与 reward 配置,再以 validation 反馈晋级。
  • Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment:以 RAG、SFT 和 DPO 同时优化补全相关性、安全与 groundedness。
  • LLaTTE:用 BERT 语义特征、MLA 上游压缩、候选感知在线 attention 和 DHEN 门控连接多阶段序列。
  • RecGPT-V2:以层级 multi-agent、meta-prompt 和约束偏好 RL 生成淘宝用户意图标签与解释。
  • CRSD:用领域 LLM 产生标签与 reasoning 视图,通过同一学生的双视图对比自蒸馏把推理能力压入低延迟排序模型。
  • PLUM:对 LLM 进行推荐语料 CPT 与 SFT,再以 Semantic ID 生成物品序列。
  • PinFM:构建推荐 foundation model,并通过预训练—微调适配多个流量场景。
  • FilterLLM:让 LLM 从新品文本直接预测用户词表分布,避免逐候选判断。
  • SERAL:用 LLM 认知画像表示用户兴趣,再通过 IPO 与 nearline 链路优化惊喜度推荐。
  • LUM:通过 next-condition-item 与 group query 学习用户知识,再把生成表征注入判别模型。
  • MIM:多模态内容预训练和内容兴趣感知 SFT 把协同偏好对齐到内容空间。
  • MSD:把 teacher 知识自回归蒸馏到 student,并用 LoRA 对齐 CTR 目标。
  • PRECISE:联合 LLM 语义 token 与协同 ID,通过 top-k MoE 和两阶段训练建模用户序列。
  • LEADRE:以意图感知 Semantic ID 表示广告,并用 DPO 对齐展示与转化偏好。
  • LEARN:冻结 LLM 生成内容增强表征,并用协同域适配改善冷启动。
  • BAHE:缓存原子行为的浅层语言编码,只在线执行高层行为聚合。
  • LSVCR:用 LoRA 学习 LLM 偏好,再通过 SSC/VCC 双序列目标对齐评论与行为。
  • NoteLLM:把内容压缩到特殊 token,以 GCL 注入协同信号,并用 CSFT 保持生成能力。
  • BEQUE:生成 query rewrite,并用离线反馈、自采样和 PRO 优化改写质量。
  • KAR:让 LLM 生成用户偏好和物品事实知识,再由 hybrid-expert adapter 融合进推荐器。
  • M6-Rec:把多种推荐任务统一成自然语言形式,并以 option-adapter 轻量适配预训练模型。

生成、排序与冷启动

  • ANGLE:以层次文本标识、三目标联合训练和请求侧动态约束实现一步广告检索。

搜索、召回与长期价值

  • MIMA:用同请求多正例与排他一对一匹配显式监督互补兴趣,并以 activation routing 校准召回通道。
  • VK Friend-GNN:以多哈希共享表压缩超大用户 embedding,并用时序邻接与 cutoff 避免邻居采样泄漏未来边。
  • DCEO:用直接因果效应替代短期相关性代理,并以动态多目标权重优化长期用户价值。
  • TransRetrieval:通过 target-token 压缩、多域参数化与深层 Transformer 扩展工业检索。
  • Policy-Grounded Dynamic Facet Suggestions:离线构建 facet taxonomy,在线按 query/member 召回并在策略约束下排序关键词。
  • HILL:用跨层 residual quantization 学习 coarse-to-fine 检索索引,减少候选打分量。
  • GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce:联合生成搜索分面和改写 query,再以检索满意度执行偏好对齐。

生成式召回与端到端推荐

排序网络与长序列

  • ChronicleRec:以非均匀历史合并、因果 query 锚点和多 horizon alignment 生成可缓存的长期用户 token。
  • From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs:用双门控时序编码抑制行为噪声,并将重型用户编码与轻量候选交叉解耦,实现请求内共享计算。
  • OneModel:将推荐、广告与商家混合行为映射到共享序列模型,并以 SAIM 场景门控兼顾迁移和专门化。
  • DrEM:在 logit 扰动下反演 pair-label 翻转风险,并以一致性融合降低多目标排序漂移。
  • IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation:让多个业务任务在长短双流的不同层级执行交互查询,而非仅共享底层编码。
  • Netflix GenRec:用 prefill-only LLM 取代逐 token 解码,联合 catalog head、language loss 和 reward-weighted ranking loss 执行大目录精排。
  • TM20K:教师保留完整历史,学生把连续行为合并到固定 token 预算并蒸馏注意力。
  • TransX:离线缓存行为流,在线候选只对 global-local cache 做 cross-attention。
  • CCFormer:以字段分离的 ID/content 编码和门控融合增强冷内容泛化,再分层压缩远期 token、保留近期行为细节。
  • HA-MoE:用内容异构性控制多门控 MoE,在同一排序器内平衡通用与领域专长信号。
  • ROCS:把 request-side encoder 与 candidate-side late interaction 解耦,使同一表征路径覆盖大候选检索和精排序批量打分。
  • ClockRoPE:从周期 kernel 的 Fourier 变换采样旋转频率,让 attention 同时识别 recency 与日/周 routine。
  • TWICE:以点击/转化双时钟和单调 delay CDF 处理长期转化反馈未成熟问题。
  • CORE:将有序相关性拆成 High/Non-High 与条件 Mid/Low 两道边界,并把 step-GRPO reasoning 经 PostCoT 蒸馏给在线双头排序器。
  • Mosaic:把不同归纳偏置的 user embedding 作为可独立演进的 specialist fleet,用 MRM 复合监督和去冗余损失增加下游有效信息。
  • SpecFormer:以可学习谱软化和谱残差位置编码缓解 embedding/attention collapse。
  • YouTube Freshness:联合训练去偏与 serving 探索,专门改善新发行内容的曝光反馈闭环。
  • WHALE:逐层耦合 Wukong 高阶交互和门控 HSTU 序列状态,避免双分支只在末端融合。
  • Long-History User Transformers:把长历史异步压缩成固定缓存,线上只运行近期事件 Transformer,兼顾历史容量与实时延迟。
  • TMallGS:对异构字段使用独立 QKV、噪声门控、FiLM 和 progressive loss,统一特征交互与序列建模。
  • DANet:联合兴趣网络、折扣时频表征和用户/促销分布修正预测转化率。
  • MESH:用异构模块塔、信号放大与 RGBC 缓解 fresh/tail 梯度被头部内容淹没的问题。
  • SAM:预测品类补货周期并动态屏蔽购买前已满足意图,降低购买后重复推荐。
  • SlimPer:以固定 knowledge slots 反复访问原始用户 token,把逐层状态从序列长度中解耦并支持 request-only 共享。
  • ZoRRO:无需训练,用 recency、semantic 和 category 关系直接排序新闻候选。
  • UniFormer:在特征空间和任务空间中组织统一语义 token 与交互模块。
  • JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling:统一编码长短 guest journey 与事件时间,在生产搜索中替代手工序列特征。
  • OneRank:将结构特征、任务 token 和任务私有通道放入同一 Transformer-native ranking 架构。
  • Memento:用 query-conditioned MMR 动态平衡相关性与多样性。
  • Effective Knowledge Transfer for Multi-Task Recommendation Models:按任务相似度把 CTR 知识迁移到多个 CVR 塔,并抑制难例负迁移。
  • Semantic-Native Long Sequence Modeling:以层级语义 ID、bigram、时间折叠和 global-local pooling 扩展视频长历史。
  • RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems:随机置换多 embedding、全局 token 和任务解耦共同提升表征有效秩。
  • UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking:以 Entire-Space 数据和分层异构融合协同扩展搜索排序模型。
  • HAP:按候选难度分配轻量或强分支并对齐异构预排输出。
  • SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders:系统优化 token 化、注意力和 FFN,统一替代工业 DLRM 排序。
  • OneRanker:用 fake item token 和一致性损失统一 generation/value/ranking。
  • Beyond the Flat Sequence: Hierarchical and Preference-Aware Generative Recommendations:以 session 层级预训练和偏好引导稀疏注意力建模长行为序列。
  • HiSAC:用层级投票压缩超长历史,再以 query-conditioned soft routing 选择兴趣 agent。
  • ULTRA-HSTU:以半局部 attention、LBSL 逐层扩窗和 Mixture of Transducers 扩展 16k 用户历史。
  • MixFormer:在统一网络中融合 dense 特征交互和序列建模,并按预算选择训练模块。
  • An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking:用工业长序列推荐器重写 LinkedIn Feed 排序与服务链路。
  • Compress, Cross and Scale: Multi-Level Compression Cross Networks for Efficient Scaling in Recommender Systems:分层压缩并交叉低维特征,在受控计算量下扩大推荐网络容量。
  • Compute Only Once: UG-Separation for Efficient Large Recommendation Models:拆分用户侧与通用计算,使大规模推荐模型复用只需计算一次的表示。
  • Kunlun:在每层组合 GDPA Transformer 与分层 seed/global interaction block,并以 CompSkip 稳定深层训练。
  • MDL:把 feature、scenario 和 task token 化,让领域与任务参与每层特征交互。
  • MSN:把大容量参数放入稀疏 Product-Key Memory,只激活 top-k 槽位控制计算。
  • TokenMixer-Large:用 mixing/reverting、双粒度 SwiGLU、interval residual 和辅助监督扩展工业精排。
  • Zenith: Scaling up Ranking Models for Billion-scale Livestreaming Recommendation:以 Prime Token Fusion 和 Boost 扩展直播排序模型的深度与宽度。
  • Unleashing the Potential of Sparse Attention on Long-term Behaviors for CTR Prediction:组合全局、转移和局部稀疏注意力,建模千级长期行为序列。
  • HyFormer:联合用户序列与 query decoding,通过 query boosting 强化搜索排序。
  • OneTrans:用统一因果 Transformer 覆盖多场景排序,并复用 KV cache。
  • ARGUS:分解用户反馈与物品表示,在 Transformer 中建模超长音乐序列。
  • RankMixer:交替使用 token mixing 与逐 token FFN,并探索稀疏 MoE 扩容。
  • Click A, Buy B:联合 CABA/CABB 分支和商品 taxonomy 重构电商转化归因。
  • MGOE:把多任务相关性编码成宏观图,再由 graph experts 和任务塔联合预测。
  • TransAct V2:以候选感知终身序列和 next-action 多任务目标增强排序。
  • SORT-Gen:以 causal ordered regression 学习列表前缀的 CLICK/PAY 价值,通过多目标队列和内嵌 MMR 生成最终重排列表。
  • LONGER:结合混合注意力、InnerTrans、token merge 与 KV cache 扩展超长序列。
  • FuXi-α:用多通道注意力和 multi-stage FFN 扩展特征交互模型容量。
  • AdaF²M²:用 feature-mask 多次前向和 state-aware adapter 改善特征学习与状态适配。
  • TWIN-V2:把百万级生命周期行为离线压缩为层次兴趣簇,再以候选相关粗搜和精确注意力恢复原始行为信号。
  • CWM:估计统一时长干预下的反事实观看收益以抵消 duration bias。
  • PLE:把共享与任务专属 experts 分开,并以 CGC gate 渐进抽取多任务表示。
  • DCN-V2:使用低秩专家混合显式构造特征交互,并与 deep tower 联合排序。
  • SIM:用候选条件 GSU 从超长历史中搜索相关子序列,再由 ESU 计算精确候选—行为交互。
  • BST:让 Transformer 联合编码候选商品与带位置的行为序列。
  • DIEN:用辅助监督抽取兴趣状态,再让候选相关门控驱动兴趣演化。
  • SASRec:以因果自注意力编码行为序列,并预测下一物品。
  • MMoE:共享一组 experts,但由每个任务的独立 gate 学习不同专家组合。
  • ESMM:用 CTR 与 CTCVR 的 entire-space 联合目标学习 CVR,避免只看点击样本造成选择偏差。
  • DIN:使用候选感知局部激活从历史行为中提取相关兴趣,是经典 CTR 排序结构。
  • DeepFM:让 FM 二阶交互与 deep 分支共享 embedding,端到端覆盖低阶和高阶特征组合。
  • YouTube DNN:把观看历史聚合为用户向量并经非线性塔变换,以 item embedding 点积完成候选召回。
  • Wide & Deep:联合显式 wide 交叉与 deep 表征,是工业精排从线性模型向深度模型过渡的经典骨架。

冷启动与语义-行为对齐

  • LLM Thompson Priors:把 LLM 对新评论质量的语义判断编码为分群 Beta 先验,再让真实曝光反馈逐步覆盖先验。
  • PinEqualizer:在 corpus、召回、排序和 utility 全漏斗识别 fresh 内容瓶颈,以内容特征、engagement dropout、cohort calibration 和 UCB 打破曝光反馈回路。
  • Pin-SCALE:以 engagement-aware residual codebook 和多视角对齐把 Semantic ID 接入判别式召回。
  • Proximity Features:以自适应群体地理 key 聚合行为,为匿名和首次访问用户提供冷启动特征。
  • Taiji:自适应融合语义匹配与协同信号,在冷启动覆盖和成熟内容精度之间选择 Pareto 工作点。
  • LLM Retrieval:生成 creative 层级语义属性,并用 primary/shadow 机制稳定广告召回。
  • SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search:以层级 SID、目标感知 HID–SID 门控和兴趣对齐增强长尾泛化。
  • PinCLIP:把图文 contrastive learning 与 Pin-Board 共现邻居对齐,改善 fresh 内容表示。
  • Podcast MTL:共享 organic stream 与 ads/promotion 表征,把高资源任务知识迁移到冷启动 podcast。
  • SaviorRec:用行为监督训练内容 encoder,生成 RQ Semantic ID,再通过多行为模块对齐冷启动物品。
  • PRECISE:联合 LLM 语义 token 与协同 ID,并针对冷启动物品进行序列预训练。

训练目标与决策优化

采样、蒸馏与强化学习

  • LLM Thompson Priors:用 LLM 初始化分群 bandit 先验,并由 Thompson Sampling 在持续反馈下完成可校正的冷启动决策。
  • KGD:以 BMTP 和冻结知识分支保留可刷新的预训练信息,并用正交 ACR 控制它与协同几何的干扰。
  • HRPO:依据层级生成前缀的后续收益分配 residual credit,使组相对策略优化不再只依赖整序列标量奖励。
  • RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems:用 bandit 在有限预算下路由候选结构实验,并把验证反馈写回下一轮。
  • From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation:从真实反馈发现生成策略,再用双空间关系蒸馏到轻量线上排序器。
  • ASARL:用多 Agent 校验与补齐长尾 relevance 数据,执行 SCT、交互偏好优化和在线 student 蒸馏。
  • Reward Guided Decoding:用 reward 对生成先验做指数倾斜,并以 KL 温度限制策略偏离。
  • RAMP:以富个性化路径为 teacher,通过 feature mask 和 KL alignment 改善仅有公共字段的流量。
  • UAME:利用 Gaussian 排序不确定性识别多 pxtr 冲突样本,并自适应提高高偏差 pair 的训练权重。
  • Downstream Rewards:先筛选预测长期参与度的候选奖励,再将独立 reward heads 与即时目标联合优化。
  • Cluster GOOBS:用在线聚类感知的 sampler 扩大样本覆盖并缓解头部集中。
  • SCALR:学习跨域条件分布并概率采样合成训练事件,替代覆盖度较低的确定性 top-k 翻译。
  • Rec-Distill:结合 batch/stream teacher,把大模型知识蒸馏到轻量 student。
  • Pinterest Complementary LLM Predictor:先用 SFT 学习广告主列表,再以 GRPO 奖励优化列表质量。
  • Stochastic Primal-Dual Decoding:在逐 token 解码中同步更新随机约束乘子,以无需重训的方式控制序列级业务目标。
  • MDCNS:从多种负样本分布协同采样,并通过双模型交替更新减少偏差。
  • UniVA:在请求内归一化 eCPM reward,并交替执行监督学习与强化学习。
  • AgenticRecTune:用 Actor–Critic 生成和审查配置,以 Online agent 回收实验反馈并由 SkillHub 跨轮复用。
  • LWGR:用 reference confidence 约束融合结果,并通过 primal-dual 更新拉格朗日乘子。
  • Cross-domain KD:把源域 teacher 知识蒸馏到目标域,减少跨域冷启动监督需求。
  • SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search:用满意度奖励和双重相对优势优化短视频搜索多任务融合。
  • GR4AD:通过 RSPO 优化可变长度广告生成,并结合 LazyAR 降低推理成本。
  • S-GRec:只采样少量 PSJ 反馈,并用 advantage 符号门控和幅度约束稳定 A2PO。
  • DRL-PUT:使用 logged propensity 和策略梯度自动调节广告排序 utility 权重。
  • MPFormer:目标 token 与动态 quota 让多任务检索共享训练/serving 资源。
  • OneRec-V2:利用真实时长反馈和 GBPO 对生成序列进行强化学习。
  • SERAL:通过 IPO 对齐惊喜度偏好,并在 nearline 链路应用认知画像。
  • LEADRE:使用 DPO 对齐 Semantic ID 生成与广告转化偏好。
  • BEQUE:结合离线检索反馈、自采样和 PRO,优化生成式 query rewrite。

因果推断与长期价值

多阶段排序与混排

实时序列与 listwise 重排

  • SequenceO1:将远期超长历史压成固定预算 prototype sketch,再与近期行为分支融合。
  • POEM:用当前请求的多路 rank signal 构造偏序序列,补充纯时间历史。
  • PIANO:query-driven interest refiner 选择相关历史,information node 汇总候选列表并条件化 item score。

召回、粗排与精排协同

  • UniRec:联合预排与精排融合,以纵向偏好对齐、紧凑 pairwise 聚合和组相对正则协调级联阶段。
  • SPEAR:以双 embedding 和乘法选择门把 query rewrite 与 item relevance 端到端对齐,同时保留原 query residual。
  • STEPS:以 planning、execution、filter 三 Agent 联合决定推送动作和下一次系统唤醒时刻。
  • ROCS:把 request-side encoder 与 candidate-side late interaction 解耦,使同一表征路径覆盖大候选检索和精排序批量打分。
  • OneShot:把索引 assignment 与排序目标共同训练,再在命中路径内执行比点积更强的 neural scoring。
  • SlimPer:以固定 knowledge slots 反复读取用户历史,让 request-only 表征可跨候选复用,再进行候选相关精排。
  • CS3:在保持双塔 ANN 召回兼容的前提下,通过循环修正、跨塔同步和级联教师增强交互能力。
  • COBRA:先执行稀疏生成缩小候选空间,再用稠密生成细排,形成级联召回—排序路径。

重排、混排与多目标页面决策

内容理解、审核与风险控制

内容理解与语义表征

相关性审核与数据质量

  • ASARL:以 Reason、Critic 和 Gen Agent 审核、修复长尾 relevance 数据,再蒸馏到线上 student。
  • CORE:把 High/Mid/Low 相关性拆成级联边界,用 step-GRPO 训练 reasoning 后蒸馏给在线审核/排序头。
  • MESH:通过异构塔与 residual gated bias correction 防止 fresh/tail 内容信号被头部样本淹没。
  • Cluster GOOBS:用在线聚类感知采样扩大训练覆盖,降低头部内容对数据分布的支配。

隐私、策略约束与风险控制

审核风控覆盖边界

当前实现主要覆盖相关性审核、训练数据质量、隐私受限特征与策略约束;内容安全、 作弊/欺诈和广告合规仍是明确缺口,不能用相关性模型冒充已实现。

  • SIRF:通过 EntiGraph、MAGA 与账户级 CoT 合成长尾规则训练数据,把 trigger/exemption 关系内化进风控模型并按 P95 门槛出 verdict。
  • RAMP:训练个性化/公共双路径,并用 feature mask 与预测对齐适配隐私受限和字段缺失流量。
  • UAME:显式建模多目标不确定性和标签冲突,降低高分歧样本对排序策略的风险。
  • Causal Retrieval:用 doubly-robust uplift 同时评估触发候选源的增量收益与调用成本,控制无效干预。
  • Proximity Features:以隐私合规的群体地理特征服务匿名用户,避免依赖持久用户 ID。

Serving 与研究基础设施

自主研究与反馈闭环

Serving / efficiency

  • ROCS:请求表征只计算一次,候选相关交互延后并批量执行;本地同时报告排序质量和进程内候选评分吞吐。
  • Memory Layer:把 cache 纳入模型训练,以 eta=1 writeback 和 always-on 属性表征消除训练服务偏差与冷启动缺口。
  • Prompt Generation:训练和 serving 共享特征配置,并通过 event replay 与 token compression 控制延迟。
  • NOVA:用四级验证、失败方向和 architecture gradient 提高自动架构进化的有效通过率。
  • RankGraph-2:离线预计算 popularity-corrected PPR 并用 cluster index 压缩线上图召回。
  • EvoRec:把历史实验蒸馏为可复用 skill memory,使自动研究方法本身跨代进化。
  • Pinterest Complementary LLM Predictor:离线批量生成 advertiser prior,线上作为传统候选生成的补充信号。
  • UniVA:按请求构造个性化 trie,并用 value-guided beam search 约束有效广告路径。
  • CS3:在保持双塔 ANN 兼容的前提下,以循环修正、跨塔同步和教师协同补充交互能力。
  • LWGR:在 nearline 阶段缓存世界知识,线上只执行轻量 cross-attention 融合。
  • SIGMA:使用 prefix-local item retrieval 和 nearline U2I 控制生成检索成本。
  • S-GRec:LLM judge 只在训练期调用,线上仅部署轻量 SID generator。
  • OneTrans:在多场景间共享因果 Transformer,并复用 KV cache 加速线上推理。
  • OneRec-V2:用 lazy decoder 和并行策略降低生成式推荐延迟。
  • RADAR:将高成本全排序移到请求后异步执行,并缓存为下一请求召回候选。
  • LONGER:通过 token merge、混合注意力和缓存降低超长序列 serving 成本。
  • MSD:把 teacher 知识蒸馏到小模型,并以 LoRA 与缓存表征控制 CTR serving 成本。
  • BAHE:缓存原子行为的浅层编码,只在线执行高层序列聚合。
  • BEQUE:将检索反馈放在离线训练阶段,线上只保留轻量 query 生成。
  • M6-Rec:冻结大部分预训练语言模型,仅用 option-adapter 适配推荐任务。

广告与商业决策

召回、触发与多通道路由

多任务学习与多目标优化