跳转至

按年月

同月论文保留在同一小节,但每篇独占一行,并附主要方法简介。

2026-09

2026-08

2026-07

  • GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System:通过三元组预训练、GRPO 行为对齐和 ID/多模态门控形成可部署表示。
  • RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems:用 bandit 在有限预算下路由候选结构实验,并把验证反馈写回下一轮。
  • TransX:行为/服务双流交叉与可缓存长序列编码。
  • CCFormer:腾讯以字段分离的 ID/content 表征、门控融合和分层历史压缩,同时降低超长行为序列开销并增强内容泛化。
  • From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation:从真实反馈发现生成策略,再用双空间关系蒸馏到轻量线上排序器。
  • HA-MoE:Google Discover 依据 session 内容异构性动态路由多个专长 expert,统一排序开放网页内容。
  • Open Web UFM:Teads 在开放网页行为上用双裁剪对比学习与 next-item 目标预训练共享用户编码器,再迁移到广告排序。
  • ROCS:Meta 将请求侧特征只编码一次,把候选相关交互延后到批量评分阶段,以统一服务检索和排序并提升 QPS。
  • SnapLGR:共参与监督的 residual SID 与 LLM 生成召回。
  • ASARL:以 ReasonAgent、CriticAgent、GenAgent 闭环整理 QQ 社交搜索数据,再经 SCT、PGO 和 Social Distillation 服务在线模型。
  • ClockRoPE:以随机 Fourier 旋转近似日/周周期注意力 prior,并与标准 RoPE 组合建模 routine。
  • DIRECTOR:运输优化动态索引与并行全局匹配。
  • OneShot:把 ranking-shaped 层级索引、全局路径平衡和 neural scoring 统一进端到端工业检索模型。
  • PSG:pair-space 半长度生成式重排。
  • RecoReward:用冻结推荐双塔的目标/非目标亲和力差训练内容描述,并保持线上 content-only serving。
  • Reward Guided Decoding:KL 正则 reward 引导解码。
  • SWAG:用 masked future plan、七日滑窗目标和逐步 gate 优化跨 episode 自动出价。
  • TWICE:分离点击和转化时钟,以 current-status likelihood 和单调 delay CDF 学习长期 CVR。
  • CORE:美团把 High/Mid/Low 相关性拆成条件二分类,用逐 step GRPO 优化 reasoning,再通过 PostCoT 蒸馏到低延迟双头模型。
  • Memory Layer:把 cache 纳入模型训练,以 eta=1 writeback 和 always-on 属性表征消除训练服务偏差与冷启动缺口。
  • Mosaic:Meta 将 memorization、dense、sequential 与 CoTrain 用户表征组织成 specialist fleet,并以 MRM 和 cosine redundancy loss 挖掘增量信息。
  • OxygenREC-v2:把目标行为写入生成 decoder prefix,并用未来交互 privileged teacher 和熵路由蒸馏内化判别能力。
  • SpecFormer:谱软化 attention 与谱残差位置编码缓解推荐 Transformer 表征坍缩。
  • UniR²:快手用 Dual-Query Prefix-Causal Attention 在同一 decoder 序列内统一层级 SID 生成和多目标排序,并以 ranking-only LoRA 隔离梯度。
  • Dual-purpose Semantic IDs:YouTube 用同一分层 SID 表达协同身份,并以 Semantic Decoder 恢复内容语义表示。
  • Melo:以多节点音乐 Agent、实体目录 grounding 和反思重试生成可靠 playlist。
  • YouTube Freshness:组合 recency、IPS、可移除 bias tower 与不确定性探索打破新内容反馈环。
  • EGR:共享 LLM 联合学习 item 索引和 user query 向量。
  • BARGE:用 ICA 恢复 item token 结构、HPR 重排累计语义路径,再以 OSQ 正交双通道和 OR-fusion 补充可达候选。
  • PinEqualizer:在 Pinterest 全漏斗维护 fresh exploration corpus,并以 engagement dropout、内容交叉、分 cohort calibration 和 UCB 减少旧内容偏置。
  • PinDCO:以创意组件专塔、相对广告分数的增量融合和整页像素惩罚完成动态创意选择。
  • TSGR:把 residual semantic prefix 与并行全局/query 价值码结合,再由联合 VRM 完成价值感知生成召回。
  • RAMP:显式训练个性化和公共字段双路径,用 feature mask 与 prediction alignment 适配隐私受限流量。
  • Pin-SCALE:Pinterest 用 engagement-aware Semantic ID、级联 pooling 与多视角对比学习接入 dense retrieval。
  • UAME:联合预测满意度均值和不确定性,以概率 pairwise loss 和冲突加权缓解多目标标签偏差。
  • WHALE:逐层交换 Wukong 特征交互分支与 HSTU 行为序列分支,构成统一可扩展排序模型。
  • RECAP:维护固定容量流式语义画像,并把历史推荐反馈训练成 GRPO reward,形成画像优化闭环。
  • RecGPT-V3:用可演化 Memory Hub、文本/SID 混合基础模型和可重建 latent reasoning 同时改进长期用户理解、商品 grounding 与推理效率。
  • LLM-Based Re-Ranking for Real Estate Search:结合对话需求、房源属性、文本描述与候选集合统计执行 LLM 重排。
  • Adaptive Ad Load Design for Sponsored Search Markets: Evidence, Theory, and Deployment:从随机现场实验学习收入—转化曲线,再按请求动态选择广告数量。
  • Downstream Rewards:筛选与未来参与度相关的 session reward,并通过模型无关 reward heads 接入多个推荐 surface。
  • Long-History User Transformers:离线编码完整历史并缓存固定状态,在线仅融合近期行为以控制广告排序延迟。
  • TMallGS:以 field-wise QKV、噪声门控、FiLM 和逐层误差监督统一电商搜索异构字段。
  • Causal Retrieval:Pinterest 用 doubly-robust uplift 判断是否触发 shopping candidate generator。
  • DANet:融合兴趣建模、折扣时频分解与个性化折扣偏好预测 CVR。
  • MESH:用异构模块塔和 residual gated bias correction 保护 fresh 内容的缩放收益。
  • NONTP:通过 TCL 感知多步未来轨迹,并以 TDL 为跨域目标增加共享预测头的第二条梯度路径。
  • Proximity Features:自适应聚合地理群体行为,为匿名用户提供不依赖持久 ID 的冷启动信号。
  • SAM:学习购买后兴趣退出及恢复节奏,在注意力层抑制重复推荐。
  • SlimPer:通过固定知识库的 Select–Match–Refine 循环替代全序列逐层传播,降低长历史排序的计算和中间状态。
  • Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap:把时空历史编码为 SID,并以课程训练和长期反馈优化下一 POI 生成。
  • Prompt Generation:把异构特征组织成配置驱动的生成提示,通过 token 压缩和多种合并策略服务搜索与推荐召回。
  • ZoRRO:零权重新闻推荐融合 recency、语义和类别关系。
  • Apple Music ELISE:多语言 dense retrieval 与词法索引的分位数校准融合。
  • Cluster GOOBS:在线聚类用户或物品表征,并以 cluster-aware sampler 改善训练样本覆盖和头部集中。

2026-06

  • GenPage: Towards End-to-End Generative Homepage Construction at Netflix:用一个模型直接生成整页,并以长期用户奖励和业务约束进行后训练。
  • POEM:由实时多目标排序信号动态构造偏序兴趣序列。
  • NEXT:以 VLM 推理 next intent、检索并验证 directed video edges,再通过离线 NKG 支持低延迟在线注入。
  • CMSL:用可学习兴趣 lenses 拆分多兴趣序列,并结合 HSTU 建模不同语义 strand。
  • NOVA:以 architecture gradient 汇总验证和指标反馈,并通过四级级联阻断静默错误架构。
  • UniFormer:统一扩展特征 token、行为序列与多任务交互。
  • Recommendation as Generation:用解耦语义 ID 连接生成式推荐和个性化视频生成。
  • TokenMinds:共享序列 encoder,同时输出稠密用户向量和分层 SID 用户 token,再以可学习 token embedding 注入生产排序模型。
  • G2Rec:构建可微 soft graph,并联合图结构与生成式双目标学习用户—物品关系。
  • JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling:统一编码长短 guest journey 与事件时间,在生产搜索中替代手工序列特征。
  • RankGraph-2:对图边去热门偏置,离线预计算多跳 PPR,再以 cluster index 服务召回。
  • EvoRec:让 Research/Code Agent 迭代模型,Skill Evolver 从持久 Memory 中提炼优化方法。
  • OneRank:原生统一 Transformer 多任务排序与任务私有通道。
  • PIANO:查询驱动兴趣精炼和信息聚合节点的音乐 listwise 重排。
  • Atomic Intent Reasoning:将跨域行为拆成层级原子意图,离线缓存后按目标候选检索并聚合意图链。
  • ToolRec:联合工具相关性、置信度校准和调用代价,减少大模型助手的无效工具推荐。
  • SSRLive:静态/动态 Semantic ID 配合用户—直播间交叉模块,统一内容身份与实时状态。
  • Taiji:在语义匹配与协同信号之间自适应选择 Pareto 工作点。

2026-05

2026-04

2026-03

2026-02

2026-01

2025-12

  • HiGR:联合 residual Semantic ID、粗到细 slate decoder 与 ORPO 列表偏好对齐。
  • HiGR:先生成层级 Semantic ID 簇再解码物品 slate,并以 ORPO 做列表偏好对齐。
  • RecGPT-V2:把用户意图推理组织成层级 multi-agent 协作,并以 meta-prompt、压缩表示和约束偏好 RL 优化标签与解释。
  • RecGPT-V2:以层级意图 agents、混合压缩表示、meta-prompt 和约束偏好 RL 升级淘宝意图推理。

2025-11

  • DualGR:长短兴趣双路由、约束 SID 和曝光感知生成召回。

2025-10

  • OneTrans:用统一因果 Transformer 覆盖多场景排序,并复用 KV cache 降低线上推理成本。
  • CRSD:用领域 reasoning teacher 和普通/推理双视图对比自蒸馏训练轻量在线学生。
  • PLUM:对 LLM 进行推荐语料 CPT 与 SFT,并以 Semantic ID 生成物品序列。

2025-09

  • IntSR:显式/隐式意图和时间词表统一搜索与推荐生成。
  • OnePiece:上下文工程、块级 latent reasoning 和级联多任务排序。
  • DRL-PUT:从 logged ads behavior 学习相关性、新颖性和收益等排序 utility 的动态权重策略。

2025-08

  • MPFormer:任务条件化序列检索和资源自适应共享。
  • OneRec-V2:使用 lazy decoder 降低生成延迟,并用真实反馈强化学习和 GBPO 优化推荐序列。
  • SaviorRec:用行为监督训练内容编码器,生成 RQ Semantic ID,并通过多行为适配模块改善冷启动。

2025-07

  • ARGUS:分解用户反馈与物品表示,在大规模 Transformer 中联合建模音乐序列。
  • RankMixer:交替进行 token mixing 与逐 token FFN,并探索稀疏 MoE 以扩展工业排序网络。
  • Click A, Buy B:显式区分点击 A 后购买 A/B 的归因路径,并用 taxonomy-aware weighting 共享跨物品信号。
  • Click A, Buy B:拆分同物品 CABA 与跨物品 CABB 转化归因,并用商品 taxonomy 建立协同权重。
  • PinFM:以 DCAT 等序列模块构建推荐 foundation model,并通过预训练—微调适配多个流量场景。

2025-06

  • MGOE:从任务统计构建 Macro Task Merging Graph,在 graph experts 中传播关系后分别预测各目标。
  • MGOE:构建宏观任务合并图,让 graph experts 显式传播多任务关系后进入独立预测塔。
  • RADAR:延迟异步全库排序结果回流下一请求召回。
  • TransAct V2:用候选感知的终身行为序列和 next-action 多任务目标增强 Homefeed 排序。

2025-05

  • SORT-Gen:用 ordered-regression Transformer 预测多目标前缀价值,再以多目标队列、mask-driven selection 和 MMR 生成 slate。
  • GenRank:把多种用户动作编码为生成目标,通过 action-oriented generation 完成端到端排序。
  • LONGER:结合混合注意力、InnerTrans、token merge 与 KV cache,扩展超长用户行为序列建模。

2025-04

  • PinRec:根据目标 outcome 生成多 token 物品表示,以条件生成方式完成召回。

2025-03

  • COBRA:先用稀疏生成缩小候选空间,再用稠密生成细排,形成级联式生成召回。

2025-02

  • OneRec:把 session 推荐建模为 Semantic ID 序列生成,并结合 MoE 与偏好优化对齐真实反馈。
  • FilterLLM:将新品文本直接生成为用户分布,并用行为信号校准十亿级冷启动召回。
  • FilterLLM:把新品文本映射到用户词表分布,并用历史行为约束冷启动召回。
  • SERAL:构建用户认知画像,用 IPO 对齐惊喜度偏好,并通过 nearline 链路注入推荐排序。
  • SessionRec:按真实 session 生成候选,并利用曝光负例和 hard negative 改善会话级召回。
  • LUM:通过 next-condition-item 预训练和 group query 压缩用户知识,再把生成表征注入判别式排序器。
  • FuXi-α:以自适应多通道注意力和分阶段 FFN 扩展推荐特征交互容量。
  • FuXi-α:用多通道注意力和 multi-stage FFN 扩展特征交互模型容量。
  • MIM:以多模态遮盖预训练、内容兴趣 SFT 与 CiUBM 把内容语义注入用户行为建模。
  • MIM:以遮盖多模态预训练和内容兴趣 SFT 对齐内容/协同空间,再由 CiUBM 融合排序。

2025-01

  • AdaF²M²:通过 feature-mask 多次前向学习完整表征,再按用户/物品状态动态调节 adapter。

2025-01

  • AdaF²M²:用 feature-mask multi-forward 学习全面特征,再由 state-aware adapter 响应不同用户/物品状态。

2024-12

  • MSD:把 teacher 的用户知识自回归蒸馏到小模型,再通过 LoRA 和缓存表征对齐 CTR 任务。
  • PRECISE:联合 LLM 语义 token 与协同 ID,使用 top-k MoE 和通用/目标训练建模序列推荐。

2024-11

  • LEADRE:生成意图感知 Semantic ID,并通过 DPO 对齐广告展示与转化偏好。

2024-07

  • TWIN-V2:离线压缩生命周期行为,在线以 GSU/ESU 完成候选相关粗搜与精确建模。

2024-06

  • CDM:将上下文多样性教师蒸馏到低延迟混排学生。
  • CWM:以反事实 watch time 消除视频时长偏置。

2024-05

  • LEARN:冻结 LLM 生成内容增强表征,再通过协同域适配改善冷启动和长尾推荐。

2024-03

  • BAHE:缓存每个原子行为的浅层语言表示,只在线聚合高层序列,从而降低长文本 CTR 建模成本。
  • LSVCR:用 LoRA 学习 LLM 偏好,通过 SSC/VCC 双序列目标对齐评论语义和用户行为。
  • NoteLLM:把内容压缩到特殊 token,以 GCL 注入协同信号,并用 CSFT 保持生成能力。

2024-02

  • HSTU:以分层顺序转导单元建模超长行为历史,用生成式目标统一大规模推荐排序。

2023-11

  • BEQUE:生成用户相关的搜索改写,并结合离线检索反馈、自采样与偏好排序优化改写质量。

2023-06

  • KAR:让 LLM 生成用户偏好与物品事实知识,再由 hybrid-expert adapter 融合进传统推荐模型。

2023-05

  • TIGER:用 RQ-VAE 把物品量化为层级 Semantic ID,再通过自回归模型直接生成召回结果。

2022-05

  • M6-Rec:把推荐任务统一改写为自然语言任务,在预训练语言模型上使用轻量 option-adapter 完成多场景适配。

2020-09

  • PLE:把专家拆成共享组与任务专属组,并由 CGC gate 渐进抽取共性和个性信息。

2020-08

  • DCN-V2:用低秩 cross experts 和 gate 显式学习高阶特征交互。

2020-06

  • SIM:先按候选搜索超长历史中的相关行为,再以精确搜索单元汇聚兴趣。

2019-05

  • BST:用候选参与的 Transformer 建模电商用户行为序列。

2018-09

  • DIEN:以辅助监督 GRU 抽取兴趣,再让候选相关门控控制兴趣演化。

2018-08

  • SASRec:用因果自注意力编码用户行为序列,并预测下一物品,作为经典序列推荐基线。
  • MMoE:让每个任务用独立 gate 组合共享 experts,缓解任务相关性变化造成的负迁移。

2018-04

  • ESMM:在全曝光空间联合学习 CTR 与 CTCVR,并用概率乘积分解缓解 CVR 样本选择偏差。

2017-06

  • DIN:用候选物品感知的局部激活单元,从用户历史中动态提取相关兴趣,并以 Dice 激活训练 CTR 排序模型。

2017-03

  • DeepFM:让 FM 二阶交互与深层网络共享 field embedding,端到端学习低阶和高阶组合。

2016-09

  • YouTube DNN:聚合观看历史并用非线性用户塔生成向量,再通过 item embedding 近邻召回候选。

2016-06

  • Wide & Deep:联合记忆型 wide 交叉和泛化型 deep tower,是工业深度推荐的经典起点。