跳转至

按公司

每篇论文独占一行;简介只概括主要方法,实验效果与复现边界请进入单篇文档查看。

Baidu

  • 2026-09 · GESE:先生成多样且忠实的标题候选,再依据当前用户上下文选择展示标题。

Alibaba International Digital Commerce Group

  • 2026-09 · LazFormer:以生成式预训练迁移序列知识,再用 residual adapter 与近密远疏注意力适配工业排序。

Yandex

  • 2026-08 · Sona:压缩长历史并自回归生成层级 Semantic ID,再以 item ranker 统一替换音乐推荐级联。
  • 2026-08 · Gryphon-v2:以共享历史编码器统一 SID 生成和 item-level 排序,用 rollout 与 logged impression 双来源蒸馏训练期 teacher。

Dable

  • 2026-09 · BAFF:用广告排名差与出价差的双轴过滤,降低 RTB A/B 共享训练日志的相互干扰。

AI VK

  • 2026-08 · VK Friend-GNN:以多哈希共享表压缩超大用户 embedding,并用时序邻接与 cutoff 避免邻居采样泄漏未来边。

Netflix

JD.com

Alibaba International Digital Commerce Group

  • 2026-09 · MIMA:将同请求物品组成多正例集合,以排他匹配监督互补兴趣,并用 activation routing 校准多通道分数。

Alibaba

  • 2026-08 · DCEO:以直接因果效应分离短期点击与长期用户价值,并用多目标策略权重优化电商搜索排序。
  • 2026-08 · TransRetrieval:把 target token 压缩、多域归一化与大规模 Transformer 检索结合,在受控 serving 预算下扩展召回模型。
  • 2026-08 · DREAM:以 L0/L1/L2 意图、策略记忆和有界 typed compiler 控制现有推荐链路,再用离线探索与线上结论回流持续更新策略。
  • 2026-08 · MetaStrategy:根据请求生成带类型的多目标排序策略,并由确定性 compiler 校验、执行和审计。
  • 2026-07 · SWAG:以 masked future plan 和滑动窗口目标进行长周期生成式自动出价。
  • 2026-07 · SpecFormer:以谱软化 attention 与谱残差位置编码缓解推荐 Transformer 的表征坍缩。
  • 2026-07 · TSGR:用 residual semantic prefix 加并行全局/query 价值码生成候选,再以联合 VRM 把相关性与商业价值统一排序。
  • 2026-07 · RecGPT-V3:以可增量 Memory Hub 压缩长期行为,把文本与商品 Semantic ID 统一进基础模型,再将显式 CoT 蒸馏为可重建 latent intent token。
  • 2026-07 · TMallGS:通过 field-wise QKV、噪声门控、FiLM 与 progressive supervision 统一 query、行为和商品字段。
  • 2026-07 · DANet:对折扣率时间序列做高低频分解,并用用户折扣偏好和促销上下文修正 CVR 预测。
  • 2026-07 · SAM:学习购买后的兴趣退出与个性化恢复周期,通过 ASGU 在注意力 logit 上动态压制重复意图。
  • 2026-07 · Prompt Generation:把异构特征组织成配置驱动的生成提示,通过 token 压缩和多种合并策略服务搜索与推荐召回。
  • 2026-06 · EvoRec:让模型候选和优化方法双轨进化,并从持久实验记忆中提炼下一代可复用技能。
  • 2026-06 · SSRLive:以静态/动态 Semantic ID、用户侧 decoder 和 User–Live Cross Module 联合建模直播内容身份与实时状态。
  • 2026-05 · DeGRe:离线用累计价值评估器做前瞻 beam 搜索,把逐前缀 dense 价值分布蒸馏到在线单次生成器。
  • 2026-05 · AKT-Rec:用 LLM 对齐内容与协同信号并生成层级 Semantic ID,通过非对称 head-to-tail 迁移改善长尾 CTR 排序。
  • 2026-05 · GrowthGR:用 ItemLTV 估计新品点击的长期增量,并以多价值 MoPO 对 Semantic ID 生成策略做偏好对齐。
  • 2026-05 · CQ-SID:用类目约束残差 Semantic ID 表示商品,再以多专家奖励和 EG-GRPO 优化生成检索。
  • 2026-05 · RecGPT-Mobile:在端侧用量化 LoRA LLM 把异构行为翻译成下一意图 query,并以 adaptive prompt 和漂移触发控制资源消耗。
  • 2026-05 · LWGR:把个性化 soft instruction 注入 LLM 世界知识,并用交叉注意力和拉格朗日约束与推荐分数融合。
  • 2026-02 · GRC:把生成、首错位置/属性反思和纠正串成结构化轨迹,再以 GRPO 与熵调度优化有限纠错预算。
  • 2026-02 · SIGMA:用 LLM 对物品做多视角语义 grounding,以混合 SID/ID token 和多任务 SFT 训练生成式推荐器。
  • 2026-02 · HiSAC:用层级投票生成少量兴趣 agent,再对超长历史做 query-conditioned soft routing。
  • 2025-12 · RecGPT-V2:以层级意图 agents、混合压缩表示、meta-prompt 和约束偏好 RL 升级淘宝意图推理。
  • 2025-09 · IntSR:把显式 query、隐式会话意图、时间信息和 POI 词表统一为搜索推荐生成框架。
  • 2025-08 · SaviorRec:用行为监督训练内容编码器,生成 RQ Semantic ID,并通过多行为适配模块改善冷启动。
  • 2025-06 · MGOE:构建宏观任务合并图,让 graph experts 显式传播多任务关系后进入独立预测塔。
  • 2025-05 · SORT-Gen:用 causal Transformer ordered regression 估计列表前缀多目标价值,再以目标队列、mask 和 MMR 单次批量生成 slate。
  • 2025-02 · FilterLLM:把新品文本一次性映射到用户词表分布,并用历史行为约束冷启动召回。
  • 2025-02 · SERAL:构建用户认知画像,用 IPO 对齐惊喜度偏好,并通过 nearline 链路注入推荐排序。
  • 2025-02 · LUM:通过 next-condition-item 预训练和 group query 压缩用户知识,再把生成表征注入判别式排序器。
  • 2025-02 · MIM:以遮盖多模态预训练和内容兴趣感知 SFT 对齐内容/协同空间,再由 CiUBM 融合排序。
  • 2023-11 · BEQUE:生成用户相关的搜索改写,并结合离线检索反馈、自采样与偏好排序优化改写质量。
  • 2022-05 · M6-Rec:把推荐任务统一改写为自然语言任务,在预训练语言模型上使用轻量 option-adapter 完成多场景适配。
  • 2020-06 · SIM:以候选 item 为 query,先从超长历史检索相关行为,再由精确搜索单元做候选相关注意力聚合。
  • 2019-05 · BST:把候选商品作为 token 与用户行为共同送入 Transformer,显式建模序列内依赖。
  • 2018-09 · DIEN:用 GRU 抽取逐步兴趣,以下一行为辅助监督并由候选相关门控控制兴趣演化。
  • 2018-04 · ESMM:在全曝光空间联合训练 CTR 与 CTCVR,并用 pCTR×pCVR 缓解点击后转化的选择偏差。
  • 2017-06 · DIN:用候选物品感知的局部激活单元,从用户历史中动态提取相关兴趣,并以 Dice 激活训练 CTR 排序模型。

Ant Group

  • 2024-03 · BAHE:缓存每个原子行为的浅层语言表示,只在线聚合高层序列,从而降低长文本 CTR 建模成本。

Baidu

  • 2025-03 · COBRA:先用稀疏生成缩小候选空间,再用稠密生成细排,形成级联式生成召回。

ByteDance / Douyin / TikTok

  • 2026-09 · SequenceO1:把远期超长历史压成固定预算 prototype sketch,并与近期行为分支共同建模。
  • 2026-09 · From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs:用双门控时序编码抑制行为噪声,并将重型用户编码与轻量候选交叉解耦,实现请求内共享计算。
  • 2026-08 · TM20K:教师保留完整行为 token,学生用连续合并和蒸馏压缩超长序列。
  • 2026-08 · DME:先做多模态对比预训练,再以 typed latent evidence 和 cross-conditional reconstruction 保留细粒度对侧语义。
  • 2026-08 · STEPS:用 ordinal planning、trajectory execution 与 filtering agent 闭合“是否推送—何时再唤醒”,并已在抖音全量部署。
  • 2026-05 · Rec-Distill:结合 batch 与 streaming teacher,把大模型知识蒸馏到轻量推荐 student,并优化跨任务可迁移性。
  • 2026-05 · MuChator:从多轮对话中发现显式与潜在意图,并结合会话反馈选择后续推荐候选。
  • 2026-05 · FLUID:把直播多模态切片量化成 slice/room 两级 LUCID,以 prefix n-gram late fusion 完全替代短生命周期候选 ID。
  • 2026-05 · PA-Bridge:对齐主动搜索与被动推荐的表征分布,使两种用户表达方式互相补充。
  • 2026-03 · HAP:按候选异质难度路由轻量/强预排分支,并以 harmonization 对齐不同计算预算。
  • 2026-02 · MixFormer:在统一 Transformer 中平衡 dense 特征交互与序列建模,并按预算选择可训练模块。
  • 2026-02 · MDL:把 feature、scenario、task 全部 token 化,并以 domain-feature attention 深层共享。
  • 2026-02 · MSN:用两轴 Product-Key Memory 扩大参数容量,每次只激活 top-k 槽位并与 dense 主干门控融合。
  • 2026-02 · TokenMixer-Large:交替执行无参数 token mixing、head-wise/token-wise SwiGLU,并以间隔残差和辅助头稳定深层扩容。
  • 2026-01 · HyFormer:联合编码用户序列与搜索 query,通过 query decoding 和 boosting 强化搜索推荐信号。
  • 2025-10 · OneTrans:用统一因果 Transformer 覆盖多场景排序,并复用 KV cache 降低线上推理成本。
  • 2025-07 · RankMixer:交替进行 token mixing 与逐 token FFN,并探索稀疏 MoE 以扩展工业排序网络。
  • 2025-05 · LONGER:结合混合注意力、InnerTrans、token merge 与 KV cache,扩展超长用户行为序列建模。
  • 2025-01 · AdaF²M²:通过 feature-mask 多次前向学习完整表征,再按用户/物品状态动态调节 adapter。

Dewu

  • 2026-08 · SPEAR:用双 embedding、confidence×relevance 乘法门和动态 selector 联合优化个性化改写与检索。

Google / YouTube

  • 2026-07 · HA-MoE:依据内容异构性动态路由领域、转移、内容与新鲜度专家,在单一模型中统一开放网页排序。
  • 2026-07 · ClockRoPE:从日/周周期 kernel 的 Fourier 频谱采样旋转频率,为生成式召回显式建模用户 routine。
  • 2026-07 · Dual-purpose Semantic IDs:让分层 SID 同时承载协同身份并通过 Semantic Decoder 重建内容 embedding。
  • 2026-07 · YouTube Freshness:比较 recency、IPS、bias tower 与不确定性探索对新内容反馈环的影响。
  • 2026-07 · RecEvolve:以知识库驱动候选提案、隔离实验、critic gate、冠军继承和回滚,形成可审计的推荐自主进化闭环。
  • 2026-06 · TokenMinds:让共享 encoder 同时产生稠密用户向量,并由 decoder 生成可落到内容语义空间的 SID 用户 token,再共同服务下游排序。
  • 2026-05 · Semantic-Native Long Sequence Modeling:以层级语义 ID、bigram、时间折叠和 global-local pooling 扩展视频长历史。
  • 2026-04 · AgenticRecTune:以 Actor、Critic、Insight、Skill 和 Online agent 闭合推荐配置的多轮实验反馈。
  • 2026-03 · Cross-domain KD:把 YouTube 等源域 teacher 的知识蒸馏到目标域,实现面向音乐发现的零样本迁移。
  • 2026-02 · Self-Evolving RecSys:让 LLM Agent 根据历史实验提出、评估和迭代推荐策略,形成自动改进闭环。
  • 2025-10 · PLUM:对 LLM 进行推荐语料 CPT 与 SFT,并以 Semantic ID 生成物品序列。
  • 2023-05 · TIGER:用 RQ-VAE 把物品量化为层级 Semantic ID,再通过自回归模型直接生成召回结果。
  • 2020-08 · DCN-V2:用低秩 cross experts 与输入相关 gate 高效学习有界阶数特征交互。
  • 2018-08 · MMoE:为 CTR、转化等任务学习独立 gates,以不同权重组合同一组共享 experts。
  • 2016-09 · YouTube DNN:用观看历史聚合与深层用户塔学习候选召回向量,再做大规模 item 近邻检索。
  • 2016-06 · Wide & Deep:联合显式 wide 特征交叉与 deep tower,兼顾共现记忆和未见组合泛化。

Huawei

  • 2026-07 · RAMP:用个性化/公共双路径、可用性 mask 和 prediction-alignment 蒸馏提升缺失用户字段时的广告排序鲁棒性。
  • 2025-02 · FuXi-α:用时间、语义等自适应多通道注意力和 multi-stage FFN 扩展推荐特征交互模型。
  • 2023-06 · KAR:让 LLM 生成用户偏好与物品事实知识,再由 hybrid-expert adapter 融合进传统推荐模型。
  • 2017-03 · DeepFM:用共享 embedding 联合 FM 二阶交互和 deep 高阶交互,减少手工特征交叉。

Kuaishou

  • 2026-09 · UniRec:联合预排和精排融合,以纵向偏好对齐、紧凑 pairwise 聚合和组相对正则协调级联阶段。
  • 2026-08 · HRPO:按层级 Semantic ID 前缀构造 residual credit-to-go,让生成式推荐的策略更新同时优化局部 token 与整条推荐轨迹。
  • 2026-07 · RecoReward:以目标/非目标推荐亲和力差作为多模态描述的训练奖励。
  • 2026-07 · TWICE:用双时钟和双窗口校正在线广告长期延迟转化。
  • 2026-07 · UniR²:用统一 decoder 和 Dual-Query Prefix-Causal Attention 同时学习层级 SID 生成与多目标排序,并以 ranking-only LoRA 避免梯度冲突。
  • 2026-07 · UAME:把满意度分数建模为均值—方差 Gaussian 变量,用多目标冲突产生的不确定性加权 pairwise 排序训练。
  • 2026-07 · RECAP:把流式用户画像维护为固定容量语义状态,并用推荐反馈评价器和 GRPO 闭环优化画像更新策略。
  • 2026-06 · POEM:将实时多目标排序信号转成偏序,动态构造兴趣序列。
  • 2026-06 · UniFormer:拆分 feature/task token 空间并统一交互,支持模型中心协同扩展。
  • 2026-06 · Recommendation as Generation:以解耦语义 ID 连接生成式推荐和兴趣条件内容生成。
  • 2026-06 · Taiji:在语义匹配与协同信号之间自适应选择 Pareto 工作点,兼顾冷启动与成熟内容。
  • 2026-04 · GloRank:在全局 Semantic ID action space 上做 listwise SFT 与组相对奖励优化,避免局部候选池限制。
  • 2026-04 · CS3:通过循环自修正、跨塔同步和级联教师信号增强仍可 ANN 服务的双塔模型。
  • 2026-04 · Dual-Rerank:以 AR 顺序教师蒸馏 NAR 并行名次学生,并把列表效用与延迟共同纳入目标。
  • 2026-02 · GR4AD:构造用户感知 Semantic ID,结合 LazyAR、可变长度生成和 RSPO 完成生成式广告召回。
  • 2026-01 · OneMall:以统一 Semantic ID、场景 prompt 和跨行为融合覆盖商品卡、短视频与直播生成推荐。
  • 2025-11 · DualGR:融合长短期兴趣路由、受约束 SID 前缀和曝光感知损失完成生成召回。
  • 2025-08 · MPFormer:以任务 token 驱动共享序列检索器,并按难度动态分配容量与 serving 配额。
  • 2025-08 · OneRec-V2:使用 lazy decoder 降低生成延迟,并用真实反馈强化学习和 GBPO 优化推荐序列。
  • 2025-02 · OneRec:把 session 推荐建模为 Semantic ID 序列生成,并结合 MoE 与偏好优化对齐真实反馈。
  • 2024-07 · TWIN-V2:离线层次压缩生命周期行为,在线通过候选相关 GSU 检索兴趣簇,再以 ESU 精确建模原始行为。
  • 2024-06 · CDM:将可控 MMR 教师的上下文多样性边际收益蒸馏到低延迟学生。
  • 2024-06 · CWM:以统一视频时长干预下的反事实观看收益抵消 duration bias。
  • 2024-05 · LEARN:冻结 LLM 生成内容增强表征,再通过协同域适配改善冷启动和长尾推荐。
  • 2024-03 · LSVCR:用 LoRA 学习 LLM 偏好,通过 SSC/VCC 双序列目标对齐评论语义和用户行为。

Meituan

  • 2026-07 · CORE:把三级电商相关性拆成两道条件边界,以 step-GRPO 提供细粒度 credit,再将 PostCoT LLM 蒸馏到在线双头模型。
  • 2026-07 · NONTP:在 NTP 上加入未来状态对比学习和跨域 hidden-state pooling,扩大生成式推荐的训练监督覆盖。
  • 2026-04 · MBGR:通过 business-aware SID、共享 MoE 和最近未来标签路由,同时学习多个业务域的生成目标。
  • 2026-02 · DOS:用协同/语义双流和正交 residual quantization 对齐 SID codebook 与生成空间。
  • 2025-10 · CRSD:用领域 reasoning teacher 构造增强视图,再让同一轻量学生执行普通/推理双视图对比自蒸馏,线上无需生成推理链。
  • 2025-02 · SessionRec:按真实 session 生成候选,并利用曝光负例和 hard negative 改善会话级召回。
  • 2024-12 · MSD:把 teacher 的用户知识自回归蒸馏到小模型,再通过 LoRA 和缓存表征对齐 CTR 任务。

Meta

  • 2026-09 · CORAL:在预算与执行约束下让 LLM 连续提出推荐配置,并以最近实验记忆和生产反馈驱动下一轮优化。
  • 2026-07 · ROCS:复用单次 request encoding,并在候选端执行轻量 late interaction,统一覆盖广告/自然流量的检索和排序 serving。
  • 2026-07 · OneShot:将层级索引纳入 ranking objective 共同训练,并以 neural interaction scoring 突破纯点积检索。
  • 2026-07 · Memory Layer:把 cache 纳入模型训练,以 eta=1 writeback 和 always-on 属性表征消除训练服务偏差与冷启动缺口。
  • 2026-07 · Mosaic:将多类用户 embedding 组织为 specialist fleet,并通过 MRM 联合标签与 cosine redundancy loss 保持新增表征的独特信息。
  • 2026-07 · WHALE:逐层耦合 Wukong 高阶特征交互和门控 HSTU 序列建模,形成共同扩展的统一排序模型。
  • 2026-07 · SlimPer:用固定容量 user-item knowledge base 逐层查询完整历史,并通过 Select–Match–Refine 把计算集中到候选相关证据。
  • 2026-07 · Cluster GOOBS:在线聚类用户或物品表征,并以 cluster-aware sampler 改善训练样本覆盖和头部集中。
  • 2026-06 · NEXT:用 VLM 生成并验证 item→intent→item directed edges,离线构图后在正反馈时在线注入。
  • 2026-06 · CMSL:用可学习兴趣 lenses 拆分多兴趣序列,并结合 HSTU 建模不同语义 strand。
  • 2026-06 · G2Rec:构建可微 soft graph,并联合图结构与生成式双目标学习用户—物品关系。
  • 2026-06 · RankGraph-2:用流行度校正边、离线多跳 PPR 和 residual cluster index 降低工业图召回的在线成本。
  • 2026-05 · SCALR:学习跨域条件分布并概率采样合成训练事件,替代覆盖度较低的确定性 top-k 翻译。
  • 2026-05 · Memento:采用 query-conditioned MMR 在相关性与多样性之间动态权衡,进行候选重排。
  • 2026-05 · LLM Retrieval:通过 domain SFT 生成层级广告属性,构建语义图并约束召回结果对属性扰动的稳定性。
  • 2026-05 · MM-LLM:把多模态内容转成 caption/token 特征,再注入推荐模型增强内容理解。
  • 2026-04 · HILL:用跨层 residual quantization 学习 coarse-to-fine 检索索引,减少候选打分量。
  • 2026-04 · SOLARIS:预测未来 user-item 请求,异步预计算 foundation-model latent,并通过 cache/fallback 服务线上排序。
  • 2026-02 · ULTRA-HSTU:组合半局部注意力、逐层扩窗 LBSL 与 Mixture of Transducers 扩展超长历史。
  • 2026-02 · MFLI:联合学习语义、流行度与新鲜度等多个 facet 索引,替代静态单空间 ANN。
  • 2026-02 · Kunlun:用 GDPA、分层 seed pooling、全局交互与 CompSkip 统一深层广告排序架构。
  • 2026-01 · LLaTTE:把 LLM 语义特征与推荐表征结合,并面向大规模排序设计特征交互结构。
  • 2025-06 · RADAR:在请求后异步运行完整排序器,把高价值结果缓存为下一请求的召回补充。
  • 2024-02 · HSTU:以分层顺序转导单元建模超长行为历史,用生成式目标统一大规模推荐排序。

Pinterest

  • 2026-07 · PinEqualizer:贯通探索 corpus、召回、排序与 utility,通过 engagement dropout、内容交叉、分 cohort calibration 和 UCB 缓解 fresh 内容反馈回路。
  • 2026-07 · PinDCO:以组件专塔学习相对广告基线的创意增量分数,再用 PAM 协调整页像素收益并以预筛控制成本。
  • 2026-07 · Pin-SCALE:用 engagement-aware SID、级联 pooling 和多视角对比对齐接入 dense retrieval。
  • 2026-07 · Downstream Rewards:离线筛选能预测未来参与度的长期 reward,再以模型无关附加头接入多个推荐 surface。
  • 2026-07 · Causal Retrieval:用 doubly-robust uplift 决定是否触发 shopping candidate generator。
  • 2026-07 · MESH:把 user/item/context 特征放入独立放大塔,再用 residual gated bias correction 保护 fresh 内容信号。
  • 2026-05 · Complementary LLM Ads Predictor:对广告主列表进行 SFT/GRPO,让 LLM 作为传统广告召回与排序的补充预测器。
  • 2026-05 · A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems:以双头 Q 网络和 Pareto 扫描选择可治理的个性化多目标 utility 策略。
  • 2026-03 · PinCLIP:以 VLM 图文对齐加 Pin-Board 邻居目标改善 fresh 内容表征。
  • 2026-02 · ML-DCN: Masked Low-Rank Deep Crossing Network Towards Scalable Ads Click-through Rate Prediction at Pinterest:用可学习 mask 与低秩交叉扩大 DCN 容量并保持线上成本中性。
  • 2025-09 · DRL-PUT:从 logged ads behavior 学习相关性、新颖性和收益等排序 utility 的动态权重策略。
  • 2025-07 · Click A, Buy B:拆分同物品 CABA 与跨物品 CABB 转化归因,并用商品 taxonomy 建立协同权重。
  • 2025-07 · PinFM:以 DCAT 等序列模块构建推荐 foundation model,并通过预训练—微调适配多个流量场景。
  • 2025-06 · TransAct V2:用候选感知的终身行为序列和 next-action 多任务目标增强 Homefeed 排序。
  • 2025-04 · PinRec:根据目标 outcome 生成多 token 物品表示,以条件生成方式完成召回。

Tencent / WeChat

  • 2026-07 · CCFormer:分离 ID 与内容字段后门控融合,并以分层压缩保留近期细节和远期兴趣,服务腾讯视频推荐。
  • 2026-07 · ASARL:用 Reason/Critic/Gen 多 Agent 闭环整理社交搜索数据,再经 SCT、偏好优化和蒸馏得到在线相关性模型。
  • 2026-07 · BARGE:用 item-level ICA 恢复多 token Semantic ID 边界,通过逐层 HPR 与正交双路径 DPD 抑制生成漂移。
  • 2026-06 · NOVA:以 architecture gradient 驱动候选修改,并用四级验证级联阻断可运行但语义错误的架构。
  • 2026-05 · UniVA:用 Commercial SID 和 generation-as-ranking 统一广告生成,并通过价值对齐 RL 与 trie beam 优化收益。
  • 2026-03 · OneRanker:用 fake item token 统一生成、价值预测和工业广告排序,并约束两种分布一致。
  • 2026-02 · S-GRec:以 LLM 个性化语义 judge 产生偏好监督,再用 A2PO 蒸馏到轻量 SID 生成器。
  • 2025-12 · HiGR:先生成层级 Semantic ID 簇再解码物品 slate,并以 ORPO 做列表偏好对齐。
  • 2024-12 · PRECISE:联合 LLM 语义 token 与协同 ID,使用 top-k MoE 和通用/目标训练建模序列推荐。
  • 2024-11 · LEADRE:生成意图感知 Semantic ID,并通过 DPO 对齐广告展示与转化偏好。
  • 2020-09 · PLE:把共享 experts 与任务专属 experts 分组,通过 CGC gates 逐层分离共性和任务特性。

Xiaohongshu

  • 2026-09 · SIRF:把 trigger、exemption 与账户级规则关系合成为持续预训练数据,并以单次 verdict 和 P95 阈值服务工业内容风控。
  • 2026-08 · OneModel:以共享长序列 backbone、场景条件门控和全局/局部分层表征统一推荐、广告与商家排序。
  • 2026-03 · IDProxy:先把多模态 LLM 表征对齐到协同 ID 空间,再通过多层 proxy adapter 和残差门控注入排序器。
  • 2025-05 · GenRank:把多种用户动作编码为生成目标,通过 action-oriented generation 完成端到端排序。
  • 2024-03 · NoteLLM:把内容压缩到特殊 token,以 GCL 注入协同信号,并用 CSFT 保持生成能力。

Yandex

  • 2026-07 · Long-History User Transformers:用异步全历史 Transformer 生成固定缓存,线上只编码近期事件,在不重算长序列的情况下增强广告排序。
  • 2025-07 · ARGUS:分解用户反馈与物品表示,在大规模 Transformer 中联合建模音乐序列。

Microsoft / Bing Ads

  • 2026-05 · HARNESS-LM:先训练强检索 teacher,再以 L2 对齐和冻结文档塔对比精修压缩在线 query encoder。

Airbnb

Teads

  • 2026-07 · Open Web UFM:以开放网页用户行为做双裁剪对比预训练和 next-item 监督,再把共享 user encoder 迁移到广告 CTR 与访问预测。

Spotify

  • 2026-05 · Stochastic Primal-Dual Decoding:解码时逐步更新约束乘子,在推荐相关性与用户满意度约束之间做序列级校正。
  • 2026-03 · GLIDE:用 residual Semantic ID 自回归检索,并联合近期历史与长期用户 soft prompt 扩大探索。
  • 2026-01 · Podcast MTL:共享广告、推广与 organic stream 表征,将高资源任务知识迁移给冷启动 podcast。

NetEase

Shopee

  • 2026-08 · KGD:以 BMTP、冻结知识迁移和正交 ACR 解耦预训练知识与推荐几何,使流式模型可以低成本刷新外部知识。
  • 2026-06 · OneRank:用原生统一 Transformer、任务私有通道和梯度隔离执行多任务排序。
  • 2025-09 · OnePiece:用上下文 token、块级 latent reasoning 和递进多任务训练统一级联排序。

Twitch

  • 2026-08 · Twitch Multi-Objective Ranking:联合即时与延迟直播反馈,并以生命周期分群 gate 调节共享专家,避免单一短期目标主导排序。
  • 2026-08 · LLM Thompson Priors:用 LLM 语义判断初始化评论冷启动先验,再通过分群 Thompson Sampling 在探索与点击收益之间自适应取舍。

JD.com

  • 2026-07 · OxygenREC-v2:把 click/cart/order instruction 内化到 SID 生成,并用未来交互特权教师与熵路由蒸馏联合后训练。
  • 2026-04 · GenRec:把下一页作为联合生成目标,通过非对称 Token Merger 和带 NLL 约束的 GRPO-SR 优化整页。

学术与经典基线

  • 2026-05 · MDCNS:从多种负样本分布协同采样,并通过双模型更新降低单一采样偏差。
  • 2018-08 · SASRec:用因果自注意力编码用户行为序列,并预测下一物品,作为经典序列推荐基线。

Michigan State University

  • 2026-08 · ConnectionMind:在时序异构社交图上用最短正路径 SFT 和规则奖励 GRPO 学习多步探索,再把路径教师蒸馏给 GNN student。

Kuaishou Technology

Amap / Alibaba

Huazhong Agricultural University (Kuaishou internship)

Rajax Network Technology / Taobao Shangou / Alibaba

QuintoAndar

University of Washington

NetEase Cloud Music

University of Science and Technology of China / Alibaba

Tubi

TikTok

Huawei Technologies

University of Electronic Science and Technology of China / Kuaishou

Authors did not disclose affiliation / large-scale e-commerce platform

Taobao & Tmall Group / Alibaba

Alibaba International Digital Commerce

Alibaba Group / Renmin University

Alibaba Group / Tsinghua University

Forth AI / Shopee / Singapore University of Technology and Design

LinkedIn

Tencent

The Hong Kong Polytechnic University

  • 2026-06 · Atomic Intent Reasoning:把跨域行为离线拆成可缓存的层级原子意图,再按目标商品检索并聚合意图链。

Huazhong University of Science and Technology

  • 2026-06 · ToolRec:联合工具相关性、置信度校准和调用代价,减少大模型助手的无效工具推荐。

University of Warwick

Institute of Information Engineering, CAS / Kuaishou

Apple

Shenzhen University

  • 2026-08 · DrEM:用偏好保持筛选、翻转风险反演和一致性融合稳定噪声 pxtr 集成排序。

Snap Inc.

University of Science and Technology of China

  • 2026-07 · DIRECTOR:用 Sinkhorn transport 与全局匹配并行生成无重复动态索引 slate。

Technical University of Denmark

  • 2026-07 · ZoRRO:零训练参数地融合时间衰减、内容相似和类别关系完成新闻个性化。

Shanghai Jiao Tong University

Alibaba International Digital Commerce Group

Tongji University

Bilibili

Harbin Institute of Technology

Beihang University

ByteDance AML

Beijing University of Posts and Telecommunications

North Carolina State University

Institute of Software, Chinese Academy of Sciences

Dream11

Allegro.com