复现总览¶
这是全部 reproduction adapter、实现状态和实验结论的底层统一总表。后续新增论文或 重跑实验时,只更新本页和对应论文 README,不再新建阶段性审计或批次汇总页。
工业搜广推论文可按公司、主题或 年月浏览;基础模型的架构、预训练、多模态与推理效率进入 基础模型目录,训练后算法进入 LLM 后训练。论文详情和物理路径保持不变。
每轮新增论文不再依赖零散搜索记录,而是先建立候选全集、再逐项进入明确终态;规则、 机器账本和强制校验见论文发现闭环与防遗漏审计。
原论文关键图规范¶
每篇论文页在“背景与主要改动”和“核心公式”之间固定展示一张原论文关键图,
优先选择架构图、模型结构图或训练/推理流程图。图片本地保存到论文目录的
assets/paper-figure-01.png,页面同时链接原始来源并保留版权说明。论文没有
结构图时,选择最能解释方法的原始流程、算法或实验截图;无法自动取得全文的
页面必须明确写出公开来源边界,不能用本地 Mermaid 图冒充原论文截图。
新增或刷新论文图时执行:
python -m pip install -e '.[paper-figures]'
python scripts/sync_paper_figures.py --only <arXiv ID 或论文目录关键词>
全库检查可执行:
抽取器优先使用 arXiv HTML 的图注关系,老论文自动回退到 PDF 图注定位裁剪。 少数非 arXiv 论文使用脚本中经过人工核验的公开 PDF 映射;稳定注释标记允许 后续重复刷新而不产生重复小节。
选文与记录规则¶
- 工业论文硬门槛:正文必须披露真实生产流量的量化线上 A/B;或由用户明确认可论文所述的统计显著全流量发布、业务收益与 guardrail 结论。仅“已部署”、离线 SOTA 或模拟器结果不算;未披露具体 lift 的 full-traffic 论文必须明确标注,不能换算成百分比。
- 基础模型论文门槛:不要求线上 A/B,但必须有公开 benchmark、同预算对照和可在 WikiText 等公开数据上实际训练的核心方法;只写公式或固定打分不进入复现表。
- 具名例外:SASRec、TIGER、Wide & Deep、DCN-V2、DIEN、BST、DeepFM、YouTube DNN、ESMM、MMoE、PLE 是用户明确要求补齐的经典骨架;其中缺量化线上 A/B 的条目会逐篇明示,不据此放宽后续新工业论文的门槛。
- 本地结果口径:每篇 README 明确基线、实验组、数据、主指标和相对变化;论文线上结果、本地跨模型比较、模块消融和效率对照分开写。
- 保真度:公开数据替代私有数据或缩小规模可以接受;核心网络、训练目标或推理路径被 heuristic 替代时,只能标为“概念验证”。默认批量运行不包含概念验证。
- 论文信息:每篇 README 顶部固定列出论文链接、公司/机构、精确首次公开日期及来源、原作者是否开源代码、Adapter 和本地复现代码位置;未找到原作者代码时必须明确写“否”,不能留空。没有独立 arXiv 页的正式会议论文使用官方论文集/机构发布页,不伪造 arXiv ID。
统一 DIN 实验使用 MovieLens-100K、时间 leave-two-out、全物品排序和 seeds 42/43/44;SERAL、LEADRE、COBRA、ARGUS、GR4AD、MM-LLM 使用同一 DIN NDCG@10 0.02167,Cross-domain KD 在独立 target split 上使用 DIN 0.05518。这些结果只代表当前公开小数据协议,不等同于论文私有工业数据结论。
当前进度¶
angle· ANGLE:层次文本标识、生成/判别/排序联合目标与动态约束检索。sas-attention· SAS:用 softmax 内连续 log-gate 让语言模型损失端到端训练稀疏上下文排序。mima· MIMA:以同请求多正例、排他匹配和兴趣激活校准缓解多兴趣坍缩。chronicle-rec· ChronicleRec:近密远疏压缩、因果时间锚点、多 horizon 与 alignment 预训练。pindco· PinDCO:组件专塔增量融合、整页像素惩罚、预筛与探索反馈闭环。gese· GESE:集合级标题探索、忠实度约束与上下文个性化选择。lazformer· LazFormer:可迁移生成式预训练、排序残差适配与近密远疏注意力。sirf· SIRF:将策略规范内化为可训练交互特征,并以独立的高分位误惩罚约束验证策略决策。unirec· UniRec:统一预排/精排融合、纵向偏好对齐与组相对正则。sequenceo1· SequenceO1:固定预算 Sketch Attention、近期分支与超长序列缓存设计。baff· BAFF:RTB 共享日志的广告排名/出价双轴干扰过滤。allecompanion· AlleCompanion:类别约束双塔、ComCat 互补类别图与受控 Category Adapter。autolr· AutoLR:多专家评审、证据加权实验预算与确定性上线晋级门。beaconkv· BeaconKV:用 query 簇 beacon 预测长推理中的远程 KV 重访。kvmem· KVMEM:分页 KV 虚拟化与查询相关 Agent 工作区物化。coral· CORAL:Meta 的约束配置、短期实验记忆与生产效果反馈闭环。recevolve· RecEvolve:Google 的知识驱动提案、隔离实验、回滚与防 reward hacking 控制器。random-attention· Random Attention:prompt 保护、逐 head 随机 KV 淘汰及真实 Qwen/A100 验证。lngram-v2· Lngram v2:离散 latent n-gram memory、GQA zero sink 及真实 VLM/A100 验证。rest· ReST:双门控时序编码与可复用用户前缀的工业排序。tgr· TGR:统一生成式排序、语义 ID 和离线 reason token。camie· CAMIE:用共同互动对齐多模态商品向量。-
setmir· SetMIR:兴趣集合预测、presence 门控与动态 ANN 派发。 -
已审计个人博客两个工业落地章节的 94 个主条目和 138 个 arXiv 链接。
- 已登记并复核 292 个 adapter;其中推荐论文继续执行线上 A/B/full-traffic 证据门槛,基础模型论文执行公开 benchmark 与真实训练门槛。
- 暂缓:AIGQ(缺等价 query/CTR reward)、RaG(依赖视频生成与质量反馈)、RoleGen(缺 conversion trajectory 与线上反馈闭环)、LCU(数据需保密协议)。
- 跳过:EGA-V1;仅有离线结果或无法核验量化线上 A/B 的论文不进入实现队列。
- 2026 年剩余硬门槛论文已进入核心机制复现;2026-07-27 的 P1 批次加入 8 篇工业推荐论文,并把 Engram、Looped Latent Attention、GaugeQuant 三个真实算子接入 LLM evolve。GRACE、DLMRec、LO-FAR、PRL 因缺量化线上证据未纳入推荐复现。
- 2026-07-28 最近论文增量加入 Meta Mosaic、快手 UniR²、美团 CORE 与基础模型 DataOrchestra;前三篇均通过量化线上 A/B 门槛,DataOrchestra 有官方代码与公开预训练 benchmark。
- 2026-07-30 跨领域增量加入腾讯 CCFormer、Teads Open Web UFM、Meta ROCS 与基础模型 WIDE;前三篇分别提供线上 A/B、全生产流量或量化部署证据,WIDE 提供官方代码和公开剪枝/吞吐实验。
- 2025 工业 P0 补漏加入 MIM、FilterLLM、FuXi-α、RecGPT-V2、HiGR、DRL-PUT、AdaF²M²、MGOE 与 Click A Buy B;9 篇均有量化生产 A/B,并已在 MovieLens-1M 上执行独立核心机制。
- 2025 LLM evolve P0 加入 DeepSeek NSA、Qwen Gated Attention 与 Moonshot Muon;结构和优化器可组合搜索,并完成 WikiText-2 同预算对照与四轮 evolve。
Google / Meta 正文证据补漏(10 个 P0 adapter)¶
memory-layer· Meta Memory Layer:训练内 eta=1 writeback 把 item cache 纳入模型状态,并用 always-on 属性表征覆盖冷启动与缺失 ID。scalr· Meta SCALR:从跨域事件学习条件分布,以概率采样而非 top-k 复制生成覆盖更广的训练事件。hill-index· Meta HILL:以 coarse-to-fine residual quantization 学习分层索引并减少在线候选打分量。-
semantic-native-longseq· Google Semantic-Native Long Sequence Modeling:用层级语义 ID、bigram、时间折叠及 global-local pooling 扩展视频历史。 -
ha-moe· Google Discover HA-MoE:异构性门控多专家;7 天 1% 流量 A/B。 dual-sid· YouTube Dual-purpose Semantic IDs:SID 同时表达协同身份并重建内容 embedding。agentic-rec-tune· Google Discover AgenticRecTune:Actor–Critic–SkillHub 多轮推荐优化闭环。mfli· Meta MFLI:多切面可学习实时检索索引。kunlun· Meta Kunlun:GDPA、分层 seed pooling 与 CompSkip 的统一深层架构。ultra-hstu· Meta ULTRA-HSTU:semi-local attention、LBSL 与 Mixture of Transducers。
这批候选均由机构/主题先召回,再逐篇检查正文和表格;不再要求摘要先出现 A/B 关键词。六篇均完成公开数据实验、固定指标、论文原图与 evolve 可执行映射(AgenticRecTune 对应控制器回归样例,而非伪造网络结构)。
2026 历史 P0 · H02(8 个 adapter)¶
drem· DrEM:以偏好保持噪声筛选、pair-label 翻转风险反演和一致性融合稳定多路 pxtr 排序。incrementality· From Prediction to Incrementality:以潜在结果差和不确定度执行同预算因果 targeting,不再按 treated outcome 直接排序。tm20k· TM20K:教师保留完整历史,学生用连续 token merge 与注意力蒸馏压缩超长序列。transx· TransX:分离可缓存行为流和请求时服务流,以 cross-attention 降低重复计算。snaplgr· SnapLGR:共参与传播、分层 residual SID、token grounding 与 SID sequence SFT。psg· PSG:在 ordered pair 空间生成并展开 slate,将六 item 解码缩短为三步。director· DIRECTOR:用 Sinkhorn transport 和全局匹配并行生成无重复动态索引 slate。reward-guided-decoding· Reward Guided Decoding:以 KL 正则闭式策略在不重训生成器的情况下引入业务 reward。
八篇均保存 seeds 42/43/44 的公开数据结果、原论文关键图、线上证据与明确复现边界;对应结构已注册为可执行 genrec evolve mutation。
2026 历史 P0 · H03(9 个 adapter)¶
specformer· SpecFormer:谱软化 attention 与谱残差位置编码。egr· EGR:共享编码器联合学习 item 索引向量和用户查询向量。zorro· ZoRRO:零训练参数的 recency、语义和类别关系排序。elise· Apple Music ELISE:dense/lexical 分位数校准与混合检索。poem· POEM:由实时多目标排名信号构造偏序行为序列。uniformer· UniFormer:特征空间与任务空间统一 token 交互。rag-generation· Recommendation as Generation:解耦语义 ID 连接推荐和内容生成。onerank· OneRank:Transformer-native 多任务私有通道与梯度隔离。piano· PIANO:query-driven interest refiner 与 listwise information node。
九篇均执行独立核心计算、保存三随机种子公开结果和原文关键图,并注册为可执行 genrec Evolve 算子。所有本地结果只用于机制验证,不外推为论文生产 lift。
2026 历史 P0 · H04(9 个 adapter)¶
atomic-intent· Atomic Intent Reasoning:以层级原子意图树拆解查询,再按候选与意图路径的一致性重排。toolrec· ToolRec:联合建模工具相关性、置信度校准和业务代价,过滤过度触发的工具推荐。ssrlive· SSRLive:静态与动态语义 ID 配合用户—直播间交叉模块,统一内容身份和实时状态。taiji· Taiji:在语义匹配与协同信号之间自适应选择 Pareto 工作点。primal-dual-decoding· Stochastic Primal-Dual Decoding:解码时动态更新约束乘子,在相关性与业务约束之间逐步校正。muchator· MuChator:从多轮会话发现潜在意图,并把显式与隐式反馈共同用于候选排序。causal-representation· Causal Representation Learning for Generalisable Recommendation:残差化环境混杂因素,保留跨环境更稳定的因果偏好表示。policy-facet· Policy-Grounded Dynamic Facet Suggestions:以离线 taxonomy、在线召回和策略约束排序生成动态搜索 facet。pa-bridge· PA-Bridge:对齐主动搜索与被动推荐的表征分布,桥接两类用户表达信号。
九篇均保留论文生产证据和公开数据复现边界,使用 MovieLens 三随机种子执行相互独立的核心机制,并把对应结构注册为可运行的 genrec Evolve mutation;本地负结果不会被隐藏或改写为提升。
2026 历史 P0 · H05(10 个 adapter)¶
marc· MARC:从中间层抽取任务相关表征,显式解耦推荐适配与低维压缩。rankup· RankUp:随机置换多 embedding、全局 token 和任务解耦共同提升表征有效秩。sid-coord· SID-Coord:用层级 SID、目标感知 HID–SID 门控和兴趣对齐增强长尾泛化。rclrec· RCLRec:把转化相关行为逆序组成短课程,为稀疏转化提供中间监督。tagllm· TagLLM:用用户兴趣手册约束细粒度多模态标签,再将标签能力蒸馏到小模型。genfacet· GenFacet:联合生成搜索分面和改写 query,并以检索满意度做偏好对齐。cgr· CGR:在自回归重排中直接执行约束感知奖励剪枝。hpgr· HPGR:以 session 层级预训练和偏好引导稀疏注意力改造平铺行为序列。climber-pilot· Climber-Pilot:将多步消费前瞻蒸馏到单步召回,并在 attention 内注入业务指令。rolegen· RoleGen:通过功能角色和反事实转化路径发现能激活休眠用户的桥接物品。
十篇均有独立核心计算、seeds 42/43/44 公开数据产物、论文关键原图和可执行 genrec Evolve operator;线上数字与本地机制实验严格分栏记录。
2026 历史 P0 · H06/H07(15 个 adapter)¶
unimvt· UniMVT:联合学习去偏 CTR 与因果 uplift,显式估计 treatment 和 counterfactual 响应。rq-gmm· RQ-GMM:以残差高斯混合量化替代硬聚类,用概率语义 ID 增强多模态 CTR。capts· CAPTS:以价值感知匹配和跨渠道自适应路由选择 I2I 召回 trigger。mlcc· MLCC:分层压缩并交叉低维特征,在受控计算量下扩大推荐网络容量。ug-sep· UG-Sep:拆分用户侧与通用计算,复用只需计算一次的表示。smes· SMES:用渐进式稀疏路由和去重执行,为不同任务动态分配专家容量。pit· PIT:按用户动态组合 item token,使生成式推荐的语义 ID 表达个体偏好。zenith· Zenith:以 Prime Token Fusion 和 Boost 扩展直播排序模型。easq· EASQ:用独立 LoRA 与多任务路径把稀疏问卷满意度接入在线学习。s2gr· S2GR:把语义引导逐步写入潜空间推理,增强生成式推荐的中间决策。sparsectr· SparseCTR:组合全局、转移和局部稀疏注意力,建模千级长期行为序列。hcub· HCUB:用层级上下文 uplift bandit 学习目录个性化的增量收益。airbnb-ebr· Airbnb EBR:用旅程级检索和多阶段排序统一体验推荐链路。promise· PROMISE:以过程奖励监督生成式推荐的中间推理。harmonrank· HarmonRank:用关系感知注意力和一致性约束协调多阶段工业排序。
十五篇均有相互独立的核心机制、seeds 42/43/44 公开数据结果、论文关键原图和可执行 Evolve operator。H06/H07 完成后,冻结的 55 篇 2026 历史 P0 队列已全部实现。
2026-08-24 近期跨领域增量¶
oneshot-index· OneShot:Meta/Instagram 将层级索引与排序目标共同训练,并以 neural scoring 替代纯点积检索;已全量部署全球流量。clockrope· ClockRoPE:YouTube/Google DeepMind 从周期 kernel 的 Fourier 频谱采样旋转频率,为生成式召回显式建模日、周 routine。next-vlm· NEXT:Meta 用 8B VLM 构造 item→intent→item 的 directed NKG,并把推理移到离线、线上只注入验证边。onemodel· OneModel:小红书以共享长序列 backbone、场景门控和分层用户表征统一推荐、广告与商家排序,并披露三个生产场景的量化 A/B。rare· RARE:把表征编辑方向投影到 MoE router 零空间,并在下游保护层校正传播漂移,保持原专家路径。
2026-08-26 最新增量¶
tagr· TAGR:快手直播广告用稳定词表的两级语义/协同 ID、多尺度兴趣和行为价值门控做生成式推荐;论文生产 A/B 的 LRE +8.5%、SCC +7.4%、Revenue +16.1%。wemm-embedding· WeMM-Embedding:微信把多模态对齐、跨尺度 teacher refinement 与 Matryoshka embedding 合成统一检索模型;报告说明 14 项线上 A/B 收益已全量发布并公开代码与权重。
2026-08-27 最新增量¶
dceo· DCEO:淘宝搜索以上下文条件 actor 直接优化长期用户价值的相对因果效果;41 天生产 A/B GMV +0.36%。transretrieval· TransRetrieval:跨域广告召回使用 norm-aware 聚合、target-token 压缩和位置化 domain embedding;一个月 5% 流量 A/B 收入 +2.53%。vbvr-pro· VBVR-Pro:以任务专用可执行 scorer 替代通用 VLM judge,为原生视觉推理提供状态级 verifiable reward。mllmclip· MLLMCLIP:从 MLLM 各层按 attention 选 teacher token,再以 CKA 对齐轻量 CLIP 的视觉与文本特征。
2026-08-29 最新增量¶
friend-gnn· VK Friend-GNN:以多哈希共享表压缩超大用户 embedding,并用按时间排序邻接与二分 cutoff 避免时序邻居采样的数据泄漏;论文在 VK 生产 A/B 中报告好友添加数 +16.0%、独立添加好友用户数 +11.5%。pace-vlm· PACE:用浅层视觉 preview 自适应设置 token budget,并融合 LLM/ViT 注意力;真实 Qwen2.5-VL + RealWorldQA 路径在 A30 验证。twinkv· TwinKV:以 orphan/donor 配对修复任意 KV eviction policy,保持缓存预算严格不变;真实 Qwen3 KV + WikiText-2 长上下文路径在 A30 验证。
2026 历史扫描 B01~B03(18 个 adapter)¶
dynamic-codebook· Dynamic Single-Level Large Semantic Codebook:曝光加权动态大码本、独立碰撞码和短 SID 解码。netflix-mediafm· Netflix Multimedia Asset Personalization:冻结多模态特征、统一资产双塔和查询感知打分。ogr· Once Generated, Ranked:统一语义-协同 ID、列表规划与保守策略对齐。inthq· IntHQ:长短双流上的分层任务交互查询。pushdualgen· PushDualGen:先生成 SID,再按需生成可解释 copy。recharness· RecHarness:用 bandit 在有限预算下路由多轮结构实验。gala· GALA:多模态三元组预训练、GRPO 行为对齐和 ID 门控融合。feedback-policy· Feedback-Grounded Policy Discovery:从反馈发现生成策略并蒸馏到线上轻量排序器。real-estate-rerank· LLM-Based Re-Ranking for Real Estate Search:结合对话意图、房源文本和候选集合统计重排。adaptive-ad-load· Adaptive Ad Load Design:在收入与转化约束下动态选择广告数量。guess-where-you-go· Guess Where You Go:时空 SID、课程训练和长期反馈策略优化。genpage· GenPage:以单模型生成整页并用长期奖励后训练。journeyformer· JourneyFormer:统一编码长期与短期 Airbnb guest journey。l2rec· L2Rec:个性化双视图 LoRA-MoE 与跨视图融合。qgs· QGS:query-item 联合序列、Linear HSTU 和生成式搜索。tubifm· TubiFM:同一 user-story foundation model 统一三种排序任务。pearl-percentile· PEARL:多样本对比得到低方差、低偏置的行为 percentile。dadf· DADF:冻结基模型并学习分布感知的乘性残差校正。
本轮全域 P0 补齐(19 个 adapter)¶
glorank· GloRankdual-rerank· Dual-Rerankoneranker· OneRankerradar· RADARdualgr· DualGRmpformer· MPFormerhap· HAPonepiece· OnePieceintsr· IntSRcdm· CDMcwm· CWMrope· RoPE / RoFormeralibi· ALiBigqa· GQAhymba· Hymbamoba· MoBAblt· Byte Latent Transformerdoremi· DoReMidata-mixing-laws· Data Mixing Laws
每篇详情页都给出原文代码状态、核心公式、原论文关键图、原文效果、本地公平基线、固定指标与可执行命令;本地负结果同样保留。
本轮全域 P1 补齐(8 个 adapter)¶
- 工业推荐:TWIN-V2、SIM、CRSD。
- 多模态:CLIP、BLIP-2、LLaVA、SigLIP 2、SmolVLM。
- 推理与部署:Speculative Decoding、AWQ、Medusa。
2026-08-09 P0/P1 增量(9 个 adapter)¶
twitch-mor· Twitch Multi-Objective Rankingllm-ts-prior· LLM-Derived Thompson Priorskgd· KGDhrpo· HRPObakron· BaKronmacro· MACROhilp· HiLPdblast· DBLastqevict· QEvict
前四篇工业论文满足量化线上 A/B / 全量部署门槛;后五篇归入基础模型目录。所有条目均已执行核心机制并保存 seed 42 指标,负结果与不显著线上结果不做美化。
2026-08-13 MR7 增量(3 个 adapter)¶
sona· Sona:压缩历史、Semantic ID 自回归生成与 item ranker 单模型替换音乐推荐级联。metastrategy· MetaStrategy:LLM 生成 typed strategy,由确定性 compiler 执行多目标排序。gas· GAS:用可删除 MoT 生成分支执行连续 Next Embedding Prediction,以零部署开销增强多模态理解。
两篇工业论文均在正文披露真实流量量化 A/B;本地 MovieLens-1M 训练均保留负结果,不把原文线上收益移植为复现指标。GAS 属于基础模型/多模态论文,不要求线上 A/B,本地公开像素实验与论文数字分栏呈现。
2026-08-20 工业增量(2 个 adapter)¶
connectionmind· ConnectionMind:Meta 与密歇根州立大学将时序异构图、最短路径 SFT、规则奖励 GRPO 和路径蒸馏组合为社交推荐系统;数千万用户多周 A/B 的曝光、观看时长和 session 均有量化提升。dream· DREAM:淘宝在原召回/排序链路上增加三层意图、策略记忆、typed 参数编译与离线/在线 Reward Dual Loop;精排+重排线上 IPV +2.71%、Core IPV +3.06%、GMV +1.31%。
两篇均执行了各自核心训练/控制链路;ConnectionMind 使用论文同款 Delicious 数据并保留 NDCG@10 -7.44% 的负结果,DREAM 的本地正向相关性伴随明显头部偏置,文档同时披露。
2026 历史扫描 B04~B06(19 个 adapter)¶
19 篇均逐篇核验正文中的生产 A/B 位置,并在 MovieLens-100K 的相同切分、候选集与 seed 42 下运行独立核心机制;线上数字与本地结果严格分栏。
B04¶
prl-puts· PRL-PUTS:双头 Q 网络与 Pareto utility 扫描。ektm· Effective Knowledge Transfer for Multi-Task Recommendation Models:任务相似度驱动的多任务知识迁移。adasid· AdaSID:碰撞负载与语义相容性驱动的动态 SID。unirec-coa· UniRec:属性链生成与业务偏好对齐。uniscale· UniScale:Entire-Space 数据与模型协同扩展。gatesid· GateSID:冷启动感知的语义/协同门控。
B05¶
aigq· AIGQ:混合 query 生成与 IL-GRPO。safro· SaFRO:满意度感知的双重相对策略优化。sort-ranking· SORT:工业 Ranking Transformer 系统优化。quasid· QuaSID:资格感知的 SID 碰撞约束。gpl-prerank· Generative Pseudo-Labeling:LLM 伪标签增强在线预排序。ltv-video-ranking· Long-term Value Prediction:位置去偏与长期价值建模。
B06¶
rgalign-rec· RGAlign-Rec:排序器指导的潜在 query 对齐。linkedin-feed-sr· LinkedIn Feed SR:工业长序列 Feed 排序。cadet· CADET:候选后上下文条件化广告 CTR。diffureason· DiffuReason:扩散式潜在推理与 GRPO。sarm· SARM:MLLM 语义 anchor 增强直播排序。ml-dcn· ML-DCN:Masked Low-Rank DCN 特征交叉。rag-qac· RAG-QAC:RAG 与多目标对齐的查询补全。
2026 历史扫描 B07(9 个基础模型 / 基础设施 adapter)¶
tcab· Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing:用最大耦合和最小生成树共享相同决策的反馈,同时保持每个自适应策略的边际轨迹分布不变。olmpool-long-context· Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension:以受控 7B 模型池隔离 normalization、GQA、预训练长度和滑窗注意力对长上下文扩展的复合影响。distillcache· DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference:把 KV 淘汰视为序列决策,以逐步 KL 奖励训练轻量策略保留未来预测分布。autonomy-heads· Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry:直接从冻结 QK 投影的谱有效秩区分 retrieval 与 streaming heads,无需校准数据或运行时门控。physics-mm-pretraining· Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes:用受控实验刻画模态知识流、协同/竞争、早期统一和共享 attention+norm/模态专属 FFN 配方。ttcd· Learning What to Remember: Test-Time Training via Context Distillation:长窗口教师以隐藏状态差异监督短窗口学生的 fast weights,使有限记忆优先保留未来有用信息。dart· DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling:保留 Mamba-2 chunk state contributions,解码 token-conditioned K/V 并执行 state-memory attention。transmem· TransMem: Transforming Hidden States into Memory for Large Language Models:将冻结骨干的稀疏历史 hidden states 变换成可复用参数记忆,并用 evidence-conditioned self-distillation 学门控。c2kv· C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference:以 compression tokens 和结构化 attention 学习位置无关、可拼接的压缩 KV manifold,并联合训练压缩与复用。
全部复现(262/262)¶
| 保真度 | Adapter / 论文 | 原论文线上效果 | 本地结论 |
|---|---|---|---|
| 核心机制 | pace-vlm · PACE |
无工业 A/B;论文报告 10% 视觉 token 保留 93.8% 平均性能、TTFT 最高 3.1× | APC/DDAE 公式、RealWorldQA 同 checkpoint 质量/token/延迟/显存和 Evolve 配方均可审计 |
| 核心机制 | twinkv · TwinKV |
无工业 A/B;LongBench/LooGLE/RULER/MMLU-Pro 离线结果且含失败任务 | fixed-budget repair、真实 Qwen3 KV reconstruction/延迟/显存和 Evolve attention operator 均可审计 |
| 核心机制 | prl-puts · PRL-PUTS |
P2P impressions +0.30% | 双头 Q 网络与 Pareto utility 扫描;NDCG@10 +39.64% |
| 核心机制 | ektm · Effective Knowledge Transfer for Multi-Task Recommendation Models |
eCPM +3.93% | 任务相似度驱动的多任务知识迁移;NDCG@10 +10.98% |
| 核心机制 | adasid · AdaSID |
GPM +1.16% | 碰撞负载与语义相容性驱动的动态 SID;NDCG@10 -6.30% |
| 核心机制 | unirec-coa · UniRec |
GMV +5.60% | 属性链生成与业务偏好对齐;NDCG@10 -4.93% |
| 核心机制 | uniscale · UniScale |
GMV +2.04% | Entire-Space 数据与模型协同扩展;NDCG@10 -2.20% |
| 核心机制 | gatesid · GateSID |
GMV +2.60% | 冷启动感知的语义/协同门控;NDCG@10 +34.95% |
| 核心机制 | aigq · AIGQ |
GMV +10.68% | 混合 query 生成与 IL-GRPO;NDCG@10 +8.09% |
| 核心机制 | safro · SaFRO |
watch time +0.61% | 满意度感知的双重相对策略优化;NDCG@10 +81.86% |
| 核心机制 | sort-ranking · SORT |
orders +6.35% | 工业 Ranking Transformer 系统优化;NDCG@10 -13.11% |
| 核心机制 | quasid · QuaSID |
GMV-S2 +2.38% | 资格感知的 SID 碰撞约束;NDCG@10 -0.55% |
| 核心机制 | gpl-prerank · Generative Pseudo-Labeling |
CTR +3.07% | LLM 伪标签增强在线预排序;NDCG@10 +12.84% |
| 核心机制 | ltv-video-ranking · Long-term Value Prediction |
VV +2.49% | 位置去偏与长期价值建模;NDCG@10 +9.73% |
| 核心机制 | rgalign-rec · RGAlign-Rec |
CTR@3 incremental over QE-Rec +0.13% | 排序器指导的潜在 query 对齐;NDCG@10 -14.03% |
| 核心机制 | linkedin-feed-sr · LinkedIn Feed SR |
time spent +2.10% | 工业长序列 Feed 排序;NDCG@10 -0.12% |
| 核心机制 | cadet · CADET |
CTR +11.04% | 候选后上下文条件化广告 CTR;NDCG@10 -6.20% |
| 核心机制 | diffureason · DiffuReason |
ad consumption +1.15% | 扩散式潜在推理与 GRPO;NDCG@10 -6.50% |
| 核心机制 | sarm · SARM |
watch count +1.19% | MLLM 语义 anchor 增强直播排序;NDCG@10 +44.74% |
| 核心机制 | ml-dcn · ML-DCN |
platform-wide CTR +1.89% | Masked Low-Rank DCN 特征交叉;NDCG@10 -2.08% |
| 核心机制 | rag-qac · RAG-QAC |
suggestions taken +3.46% | RAG 与多目标对齐的查询补全;NDCG@10 -4.48% |
| 核心机制 | dynamic-codebook · Dynamic Codebook |
消费指标 +0.792%,解码 FLOPs 约 -48% | 动态码本与碰撞码;NDCG@10 -18.73%,保留负结果 |
| 核心机制 | netflix-mediafm · Netflix MediaFM |
Search playthrough +0.36% | 冻结多模态特征与查询打分;NDCG@10 -9.52% |
| 核心机制 | ogr · OGR |
Effective Views +1.120% | 统一 SID、列表规划与保守对齐;NDCG@10 +13.25% |
| 核心机制 | inthq · IntHQ |
UVCTR +1.60% | 分层任务查询;NDCG@10 -7.38% |
| 核心机制 | pushdualgen · PushDualGen |
有效播放率 +8.50%、不满意率 -37.70% | SID→可选 copy;NDCG@10 +1.19% |
| 核心机制 | recharness · RecHarness |
ADVV +2.084%、Revenue +0.534% | UCB 预算路由;NDCG@10 -9.02% |
| 核心机制 | gala · GALA |
订单量 +0.55% | 多模态行为对齐门控;NDCG@10 -5.60% |
| 核心机制 | feedback-policy · Feedback Policy |
Revenue +4.506%、ADVV +4.621% | 反馈策略与保守增量;NDCG@10 +2.76% |
| 核心机制 | real-estate-rerank · Real Estate Re-ranker |
CTR +5.3%、预约看房 +4.8% | 文本/属性集合重排;NDCG@10 -8.21% |
| 核心机制 | adaptive-ad-load · Adaptive Ad Load |
Revenue +36.8%、Conversion -1.1% | 受约束广告负载;NDCG@10 持平 |
| 核心机制 | guess-where-you-go · Gwhere |
P-CTR +5.83%、U-CTR +6.20% | 时空 SID 下一 POI;NDCG@10 +9.38% |
| 核心机制 | genpage · GenPage |
核心参与度 +0.24%、时延 -20% | 页面联合效用;NDCG@10 -3.98% |
| 核心机制 | journeyformer · JourneyFormer |
Bookers +0.55%、Booked Nights +0.82% | 长短 journey 时间编码;NDCG@10 -2.77% |
| 核心机制 | l2rec · L2Rec |
CTR +9.24%、Reply Rate +3.15% | 双视图个性化适配;NDCG@10 -5.04% |
| 核心机制 | qgs · QGS |
CTR +0.62%、PV Duration +3.55% | query-conditioned SID 打分;NDCG@10 +0.73% |
| 核心机制 | tubifm · TubiFM |
Search TVT +3.9%、Carousel TVT +0.30% | 统一三任务模型;NDCG@10 +0.45% |
| 核心机制 | pearl-percentile · PEARL |
Watch Duration +2.10%、Report Rate -6.91% | 多样本 percentile;NDCG@10 -10.65% |
| 核心机制 | dadf · DADF |
Time Spent +0.649%、生产 MAE -12.57% | 冻结基模乘性残差;NDCG@10 持平 |
| 核心机制 | connectionmind · ConnectionMind |
Meta 数千万用户多周 A/B:曝光 +0.33%、观看时长 +0.43%、视频 session +0.22% | Delicious-2K 路径 SFT→GRPO→蒸馏混合推理;NDCG@10 -7.44%,保留负结果 |
| 核心机制 | dream · DREAM |
淘宝精排+重排 IPV +2.71%、Core IPV +3.06%、GMV +1.31% | 意图→策略记忆→安全编译→双环门控;NDCG@10 +39.36%,但 head share +94.37% |
| 核心机制 | gas · GAS |
纯多模态:from-scratch Overall 47.25→48.25;推理开销 0% | MoT + NEP + EMA;Fashion-MNIST QA 61.1%→63.5%,部署参数开销 0% |
| 核心机制 | sona · Sona |
Yandex Music Active Users +4.53%、时长 +6.30%、Likes +11.42% | history compression + SID decoder + ranker;NDCG@10 -92.05%,保留负迁移 |
| 核心机制 | metastrategy · MetaStrategy |
淘宝 click PV +2.11%、IPV +3.12%、交易金额 +2.83% | typed bundle + deterministic compiler;NDCG@10 -8.51%,head share -42.94% |
| 核心机制 | crsd · CRSD |
美团 AdCTR +0.91%、AdCVR +1.06%、GTV +0.40% | 两阶段 reasoning distillation;MovieLens-100K NDCG@10 -2.14%,保留负迁移 |
| 核心机制 | twin-v2 · TWIN-V2 |
快手三场景 Watch Time +0.672%/+0.800%/+0.728%,主流量 | 层级压缩 + GSU/ESU;NDCG@10 +22.45% |
| 核心机制 | medusa · Medusa |
纯 LLM:Medusa-1 2.2×,Medusa-2 2.3–3.6× | WikiText-2 三 future heads;backbone calls -50%,输出完全一致 |
| 核心机制 | awq · AWQ |
纯 LLM:TinyChat 相对 FP16 超过 3× | activation-aware W4;输出 MSE -4.22% |
| 核心机制 | smolvlm · SmolVLM |
纯多模态:原文报告更低视觉 token 成本下保持竞争力 | pixel-shuffle 视觉 token 16→4;Fashion-MNIST QA +19.0 points |
| 核心机制 | siglip2 · SigLIP 2 |
纯多模态:原文在多类图文 benchmark 改善语义与定位能力 | sigmoid 对比 + masked-view 自蒸馏;Fashion-MNIST QA +56.9 points |
| 核心机制 | llava · LLaVA |
纯多模态:ScienceQA 92.53% | MLP projector 对线性 connector -3.4 points,保留小数据负结果 |
| 核心机制 | blip2 · BLIP-2 |
纯多模态:zero-shot VQAv2 相对 Flamingo-80B +8.7 points | 四 query Q-Former 将 token 16→4;accuracy -5.3 points,保留负结果 |
| 核心机制 | speculative-decoding · Speculative Decoding |
纯 LLM:T5-XXL 2–3× 且分布不变 | 低秩 draft + exact verification;target calls -75%,输出一致 |
| 核心机制 | clip · CLIP |
纯多模态:ImageNet zero-shot 匹配监督 ResNet-50 | 双向对比学习;Fashion-MNIST 图文任务 72.0%,打乱图像 10.3% |
| 核心机制 | sim · SIM |
阿里 CTR +7.1%、RPM +4.4%,主流量 | GSU/ESU 长历史检索;NDCG@10 +32.97% |
| 核心机制 | dme · DME |
抖音搜索 Lifetime +0.1%,内部离线 +2.92% | typed latent + cross reconstruction;MovieLens-100K NDCG@10 -8.84%,保留负结果 |
| 核心机制 | steps · STEPS |
active days +0.2843%、permission disablement -1.9089%,已全量 | planning/execution/filter 闭环;MovieLens-100K NDCG@10 +66.05% |
| 核心机制 | spear · SPEAR |
query-view CTR +0.259、reading depth +0.733,已全量 | 双 embedding + 乘法门;MovieLens-100K NDCG@10 +26.95% |
| 核心机制 | open-language-model · OpenLanguageModel |
纯 LLM:四卡 weak scaling 90.6%;无线上 A/B | olm_composable genome;WikiText-2 同预算 PPL 基本等价,验证可组合结构语义 |
| 核心机制 | gryphon-v2 · Gryphon-v2 |
Yandex Music active users +1.41% | rollout/impression 双路 teacher distillation;NDCG@10 -26.84%,保留负迁移 |
| 核心机制 | degr · DEGR |
京东 UCTR +1.22%、PV +0.20% | diversity + adaptive reward ORPO;NDCG 持平、head share -1.21% |
| 核心机制 | rd-attnres · RD-AttnRes |
纯 LLM:120M/343M PPL -2.97%/-2.43% | 相对 Block AttnRes PPL +0.61%(变差),QK/V route JS=0.00489 |
| 核心机制 | retoken · ReToken |
Visual Haystacks:Qwen3-VL-8B +13.4 points;无线上 A/B | 单 retrieval target + value-cache Top-K;WikiText-2 PPL +3.70%(变差) |
| 核心机制 | ccformer · CCFormer |
腾讯视频 CTR +3.57%、广告收入 +1.71%,实验后全流量 | 分字段 ID/content gate + 分层历史压缩;MovieLens-1M NDCG@10 +22.44%,token 24→12 |
| 核心机制 | open-web-ufm · Open Web UFM |
Teads 50/50 A/B:CTR +2.13%、eCPC -1.13%、visit rate +2.37% | 双裁剪对比预训练 + next-item 代理任务;MovieLens-1M NDCG@10 +0.00%,如实保留零收益 |
| 核心机制 | rocs · ROCS |
Meta 检索最高 3× QPS;短视频排序 LogLoss -0.5%、QPS +50% | request-once / candidate-late interaction;MovieLens-1M NDCG@10 +8.19%,进程内候选打分 129.58× |
| 核心机制 | wide · WIDE |
纯 LLM:50% sparsity 下 kernel prefill 1.98×、decode 4.95× | token 级 head/FFN group Top-K;WikiText-2 PPL +0.81%(变差),dense PyTorch 未获得 kernel 加速 |
| 核心机制 | asarl · ASARL |
QQ 频道 CTR +2.69%、群 GSB +16.66%,1200 万 DAU | Reason/Critic/Gen + SCT/PGO/SD;NDCG@10 -72.72%,保留代理负迁移 |
| 核心机制 | oxygenrec-v2 · OxygenREC-v2 |
京东 UCTCVR +1.61%–+4.44%,首页 GMV +21.21% | 行为指令 + privileged distillation;NDCG@10 -54.09%,保留代理负迁移 |
| 核心机制 | reco-reward · RecoReward |
快手有效用户渗透 +0.265%、外流曝光 +0.791% | RAS target/non-target reward;Hit@10 -16.00%,保留负结果 |
| 核心机制 | twice · TWICE |
expected revenue +2.486%、conversion +2.061%,已全流量 | 双时钟与 delay CDF;NDCG@10 +14.31% |
| 核心机制 | swag-bid · SWAG |
GMV +3.42%、ROAS +5.65% | 滑窗 masked planner;NDCG@10 +0.00% |
| 核心机制 | youtube-freshness · YouTube Freshness |
1-day new-release engagement +4.33% | IPS + bias tower + uncertainty;head share -28.72% |
| 核心机制 | melo · Melo |
系统级 A/B retention >2pp | grounding + retry;fresh Hit@10 +50.00%,系统归因单列 |
| 核心机制 | penelope · Penelope |
纯 LLM:结构化推理 accuracy/compute 改善 | 两步 localized recurrence;composite loss -0.63% |
| 核心机制 | mim · MIM |
淘宝 CTR +14.14%、RPM +4.12% | 遮盖多模态对齐 + CiUBM;NDCG@10 +0.94%,Hit@10 下降 |
| 核心机制 | filterllm · FilterLLM |
Cold-PV +5.13%、GMV +10.86% | text-to-user-distribution;NDCG@10 -9.82%,保留负结果 |
| 核心机制 | fuxi-alpha · FuXi-α |
播放歌曲 +4.67%、时长 +5.10% | 三通道交互;Hit@10 略升、NDCG@10 -4.25% |
| 核心机制 | recgpt-v2 · RecGPT-V2 |
淘宝 CTR +2.98%、IPV +3.71%、NER +11.46% | 层级 agents + 约束路由;NDCG@10 +18.52% |
| 核心机制 | higr · HiGR |
腾讯播放量 +1.73%、观看时长 +1.22% | 层级 SID slate + ORPO;NDCG@10 -12.32% |
| 核心机制 | drl-put · DRL-PUT |
Pinterest 收入 +0.27%、CTR +1.62% | logged bandit 策略调权;NDCG@10 +19.13% |
| 核心机制 | adaf2m2 · AdaF²M² |
抖音活跃天数 +1.37%、时长 +1.89% | feature-mask multi-forward + adapter;NDCG@10 +2.42% |
| 核心机制 | mgoe · MGOE |
阿里 GMV +16.46%、CVR +5.88% | macro task graph experts;NDCG@10 +7.03% |
| 核心机制 | click-a-buy-b · Click A Buy B |
Pinterest 主业务指标 +0.25% | CABA/CABB + taxonomy;NDCG@10 +33.70% |
| 核心机制 | mosaic · Mosaic |
Meta 三个 surface +0.10%/+0.15%/+0.28% | 四 specialist + MRM + CRL;NDCG@10 +3.49%,Hit@10 -7.69% |
| 核心机制 | unir2 · UniR² |
快手播放量 +1.177%、点赞率 +2.560%;极速版送礼金额 +2.569% | DQ-PCA + ranking LoRA;SID code accuracy +34.04%,NDCG@10 -13.19% |
| 核心机制 | core-relevance · CORE |
美团 NDCG@5 +0.20%、Badcase@5 -15.9% | 级联头 + step-GRPO + PostCoT;NDCG@5 +0.98%、Badcase@5 -50.00%,accuracy -0.52 points |
| 核心机制 | data-orchestra · DataOrchestra |
纯 LLM:0.5B/1.5B/7B benchmark average 稳定提升 | 逐样本路由;PPL 较固定清洗 -1.03%,较 raw +8.60%(变差) |
| 核心机制 | native-sparse-attention · NSA |
纯 LLM:质量不低于 full attention,64K 三阶段显著加速 | 三路稀疏注意力;attention edge -43.65%,PPL -3.17% |
| 核心机制 | gated-attention · Gated Attention |
纯 LLM:改善 scaling、稳定性与长上下文外推 | post-SDPA 逐头 gate;PPL -0.72% |
| 核心机制 | muon · Muon |
纯 LLM:约 2× compute efficiency | 正交矩阵更新已执行;PPL +5.61%(变差) |
| 核心机制 | wide-deep · Wide & Deep |
Google Play acquisition +3.9% | wide crosses + deep tower;NDCG@10 +5.45% |
| 核心机制 | deepfm · DeepFM |
用户批准的经典例外 | FM + deep 共享 embedding;NDCG@10 +23.58% |
| 核心机制 | youtube-dnn · YouTube DNN |
用户批准的经典例外;未披露量化 lift | 非线性用户塔;NDCG@10 -6.61%,保留负结果 |
| 核心机制 | esmm · ESMM |
用户批准的经典例外 | entire-space CTR×CVR;平均 AUC +1.69% |
| 核心机制 | mmoe · MMoE |
用户批准的经典例外 | 共享 experts + 任务 gates;平均 AUC +1.30% |
| 核心机制 | ple · PLE |
用户批准的经典例外 | 共享/专属 experts;平均 AUC +1.34% |
| 核心机制 | dcn-v2 · DCN-V2 |
经典例外:线上显著但未披露 lift | low-rank cross experts;NDCG@10 +22.87% |
| 核心机制 | dien · DIEN |
CTR +20.7%、eCPM +17.1% | GRU + auxiliary + interest evolution;NDCG@10 -1.98% |
| 核心机制 | bst · BST |
CTR +7.57% | target-token Transformer;NDCG@10 +20.29% |
| 核心机制 | cs3 · CS3 |
Revenue +8.356%/+1.366%/+2.177% | cycle/sync/cascade;NDCG@10 -16.06% |
| 核心机制 | cq-sid · CQ-SID |
GMV +1.15%、UCTCVR +0.40% | category SID + EG-GRPO;NDCG@10 +1.66% |
| 核心机制 | switch-transformer · Switch Transformer |
纯 LLM:预训练约 7× 加速 | top-1 MoE;30-step PPL -3.29% |
| 核心机制 | mamba · Mamba |
纯 LLM:推理最高约 5× | selective scan;30-step PPL +48.82%(变差) |
| 核心机制 | switch-attention · Switch Attention |
纯 LLM:32K decode >4× | dynamic full/local router;30-step PPL +0.19%(略差) |
| 核心机制 | onemall · OneMall |
商品卡 GMV +13.01%、短视频订单 +15.32%、直播订单 +2.78% | 场景 prompt + SID + 跨行为融合;NDCG@10 +4.33% |
| 核心机制 | dos · DOS |
美团收入 +1.15% | 双流 ORQ;NDCG@10 +11.26% |
| 核心机制 | mdl · MDL |
抖音 LT30 +0.0626%、rewrite -0.3267% | 三类 token 与 domain attention;NDCG@10 +13.34%,head share +73.43% |
| 核心机制 | hisac · HiSAC |
淘宝 CTR +1.65% | 层级 interest agents;NDCG@10 +1.31% |
| 核心机制 | pinclip · PinCLIP |
fresh Repin +15%、new Ads click +8.7% | 邻居对齐 NDCG@10 -1.41%,未迁移收益 |
| 核心机制 | pin-scale · Pin-SCALE |
Repin +3.67%、DAU +0.05% | engagement-aware SID;NDCG@10 +13.61%、fresh Hit +50.00% |
| 核心机制 | causal-retrieval · Causal Retrieval |
trigger -85%、session +0.26%、Save +1.10% | DR uplift trigger;合成 treatment NDCG@10 +80.77% |
| 核心机制 | podcast-mtl · Podcast MTL |
eCPS -22%、stream +18%–24% | shared MTL NDCG@10 -20.63%,出现 negative transfer |
| 核心机制 | engram · Engram |
纯 LLM:MMLU +3.4、BBH +5.0、HumanEval +3.0 | O(1) memory 已接 evolve;30-step PPL +50.12%(变差) |
| 核心机制 | looped-latent-attention · Looped Latent Attention |
纯 LLM:KV 最多 32× 压缩 | 已接 evolve;参数 -42.28%,PPL +5.56% |
| 核心机制 | gaugequant · GaugeQuant |
纯 LLM:LLaMA-2 7B W4A4 PPL 8.22→6.73 | 已接 evolve;本地 W4A4 STE PPL -1.56% |
| 核心机制 | nova · NOVA |
腾讯三个 pCVR 目标 GMV +1.25%/+1.70%/+2.02% | 四级 verification cascade、失败方向和 architecture gradient 实际接入 evolve |
| 核心机制 | evorec · EvoRec |
Revenue +1.85%、CTR +1.02% | 三代模型/方法双轨进化与持久 skill memory |
| 完整核心链路 | tokenmixer-large · TokenMixer-Large |
Orders +1.66%、payment GMV +2.98% | mixing/reverting、双 SwiGLU、interval residual 和辅助损失实际训练 |
| 核心机制 | msn · MSN |
Watch time +0.2958%、finish +0.2071% | Product-Key Memory、top-k sparse read 与 gate |
| 核心机制 | idproxy · IDProxy |
内容互动 +0.50%、广告 ADVV +1.93% | 对比损失 6.073→5.358;NDCG@10 +5.32% |
| 核心机制 | glide · GLIDE |
Non-habitual streaming +5.4%、new-show discovery +14.3% | residual Semantic ID 生成与长短期双 prompt |
| 核心机制 | genrec · GenRec |
Clicks +9.5%、transactions +8.7% | page-wise NTP、Token Merger 与 GRPO-SR/NLL |
| 核心机制 | genrec-netflix · Netflix GenRec |
10% 流量 4 周;短期首页参与 +0.115%、长期核心指标 +0.006% | SmolLM2 LoRA + catalog head + reward weighting;NDCG@10 +35.07%(单 seed) |
| 核心机制 | rankgraph2 · RankGraph-2 |
CTR +0.96%、CVR +2.75% | 去偏边、多跳 PPR 与两级 residual index;NDCG@10 +109.65% |
| 核心机制 | solaris · SOLARIS |
全流量 top-line revenue +0.67% | future-pair predictor、异步 latent cache 与 fallback |
| 核心机制 | minimax-sparse-attention · MiniMax Sparse Attention |
纯 LLM:1M context attention compute -28.4× | attention pairs -79.95%,PPL +0.41%(变差),未融合 MPS 耗时 +67.58% |
| 核心机制 | pinequalizer · PinEqualizer |
Related Pins ranking architecture:all-fresh +8.63%、underexplored +6.57% | MovieLens-1M fresh NDCG +448.62%、underexplored exposure +471.02%,但整体 NDCG -16.44% |
| 核心机制 | gzip-sparse-attention · Gzip-guided Sparse Attention |
纯 LLM:PG-19 BPB 2.34→1.71(对 BigBird) | 同参数 256-context BPB 较 BigBird +1.02%(变差),attention edges -70.82% |
| 核心机制 | windowed-mtp · Windowed-MTP |
纯 LLM serving:1M step latency +28.3%–+44.3% | 16K KV read -99.56%、MPS draft latency -50.25%;输出完全一致,acceptance 41.67%→25.00% |
| 核心机制 | adadsf · AdaDSF |
纯 LLM:80% retention PPL 21.6→18.9(对 MoD) | 同 teacher/budget 下 PPL 较 Uniform MoD +0.30%(变差) |
| 核心机制 | barge · BARGE |
腾讯 CTR +0.60%、点击 UV +1.34%、阅读时长 +1.70% | OSQ+ICA+HPR+DPD;NDCG@10 +85.77%,但 head share +165.02% |
| 核心机制 | mobius-rope · Möbius RoPE |
纯 LLM:needle 63.3%→90.3%,PPL 持平 | PPL -0.03%,单 seed needle -2.08 points,未迁移论文收益 |
| 核心机制 | naju · Naju |
纯 LLM:WikiText-103 PPL 28.31→26.20 | preserve-first gates 正确;WikiText-2 PPL +25.67%(变差) |
| 核心机制 | dynamic-rubric · DynamicRubric |
微信搜索全 AI 流量统计显著;具体 lift 未披露 | Alpaca preference accuracy 83.89%→87.78%,相对 +4.64% |
| 核心机制 | tsgr · TSGR |
淘宝 IPV +0.43%、成交 +1.12%、GMV +1.64% | 并行价值 SID + 联合 VRM;NDCG@10 +115.73% |
| 核心机制 | off-context-grpo · Off-Context GRPO |
纯 LLM:Qwen2.5-7B 相对 GRPO +13.8% | 官方 GSM8K Pass@1 2.67%→3.33%,相对 +25.00% |
| 核心机制 | ramp · RAMP |
工业 CVR Total Advertiser Value >+3% | 受限个性化字段流量 NDCG@10 +417.23% |
| 核心机制 | whale · WHALE |
Meta 主指标 +0.113%、Metric 1 +0.824% | Wukong-HSTU 渐进交换;NDCG@10 -83.20%,未迁移收益 |
| 核心机制 | tmallgs · TMallGS |
天猫 UCTCVR +1.38%、GMV +1.52% | Field-adaptive gated Transformer;NDCG@10 +310.42% |
| 核心机制 | long-history-transformer · Long-History User Transformers |
Yandex Search 主指标 +2.77%、Revenue +2.26% | 缓存全历史 + 在线近期 encoder;NDCG@10 +57.08% |
| 核心机制 | downstream-rewards · Downstream Rewards |
多 surface +0.11%–+0.36% | 筛选长期 reward head;NDCG@10 -5.10%,未迁移收益 |
| 核心机制 | recgpt-mobile · RecGPT-Mobile |
淘宝 CLICK +1.8%、PAY +2.7%、GMV +2.5% | 真实 135M LoRA semantic intent accuracy +100.00%;INT8 相对 -6.25%、体积 -53.68%,触发器跳过 96.21% 推理 |
| 核心机制 | sort-gen · SORT-Gen |
相对部署基线 CLICK +4.13%、GMV +8.10% | ordered regression + 单次 mask-driven queue generation;Click +5.10%、Pay +8.46%、GMV proxy +9.00%、ILAD +2.89% |
| 核心机制 | recgpt-v3 · RecGPT-V3 |
淘宝 Feed IPV +1.28%、CTR +1.00%、GMV +3.97%;资源 -52.4% | 两阶段教师蒸馏后 NDCG@10 +36.96%,memory token -65%、latent slots -90%,但 head share +71.43% |
| 核心机制 | slimper · SlimPer |
Instagram Reels/Feed 统计显著全流量提升;具体 lift 未披露 | 参数匹配下 NDCG@10 +1.29%,attention-score elements -94.12% |
| 核心机制 | tokenminds · TokenMinds |
YouTube SFV Engaged Users +0.11%、Satisfied Engagement +0.62%,多 surface 全流量 | dense + SID user token 双输出实际训练;单 seed NDCG@10 -0.35%,不宣称稳定提升 |
| 核心机制 | recap · RECAP |
快手人均应用使用时长 +0.139% | GRPO reward 0.5245→0.7096,但 NDCG@10 -6.77%、head share -20.27% |
| 核心机制 | uame · UAME |
LongView 最高 +1.614%、Forward 最高 +1.598% | 三路公开 proxy 下 NDCG@10 -62.28%,未迁移线上收益 |
| 核心机制 | conv-llm · Convolution for LLMs |
纯 LLM:Qwen3-1.7B PPL 13.42→12.79 | 同预算 WikiText-2 test PPL 305.664→304.787(-0.29%) |
| 核心机制 | ppl-factory · PPL-Factory |
纯 LLM:10% 数据时 GSM8K +0.9、MATH +4.8 points | 20% middle selection PPL 较随机变差 1.79%,easy 最好 |
| 核心机制 | fluid · FLUID |
QWD +0.55%、冷启房间播放 +2.05% | 去候选 ID 后 NDCG -20.63%,fresh Hit +100.00%、head share -58.32% |
| 核心机制 | memory-grafting · Memory Grafting |
纯 LLM:benchmark average 53.86 | PPL 较 Transformer -3.59%,但较 Engram +0.03%,未超过直接可训练记忆 |
| 核心机制 | mhc · mHC |
纯 LLM:benchmark +2.1%–2.3% | PPL 未提升;残差行列误差归零、谱范数 1.089→1.000 |
| 核心机制 | degre · DeGRe |
Taobao Flash CTR +2.85%、GMV +3.75% | evaluator→beam→dense distillation;NDCG@10 +3.31% |
| 核心机制 | harness-lm · HARNESS-LM |
Bing Ads Revenue +1.0%、Clicks +0.4% | 三阶段收敛但 test NDCG -28.05% |
| 核心机制 | grc · GRC |
Revenue +1.79%、CTR +2.11%、GMV +2.04% | structured SFT→GRPO→EGRS;NDCG -11.12% |
| 核心机制 | mbgr · MBGR |
Meituan CTCVR +3.98% | BID/MBP/LDR;NDCG -5.92% |
| 核心机制 | growthgr · GrowthGR |
新品 GMV +5.3%、全站 GMV +0.3% | ItemLTV→SID→MoPO;NDCG +2.05% |
| 核心机制 | mesh · MESH |
fresh repins +5.5%、retention +0.46% | 三塔与 RGBC;NDCG -3.54% |
| 核心机制 | sam · SAM |
CTR +1.1%、GMV +0.9%、bad-case -74.5% | ASGU/TTNP;NDCG -6.60% |
| 核心机制 | danet · DANet |
pCVR +3.63%、GMV +2.23% | TFTM/DCM;NDCG -1.46%、fresh Hit +50.00% |
| 核心机制 | proximity-features · Proximity Features |
first-time bookers +2.0%、booking +0.16% | ZIP adaptive buckets;Hit@10 +16.67%、NDCG +22.91% |
| 核心机制 | nontp · NONTP |
Meituan DSP CTR +1.8%、GMV +2.1% | EMA teacher TCL、跨域 TDL 与零额外推理路径实际执行;Hit@10 -4.93%、NDCG -8.62% |
| 核心机制 | akt-rec · AKT-Rec |
Tmall CTR +2.76%、GMV +3.47% | 真实小型 LLM、RQ-VAE 与非对称迁移实际执行;AUC +3.44%、GAUC +5.53%、tail AUC +2.15% |
| 完整核心链路 | s-grec · S-GRec |
WeChat GMV +1.19%、CTR +1.16%、dislike -2.02% | 真实 LLM PSJ + SID generator + 5% A2PO;A2PO 经 validation 晋级,test HR@10 +0%、NDCG -4.53%,约束零越界 |
| 完整核心链路 | pinterest-ads-llm · Complementary LLM Predictor |
US Shopping RoAS +4.94%、opt-in +6.69% | SFT 被选中;GRPO Recall@20 +0%,LLM 排序特征 AUC +2.59%,召回 quota=0 |
| 完整核心链路 | lwgr · LWGR |
Ads revenue +1.35%、CTR +1.17% | reference 被选中;LWGR Recall@10 +0%、NDCG -4.29%,dual update 执行但约束未改善 |
| 完整核心链路 | sigma · SIGMA |
AliExpress Order +2.80%、GMV +7.84% | top1-prefix HR@20 1/128→9/128;APF 相对 top1 -11.11% |
| 完整核心链路 | univa · UniVA |
WeChat Channels GMV +1.50%、GMV(normal) +1.42% | Office 公开代理;HR@100 +4.76%、ValueHR +6.56%,但 wNDCG -8.43%;trie 有效路径 50/50 |
| 核心机制 | prompt-generation · Prompt Generation |
Taobao Search transaction +0.47%、GMV +0.51%;Shop Search +4.01% | 同源 Amazon Office + Qwen2.5-0.5B;选中 Title 的 HR@10 -11.11%,mean merger 较原始 Title 打分 -90.38% |
| 完整核心链路 | precise · PRECISE |
WeChat ranking Clicks +1.961%、Shares +1.433% | SmolLM token + MoE + UT/TT;Recall@10 +40.0%,Cold Recall -50.0% |
| 完整核心链路 | lum · LUM |
Taobao CTR +2.9%、RPM +1.2% | next-condition-item + group query + DLRM;AUC +14.60%,3/3 seeds 正向 |
| 完整核心链路 | lsvcr · LSVCR |
Kuaishou comment watch time +4.1264% | q/v-LoRA + SSC/VCC;comment NDCG +50.40%,item NDCG -56.42% |
| 完整核心链路 | msd · MSD |
Meituan CTR +2.12%、CPM +2.59% | teacher→T5 distill + LoRA/cache fusion;AUC +1.55%,2/3 seeds 正向 |
| 核心机制 | sessionrec · SessionRec |
Meituan Pay PV +0.603%、PVCTCVR +0.564% | KuaiRand 真实 session、曝光负例;NDCG@20 -22.05%,仅 1/3 seeds 正向 |
| 核心机制 | saviorrec · SaviorRec |
Taobao Clicks +13.31%、Orders +13.44%、CTR +12.80% | 行为 encoder + RQ-SID + MBA + BiTargetAttn;cold AUC 均值 +6.92%,仅 1/3 seeds 正向 |
| 完整核心链路 | pinrec · PinRec |
Grid Clicks +4.01%、Time Spent +0.55% | OC + unordered MT 实际训练;Recall@10 -27.78% |
| 完整核心链路 | genrank · GenRank |
Engagements +1.2474% | action-oriented 延迟 -25.66%,AUC -0.46% |
| 完整核心链路 | learn · LEARN |
cold-item Revenue +8.77% | NDCG +233.10%,但 head share 69.50% |
| 完整核心链路 | notellm · NoteLLM |
I2I CTR +16.20% | GCL+CSFT;NDCG +7.15%,3/3 seeds 正向 |
| 完整核心链路 | kar · KAR |
Huawei 新闻 Recall +7%;音乐播放量 +1.70% | 真实 LLM 知识生成与 hybrid experts;AUC 均值 +0.81%,2/3 seeds 正向 |
| 完整核心链路 | bahe · BAHE |
Ads CTR +9.65%、CPM +2.41% | 原子行为缓存 + 上层聚合;耗时 -53.61%,AUC -2.94% |
| 完整核心链路 | beque · BEQUE |
Taobao GMV +0.40%、交易数 +0.34% | SFT + 无泄漏自采样 + 离线反馈 + PRO;feedback +30.03%,increment -66.02% |
| 完整核心链路 | onerec-v2 · OneRec-V2 |
Kuaishou stay +0.467%、Lite +0.741% | KuaiRand 真实时长反馈;Lazy latency -54.78%,GBPO 均值 +21.66% 但仅 2/3 seeds 正向 |
| 完整核心链路 | plum · PLUM |
YouTube Panel CTR +0.76%/+4.96% | CPT 降低 loss;Recall@10 R1/CR1 0.5%,R2/CR2 0,未验证召回增益 |
| 完整核心链路 | onerec · OneRec |
Kuaishou watch time +1.68% | 核心链路均执行;DPO 将本地 NDCG@10 从 0.0157 降至 0 |
| 完整核心链路 | g2rec · G2Rec |
Meta +0.06%–+0.19% | Beauty 上 soft graph + generative dual-loss;NDCG@10 +11.92% |
| 完整核心链路 | mixformer · MixFormer |
Douyin duration +0.2799% | matched-budget trainable blocks;NDCG@10 +17.41% |
| 完整核心链路 | rankmixer · RankMixer |
Active Days +0.3%、duration +1.08% | dense per-token FFN 最优;sparse MoE 未追平 dense |
| 完整核心链路 | hyformer · HyFormer |
watch time +0.293%、finish +1.111% | NDCG@10 +143.77%,head share 同步上升 |
| 完整核心链路 | onetrans · OneTrans |
Feeds GMV/U +5.6848% | NDCG@10 +123.58%,但 92% 推荐落在头部 |
| 完整核心链路 | rec-distill · Rec-Distill |
Ads ADVV +1.00%、Rec Finish/U +1.2725% | α 搜索后 transferability -4.11%,未验证蒸馏收益 |
| 完整核心链路 | sasrec · SASRec |
无;用户指定经典基线例外 | 原论文 BCE 与全库推理;NDCG@10 0.02933,较 popularity -1.24% |
| 核心机制 | hstu · HSTU |
Meta engagement +12.4%、consumption +4.4% | matched sampled-softmax SASRec 对照;NDCG@10 -17.73% |
| 核心机制 | m6rec · M6-Rec |
Alipay mini-app CTR >+1.0% | 冻结真实预训练 LM;option-adapter AUC 均值 +0.12% ± 0.41% |
| 核心机制 | din · DIN |
Alibaba CTR +10.0%、RPM +3.8% | local activation 与 Dice 实际训练;较 mean pool NDCG@10 -6.97% |
| 核心机制 | tiger · TIGER |
无;用户指定经典论文例外 | RQ-VAE 与自回归检索实际训练;较等容量 random ID NDCG@10 -39.16% |
| 核心机制 | transact-v2 · TransAct V2 |
Pinterest Repin +6.35%、Hide -12.80%、Time Spent +1.41% | NDCG@10 +92.65%,但 head share 升至 98.99% |
| 核心机制 | pinfm · PinFM |
Pinterest Homefeed Saves +1.20%–+5.70% | 两轮预训练/微调按 validation 选型;test -3.57%,head share 降至 20.16% |
| 核心机制 | sis · SIS |
非本轮 A/B 集合 | SIS 公式实际执行;未训练 Qwen3/GRPO |
| 核心机制 | mdcns · MDCNS |
论文公开离线结果 | 作者 Beauty 切分;三源采样与双模型更新实际执行 |
| 核心机制 | memento · Memento |
Meta CTR +1.0%、CVR +1.2% | query-conditioned MMR 实际执行;生产 replay/serving 省略 |
| 核心机制 | llm-ad-retrieval · LLM Retrieval |
Meta top-line +0.45%、final recall +1.2% | domain SFT + LLM attribute graph;Recall@20 +11.90%,score drift -77.36% |
| 完整核心链路 | seral · SERAL |
Taobao clicks +29.56%、transactions +27.6% | 相对 DIN NDCG +50.60%;novelty 未提升 |
| 完整核心链路 | leadre · LEADRE |
WeChat GMV +1.57%/+1.17% | 相对 DIN +12.94%;DPO 消融 -4.53% |
| 完整核心链路 | cobra · COBRA |
Conversion +3.60%、ARPU +4.15% | 相对 DIN +25.75%;热门集中上升 |
| 核心机制 | argus · ARGUS |
Listening +2.26%、likes +6.37% | 相对 DIN -4.12%,未验证收益 |
| 核心机制 | gr4ad · GR4AD |
Kuaishou ad revenue +4.2% | 相对 DIN +69.67%,head share 0.505 |
| 核心机制 | cross-domain-kd · Cross-domain KD |
Music discovery +1.12% | target split 相对 DIN -68.46% |
| 核心机制 | mm-llm · MM-LLM |
Meta engagement +0.02% | 相对 DIN -13.23%,未验证收益 |
| 核心机制 | cluster-goobs · Cluster GOOBS |
Meta CTR +53% | online sampler 实际执行;genre 替换私有 LLM cluster |
| 核心机制 | llatte · LLaTTE |
Meta conversion +4.3% | BERT semantic features、MLA、target-aware online attention 与 DHEN 均实际训练 |
| 核心机制 | self-evolving-rec · Self-Evolving RecSys |
Google +0.03%–+0.14% | 本地指令 LLM 读取 journal、逐轮提案、validation 反馈与隔离 test |
| 核心机制 | cmsl · CMSL |
Meta +0.092%–+0.171% | learned contextual lenses 与 HSTU-style backbone 实际训练 |
| 核心机制 | longer · LONGER |
Douyin Ads/电商 A/B | InnerTrans、global token 与 hybrid attention 端到端训练 |
统一运行方式¶
# 单篇
auto-research reproduce --paper <adapter> --seed 42
# 全部
auto-research reproduce --paper all --seed 42
# 包含明确降级的概念验证
auto-research reproduce --paper all --include-concept-demos --seed 42
原始运行产物位于:
runs/ 不进入 Git;result.json 是单次运行的事实来源。复核后的稳定结论、实验协议和边界条件才会摘录到对应论文 README。
Adapter 目录约定¶
src/auto_research/reproductions/<adapter>/
├── adapter.py
├── model.py 或 algorithm.py
├── experiment.py
└── report.py
共享的公开数据切分、逐用户及矩阵化全库指标位于 reproductions/rec_utils.py,序列模型的 all-position 训练位于 reproductions/sequence_training.py,下载器位于 datasets.py。论文特有网络、采样、调参和报告逻辑保留在论文目录中。每篇 README 固定包含完整论文信息、原论文背景、主要改动、Mermaid 架构图、核心公式、论文离线/在线效果、本地协议和复现边界。论文信息由 scripts/sync_reproduction_metadata.py 统一同步;扩展规则见架构文档。