{
  "schema_version": 1,
  "description": "Canonical metadata for all research domains; generated pages must not maintain paper tables.",
  "papers": [
    {
      "domain": "agent-research",
      "key": "ace-data",
      "title": "What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.27260",
      "detail_path": "agent-research/2608.27260-ace-data/README.md",
      "topic": [
        "Agent 数据质量"
      ],
      "first_author": "Xingshan Zeng",
      "first_author_affiliation": "Huawei Technologies Co., Ltd",
      "published": "2026-08-27",
      "code": null,
      "adapter": "ace-data"
    },
    {
      "domain": "agent-research",
      "key": "adavdr",
      "title": "AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research",
      "paper_url": "https://arxiv.org/abs/2608.25559",
      "detail_path": "agent-research/2608.25559-adavdr/README.md",
      "topic": [
        "视频研究自适应工具与反思"
      ],
      "first_author": "Xintong Zhang",
      "first_author_affiliation": "Accio Team, Alibaba Group",
      "published": "2026-08-26",
      "code": "https://github.com/Accio-Lab/AdaVDR",
      "adapter": "adavdr"
    },
    {
      "domain": "agent-research",
      "key": "agent-g2",
      "title": "Agent-G²: Gaussian Guidance for Agentic Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.23318",
      "detail_path": "agent-research/2608.23318-agent-g2/README.md",
      "topic": [
        "高斯 guidance Agent RL"
      ],
      "first_author": "Zixuan Wang",
      "first_author_affiliation": "Baidu",
      "published": "2026-08-24",
      "code": "https://github.com/ZJU-REAL/Agent-G2",
      "adapter": "agent-g2"
    },
    {
      "domain": "agent-research",
      "key": "agent-lightning",
      "title": "Agent Lightning",
      "paper_url": "https://arxiv.org/abs/2508.03680",
      "detail_path": "agent-research/2508.03680-agent-lightning/README.md",
      "topic": [
        "Agent RL"
      ],
      "first_author": "Xufang Luo",
      "first_author_affiliation": "Microsoft Research",
      "published": "2025-08-05",
      "code": "https://github.com/microsoft/agent-lightning",
      "adapter": "agent-lightning"
    },
    {
      "domain": "agent-research",
      "key": "agent-opsd",
      "title": "AgentOPSD",
      "paper_url": "https://arxiv.org/abs/2608.05987",
      "detail_path": "agent-research/2608.05987-agent-opsd/README.md",
      "topic": [
        "递归 turn 信用"
      ],
      "first_author": "Zi-Han Wang",
      "first_author_affiliation": "Tsinghua University",
      "published": "2026-08-06",
      "code": "https://github.com/ZethWang/AgentOPSD",
      "adapter": "agent-opsd"
    },
    {
      "domain": "agent-research",
      "key": "agent-r1",
      "title": "Agent-R1",
      "paper_url": "https://arxiv.org/abs/2511.14460",
      "detail_path": "agent-research/2511.14460-agent-r1/README.md",
      "topic": [
        "Agentic RL 基础设施"
      ],
      "first_author": "Mingyue Cheng",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2025-11-18",
      "code": "https://github.com/AgentR1/Agent-R1",
      "adapter": "agent-r1"
    },
    {
      "domain": "agent-research",
      "key": "agent0",
      "title": "Agent0",
      "paper_url": "https://arxiv.org/abs/2511.16043",
      "detail_path": "agent-research/2511.16043-agent0/README.md",
      "topic": [
        "零数据多 Agent"
      ],
      "first_author": "Peng Xia",
      "first_author_affiliation": "University of North Carolina at Chapel Hill",
      "published": "2025-11-20",
      "code": "未发现官方代码",
      "adapter": "agent0"
    },
    {
      "domain": "agent-research",
      "key": "agentx",
      "title": "AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2606.26859",
      "detail_path": "agent-research/2606.26859-agentx/README.md",
      "topic": [
        "研究自动化",
        "工业推荐 Agent"
      ],
      "first_author": "AgentX Team",
      "first_author_affiliation": "Kuaishou",
      "published": "2026-06-26",
      "code": null,
      "adapter": "agentx"
    },
    {
      "domain": "agent-research",
      "key": "ahead",
      "title": "AHEAD: Agentic Hints for Effective Agent Development",
      "paper_url": "https://arxiv.org/abs/2608.24114",
      "detail_path": "agent-research/2608.24114-ahead/README.md",
      "topic": [
        "环境反馈提示训练"
      ],
      "first_author": "Xiaolong Jin",
      "first_author_affiliation": "AWS AI Labs / Purdue University",
      "published": "2026-08-25",
      "code": null,
      "adapter": "ahead"
    },
    {
      "domain": "agent-research",
      "key": "art",
      "title": "ART",
      "paper_url": "https://arxiv.org/abs/2303.09014",
      "detail_path": "agent-research/2303.09014-art/README.md",
      "topic": [
        "自动工具推理"
      ],
      "first_author": "Bhargavi Paranjape",
      "first_author_affiliation": "University of Washington",
      "published": "2023-03-16",
      "code": "https://github.com/bhargaviparanjape/language-programmes",
      "adapter": "art"
    },
    {
      "domain": "agent-research",
      "key": "atomrec",
      "title": "AtomRec: Evolving Atomic Memory for Agentic Recommendation",
      "paper_url": "https://arxiv.org/abs/2609.04882",
      "detail_path": "agent-research/2609.04882-atomrec/README.md",
      "topic": [
        "Agentic recommendation memory"
      ],
      "first_author": "Peiyu Hu",
      "first_author_affiliation": "Xi'an Jiaotong-Liverpool University",
      "published": "2026-09-04",
      "code": null,
      "adapter": "atomrec"
    },
    {
      "domain": "agent-research",
      "key": "auso",
      "title": "AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization",
      "paper_url": "https://arxiv.org/abs/2608.21292",
      "detail_path": "agent-research/2608.21292-auso/README.md",
      "topic": [
        "动作级技能优化"
      ],
      "first_author": "Huizu Lin",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-08-21",
      "code": "https://github.com/JordanSancholhz/Action-Skill",
      "adapter": "auso"
    },
    {
      "domain": "agent-research",
      "key": "autogen",
      "title": "AutoGen",
      "paper_url": "https://arxiv.org/abs/2308.08155",
      "detail_path": "agent-research/2308.08155-autogen/README.md",
      "topic": [
        "多 Agent"
      ],
      "first_author": "Qingyun Wu",
      "first_author_affiliation": "Microsoft Research",
      "published": "2023-08-16",
      "code": "https://github.com/microsoft/autogen",
      "adapter": "autogen"
    },
    {
      "domain": "agent-research",
      "key": "autosaddler",
      "title": "AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces",
      "paper_url": "https://arxiv.org/abs/2608.23041",
      "detail_path": "agent-research/2608.23041-autosaddler/README.md",
      "topic": [
        "Harness 自动优化"
      ],
      "first_author": "Sungho Park",
      "first_author_affiliation": "Microsoft / POSTECH",
      "published": "2026-08-24",
      "code": null,
      "adapter": "autosaddler"
    },
    {
      "domain": "agent-research",
      "key": "cam-df",
      "title": "CAM-DF",
      "paper_url": "https://arxiv.org/abs/2607.27083",
      "detail_path": "agent-research/2607.27083-cam-df/README.md",
      "topic": [
        "成本感知工具停止"
      ],
      "first_author": "Yicheng Feng",
      "first_author_affiliation": "Peking University",
      "published": "2026-07-29",
      "code": "未发现官方代码",
      "adapter": "cam-df"
    },
    {
      "domain": "agent-research",
      "key": "camel",
      "title": "CAMEL",
      "paper_url": "https://arxiv.org/abs/2303.17760",
      "detail_path": "agent-research/2303.17760-camel/README.md",
      "topic": [
        "多 Agent 协作"
      ],
      "first_author": "Guohao Li",
      "first_author_affiliation": "King Abdullah University of Science and Technology",
      "published": "2023-03-31",
      "code": "https://github.com/camel-ai/camel",
      "adapter": "camel"
    },
    {
      "domain": "agent-research",
      "key": "caskg",
      "title": "CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval",
      "paper_url": "https://arxiv.org/abs/2608.25500",
      "detail_path": "agent-research/2608.25500-caskg/README.md",
      "topic": [
        "反事实因果技能图"
      ],
      "first_author": "Zhiyuan Li",
      "first_author_affiliation": "Jilin University / Ant Group",
      "published": "2026-08-26",
      "code": "https://github.com/ZhiyuanLi218/Caskg",
      "adapter": "caskg"
    },
    {
      "domain": "agent-research",
      "key": "cast",
      "title": "CAST",
      "paper_url": "https://arxiv.org/abs/2607.25308",
      "detail_path": "agent-research/2607.25308-cast/README.md",
      "topic": [
        "Agentic RL / turn-level credit"
      ],
      "first_author": "Yu Wang",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-07-28",
      "code": "https://github.com/Wloner0809/CAST",
      "adapter": "cast"
    },
    {
      "domain": "agent-research",
      "key": "cera-moa",
      "title": "CERA-MoA: Co-Evolving Router and Agents for Mixture-of-Agents",
      "paper_url": "https://arxiv.org/abs/2609.18779",
      "detail_path": "agent-research/2609.18779-cera-moa/README.md",
      "topic": [
        "多 Agent",
        "路由与协同进化"
      ],
      "first_author": "Jiaxuan Jiang",
      "first_author_affiliation": "IIIS, Tsinghua University",
      "published": "2026-09-16",
      "code": null,
      "adapter": "cera-moa",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "cipo",
      "title": "Contextual Information Policy Optimization for Search Agents",
      "paper_url": "https://arxiv.org/abs/2608.06128",
      "detail_path": "agent-research/2608.06128-cipo/README.md",
      "topic": [
        "搜索 Agent RL"
      ],
      "first_author": "Xingyu Guo",
      "first_author_affiliation": "Beihang University",
      "published": "2026-08-06",
      "code": null,
      "adapter": "cipo"
    },
    {
      "domain": "agent-research",
      "key": "cobra-skills",
      "title": "COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization",
      "paper_url": "https://arxiv.org/abs/2609.11682",
      "detail_path": "agent-research/2609.11682-cobra-skills/README.md",
      "topic": [
        "技能进化",
        "Contextual bandit"
      ],
      "first_author": "Pingchen Lu",
      "first_author_affiliation": "The Chinese University of Hong Kong, Shenzhen",
      "published": "2026-09-10",
      "code": "https://github.com/Jerry-LuP/COBRA-Skills",
      "adapter": "cobra-skills",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "codegrep",
      "title": "CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents",
      "paper_url": "https://arxiv.org/abs/2608.05886",
      "detail_path": "agent-research/2608.05886-codegrep/README.md",
      "topic": [
        "代码检索 Agent"
      ],
      "first_author": "Wuya Chen",
      "first_author_affiliation": "NetEase Guangzhou AI Lab",
      "published": "2026-08-06",
      "code": null,
      "adapter": "codegrep"
    },
    {
      "domain": "agent-research",
      "key": "coevo-mem",
      "title": "CoEvo-Mem",
      "paper_url": "https://arxiv.org/abs/2608.01739",
      "detail_path": "agent-research/2608.01739-coevo-mem/README.md",
      "topic": [
        "检索—记忆共进化"
      ],
      "first_author": "Bowen Ye",
      "first_author_affiliation": "论文未列机构",
      "published": "2026-08-03",
      "code": "未发现官方代码",
      "adapter": "coevo-mem"
    },
    {
      "domain": "agent-research",
      "key": "coskill",
      "title": "CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution",
      "paper_url": "https://arxiv.org/abs/2609.04865",
      "detail_path": "agent-research/2609.04865-coskill/README.md",
      "topic": [
        "Hierarchical skill coevolution"
      ],
      "first_author": "Jinyuan Feng",
      "first_author_affiliation": "Institute of Automation, Chinese Academy of Sciences",
      "published": "2026-09-04",
      "code": "https://github.com/jinyuan-cookie/CoSkill",
      "adapter": "coskill"
    },
    {
      "domain": "agent-research",
      "key": "covemem",
      "title": "When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2608.26895",
      "detail_path": "agent-research/2608.26895-covemem/README.md",
      "topic": [
        "可训练协同记忆"
      ],
      "first_author": "Hanchong Chen",
      "first_author_affiliation": "Shenzhen Technology University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "covemem"
    },
    {
      "domain": "agent-research",
      "key": "critic",
      "title": "CRITIC",
      "paper_url": "https://arxiv.org/abs/2305.11738",
      "detail_path": "agent-research/2305.11738-critic/README.md",
      "topic": [
        "工具反馈"
      ],
      "first_author": "Zhibin Gou",
      "first_author_affiliation": "Microsoft",
      "published": "2023-05-19",
      "code": "https://github.com/microsoft/ProphetNet/tree/master/CRITIC",
      "adapter": "critic"
    },
    {
      "domain": "agent-research",
      "key": "deeprepro",
      "title": "DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories",
      "paper_url": "https://arxiv.org/abs/2608.26557",
      "detail_path": "agent-research/2608.26557-deeprepro/README.md",
      "topic": [
        "论文到代码状态子规划"
      ],
      "first_author": "Hongru Song",
      "first_author_affiliation": "Institute of Computing Technology, Chinese Academy of Sciences",
      "published": "2026-08-27",
      "code": "https://github.com/ruyisy/DeepRepro",
      "adapter": "deeprepro"
    },
    {
      "domain": "agent-research",
      "key": "deepresearcher",
      "title": "DeepResearcher",
      "paper_url": "https://arxiv.org/abs/2504.03160",
      "detail_path": "agent-research/2504.03160-deepresearcher/README.md",
      "topic": [
        "深度研究 RL"
      ],
      "first_author": "Yuxiang Zheng",
      "first_author_affiliation": "HKU",
      "published": "2025-04-04",
      "code": "https://github.com/GAIR-NLP/DeepResearcher",
      "adapter": "deepresearcher"
    },
    {
      "domain": "agent-research",
      "key": "dependency-refinement",
      "title": "Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning",
      "paper_url": "https://arxiv.org/abs/2609.18417",
      "detail_path": "agent-research/2609.18417-dependency-refinement/README.md",
      "topic": [
        "轨迹精炼",
        "Agent 微调"
      ],
      "first_author": "Zhuo Chen",
      "first_author_affiliation": "ShanghaiTech University",
      "published": "2026-09-16",
      "code": "https://github.com/Alibaba-NLP/VLLM-KB",
      "adapter": "dependency-refinement",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "ecdysis",
      "title": "Ecdysis: Efficient and Effective Training of Runtime Harnesses for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2609.11677",
      "detail_path": "agent-research/2609.11677-ecdysis/README.md",
      "topic": [
        "Harness 自进化",
        "失败诊断"
      ],
      "first_author": "Ruiqing Yue",
      "first_author_affiliation": "Chengdu Institute of Computer Applications, Chinese Academy of Sciences",
      "published": "2026-09-10",
      "code": "https://github.com/cuiyu-ai/Ecdysis",
      "adapter": "ecdysis",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "envace",
      "title": "EnvACE",
      "paper_url": "https://arxiv.org/abs/2608.06197",
      "detail_path": "agent-research/2608.06197-envace/README.md",
      "topic": [
        "环境 rehearsal / Agent RL"
      ],
      "first_author": "Zishan Xu",
      "first_author_affiliation": "Shanghai Jiao Tong",
      "published": "2026-08-06",
      "code": "https://github.com/Within-yao/EnvACE",
      "adapter": "envace"
    },
    {
      "domain": "agent-research",
      "key": "evoharness-rl",
      "title": "EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.05446",
      "detail_path": "agent-research/2608.05446-evoharness-rl/README.md",
      "topic": [
        "Harness policy RL"
      ],
      "first_author": "Xuying Ning",
      "first_author_affiliation": "University of Illinois Urbana–Champaign / Meta AI",
      "published": "2026-08-05",
      "code": null,
      "adapter": "evoharness-rl"
    },
    {
      "domain": "agent-research",
      "key": "evoskill-gui",
      "title": "Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents",
      "paper_url": "https://arxiv.org/abs/2609.17653",
      "detail_path": "agent-research/2609.17653-evoskill-gui/README.md",
      "topic": [
        "GUI Agent",
        "技能进化"
      ],
      "first_author": "Bofan Chen",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-09-15",
      "code": "https://github.com/ZJU-REAL/EvoSkill-GUI",
      "adapter": "evoskill-gui",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "feedback-scaffold",
      "title": "Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks",
      "paper_url": "https://arxiv.org/abs/2609.08404",
      "detail_path": "agent-research/2609.08404-feedback-scaffold/README.md",
      "topic": [
        "环境反馈脚手架"
      ],
      "first_author": "Hongbang Yuan",
      "first_author_affiliation": "Fudan University",
      "published": "2026-09-08",
      "code": "https://github.com/HongbangYuan/EnvAsScaffold",
      "adapter": "feedback-scaffold"
    },
    {
      "domain": "agent-research",
      "key": "fuse-evaluator",
      "title": "Verifiable Social Reasoning for LLM Assistants",
      "paper_url": "https://arxiv.org/abs/2609.17496",
      "detail_path": "agent-research/2609.17496-fuse-evaluator/README.md",
      "topic": [
        "Agent 评测",
        "社会推理"
      ],
      "first_author": "Amir Taubenfeld",
      "first_author_affiliation": "Google Research / Hebrew University of Jerusalem / University of Cambridge",
      "published": "2026-09-15",
      "code": null,
      "adapter": "fuse-evaluator",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "gaia",
      "title": "GAIA",
      "paper_url": "https://arxiv.org/abs/2311.12983",
      "detail_path": "agent-research/2311.12983-gaia/README.md",
      "topic": [
        "通用 Agent 评测"
      ],
      "first_author": "Grégoire Mialon",
      "first_author_affiliation": "Meta AI",
      "published": "2023-11-21",
      "code": "https://huggingface.co/gaia-benchmark",
      "adapter": "gaia"
    },
    {
      "domain": "agent-research",
      "key": "generative-agents",
      "title": "Generative Agents",
      "paper_url": "https://arxiv.org/abs/2304.03442",
      "detail_path": "agent-research/2304.03442-generative-agents/README.md",
      "topic": [
        "记忆与反思"
      ],
      "first_author": "Joon Sung Park",
      "first_author_affiliation": "Stanford University",
      "published": "2023-04-07",
      "code": "https://github.com/joonspk-research/generative_agents",
      "adapter": "generative-agents"
    },
    {
      "domain": "agent-research",
      "key": "gigpo",
      "title": "GiGPO",
      "paper_url": "https://arxiv.org/abs/2505.10978",
      "detail_path": "agent-research/2505.10978-gigpo/README.md",
      "topic": [
        "Agent group credit"
      ],
      "first_author": "Lang Feng",
      "first_author_affiliation": "Nanyang Technological University",
      "published": "2025-05-16",
      "code": "未发现官方代码",
      "adapter": "gigpo"
    },
    {
      "domain": "agent-research",
      "key": "grounded-memory",
      "title": "Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents",
      "paper_url": "https://arxiv.org/abs/2609.11060",
      "detail_path": "agent-research/2609.11060-grounded-memory/README.md",
      "topic": [
        "Agent 记忆",
        "环境探测"
      ],
      "first_author": "Susheel Suresh",
      "first_author_affiliation": "Microsoft",
      "published": "2026-09-09",
      "code": null,
      "adapter": "grounded-memory",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "grsd",
      "title": "Group-Reflective Self-Distillation",
      "paper_url": "https://arxiv.org/abs/2607.28076",
      "detail_path": "agent-research/2607.28076-grsd/README.md",
      "topic": [
        "Agent group credit"
      ],
      "first_author": "Binbin Zheng",
      "first_author_affiliation": "Baidu Inc.",
      "published": "2026-07-30",
      "code": "https://github.com/BinbZheng1/GRSD",
      "adapter": "grsd"
    },
    {
      "domain": "agent-research",
      "key": "gse",
      "title": "Learning Globally Reusable Skills for Coding Agents",
      "paper_url": "https://arxiv.org/abs/2608.06153",
      "detail_path": "agent-research/2608.06153-gse/README.md",
      "topic": [
        "全局技能进化"
      ],
      "first_author": "Chen Yang",
      "first_author_affiliation": "Tianjin University",
      "published": "2026-08-06",
      "code": null,
      "adapter": "gse"
    },
    {
      "domain": "agent-research",
      "key": "harness-bandit",
      "title": "HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2609.13739",
      "detail_path": "agent-research/2609.13739-harness-bandit/README.md",
      "topic": [
        "Agent RL",
        "Harness 调度"
      ],
      "first_author": "Hongliang Wei",
      "first_author_affiliation": "Harbin Institute of Technology / Alibaba Cloud",
      "published": "2026-09-12",
      "code": null,
      "adapter": "harness-bandit",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "harness-design-study",
      "title": "An Empirical Study of Harness Design for Coding Agents",
      "paper_url": "https://arxiv.org/abs/2609.20804",
      "detail_path": "agent-research/2609.20804-harness-design-study/README.md",
      "topic": [
        "编程 Agent",
        "Harness 设计"
      ],
      "first_author": "Run-Ze Fan",
      "first_author_affiliation": "University of Massachusetts Amherst",
      "published": "2026-09-17",
      "code": null,
      "adapter": "harness-design-study",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "harnesslens",
      "title": "Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification",
      "paper_url": "https://arxiv.org/abs/2608.27311",
      "detail_path": "agent-research/2608.27311-harnesslens/README.md",
      "topic": [
        "行为相关 Harness 验证"
      ],
      "first_author": "Jinghan Xu",
      "first_author_affiliation": "Fudan University",
      "published": "2026-08-27",
      "code": "https://github.com/jhxu5214/HarnessLens",
      "adapter": "harnesslens"
    },
    {
      "domain": "agent-research",
      "key": "harnessopt-bench",
      "title": "HarnessOpt-Bench: Evaluating LLMs at Harness Optimization",
      "paper_url": "https://arxiv.org/abs/2608.06301",
      "detail_path": "agent-research/2608.06301-harnessopt-bench/README.md",
      "topic": [
        "Harness 优化评测"
      ],
      "first_author": "Varun Ursekar",
      "first_author_affiliation": "Scale AI",
      "published": "2026-08-06",
      "code": null,
      "adapter": "harnessopt-bench"
    },
    {
      "domain": "agent-research",
      "key": "hindsearch",
      "title": "HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.01597",
      "detail_path": "agent-research/2608.01597-hindsearch/README.md",
      "topic": [
        "搜索轨迹 hindsight"
      ],
      "first_author": "Haowei Liu",
      "first_author_affiliation": "Santa Clara University",
      "published": "2026-08-03",
      "code": "https://anonymous.4open.science/r/hindsearch-anon-EBDC",
      "adapter": "hindsearch"
    },
    {
      "domain": "agent-research",
      "key": "hiskill",
      "title": "HiSkill",
      "paper_url": "https://arxiv.org/abs/2607.25853",
      "detail_path": "agent-research/2607.25853-hiskill/README.md",
      "topic": [
        "Hierarchical skill memory"
      ],
      "first_author": "Yu Hao",
      "first_author_affiliation": "Beijing University of Posts and Telecommunications",
      "published": "2026-07-28",
      "code": "https://github.com/BUPT-GAMMA/HiSkill",
      "adapter": "hiskill"
    },
    {
      "domain": "agent-research",
      "key": "hugginggpt",
      "title": "HuggingGPT",
      "paper_url": "https://arxiv.org/abs/2303.17580",
      "detail_path": "agent-research/2303.17580-hugginggpt/README.md",
      "topic": [
        "专家模型编排"
      ],
      "first_author": "Yongliang Shen",
      "first_author_affiliation": "Zhejiang University",
      "published": "2023-03-30",
      "code": "https://github.com/microsoft/JARVIS",
      "adapter": "hugginggpt"
    },
    {
      "domain": "agent-research",
      "key": "hymem",
      "title": "HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation",
      "paper_url": "https://arxiv.org/abs/2608.15703",
      "detail_path": "agent-research/2608.15703-hymem/README.md",
      "topic": [
        "记忆",
        "长时序 Agent"
      ],
      "first_author": "XinQi Wang",
      "first_author_affiliation": "Institute of Automation, Chinese Academy of Sciences",
      "published": "2026-08-16",
      "code": null,
      "adapter": "hymem"
    },
    {
      "domain": "agent-research",
      "key": "hyperagent",
      "title": "HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.02650",
      "detail_path": "agent-research/2608.02650-hyperagent/README.md",
      "topic": [
        "工具规划",
        "超图"
      ],
      "first_author": "Zian Zhai",
      "first_author_affiliation": "University of New South Wales",
      "published": "2026-07-31",
      "code": null,
      "adapter": "hyperagent"
    },
    {
      "domain": "agent-research",
      "key": "interactive-memory",
      "title": "Interactive Memory Learning for Long-Term Conversations",
      "paper_url": "https://arxiv.org/abs/2609.17088",
      "detail_path": "agent-research/2609.17088-interactive-memory/README.md",
      "topic": [
        "长期记忆",
        "多 Agent 强化学习"
      ],
      "first_author": "Cai Ke",
      "first_author_affiliation": "Harbin Institute of Technology, Shenzhen / Pengcheng Laboratory",
      "published": "2026-09-15",
      "code": null,
      "adapter": "interactive-memory",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "jit-agent",
      "title": "JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution",
      "paper_url": "https://arxiv.org/abs/2608.25593",
      "detail_path": "agent-research/2608.25593-jit-agent/README.md",
      "topic": [
        "Harness 即时生成与进化"
      ],
      "first_author": "Guibin Zhang",
      "first_author_affiliation": "LV-NUS Lab",
      "published": "2026-08-26",
      "code": "https://github.com/bingreeky/JIT",
      "adapter": "jit-agent"
    },
    {
      "domain": "agent-research",
      "key": "lats",
      "title": "LATS",
      "paper_url": "https://arxiv.org/abs/2310.04406",
      "detail_path": "agent-research/2310.04406-lats/README.md",
      "topic": [
        "Agent 搜索"
      ],
      "first_author": "Andy Zhou",
      "first_author_affiliation": "University of Illinois Urbana-Champaign",
      "published": "2023-10-06",
      "code": "https://github.com/lapisrocks/LanguageAgentTreeSearch",
      "adapter": "lats"
    },
    {
      "domain": "agent-research",
      "key": "legomem",
      "title": "LEGOMem",
      "paper_url": "https://arxiv.org/abs/2510.04851",
      "detail_path": "agent-research/2510.04851-legomem/README.md",
      "topic": [
        "过程记忆"
      ],
      "first_author": "Dongge Han",
      "first_author_affiliation": "Microsoft Research",
      "published": "2025-10-06",
      "code": "未发现官方代码",
      "adapter": "legomem"
    },
    {
      "domain": "agent-research",
      "key": "loongreflect",
      "title": "LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation",
      "paper_url": "https://arxiv.org/abs/2608.11967",
      "detail_path": "agent-research/2608.11967-loongreflect/README.md",
      "topic": [
        "反思",
        "Agentic RL"
      ],
      "first_author": "Zhixin Zhang",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-08-12",
      "code": null,
      "adapter": "loongreflect"
    },
    {
      "domain": "agent-research",
      "key": "loop",
      "title": "LOOP",
      "paper_url": "https://arxiv.org/abs/2502.01600",
      "detail_path": "agent-research/2502.01600-loop/README.md",
      "topic": [
        "长时程 Agent RL"
      ],
      "first_author": "Kevin Chen",
      "first_author_affiliation": "Apple",
      "published": "2025-02-03",
      "code": "https://github.com/apple/ml-loop",
      "adapter": "loop"
    },
    {
      "domain": "agent-research",
      "key": "manta",
      "title": "MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems",
      "paper_url": "https://arxiv.org/abs/2607.28527",
      "detail_path": "agent-research/2607.28527-manta/README.md",
      "topic": [
        "多 Agent",
        "自进化"
      ],
      "first_author": "MaoXun Huang",
      "first_author_affiliation": "Cornell University",
      "published": "2026-07-30",
      "code": null,
      "adapter": "manta"
    },
    {
      "domain": "agent-research",
      "key": "maple",
      "title": "MAPLE: Memory-Augmented Planning with Language and Evolution",
      "paper_url": "https://arxiv.org/abs/2609.11636",
      "detail_path": "agent-research/2609.11636-maple/README.md",
      "topic": [
        "持久化优化规划"
      ],
      "first_author": "Kesheng Chen",
      "first_author_affiliation": "Harbin Institute of Technology, Shenzhen",
      "published": "2026-09-10",
      "code": "https://github.com/xin8coder/MAPLE",
      "adapter": "maple"
    },
    {
      "domain": "agent-research",
      "key": "memento-skills",
      "title": "Memento-Skills",
      "paper_url": "https://arxiv.org/abs/2603.18743",
      "detail_path": "agent-research/2603.18743-memento-skills/README.md",
      "topic": [
        "技能设计"
      ],
      "first_author": "Huichi Zhou",
      "first_author_affiliation": "Memento Team",
      "published": "2026-03-19",
      "code": "https://github.com/Memento-Teams/Memento-Skills",
      "adapter": "memento-skills"
    },
    {
      "domain": "agent-research",
      "key": "memforest",
      "title": "MemForest: Efficient Agent Memory Management via EventTree Partitioning and Progressive Merging",
      "paper_url": "https://arxiv.org/abs/2609.08273",
      "detail_path": "agent-research/2609.08273-memforest/README.md",
      "topic": [
        "事件树记忆压缩"
      ],
      "first_author": "Junxi Wang",
      "first_author_affiliation": "Shanghai Jiao Tong University",
      "published": "2026-09-08",
      "code": "https://github.com/Celina-love-sweet/MemForest",
      "adapter": "memforest"
    },
    {
      "domain": "agent-research",
      "key": "memgpt",
      "title": "MemGPT",
      "paper_url": "https://arxiv.org/abs/2310.08560",
      "detail_path": "agent-research/2310.08560-memgpt/README.md",
      "topic": [
        "虚拟上下文"
      ],
      "first_author": "Charles Packer",
      "first_author_affiliation": "University of California, Berkeley",
      "published": "2023-10-12",
      "code": "https://github.com/letta-ai/letta",
      "adapter": "memgpt"
    },
    {
      "domain": "agent-research",
      "key": "memorycpt",
      "title": "MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off",
      "paper_url": "https://arxiv.org/abs/2608.04843",
      "detail_path": "agent-research/2608.04843-memorycpt/README.md",
      "topic": [
        "端到端 Agent 记忆"
      ],
      "first_author": "Songxin Lei",
      "first_author_affiliation": "Hong Kong University of Science and Technology / Tencent LIGHTSPEED STUDIOS",
      "published": "2026-08-05",
      "code": null,
      "adapter": "memorycpt"
    },
    {
      "domain": "agent-research",
      "key": "memskill",
      "title": "MemSkill",
      "paper_url": "https://arxiv.org/abs/2602.02474",
      "detail_path": "agent-research/2602.02474-memskill/README.md",
      "topic": [
        "记忆技能"
      ],
      "first_author": "Haozhen Zhang",
      "first_author_affiliation": "Nanyang Technological University",
      "published": "2026-02-02",
      "code": "https://github.com/ViktorAxelsen/MemSkill",
      "adapter": "memskill"
    },
    {
      "domain": "agent-research",
      "key": "memtool",
      "title": "MemTool",
      "paper_url": "https://arxiv.org/abs/2507.21428",
      "detail_path": "agent-research/2507.21428-memtool/README.md",
      "topic": [
        "工具记忆"
      ],
      "first_author": "Elias Lumer",
      "first_author_affiliation": "PricewaterhouseCoopers Commercial Technology and Innovation Office",
      "published": "2025-07-29",
      "code": "未发现官方代码",
      "adapter": "memtool"
    },
    {
      "domain": "agent-research",
      "key": "metagpt",
      "title": "MetaGPT",
      "paper_url": "https://arxiv.org/abs/2308.00352",
      "detail_path": "agent-research/2308.00352-metagpt/README.md",
      "topic": [
        "多 Agent 软件工程"
      ],
      "first_author": "Sirui Hong",
      "first_author_affiliation": "DeepWisdom",
      "published": "2023-08-01",
      "code": "https://github.com/FoundationAgents/MetaGPT",
      "adapter": "metagpt"
    },
    {
      "domain": "agent-research",
      "key": "mrkl",
      "title": "MRKL",
      "paper_url": "https://arxiv.org/abs/2205.00445",
      "detail_path": "agent-research/2205.00445-mrkl/README.md",
      "topic": [
        "神经符号路由"
      ],
      "first_author": "Ehud Karpas",
      "first_author_affiliation": "AI21 Labs",
      "published": "2022-05-01",
      "code": "未发现官方代码",
      "adapter": "mrkl"
    },
    {
      "domain": "agent-research",
      "key": "mua-rl",
      "title": "MUA-RL",
      "paper_url": "https://arxiv.org/abs/2508.18669",
      "detail_path": "agent-research/2508.18669-mua-rl/README.md",
      "topic": [
        "多轮用户 Agent RL"
      ],
      "first_author": "Weikang Zhao",
      "first_author_affiliation": "Meituan",
      "published": "2025-08-26",
      "code": "https://github.com/zzwkk/MUA-RL",
      "adapter": "mua-rl"
    },
    {
      "domain": "agent-research",
      "key": "multi-harness-rl",
      "title": "What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents",
      "paper_url": "https://arxiv.org/abs/2609.04518",
      "detail_path": "agent-research/2609.04518-multi-harness-rl/README.md",
      "topic": [
        "Multi-harness RL audit"
      ],
      "first_author": "Chenqian Le",
      "first_author_affiliation": "New York University",
      "published": "2026-09-03",
      "code": null,
      "adapter": "multi-harness-rl"
    },
    {
      "domain": "agent-research",
      "key": "ocsd",
      "title": "OCSD",
      "paper_url": "https://arxiv.org/abs/2608.04788",
      "detail_path": "agent-research/2608.04788-ocsd/README.md",
      "topic": [
        "观测校准蒸馏"
      ],
      "first_author": "Yi Yang",
      "first_author_affiliation": "Nanjing University",
      "published": "2026-08-05",
      "code": "https://github.com/yiy1x/OCSD",
      "adapter": "ocsd"
    },
    {
      "domain": "agent-research",
      "key": "openhands",
      "title": "OpenHands",
      "paper_url": "https://arxiv.org/abs/2407.16741",
      "detail_path": "agent-research/2407.16741-openhands/README.md",
      "topic": [
        "通用软件 Agent"
      ],
      "first_author": "Xingyao Wang",
      "first_author_affiliation": "All-Hands-AI",
      "published": "2024-07-23",
      "code": "https://github.com/All-Hands-AI/OpenHands",
      "adapter": "openhands"
    },
    {
      "domain": "agent-research",
      "key": "openloopevolve",
      "title": "OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks",
      "paper_url": "https://arxiv.org/abs/2608.09380",
      "detail_path": "agent-research/2608.09380-openloopevolve/README.md",
      "topic": [
        "自进化",
        "策略治理"
      ],
      "first_author": "Siqi Wang",
      "first_author_affiliation": "Tsinghua University",
      "published": "2026-08-10",
      "code": "https://github.com/yoyoshikc/OpenLoopEvolve",
      "adapter": "openloopevolve"
    },
    {
      "domain": "agent-research",
      "key": "os-shepherd",
      "title": "OSReward / OS-Shepherd",
      "paper_url": "https://arxiv.org/abs/2607.28609",
      "detail_path": "agent-research/2607.28609-osreward/README.md",
      "topic": [
        "CUA Reward 评测"
      ],
      "first_author": "Qiushi Sun",
      "first_author_affiliation": "The University of Hong Kong",
      "published": "2026-07-30",
      "code": "https://os-copilot.github.io/OSReward-Home/",
      "adapter": "os-shepherd"
    },
    {
      "domain": "agent-research",
      "key": "pal",
      "title": "PAL",
      "paper_url": "https://arxiv.org/abs/2211.10435",
      "detail_path": "agent-research/2211.10435-pal/README.md",
      "topic": [
        "程序推理"
      ],
      "first_author": "Luyu Gao",
      "first_author_affiliation": "Carnegie Mellon University",
      "published": "2022-11-18",
      "code": "https://github.com/reasoning-machines/pal",
      "adapter": "pal"
    },
    {
      "domain": "agent-research",
      "key": "pearl",
      "title": "PEARL",
      "paper_url": "https://arxiv.org/abs/2601.20439",
      "detail_path": "agent-research/2601.20439-pearl/README.md",
      "topic": [
        "规划强化学习"
      ],
      "first_author": "Qihao Wang",
      "first_author_affiliation": "中国科学院信息工程研究所",
      "published": "2026-01-28",
      "code": "未发现官方代码",
      "adapter": "pearl"
    },
    {
      "domain": "agent-research",
      "key": "planpo",
      "title": "PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs",
      "paper_url": "https://arxiv.org/abs/2608.17289",
      "detail_path": "agent-research/2608.17289-planpo/README.md",
      "topic": [
        "Agentic RL",
        "规划"
      ],
      "first_author": "Dayang Liang",
      "first_author_affiliation": "Xiamen University",
      "published": "2026-08-18",
      "code": null,
      "adapter": "planpo"
    },
    {
      "domain": "agent-research",
      "key": "pmcoder",
      "title": "Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution",
      "paper_url": "https://arxiv.org/abs/2608.06811",
      "detail_path": "agent-research/2608.06811-pmcoder/README.md",
      "topic": [
        "代码 Agent",
        "记忆与规划"
      ],
      "first_author": "Jiahao Zhang",
      "first_author_affiliation": "Vanderbilt University",
      "published": "2026-08-07",
      "code": null,
      "adapter": "pmcoder"
    },
    {
      "domain": "agent-research",
      "key": "procedural-graphs",
      "title": "Procedural Graphs: Self-Evolving Execution Structures for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2609.09153",
      "detail_path": "agent-research/2609.09153-procedural-graphs/README.md",
      "topic": [
        "自进化程序图"
      ],
      "first_author": "Yuxing Lu",
      "first_author_affiliation": "Google",
      "published": "2026-09-08",
      "code": null,
      "adapter": "procedural-graphs"
    },
    {
      "domain": "agent-research",
      "key": "progrouter",
      "title": "ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs",
      "paper_url": "https://arxiv.org/abs/2608.25992",
      "detail_path": "agent-research/2608.25992-progrouter/README.md",
      "topic": [
        "在线进展成本路由"
      ],
      "first_author": "Songyuan Li",
      "first_author_affiliation": "Aston University",
      "published": "2026-08-26",
      "code": null,
      "adapter": "progrouter"
    },
    {
      "domain": "agent-research",
      "key": "prompts",
      "title": "PROMPTS: Performance Optimization via Multi-Agent Planning for LLM Training and Serving",
      "paper_url": "https://research.google/pubs/prompts-performance-optimization-via-multi-agent-planning-for-llm-training-and-serving/",
      "detail_path": "agent-research/mlsys2026-prompts/README.md",
      "topic": [
        "训练服务优化",
        "多 Agent 性能诊断"
      ],
      "first_author": "Yuran Ding",
      "first_author_affiliation": "University of Maryland / Google",
      "published": "2026-05-18",
      "code": null,
      "adapter": "prompts",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "ragen",
      "title": "RAGEN",
      "paper_url": "https://arxiv.org/abs/2504.20073",
      "detail_path": "agent-research/2504.20073-ragen/README.md",
      "topic": [
        "多轮 Agent RL"
      ],
      "first_author": "Zihan Wang",
      "first_author_affiliation": "Northwestern",
      "published": "2025-04-24",
      "code": "https://github.com/RAGEN-AI/RAGEN",
      "adapter": "ragen"
    },
    {
      "domain": "agent-research",
      "key": "react",
      "title": "ReAct",
      "paper_url": "https://arxiv.org/abs/2210.03629",
      "detail_path": "agent-research/2210.03629-react/README.md",
      "topic": [
        "推理与行动"
      ],
      "first_author": "Shunyu Yao",
      "first_author_affiliation": "Princeton University",
      "published": "2022-10-06",
      "code": "https://github.com/ysymyth/ReAct",
      "adapter": "react"
    },
    {
      "domain": "agent-research",
      "key": "redevoagent",
      "title": "RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution",
      "paper_url": "https://arxiv.org/abs/2608.27439",
      "detail_path": "agent-research/2608.27439-redevoagent/README.md",
      "topic": [
        "红队技能进化"
      ],
      "first_author": "Junjie Zhang",
      "first_author_affiliation": "City University of Hong Kong",
      "published": "2026-08-27",
      "code": null,
      "adapter": "redevoagent"
    },
    {
      "domain": "agent-research",
      "key": "reflexion",
      "title": "Reflexion",
      "paper_url": "https://arxiv.org/abs/2303.11366",
      "detail_path": "agent-research/2303.11366-reflexion/README.md",
      "topic": [
        "自我反思"
      ],
      "first_author": "Noah Shinn",
      "first_author_affiliation": "Northeastern University",
      "published": "2023-03-20",
      "code": "https://github.com/noahshinn/reflexion",
      "adapter": "reflexion"
    },
    {
      "domain": "agent-research",
      "key": "repoatlas",
      "title": "RepoAtlas: Guiding Coding Agents via Evolving Multimodal Repository Views",
      "paper_url": "https://arxiv.org/abs/2609.16936",
      "detail_path": "agent-research/2609.16936-repoatlas/README.md",
      "topic": [
        "编程 Agent",
        "多模态仓库视图"
      ],
      "first_author": "Yunxiang Zhang",
      "first_author_affiliation": "Beihang University",
      "published": "2026-09-15",
      "code": null,
      "adapter": "repoatlas",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "retool",
      "title": "ReTool",
      "paper_url": "https://arxiv.org/abs/2504.11536",
      "detail_path": "agent-research/2504.11536-retool/README.md",
      "topic": [
        "推理中工具调用"
      ],
      "first_author": "Jiazhan Feng",
      "first_author_affiliation": "ByteDance Seed",
      "published": "2025-04-15",
      "code": "未发现官方代码",
      "adapter": "retool"
    },
    {
      "domain": "agent-research",
      "key": "rewoo",
      "title": "ReWOO",
      "paper_url": "https://arxiv.org/abs/2305.18323",
      "detail_path": "agent-research/2305.18323-rewoo/README.md",
      "topic": [
        "解耦规划"
      ],
      "first_author": "Binfeng Xu",
      "first_author_affiliation": "Microsoft Research",
      "published": "2023-05-29",
      "code": "https://github.com/billxbf/ReWOO",
      "adapter": "rewoo"
    },
    {
      "domain": "agent-research",
      "key": "rtpo",
      "title": "RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training",
      "paper_url": "https://arxiv.org/abs/2608.18682",
      "detail_path": "agent-research/2608.18682-rtpo/README.md",
      "topic": [
        "Agentic RL",
        "credit assignment"
      ],
      "first_author": "Yugu Li",
      "first_author_affiliation": "Adelaide University",
      "published": "2026-08-19",
      "code": null,
      "adapter": "rtpo"
    },
    {
      "domain": "agent-research",
      "key": "sage",
      "title": "SAGE",
      "paper_url": "https://arxiv.org/abs/2512.17102",
      "detail_path": "agent-research/2512.17102-sage/README.md",
      "topic": [
        "技能库强化学习"
      ],
      "first_author": "Jiongxiao Wang",
      "first_author_affiliation": "University of Wisconsin–Madison",
      "published": "2025-12-18",
      "code": "未发现官方代码",
      "adapter": "sage"
    },
    {
      "domain": "agent-research",
      "key": "sapo",
      "title": "SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.19842",
      "detail_path": "agent-research/2608.19842-sapo/README.md",
      "topic": [
        "Agentic RL",
        "credit assignment"
      ],
      "first_author": "Dayang Liang",
      "first_author_affiliation": "Xiamen University",
      "published": "2026-08-20",
      "code": null,
      "adapter": "sapo"
    },
    {
      "domain": "agent-research",
      "key": "saycan",
      "title": "SayCan",
      "paper_url": "https://arxiv.org/abs/2204.01691",
      "detail_path": "agent-research/2204.01691-saycan/README.md",
      "topic": [
        "具身规划"
      ],
      "first_author": "Michael Ahn",
      "first_author_affiliation": "Robotics at Google",
      "published": "2022-04-04",
      "code": "https://github.com/google-research/google-research/tree/master/saycan",
      "adapter": "saycan"
    },
    {
      "domain": "agent-research",
      "key": "sciencebuddy",
      "title": "ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents",
      "paper_url": "https://arxiv.org/abs/2609.17523",
      "detail_path": "agent-research/2609.17523-sciencebuddy/README.md",
      "topic": [
        "科学 Agent",
        "递归自进化"
      ],
      "first_author": "Shuhan Xue",
      "first_author_affiliation": "Gen-Verse research collaboration",
      "published": "2026-09-15",
      "code": "https://github.com/Gen-Verse/ScienceBuddy",
      "adapter": "sciencebuddy",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "search-r1",
      "title": "Search-R1",
      "paper_url": "https://arxiv.org/abs/2503.09516",
      "detail_path": "agent-research/2503.09516-search-r1/README.md",
      "topic": [
        "搜索 Agent RL"
      ],
      "first_author": "Bowen Jin",
      "first_author_affiliation": "University of Illinois Urbana-Champaign",
      "published": "2025-03-12",
      "code": "https://github.com/PeterGriffinJin/Search-R1",
      "adapter": "search-r1"
    },
    {
      "domain": "agent-research",
      "key": "searchatlas",
      "title": "SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs",
      "paper_url": "https://arxiv.org/abs/2609.10901",
      "detail_path": "agent-research/2609.10901-searchatlas/README.md",
      "topic": [
        "搜索 Agent",
        "过程审计"
      ],
      "first_author": "Jiacheng Sang",
      "first_author_affiliation": "Duke University",
      "published": "2026-09-09",
      "code": "https://github.com/DukeNLP/SearchAtlas",
      "adapter": "searchatlas",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "searl",
      "title": "SEARL",
      "paper_url": "https://arxiv.org/abs/2604.07791",
      "detail_path": "agent-research/2604.07791-searl/README.md",
      "topic": [
        "策略—工具图共进化"
      ],
      "first_author": "Xinshun Feng",
      "first_author_affiliation": "Shanghai AI Laboratory",
      "published": "2026-04-09",
      "code": "未发现官方代码",
      "adapter": "searl"
    },
    {
      "domain": "agent-research",
      "key": "seed",
      "title": "SEED",
      "paper_url": "https://arxiv.org/abs/2607.14777",
      "detail_path": "agent-research/2607.14777-seed/README.md",
      "topic": [
        "Agentic RL / hindsight skill"
      ],
      "first_author": "Jinyang Wu",
      "first_author_affiliation": "Tsinghua University",
      "published": "2026-07-16",
      "code": "https://github.com/jinyangwu/SEED",
      "adapter": "seed"
    },
    {
      "domain": "agent-research",
      "key": "self-refine",
      "title": "Self-Refine",
      "paper_url": "https://arxiv.org/abs/2303.17651",
      "detail_path": "agent-research/2303.17651-self-refine/README.md",
      "topic": [
        "自我迭代"
      ],
      "first_author": "Aman Madaan",
      "first_author_affiliation": "Carnegie Mellon University",
      "published": "2023-03-30",
      "code": "https://github.com/madaan/self-refine",
      "adapter": "self-refine"
    },
    {
      "domain": "agent-research",
      "key": "silr",
      "title": "SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents",
      "paper_url": "https://arxiv.org/abs/2609.04629",
      "detail_path": "agent-research/2609.04629-silr/README.md",
      "topic": [
        "Structure-preserving verifier and reward"
      ],
      "first_author": "Chenyu Zhou",
      "first_author_affiliation": "Institute of Science Tokyo",
      "published": "2026-09-03",
      "code": null,
      "adapter": "silr"
    },
    {
      "domain": "agent-research",
      "key": "sinkflex-rl",
      "title": "Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks",
      "paper_url": "https://arxiv.org/abs/2608.10357",
      "detail_path": "agent-research/2608.10357-sinkflex-rl/README.md",
      "topic": [
        "Agentic RL / efficient long context"
      ],
      "first_author": "Zelei Cheng",
      "first_author_affiliation": "Capital One AI Foundations",
      "published": "2026-08-11",
      "code": null,
      "adapter": "sinkflex-rl"
    },
    {
      "domain": "agent-research",
      "key": "skill-retention",
      "title": "When Synthetic Data Hurts: On Catastrophic Forgetting in Skill Retrieval for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2609.10750",
      "detail_path": "agent-research/2609.10750-skill-retention/README.md",
      "topic": [
        "技能检索",
        "灾难性遗忘"
      ],
      "first_author": "Syed Shariyar Murtaza",
      "first_author_affiliation": "Manulife",
      "published": "2026-09-09",
      "code": "https://github.com/manulife-ai/emnlp2026/",
      "adapter": "skill-retention",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "skillforge",
      "title": "SkillForge: Automated Skill Discovery and Refinement for Tool-Using Agents",
      "paper_url": "https://arxiv.org/abs/2608.24747",
      "detail_path": "agent-research/2608.24747-skillforge/README.md",
      "topic": [
        "可验证技能锻造"
      ],
      "first_author": "Shidong Yang",
      "first_author_affiliation": "AMAP, Alibaba Group",
      "published": "2026-08-25",
      "code": null,
      "adapter": "skillforge"
    },
    {
      "domain": "agent-research",
      "key": "skillrise",
      "title": "SkillRise",
      "paper_url": "https://arxiv.org/abs/2607.26784",
      "detail_path": "agent-research/2607.26784-skillrise/README.md",
      "topic": [
        "跨任务技能进化"
      ],
      "first_author": "Zhiyuan Yao",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-07-29",
      "code": "https://github.com/Within-yao/SkillRise",
      "adapter": "skillrise"
    },
    {
      "domain": "agent-research",
      "key": "smith",
      "title": "SMITH: Self-Improving Tool-Using Agents through Multi-Aspect Verification",
      "paper_url": "https://arxiv.org/abs/2608.24571",
      "detail_path": "agent-research/2608.24571-smith/README.md",
      "topic": [
        "多维验证工具自进化"
      ],
      "first_author": "Zhi Rui Tam",
      "first_author_affiliation": "Appier AI Research / National Taiwan University",
      "published": "2026-08-25",
      "code": "https://github.com/appier-research/smith",
      "adapter": "smith"
    },
    {
      "domain": "agent-research",
      "key": "spade",
      "title": "SPADE: Self-Play in Adaptive Synthetic Executable Environments",
      "paper_url": "https://arxiv.org/abs/2608.19197",
      "detail_path": "agent-research/2608.19197-spade/README.md",
      "topic": [
        "Agentic RL",
        "环境生成"
      ],
      "first_author": "Bo Liu",
      "first_author_affiliation": "University of Washington",
      "published": "2026-08-19",
      "code": "https://github.com/spade-rl/spade",
      "adapter": "spade"
    },
    {
      "domain": "agent-research",
      "key": "spo-plus-plus",
      "title": "SPO++: Stabilizing Asynchronous Agentic Reinforcement Learning via Measure-Theoretic Token Correction",
      "paper_url": "https://arxiv.org/abs/2608.24870",
      "detail_path": "agent-research/2608.24870-spo-plus-plus/README.md",
      "topic": [
        "异步单流 Agent RL"
      ],
      "first_author": "Kai Ruan",
      "first_author_affiliation": "Renmin University of China",
      "published": "2026-08-25",
      "code": null,
      "adapter": "spo-plus-plus"
    },
    {
      "domain": "agent-research",
      "key": "spt",
      "title": "SPT: Skills as Pre-Training Data for Agentic Language Models",
      "paper_url": "https://arxiv.org/abs/2608.26563",
      "detail_path": "agent-research/2608.26563-spt/README.md",
      "topic": [
        "Agent 技能预训练"
      ],
      "first_author": "Yufei Sun",
      "first_author_affiliation": "Beijing University of Posts and Telecommunications",
      "published": "2026-08-27",
      "code": null,
      "adapter": "spt"
    },
    {
      "domain": "agent-research",
      "key": "state2state",
      "title": "State2State: Environment-Derived Mid-Training for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.04934",
      "detail_path": "agent-research/2608.04934-state2state/README.md",
      "topic": [
        "环境派生中训练"
      ],
      "first_author": "Xuanyu Lei",
      "first_author_affiliation": "Tsinghua University AIR / Alibaba Group",
      "published": "2026-08-05",
      "code": "https://github.com/THUNLP-MT/State2State",
      "adapter": "state2state"
    },
    {
      "domain": "agent-research",
      "key": "steppo",
      "title": "StepPO",
      "paper_url": "https://arxiv.org/abs/2604.18401",
      "detail_path": "agent-research/2604.18401-steppo/README.md",
      "topic": [
        "Step-aligned Agent RL"
      ],
      "first_author": "Daoyu Wang",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-04-20",
      "code": "未发现官方代码",
      "adapter": "steppo"
    },
    {
      "domain": "agent-research",
      "key": "swe-agent",
      "title": "SWE-agent",
      "paper_url": "https://arxiv.org/abs/2405.15793",
      "detail_path": "agent-research/2405.15793-swe-agent/README.md",
      "topic": [
        "软件工程 ACI"
      ],
      "first_author": "John Yang",
      "first_author_affiliation": "Princeton University",
      "published": "2024-05-06",
      "code": "https://github.com/SWE-agent/SWE-agent",
      "adapter": "swe-agent"
    },
    {
      "domain": "agent-research",
      "key": "swe-prime",
      "title": "SWE-Prime: Fewer Trajectories, Better Performance",
      "paper_url": "https://arxiv.org/abs/2608.27449",
      "detail_path": "agent-research/2608.27449-swe-prime/README.md",
      "topic": [
        "软件轨迹筛选"
      ],
      "first_author": "Dewu Zheng",
      "first_author_affiliation": "Sun Yat-sen University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "swe-prime"
    },
    {
      "domain": "agent-research",
      "key": "t1-terminal-rl",
      "title": "T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks",
      "paper_url": "https://arxiv.org/abs/2609.11042",
      "detail_path": "agent-research/2609.11042-t1-terminal-rl/README.md",
      "topic": [
        "Agent RL",
        "长程终端任务"
      ],
      "first_author": "Junyao Yang",
      "first_author_affiliation": "National University of Singapore / Tencent",
      "published": "2026-09-09",
      "code": null,
      "adapter": "t1-terminal-rl",
      "priority": "P1"
    },
    {
      "domain": "agent-research",
      "key": "tapo",
      "title": "TAPO",
      "paper_url": "https://arxiv.org/abs/2607.27973",
      "detail_path": "agent-research/2607.27973-tapo/README.md",
      "topic": [
        "Agent RL"
      ],
      "first_author": "Cong Li",
      "first_author_affiliation": "Peking University",
      "published": "2026-07-30",
      "code": "未发现官方代码",
      "adapter": "tapo"
    },
    {
      "domain": "agent-research",
      "key": "toolbench",
      "title": "ToolBench",
      "paper_url": "https://arxiv.org/abs/2305.16504",
      "detail_path": "agent-research/2305.16504-toolbench/README.md",
      "topic": [
        "工具指令与评测"
      ],
      "first_author": "Qiantong Xu",
      "first_author_affiliation": "Tsinghua University",
      "published": "2023-05-25",
      "code": "未发现官方代码",
      "adapter": "toolbench"
    },
    {
      "domain": "agent-research",
      "key": "toolformer",
      "title": "Toolformer",
      "paper_url": "https://arxiv.org/abs/2302.04761",
      "detail_path": "agent-research/2302.04761-toolformer/README.md",
      "topic": [
        "工具学习"
      ],
      "first_author": "Timo Schick",
      "first_author_affiliation": "Meta AI Research",
      "published": "2023-02-09",
      "code": "未发现官方代码",
      "adapter": "toolformer"
    },
    {
      "domain": "agent-research",
      "key": "toolgrad",
      "title": "ToolGrad: Efficient Tool-Use Dataset Generation with Textual Gradients",
      "paper_url": "https://arxiv.org/abs/2508.04086",
      "detail_path": "agent-research/2508.04086-toolgrad/README.md",
      "topic": [
        "工具学习",
        "数据生成"
      ],
      "first_author": "Zhongyi Zhou",
      "first_author_affiliation": "Google",
      "published": "2025-08-06",
      "code": "https://github.com/zhongyi-zhou/toolgrad",
      "adapter": "toolgrad",
      "priority": "P0"
    },
    {
      "domain": "agent-research",
      "key": "toollift",
      "title": "ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning",
      "paper_url": "https://arxiv.org/abs/2608.03468",
      "detail_path": "agent-research/2608.03468-toollift/README.md",
      "topic": [
        "工具规划",
        "图结构"
      ],
      "first_author": "Xiuhui You",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-08-04",
      "code": null,
      "adapter": "toollift"
    },
    {
      "domain": "agent-research",
      "key": "toolrl",
      "title": "ToolRL",
      "paper_url": "https://arxiv.org/abs/2504.13958",
      "detail_path": "agent-research/2504.13958-toolrl/README.md",
      "topic": [
        "工具强化学习"
      ],
      "first_author": "Cheng Qian",
      "first_author_affiliation": "University of Illinois Urbana-Champaign",
      "published": "2025-04-16",
      "code": "未发现官方代码",
      "adapter": "toolrl"
    },
    {
      "domain": "agent-research",
      "key": "topas",
      "title": "TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving",
      "paper_url": "https://arxiv.org/abs/2608.25523",
      "detail_path": "agent-research/2608.25523-topas/README.md",
      "topic": [
        "工作流 Prefix-State 调度"
      ],
      "first_author": "Hongqiu Ni",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-08-26",
      "code": null,
      "adapter": "topas"
    },
    {
      "domain": "agent-research",
      "key": "traceml",
      "title": "TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development",
      "paper_url": "https://arxiv.org/abs/2608.26086",
      "detail_path": "agent-research/2608.26086-traceml/README.md",
      "topic": [
        "ML 开发轨迹规划"
      ],
      "first_author": "Jiarui Yan",
      "first_author_affiliation": "Carnegie Mellon University",
      "published": "2026-08-26",
      "code": "https://huggingface.co/datasets/jerryyan/TraceML",
      "adapter": "traceml"
    },
    {
      "domain": "agent-research",
      "key": "trca",
      "title": "TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.16156",
      "detail_path": "agent-research/2608.16156-trca/README.md",
      "topic": [
        "Agentic RL",
        "过程奖励"
      ],
      "first_author": "Huan Zhang",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-08-17",
      "code": null,
      "adapter": "trca"
    },
    {
      "domain": "agent-research",
      "key": "tree-of-thoughts",
      "title": "Tree of Thoughts",
      "paper_url": "https://arxiv.org/abs/2305.10601",
      "detail_path": "agent-research/2305.10601-tree-of-thoughts/README.md",
      "topic": [
        "推理搜索"
      ],
      "first_author": "Shunyu Yao",
      "first_author_affiliation": "Princeton University",
      "published": "2023-05-17",
      "code": "https://github.com/princeton-nlp/tree-of-thought-llm",
      "adapter": "tree-of-thoughts"
    },
    {
      "domain": "agent-research",
      "key": "turn-opd",
      "title": "TurnOPD",
      "paper_url": "https://arxiv.org/abs/2607.05804",
      "detail_path": "agent-research/2607.05804-turn-opd/README.md",
      "topic": [
        "Agentic OPD / rollout budgeting"
      ],
      "first_author": "Yuhang Zhou",
      "first_author_affiliation": "Academic author team",
      "published": "2026-07-07",
      "code": "未发现官方代码",
      "adapter": "turn-opd"
    },
    {
      "domain": "agent-research",
      "key": "u-mem",
      "title": "U-Mem",
      "paper_url": "https://arxiv.org/abs/2602.22406",
      "detail_path": "agent-research/2602.22406-u-mem/README.md",
      "topic": [
        "主动记忆"
      ],
      "first_author": "Xinle Wu",
      "first_author_affiliation": "National University of Singapore",
      "published": "2026-02-25",
      "code": "https://anonymous.4open.science/r/code-release-456D/",
      "adapter": "u-mem"
    },
    {
      "domain": "agent-research",
      "key": "unimem",
      "title": "UniMem",
      "paper_url": "https://arxiv.org/abs/2607.26017",
      "detail_path": "agent-research/2607.26017-unimem/README.md",
      "topic": [
        "Continual agent memory"
      ],
      "first_author": "Siyu Xia",
      "first_author_affiliation": "CASIA",
      "published": "2026-07-28",
      "code": "未发现官方代码",
      "adapter": "unimem"
    },
    {
      "domain": "agent-research",
      "key": "vag",
      "title": "When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents",
      "paper_url": "https://arxiv.org/abs/2608.05810",
      "detail_path": "agent-research/2608.05810-vag/README.md",
      "topic": [
        "技能进化安全"
      ],
      "first_author": "Linfang Shang",
      "first_author_affiliation": "论文未列机构",
      "published": "2026-08-06",
      "code": null,
      "adapter": "vag"
    },
    {
      "domain": "agent-research",
      "key": "vermem",
      "title": "VerMem",
      "paper_url": "https://arxiv.org/abs/2608.03137",
      "detail_path": "agent-research/2608.03137-vermem/README.md",
      "topic": [
        "可验证统一记忆"
      ],
      "first_author": "Xiaolong Sun",
      "first_author_affiliation": "Sun Yat-sen University",
      "published": "2026-08-04",
      "code": "https://github.com/Sun-SYSU-24/VerMem",
      "adapter": "vermem"
    },
    {
      "domain": "agent-research",
      "key": "voyager",
      "title": "Voyager",
      "paper_url": "https://arxiv.org/abs/2305.16291",
      "detail_path": "agent-research/2305.16291-voyager/README.md",
      "topic": [
        "终身学习"
      ],
      "first_author": "Guanzhi Wang",
      "first_author_affiliation": "NVIDIA",
      "published": "2023-05-25",
      "code": "https://github.com/MineDojo/Voyager",
      "adapter": "voyager"
    },
    {
      "domain": "agent-research",
      "key": "webagent-r1",
      "title": "WebAgent-R1",
      "paper_url": "https://arxiv.org/abs/2505.16421",
      "detail_path": "agent-research/2505.16421-webagent-r1/README.md",
      "topic": [
        "网页 Agent RL"
      ],
      "first_author": "Zhepei Wei",
      "first_author_affiliation": "University of Virginia",
      "published": "2025-05-22",
      "code": "https://github.com/weizhepei/WebAgent-R1",
      "adapter": "webagent-r1"
    },
    {
      "domain": "agent-research",
      "key": "webgpt",
      "title": "WebGPT",
      "paper_url": "https://arxiv.org/abs/2112.09332",
      "detail_path": "agent-research/2112.09332-webgpt/README.md",
      "topic": [
        "浏览问答"
      ],
      "first_author": "Reiichiro Nakano",
      "first_author_affiliation": "OpenAI",
      "published": "2021-12-17",
      "code": "https://huggingface.co/datasets/openai/webgpt_comparisons",
      "adapter": "webgpt"
    },
    {
      "domain": "foundation-models",
      "key": "adadsf",
      "title": "Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs",
      "paper_url": "https://arxiv.org/abs/2607.21291",
      "detail_path": "reproductions/2607.21291-adadsf/README.md",
      "topic": [
        "llm-architecture",
        "efficient-inference",
        "token-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei ACS Lab / Southern University of Science and Technology",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "adadsf",
        "arxiv_id": "2607.21291",
        "title": "Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs",
        "paper_url": "https://arxiv.org/abs/2607.21291",
        "track": "llm",
        "organization": "Huawei ACS Lab / Southern University of Science and Technology",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "efficient-inference",
          "token-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/adadsf",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同一个 96-d、4-layer dense teacher",
        "metrics": [
          "variants.adadsf_80.perplexity",
          "variants.dense_teacher.perplexity",
          "variants.uniform_mod_80.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=70",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "agentkv",
      "title": "AgentKV: Phase-Aware KV Eviction for Agentic LLMs",
      "paper_url": "https://arxiv.org/abs/2609.14872",
      "detail_path": "foundation-models/2609.14872-agentkv/README.md",
      "topic": [
        "Agent 推理",
        "KV Cache"
      ],
      "first_author": "Taowen Tony Liu",
      "first_author_affiliation": "University of Cambridge",
      "published": "2026-09-14",
      "code": "https://github.com/LiuTaowen-Tony/agentkv",
      "adapter": "agentkv",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "alibi",
      "title": "Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation",
      "paper_url": "https://arxiv.org/abs/2108.12409",
      "detail_path": "reproductions/2108.12409-alibi/README.md",
      "topic": [
        "position-encoding",
        "length-extrapolation",
        "attention"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Washington / Meta AI",
      "published": "2021-08-27",
      "code": "https://github.com/ofirpress/attention_with_linear_biases",
      "adapter": {
        "adapter_key": "alibi",
        "arxiv_id": "2108.12409",
        "title": "Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation",
        "paper_url": "https://arxiv.org/abs/2108.12409",
        "track": "llm",
        "organization": "University of Washington / Meta AI",
        "published": "2021-08-27",
        "code_url": "https://github.com/ofirpress/attention_with_linear_biases",
        "topics": [
          "position-encoding",
          "length-extrapolation",
          "attention"
        ],
        "local_code_dir": "src/auto_research/reproductions/alibi",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 alibi",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.train_short_test_long",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "paper_results.memory_percent",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "aspire",
      "title": "ASPIRE: Asynchronous Batch Self-Speculative Decoding",
      "paper_url": "https://arxiv.org/abs/2609.17943",
      "detail_path": "foundation-models/2609.17943-aspire/README.md",
      "topic": [
        "推测解码",
        "推理效率"
      ],
      "first_author": "Amir Ziashahabi",
      "first_author_affiliation": "University of Southern California",
      "published": "2026-09-16",
      "code": null,
      "adapter": "aspire",
      "priority": "P1",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/aspire-a100-20260919.json"
    },
    {
      "domain": "foundation-models",
      "key": "autonomy-heads",
      "title": "Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry",
      "paper_url": "https://arxiv.org/abs/2608.06849",
      "detail_path": "reproductions/2608.06849-autonomy-heads/README.md",
      "topic": [
        "注意力与长上下文",
        "稀疏注意力"
      ],
      "first_author": null,
      "first_author_affiliation": "Institute of Computing Technology, Chinese Academy of Sciences",
      "published": "2026-08-07",
      "code": null,
      "adapter": {
        "adapter_key": "autonomy-heads",
        "arxiv_id": "2608.06849",
        "title": "Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry",
        "paper_url": "https://arxiv.org/abs/2608.06849",
        "track": "llm",
        "organization": "Institute of Computing Technology, Chinese Academy of Sciences",
        "published": "2026-08-07",
        "code_url": null,
        "topics": [
          "注意力与长上下文",
          "稀疏注意力"
        ],
        "local_code_dir": "src/auto_research/reproductions/autonomy_heads",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "awq",
      "title": "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration",
      "paper_url": "https://arxiv.org/abs/2306.00978",
      "detail_path": "reproductions/2306.00978-awq/README.md",
      "topic": [
        "inference-serving",
        "quantization"
      ],
      "first_author": null,
      "first_author_affiliation": "MIT / NVIDIA / Harvard / SJTU",
      "published": "2023-06-01",
      "code": "https://github.com/mit-han-lab/llm-awq",
      "adapter": {
        "adapter_key": "awq",
        "arxiv_id": "2306.00978",
        "title": "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration",
        "paper_url": "https://arxiv.org/abs/2306.00978",
        "track": "llm",
        "organization": "MIT / NVIDIA / Harvard / SJTU",
        "published": "2023-06-01",
        "code_url": "https://github.com/mit-han-lab/llm-awq",
        "topics": [
          "inference-serving",
          "quantization"
        ],
        "local_code_dir": "src/auto_research/reproductions/awq",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 activation calibration"
        ],
        "baseline": "round-to-nearest W4，实验组为 activation-aware equivalent scaling W4，只改变论文核心机制",
        "metrics": [
          "baseline.output_mse",
          "method.output_mse",
          "relative.output_mse_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "bakron",
      "title": "BaKron: Efficient Quantization with Kronecker-Factored Hessians",
      "paper_url": "https://arxiv.org/abs/2608.06291",
      "detail_path": "reproductions/2608.06291-bakron/README.md",
      "topic": [
        "quantization",
        "hessian",
        "inference-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "University of California, San Diego",
      "published": "2026-08-06",
      "code": null,
      "adapter": {
        "adapter_key": "bakron",
        "arxiv_id": "2608.06291",
        "title": "BaKron: Efficient Quantization with Kronecker-Factored Hessians",
        "paper_url": "https://arxiv.org/abs/2608.06291",
        "track": "llm",
        "organization": "University of California, San Diego",
        "published": "2026-08-06",
        "code_url": null,
        "topics": [
          "quantization",
          "hessian",
          "inference-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/bakron",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic public-style mini-suite"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "bakron.reported_objective"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "beaconkv",
      "title": "BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference",
      "paper_url": "https://arxiv.org/abs/2609.04971",
      "detail_path": "reproductions/2609.04971-beaconkv/README.md",
      "topic": [
        "kv-cache",
        "long-context",
        "reasoning",
        "inference-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Hanyang University",
      "published": "2026-09-04",
      "code": null,
      "adapter": {
        "adapter_key": "beaconkv",
        "arxiv_id": "2609.04971",
        "title": "BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference",
        "paper_url": "https://arxiv.org/abs/2609.04971",
        "track": "llm",
        "organization": "Hanyang University",
        "published": "2026-09-04",
        "code_url": null,
        "topics": [
          "kv-cache",
          "long-context",
          "reasoning",
          "inference-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/beaconkv",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "public-domain long-context probe"
        ],
        "baseline": "equal-budget recent-token KV retention",
        "metrics": [
          "attention-output cosine",
          "retained tokens",
          "peak GPU memory"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/beaconkv-a100-20260907.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": [
          "attention:beacon-query-kv"
        ]
      }
    },
    {
      "domain": "foundation-models",
      "key": "blip2",
      "title": "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models",
      "paper_url": "https://arxiv.org/abs/2301.12597",
      "detail_path": "reproductions/2301.12597-blip2/README.md",
      "topic": [
        "multimodal",
        "q-former",
        "frozen-encoders"
      ],
      "first_author": null,
      "first_author_affiliation": "Salesforce Research",
      "published": "2023-01-30",
      "code": "https://github.com/salesforce/LAVIS",
      "adapter": {
        "adapter_key": "blip2",
        "arxiv_id": "2301.12597",
        "title": "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models",
        "paper_url": "https://arxiv.org/abs/2301.12597",
        "track": "llm",
        "organization": "Salesforce Research",
        "published": "2023-01-30",
        "code_url": "https://github.com/salesforce/LAVIS",
        "topics": [
          "multimodal",
          "q-former",
          "frozen-encoders"
        ],
        "local_code_dir": "src/auto_research/reproductions/blip2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST object QA"
        ],
        "baseline": "linear mean-pooled connector",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta",
          "visual_tokens"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "blt",
      "title": "Byte Latent Transformer: Patches Scale Better Than Tokens",
      "paper_url": "https://arxiv.org/abs/2412.09871",
      "detail_path": "reproductions/2412.09871-blt/README.md",
      "topic": [
        "tokenizer-free",
        "byte-model",
        "dynamic-patching",
        "architecture"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta FAIR",
      "published": "2024-12-13",
      "code": "https://github.com/facebookresearch/blt",
      "adapter": {
        "adapter_key": "blt",
        "arxiv_id": "2412.09871",
        "title": "Byte Latent Transformer: Patches Scale Better Than Tokens",
        "paper_url": "https://arxiv.org/abs/2412.09871",
        "track": "llm",
        "organization": "Meta FAIR",
        "published": "2024-12-13",
        "code_url": "https://github.com/facebookresearch/blt",
        "topics": [
          "tokenizer-free",
          "byte-model",
          "dynamic-patching",
          "architecture"
        ],
        "local_code_dir": "src/auto_research/reproductions/blt",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 blt",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.expanded_back_to_byte_targets",
          "method.architecture_stats.observed_patch_boundary_rate",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "c2kv",
      "title": "C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference",
      "paper_url": "https://arxiv.org/abs/2607.17715",
      "detail_path": "reproductions/2607.17715-c2kv/README.md",
      "topic": [
        "推理与系统效率",
        "KV cache"
      ],
      "first_author": null,
      "first_author_affiliation": "Shanghai Jiao Tong University",
      "published": "2026-07-20",
      "code": "https://github.com/s7a9/C2KV",
      "adapter": {
        "adapter_key": "c2kv",
        "arxiv_id": "2607.17715",
        "title": "C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference",
        "paper_url": "https://arxiv.org/abs/2607.17715",
        "track": "llm",
        "organization": "Shanghai Jiao Tong University",
        "published": "2026-07-20",
        "code_url": "https://github.com/s7a9/C2KV",
        "topics": [
          "推理与系统效率",
          "KV cache"
        ],
        "local_code_dir": "src/auto_research/reproductions/c2kv",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "clip",
      "title": "Learning Transferable Visual Models From Natural Language Supervision",
      "paper_url": "https://arxiv.org/abs/2103.00020",
      "detail_path": "reproductions/2103.00020-clip/README.md",
      "topic": [
        "multimodal",
        "contrastive-pretraining"
      ],
      "first_author": null,
      "first_author_affiliation": "OpenAI",
      "published": "2021-02-26",
      "code": "https://github.com/openai/CLIP",
      "adapter": {
        "adapter_key": "clip",
        "arxiv_id": "2103.00020",
        "title": "Learning Transferable Visual Models From Natural Language Supervision",
        "paper_url": "https://arxiv.org/abs/2103.00020",
        "track": "llm",
        "organization": "OpenAI",
        "published": "2021-02-26",
        "code_url": "https://github.com/openai/CLIP",
        "topics": [
          "multimodal",
          "contrastive-pretraining"
        ],
        "local_code_dir": "src/auto_research/reproductions/clip",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST image-text pairs"
        ],
        "baseline": "uniform label retrieval",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=150",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "conv-llm",
      "title": "Convolution for Large Language Models",
      "paper_url": "https://arxiv.org/abs/2607.18413",
      "detail_path": "reproductions/2607.18413-conv-llm/README.md",
      "topic": [
        "llm-architecture",
        "attention",
        "depthwise-convolution"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei / Peking University / Tsinghua University",
      "published": "2026-07-20",
      "code": null,
      "adapter": {
        "adapter_key": "conv-llm",
        "arxiv_id": "2607.18413",
        "title": "Convolution for Large Language Models",
        "paper_url": "https://arxiv.org/abs/2607.18413",
        "track": "llm",
        "organization": "Huawei / Peking University / Tsinghua University",
        "published": "2026-07-20",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "attention",
          "depthwise-convolution"
        ],
        "local_code_dir": "src/auto_research/reproductions/conv_llm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "相同 96-d、3-layer、60-step Transformer",
        "metrics": [
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.test_loss",
          "method.parameters",
          "method.perplexity",
          "method.test_loss",
          "perplexity_reduction_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=60",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "criticl",
      "title": "CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes",
      "paper_url": "https://arxiv.org/abs/2608.27455",
      "detail_path": "foundation-models/2608.27455-criticl/README.md",
      "topic": [
        "弱模型失败模式 ICL"
      ],
      "first_author": "Yufan Wu",
      "first_author_affiliation": "The Ohio State University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "criticl"
    },
    {
      "domain": "foundation-models",
      "key": "dart",
      "title": "DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling",
      "paper_url": "https://arxiv.org/abs/2608.02032",
      "detail_path": "reproductions/2608.02032-dart/README.md",
      "topic": [
        "网络架构",
        "注意力与长上下文"
      ],
      "first_author": null,
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-08-03",
      "code": null,
      "adapter": {
        "adapter_key": "dart",
        "arxiv_id": "2608.02032",
        "title": "DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling",
        "paper_url": "https://arxiv.org/abs/2608.02032",
        "track": "llm",
        "organization": "Zhejiang University",
        "published": "2026-08-03",
        "code_url": null,
        "topics": [
          "网络架构",
          "注意力与长上下文"
        ],
        "local_code_dir": "src/auto_research/reproductions/dart",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "data-mixing-laws",
      "title": "Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance",
      "paper_url": "https://arxiv.org/abs/2403.16952",
      "detail_path": "reproductions/2403.16952-data-mixing-laws/README.md",
      "topic": [
        "pretraining-data",
        "scaling-law",
        "data-mixture"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Cambridge / Shanghai AI Laboratory",
      "published": "2024-03-25",
      "code": "https://github.com/yegcjs/mixinglaws",
      "adapter": {
        "adapter_key": "data-mixing-laws",
        "arxiv_id": "2403.16952",
        "title": "Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance",
        "paper_url": "https://arxiv.org/abs/2403.16952",
        "track": "llm",
        "organization": "University of Cambridge / Shanghai AI Laboratory",
        "published": "2024-03-25",
        "code_url": "https://github.com/yegcjs/mixinglaws",
        "topics": [
          "pretraining-data",
          "scaling-law",
          "data-mixture"
        ],
        "local_code_dir": "src/auto_research/reproductions/data_mixing_laws",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 + public narrative domain"
        ],
        "baseline": "均匀数据混合，实验组为 data-mixing-laws",
        "metrics": [
          "baseline.validation_loss",
          "method.validation_loss",
          "relative.validation_loss_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "data-orchestra",
      "title": "DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data",
      "paper_url": "https://arxiv.org/abs/2607.24717",
      "detail_path": "reproductions/2607.24717-data-orchestra/README.md",
      "topic": [
        "llm-pretraining",
        "data-curation",
        "data-cleaning",
        "learned-orchestration"
      ],
      "first_author": null,
      "first_author_affiliation": "Fudan University / Shanghai Jiao Tong University / SII-GAIR",
      "published": "2026-07-27",
      "code": "https://github.com/GAIR-NLP/DataOrchestra",
      "adapter": {
        "adapter_key": "data-orchestra",
        "arxiv_id": "2607.24717",
        "title": "DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data",
        "paper_url": "https://arxiv.org/abs/2607.24717",
        "track": "llm",
        "organization": "Fudan University / Shanghai Jiao Tong University / SII-GAIR",
        "published": "2026-07-27",
        "code_url": "https://github.com/GAIR-NLP/DataOrchestra",
        "topics": [
          "llm-pretraining",
          "data-curation",
          "data-cleaning",
          "learned-orchestration"
        ],
        "local_code_dir": "src/auto_research/reproductions/data_orchestra",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "在 WikiText-2 raw 文本上训练同一个 208,872 参数 Llama-style LM",
        "metrics": [
          "orchestrator_training.final_loss",
          "orchestrator_training.held_out_action_accuracy",
          "orchestrator_training.held_out_operation_accuracy",
          "orchestrator_training.initial_loss",
          "relative.perplexity_reduction_vs_raw_percent",
          "setup.same_tokens_steps_optimizer_architecture",
          "variants.DataOrchestra.final_loss",
          "variants.DataOrchestra.initial_loss",
          "variants.DataOrchestra.loss",
          "variants.DataOrchestra.perplexity",
          "variants.Raw.final_loss",
          "variants.Raw.initial_loss",
          "variants.Raw.loss",
          "variants.Raw.perplexity",
          "variants.Static cleaner.final_loss",
          "variants.Static cleaner.initial_loss",
          "variants.Static cleaner.loss",
          "variants.Static cleaner.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=55",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "dblast",
      "title": "DBLast: Dependent Block Drafting for Stochastic Speculative Decoding",
      "paper_url": "https://arxiv.org/abs/2608.05448",
      "detail_path": "reproductions/2608.05448-dblast/README.md",
      "topic": [
        "speculative-decoding",
        "inference-efficiency",
        "stochastic-decoding"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei Technologies Canada",
      "published": "2026-08-05",
      "code": null,
      "adapter": {
        "adapter_key": "dblast",
        "arxiv_id": "2608.05448",
        "title": "DBLast: Dependent Block Drafting for Stochastic Speculative Decoding",
        "paper_url": "https://arxiv.org/abs/2608.05448",
        "track": "llm",
        "organization": "Huawei Technologies Canada",
        "published": "2026-08-05",
        "code_url": null,
        "topics": [
          "speculative-decoding",
          "inference-efficiency",
          "stochastic-decoding"
        ],
        "local_code_dir": "src/auto_research/reproductions/dblast",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic public-style mini-suite"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "dblast.reported_objective"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "distillcache",
      "title": "DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference",
      "paper_url": "https://arxiv.org/abs/2608.08878",
      "detail_path": "reproductions/2608.08878-distillcache/README.md",
      "topic": [
        "推理与系统效率",
        "KV cache"
      ],
      "first_author": null,
      "first_author_affiliation": "Oklahoma State University",
      "published": "2026-08-09",
      "code": null,
      "adapter": {
        "adapter_key": "distillcache",
        "arxiv_id": "2608.08878",
        "title": "DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference",
        "paper_url": "https://arxiv.org/abs/2608.08878",
        "track": "llm",
        "organization": "Oklahoma State University",
        "published": "2026-08-09",
        "code_url": null,
        "topics": [
          "推理与系统效率",
          "KV cache"
        ],
        "local_code_dir": "src/auto_research/reproductions/distillcache",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "doremi",
      "title": "DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining",
      "paper_url": "https://arxiv.org/abs/2305.10429",
      "detail_path": "reproductions/2305.10429-doremi/README.md",
      "topic": [
        "pretraining-data",
        "data-mixture",
        "group-dro"
      ],
      "first_author": null,
      "first_author_affiliation": "Stanford University / Google Research",
      "published": "2023-05-17",
      "code": "https://github.com/sangmichaelxie/doremi",
      "adapter": {
        "adapter_key": "doremi",
        "arxiv_id": "2305.10429",
        "title": "DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining",
        "paper_url": "https://arxiv.org/abs/2305.10429",
        "track": "llm",
        "organization": "Stanford University / Google Research",
        "published": "2023-05-17",
        "code_url": "https://github.com/sangmichaelxie/doremi",
        "topics": [
          "pretraining-data",
          "data-mixture",
          "group-dro"
        ],
        "local_code_dir": "src/auto_research/reproductions/doremi",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 + public narrative domain"
        ],
        "baseline": "均匀数据混合，实验组为 doremi",
        "metrics": [
          "baseline.validation_loss",
          "method.validation_loss",
          "paper_results.few_shot_accuracy_points",
          "relative.validation_loss_percent",
          "stages.worst_excess_loss_updates"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "dqwen35",
      "title": "dQwen3.5: Adapting Hybrid Language Models into Bidirectional Diffusion Language Models",
      "paper_url": "https://arxiv.org/abs/2609.20751",
      "detail_path": "foundation-models/2609.20751-dqwen35/README.md",
      "topic": [
        "扩散语言模型",
        "网络架构"
      ],
      "first_author": "Anton Xue",
      "first_author_affiliation": "University of Texas at Austin",
      "published": "2026-09-17",
      "code": null,
      "checkpoint": "https://huggingface.co/UT-IFML/dQwen3.5-9B-Base",
      "adapter": "dqwen35",
      "priority": "P1",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/dqwen35-a100-20260919.json"
    },
    {
      "domain": "foundation-models",
      "key": "echo",
      "title": "ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding",
      "paper_url": "https://arxiv.org/abs/2609.17241",
      "detail_path": "foundation-models/2609.17241-echo/README.md",
      "topic": [
        "推测解码",
        "推理效率"
      ],
      "first_author": "Ziyang Ma",
      "first_author_affiliation": "Wuhan University",
      "published": "2026-09-15",
      "code": "https://github.com/whucs21Mzy/ECHO",
      "adapter": "echo",
      "priority": "P0",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/echo-a100-20260916.json"
    },
    {
      "domain": "foundation-models",
      "key": "engram",
      "title": "Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models",
      "paper_url": "https://arxiv.org/abs/2601.07372",
      "detail_path": "reproductions/2601.07372-engram/README.md",
      "topic": [
        "llm-architecture",
        "conditional-memory",
        "sparsity"
      ],
      "first_author": null,
      "first_author_affiliation": "DeepSeek",
      "published": "2026-01-12",
      "code": "https://github.com/deepseek-ai/Engram",
      "adapter": {
        "adapter_key": "engram",
        "arxiv_id": "2601.07372",
        "title": "Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models",
        "paper_url": "https://arxiv.org/abs/2601.07372",
        "track": "llm",
        "organization": "DeepSeek",
        "published": "2026-01-12",
        "code_url": "https://github.com/deepseek-ai/Engram",
        "topics": [
          "llm-architecture",
          "conditional-memory",
          "sparsity"
        ],
        "local_code_dir": "src/auto_research/reproductions/engram",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "frames-on-demand",
      "title": "Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding",
      "paper_url": "https://arxiv.org/abs/2609.11899",
      "detail_path": "foundation-models/2609.11899-frames-on-demand/README.md",
      "topic": [
        "长视频理解",
        "视觉预算路由"
      ],
      "first_author": "Weitong Cai",
      "first_author_affiliation": "Queen Mary University of London",
      "published": "2026-09-10",
      "code": null,
      "adapter": "frames-on-demand",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "gas",
      "title": "Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction",
      "paper_url": "https://arxiv.org/abs/2608.12209",
      "detail_path": "reproductions/2608.12209-gas/README.md",
      "topic": [
        "multimodal",
        "generation-guided-training",
        "next-embedding-prediction"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-08-12",
      "code": null,
      "adapter": {
        "adapter_key": "gas",
        "arxiv_id": "2608.12209",
        "title": "Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction",
        "paper_url": "https://arxiv.org/abs/2608.12209",
        "track": "llm",
        "organization": "ByteDance",
        "published": "2026-08-12",
        "code_url": null,
        "topics": [
          "multimodal",
          "generation-guided-training",
          "next-embedding-prediction"
        ],
        "local_code_dir": "src/auto_research/reproductions/gas",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST object QA"
        ],
        "baseline": "understanding-only matched trunk",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta",
          "deployed_parameter_overhead_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "gated-attention",
      "title": "Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free",
      "paper_url": "https://arxiv.org/abs/2505.06708",
      "detail_path": "reproductions/2505.06708-gated-attention/README.md",
      "topic": [
        "llm-architecture",
        "attention-gating",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "Qwen / Alibaba",
      "published": "2025-05-10",
      "code": "https://github.com/qiuzh20/gated_attention",
      "adapter": {
        "adapter_key": "gated-attention",
        "arxiv_id": "2505.06708",
        "title": "Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free",
        "paper_url": "https://arxiv.org/abs/2505.06708",
        "track": "llm",
        "organization": "Qwen / Alibaba",
        "published": "2025-05-10",
        "code_url": "https://github.com/qiuzh20/gated_attention",
        "topics": [
          "llm-architecture",
          "attention-gating",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/gated_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.output_gate_below_0_5",
          "method.output_gate_mean",
          "method.parameters",
          "method.perplexity",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "gaugequant",
      "title": "GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries",
      "paper_url": "https://arxiv.org/abs/2607.20757",
      "detail_path": "reproductions/2607.20757-gaugequant/README.md",
      "topic": [
        "llm-training",
        "quantization",
        "w4a4"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Cambridge",
      "published": "2026-07-22",
      "code": "https://github.com/MPedraBento/gauge-quant",
      "adapter": {
        "adapter_key": "gaugequant",
        "arxiv_id": "2607.20757",
        "title": "GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries",
        "paper_url": "https://arxiv.org/abs/2607.20757",
        "track": "llm",
        "organization": "University of Cambridge",
        "published": "2026-07-22",
        "code_url": "https://github.com/MPedraBento/gauge-quant",
        "topics": [
          "llm-training",
          "quantization",
          "w4a4"
        ],
        "local_code_dir": "src/auto_research/reproductions/gaugequant",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "浮点 llamamodern",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "gliclass",
      "title": "GLiClass: Generalist Lightweight Model for Sequence Classification Tasks",
      "paper_url": "https://arxiv.org/abs/2508.07662",
      "detail_path": "foundation-models/2508.07662-gliclass/README.md",
      "topic": [
        "动态候选分类",
        "System One 相邻方法"
      ],
      "first_author": "Ihor Stepanov",
      "first_author_affiliation": "Knowledgator",
      "published": "2025-08-11",
      "code": "https://github.com/Knowledgator/GLiClass",
      "adapter": "system-one:bilinear-ce",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "gqa",
      "title": "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints",
      "paper_url": "https://arxiv.org/abs/2305.13245",
      "detail_path": "reproductions/2305.13245-gqa/README.md",
      "topic": [
        "attention",
        "kv-cache",
        "serving",
        "architecture"
      ],
      "first_author": null,
      "first_author_affiliation": "Google Research",
      "published": "2023-05-22",
      "code": null,
      "adapter": {
        "adapter_key": "gqa",
        "arxiv_id": "2305.13245",
        "title": "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints",
        "paper_url": "https://arxiv.org/abs/2305.13245",
        "track": "llm",
        "organization": "Google Research",
        "published": "2023-05-22",
        "code_url": null,
        "topics": [
          "attention",
          "kv-cache",
          "serving",
          "architecture"
        ],
        "local_code_dir": "src/auto_research/reproductions/gqa",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 gqa",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.kv_cache_reduction_x",
          "method.architecture_stats.kv_heads",
          "method.architecture_stats.query_heads",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "gzip-sparse-attention",
      "title": "Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection",
      "paper_url": "https://arxiv.org/abs/2607.21752",
      "detail_path": "reproductions/2607.21752-gzip-sparse-attention/README.md",
      "topic": [
        "llm",
        "sparse-attention",
        "long-context",
        "compression"
      ],
      "first_author": null,
      "first_author_affiliation": "Pennsylvania State University",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "gzip-sparse-attention",
        "arxiv_id": "2607.21752",
        "title": "Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection",
        "paper_url": "https://arxiv.org/abs/2607.21752",
        "track": "llm",
        "organization": "Pennsylvania State University",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "llm",
          "sparse-attention",
          "long-context",
          "compression"
        ],
        "local_code_dir": "src/auto_research/reproductions/gzip_sparse_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 raw UTF-8 bytes"
        ],
        "baseline": "相同 132,032 参数、相同初始化、WikiText-2 原始 bytes、256 context 和 120 steps 的 BigBird fixed mask",
        "metrics": [
          "gzip-sparse-attention.reported_objective"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "hilp",
      "title": "Hierarchical Latent Prediction for Language Models",
      "paper_url": "https://arxiv.org/abs/2608.05806",
      "detail_path": "reproductions/2608.05806-hilp/README.md",
      "topic": [
        "pretraining",
        "latent-prediction",
        "multi-token-prediction",
        "speculative-decoding"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Texas at Austin",
      "published": "2026-08-06",
      "code": null,
      "adapter": {
        "adapter_key": "hilp",
        "arxiv_id": "2608.05806",
        "title": "Hierarchical Latent Prediction for Language Models",
        "paper_url": "https://arxiv.org/abs/2608.05806",
        "track": "llm",
        "organization": "University of Texas at Austin",
        "published": "2026-08-06",
        "code_url": null,
        "topics": [
          "pretraining",
          "latent-prediction",
          "multi-token-prediction",
          "speculative-decoding"
        ],
        "local_code_dir": "src/auto_research/reproductions/hilp",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic public-style mini-suite"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "hilp.reported_objective"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "hymba",
      "title": "Hymba: A Hybrid-head Architecture for Small Language Models",
      "paper_url": "https://arxiv.org/abs/2411.13676",
      "detail_path": "reproductions/2411.13676-hymba/README.md",
      "topic": [
        "hybrid-attention-ssm",
        "small-language-model",
        "architecture"
      ],
      "first_author": null,
      "first_author_affiliation": "NVIDIA",
      "published": "2024-11-20",
      "code": "https://github.com/NVlabs/hymba",
      "adapter": {
        "adapter_key": "hymba",
        "arxiv_id": "2411.13676",
        "title": "Hymba: A Hybrid-head Architecture for Small Language Models",
        "paper_url": "https://arxiv.org/abs/2411.13676",
        "track": "llm",
        "organization": "NVIDIA",
        "published": "2024-11-20",
        "code_url": "https://github.com/NVlabs/hymba",
        "topics": [
          "hybrid-attention-ssm",
          "small-language-model",
          "architecture"
        ],
        "local_code_dir": "src/auto_research/reproductions/hymba",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 hymba",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.hybrid_gate_mean",
          "method.architecture_stats.parallel_attention_ssm",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "paper_results.accuracy_vs_llama32_3b_percent",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "kvmem",
      "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
      "paper_url": "https://arxiv.org/abs/2609.04852",
      "detail_path": "reproductions/2609.04852-kvmem/README.md",
      "topic": [
        "agent-memory",
        "kv-cache",
        "long-context",
        "inference-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Shanghai University of Finance and Economics",
      "published": "2026-09-04",
      "code": "https://github.com/kvmem/kvmem-qw3",
      "adapter": {
        "adapter_key": "kvmem",
        "arxiv_id": "2609.04852",
        "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
        "paper_url": "https://arxiv.org/abs/2609.04852",
        "track": "llm",
        "organization": "Shanghai University of Finance and Economics",
        "published": "2026-09-04",
        "code_url": "https://github.com/kvmem/kvmem-qw3",
        "topics": [
          "agent-memory",
          "kv-cache",
          "long-context",
          "inference-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/kvmem",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "public-domain long-context probe"
        ],
        "baseline": "equal-budget recent-context compaction",
        "metrics": [
          "attention-output cosine",
          "materialized blocks",
          "peak GPU memory"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/kvmem-a100-20260907.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": [
          "memory:query-conditioned-paged-kv"
        ]
      }
    },
    {
      "domain": "foundation-models",
      "key": "llava",
      "title": "Visual Instruction Tuning",
      "paper_url": "https://arxiv.org/abs/2304.08485",
      "detail_path": "reproductions/2304.08485-llava/README.md",
      "topic": [
        "multimodal",
        "instruction-tuning"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Wisconsin-Madison / Microsoft Research / Columbia University",
      "published": "2023-04-17",
      "code": "https://github.com/haotian-liu/LLaVA",
      "adapter": {
        "adapter_key": "llava",
        "arxiv_id": "2304.08485",
        "title": "Visual Instruction Tuning",
        "paper_url": "https://arxiv.org/abs/2304.08485",
        "track": "llm",
        "organization": "University of Wisconsin-Madison / Microsoft Research / Columbia University",
        "published": "2023-04-17",
        "code_url": "https://github.com/haotian-liu/LLaVA",
        "topics": [
          "multimodal",
          "instruction-tuning"
        ],
        "local_code_dir": "src/auto_research/reproductions/llava",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST object QA"
        ],
        "baseline": "linear mean-pooled connector",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "lngram-v2",
      "title": "Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations",
      "paper_url": "https://arxiv.org/abs/2609.03426",
      "detail_path": "reproductions/2609.03426-lngram-v2/README.md",
      "topic": [
        "multimodal-foundation-model",
        "conditional-memory",
        "discrete-routing",
        "model-architecture"
      ],
      "first_author": null,
      "first_author_affiliation": "Beijing University of Posts and Telecommunications / Kuaishou Technology",
      "published": "2026-09-03",
      "code": null,
      "adapter": {
        "adapter_key": "lngram-v2",
        "arxiv_id": "2609.03426",
        "title": "Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations",
        "paper_url": "https://arxiv.org/abs/2609.03426",
        "track": "llm",
        "organization": "Beijing University of Posts and Telecommunications / Kuaishou Technology",
        "published": "2026-09-03",
        "code_url": null,
        "topics": [
          "multimodal-foundation-model",
          "conditional-memory",
          "discrete-routing",
          "model-architecture"
        ],
        "local_code_dir": "src/auto_research/reproductions/lngram_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "SmolVLM2-256M-Video-Instruct checkpoint + deterministic RGB geometry probe"
        ],
        "baseline": "same checkpoint without latent memory branch",
        "metrics": [
          "finite output",
          "route diversity",
          "sink selectivity",
          "activation memory"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/lngram-v2-a100-20260906.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": [
          "memory:latent-ngram-gqa"
        ]
      }
    },
    {
      "domain": "foundation-models",
      "key": "looped-latent-attention",
      "title": "Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers",
      "paper_url": "https://arxiv.org/abs/2607.15456",
      "detail_path": "reproductions/2607.15456-looped-latent-attention/README.md",
      "topic": [
        "llm-architecture",
        "kv-cache",
        "looped-transformer"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Maryland / Meta AI",
      "published": "2026-07-16",
      "code": null,
      "adapter": {
        "adapter_key": "looped-latent-attention",
        "arxiv_id": "2607.15456",
        "title": "Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers",
        "paper_url": "https://arxiv.org/abs/2607.15456",
        "track": "llm",
        "organization": "University of Maryland / Meta AI",
        "published": "2026-07-16",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "kv-cache",
          "looped-transformer"
        ],
        "local_code_dir": "src/auto_research/reproductions/looped_latent_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "两层 llamamodern",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "loopspec",
      "title": "LoopSpec: Pipelined Self-Speculative Decoding for Looped Transformers",
      "paper_url": "https://arxiv.org/abs/2609.17184",
      "detail_path": "foundation-models/2609.17184-loopspec/README.md",
      "topic": [
        "推测解码",
        "循环 Transformer"
      ],
      "first_author": "SangLyul Cho",
      "first_author_affiliation": "Seoul National University / KAIST",
      "published": "2026-09-15",
      "code": null,
      "adapter": "loopspec",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "macro",
      "title": "MACRO: Markov Chain Routing of Transformer Layers",
      "paper_url": "https://arxiv.org/abs/2608.05872",
      "detail_path": "reproductions/2608.05872-macro/README.md",
      "topic": [
        "network-architecture",
        "dynamic-routing",
        "inference-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Heinrich Heine University Düsseldorf",
      "published": "2026-08-06",
      "code": "https://github.com/Batorskq/MACRO",
      "adapter": {
        "adapter_key": "macro",
        "arxiv_id": "2608.05872",
        "title": "MACRO: Markov Chain Routing of Transformer Layers",
        "paper_url": "https://arxiv.org/abs/2608.05872",
        "track": "llm",
        "organization": "Heinrich Heine University Düsseldorf",
        "published": "2026-08-06",
        "code_url": "https://github.com/Batorskq/MACRO",
        "topics": [
          "network-architecture",
          "dynamic-routing",
          "inference-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/macro",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic public-style mini-suite"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "macro_accuracy",
          "paper_results.average_accuracy_percent",
          "sequential_accuracy"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "mamba",
      "title": "Mamba: Linear-Time Sequence Modeling with Selective State Spaces",
      "paper_url": "https://arxiv.org/abs/2312.00752",
      "detail_path": "reproductions/2312.00752-mamba/README.md",
      "topic": [
        "llm-architecture",
        "state-space-model",
        "classic"
      ],
      "first_author": null,
      "first_author_affiliation": "Carnegie Mellon University / Princeton University",
      "published": "2023-12-01",
      "code": "https://github.com/state-spaces/mamba",
      "adapter": {
        "adapter_key": "mamba",
        "arxiv_id": "2312.00752",
        "title": "Mamba: Linear-Time Sequence Modeling with Selective State Spaces",
        "paper_url": "https://arxiv.org/abs/2312.00752",
        "track": "llm",
        "organization": "Carnegie Mellon University / Princeton University",
        "published": "2023-12-01",
        "code_url": "https://github.com/state-spaces/mamba",
        "topics": [
          "llm-architecture",
          "state-space-model",
          "classic"
        ],
        "local_code_dir": "src/auto_research/reproductions/mamba",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "tiny Transformer",
        "metrics": [
          "baseline.perplexity",
          "method.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "medusa",
      "title": "Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads",
      "paper_url": "https://arxiv.org/abs/2401.10774",
      "detail_path": "reproductions/2401.10774-medusa/README.md",
      "topic": [
        "inference-serving",
        "decoding"
      ],
      "first_author": null,
      "first_author_affiliation": "Together AI / Princeton University / University of Illinois Urbana-Champaign",
      "published": "2024-01-19",
      "code": "https://github.com/FasterDecoding/Medusa",
      "adapter": {
        "adapter_key": "medusa",
        "arxiv_id": "2401.10774",
        "title": "Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads",
        "paper_url": "https://arxiv.org/abs/2401.10774",
        "track": "llm",
        "organization": "Together AI / Princeton University / University of Illinois Urbana-Champaign",
        "published": "2024-01-19",
        "code_url": "https://github.com/FasterDecoding/Medusa",
        "topics": [
          "inference-serving",
          "decoding"
        ],
        "local_code_dir": "src/auto_research/reproductions/medusa",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "single-head greedy，实验组为 three future heads + tree verification，只改变论文核心机制",
        "metrics": [
          "baseline.backbone_calls",
          "method.backbone_calls",
          "relative.backbone_call_reduction_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "memory-grafting",
      "title": "Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory",
      "paper_url": "https://arxiv.org/abs/2605.20948",
      "detail_path": "reproductions/2605.20948-memory-grafting/README.md",
      "topic": [
        "llm-pretraining",
        "conditional-memory",
        "offline-knowledge-transfer"
      ],
      "first_author": null,
      "first_author_affiliation": "Tsinghua University / Microsoft Research Asia",
      "published": "2026-05-20",
      "code": null,
      "adapter": {
        "adapter_key": "memory-grafting",
        "arxiv_id": "2605.20948",
        "title": "Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory",
        "paper_url": "https://arxiv.org/abs/2605.20948",
        "track": "llm",
        "organization": "Tsinghua University / Microsoft Research Asia",
        "published": "2026-05-20",
        "code_url": null,
        "topics": [
          "llm-pretraining",
          "conditional-memory",
          "offline-knowledge-transfer"
        ],
        "local_code_dir": "src/auto_research/reproductions/memory_grafting",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同结构普通 Transformer",
        "metrics": [
          "paper_benchmark_average.Memory Grafting",
          "relative.ppl_reduction_vs_engram_percent",
          "relative.ppl_reduction_vs_transformer_percent",
          "setup.memory_capacity",
          "variants.Engram.loss",
          "variants.Engram.perplexity",
          "variants.Memory Grafting.exact_hit_rate",
          "variants.Memory Grafting.loss",
          "variants.Memory Grafting.perplexity",
          "variants.Memory Grafting.trainable_parameters",
          "variants.Transformer.loss",
          "variants.Transformer.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=45",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "mhc",
      "title": "mHC: Manifold-Constrained Hyper-Connections",
      "paper_url": "https://arxiv.org/abs/2512.24880",
      "detail_path": "reproductions/2512.24880-mhc/README.md",
      "topic": [
        "llm-architecture",
        "hyper-connections",
        "training-stability"
      ],
      "first_author": null,
      "first_author_affiliation": "DeepSeek-AI",
      "published": "2025-12-31",
      "code": null,
      "adapter": {
        "adapter_key": "mhc",
        "arxiv_id": "2512.24880",
        "title": "mHC: Manifold-Constrained Hyper-Connections",
        "paper_url": "https://arxiv.org/abs/2512.24880",
        "track": "llm",
        "organization": "DeepSeek-AI",
        "published": "2025-12-31",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "hyper-connections",
          "training-stability"
        ],
        "local_code_dir": "src/auto_research/reproductions/mhc",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同 token、优化器和主干宽度的普通 Transformer",
        "metrics": [
          "relative.ppl_reduction_vs_hc_percent",
          "relative.ppl_reduction_vs_transformer_percent",
          "variants.HC.loss",
          "variants.HC.perplexity",
          "variants.HC.spectral_norm_max",
          "variants.Transformer.loss",
          "variants.Transformer.perplexity",
          "variants.mHC.loss",
          "variants.mHC.perplexity",
          "variants.mHC.spectral_norm_max"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=45",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "minimax-sparse-attention",
      "title": "MiniMax Sparse Attention",
      "paper_url": "https://arxiv.org/abs/2606.13392",
      "detail_path": "reproductions/2606.13392-minimax-sparse-attention/README.md",
      "topic": [
        "llm",
        "sparse-attention",
        "gqa",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "MiniMax",
      "published": "2026-06-11",
      "code": "https://github.com/MiniMax-AI/MSA",
      "adapter": {
        "adapter_key": "minimax-sparse-attention",
        "arxiv_id": "2606.13392",
        "title": "MiniMax Sparse Attention",
        "paper_url": "https://arxiv.org/abs/2606.13392",
        "track": "llm",
        "organization": "MiniMax",
        "published": "2026-06-11",
        "code_url": "https://github.com/MiniMax-AI/MSA",
        "topics": [
          "llm",
          "sparse-attention",
          "gqa",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/minimax_sparse_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "dense GQA，实验组为带 index 辅助损失的 MiniMax block-sparse GQA",
        "metrics": [
          "baseline.attention_pair_ratio",
          "baseline.perplexity",
          "baseline.seconds",
          "baseline.validation_loss",
          "method.attention_pair_ratio",
          "method.perplexity",
          "method.seconds",
          "method.validation_loss",
          "relative.attention_pairs_percent",
          "relative.measured_training_seconds_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=36",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "mllmclip",
      "title": "MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations",
      "paper_url": "https://arxiv.org/abs/2608.25575",
      "detail_path": "reproductions/2608.25575-mllmclip/README.md",
      "topic": [
        "multimodal-foundation-model",
        "feature-distillation",
        "compositionality",
        "cka"
      ],
      "first_author": null,
      "first_author_affiliation": "KAIST / Sony AI",
      "published": "2026-08-26",
      "code": null,
      "adapter": {
        "adapter_key": "mllmclip",
        "arxiv_id": "2608.25575",
        "title": "MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations",
        "paper_url": "https://arxiv.org/abs/2608.25575",
        "track": "llm",
        "organization": "KAIST / Sony AI",
        "published": "2026-08-26",
        "code_url": null,
        "topics": [
          "multimodal-foundation-model",
          "feature-distillation",
          "compositionality",
          "cka"
        ],
        "local_code_dir": "src/auto_research/reproductions/mllmclip",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "POPE adversarial / COCO val2014 checkpoint subset",
          "MovieLens-1M diagnostic proxy"
        ],
        "baseline": "frozen CLIP features with a validation-selected ridge projection",
        "metrics": [
          "linear CKA",
          "neighbor overlap@5",
          "training loss",
          "peak GPU memory"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=40",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/mllmclip-a100-20260828.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "moba",
      "title": "MoBA: Mixture of Block Attention for Long-Context LLMs",
      "paper_url": "https://arxiv.org/abs/2502.13189",
      "detail_path": "reproductions/2502.13189-moba/README.md",
      "topic": [
        "sparse-attention",
        "long-context",
        "block-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "Moonshot AI",
      "published": "2025-02-18",
      "code": "https://github.com/MoonshotAI/MoBA",
      "adapter": {
        "adapter_key": "moba",
        "arxiv_id": "2502.13189",
        "title": "MoBA: Mixture of Block Attention for Long-Context LLMs",
        "paper_url": "https://arxiv.org/abs/2502.13189",
        "track": "llm",
        "organization": "Moonshot AI",
        "published": "2025-02-18",
        "code_url": "https://github.com/MoonshotAI/MoBA",
        "topics": [
          "sparse-attention",
          "long-context",
          "block-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/moba",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 moba",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.block_size",
          "method.architecture_stats.selected_block_fraction",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "mobius-rope",
      "title": "Anti-Periodic Positional Encoding: Möbius Boundary Conditions Make In-Context Retrieval Reliable",
      "paper_url": "https://arxiv.org/abs/2607.21405",
      "detail_path": "reproductions/2607.21405-mobius-rope/README.md",
      "topic": [
        "llm-architecture",
        "positional-encoding",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "Independent researcher",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "mobius-rope",
        "arxiv_id": "2607.21405",
        "title": "Anti-Periodic Positional Encoding: Möbius Boundary Conditions Make In-Context Retrieval Reliable",
        "paper_url": "https://arxiv.org/abs/2607.21405",
        "track": "llm",
        "organization": "Independent researcher",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "positional-encoding",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/mobius_rope",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 + synthetic single-needle retrieval"
        ],
        "baseline": "standard RoPE",
        "metrics": [
          "hybrid_mobius_rope.far_needle_accuracy",
          "hybrid_mobius_rope.needle_accuracy",
          "hybrid_mobius_rope.perplexity",
          "relative.far_needle_accuracy_points",
          "relative.needle_accuracy_points",
          "relative.perplexity_reduction_percent",
          "standard_rope.far_needle_accuracy",
          "standard_rope.needle_accuracy",
          "standard_rope.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=90",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "muon",
      "title": "Muon is Scalable for LLM Training",
      "paper_url": "https://arxiv.org/abs/2502.16982",
      "detail_path": "reproductions/2502.16982-muon/README.md",
      "topic": [
        "llm-training",
        "optimizer",
        "training-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Moonshot AI / UCLA",
      "published": "2025-02-24",
      "code": "https://github.com/MoonshotAI/Moonlight",
      "adapter": {
        "adapter_key": "muon",
        "arxiv_id": "2502.16982",
        "title": "Muon is Scalable for LLM Training",
        "paper_url": "https://arxiv.org/abs/2502.16982",
        "track": "llm",
        "organization": "Moonshot AI / UCLA",
        "published": "2025-02-24",
        "code_url": "https://github.com/MoonshotAI/Moonlight",
        "topics": [
          "llm-training",
          "optimizer",
          "training-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/muon",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "matched control without the muon mechanism",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "musec",
      "title": "Musec: MomentUm SpEctral Clipping for Stable Muon-type Training",
      "paper_url": "https://arxiv.org/abs/2609.11655",
      "detail_path": "foundation-models/2609.11655-musec/README.md",
      "topic": [
        "优化器",
        "谱裁剪"
      ],
      "first_author": "Zhuanghua Liu",
      "first_author_affiliation": "National University of Singapore",
      "published": "2026-09-10",
      "code": null,
      "adapter": "musec",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "naju",
      "title": "Naju: A Native Discrete State-Space Model with Independent Retention and Writing for Long-Sequence Memory",
      "paper_url": "https://arxiv.org/abs/2607.21000",
      "detail_path": "reproductions/2607.21000-naju/README.md",
      "topic": [
        "llm-architecture",
        "state-space-model",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "Independent researchers",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "naju",
        "arxiv_id": "2607.21000",
        "title": "Naju: A Native Discrete State-Space Model with Independent Retention and Writing for Long-Sequence Memory",
        "paper_url": "https://arxiv.org/abs/2607.21000",
        "track": "llm",
        "organization": "Independent researchers",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "state-space-model",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/naju",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同 token、optimizer、70 steps 的 96-d、3-layer Transformer",
        "metrics": [
          "naju.loss",
          "naju.perplexity",
          "relative.perplexity_reduction_percent",
          "transformer.loss",
          "transformer.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=70",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "native-sparse-attention",
      "title": "Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention",
      "paper_url": "https://arxiv.org/abs/2502.11089",
      "detail_path": "reproductions/2502.11089-native-sparse-attention/README.md",
      "topic": [
        "llm-architecture",
        "sparse-attention",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "DeepSeek",
      "published": "2025-02-16",
      "code": null,
      "adapter": {
        "adapter_key": "native-sparse-attention",
        "arxiv_id": "2502.11089",
        "title": "Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention",
        "paper_url": "https://arxiv.org/abs/2502.11089",
        "track": "llm",
        "organization": "DeepSeek",
        "published": "2025-02-16",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "sparse-attention",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/native_sparse_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同维度、层数、token、AdamW 和 30-step 预算的 llamamodern",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.attention_edge_fraction",
          "method.compression_block",
          "method.lm_loss",
          "method.local_window",
          "method.parameters",
          "method.perplexity",
          "method.selected_blocks",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "oda",
      "title": "On-Demand Attention: Efficient Long-Context Decoding with Learned Recall",
      "paper_url": "https://arxiv.org/abs/2609.20734",
      "detail_path": "foundation-models/2609.20734-oda/README.md",
      "topic": [
        "注意力与长上下文",
        "推理效率"
      ],
      "first_author": "Paper author team",
      "first_author_affiliation": "Southern University of Science and Technology",
      "published": "2026-09-17",
      "code": null,
      "adapter": "oda",
      "priority": "P0",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/oda-a100-20260919.json"
    },
    {
      "domain": "foundation-models",
      "key": "olmpool-long-context",
      "title": "Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension",
      "paper_url": "https://arxiv.org/abs/2608.10296",
      "detail_path": "reproductions/2608.10296-olmpool-long-context/README.md",
      "topic": [
        "注意力与长上下文",
        "网络架构"
      ],
      "first_author": null,
      "first_author_affiliation": "Ai2",
      "published": "2026-08-10",
      "code": "https://github.com/allenai/olmpool/",
      "adapter": {
        "adapter_key": "olmpool-long-context",
        "arxiv_id": "2608.10296",
        "title": "Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension",
        "paper_url": "https://arxiv.org/abs/2608.10296",
        "track": "llm",
        "organization": "Ai2",
        "published": "2026-08-10",
        "code_url": "https://github.com/allenai/olmpool/",
        "topics": [
          "注意力与长上下文",
          "网络架构"
        ],
        "local_code_dir": "src/auto_research/reproductions/olmpool_long_context",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "omnikvquant",
      "title": "OmniKVQuant: KV Cache Quantization for Omni-LLMs",
      "paper_url": "https://arxiv.org/abs/2609.11582",
      "detail_path": "foundation-models/2609.11582-omnikvquant/README.md",
      "topic": [
        "多模态推理",
        "KV Cache 量化"
      ],
      "first_author": "Suho Yoo",
      "first_author_affiliation": "KAIST",
      "published": "2026-09-10",
      "code": "https://github.com/kaistmm/OmniKVQuant",
      "adapter": "omnikvquant",
      "priority": "P0"
    },
    {
      "domain": "foundation-models",
      "key": "open-1b-audit",
      "title": "OPEN-1B: A Fully Auditable Training Run",
      "paper_url": "https://arxiv.org/abs/2609.17380",
      "detail_path": "foundation-models/2609.17380-open-1b-audit/README.md",
      "topic": [
        "可复现训练",
        "训练审计"
      ],
      "first_author": "John Donaghy",
      "first_author_affiliation": "Gensyn",
      "published": "2026-09-15",
      "code": "https://github.com/gensyn-ai/open-transformers",
      "code_extra": "https://github.com/gensyn-ai/pretraining-audit-cli",
      "adapter": "open-1b-audit",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "open-language-model",
      "title": "OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research",
      "paper_url": "https://arxiv.org/abs/2607.16669",
      "detail_path": "reproductions/2607.16669-open-language-model/README.md",
      "topic": [
        "pretraining-infrastructure",
        "composable-architecture",
        "small-language-model",
        "evolve"
      ],
      "first_author": null,
      "first_author_affiliation": "Indian Institute of Technology Madras",
      "published": "2026-07-18",
      "code": "https://github.com/openlanguagemodel/openlanguagemodel",
      "adapter": {
        "adapter_key": "open-language-model",
        "arxiv_id": "2607.16669",
        "title": "OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research",
        "paper_url": "https://arxiv.org/abs/2607.16669",
        "track": "llm",
        "organization": "Indian Institute of Technology Madras",
        "published": "2026-07-18",
        "code_url": "https://github.com/openlanguagemodel/openlanguagemodel",
        "topics": [
          "pretraining-infrastructure",
          "composable-architecture",
          "small-language-model",
          "evolve"
        ],
        "local_code_dir": "src/auto_research/reproductions/open_language_model",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 LLaMA-modern，实验组为 olmcomposable",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.ordinary_pytorch_modules",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "pace-vlm",
      "title": "PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference",
      "paper_url": "https://arxiv.org/abs/2608.27206",
      "detail_path": "reproductions/2608.27206-pace-vlm/README.md",
      "topic": [
        "multimodal-foundation-model",
        "visual-token-compression",
        "inference-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Sun Yat-sen University",
      "published": "2026-08-27",
      "code": "https://github.com/jjL357/PACE",
      "adapter": {
        "adapter_key": "pace-vlm",
        "arxiv_id": "2608.27206",
        "title": "PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference",
        "paper_url": "https://arxiv.org/abs/2608.27206",
        "track": "llm",
        "organization": "Sun Yat-sen University",
        "published": "2026-08-27",
        "code_url": "https://github.com/jjL357/PACE",
        "topics": [
          "multimodal-foundation-model",
          "visual-token-compression",
          "inference-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/pace_vlm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "RealWorldQA checkpoint subset"
        ],
        "baseline": "Qwen2.5-VL at the original visual-token budget",
        "metrics": [
          "answer accuracy",
          "visual tokens",
          "latency",
          "peak GPU memory"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/pace-vlm-a30-20260829.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "penelope",
      "title": "Penelope: Localized Latent Recurrence for Efficient Structured Reasoning",
      "paper_url": "https://arxiv.org/abs/2607.25915",
      "detail_path": "reproductions/2607.25915-penelope/README.md",
      "topic": [
        "llm-architecture",
        "latent-reasoning",
        "recurrence",
        "efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Academic author team",
      "published": "2026-07-28",
      "code": null,
      "adapter": {
        "adapter_key": "penelope",
        "arxiv_id": "2607.25915",
        "title": "Penelope: Localized Latent Recurrence for Efficient Structured Reasoning",
        "paper_url": "https://arxiv.org/abs/2607.25915",
        "track": "llm",
        "organization": "Academic author team",
        "published": "2026-07-28",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "latent-reasoning",
          "recurrence",
          "efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/penelope",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "llamamodern，实验组为 penelope",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.full_decoder_reexecution",
          "method.architecture_stats.latent_recurrence_steps",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "persistent-recurrent-memory",
      "title": "Persistent Recurrent Memory Between Transformer Layers Improves Language Model Generalization",
      "paper_url": "https://arxiv.org/abs/2609.17251",
      "detail_path": "foundation-models/2609.17251-persistent-recurrent-memory/README.md",
      "topic": [
        "网络架构",
        "持久记忆"
      ],
      "first_author": "Eduardo Novaes Hering",
      "first_author_affiliation": "FITec Labs / Ericsson São Paulo",
      "published": "2026-09-15",
      "code": null,
      "adapter": "persistent-recurrent-memory",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "physics-mm-pretraining",
      "title": "Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes",
      "paper_url": "https://arxiv.org/abs/2608.05000",
      "detail_path": "reproductions/2608.05000-physics-mm-pretraining/README.md",
      "topic": [
        "多模态基础模型",
        "预训练与数据"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-08-05",
      "code": null,
      "adapter": {
        "adapter_key": "physics-mm-pretraining",
        "arxiv_id": "2608.05000",
        "title": "Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes",
        "paper_url": "https://arxiv.org/abs/2608.05000",
        "track": "llm",
        "organization": "Meta",
        "published": "2026-08-05",
        "code_url": null,
        "topics": [
          "多模态基础模型",
          "预训练与数据"
        ],
        "local_code_dir": "src/auto_research/reproductions/physics_mm_pretraining",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "ppl-factory",
      "title": "PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning",
      "paper_url": "https://arxiv.org/abs/2607.18199",
      "detail_path": "reproductions/2607.18199-ppl-factory/README.md",
      "topic": [
        "llm-training",
        "data-selection",
        "efficient-finetuning"
      ],
      "first_author": null,
      "first_author_affiliation": "McGill University",
      "published": "2026-07-20",
      "code": null,
      "adapter": {
        "adapter_key": "ppl-factory",
        "arxiv_id": "2607.18199",
        "title": "PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning",
        "paper_url": "https://arxiv.org/abs/2607.18199",
        "track": "llm",
        "organization": "McGill University",
        "published": "2026-07-20",
        "code_url": null,
        "topics": [
          "llm-training",
          "data-selection",
          "efficient-finetuning"
        ],
        "local_code_dir": "src/auto_research/reproductions/ppl_factory",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "20% 随机 block",
        "metrics": [
          "perplexity_reduction_vs_random_percent",
          "variants.Easy-NLL.perplexity",
          "variants.Easy-NLL.test_loss",
          "variants.PPL-Factory.perplexity",
          "variants.PPL-Factory.test_loss",
          "variants.Random.perplexity",
          "variants.Random.test_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "qevict",
      "title": "QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding",
      "paper_url": "https://arxiv.org/abs/2608.05326",
      "detail_path": "reproductions/2608.05326-qevict/README.md",
      "topic": [
        "long-context",
        "kv-cache",
        "quantization",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Indian Institute of Technology Roorkee",
      "published": "2026-08-05",
      "code": null,
      "adapter": {
        "adapter_key": "qevict",
        "arxiv_id": "2608.05326",
        "title": "QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding",
        "paper_url": "https://arxiv.org/abs/2608.05326",
        "track": "llm",
        "organization": "Indian Institute of Technology Roorkee",
        "published": "2026-08-05",
        "code_url": null,
        "topics": [
          "long-context",
          "kv-cache",
          "quantization",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/qevict",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic public-style mini-suite"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "binary_evict_recall",
          "full_precision_slots",
          "qevict_recall"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "r4t",
      "title": "Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion",
      "paper_url": "https://arxiv.org/abs/2603.06397",
      "detail_path": "foundation-models/2603.06397-r4t/README.md",
      "topic": [
        "生成式检索",
        "RL 编译"
      ],
      "first_author": "Pengcheng Jiang",
      "first_author_affiliation": "University of Illinois Urbana-Champaign / Google Research",
      "published": "2026-03-06",
      "code": null,
      "adapter": "r4t",
      "priority": "P0"
    },
    {
      "domain": "foundation-models",
      "key": "random-attention",
      "title": "Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning",
      "paper_url": "https://arxiv.org/abs/2609.03430",
      "detail_path": "reproductions/2609.03430-random-attention/README.md",
      "topic": [
        "kv-cache",
        "reasoning",
        "inference-serving",
        "compression"
      ],
      "first_author": null,
      "first_author_affiliation": "Salesforce AI Research / University of Illinois Urbana-Champaign",
      "published": "2026-09-03",
      "code": "https://github.com/SalesforceAIResearch/Random-Attention",
      "adapter": {
        "adapter_key": "random-attention",
        "arxiv_id": "2609.03430",
        "title": "Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning",
        "paper_url": "https://arxiv.org/abs/2609.03430",
        "track": "llm",
        "organization": "Salesforce AI Research / University of Illinois Urbana-Champaign",
        "published": "2026-09-03",
        "code_url": "https://github.com/SalesforceAIResearch/Random-Attention",
        "topics": [
          "kv-cache",
          "reasoning",
          "inference-serving",
          "compression"
        ],
        "local_code_dir": "src/auto_research/reproductions/random_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 real-checkpoint subset"
        ],
        "baseline": "prompt-protected recent-token eviction at equal budget",
        "metrics": [
          "attention-output cosine",
          "selection latency",
          "KV bytes",
          "peak GPU memory"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/random-attention-a100-20260906.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": [
          "attention:prompt-protected-random-eviction"
        ]
      }
    },
    {
      "domain": "foundation-models",
      "key": "rare",
      "title": "RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models",
      "paper_url": "https://arxiv.org/abs/2608.21236",
      "detail_path": "reproductions/2608.21236-rare/README.md",
      "topic": [
        "llm-architecture",
        "mixture-of-experts",
        "representation-steering",
        "model-editing"
      ],
      "first_author": null,
      "first_author_affiliation": "Huazhong University of Science and Technology",
      "published": "2026-08-21",
      "code": null,
      "adapter": {
        "adapter_key": "rare",
        "arxiv_id": "2608.21236",
        "title": "RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models",
        "paper_url": "https://arxiv.org/abs/2608.21236",
        "track": "llm",
        "organization": "Huazhong University of Science and Technology",
        "published": "2026-08-21",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "mixture-of-experts",
          "representation-steering",
          "model-editing"
        ],
        "local_code_dir": "src/auto_research/reproductions/rare",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l1_mechanism",
        "datasets": [
          "deterministic MoE routing mini-suite"
        ],
        "baseline": "unprojected representation steering",
        "metrics": [
          "route agreement",
          "route flip rate",
          "steering gain"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "rd-attnres",
      "title": "Role-Decoupled Attention Residuals",
      "paper_url": "https://arxiv.org/abs/2608.01075",
      "detail_path": "reproductions/2608.01075-rd-attnres/README.md",
      "topic": [
        "foundation-model",
        "attention",
        "residual-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "Kehan Wang（论文未列机构）",
      "published": "2026-08-03",
      "code": null,
      "adapter": {
        "adapter_key": "rd-attnres",
        "arxiv_id": "2608.01075",
        "title": "Role-Decoupled Attention Residuals",
        "paper_url": "https://arxiv.org/abs/2608.01075",
        "track": "llm",
        "organization": "Kehan Wang（论文未列机构）",
        "published": "2026-08-03",
        "code_url": null,
        "topics": [
          "foundation-model",
          "attention",
          "residual-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/rd_attnres",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "共享深度路由的 Block AttnRes，实验组仅解耦 QK/V route",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "method.qk_v_route_js_divergence",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "register-tokens-dllm",
      "title": "Register Tokens for Bounded-State Reasoning in Diffusion Language Models",
      "paper_url": "https://arxiv.org/abs/2609.16372",
      "detail_path": "foundation-models/2609.16372-register-tokens-dllm/README.md",
      "topic": [
        "扩散语言模型",
        "长程推理"
      ],
      "first_author": "Albert Ge",
      "first_author_affiliation": "University of Wisconsin–Madison",
      "published": "2026-09-14",
      "code": null,
      "adapter": "register-tokens-dllm",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "repeat-aware-moe",
      "title": "Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data",
      "paper_url": "https://arxiv.org/abs/2609.11917",
      "detail_path": "foundation-models/2609.11917-repeat-aware-moe/README.md",
      "topic": [
        "MoE",
        "数据重复与正则化"
      ],
      "first_author": "Atindra Jha",
      "first_author_affiliation": "Stanford University",
      "published": "2026-09-10",
      "code": null,
      "adapter": "repeat-aware-moe",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "retoken",
      "title": "ReToken: One Token to Improve Vision–Language Models for Visual Retrieval",
      "paper_url": "https://arxiv.org/abs/2607.28627",
      "detail_path": "reproductions/2607.28627-retoken/README.md",
      "topic": [
        "vision-language-model",
        "visual-retrieval",
        "kv-cache",
        "sparse-attention"
      ],
      "first_author": null,
      "first_author_affiliation": "UIUC / Microsoft Research / Google DeepMind",
      "published": "2026-07-30",
      "code": "https://github.com/avaxiao/ReToken",
      "adapter": {
        "adapter_key": "retoken",
        "arxiv_id": "2607.28627",
        "title": "ReToken: One Token to Improve Vision–Language Models for Visual Retrieval",
        "paper_url": "https://arxiv.org/abs/2607.28627",
        "track": "llm",
        "organization": "UIUC / Microsoft Research / Google DeepMind",
        "published": "2026-07-30",
        "code_url": "https://github.com/avaxiao/ReToken",
        "topics": [
          "vision-language-model",
          "visual-retrieval",
          "kv-cache",
          "sparse-attention"
        ],
        "local_code_dir": "src/auto_research/reproductions/retoken",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 dense LLaMA，实验组为 ReToken value-cache Top-K",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.causal_cache_keep_rate",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "method.retrieval_target_tokens",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "rope",
      "title": "RoFormer: Enhanced Transformer with Rotary Position Embedding",
      "paper_url": "https://arxiv.org/abs/2104.09864",
      "detail_path": "reproductions/2104.09864-rope/README.md",
      "topic": [
        "position-encoding",
        "long-context",
        "architecture"
      ],
      "first_author": null,
      "first_author_affiliation": "Zhuiyi Technology",
      "published": "2021-04-20",
      "code": "https://github.com/ZhuiyiTechnology/roformer",
      "adapter": {
        "adapter_key": "rope",
        "arxiv_id": "2104.09864",
        "title": "RoFormer: Enhanced Transformer with Rotary Position Embedding",
        "paper_url": "https://arxiv.org/abs/2104.09864",
        "track": "llm",
        "organization": "Zhuiyi Technology",
        "published": "2021-04-20",
        "code_url": "https://github.com/ZhuiyiTechnology/roformer",
        "topics": [
          "position-encoding",
          "long-context",
          "architecture"
        ],
        "local_code_dir": "src/auto_research/reproductions/rope",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 llamamodern，实验组为 rope",
        "metrics": [
          "baseline.composite_loss",
          "baseline.final_loss",
          "baseline.fitness",
          "baseline.initial_loss",
          "baseline.instruction_loss",
          "baseline.lm_loss",
          "baseline.muon_orthogonality_error",
          "baseline.parameters",
          "baseline.perplexity",
          "baseline.post_training_loss",
          "baseline.primary",
          "baseline.public_composite",
          "baseline.reward_bearing_group_rate",
          "method.architecture_stats.relative_phase",
          "method.composite_loss",
          "method.final_loss",
          "method.fitness",
          "method.initial_loss",
          "method.instruction_loss",
          "method.lm_loss",
          "method.muon_orthogonality_error",
          "method.parameters",
          "method.perplexity",
          "method.post_training_loss",
          "method.primary",
          "method.public_composite",
          "method.reward_bearing_group_rate",
          "relative.lm_loss_percent",
          "relative.perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=12",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "sas-attention",
      "title": "SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking",
      "paper_url": "https://arxiv.org/abs/2609.13141",
      "detail_path": "reproductions/2609.13141-sas-attention/README.md",
      "topic": [
        "sparse-attention",
        "long-context",
        "post-training",
        "context-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent HY LLM Frontier / HKUST (Guangzhou) / HKUST",
      "published": "2026-09-11",
      "code": "https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification",
      "adapter": {
        "adapter_key": "sas-attention",
        "arxiv_id": "2609.13141",
        "title": "SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking",
        "paper_url": "https://arxiv.org/abs/2609.13141",
        "track": "llm",
        "organization": "Tencent HY LLM Frontier / HKUST (Guangzhou) / HKUST",
        "published": "2026-09-11",
        "code_url": "https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification",
        "topics": [
          "sparse-attention",
          "long-context",
          "post-training",
          "context-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/sas_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "same trained tiny decoder with full causal attention",
        "metrics": [
          "test.sas.perplexity",
          "test.dense.perplexity",
          "routing.retained_attention_fraction",
          "selector_training.selector_gradient_norm_mean"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "sensenova-u1-5",
      "title": "SenseNova-U1.5: Towards Native Unified Visual Intelligence",
      "paper_url": "https://arxiv.org/abs/2609.11929",
      "detail_path": "foundation-models/2609.11929-sensenova-u1-5/README.md",
      "topic": [
        "统一多模态",
        "视觉生成与理解"
      ],
      "first_author": "SenseNova Team",
      "first_author_affiliation": "SenseTime Research",
      "published": "2026-09-10",
      "code": "https://github.com/OpenSenseNova/SenseNova-U1",
      "adapter": "sensenova-u1-5",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "siglip2",
      "title": "SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features",
      "paper_url": "https://arxiv.org/abs/2502.14786",
      "detail_path": "reproductions/2502.14786-siglip2/README.md",
      "topic": [
        "multimodal",
        "sigmoid-contrastive",
        "self-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Google DeepMind",
      "published": "2025-02-20",
      "code": "https://github.com/google-research/big_vision",
      "adapter": {
        "adapter_key": "siglip2",
        "arxiv_id": "2502.14786",
        "title": "SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features",
        "paper_url": "https://arxiv.org/abs/2502.14786",
        "track": "llm",
        "organization": "Google DeepMind",
        "published": "2025-02-20",
        "code_url": "https://github.com/google-research/big_vision",
        "topics": [
          "multimodal",
          "sigmoid-contrastive",
          "self-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/siglip2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST image-text pairs"
        ],
        "baseline": "uniform label retrieval",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=150",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "smolvlm",
      "title": "SmolVLM: Redefining small and efficient multimodal models",
      "paper_url": "https://arxiv.org/abs/2504.05299",
      "detail_path": "reproductions/2504.05299-smolvlm/README.md",
      "topic": [
        "multimodal",
        "efficient-vlm",
        "visual-token-compression"
      ],
      "first_author": null,
      "first_author_affiliation": "Hugging Face",
      "published": "2025-04-07",
      "code": "https://github.com/huggingface/smollm",
      "adapter": {
        "adapter_key": "smolvlm",
        "arxiv_id": "2504.05299",
        "title": "SmolVLM: Redefining small and efficient multimodal models",
        "paper_url": "https://arxiv.org/abs/2504.05299",
        "track": "llm",
        "organization": "Hugging Face",
        "published": "2025-04-07",
        "code_url": "https://github.com/huggingface/smollm",
        "topics": [
          "multimodal",
          "efficient-vlm",
          "visual-token-compression"
        ],
        "local_code_dir": "src/auto_research/reproductions/smolvlm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Fashion-MNIST object QA"
        ],
        "baseline": "linear mean-pooled connector",
        "metrics": [
          "test_accuracy",
          "visual_dependency_delta",
          "visual_tokens"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "speculative-decoding",
      "title": "Fast Inference from Transformers via Speculative Decoding",
      "paper_url": "https://arxiv.org/abs/2211.17192",
      "detail_path": "reproductions/2211.17192-speculative-decoding/README.md",
      "topic": [
        "inference-serving",
        "decoding"
      ],
      "first_author": null,
      "first_author_affiliation": "Google Research",
      "published": "2022-11-30",
      "code": "https://github.com/google-research/google-research/tree/master/speculative_decoding",
      "adapter": {
        "adapter_key": "speculative-decoding",
        "arxiv_id": "2211.17192",
        "title": "Fast Inference from Transformers via Speculative Decoding",
        "paper_url": "https://arxiv.org/abs/2211.17192",
        "track": "llm",
        "organization": "Google Research",
        "published": "2022-11-30",
        "code_url": "https://github.com/google-research/google-research/tree/master/speculative_decoding",
        "topics": [
          "inference-serving",
          "decoding"
        ],
        "local_code_dir": "src/auto_research/reproductions/speculative_decoding",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "target-only greedy decoding，实验组为 four-token draft and exact target verification，只改变论文核心机制",
        "metrics": [
          "baseline.target_calls",
          "method.target_calls",
          "relative.target_call_reduction_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "switch-attention",
      "title": "Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers",
      "paper_url": "https://arxiv.org/abs/2603.26380",
      "detail_path": "reproductions/2603.26380-switch-attention/README.md",
      "topic": [
        "llm-architecture",
        "efficient-attention",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "Peking University / Huawei Technologies",
      "published": "2026-03-27",
      "code": null,
      "adapter": {
        "adapter_key": "switch-attention",
        "arxiv_id": "2603.26380",
        "title": "Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers",
        "paper_url": "https://arxiv.org/abs/2603.26380",
        "track": "llm",
        "organization": "Peking University / Huawei Technologies",
        "published": "2026-03-27",
        "code_url": null,
        "topics": [
          "llm-architecture",
          "efficient-attention",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/switch_attention",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "full-attention tiny Transformer",
        "metrics": [
          "baseline.perplexity",
          "method.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "switch-transformer",
      "title": "Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity",
      "paper_url": "https://arxiv.org/abs/2101.03961",
      "detail_path": "reproductions/2101.03961-switch-transformer/README.md",
      "topic": [
        "llm-architecture",
        "mixture-of-experts",
        "classic"
      ],
      "first_author": null,
      "first_author_affiliation": "Google Brain",
      "published": "2021-01-11",
      "code": "https://github.com/tensorflow/mesh",
      "adapter": {
        "adapter_key": "switch-transformer",
        "arxiv_id": "2101.03961",
        "title": "Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity",
        "paper_url": "https://arxiv.org/abs/2101.03961",
        "track": "llm",
        "organization": "Google Brain",
        "published": "2021-01-11",
        "code_url": "https://github.com/tensorflow/mesh",
        "topics": [
          "llm-architecture",
          "mixture-of-experts",
          "classic"
        ],
        "local_code_dir": "src/auto_research/reproductions/switch_transformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "参数预算内 dense Transformer",
        "metrics": [
          "baseline.perplexity",
          "method.perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "swrouter",
      "title": "SWRouter: Similarity-Contractive Window Routing for Multi-Turn Large Language Model Conversations",
      "paper_url": "https://arxiv.org/abs/2609.11414",
      "detail_path": "foundation-models/2609.11414-swrouter/README.md",
      "topic": [
        "模型路由",
        "多轮上下文"
      ],
      "first_author": "Yu Wang",
      "first_author_affiliation": "Shanghai Jiao Tong University",
      "published": "2026-09-10",
      "code": null,
      "adapter": "swrouter",
      "priority": "P1"
    },
    {
      "domain": "foundation-models",
      "key": "tcab",
      "title": "Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing",
      "paper_url": "https://arxiv.org/abs/2608.12831",
      "detail_path": "reproductions/2608.12831-tcab/README.md",
      "topic": [
        "评测基础设施",
        "在线实验"
      ],
      "first_author": null,
      "first_author_affiliation": "New York University",
      "published": "2026-08-13",
      "code": null,
      "adapter": {
        "adapter_key": "tcab",
        "arxiv_id": "2608.12831",
        "title": "Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing",
        "paper_url": "https://arxiv.org/abs/2608.12831",
        "track": "llm",
        "organization": "New York University",
        "published": "2026-08-13",
        "code_url": null,
        "topics": [
          "评测基础设施",
          "在线实验"
        ],
        "local_code_dir": "src/auto_research/reproductions/tcab",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "transmem",
      "title": "TransMem: Transforming Hidden States into Memory for Large Language Models",
      "paper_url": "https://arxiv.org/abs/2607.29032",
      "detail_path": "reproductions/2607.29032-transmem/README.md",
      "topic": [
        "注意力与长上下文",
        "Agent 记忆"
      ],
      "first_author": null,
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-07-31",
      "code": null,
      "adapter": {
        "adapter_key": "transmem",
        "arxiv_id": "2607.29032",
        "title": "TransMem: Transforming Hidden States into Memory for Large Language Models",
        "paper_url": "https://arxiv.org/abs/2607.29032",
        "track": "llm",
        "organization": "Authors did not disclose affiliation",
        "published": "2026-07-31",
        "code_url": null,
        "topics": [
          "注意力与长上下文",
          "Agent 记忆"
        ],
        "local_code_dir": "src/auto_research/reproductions/transmem",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "ttcd",
      "title": "Learning What to Remember: Test-Time Training via Context Distillation",
      "paper_url": "https://arxiv.org/abs/2608.01672",
      "detail_path": "reproductions/2608.01672-ttcd/README.md",
      "topic": [
        "注意力与长上下文",
        "测试时训练"
      ],
      "first_author": null,
      "first_author_affiliation": "Princeton University",
      "published": "2026-08-03",
      "code": "https://github.com/dangxingyu/ttcd",
      "adapter": {
        "adapter_key": "ttcd",
        "arxiv_id": "2608.01672",
        "title": "Learning What to Remember: Test-Time Training via Context Distillation",
        "paper_url": "https://arxiv.org/abs/2608.01672",
        "track": "llm",
        "organization": "Princeton University",
        "published": "2026-08-03",
        "code_url": "https://github.com/dangxingyu/ttcd",
        "topics": [
          "注意力与长上下文",
          "测试时训练"
        ],
        "local_code_dir": "src/auto_research/reproductions/ttcd",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "deterministic long-context public mini-suite"
        ],
        "baseline": "recent-window attention",
        "metrics": [
          "accuracy",
          "relative cost"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "twinkv",
      "title": "TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy",
      "paper_url": "https://arxiv.org/abs/2608.27128",
      "detail_path": "reproductions/2608.27128-twinkv/README.md",
      "topic": [
        "kv-cache",
        "long-context",
        "inference-serving",
        "compression"
      ],
      "first_author": null,
      "first_author_affiliation": "The Hong Kong University of Science and Technology (Guangzhou)",
      "published": "2026-08-27",
      "code": null,
      "adapter": {
        "adapter_key": "twinkv",
        "arxiv_id": "2608.27128",
        "title": "TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy",
        "paper_url": "https://arxiv.org/abs/2608.27128",
        "track": "llm",
        "organization": "The Hong Kong University of Science and Technology (Guangzhou)",
        "published": "2026-08-27",
        "code_url": null,
        "topics": [
          "kv-cache",
          "long-context",
          "inference-serving",
          "compression"
        ],
        "local_code_dir": "src/auto_research/reproductions/twinkv",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2 long-context checkpoint subset"
        ],
        "baseline": "StreamingLLM sink + recent eviction at the same KV budget",
        "metrics": [
          "attention-output cosine",
          "repair latency",
          "KV bytes",
          "peak GPU memory"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/twinkv-a30-20260829.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "vbvr-pro",
      "title": "VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.26105",
      "detail_path": "reproductions/2608.26105-vbvr-pro/README.md",
      "topic": [
        "multimodal-foundation-model",
        "native-visual-reasoning",
        "verifiable-reward",
        "benchmark"
      ],
      "first_author": null,
      "first_author_affiliation": "Nanyang Technological University / VBVR Community",
      "published": "2026-08-26",
      "code": "https://www.video-reason.com/?v=pro",
      "adapter": {
        "adapter_key": "vbvr-pro",
        "arxiv_id": "2608.26105",
        "title": "VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning",
        "paper_url": "https://arxiv.org/abs/2608.26105",
        "track": "llm",
        "organization": "Nanyang Technological University / VBVR Community",
        "published": "2026-08-26",
        "code_url": "https://www.video-reason.com/?v=pro",
        "topics": [
          "multimodal-foundation-model",
          "native-visual-reasoning",
          "verifiable-reward",
          "benchmark"
        ],
        "local_code_dir": "src/auto_research/reproductions/vbvr_pro",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l1_mechanism",
        "datasets": [
          "VBVR-Pro procedural task specification"
        ],
        "baseline": "scalar VLM-as-a-judge analogue on the same 300 generated tasks",
        "metrics": [
          "reward mean",
          "reward standard deviation",
          "deterministic verifier agreement"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "wemm-embedding",
      "title": "WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report",
      "paper_url": "https://arxiv.org/abs/2608.24053",
      "detail_path": "reproductions/2608.24053-wemm-embedding/README.md",
      "topic": [
        "multimodal-foundation-model",
        "embedding",
        "retrieval",
        "matryoshka-representation"
      ],
      "first_author": "Junjie Zhou",
      "first_author_affiliation": "WeChat Vision, Tencent",
      "published": "2026-08-25",
      "code": "https://github.com/Tencent/WeMM-Embedding",
      "adapter": {
        "adapter_key": "wemm-embedding",
        "arxiv_id": "2608.24053",
        "title": "WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report",
        "paper_url": "https://arxiv.org/abs/2608.24053",
        "track": "llm",
        "organization": "WeChat Vision, Tencent",
        "published": "2026-08-25",
        "code_url": "https://github.com/Tencent/WeMM-Embedding",
        "topics": [
          "multimodal-foundation-model",
          "embedding",
          "retrieval",
          "matryoshka-representation"
        ],
        "local_code_dir": "src/auto_research/reproductions/wemm_embedding",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M paired content/collaborative views"
        ],
        "baseline": "stage-1 multimodal alignment without refinement",
        "metrics": [
          "Recall@1",
          "Recall@10",
          "MRR"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "wide",
      "title": "WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning",
      "paper_url": "https://arxiv.org/abs/2607.28418",
      "detail_path": "reproductions/2607.28418-wide/README.md",
      "topic": [
        "llm-architecture",
        "dynamic-pruning",
        "inference-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "EIT-NLP / LMU Munich",
      "published": "2026-07-30",
      "code": "https://github.com/EIT-NLP/LLM-Pruning/tree/main/WIDE",
      "adapter": {
        "adapter_key": "wide",
        "arxiv_id": "2607.28418",
        "title": "WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning",
        "paper_url": "https://arxiv.org/abs/2607.28418",
        "track": "llm",
        "organization": "EIT-NLP / LMU Munich",
        "published": "2026-07-30",
        "code_url": "https://github.com/EIT-NLP/LLM-Pruning/tree/main/WIDE",
        "topics": [
          "llm-architecture",
          "dynamic-pruning",
          "inference-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/wide",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "同预算 dense LLaMA",
        "metrics": [
          "baseline.lm_loss",
          "baseline.parameters",
          "baseline.perplexity",
          "method.active_attention_head_fraction",
          "method.active_ffn_channel_fraction",
          "method.lm_loss",
          "method.parameters",
          "method.perplexity",
          "relative_perplexity_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=30",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "foundation-models",
      "key": "windowed-mtp",
      "title": "Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context",
      "paper_url": "https://arxiv.org/abs/2607.21535",
      "detail_path": "reproductions/2607.21535-windowed-mtp/README.md",
      "topic": [
        "llm-serving",
        "speculative-decoding",
        "kv-cache",
        "long-context"
      ],
      "first_author": null,
      "first_author_affiliation": "NVIDIA",
      "published": "2026-07-23",
      "code": "https://github.com/avalliappan-nvidia/windowed-mtp-b200",
      "adapter": {
        "adapter_key": "windowed-mtp",
        "arxiv_id": "2607.21535",
        "title": "Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context",
        "paper_url": "https://arxiv.org/abs/2607.21535",
        "track": "llm",
        "organization": "NVIDIA",
        "published": "2026-07-23",
        "code_url": "https://github.com/avalliappan-nvidia/windowed-mtp-b200",
        "topics": [
          "llm-serving",
          "speculative-decoding",
          "kv-cache",
          "long-context"
        ],
        "local_code_dir": "src/auto_research/reproductions/windowed_mtp",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "WikiText-2"
        ],
        "baseline": "读取完整历史的同权重 MTP draft",
        "metrics": [
          "context_16384.latency_reduction_percent",
          "target_perplexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "multimodal-models",
      "key": "stacktok",
      "title": "StackTok: Accelerating VLMs Inference with Budget-Adaptive Visual Token Selection",
      "paper_url": "https://arxiv.org/abs/2609.16841",
      "detail_path": "multimodal-models/2609.16841-stacktok/README.md",
      "topic": [
        "视觉 Token 选择",
        "推理效率"
      ],
      "first_author": "Zhenbin Wang",
      "first_author_affiliation": "Sichuan University",
      "published": "2026-09-15",
      "code": "https://github.com/wongzbb/StackToK",
      "adapter": "stacktok",
      "priority": "P1"
    },
    {
      "domain": "multimodal-models",
      "key": "videomm",
      "title": "VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs",
      "paper_url": "https://arxiv.org/abs/2609.16722",
      "detail_path": "multimodal-models/2609.16722-videomm/README.md",
      "topic": [
        "视频理解",
        "Token 压缩"
      ],
      "first_author": "Haoyu Guo",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-09-15",
      "code": "https://github.com/adfh917k/VideoMM",
      "adapter": "videomm",
      "priority": "P0",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/videomm-a100-20260916.json"
    },
    {
      "domain": "post-training",
      "key": "absolute-zero",
      "title": "Absolute Zero",
      "paper_url": "https://arxiv.org/abs/2505.03335",
      "detail_path": "post-training/2505.03335-absolute-zero/README.md",
      "topic": [
        "零数据自博弈"
      ],
      "first_author": "Andrew Zhao",
      "first_author_affiliation": "Tsinghua University",
      "published": "2025-05-06",
      "code": "https://github.com/LeapLabTHU/Absolute-Zero-Reasoner",
      "adapter": "absolute-zero"
    },
    {
      "domain": "post-training",
      "key": "adaptive-opd-gate",
      "title": "A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficients",
      "paper_url": "https://arxiv.org/abs/2609.11768",
      "detail_path": "post-training/2609.11768-adaptive-opd-gate/README.md",
      "topic": [
        "On-policy distillation",
        "逐 token 自适应门控"
      ],
      "first_author": "Suwan Wu",
      "first_author_affiliation": "Xiaohongshu",
      "published": "2026-09-10",
      "code": null,
      "adapter": "adaptive-opd-gate",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "adrs",
      "title": "ADRS",
      "paper_url": "https://arxiv.org/abs/2608.03223",
      "detail_path": "post-training/2608.03223-adrs/README.md",
      "topic": [
        "回报相关奖励塑形"
      ],
      "first_author": "Ranxu Zhang",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-08-04",
      "code": "https://github.com/gitrxh/ADRS-arxiv",
      "adapter": "adrs"
    },
    {
      "domain": "post-training",
      "key": "armor",
      "title": "ARMOR",
      "paper_url": "https://arxiv.org/abs/2607.10481",
      "detail_path": "post-training/2607.10481-armor/README.md",
      "topic": [
        "Reference anchor"
      ],
      "first_author": "Kexin Huang",
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-07-11",
      "code": "未发现官方代码",
      "adapter": "armor"
    },
    {
      "domain": "post-training",
      "key": "beta-opsd",
      "title": "β-OPSD",
      "paper_url": "https://arxiv.org/abs/2607.28582",
      "detail_path": "post-training/2607.28582-beta-opsd/README.md",
      "topic": [
        "On-policy self-distillation"
      ],
      "first_author": "Jiawei Xu",
      "first_author_affiliation": "University of Maryland, College Park",
      "published": "2026-07-30",
      "code": "未发现官方代码",
      "adapter": "beta-opsd"
    },
    {
      "domain": "post-training",
      "key": "c2-dpo",
      "title": "Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization",
      "paper_url": "https://arxiv.org/abs/2608.12158",
      "detail_path": "post-training/2608.12158-c2-dpo/README.md",
      "topic": [
        "多模态上下文偏好校准"
      ],
      "first_author": "Byungoh Ko",
      "first_author_affiliation": "Korea University",
      "published": "2026-08-12",
      "code": "https://github.com/mlvlab/C2-DPO",
      "adapter": "c2-dpo"
    },
    {
      "domain": "post-training",
      "key": "calibration-aware-rl",
      "title": "Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2601.13284",
      "detail_path": "post-training/2601.13284-calibration-aware-rl/README.md",
      "topic": [
        "校准强化学习",
        "决策 token"
      ],
      "first_author": "Duygu Nur Yaldiz",
      "first_author_affiliation": "University of Southern California",
      "published": "2026-01-19",
      "code": null,
      "adapter": "system-one:rival-hybrid",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "causal-opd",
      "title": "CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.03673",
      "detail_path": "post-training/2608.03673-causal-opd/README.md",
      "topic": [
        "OPD",
        "过程监督"
      ],
      "first_author": "Jian Zhang",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-08-04",
      "code": null,
      "adapter": "causal-opd"
    },
    {
      "domain": "post-training",
      "key": "chord",
      "title": "CHORD",
      "paper_url": "https://arxiv.org/abs/2508.11408",
      "detail_path": "post-training/2508.11408-chord/README.md",
      "topic": [
        "SFT-RL 动态混合"
      ],
      "first_author": "Wenhao Zhang",
      "first_author_affiliation": "Alibaba Group",
      "published": "2025-08-15",
      "code": "https://github.com/modelscope/Trinity-RFT/tree/main/examples/mix_chord",
      "adapter": "chord"
    },
    {
      "domain": "post-training",
      "key": "cispo",
      "title": "CISPO / MiniMax-M1",
      "paper_url": "https://arxiv.org/abs/2506.13585",
      "detail_path": "post-training/2506.13585-cispo/README.md",
      "topic": [
        "长上下文 RL"
      ],
      "first_author": "MiniMax",
      "first_author_affiliation": "MiniMax",
      "published": "2025-06-16",
      "code": "https://github.com/MiniMax-AI/MiniMax-M1",
      "adapter": "cispo"
    },
    {
      "domain": "post-training",
      "key": "clue-opsd",
      "title": "Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding",
      "paper_url": "https://arxiv.org/abs/2608.25356",
      "detail_path": "post-training/2608.25356-clue-opsd/README.md",
      "topic": [
        "长视频特权视图 OPD"
      ],
      "first_author": "Kaishen Wang",
      "first_author_affiliation": "University of Maryland, College Park",
      "published": "2026-08-26",
      "code": null,
      "adapter": "clue-opsd"
    },
    {
      "domain": "post-training",
      "key": "coba-rl",
      "title": "CoBA-RL",
      "paper_url": "https://arxiv.org/abs/2606.22317",
      "detail_path": "post-training/2606.22317-coba-rl/README.md",
      "topic": [
        "能力边界课程"
      ],
      "first_author": "Pengxiang Cai",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-06-21",
      "code": "未发现官方代码",
      "adapter": "coba-rl"
    },
    {
      "domain": "post-training",
      "key": "compass-opd",
      "title": "CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood Shifts",
      "paper_url": "https://arxiv.org/abs/2609.10154",
      "detail_path": "post-training/2609.10154-compass-opd/README.md",
      "topic": [
        "跨模型族 OPD"
      ],
      "first_author": "Naibin Gu",
      "first_author_affiliation": "Institute of Information Engineering, Chinese Academy of Sciences",
      "published": "2026-09-09",
      "code": null,
      "adapter": "compass-opd"
    },
    {
      "domain": "post-training",
      "key": "compo",
      "title": "A Zeroth-Order Paradigm for LLM Preference Alignment",
      "paper_url": "https://arxiv.org/abs/2609.19144",
      "detail_path": "post-training/2609.19144-compo/README.md",
      "topic": [
        "偏好优化",
        "零阶优化"
      ],
      "first_author": "Peter Chen",
      "first_author_affiliation": "University of California, Berkeley",
      "published": "2026-09-16",
      "code": null,
      "adapter": "compo",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "conspo",
      "title": "ConSPO",
      "paper_url": "https://arxiv.org/abs/2605.12969",
      "detail_path": "post-training/2605.12969-conspo/README.md",
      "topic": [
        "对比序列 RL"
      ],
      "first_author": "Feng Zhang",
      "first_author_affiliation": "Beijing Institute of Technology",
      "published": "2026-05-13",
      "code": "未发现官方代码",
      "adapter": "conspo"
    },
    {
      "domain": "post-training",
      "key": "constitutional-ai",
      "title": "Constitutional AI",
      "paper_url": "https://arxiv.org/abs/2212.08073",
      "detail_path": "post-training/2212.08073-constitutional-ai/README.md",
      "topic": [
        "AI 反馈安全对齐"
      ],
      "first_author": "Yuntao Bai",
      "first_author_affiliation": "Anthropic",
      "published": "2022-12-15",
      "code": "https://github.com/anthropics/ConstitutionalHarmlessnessPaper",
      "adapter": "constitutional-ai"
    },
    {
      "domain": "post-training",
      "key": "cort",
      "title": "CoRT",
      "paper_url": "https://arxiv.org/abs/2607.25659",
      "detail_path": "post-training/2607.25659-cort/README.md",
      "topic": [
        "Token-level credit assignment"
      ],
      "first_author": "Bo-Wen Zhang",
      "first_author_affiliation": "ByteDance internship",
      "published": "2026-07-28",
      "code": "未发现官方代码",
      "adapter": "cort"
    },
    {
      "domain": "post-training",
      "key": "crpo",
      "title": "Contrastive Reinforced Policy Optimization via Privileged Self-Distillation",
      "paper_url": "https://arxiv.org/abs/2607.28026",
      "detail_path": "post-training/2607.28026-crpo/README.md",
      "topic": [
        "OPD",
        "Agentic RL"
      ],
      "first_author": "Xingjian Wu",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-07-30",
      "code": null,
      "adapter": "crpo"
    },
    {
      "domain": "post-training",
      "key": "dapo",
      "title": "DAPO",
      "paper_url": "https://arxiv.org/abs/2503.14476",
      "detail_path": "post-training/2503.14476-dapo/README.md",
      "topic": [
        "长推理 RL"
      ],
      "first_author": "Qiying Yu",
      "first_author_affiliation": "ByteDance Seed",
      "published": "2025-03-18",
      "code": "https://github.com/BytedTsinghua-SIA/DAPO",
      "adapter": "dapo"
    },
    {
      "domain": "post-training",
      "key": "dash",
      "title": "DASH",
      "paper_url": "https://arxiv.org/abs/2608.06243",
      "detail_path": "post-training/2608.06243-dash/README.md",
      "topic": [
        "自适应自蒸馏"
      ],
      "first_author": "Zhiyan Hou",
      "first_author_affiliation": "Nanjing University",
      "published": "2026-08-06",
      "code": "https://github.com/DBtxy/DASH-OPSD",
      "adapter": "dash"
    },
    {
      "domain": "post-training",
      "key": "df-opd",
      "title": "Data-free On-policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.14193",
      "detail_path": "post-training/2609.14193-df-opd/README.md",
      "topic": [
        "On-policy distillation",
        "数据合成"
      ],
      "first_author": "Gengsheng Li",
      "first_author_affiliation": "Institute of Automation, Chinese Academy of Sciences / Tencent",
      "published": "2026-09-12",
      "code": null,
      "adapter": "df-opd",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "distilled-rl",
      "title": "Distilled RL",
      "paper_url": "https://arxiv.org/abs/2607.17247",
      "detail_path": "post-training/2607.17247-distilled-rl/README.md",
      "topic": [
        "教师奖励重权重"
      ],
      "first_author": "Chen Wang",
      "first_author_affiliation": "Nankai University",
      "published": "2026-07-19",
      "code": "https://github.com/597358816/Distilled-RL",
      "adapter": "distilled-rl"
    },
    {
      "domain": "post-training",
      "key": "dpo",
      "title": "DPO",
      "paper_url": "https://arxiv.org/abs/2305.18290",
      "detail_path": "post-training/2305.18290-dpo/README.md",
      "topic": [
        "直接偏好优化"
      ],
      "first_author": "Rafael Rafailov",
      "first_author_affiliation": "Stanford University",
      "published": "2023-05-29",
      "code": "https://github.com/eric-mitchell/direct-preference-optimization",
      "adapter": "dpo"
    },
    {
      "domain": "post-training",
      "key": "dr-grpo",
      "title": "Dr. GRPO",
      "paper_url": "https://arxiv.org/abs/2503.20783",
      "detail_path": "post-training/2503.20783-dr-grpo/README.md",
      "topic": [
        "GRPO 聚合偏置"
      ],
      "first_author": "Zichen Liu",
      "first_author_affiliation": "SAIL 研究团队",
      "published": "2025-03-26",
      "code": "https://github.com/sail-sg/understand-r1-zero",
      "adapter": "dr-grpo"
    },
    {
      "domain": "post-training",
      "key": "dynamic-rubric",
      "title": "Co-Evolving LLM Evaluators and Policies via DynamicRubric",
      "paper_url": "https://arxiv.org/abs/2607.20083",
      "detail_path": "reproductions/2607.20083-dynamic-rubric/README.md",
      "topic": [
        "post-training",
        "reward-model",
        "evaluator",
        "co-evolution"
      ],
      "first_author": "Beining Wang",
      "first_author_affiliation": "WeChat / Tencent",
      "published": "2026-07-22",
      "code": null,
      "adapter": {
        "adapter_key": "dynamic-rubric",
        "arxiv_id": "2607.20083",
        "title": "Co-Evolving LLM Evaluators and Policies via DynamicRubric",
        "paper_url": "https://arxiv.org/abs/2607.20083",
        "track": "llm",
        "organization": "WeChat / Tencent and Tsinghua University",
        "published": "2026-07-22",
        "code_url": null,
        "topics": [
          "post-training",
          "reward-model",
          "evaluator",
          "co-evolution"
        ],
        "local_code_dir": "src/auto_research/reproductions/dynamic_rubric",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Stanford Alpaca"
        ],
        "baseline": "固定 prompt-only rubric policy，实验组为 DynamicRubric evaluator-policy 共进化",
        "metrics": [
          "baseline.preference_accuracy",
          "method.preference_accuracy",
          "relative.margin_delta",
          "relative.preference_accuracy_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=1600",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "The paper reports statistically significant online A/B gains and a full-traffic WeChat Search deployment, but withholds exact lifts.",
        "evolve_operators": []
      }
    },
    {
      "domain": "post-training",
      "key": "erils",
      "title": "Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models",
      "paper_url": "https://arxiv.org/abs/2608.01717",
      "detail_path": "post-training/2608.01717-erils/README.md",
      "topic": [
        "外部 rollout",
        "Diffusion LM RL"
      ],
      "first_author": "Wonseok Lee",
      "first_author_affiliation": "Seoul National University",
      "published": "2026-08-03",
      "code": null,
      "adapter": "erils"
    },
    {
      "domain": "post-training",
      "key": "erpo",
      "title": "Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization",
      "paper_url": "https://arxiv.org/abs/2608.23311",
      "detail_path": "post-training/2608.23311-erpo/README.md",
      "topic": [
        "输入侧 Query-KL"
      ],
      "first_author": "Xianlei Zhou",
      "first_author_affiliation": "AMAP, Alibaba Group",
      "published": "2026-08-24",
      "code": "https://github.com/alibaba/ERPO",
      "adapter": "erpo"
    },
    {
      "domain": "post-training",
      "key": "flux-opd",
      "title": "Flux-OPD",
      "paper_url": "https://arxiv.org/abs/2607.28022",
      "detail_path": "post-training/2607.28022-flux-opd/README.md",
      "topic": [
        "Context distillation"
      ],
      "first_author": "Yuran Wang",
      "first_author_affiliation": "Peking University",
      "published": "2026-07-30",
      "code": "未发现官方代码",
      "adapter": "flux-opd"
    },
    {
      "domain": "post-training",
      "key": "gamma-opd",
      "title": "Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.16937",
      "detail_path": "post-training/2609.16937-gamma-opd/README.md",
      "topic": [
        "On-policy distillation",
        "时间信用分配"
      ],
      "first_author": "Shiqi Liu",
      "first_author_affiliation": "Tsinghua University / DiDi Voyager Labs",
      "published": "2026-09-15",
      "code": null,
      "adapter": "gamma-opd",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "gcpo",
      "title": "GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs",
      "paper_url": "https://arxiv.org/abs/2608.11674",
      "detail_path": "post-training/2608.11674-gcpo/README.md",
      "topic": [
        "几何约束 RL"
      ],
      "first_author": "Kai Yang",
      "first_author_affiliation": "Shanghai AI Laboratory",
      "published": "2026-08-12",
      "code": "https://github.com/Icarus1411/GCPO",
      "adapter": "gcpo"
    },
    {
      "domain": "post-training",
      "key": "gkd",
      "title": "GKD",
      "paper_url": "https://arxiv.org/abs/2306.13649",
      "detail_path": "post-training/2306.13649-gkd/README.md",
      "topic": [
        "经典 On-policy distillation"
      ],
      "first_author": "Rishabh Agarwal",
      "first_author_affiliation": "Google DeepMind",
      "published": "2023-06-23",
      "code": "https://github.com/huggingface/trl/blob/main/docs/source/distillation_trainer.md",
      "adapter": "gkd"
    },
    {
      "domain": "post-training",
      "key": "gppo",
      "title": "GPPO",
      "paper_url": "https://arxiv.org/abs/2508.07629",
      "detail_path": "post-training/2508.07629-gppo/README.md",
      "topic": [
        "梯度保留 clip"
      ],
      "first_author": "Zhenpeng Su",
      "first_author_affiliation": "Alibaba Group",
      "published": "2025-08-11",
      "code": "未发现官方代码",
      "adapter": "gppo"
    },
    {
      "domain": "post-training",
      "key": "gprl",
      "title": "GPRL",
      "paper_url": "https://arxiv.org/abs/2605.18721",
      "detail_path": "post-training/2605.18721-gprl/README.md",
      "topic": [
        "多目标 RL"
      ],
      "first_author": "Muhammad Umer",
      "first_author_affiliation": "Stanford University",
      "published": "2026-05-18",
      "code": "未发现官方代码",
      "adapter": "gprl"
    },
    {
      "domain": "post-training",
      "key": "grin",
      "title": "From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection",
      "paper_url": "https://arxiv.org/abs/2608.25243",
      "detail_path": "post-training/2608.25243-grin/README.md",
      "topic": [
        "混合策略知识注入 RL"
      ],
      "first_author": "Zhibo Hou",
      "first_author_affiliation": "University of California, Merced",
      "published": "2026-08-26",
      "code": null,
      "adapter": "grin"
    },
    {
      "domain": "post-training",
      "key": "grip",
      "title": "GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.25583",
      "detail_path": "post-training/2608.25583-grip/README.md",
      "topic": [
        "奖励引导参数插值"
      ],
      "first_author": "Lam So",
      "first_author_affiliation": "Peking University",
      "published": "2026-08-26",
      "code": null,
      "adapter": "grip"
    },
    {
      "domain": "post-training",
      "key": "growmtp",
      "title": "GrowMTP: Can RL Grow Its Own Draft Head?",
      "paper_url": "https://arxiv.org/abs/2609.16648",
      "detail_path": "post-training/2609.16648-growmtp/README.md",
      "topic": [
        "RL 训练加速",
        "推测解码"
      ],
      "first_author": "Minghua He",
      "first_author_affiliation": "WeChat AI, Tencent / Peking University",
      "published": "2026-09-15",
      "code": null,
      "adapter": "growmtp",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "grpo",
      "title": "DeepSeekMath / GRPO",
      "paper_url": "https://arxiv.org/abs/2402.03300",
      "detail_path": "post-training/2402.03300-grpo/README.md",
      "topic": [
        "在线推理 RL"
      ],
      "first_author": "Zhihong Shao",
      "first_author_affiliation": "DeepSeek-AI",
      "published": "2024-02-05",
      "code": "https://github.com/deepseek-ai/DeepSeek-Math",
      "adapter": "grpo"
    },
    {
      "domain": "post-training",
      "key": "gspo",
      "title": "GSPO",
      "paper_url": "https://arxiv.org/abs/2507.18071",
      "detail_path": "post-training/2507.18071-gspo/README.md",
      "topic": [
        "稳定序列 RL"
      ],
      "first_author": "Chujie Zheng",
      "first_author_affiliation": "Alibaba Qwen Team",
      "published": "2025-07-24",
      "code": "https://alibaba.github.io/ROLL/docs/User%20Guides/Algorithms/GSPO/",
      "adapter": "gspo"
    },
    {
      "domain": "post-training",
      "key": "icepop",
      "title": "IcePop",
      "paper_url": "https://arxiv.org/abs/2510.18855",
      "detail_path": "post-training/2510.18855-icepop/README.md",
      "topic": [
        "MoE 训推失配"
      ],
      "first_author": "Ling Team",
      "first_author_affiliation": "Ant Group",
      "published": "2025-10-21",
      "code": "未发现官方代码",
      "adapter": "icepop"
    },
    {
      "domain": "post-training",
      "key": "intuitor",
      "title": "INTUITOR",
      "paper_url": "https://arxiv.org/abs/2505.19590",
      "detail_path": "post-training/2505.19590-intuitor/README.md",
      "topic": [
        "自置信奖励"
      ],
      "first_author": "Xuandong Zhao",
      "first_author_affiliation": "University of California, Berkeley",
      "published": "2025-05-26",
      "code": "https://github.com/sunblaze-ucb/Intuitor",
      "adapter": "intuitor"
    },
    {
      "domain": "post-training",
      "key": "ipo",
      "title": "IPO",
      "paper_url": "https://arxiv.org/abs/2310.12036",
      "detail_path": "post-training/2310.12036-ipo/README.md",
      "topic": [
        "偏好正则"
      ],
      "first_author": "Mohammad Gheshlaghi Azar",
      "first_author_affiliation": "Google DeepMind",
      "published": "2023-10-18",
      "code": "未发现官方代码",
      "adapter": "ipo"
    },
    {
      "domain": "post-training",
      "key": "iso-rlvr",
      "title": "ISO: An RLVR-Native Optimization Stack",
      "paper_url": "https://arxiv.org/abs/2607.19331",
      "detail_path": "post-training/2607.19331-iso-rlvr/README.md",
      "topic": [
        "RLVR",
        "优化器"
      ],
      "first_author": "Hanqing Zhu",
      "first_author_affiliation": "The University of Texas at Austin",
      "published": "2026-07-21",
      "code": "https://github.com/zhuhanqing/ISO",
      "adapter": "iso-rlvr"
    },
    {
      "domain": "post-training",
      "key": "kpop",
      "title": "KPop",
      "paper_url": "https://arxiv.org/abs/2606.15079",
      "detail_path": "post-training/2606.15079-kpop/README.md",
      "topic": [
        "异步训推失配"
      ],
      "first_author": "Ang Li",
      "first_author_affiliation": "Ling / Ring Team",
      "published": "2026-06-13",
      "code": "未发现官方代码",
      "adapter": "kpop"
    },
    {
      "domain": "post-training",
      "key": "kto",
      "title": "KTO",
      "paper_url": "https://arxiv.org/abs/2402.01306",
      "detail_path": "post-training/2402.01306-kto/README.md",
      "topic": [
        "二元反馈对齐"
      ],
      "first_author": "Kawin Ethayarajh",
      "first_author_affiliation": "Contextual AI",
      "published": "2024-02-02",
      "code": "https://github.com/ContextualAI/HALOs",
      "adapter": "kto"
    },
    {
      "domain": "post-training",
      "key": "lightning-opd",
      "title": "Lightning OPD",
      "paper_url": "https://arxiv.org/abs/2604.13010",
      "detail_path": "post-training/2604.13010-lightning-opd/README.md",
      "topic": [
        "On-policy distillation"
      ],
      "first_author": "Yecheng Wu",
      "first_author_affiliation": "MIT HAN Lab",
      "published": "2026-04-14",
      "code": "https://github.com/jet-ai-projects/Lightning-OPD",
      "adapter": "lightning-opd"
    },
    {
      "domain": "post-training",
      "key": "locus",
      "title": "LOCUS: Task-Aware Low-Rank Post-Training for Token-Efficient Language Generation",
      "paper_url": "https://arxiv.org/abs/2609.11739",
      "detail_path": "post-training/2609.11739-locus/README.md",
      "topic": [
        "低秩后训练",
        "Token 效率"
      ],
      "first_author": "Dongfang Zhao",
      "first_author_affiliation": "University of Washington",
      "published": "2026-09-10",
      "code": null,
      "adapter": "locus",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "luffy",
      "title": "LUFFY",
      "paper_url": "https://arxiv.org/abs/2504.14945",
      "detail_path": "post-training/2504.14945-luffy/README.md",
      "topic": [
        "离策略推理 RL"
      ],
      "first_author": "Jianhao Yan",
      "first_author_affiliation": "University of Washington",
      "published": "2025-04-21",
      "code": "https://github.com/Simplified-Reasoning/LUFFY",
      "adapter": "luffy"
    },
    {
      "domain": "post-training",
      "key": "luspo",
      "title": "LUSPO",
      "paper_url": "https://arxiv.org/abs/2602.05261",
      "detail_path": "post-training/2602.05261-luspo/README.md",
      "topic": [
        "长度无偏 RL"
      ],
      "first_author": "Fanfan Liu",
      "first_author_affiliation": "Meituan",
      "published": "2026-02-05",
      "code": "未发现官方代码",
      "adapter": "luspo"
    },
    {
      "domain": "post-training",
      "key": "math-shepherd",
      "title": "Math-Shepherd",
      "paper_url": "https://arxiv.org/abs/2312.08935",
      "detail_path": "post-training/2312.08935-math-shepherd/README.md",
      "topic": [
        "自动过程奖励"
      ],
      "first_author": "Peiyi Wang",
      "first_author_affiliation": "Peking University",
      "published": "2023-12-14",
      "code": "未发现官方代码",
      "adapter": "math-shepherd"
    },
    {
      "domain": "post-training",
      "key": "minillm",
      "title": "MiniLLM",
      "paper_url": "https://arxiv.org/abs/2306.08543",
      "detail_path": "post-training/2306.08543-minillm/README.md",
      "topic": [
        "Reverse-KL distillation"
      ],
      "first_author": "Yuxian Gu",
      "first_author_affiliation": "Tsinghua University",
      "published": "2023-06-14",
      "code": "https://github.com/microsoft/LMOps/tree/main/minillm",
      "adapter": "minillm"
    },
    {
      "domain": "post-training",
      "key": "minirl",
      "title": "Stabilizing RL with LLMs",
      "paper_url": "https://arxiv.org/abs/2512.01374",
      "detail_path": "post-training/2512.01374-minirl/README.md",
      "topic": [
        "稳定 MoE RL"
      ],
      "first_author": "Chujie Zheng",
      "first_author_affiliation": "Alibaba Qwen Team",
      "published": "2025-12-01",
      "code": "未发现官方代码",
      "adapter": "minirl"
    },
    {
      "domain": "post-training",
      "key": "missing-old-logits",
      "title": "Missing Old Logits",
      "paper_url": "https://arxiv.org/abs/2605.12070",
      "detail_path": "post-training/2605.12070-missing-old-logits/README.md",
      "topic": [
        "异步 off-policy"
      ],
      "first_author": "Zhong Guan",
      "first_author_affiliation": "Tianjin University",
      "published": "2026-05-12",
      "code": "未发现官方代码",
      "adapter": "missing-old-logits"
    },
    {
      "domain": "post-training",
      "key": "mopd",
      "title": "MOPD",
      "paper_url": "https://arxiv.org/abs/2606.30406",
      "detail_path": "post-training/2606.30406-mopd/README.md",
      "topic": [
        "多教师能力整合"
      ],
      "first_author": "Wenhan Ma",
      "first_author_affiliation": "Xiaomi",
      "published": "2026-06-29",
      "code": "未发现官方代码",
      "adapter": "mopd"
    },
    {
      "domain": "post-training",
      "key": "normalized-dpo",
      "title": "Disentangling Optimization Scale from Preference Scale in DPO",
      "paper_url": "https://arxiv.org/abs/2608.27032",
      "detail_path": "post-training/2608.27032-normalized-dpo/README.md",
      "topic": [
        "DPO 偏好/优化尺度解耦"
      ],
      "first_author": "Ivan Kruzhilov",
      "first_author_affiliation": "Affiliation not listed in the paper",
      "published": "2026-08-27",
      "code": "https://github.com/ivankru/bayesian_dpo",
      "adapter": "normalized-dpo"
    },
    {
      "domain": "post-training",
      "key": "nsd",
      "title": "Negative Self-Distillation: Learning to Reason by Avoiding Flaws",
      "paper_url": "https://arxiv.org/abs/2609.11699",
      "detail_path": "post-training/2609.11699-nsd/README.md",
      "topic": [
        "负向自蒸馏",
        "推理后训练"
      ],
      "first_author": "Rongcan Pei",
      "first_author_affiliation": "University of Virginia",
      "published": "2026-09-10",
      "code": "https://github.com/Prongcan/NSD",
      "adapter": "nsd",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "off-context-grpo",
      "title": "Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information",
      "paper_url": "https://arxiv.org/abs/2607.19313",
      "detail_path": "reproductions/2607.19313-off-context-grpo/README.md",
      "topic": [
        "rlvr",
        "grpo",
        "reasoning",
        "privileged-information"
      ],
      "first_author": "Priyank Agrawal",
      "first_author_affiliation": "Meta AI",
      "published": "2026-07-21",
      "code": "https://github.com/AgPriyank/OC-GRPO",
      "adapter": {
        "adapter_key": "off-context-grpo",
        "arxiv_id": "2607.19313",
        "title": "Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information",
        "paper_url": "https://arxiv.org/abs/2607.19313",
        "track": "llm",
        "organization": "Meta AI / Columbia University",
        "published": "2026-07-21",
        "code_url": "https://github.com/AgPriyank/OC-GRPO",
        "topics": [
          "rlvr",
          "grpo",
          "reasoning",
          "privileged-information"
        ],
        "local_code_dir": "src/auto_research/reproductions/off_context_grpo",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "GSM8K official"
        ],
        "baseline": "同 2,400 step、group size 8 的 vanilla GRPO，实验组为 Off-Context GRPO",
        "metrics": [
          "baseline.pass_at_1",
          "baseline.pass_at_8",
          "method.pass_at_1",
          "method.pass_at_8",
          "relative.pass_at_1_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=2400",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "post-training",
      "key": "online-icepop",
      "title": "Online IcePop",
      "paper_url": "web-2025-online-icepop/README.md",
      "detail_path": "post-training/web-2025-online-icepop/README.md",
      "topic": [
        "纯在线训推校正"
      ],
      "first_author": "Jian Hu",
      "first_author_affiliation": "Ant Group",
      "published": "2025-12-16",
      "code": "未发现官方代码",
      "adapter": "online-icepop"
    },
    {
      "domain": "post-training",
      "key": "opcd",
      "title": "OPCD",
      "paper_url": "https://arxiv.org/abs/2602.12275",
      "detail_path": "post-training/2602.12275-opcd/README.md",
      "topic": [
        "Context distillation"
      ],
      "first_author": "Tianzhu Ye",
      "first_author_affiliation": "Microsoft Research",
      "published": "2026-02-12",
      "code": "https://github.com/microsoft/LMOps/tree/main/opcd",
      "adapter": "opcd"
    },
    {
      "domain": "post-training",
      "key": "opd-aha",
      "title": "OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.16459",
      "detail_path": "post-training/2609.16459-opd-aha/README.md",
      "topic": [
        "多模态后训练",
        "On-policy distillation"
      ],
      "first_author": "Chenhao Qiu",
      "first_author_affiliation": "Arizona State University / University of Virginia / Stevens Institute of Technology",
      "published": "2026-09-15",
      "code": "https://github.com/Echochef/OPD-Aha",
      "adapter": "opd-aha",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "opd-lm",
      "title": "OPDLM",
      "paper_url": "https://arxiv.org/abs/2606.06712",
      "detail_path": "post-training/2606.06712-opd-lm/README.md",
      "topic": [
        "AR-to-Diffusion 蒸馏"
      ],
      "first_author": "Xingyu Su",
      "first_author_affiliation": "Texas A&M University",
      "published": "2026-06-04",
      "code": "未发现官方代码",
      "adapter": "opd-lm"
    },
    {
      "domain": "post-training",
      "key": "opd-search-plus",
      "title": "OPDSearch+: Search-Enhanced On-Policy Distillation with Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.24310",
      "detail_path": "post-training/2608.24310-opd-search-plus/README.md",
      "topic": [
        "搜索增强 OPD + RL"
      ],
      "first_author": "Qinglin Ye",
      "first_author_affiliation": "University of Chinese Academy of Sciences",
      "published": "2026-08-25",
      "code": null,
      "adapter": "opd-search-plus"
    },
    {
      "domain": "post-training",
      "key": "opd2",
      "title": "On-Policy Delta Distillation for Multilingual Math Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.05802",
      "detail_path": "post-training/2608.05802-opd2/README.md",
      "topic": [
        "OPD",
        "多语言推理"
      ],
      "first_author": "Byeongho Heo",
      "first_author_affiliation": "NAVER AI Lab",
      "published": "2026-08-06",
      "code": "https://github.com/naver-ai/opd2",
      "adapter": "opd2"
    },
    {
      "domain": "post-training",
      "key": "opdvr",
      "title": "OPDVR: On-Policy Distillation with Verifiable Rewards",
      "paper_url": "https://arxiv.org/abs/2608.24696",
      "detail_path": "post-training/2608.24696-opdvr/README.md",
      "topic": [
        "可验证奖励 OPD"
      ],
      "first_author": "Wenze Lin",
      "first_author_affiliation": "LeapLab, Tsinghua University",
      "published": "2026-08-25",
      "code": "https://github.com/LeapLabTHU/OPDVR",
      "adapter": "opdvr"
    },
    {
      "domain": "post-training",
      "key": "oprd",
      "title": "Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation",
      "paper_url": "https://arxiv.org/abs/2609.08798",
      "detail_path": "post-training/2609.08798-oprd/README.md",
      "topic": [
        "弱到强反向蒸馏"
      ],
      "first_author": "Youngrok Park",
      "first_author_affiliation": "KAIST AI",
      "published": "2026-09-08",
      "code": null,
      "adapter": "oprd"
    },
    {
      "domain": "post-training",
      "key": "opsd",
      "title": "OPSD",
      "paper_url": "https://arxiv.org/abs/2601.18734",
      "detail_path": "post-training/2601.18734-opsd/README.md",
      "topic": [
        "On-policy self-distillation"
      ],
      "first_author": "Siyan Zhao",
      "first_author_affiliation": "University of California, Los Angeles",
      "published": "2026-01-26",
      "code": "https://github.com/siyan-zhao/OPSD",
      "adapter": "opsd"
    },
    {
      "domain": "post-training",
      "key": "orpo",
      "title": "ORPO",
      "paper_url": "https://arxiv.org/abs/2403.07691",
      "detail_path": "post-training/2403.07691-orpo/README.md",
      "topic": [
        "单阶段偏好"
      ],
      "first_author": "Jiwoo Hong",
      "first_author_affiliation": "KAIST",
      "published": "2024-03-12",
      "code": "https://github.com/xfactlab/orpo",
      "adapter": "orpo"
    },
    {
      "domain": "post-training",
      "key": "pcsd",
      "title": "PCSD",
      "paper_url": "https://arxiv.org/abs/2608.01837",
      "detail_path": "post-training/2608.01837-pcsd/README.md",
      "topic": [
        "持续一致性蒸馏"
      ],
      "first_author": "Chunji Lv",
      "first_author_affiliation": "论文未列机构",
      "published": "2026-08-03",
      "code": "未发现官方代码",
      "adapter": "pcsd"
    },
    {
      "domain": "post-training",
      "key": "ppo-rlhf",
      "title": "InstructGPT / PPO-RLHF",
      "paper_url": "https://arxiv.org/abs/2203.02155",
      "detail_path": "post-training/2203.02155-ppo-rlhf/README.md",
      "topic": [
        "经典 RLHF"
      ],
      "first_author": "Long Ouyang",
      "first_author_affiliation": "OpenAI",
      "published": "2022-03-04",
      "code": "https://github.com/openai/following-instructions-human-feedback",
      "adapter": "ppo-rlhf"
    },
    {
      "domain": "post-training",
      "key": "probe-erpo",
      "title": "Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation",
      "paper_url": "https://arxiv.org/abs/2609.09135",
      "detail_path": "post-training/2609.09135-probe-erpo/README.md",
      "topic": [
        "代码测试时 RL"
      ],
      "first_author": "Jiacheng Xu",
      "first_author_affiliation": "Nanyang Technological University",
      "published": "2026-09-08",
      "code": null,
      "adapter": "probe-erpo"
    },
    {
      "domain": "post-training",
      "key": "process-supervision",
      "title": "Let's Verify Step by Step",
      "paper_url": "https://arxiv.org/abs/2305.20050",
      "detail_path": "post-training/2305.20050-process-supervision/README.md",
      "topic": [
        "过程监督"
      ],
      "first_author": "Hunter Lightman",
      "first_author_affiliation": "OpenAI",
      "published": "2023-05-31",
      "code": "https://github.com/openai/prm800k",
      "adapter": "process-supervision"
    },
    {
      "domain": "post-training",
      "key": "pto",
      "title": "Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations",
      "paper_url": "https://arxiv.org/abs/2608.12062",
      "detail_path": "post-training/2608.12062-pto/README.md",
      "topic": [
        "前瞻偏好树"
      ],
      "first_author": "Lior Baruch",
      "first_author_affiliation": "Reichman University",
      "published": "2026-08-12",
      "code": null,
      "adapter": "pto"
    },
    {
      "domain": "post-training",
      "key": "r2-opd",
      "title": "Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress",
      "paper_url": "https://arxiv.org/abs/2608.19408",
      "detail_path": "post-training/2608.19408-r2-opd/README.md",
      "topic": [
        "OPD",
        "过程蒸馏"
      ],
      "first_author": "Chen Yang",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-08-19",
      "code": null,
      "adapter": "r2-opd"
    },
    {
      "domain": "post-training",
      "key": "raft",
      "title": "RAFT",
      "paper_url": "https://arxiv.org/abs/2304.06767",
      "detail_path": "post-training/2304.06767-raft/README.md",
      "topic": [
        "Reward 选优微调"
      ],
      "first_author": "Hanze Dong",
      "first_author_affiliation": "HKUST",
      "published": "2023-04-13",
      "code": "https://github.com/OptimalScale/LMFlow",
      "adapter": "raft"
    },
    {
      "domain": "post-training",
      "key": "rail",
      "title": "Optimizing What Policies Learn From: Recoverability-Aware Rollout Intervention Learning",
      "paper_url": "https://arxiv.org/abs/2608.05080",
      "detail_path": "post-training/2608.05080-rail/README.md",
      "topic": [
        "rollout 预算分配"
      ],
      "first_author": "Zheyuan Zhang",
      "first_author_affiliation": "University of Notre Dame / Amazon",
      "published": "2026-08-05",
      "code": null,
      "adapter": "rail"
    },
    {
      "domain": "post-training",
      "key": "reco-grpo",
      "title": "ReCo",
      "paper_url": "https://arxiv.org/abs/2607.26862",
      "detail_path": "post-training/2607.26862-reco/README.md",
      "topic": [
        "分布保持 RL"
      ],
      "first_author": "Junoh Park",
      "first_author_affiliation": "Seoul National University",
      "published": "2026-07-29",
      "code": "未发现官方代码",
      "adapter": "reco-grpo"
    },
    {
      "domain": "post-training",
      "key": "reinforce-plus",
      "title": "REINFORCE++",
      "paper_url": "https://arxiv.org/abs/2501.03262",
      "detail_path": "post-training/2501.03262-reinforce-plus/README.md",
      "topic": [
        "全局优势估计"
      ],
      "first_author": "Jian Hu",
      "first_author_affiliation": "Independent researchers",
      "published": "2025-01-04",
      "code": "未发现官方代码",
      "adapter": "reinforce-plus"
    },
    {
      "domain": "post-training",
      "key": "relay-opd",
      "title": "Relay-OPD",
      "paper_url": "https://arxiv.org/abs/2607.26057",
      "detail_path": "post-training/2607.26057-relay-opd/README.md",
      "topic": [
        "On-policy distillation"
      ],
      "first_author": "Haolei Xu",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-07-28",
      "code": "https://github.com/ZJU-REAL/Relay-OPD",
      "adapter": "relay-opd"
    },
    {
      "domain": "post-training",
      "key": "remax",
      "title": "ReMax",
      "paper_url": "https://arxiv.org/abs/2310.10505",
      "detail_path": "post-training/2310.10505-remax/README.md",
      "topic": [
        "经典 RLHF"
      ],
      "first_author": "Ziniu Li",
      "first_author_affiliation": "香港中文大学（深圳）/ 深圳市大数据研究院",
      "published": "2023-10-16",
      "code": "https://github.com/liziniu/ReMax",
      "adapter": "remax"
    },
    {
      "domain": "post-training",
      "key": "retire-opd",
      "title": "RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2609.20784",
      "detail_path": "post-training/2609.20784-retire-opd/README.md",
      "topic": [
        "On-policy distillation",
        "Agent RL"
      ],
      "first_author": "ZJU-REAL team",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-09-17",
      "code": "https://github.com/ZJU-REAL/SDAR",
      "adapter": "retire-opd",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "ripo",
      "title": "RIPO",
      "paper_url": "https://arxiv.org/abs/2607.10169",
      "detail_path": "post-training/2607.10169-ripo/README.md",
      "topic": [
        "几何信任域"
      ],
      "first_author": "Zhicheng Cai",
      "first_author_affiliation": "Tsinghua University",
      "published": "2026-07-11",
      "code": "未发现官方代码",
      "adapter": "ripo"
    },
    {
      "domain": "post-training",
      "key": "rlaif",
      "title": "RLAIF",
      "paper_url": "https://arxiv.org/abs/2309.00267",
      "detail_path": "post-training/2309.00267-rlaif/README.md",
      "topic": [
        "AI 反馈"
      ],
      "first_author": "Harrison Lee",
      "first_author_affiliation": "Google Research",
      "published": "2023-09-01",
      "code": "未发现官方代码",
      "adapter": "rlaif"
    },
    {
      "domain": "post-training",
      "key": "rlcr",
      "title": "Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty",
      "paper_url": "https://arxiv.org/abs/2507.16806",
      "detail_path": "post-training/2507.16806-rlcr/README.md",
      "topic": [
        "校准奖励",
        "Proper scoring rule"
      ],
      "first_author": "Mehul Damani",
      "first_author_affiliation": "Massachusetts Institute of Technology",
      "published": "2025-07-22",
      "code": "https://github.com/damanimehul/RLCR",
      "adapter": "system-one:rival-brier",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "rloo",
      "title": "RLOO",
      "paper_url": "https://arxiv.org/abs/2402.14740",
      "detail_path": "post-training/2402.14740-rloo/README.md",
      "topic": [
        "经典 RLHF"
      ],
      "first_author": "Arash Ahmadian",
      "first_author_affiliation": "Cohere For AI",
      "published": "2024-02-22",
      "code": "未发现官方代码",
      "adapter": "rloo"
    },
    {
      "domain": "post-training",
      "key": "rlvr-fusion",
      "title": "Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms",
      "paper_url": "https://arxiv.org/abs/2608.27409",
      "detail_path": "post-training/2608.27409-rlvr-fusion/README.md",
      "topic": [
        "跨领域 RLVR 能力融合"
      ],
      "first_author": "Siye Wu",
      "first_author_affiliation": "Fudan University",
      "published": "2026-08-27",
      "code": "https://github.com/Di-viner/LLM-Fusion",
      "adapter": "rlvr-fusion"
    },
    {
      "domain": "post-training",
      "key": "route-opd",
      "title": "Distillation as Probability Transport: Routed On-Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.08337",
      "detail_path": "post-training/2609.08337-route-opd/README.md",
      "topic": [
        "概率传输 OPD"
      ],
      "first_author": "Tianle Xia",
      "first_author_affiliation": "Tencent",
      "published": "2026-09-08",
      "code": null,
      "adapter": "route-opd"
    },
    {
      "domain": "post-training",
      "key": "rp-opsd",
      "title": "RP-OPSD",
      "paper_url": "https://arxiv.org/abs/2608.06347",
      "detail_path": "post-training/2608.06347-rp-opsd/README.md",
      "topic": [
        "推理枢纽蒸馏"
      ],
      "first_author": "Xinye Wang",
      "first_author_affiliation": "Nanjing University",
      "published": "2026-08-06",
      "code": "https://github.com/NJUNLP/RP-OPSD",
      "adapter": "rp-opsd"
    },
    {
      "domain": "post-training",
      "key": "rrc",
      "title": "RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction",
      "paper_url": "https://arxiv.org/abs/2608.06310",
      "detail_path": "post-training/2608.06310-rrc/README.md",
      "topic": [
        "生成式奖励模型"
      ],
      "first_author": "Chenglong Wang",
      "first_author_affiliation": "Northeastern University",
      "published": "2026-08-06",
      "code": "https://github.com/wangclnlp/RRC",
      "adapter": "rrc"
    },
    {
      "domain": "post-training",
      "key": "rrhf",
      "title": "RRHF",
      "paper_url": "https://arxiv.org/abs/2304.05302",
      "detail_path": "post-training/2304.05302-rrhf/README.md",
      "topic": [
        "全排序偏好"
      ],
      "first_author": "Zheng Yuan",
      "first_author_affiliation": "Alibaba DAMO Academy",
      "published": "2023-04-11",
      "code": "https://github.com/GanjinZero/RRHF",
      "adapter": "rrhf"
    },
    {
      "domain": "post-training",
      "key": "rstg",
      "title": "Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance",
      "paper_url": "https://arxiv.org/abs/2608.00782",
      "detail_path": "post-training/2608.00782-rstg/README.md",
      "topic": [
        "OPD",
        "RLVR"
      ],
      "first_author": "Zhuowen Han",
      "first_author_affiliation": "Tianjin University",
      "published": "2026-08-01",
      "code": null,
      "adapter": "rstg"
    },
    {
      "domain": "post-training",
      "key": "rubric-dropout",
      "title": "Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL",
      "paper_url": "https://arxiv.org/abs/2608.11669",
      "detail_path": "post-training/2608.11669-rubric-dropout/README.md",
      "topic": [
        "Rubric RL",
        "reward hacking"
      ],
      "first_author": "Minglai Yang",
      "first_author_affiliation": "Scale AI",
      "published": "2026-08-12",
      "code": null,
      "adapter": "rubric-dropout"
    },
    {
      "domain": "post-training",
      "key": "sa-mrpo",
      "title": "Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization",
      "paper_url": "https://arxiv.org/abs/2608.16072",
      "detail_path": "post-training/2608.16072-sa-mrpo/README.md",
      "topic": [
        "多奖励 RL",
        "稳定性"
      ],
      "first_author": "Yixuan Wang",
      "first_author_affiliation": "University of Florida",
      "published": "2026-08-17",
      "code": null,
      "adapter": "sa-mrpo"
    },
    {
      "domain": "post-training",
      "key": "sd-dpo",
      "title": "Style-Debiased DPO: Updating LLM Knowledge with Factuality-Aware Synthetic Preference Data",
      "paper_url": "https://arxiv.org/abs/2609.16532",
      "detail_path": "post-training/2609.16532-sd-dpo/README.md",
      "topic": [
        "偏好优化",
        "知识更新"
      ],
      "first_author": "Takayuki Yamamoto",
      "first_author_affiliation": "Waseda University",
      "published": "2026-09-15",
      "code": null,
      "adapter": "sd-dpo",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "self-rewarding",
      "title": "Self-Rewarding LM",
      "paper_url": "https://arxiv.org/abs/2401.10020",
      "detail_path": "post-training/2401.10020-self-rewarding/README.md",
      "topic": [
        "自奖励"
      ],
      "first_author": "Weizhe Yuan",
      "first_author_affiliation": "Meta AI",
      "published": "2024-01-18",
      "code": "未发现官方代码",
      "adapter": "self-rewarding"
    },
    {
      "domain": "post-training",
      "key": "serpo",
      "title": "SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2607.26873",
      "detail_path": "post-training/2607.26873-serpo/README.md",
      "topic": [
        "Rubric RL",
        "测试时自进化"
      ],
      "first_author": "Jianze Wang",
      "first_author_affiliation": "Authors did not disclose affiliation",
      "published": "2026-07-29",
      "code": null,
      "adapter": "serpo"
    },
    {
      "domain": "post-training",
      "key": "simpo",
      "title": "SimPO",
      "paper_url": "https://arxiv.org/abs/2405.14734",
      "detail_path": "post-training/2405.14734-simpo/README.md",
      "topic": [
        "Reference-free 偏好"
      ],
      "first_author": "Yu Meng",
      "first_author_affiliation": "Princeton University",
      "published": "2024-05-23",
      "code": "https://github.com/princeton-nlp/SimPO",
      "adapter": "simpo"
    },
    {
      "domain": "post-training",
      "key": "sis",
      "title": "Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment",
      "paper_url": "https://arxiv.org/abs/2607.04728",
      "detail_path": "reproductions/2607.04728-sis/README.md",
      "topic": [
        "post-training",
        "off-policy-correction",
        "importance-sampling"
      ],
      "first_author": "Yu Li",
      "first_author_affiliation": "Renmin University of China",
      "published": "2026-07-06",
      "code": null,
      "adapter": {
        "adapter_key": "sis",
        "arxiv_id": "2607.04728",
        "title": "Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment",
        "paper_url": "https://arxiv.org/abs/2607.04728",
        "track": "llm",
        "organization": "Paper author team",
        "published": "2026-07-06",
        "code_url": null,
        "topics": [
          "post-training",
          "off-policy-correction",
          "importance-sampling"
        ],
        "local_code_dir": "src/auto_research/reproductions/sis",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Tiny Shakespeare"
        ],
        "baseline": "标准 token-level Importance Sampling",
        "metrics": [
          "sis.reported_objective"
        ],
        "default_seeds": [
          41,
          42,
          43
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "post-training",
      "key": "slic-hf",
      "title": "SLiC-HF",
      "paper_url": "https://arxiv.org/abs/2305.10425",
      "detail_path": "post-training/2305.10425-slic-hf/README.md",
      "topic": [
        "序列概率校准"
      ],
      "first_author": "Yao Zhao",
      "first_author_affiliation": "Google DeepMind",
      "published": "2023-05-17",
      "code": "未发现官方代码",
      "adapter": "slic-hf"
    },
    {
      "domain": "post-training",
      "key": "smopd",
      "title": "SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2608.03092",
      "detail_path": "post-training/2608.03092-smopd/README.md",
      "topic": [
        "OPD",
        "多奖励 RL"
      ],
      "first_author": "Wen Wang",
      "first_author_affiliation": "Alibaba / Qwen",
      "published": "2026-08-04",
      "code": null,
      "adapter": "smopd"
    },
    {
      "domain": "post-training",
      "key": "sparse-opd",
      "title": "Extremely Sparse Supervision Incentivizes Reasoning Ability",
      "paper_url": "https://arxiv.org/abs/2609.04565",
      "detail_path": "post-training/2609.04565-sparse-opd/README.md",
      "topic": [
        "极稀疏 On-policy distillation"
      ],
      "first_author": "Zhishuai Liu",
      "first_author_affiliation": "Amazon / Duke University",
      "published": "2026-09-03",
      "code": null,
      "adapter": "sparse-opd"
    },
    {
      "domain": "post-training",
      "key": "spear",
      "title": "SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.26550",
      "detail_path": "post-training/2608.26550-spear/README.md",
      "topic": [
        "过程奖励"
      ],
      "first_author": "Zhuochun Li",
      "first_author_affiliation": "University of Pittsburgh",
      "published": "2026-08-27",
      "code": "https://github.com/zhuochunli/SPEAR",
      "adapter": "spear"
    },
    {
      "domain": "post-training",
      "key": "specroll",
      "title": "SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts",
      "paper_url": "https://arxiv.org/abs/2608.04962",
      "detail_path": "post-training/2608.04962-specroll/README.md",
      "topic": [
        "RL rollout 加速"
      ],
      "first_author": "Nhat Minh Pham",
      "first_author_affiliation": "VNU University of Engineering and Technology / Viettel AI",
      "published": "2026-08-05",
      "code": "https://anonymous.4open.science/r/SpecRoll-26062006",
      "adapter": "specroll"
    },
    {
      "domain": "post-training",
      "key": "spin",
      "title": "SPIN",
      "paper_url": "https://arxiv.org/abs/2401.01335",
      "detail_path": "post-training/2401.01335-spin/README.md",
      "topic": [
        "自博弈微调"
      ],
      "first_author": "Zixiang Chen",
      "first_author_affiliation": "University of California, Los Angeles",
      "published": "2024-01-02",
      "code": "https://github.com/uclaml/SPIN",
      "adapter": "spin"
    },
    {
      "domain": "post-training",
      "key": "spiral",
      "title": "SPIRAL",
      "paper_url": "https://arxiv.org/abs/2506.24119",
      "detail_path": "post-training/2506.24119-spiral/README.md",
      "topic": [
        "自博弈课程"
      ],
      "first_author": "Bo Liu",
      "first_author_affiliation": "Apple",
      "published": "2025-06-30",
      "code": "https://github.com/spiral-rl/spiral",
      "adapter": "spiral"
    },
    {
      "domain": "post-training",
      "key": "sr-opsd",
      "title": "SR-OPSD: Self-Referenced On-Policy Self-Distillation",
      "paper_url": "https://arxiv.org/abs/2608.09745",
      "detail_path": "post-training/2608.09745-sr-opsd/README.md",
      "topic": [
        "OPD",
        "自蒸馏"
      ],
      "first_author": "Zhuo Sun",
      "first_author_affiliation": "Independent Researcher",
      "published": "2026-08-10",
      "code": null,
      "adapter": "sr-opsd"
    },
    {
      "domain": "post-training",
      "key": "srpo",
      "title": "SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.23493",
      "detail_path": "post-training/2608.23493-srpo/README.md",
      "topic": [
        "反思式 token 信用"
      ],
      "first_author": "Jialong Liu",
      "first_author_affiliation": "Wuhan University",
      "published": "2026-08-24",
      "code": "https://github.com/Galleons2029/SRPO",
      "adapter": "srpo"
    },
    {
      "domain": "post-training",
      "key": "stare",
      "title": "STARE",
      "paper_url": "https://arxiv.org/abs/2606.19236",
      "detail_path": "post-training/2606.19236-stare/README.md",
      "topic": [
        "Entropy 稳定"
      ],
      "first_author": "Haipeng Luo",
      "first_author_affiliation": "Tsinghua University",
      "published": "2026-06-17",
      "code": "https://github.com/hp-luo/STARE",
      "adapter": "stare"
    },
    {
      "domain": "post-training",
      "key": "steerlm",
      "title": "SteerLM",
      "paper_url": "https://arxiv.org/abs/2310.05344",
      "detail_path": "post-training/2310.05344-steerlm/README.md",
      "topic": [
        "多属性可控 SFT"
      ],
      "first_author": "Yi Dong",
      "first_author_affiliation": "NVIDIA",
      "published": "2023-10-09",
      "code": "https://github.com/NVIDIA/NeMo-Aligner",
      "adapter": "steerlm"
    },
    {
      "domain": "post-training",
      "key": "stride-opd",
      "title": "Know When to Stop, Where to Restart: Accelerating Multi-Turn Agentic On-Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.14636",
      "detail_path": "post-training/2609.14636-stride-opd/README.md",
      "topic": [
        "On-policy distillation",
        "多轮加速"
      ],
      "first_author": "Zhiyu Gui",
      "first_author_affiliation": "University of Science and Technology of China / Ant Group",
      "published": "2026-09-13",
      "code": null,
      "adapter": "stride-opd",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "taco",
      "title": "TACO",
      "paper_url": "https://arxiv.org/abs/2607.07976",
      "detail_path": "post-training/2607.07976-taco/README.md",
      "topic": [
        "Token 信用校准"
      ],
      "first_author": "Xiuyi Lou",
      "first_author_affiliation": "Johns Hopkins University",
      "published": "2026-07-08",
      "code": "https://github.com/xiuyilou/TACO",
      "adapter": "taco"
    },
    {
      "domain": "post-training",
      "key": "tasco",
      "title": "Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning",
      "paper_url": "https://arxiv.org/abs/2609.11393",
      "detail_path": "post-training/2609.11393-tasco/README.md",
      "topic": [
        "测试时适配",
        "稳定性优化"
      ],
      "first_author": "Bincheng Gu",
      "first_author_affiliation": "Chongqing University",
      "published": "2026-09-10",
      "code": null,
      "adapter": "tasco",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "tcr",
      "title": "TCR",
      "paper_url": "https://arxiv.org/abs/2607.19824",
      "detail_path": "post-training/2607.19824-tcr/README.md",
      "topic": [
        "过程奖励"
      ],
      "first_author": "Xubo Liu",
      "first_author_affiliation": "论文未列机构",
      "published": "2026-07-22",
      "code": "未发现官方代码",
      "adapter": "tcr"
    },
    {
      "domain": "post-training",
      "key": "tiao",
      "title": "TIAO: Token Importance-Aware Policy Optimization for Text Summarization",
      "paper_url": "https://arxiv.org/abs/2609.16748",
      "detail_path": "post-training/2609.16748-tiao/README.md",
      "topic": [
        "强化学习",
        "Token 信用分配"
      ],
      "first_author": "Qixiu Li",
      "first_author_affiliation": "National University of Defense Technology",
      "published": "2026-09-15",
      "code": "https://github.com/TechCloud-x/TIAO",
      "adapter": "tiao",
      "priority": "P0",
      "requires_gpu_validation": true,
      "gpu_validation_artifact": "docs/gpu-validations/tiao-a100-20260916.json"
    },
    {
      "domain": "post-training",
      "key": "tis",
      "title": "TIS",
      "paper_url": "web-2025-tis/README.md",
      "detail_path": "post-training/web-2025-tis/README.md",
      "topic": [
        "训推失配校正"
      ],
      "first_author": "Feng Yao",
      "first_author_affiliation": "University of California, San Diego",
      "published": "2025-08-05",
      "code": "未发现官方代码",
      "adapter": "tis"
    },
    {
      "domain": "post-training",
      "key": "tlm-dre",
      "title": "Turn-level Multiscale Density Ratio Estimation for LLM Agents",
      "paper_url": "https://arxiv.org/abs/2609.16760",
      "detail_path": "post-training/2609.16760-tlm-dre/README.md",
      "topic": [
        "多轮 Agent 对齐",
        "密度比估计"
      ],
      "first_author": "Zishuo Zhao",
      "first_author_affiliation": "Alibaba Group",
      "published": "2026-09-15",
      "code": null,
      "adapter": "tlm-dre",
      "priority": "P0"
    },
    {
      "domain": "post-training",
      "key": "trajectory-learnability",
      "title": "Trajectory Learnability for Offline On-Policy Distillation",
      "paper_url": "https://arxiv.org/abs/2609.18321",
      "detail_path": "post-training/2609.18321-trajectory-learnability/README.md",
      "topic": [
        "On-policy distillation",
        "轨迹加权"
      ],
      "first_author": "Yihao Ai",
      "first_author_affiliation": "National University of Singapore",
      "published": "2026-09-16",
      "code": null,
      "adapter": "trajectory-learnability",
      "priority": "P1"
    },
    {
      "domain": "post-training",
      "key": "ttpo",
      "title": "TTPO: Test-Time Policy Optimization",
      "paper_url": "https://arxiv.org/abs/2608.27448",
      "detail_path": "post-training/2608.27448-ttpo/README.md",
      "topic": [
        "测试时强化学习"
      ],
      "first_author": "Aozhe Wang",
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-08-27",
      "code": "https://github.com/ZJU-REAL/TTPO",
      "adapter": "ttpo"
    },
    {
      "domain": "post-training",
      "key": "ttrl",
      "title": "TTRL",
      "paper_url": "https://arxiv.org/abs/2504.16084",
      "detail_path": "post-training/2504.16084-ttrl/README.md",
      "topic": [
        "测试时强化学习"
      ],
      "first_author": "Yuxin Zuo",
      "first_author_affiliation": "PRIME-RL author team",
      "published": "2025-04-22",
      "code": "https://github.com/PRIME-RL/TTRL",
      "adapter": "ttrl"
    },
    {
      "domain": "post-training",
      "key": "u-opsd",
      "title": "U-OPSD",
      "paper_url": "https://arxiv.org/abs/2608.06296",
      "detail_path": "post-training/2608.06296-u-opsd/README.md",
      "topic": [
        "无监督自蒸馏"
      ],
      "first_author": "Yijiang Li",
      "first_author_affiliation": "University of California, San Diego",
      "published": "2026-08-06",
      "code": "未发现官方代码",
      "adapter": "u-opsd"
    },
    {
      "domain": "post-training",
      "key": "uc-mopd",
      "title": "Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPD",
      "paper_url": "https://arxiv.org/abs/2608.26735",
      "detail_path": "post-training/2608.26735-uc-mopd/README.md",
      "topic": [
        "多教师能力整合"
      ],
      "first_author": "Ziyuan Liu",
      "first_author_affiliation": "Peking University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "uc-mopd"
    },
    {
      "domain": "post-training",
      "key": "v-rubrics",
      "title": "V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning",
      "paper_url": "https://arxiv.org/abs/2608.25580",
      "detail_path": "post-training/2608.25580-v-rubrics/README.md",
      "topic": [
        "多模态 rubric RL"
      ],
      "first_author": "Shulin Tian",
      "first_author_affiliation": "S-Lab, Nanyang Technological University",
      "published": "2026-08-26",
      "code": "https://shulin16.github.io/v-rubrics/",
      "adapter": "v-rubrics"
    },
    {
      "domain": "post-training",
      "key": "vad",
      "title": "VAD",
      "paper_url": "https://arxiv.org/abs/2607.28590",
      "detail_path": "post-training/2607.28590-vad/README.md",
      "topic": [
        "多模态证据归因蒸馏"
      ],
      "first_author": "Kangning Zhang",
      "first_author_affiliation": "Shanghai Jiao Tong University",
      "published": "2026-07-30",
      "code": "https://github.com/DeepExperience/VAD_Multimodal_OPD",
      "adapter": "vad"
    },
    {
      "domain": "post-training",
      "key": "vapo",
      "title": "VAPO",
      "paper_url": "https://arxiv.org/abs/2504.05118",
      "detail_path": "post-training/2504.05118-vapo/README.md",
      "topic": [
        "Critic PPO"
      ],
      "first_author": "Yu Yue",
      "first_author_affiliation": "ByteDance Seed",
      "published": "2025-04-07",
      "code": "未发现官方代码",
      "adapter": "vapo"
    },
    {
      "domain": "post-training",
      "key": "video-opsd",
      "title": "Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models",
      "paper_url": "https://arxiv.org/abs/2608.27065",
      "detail_path": "post-training/2608.27065-video-opsd/README.md",
      "topic": [
        "证据帧特权自蒸馏"
      ],
      "first_author": "Ziyue Wang",
      "first_author_affiliation": "Nanyang Technological University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "video-opsd"
    },
    {
      "domain": "post-training",
      "key": "weak-guide-rlvr",
      "title": "Boosting LLM Exploration via Weak-Model Guidance in RLVR",
      "paper_url": "https://arxiv.org/abs/2608.27420",
      "detail_path": "post-training/2608.27420-weak-guide-rlvr/README.md",
      "topic": [
        "弱模型前缀探索"
      ],
      "first_author": "Xingyu Shen",
      "first_author_affiliation": "Peking University",
      "published": "2026-08-27",
      "code": null,
      "adapter": "weak-guide-rlvr"
    },
    {
      "domain": "recommendation",
      "key": "adaf2m2",
      "title": "AdaF²M²: Comprehensive Learning and Responsive Leveraging Features in Recommendation System",
      "paper_url": "https://arxiv.org/abs/2501.15816",
      "detail_path": "reproductions/2501.15816-adaf2m2/README.md",
      "topic": [
        "ranking",
        "feature-masking",
        "state-aware-adapter",
        "multi-forward"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin",
      "published": "2025-01-27",
      "code": null,
      "adapter": {
        "adapter_key": "adaf2m2",
        "arxiv_id": "2501.15816",
        "title": "AdaF²M²: Comprehensive Learning and Responsive Leveraging Features in Recommendation System",
        "paper_url": "https://arxiv.org/abs/2501.15816",
        "track": "recommendation",
        "organization": "ByteDance / Douyin",
        "published": "2025-01-27",
        "code_url": null,
        "topics": [
          "ranking",
          "feature-masking",
          "state-aware-adapter",
          "multi-forward"
        ],
        "local_code_dir": "src/auto_research/reproductions/adaf2m2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "single-forward full-feature ranker",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin",
            "metric": "cumulative active days",
            "lift_percent": 1.37,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2501.15816",
            "source_location": "original paper online-result disclosure: product=Douyin; metric=cumulative active days"
          },
          {
            "product": "Douyin",
            "metric": "app duration",
            "lift_percent": 1.89,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2501.15816",
            "source_location": "original paper online-result disclosure: product=Douyin; metric=app duration"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "adaptive-ad-load",
      "title": "Adaptive Ad Load Design for Sponsored Search Markets: Evidence, Theory, and Deployment",
      "paper_url": "https://arxiv.org/abs/2607.14418",
      "detail_path": "reproductions/2607.14418-adaptive-ad-load/README.md",
      "topic": [
        "advertising",
        "constrained-optimization",
        "marketplace"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Washington",
      "published": "2026-07-15",
      "code": null,
      "adapter": {
        "adapter_key": "adaptive-ad-load",
        "arxiv_id": "2607.14418",
        "title": "Adaptive Ad Load Design for Sponsored Search Markets: Evidence, Theory, and Deployment",
        "paper_url": "https://arxiv.org/abs/2607.14418",
        "track": "recommendation",
        "organization": "University of Washington",
        "published": "2026-07-15",
        "code_url": null,
        "topics": [
          "advertising",
          "constrained-optimization",
          "marketplace"
        ],
        "local_code_dir": "src/auto_research/reproductions/adaptive_ad_load",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Android app-store sponsored search",
            "metric": "revenue",
            "lift_percent": 36.8,
            "traffic": "66-day randomized field experiment",
            "source_url": "https://arxiv.org/html/2607.14418v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "adasid",
      "title": "Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale",
      "paper_url": "https://arxiv.org/abs/2604.23522",
      "detail_path": "reproductions/2604.23522-adasid/README.md",
      "topic": [
        "semantic-id",
        "multimodal-recommendation",
        "retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Electronic Science and Technology of China / Kuaishou",
      "published": "2026-04-26",
      "code": null,
      "adapter": {
        "adapter_key": "adasid",
        "arxiv_id": "2604.23522",
        "title": "Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale",
        "paper_url": "https://arxiv.org/abs/2604.23522",
        "track": "recommendation",
        "organization": "University of Electronic Science and Technology of China / Kuaishou",
        "published": "2026-04-26",
        "code_url": null,
        "topics": [
          "semantic-id",
          "multimodal-recommendation",
          "retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/adasid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou e-commerce",
            "metric": "GPM",
            "lift_percent": 1.16,
            "traffic": "tens of millions of users, four days",
            "source_url": "https://arxiv.org/html/2604.23522v1",
            "source_location": "Section 5.3 / Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "agentic-rec-tune",
      "title": "AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization",
      "paper_url": "https://arxiv.org/abs/2604.26969",
      "detail_path": "reproductions/2604.26969-agentic-rec-tune/README.md",
      "topic": [
        "agent",
        "auto-research",
        "retrieval",
        "ranking",
        "reranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Google / Discover",
      "published": "2026-04-21",
      "code": null,
      "adapter": {
        "adapter_key": "agentic-rec-tune",
        "arxiv_id": "2604.26969",
        "title": "AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization",
        "paper_url": "https://arxiv.org/abs/2604.26969",
        "track": "recommendation",
        "organization": "Google / Discover",
        "published": "2026-04-21",
        "code_url": null,
        "topics": [
          "agent",
          "auto-research",
          "retrieval",
          "ranking",
          "reranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/agentic_rec_tune",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "固定手调排序配方，实验组运行三轮 Actor–Critic–SkillHub",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Google Discover value retrieval",
            "metric": "Engagement 2",
            "lift_percent": 0.9,
            "traffic": "live-traffic A/B",
            "source_url": "https://arxiv.org/html/2604.26969v2#S5",
            "source_location": "Section 5 Table 1",
            "significance": "p<0.05",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "Google Discover diversity reranking",
            "metric": "Diversity",
            "lift_percent": 3.43,
            "traffic": "live-traffic A/B",
            "source_url": "https://arxiv.org/html/2604.26969v2#S5",
            "source_location": "Section 5 Table 1",
            "significance": "p<0.05",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "aigq",
      "title": "AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation",
      "paper_url": "https://arxiv.org/abs/2603.19710",
      "detail_path": "reproductions/2603.19710-aigq/README.md",
      "topic": [
        "query-recommendation",
        "generative-recommendation",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group / Alibaba",
      "published": "2026-03-20",
      "code": null,
      "adapter": {
        "adapter_key": "aigq",
        "arxiv_id": "2603.19710",
        "title": "AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation",
        "paper_url": "https://arxiv.org/abs/2603.19710",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group / Alibaba",
        "published": "2026-03-20",
        "code_url": null,
        "topics": [
          "query-recommendation",
          "generative-recommendation",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/aigq",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao HintQ",
            "metric": "GMV",
            "lift_percent": 10.68,
            "traffic": "thirty-day A/B",
            "source_url": "https://arxiv.org/html/2603.19710v1",
            "source_location": "Section 5.4",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "airbnb-ebr",
      "title": "Applying Embedding-Based Retrieval to Airbnb Search",
      "paper_url": "https://arxiv.org/abs/2601.06873",
      "detail_path": "reproductions/2601.06873-airbnb-ebr/README.md",
      "topic": [
        "search-retrieval",
        "embedding-retrieval",
        "hard-negative-mining"
      ],
      "first_author": null,
      "first_author_affiliation": "Airbnb",
      "published": "2026-01-11",
      "code": null,
      "adapter": {
        "adapter_key": "airbnb-ebr",
        "arxiv_id": "2601.06873",
        "title": "Applying Embedding-Based Retrieval to Airbnb Search",
        "paper_url": "https://arxiv.org/abs/2601.06873",
        "track": "recommendation",
        "organization": "Airbnb",
        "published": "2026-01-11",
        "code_url": null,
        "topics": [
          "search-retrieval",
          "embedding-retrieval",
          "hard-negative-mining"
        ],
        "local_code_dir": "src/auto_research/reproductions/airbnb_ebr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Airbnb search",
            "metric": "Booking conversion",
            "lift_percent": 0.31,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.06873v1",
            "source_location": "Section 6.3",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:journey-retrieval"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "akt-rec",
      "title": "From Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs",
      "paper_url": "https://arxiv.org/abs/2605.23310",
      "detail_path": "reproductions/2605.23310-akt-rec/README.md",
      "topic": [
        "llm-recommendation",
        "semantic-id",
        "long-tail",
        "ctr-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Peking University",
      "published": "2026-05-22",
      "code": null,
      "adapter": {
        "adapter_key": "akt-rec",
        "arxiv_id": "2605.23310",
        "title": "From Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs",
        "paper_url": "https://arxiv.org/abs/2605.23310",
        "track": "recommendation",
        "organization": "Alibaba Group / Peking University",
        "published": "2026-05-22",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "semantic-id",
          "long-tail",
          "ctr-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/akt_rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K sampled CTR"
        ],
        "baseline": "只使用 individual embedding 和实例级 target attention 的 onlinebase",
        "metrics": [
          "relative_akt_rec_vs_online_base_percent.auc",
          "relative_akt_rec_vs_online_base_percent.gauc",
          "relative_akt_rec_vs_online_base_percent.tail_auc",
          "setup.ctr_steps_per_variant_seed",
          "test.akt_rec.auc",
          "test.akt_rec.auc_std",
          "test.akt_rec.gauc",
          "test.akt_rec.gauc_std",
          "test.akt_rec.tail_auc",
          "test.akt_rec.tail_auc_std",
          "test.online_base.auc",
          "test.online_base.auc_std",
          "test.online_base.gauc",
          "test.online_base.gauc_std",
          "test.online_base.tail_auc",
          "test.online_base.tail_auc_std",
          "validation.akt_rec.auc",
          "validation.akt_rec.gauc",
          "validation.akt_rec.tail_auc",
          "validation.online_base.auc",
          "validation.online_base.gauc",
          "validation.online_base.tail_auc"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=400",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tmall",
            "metric": "CTR",
            "lift_percent": 2.76,
            "traffic": "10% control / 10% treatment, two weeks",
            "source_url": "https://arxiv.org/abs/2605.23310",
            "source_location": "original paper online-result disclosure: product=Tmall; metric=CTR"
          },
          {
            "product": "Tmall",
            "metric": "GMV",
            "lift_percent": 3.47,
            "traffic": "10% control / 10% treatment, two weeks",
            "source_url": "https://arxiv.org/abs/2605.23310",
            "source_location": "original paper online-result disclosure: product=Tmall; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "allecompanion",
      "title": "Beyond Co-purchase Relation: Evolution of Complementary Recommendations at Allegro",
      "paper_url": "https://arxiv.org/abs/2609.05063",
      "detail_path": "reproductions/2609.05063-allecompanion/README.md",
      "topic": [
        "complementary-recommendation",
        "two-tower",
        "category-adapter",
        "e-commerce"
      ],
      "first_author": null,
      "first_author_affiliation": "Allegro.com",
      "published": "2026-09-04",
      "code": null,
      "adapter": {
        "adapter_key": "allecompanion",
        "arxiv_id": "2609.05063",
        "title": "Beyond Co-purchase Relation: Evolution of Complementary Recommendations at Allegro",
        "paper_url": "https://arxiv.org/abs/2609.05063",
        "track": "recommendation",
        "organization": "Allegro.com",
        "published": "2026-09-04",
        "code_url": null,
        "topics": [
          "complementary-recommendation",
          "two-tower",
          "category-adapter",
          "e-commerce"
        ],
        "local_code_dir": "src/auto_research/reproductions/allecompanion",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "shared two-tower without category adapter",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; 80 CPU updates; validation-only candidate selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Allegro product and cart placements",
            "metric": "attributed GMV",
            "lift_percent": 21.25,
            "traffic": "two-week tests routed over 100% platform traffic",
            "source_url": "https://arxiv.org/html/2609.05063",
            "source_location": "Section 4.4, Table 5",
            "experiment_duration": "two weeks",
            "retrieved_at": "2026-09-07"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:complementary-category-adapter"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "angle",
      "title": "One-Step Retrieval Framework for Real-Time Sponsored Search Ads Using Hierarchical Text Representations",
      "paper_url": "https://arxiv.org/abs/2609.18296",
      "detail_path": "reproductions/2609.18296-angle/README.md",
      "topic": [
        "sponsored-search",
        "generative-retrieval",
        "hierarchical-identifiers"
      ],
      "first_author": "Jinrui Zhang",
      "first_author_affiliation": "Tencent",
      "published": "2026-09-16",
      "code": null,
      "adapter": {
        "adapter_key": "angle",
        "arxiv_id": "2609.18296",
        "title": "One-Step Retrieval Framework for Real-Time Sponsored Search Ads Using Hierarchical Text Representations",
        "paper_url": "https://arxiv.org/abs/2609.18296",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-09-16",
        "code_url": null,
        "topics": [
          "sponsored-search",
          "generative-retrieval",
          "hierarchical-identifiers"
        ],
        "local_code_dir": "src/auto_research/reproductions/angle",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Weixin Top Stories sponsored search",
            "metric": "consumption",
            "lift_percent": 1.81,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.18296v1",
            "source_location": "online experiment table",
            "retrieved_at": "2026-09-19"
          },
          {
            "product": "Weixin Top Stories sponsored search",
            "metric": "GMV",
            "lift_percent": 2.16,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.18296v1",
            "source_location": "online experiment table",
            "retrieved_at": "2026-09-19"
          },
          {
            "product": "Weixin Top Stories sponsored search",
            "metric": "clicks",
            "lift_percent": 1.5,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.18296v1",
            "source_location": "online experiment table",
            "retrieved_at": "2026-09-19"
          },
          {
            "product": "Weixin Top Stories sponsored search",
            "metric": "conversions",
            "lift_percent": 1.44,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.18296v1",
            "source_location": "online experiment table",
            "retrieved_at": "2026-09-19"
          },
          {
            "product": "Weixin Top Stories sponsored search",
            "metric": "exposure",
            "lift_percent": 2.49,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.18296v1",
            "source_location": "online experiment table",
            "retrieved_at": "2026-09-19"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "argus",
      "title": "Scaling Recommender Transformers to One Billion Parameters",
      "paper_url": "https://arxiv.org/abs/2507.15994",
      "detail_path": "reproductions/2507.15994-argus/README.md",
      "topic": [
        "long-sequence",
        "transformer",
        "multi-task"
      ],
      "first_author": null,
      "first_author_affiliation": "Yandex",
      "published": "2025-07",
      "code": null,
      "adapter": {
        "adapter_key": "argus",
        "arxiv_id": "2507.15994",
        "title": "Scaling Recommender Transformers to One Billion Parameters",
        "paper_url": "https://arxiv.org/abs/2507.15994",
        "track": "recommendation",
        "organization": "Yandex",
        "published": "2025-07",
        "code_url": null,
        "topics": [
          "long-sequence",
          "transformer",
          "multi-task"
        ],
        "local_code_dir": "src/auto_research/reproductions/argus",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "DIN，ARGUS NDCG@10 相对 DIN -4.12%",
        "metrics": [
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.feedback_then_item.hit_at_10",
          "results.feedback_then_item.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.next_item_only.hit_at_10",
          "results.next_item_only.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Yandex Music",
            "metric": "total listening time",
            "lift_percent": 2.26,
            "traffic": "large-scale online experiment",
            "source_url": "https://arxiv.org/abs/2507.15994",
            "source_location": "original paper online-result disclosure: product=Yandex Music; metric=total listening time"
          },
          {
            "product": "Yandex Music",
            "metric": "likes",
            "lift_percent": 6.37,
            "traffic": "large-scale online experiment",
            "source_url": "https://arxiv.org/abs/2507.15994",
            "source_location": "original paper online-result disclosure: product=Yandex Music; metric=likes"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "asarl",
      "title": "ASARL: Autonomous Social-Aware Relevance Learning for QQ Search",
      "paper_url": "https://arxiv.org/abs/2607.26593",
      "detail_path": "reproductions/2607.26593-asarl/README.md",
      "topic": [
        "search-relevance",
        "multi-agent-data-curation",
        "knowledge-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent PCG",
      "published": "2026-07-29",
      "code": null,
      "adapter": {
        "adapter_key": "asarl",
        "arxiv_id": "2607.26593",
        "title": "ASARL: Autonomous Social-Aware Relevance Learning for QQ Search",
        "paper_url": "https://arxiv.org/abs/2607.26593",
        "track": "recommendation",
        "organization": "Tencent PCG",
        "published": "2026-07-29",
        "code_url": null,
        "topics": [
          "search-relevance",
          "multi-agent-data-curation",
          "knowledge-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/asarl",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "matched control without the asarl mechanism",
        "metrics": [
          "paper_results.channel_ctr_lift_percent",
          "paper_results.group_ctr_lift_percent",
          "relative.curated_examples_percent",
          "relative.final_loss_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.initial_loss_percent",
          "relative.ndcg_at_10_percent",
          "relative.parameters_percent",
          "relative.reason_critic_rounds_percent",
          "relative.social_distillation_percent",
          "variants.ASARL distilled.final_loss",
          "variants.ASARL distilled.hit_at_10",
          "variants.ASARL distilled.initial_loss",
          "variants.ASARL distilled.ndcg_at_10",
          "variants.online student.final_loss",
          "variants.online student.hit_at_10",
          "variants.online student.initial_loss",
          "variants.online student.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=60",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "QQ channel search",
            "metric": "CTR",
            "lift_percent": 2.69,
            "traffic": "20% treatment / 20% control, >=7 days",
            "source_url": "https://arxiv.org/abs/2607.26593",
            "source_location": "original paper online-result disclosure: product=QQ channel search; metric=CTR"
          },
          {
            "product": "QQ group search",
            "metric": "GSB",
            "lift_percent": 16.66,
            "traffic": "20% treatment / 20% control, >=7 days",
            "source_url": "https://arxiv.org/abs/2607.26593",
            "source_location": "original paper online-result disclosure: product=QQ group search; metric=GSB"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "atomic-intent",
      "title": "Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations",
      "paper_url": "https://arxiv.org/abs/2606.10357",
      "detail_path": "reproductions/2606.10357-atomic-intent/README.md",
      "topic": [
        "cross-domain",
        "llm-recommendation",
        "intent-retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "The Hong Kong Polytechnic University",
      "published": "2026-06-09",
      "code": null,
      "adapter": {
        "adapter_key": "atomic-intent",
        "arxiv_id": "2606.10357",
        "title": "Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations",
        "paper_url": "https://arxiv.org/abs/2606.10357",
        "track": "recommendation",
        "organization": "The Hong Kong Polytechnic University",
        "published": "2026-06-09",
        "code_url": null,
        "topics": [
          "cross-domain",
          "llm-recommendation",
          "intent-retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/atomic_intent",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou E-commerce",
            "metric": "GMV",
            "lift_percent": 3.446,
            "traffic": "5.08% production traffic",
            "source_url": "https://arxiv.org/html/2606.10357v1",
            "source_location": "Section 5.6",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:atomic-intent-tree"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "autolr",
      "title": "AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2609.04871",
      "detail_path": "reproductions/2609.04871-autolr/README.md",
      "topic": [
        "auto-research",
        "experiment-controller",
        "launch-review",
        "industrial-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "NetEase, Inc.",
      "published": "2026-09-04",
      "code": null,
      "adapter": {
        "adapter_key": "autolr",
        "arxiv_id": "2609.04871",
        "title": "AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2609.04871",
        "track": "recommendation",
        "organization": "NetEase, Inc.",
        "published": "2026-09-04",
        "code_url": null,
        "topics": [
          "auto-research",
          "experiment-controller",
          "launch-review",
          "industrial-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/autolr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; 80 CPU updates; validation-only candidate selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "NetEase DASHEN feed and immersive-video feed",
            "metric": "content-consumption time",
            "lift_percent": 10.83,
            "traffic": "nine Launch Review records with online A/B and production decisions",
            "source_url": "https://arxiv.org/html/2609.04871",
            "source_location": "Section 5.2, Table 1",
            "retrieved_at": "2026-09-07"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "controller:autolr-evidence-council"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "baff",
      "title": "BAFF: Bid-Aware Filter Family for Mitigating Training Data Interference in RTB A/B Tests",
      "paper_url": "https://arxiv.org/abs/2609.08725",
      "detail_path": "reproductions/2609.08725-baff/README.md",
      "topic": [
        "advertising",
        "rtb",
        "ab-testing",
        "training-data-interference"
      ],
      "first_author": null,
      "first_author_affiliation": "Dable",
      "published": "2026-09-08",
      "code": null,
      "adapter": {
        "adapter_key": "baff",
        "arxiv_id": "2609.08725",
        "title": "BAFF: Bid-Aware Filter Family for Mitigating Training Data Interference in RTB A/B Tests",
        "paper_url": "https://arxiv.org/abs/2609.08725",
        "track": "recommendation",
        "organization": "Dable",
        "published": "2026-09-08",
        "code_url": null,
        "topics": [
          "advertising",
          "rtb",
          "ab-testing",
          "training-data-interference"
        ],
        "local_code_dir": "src/auto_research/reproductions/baff",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l1_mechanism",
        "datasets": [
          "controlled RTB simulation"
        ],
        "baseline": "naive pooled training",
        "metrics": [
          "parameter_deviation",
          "retained_control_fraction"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "2,400 simulated auctions",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "production DSP real-time bidding",
            "metric": "absolute CPC treatment-effect gap reduction versus naive shared log",
            "lift_percent": 95.53,
            "traffic": "single advertiser/SSP; two- and three-day measurement phases",
            "source_url": "https://arxiv.org/html/2609.08725",
            "source_location": "Section 5.4, Tables 6-7",
            "retrieved_at": "2026-09-12"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "bahe",
      "title": "Breaking the Length Barrier: LLM-Enhanced CTR Prediction in Long Textual User Behaviors",
      "paper_url": "https://arxiv.org/abs/2403.19347",
      "detail_path": "reproductions/2403.19347-bahe/README.md",
      "topic": [
        "llm-recommendation",
        "ctr-ranking",
        "long-sequence",
        "efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Ant Group",
      "published": "2024-03",
      "code": null,
      "adapter": {
        "adapter_key": "bahe",
        "arxiv_id": "2403.19347",
        "title": "Breaking the Length Barrier: LLM-Enhanced CTR Prediction in Long Textual User Behaviors",
        "paper_url": "https://arxiv.org/abs/2403.19347",
        "track": "recommendation",
        "organization": "Ant Group",
        "published": "2024-03",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "ctr-ranking",
          "long-sequence",
          "efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/bahe",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K title text"
        ],
        "baseline": "逐样本运行完整文本上层微调",
        "metrics": [
          "auc.bahe_atomic_hierarchical.mean",
          "auc.bahe_atomic_hierarchical.std",
          "auc.full_text_upper_tuning.mean",
          "auc.full_text_upper_tuning.std",
          "auc.mean_absolute_gain",
          "auc.mean_relative_gain_percent",
          "latency_milliseconds_per_example.bahe_atomic_hierarchical.mean",
          "latency_milliseconds_per_example.bahe_atomic_hierarchical.std",
          "latency_milliseconds_per_example.full_text_upper_tuning.mean",
          "latency_milliseconds_per_example.full_text_upper_tuning.std",
          "latency_milliseconds_per_example.mean_relative_change_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "e-commerce ads",
            "metric": "CTR",
            "lift_percent": 9.65,
            "traffic": "two-week A/B test",
            "source_url": "https://arxiv.org/abs/2403.19347",
            "source_location": "original paper online-result disclosure: product=e-commerce ads; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "barge",
      "title": "Bridging the Structural Gap: Adapting Autoregressive Generation for Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.21028",
      "detail_path": "reproductions/2607.21028-barge/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "reranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "barge",
        "arxiv_id": "2607.21028",
        "title": "Bridging the Structural Gap: Adapting Autoregressive Generation for Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.21028",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "reranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/barge",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "同 width、层数、训练行、optimizer 和 140 steps 的 single-path RQ-VAE/TIGER",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "osq.final_loss",
          "osq.initial_loss",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent commercial media platform",
            "metric": "CTR",
            "lift_percent": 0.6,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.21028",
            "source_location": "original paper online-result disclosure: product=Tencent commercial media platform; metric=CTR"
          },
          {
            "product": "Tencent commercial media platform",
            "metric": "click UV",
            "lift_percent": 1.34,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.21028",
            "source_location": "original paper online-result disclosure: product=Tencent commercial media platform; metric=click UV"
          },
          {
            "product": "Tencent commercial media platform",
            "metric": "total reading time",
            "lift_percent": 1.7,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.21028",
            "source_location": "original paper online-result disclosure: product=Tencent commercial media platform; metric=total reading time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "beque",
      "title": "Large Language Model based Long-tail Query Rewriting in Taobao Search",
      "paper_url": "https://arxiv.org/abs/2311.03758",
      "detail_path": "reproductions/2311.03758-beque/README.md",
      "topic": [
        "llm-recommendation",
        "query-rewriting",
        "preference-optimization",
        "search"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2023-11",
      "code": null,
      "adapter": {
        "adapter_key": "beque",
        "arxiv_id": "2311.03758",
        "title": "Large Language Model based Long-tail Query Rewriting in Taobao Search",
        "paper_url": "https://arxiv.org/abs/2311.03758",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2023-11",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "query-rewriting",
          "preference-optimization",
          "search"
        ],
        "local_code_dir": "src/auto_research/reproductions/beque",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K catalog text (public query-rewrite proxy)"
        ],
        "baseline": "T5 SFT",
        "metrics": [
          "hit_at_1.pro_mean",
          "hit_at_1.pro_std",
          "hit_at_1.relative_gain_percent",
          "hit_at_1.sft_mean",
          "hit_at_1.sft_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=40",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Mobile Taobao Search",
            "metric": "GMV",
            "lift_percent": 0.4,
            "traffic": "14-day online test",
            "source_url": "https://arxiv.org/abs/2311.03758",
            "source_location": "original paper online-result disclosure: product=Mobile Taobao Search; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "bst",
      "title": "Behavior Sequence Transformer for E-commerce Recommendation in Alibaba",
      "paper_url": "https://arxiv.org/abs/1905.06874",
      "detail_path": "reproductions/1905.06874-bst/README.md",
      "topic": [
        "ranking",
        "classic",
        "sequence-modeling"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2019-05-15",
      "code": null,
      "adapter": {
        "adapter_key": "bst",
        "arxiv_id": "1905.06874",
        "title": "Behavior Sequence Transformer for E-commerce Recommendation in Alibaba",
        "paper_url": "https://arxiv.org/abs/1905.06874",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2019-05-15",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "sequence-modeling"
        ],
        "local_code_dir": "src/auto_research/reproductions/bst",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "DIN",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao recommendation",
            "metric": "CTR",
            "lift_percent": 7.57,
            "traffic": "online A/B vs WDL control",
            "source_url": "https://arxiv.org/abs/1905.06874",
            "source_location": "original paper online-result disclosure: product=Taobao recommendation; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cadet",
      "title": "CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer",
      "paper_url": "https://arxiv.org/abs/2602.11410",
      "detail_path": "reproductions/2602.11410-cadet/README.md",
      "topic": [
        "advertising",
        "ctr-prediction",
        "decoder-only-transformer"
      ],
      "first_author": null,
      "first_author_affiliation": "LinkedIn",
      "published": "2026-02-11",
      "code": null,
      "adapter": {
        "adapter_key": "cadet",
        "arxiv_id": "2602.11410",
        "title": "CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer",
        "paper_url": "https://arxiv.org/abs/2602.11410",
        "track": "recommendation",
        "organization": "LinkedIn",
        "published": "2026-02-11",
        "code_url": null,
        "topics": [
          "advertising",
          "ctr-prediction",
          "decoder-only-transformer"
        ],
        "local_code_dir": "src/auto_research/reproductions/cadet",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "LinkedIn sponsored feed",
            "metric": "CTR",
            "lift_percent": 11.04,
            "traffic": "large-scale online A/B",
            "source_url": "https://arxiv.org/html/2602.11410v1",
            "source_location": "Section 5.3 / Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "camie",
      "title": "CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval",
      "paper_url": "https://arxiv.org/abs/2608.30255",
      "detail_path": "reproductions/2608.30255-camie/README.md",
      "topic": [
        "multimodal-retrieval",
        "co-engagement",
        "advertising"
      ],
      "first_author": null,
      "first_author_affiliation": "Snap Inc.",
      "published": "2026-08-31",
      "code": null,
      "adapter": {
        "adapter_key": "camie",
        "arxiv_id": "2608.30255",
        "title": "CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval",
        "paper_url": "https://arxiv.org/abs/2608.30255",
        "track": "recommendation",
        "organization": "Snap Inc.",
        "published": "2026-08-31",
        "code_url": null,
        "topics": [
          "multimodal-retrieval",
          "co-engagement",
          "advertising"
        ],
        "local_code_dir": "src/auto_research/reproductions/camie",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Snap Dynamic Product Ads",
            "metric": "overall CVR",
            "lift_percent": 1.911,
            "traffic": "production deployment on overall DPA traffic",
            "source_url": "https://arxiv.org/html/2608.30255v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:coengagement-embedding"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "capts",
      "title": "CAPTS: Channel-Aware, Preference-Aligned Trigger Selection for Multi-Channel Item-to-Item Retrieval",
      "paper_url": "https://arxiv.org/abs/2602.12564",
      "detail_path": "reproductions/2602.12564-capts/README.md",
      "topic": [
        "retrieval",
        "trigger-selection",
        "multi-channel-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-02-13",
      "code": null,
      "adapter": {
        "adapter_key": "capts",
        "arxiv_id": "2602.12564",
        "title": "CAPTS: Channel-Aware, Preference-Aligned Trigger Selection for Multi-Channel Item-to-Item Retrieval",
        "paper_url": "https://arxiv.org/abs/2602.12564",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-02-13",
        "code_url": null,
        "topics": [
          "retrieval",
          "trigger-selection",
          "multi-channel-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/capts",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kwai multi-channel retrieval",
            "metric": "Total app time spent",
            "lift_percent": 0.713,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2602.12564v1",
            "source_location": "Section 4.4.1",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:channel-trigger-routing"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "causal-representation",
      "title": "Causal Representation Learning for Generalisable Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.27043",
      "detail_path": "reproductions/2605.27043-causal-representation/README.md",
      "topic": [
        "causal-recommendation",
        "distribution-shift",
        "representation-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Warwick",
      "published": "2026-05-26",
      "code": null,
      "adapter": {
        "adapter_key": "causal-representation",
        "arxiv_id": "2605.27043",
        "title": "Causal Representation Learning for Generalisable Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.27043",
        "track": "recommendation",
        "organization": "University of Warwick",
        "published": "2026-05-26",
        "code_url": null,
        "topics": [
          "causal-recommendation",
          "distribution-shift",
          "representation-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/causal_representation",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Spotify playlist generation",
            "metric": "Track streams",
            "lift_percent": 0.75,
            "traffic": "2 weeks; millions of users; 95% CI [+0.54%, +0.96%]",
            "source_url": "https://arxiv.org/html/2605.27043v1",
            "source_location": "Section 4.3, Table 2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:causal-bottleneck"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "causal-retrieval",
      "title": "Deep-learning Causal Retrieval Optimization for Efficient e-commerce Distribution in Pinterest",
      "paper_url": "https://arxiv.org/abs/2607.14161",
      "detail_path": "reproductions/2607.14161-causal-retrieval/README.md",
      "topic": [
        "causal-retrieval",
        "uplift",
        "candidate-generation"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "causal-retrieval",
        "arxiv_id": "2607.14161",
        "title": "Deep-learning Causal Retrieval Optimization for Efficient e-commerce Distribution in Pinterest",
        "paper_url": "https://arxiv.org/abs/2607.14161",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "causal-retrieval",
          "uplift",
          "candidate-generation"
        ],
        "local_code_dir": "src/auto_research/reproductions/causal_retrieval",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K with synthetic randomized treatment"
        ],
        "baseline": "固定的非因果 transition/content/popularity retrieval ensemble",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest shopping retrieval",
            "metric": "total sessions",
            "lift_percent": 0.26,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.14161",
            "source_location": "original paper online-result disclosure: product=Pinterest shopping retrieval; metric=total sessions"
          },
          {
            "product": "Pinterest shopping retrieval",
            "metric": "Pin saves",
            "lift_percent": 1.1,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.14161",
            "source_location": "original paper online-result disclosure: product=Pinterest shopping retrieval; metric=Pin saves"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ccformer",
      "title": "CCFormer: Efficient Cross-Field Interaction and Hierarchical Sequence Compression for Industrial Recommendation at Tencent",
      "paper_url": "https://arxiv.org/abs/2607.28070",
      "detail_path": "reproductions/2607.28070-ccformer/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "sequence-compression",
        "token-mixing"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent Platform and Content Group",
      "published": "2026-07-30",
      "code": null,
      "adapter": {
        "adapter_key": "ccformer",
        "arxiv_id": "2607.28070",
        "title": "CCFormer: Efficient Cross-Field Interaction and Hierarchical Sequence Compression for Industrial Recommendation at Tencent",
        "paper_url": "https://arxiv.org/abs/2607.28070",
        "track": "recommendation",
        "organization": "Tencent Platform and Content Group",
        "published": "2026-07-30",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "sequence-compression",
          "token-mixing"
        ],
        "local_code_dir": "src/auto_research/reproductions/ccformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M (240 users / 400 items)"
        ],
        "baseline": "同预算 GRU",
        "metrics": [
          "baseline.encoded_sequence_tokens",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.encoded_sequence_tokens",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative_ndcg_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent video recommendation",
            "metric": "CTR",
            "lift_percent": 3.57,
            "traffic": "over one million exposed users/day, two weeks; fully deployed",
            "source_url": "https://arxiv.org/abs/2607.28070",
            "source_location": "original paper online-result disclosure: product=Tencent video recommendation; metric=CTR"
          },
          {
            "product": "Tencent advertising ranking",
            "metric": "advertising revenue",
            "lift_percent": 1.71,
            "traffic": "over one million exposed users/day, two weeks; fully deployed",
            "source_url": "https://arxiv.org/abs/2607.28070",
            "source_location": "original paper online-result disclosure: product=Tencent advertising ranking; metric=advertising revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cdm",
      "title": "Contextual Distillation Model for Diversified Recommendation",
      "paper_url": "https://arxiv.org/abs/2406.09021",
      "detail_path": "reproductions/2406.09021-cdm/README.md",
      "topic": [
        "reranking",
        "diversity",
        "knowledge-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2024-06-13",
      "code": null,
      "adapter": {
        "adapter_key": "cdm",
        "arxiv_id": "2406.09021",
        "title": "Contextual Distillation Model for Diversified Recommendation",
        "paper_url": "https://arxiv.org/abs/2406.09021",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2024-06-13",
        "code_url": null,
        "topics": [
          "reranking",
          "diversity",
          "knowledge-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/cdm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 cdm 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Watch Time",
            "lift_percent": 0.406,
            "traffic": "main-app A/B",
            "source_url": "https://arxiv.org/abs/2406.09021",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=Watch Time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cgr",
      "title": "Constraint-Aware Generative Re-ranking for Multi-Objective Optimization in Advertising Feeds",
      "paper_url": "https://arxiv.org/abs/2603.04227",
      "detail_path": "reproductions/2603.04227-cgr/README.md",
      "topic": [
        "advertising",
        "generative-reranking",
        "constraint-optimization"
      ],
      "first_author": null,
      "first_author_affiliation": "Bilibili",
      "published": "2026-03-04",
      "code": null,
      "adapter": {
        "adapter_key": "cgr",
        "arxiv_id": "2603.04227",
        "title": "Constraint-Aware Generative Re-ranking for Multi-Objective Optimization in Advertising Feeds",
        "paper_url": "https://arxiv.org/abs/2603.04227",
        "track": "recommendation",
        "organization": "Bilibili",
        "published": "2026-03-04",
        "code_url": null,
        "topics": [
          "advertising",
          "generative-reranking",
          "constraint-optimization"
        ],
        "local_code_dir": "src/auto_research/reproductions/cgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Bilibili advertising feeds",
            "metric": "Inference latency reduction",
            "lift_percent": 85.0,
            "traffic": "millions of daily requests; production online A/B",
            "source_url": "https://arxiv.org/html/2603.04227v1",
            "source_location": "Conclusion",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:constraint-aware"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "chronicle-rec",
      "title": "ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling",
      "paper_url": "https://arxiv.org/abs/2609.12375",
      "detail_path": "reproductions/2609.12375-chronicle-rec/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "sequence-compression",
        "pretraining"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-09-11",
      "code": null,
      "adapter": {
        "adapter_key": "chronicle-rec",
        "arxiv_id": "2609.12375",
        "title": "ChronicleRec: Pre-training Temporally Anchored Tokens for Lifelong User Modeling",
        "paper_url": "https://arxiv.org/abs/2609.12375",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-09-11",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "sequence-compression",
          "pretraining"
        ],
        "local_code_dir": "src/auto_research/reproductions/chronicle_rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Weixin Moments Ads pCVR",
            "metric": "GMV",
            "lift_percent": 1.61,
            "traffic": "seven-day production A/B",
            "source_url": "https://arxiv.org/html/2609.12375v1",
            "source_location": "Section 4.9",
            "experiment_duration": "seven days",
            "significance": "95% CI excludes zero",
            "retrieved_at": "2026-09-15"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "click-a-buy-b",
      "title": "Click A, Buy B: Rethinking Conversion Attribution in E-Commerce Recommendations",
      "paper_url": "https://arxiv.org/abs/2507.15113",
      "detail_path": "reproductions/2507.15113-click-a-buy-b/README.md",
      "topic": [
        "conversion-attribution",
        "multi-task-learning",
        "taxonomy",
        "ads-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2025-07-20",
      "code": null,
      "adapter": {
        "adapter_key": "click-a-buy-b",
        "arxiv_id": "2507.15113",
        "title": "Click A, Buy B: Rethinking Conversion Attribution in E-Commerce Recommendations",
        "paper_url": "https://arxiv.org/abs/2507.15113",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2025-07-20",
        "code_url": null,
        "topics": [
          "conversion-attribution",
          "multi-task-learning",
          "taxonomy",
          "ads-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/click_a_buy_b",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "last-click single-item conversion attribution",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest shopping",
            "metric": "primary business metric",
            "lift_percent": 0.25,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2507.15113",
            "source_location": "original paper online-result disclosure: product=Pinterest shopping; metric=primary business metric"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "climber-pilot",
      "title": "Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following",
      "paper_url": "https://arxiv.org/abs/2602.13581",
      "detail_path": "reproductions/2602.13581-climber-pilot/README.md",
      "topic": [
        "generative-retrieval",
        "long-horizon",
        "instruction-following"
      ],
      "first_author": null,
      "first_author_affiliation": "NetEase Cloud Music",
      "published": "2026-02-14",
      "code": null,
      "adapter": {
        "adapter_key": "climber-pilot",
        "arxiv_id": "2602.13581",
        "title": "Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following",
        "paper_url": "https://arxiv.org/abs/2602.13581",
        "track": "recommendation",
        "organization": "NetEase Cloud Music",
        "published": "2026-02-14",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "long-horizon",
          "instruction-following"
        ],
        "local_code_dir": "src/auto_research/reproductions/climber_pilot",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "NetEase Cloud Music",
            "metric": "Core business metric",
            "lift_percent": 4.24,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2602.13581v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:instruction-foresight"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "clockrope",
      "title": "ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling",
      "paper_url": "https://arxiv.org/abs/2607.26369",
      "detail_path": "reproductions/2607.26369-clockrope/README.md",
      "topic": [
        "generative-retrieval",
        "temporal-modeling",
        "rope",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "YouTube / Google DeepMind",
      "published": "2026-07-29",
      "code": null,
      "adapter": {
        "adapter_key": "clockrope",
        "arxiv_id": "2607.26369",
        "title": "ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling",
        "paper_url": "https://arxiv.org/abs/2607.26369",
        "track": "recommendation",
        "organization": "YouTube / Google DeepMind",
        "published": "2026-07-29",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "temporal-modeling",
          "rope",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/clockrope",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "RoPE-style recency ranker",
        "metrics": [
          "Hit@10",
          "NDCG@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "major video platform",
            "metric": "engagement",
            "lift_percent": 0.08,
            "traffic": "14-day A/B; 1% traffic per variant",
            "source_url": "https://arxiv.org/html/2607.26369v2#S4.SS2",
            "source_location": "Section 4.2 Table 6",
            "experiment_duration": "14 days",
            "retrieved_at": "2026-08-24"
          },
          {
            "product": "major video platform",
            "metric": "valued engagement",
            "lift_percent": 0.08,
            "traffic": "14-day A/B; 1% traffic per variant",
            "source_url": "https://arxiv.org/html/2607.26369v2#S4.SS2",
            "source_location": "Section 4.2 Table 6",
            "experiment_duration": "14 days",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cluster-goobs",
      "title": "Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval",
      "paper_url": "https://arxiv.org/abs/2607.00448",
      "detail_path": "reproductions/2607.00448-cluster-goobs/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "cluster-goobs",
        "arxiv_id": "2607.00448",
        "title": "Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval",
        "paper_url": "https://arxiv.org/abs/2607.00448",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/cluster_goobs",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "Random OOB negative sampler",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.cluster_goobs.hit_at_10",
          "results.cluster_goobs.hit_at_10_std",
          "results.cluster_goobs.ndcg_at_10",
          "results.cluster_goobs.ndcg_at_10_std",
          "results.random_oob.hit_at_10",
          "results.random_oob.hit_at_10_std",
          "results.random_oob.ndcg_at_10",
          "results.random_oob.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cmsl",
      "title": "CMSL: Constructive Multi-Sequence Learning for Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2606.28533",
      "detail_path": "reproductions/2606.28533-cmsl/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "cmsl",
        "arxiv_id": "2606.28533",
        "title": "CMSL: Constructive Multi-Sequence Learning for Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2606.28533",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/cmsl",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "single sequence hstu",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.cmsl.hit_at_10",
          "results.cmsl.hit_at_10_std",
          "results.cmsl.ndcg_at_10",
          "results.cmsl.ndcg_at_10_std",
          "results.single_sequence_hstu.hit_at_10",
          "results.single_sequence_hstu.hit_at_10_std",
          "results.single_sequence_hstu.ndcg_at_10",
          "results.single_sequence_hstu.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=90",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cobra",
      "title": "Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations",
      "paper_url": "https://arxiv.org/abs/2503.02453",
      "detail_path": "reproductions/2503.02453-cobra/README.md",
      "topic": [
        "generative-retrieval",
        "semantic-id",
        "dense-retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Baidu",
      "published": "2025-03",
      "code": null,
      "adapter": {
        "adapter_key": "cobra",
        "arxiv_id": "2503.02453",
        "title": "Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations",
        "paper_url": "https://arxiv.org/abs/2503.02453",
        "track": "recommendation",
        "organization": "Baidu",
        "published": "2025-03",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "semantic-id",
          "dense-retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/cobra",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "DIN，COBRA NDCG@10 相对 DIN +25.75%",
        "metrics": [
          "results.cobra_cascade.hit_at_10",
          "results.cobra_cascade.ndcg_at_10",
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.sparse_only.hit_at_10",
          "results.sparse_only.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Baidu advertising",
            "metric": "conversion",
            "lift_percent": 3.6,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/abs/2503.02453",
            "source_location": "original paper online-result disclosure: product=Baidu advertising; metric=conversion"
          },
          {
            "product": "Baidu advertising",
            "metric": "ARPU",
            "lift_percent": 4.15,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/abs/2503.02453",
            "source_location": "original paper online-result disclosure: product=Baidu advertising; metric=ARPU"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "connectionmind",
      "title": "ConnectionMind: A General Social-Personalized Recommendation System with LLM Reasoning",
      "paper_url": "https://arxiv.org/abs/2608.10187",
      "detail_path": "reproductions/2608.10187-connectionmind/README.md",
      "topic": [
        "social-recommendation",
        "llm-recommendation",
        "graph-reasoning",
        "reinforcement-learning",
        "distillation"
      ],
      "first_author": "Haoyu Han",
      "first_author_affiliation": "Michigan State University",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "connectionmind",
        "arxiv_id": "2608.10187",
        "title": "ConnectionMind: A General Social-Personalized Recommendation System with LLM Reasoning",
        "paper_url": "https://arxiv.org/abs/2608.10187",
        "track": "recommendation",
        "organization": "Michigan State University / Meta Platforms, Inc.",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "social-recommendation",
          "llm-recommendation",
          "graph-reasoning",
          "reinforcement-learning",
          "distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/connectionmind",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "HetRec 2011 Delicious-2K"
        ],
        "baseline": "fixed heterogeneous graph aggregation",
        "metrics": [
          "Recall@10",
          "Precision@10",
          "NDCG@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "3 SFT epochs + 180 GRPO groups",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta short-video recommendation",
            "metric": "exposure",
            "lift_percent": 0.33,
            "traffic": "multi-week test over tens of millions of users",
            "source_url": "https://arxiv.org/pdf/2608.10187",
            "source_location": "Section 5.4 Table 2",
            "experiment_duration": "multiple weeks",
            "significance": "±0.08%",
            "retrieved_at": "2026-08-20"
          },
          {
            "product": "Meta short-video recommendation",
            "metric": "watch time",
            "lift_percent": 0.43,
            "traffic": "multi-week test over tens of millions of users",
            "source_url": "https://arxiv.org/pdf/2608.10187",
            "source_location": "Section 5.4 Table 2",
            "experiment_duration": "multiple weeks",
            "significance": "±0.14%",
            "retrieved_at": "2026-08-20"
          },
          {
            "product": "Meta short-video recommendation",
            "metric": "video sessions",
            "lift_percent": 0.22,
            "traffic": "multi-week test over tens of millions of users",
            "source_url": "https://arxiv.org/pdf/2608.10187",
            "source_location": "Section 5.4 Table 2",
            "experiment_duration": "multiple weeks",
            "significance": "±0.13%",
            "retrieved_at": "2026-08-20"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "coral",
      "title": "CORAL: An LLM-Native Harness for Production Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2609.02730",
      "detail_path": "reproductions/2609.02730-coral/README.md",
      "topic": [
        "auto-research",
        "agent",
        "retrieval-budget",
        "constrained-optimization"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta AI",
      "published": "2026-09-02",
      "code": null,
      "adapter": {
        "adapter_key": "coral",
        "arxiv_id": "2609.02730",
        "title": "CORAL: An LLM-Native Harness for Production Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2609.02730",
        "track": "recommendation",
        "organization": "Meta AI",
        "published": "2026-09-02",
        "code_url": null,
        "topics": [
          "auto-research",
          "agent",
          "retrieval-budget",
          "constrained-optimization"
        ],
        "local_code_dir": "src/auto_research/reproductions/coral",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "fixed equal retrieval allocation",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "budget feasibility",
          "cycle effect"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta large-scale video service",
            "metric": "video-viewing sessions",
            "lift_percent": 0.16,
            "traffic": "millions-user online A/B; deployed configuration",
            "source_url": "https://arxiv.org/pdf/2609.02730v1",
            "source_location": "Section 5.1, Table 1",
            "retrieved_at": "2026-09-06"
          },
          {
            "product": "Meta serving-capacity service",
            "metric": "annualized capacity savings",
            "lift_percent": 44.0,
            "traffic": "second A/B round increased first-round savings by 44%; engagement neutral",
            "source_url": "https://arxiv.org/pdf/2609.02730v1",
            "source_location": "Section 5.2",
            "retrieved_at": "2026-09-06"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "controller:coral-constrained-feedback-loop"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "core-relevance",
      "title": "CORE: A Unified Cascaded Ordinal Relevance Estimation Framework for E-commerce Search",
      "paper_url": "https://arxiv.org/abs/2607.24417",
      "detail_path": "reproductions/2607.24417-core-relevance/README.md",
      "topic": [
        "search-ranking",
        "ordinal-relevance",
        "step-grpo",
        "llm-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan / Beijing Institute of Technology",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "core-relevance",
        "arxiv_id": "2607.24417",
        "title": "CORE: A Unified Cascaded Ordinal Relevance Estimation Framework for E-commerce Search",
        "paper_url": "https://arxiv.org/abs/2607.24417",
        "track": "recommendation",
        "organization": "Meituan / Beijing Institute of Technology",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "search-ranking",
          "ordinal-relevance",
          "step-grpo",
          "llm-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/core_relevance",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M ordinal relevance"
        ],
        "baseline": "MovieLens-1M 构造的同一 Low/Mid/High query-item 集上的 flat 三分类",
        "metrics": [
          "paper_results.cascaded_bert_accuracy",
          "paper_results.direct_bert_accuracy",
          "paper_results.distilled_accuracy",
          "paper_results.online_ndcg_at_5_percent",
          "paper_results.postcot_core_accuracy",
          "paper_results.step_grpo_accuracy",
          "relative.accuracy_points",
          "relative.badcase_reduction_percent",
          "relative.ndcg_at_5_percent",
          "training.cascade_sft.final_loss",
          "training.cascade_sft.initial_loss",
          "training.flat.final_loss",
          "training.flat.initial_loss",
          "training.postcot_distillation.final_loss",
          "training.postcot_distillation.initial_loss",
          "training.step_grpo.final_policy_loss",
          "training.step_grpo.mean_step_reward",
          "variants.Cascaded + step-GRPO.accuracy",
          "variants.Cascaded + step-GRPO.ndcg_at_5",
          "variants.Cascaded classifier.accuracy",
          "variants.Cascaded classifier.ndcg_at_5",
          "variants.Flat classifier.accuracy",
          "variants.Flat classifier.ndcg_at_5",
          "variants.PostCoT distilled cascade.accuracy",
          "variants.PostCoT distilled cascade.ndcg_at_5"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan e-commerce search",
            "metric": "NDCG@5",
            "lift_percent": 0.2,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2607.24417",
            "source_location": "original paper online-result disclosure: product=Meituan e-commerce search; metric=NDCG@5"
          },
          {
            "product": "Meituan e-commerce search",
            "metric": "Badcase@5 reduction",
            "lift_percent": 15.9,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2607.24417",
            "source_location": "original paper online-result disclosure: product=Meituan e-commerce search; metric=Badcase@5 reduction"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cq-sid",
      "title": "Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL",
      "paper_url": "https://arxiv.org/abs/2605.14434",
      "detail_path": "reproductions/2605.14434-cq-sid/README.md",
      "topic": [
        "generative-retrieval",
        "semantic-id",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Taobao & Tmall Group",
      "published": "2026-05-14",
      "code": null,
      "adapter": {
        "adapter_key": "cq-sid",
        "arxiv_id": "2605.14434",
        "title": "Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL",
        "paper_url": "https://arxiv.org/abs/2605.14434",
        "track": "recommendation",
        "organization": "Alibaba Taobao & Tmall Group",
        "published": "2026-05-14",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "semantic-id",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/cq_sid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "协同 item-ID 检索",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "TmallAPP Search",
            "metric": "GMV",
            "lift_percent": 1.15,
            "traffic": "two-week online A/B",
            "source_url": "https://arxiv.org/abs/2605.14434",
            "source_location": "original paper online-result disclosure: product=TmallAPP Search; metric=GMV"
          },
          {
            "product": "TmallAPP Search",
            "metric": "UCTCVR",
            "lift_percent": 0.4,
            "traffic": "two-week online A/B",
            "source_url": "https://arxiv.org/abs/2605.14434",
            "source_location": "original paper online-result disclosure: product=TmallAPP Search; metric=UCTCVR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cross-domain-kd",
      "title": "Zero-shot Cross-domain Knowledge Distillation: A Case study on YouTube Music",
      "paper_url": "https://arxiv.org/abs/2603.28994",
      "detail_path": "reproductions/2603.28994-cross-domain-kd/README.md",
      "topic": [
        "distillation",
        "cross-domain",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Google / YouTube",
      "published": "2026-03",
      "code": null,
      "adapter": {
        "adapter_key": "cross-domain-kd",
        "arxiv_id": "2603.28994",
        "title": "Zero-shot Cross-domain Knowledge Distillation: A Case study on YouTube Music",
        "paper_url": "https://arxiv.org/abs/2603.28994",
        "track": "recommendation",
        "organization": "Google / YouTube",
        "published": "2026-03",
        "code_url": null,
        "topics": [
          "distillation",
          "cross-domain",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/cross_domain_kd",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K source/target domains"
        ],
        "baseline": "在相同 target split 上训练的 DIN，实验组 KD student 的 NDCG@10 相对 DIN -68.46%",
        "metrics": [
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.target_only.hit_at_10",
          "results.target_only.ndcg_at_10",
          "results.zero_shot_kd.hit_at_10",
          "results.zero_shot_kd.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "YouTube Music",
            "metric": "discovery",
            "lift_percent": 1.12,
            "traffic": "two-week live experiments",
            "source_url": "https://arxiv.org/abs/2603.28994",
            "source_location": "original paper online-result disclosure: product=YouTube Music; metric=discovery"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "crsd",
      "title": "From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance",
      "paper_url": "https://arxiv.org/abs/2510.11056",
      "detail_path": "reproductions/2510.11056-crsd/README.md",
      "topic": [
        "search",
        "content-understanding",
        "llm-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2025-10-13",
      "code": null,
      "adapter": {
        "adapter_key": "crsd",
        "arxiv_id": "2510.11056",
        "title": "From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance",
        "paper_url": "https://arxiv.org/abs/2510.11056",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2025-10-13",
        "code_url": null,
        "topics": [
          "search",
          "content-understanding",
          "llm-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/crsd",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "shared transition + content baseline，实验组为 CRSD，只改变论文核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.adctr_percent",
          "paper_results.adcvr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan search advertising",
            "metric": "AdCTR",
            "lift_percent": 0.91,
            "traffic": "30% traffic",
            "source_url": "https://arxiv.org/abs/2510.11056",
            "source_location": "original paper online-result disclosure: product=Meituan search advertising; metric=AdCTR"
          },
          {
            "product": "Meituan search advertising",
            "metric": "AdCVR",
            "lift_percent": 1.06,
            "traffic": "30% traffic",
            "source_url": "https://arxiv.org/abs/2510.11056",
            "source_location": "original paper online-result disclosure: product=Meituan search advertising; metric=AdCVR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cs3",
      "title": "CS3: Efficient Online Capability Synergy for Two-Tower Recommendation",
      "paper_url": "https://arxiv.org/abs/2604.19269",
      "detail_path": "reproductions/2604.19269-cs3/README.md",
      "topic": [
        "retrieval",
        "two-tower",
        "online-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-04-21",
      "code": "https://github.com/lixiangwang/CS3Rec",
      "adapter": {
        "adapter_key": "cs3",
        "arxiv_id": "2604.19269",
        "title": "CS3: Efficient Online Capability Synergy for Two-Tower Recommendation",
        "paper_url": "https://arxiv.org/abs/2604.19269",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-04-21",
        "code_url": "https://github.com/lixiangwang/CS3Rec",
        "topics": [
          "retrieval",
          "two-tower",
          "online-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/cs3",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "matched two-tower",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou advertising",
            "metric": "Revenue",
            "lift_percent": 8.356,
            "traffic": "Scenario A; three production scenarios",
            "source_url": "https://arxiv.org/abs/2604.19269",
            "source_location": "original paper online-result disclosure: product=Kuaishou advertising; metric=Revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "cwm",
      "title": "Counteracting Duration Bias in Video Recommendation via Counterfactual Watch Time",
      "paper_url": "https://arxiv.org/abs/2406.07932",
      "detail_path": "reproductions/2406.07932-cwm/README.md",
      "topic": [
        "ranking",
        "counterfactual-learning",
        "watch-time",
        "bias"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology / Renmin University of China",
      "published": "2024-06-12",
      "code": "https://github.com/hyz20/CWM",
      "adapter": {
        "adapter_key": "cwm",
        "arxiv_id": "2406.07932",
        "title": "Counteracting Duration Bias in Video Recommendation via Counterfactual Watch Time",
        "paper_url": "https://arxiv.org/abs/2406.07932",
        "track": "recommendation",
        "organization": "Kuaishou Technology / Renmin University of China",
        "published": "2024-06-12",
        "code_url": "https://github.com/hyz20/CWM",
        "topics": [
          "ranking",
          "counterfactual-learning",
          "watch-time",
          "bias"
        ],
        "local_code_dir": "src/auto_research/reproductions/cwm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 cwm 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.ctr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.cost_transform_to_interest",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Mean Watch Time",
            "lift_percent": 2.9,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2406.07932",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=Mean Watch Time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dadf",
      "title": "DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2605.17863",
      "detail_path": "reproductions/2605.17863-dadf/README.md",
      "topic": [
        "ranking",
        "watch-time",
        "debiasing"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-05-18",
      "code": "https://github.com/liuzhao09/DADF",
      "adapter": {
        "adapter_key": "dadf",
        "arxiv_id": "2605.17863",
        "title": "DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2605.17863",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-05-18",
        "code_url": "https://github.com/liuzhao09/DADF",
        "topics": [
          "ranking",
          "watch-time",
          "debiasing"
        ],
        "local_code_dir": "src/auto_research/reproductions/dadf",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou full ranking",
            "metric": "average time spent per device",
            "lift_percent": 0.649,
            "traffic": "7-day A/B, then 100% traffic",
            "source_url": "https://arxiv.org/html/2605.17863v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "danet",
      "title": "Cheaper is Better: A Discount-Aware Network for Conversion Rate Prediction in E-commerce Recommendation System",
      "paper_url": "https://arxiv.org/abs/2607.12578",
      "detail_path": "reproductions/2607.12578-danet/README.md",
      "topic": [
        "ranking",
        "cvr",
        "discount"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Tmall",
      "published": "2026-07-14",
      "code": "https://github.com/tangrc/DANet",
      "adapter": {
        "adapter_key": "danet",
        "arxiv_id": "2607.12578",
        "title": "Cheaper is Better: A Discount-Aware Network for Conversion Rate Prediction in E-commerce Recommendation System",
        "paper_url": "https://arxiv.org/abs/2607.12578",
        "track": "recommendation",
        "organization": "Alibaba Group / Tmall",
        "published": "2026-07-14",
        "code_url": "https://github.com/tangrc/DANet",
        "topics": [
          "ranking",
          "cvr",
          "discount"
        ],
        "local_code_dir": "src/auto_research/reproductions/danet",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "IPN interest score",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tmall",
            "metric": "pCVR",
            "lift_percent": 3.63,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2607.12578",
            "source_location": "original paper online-result disclosure: product=Tmall; metric=pCVR"
          },
          {
            "product": "Tmall",
            "metric": "GMV",
            "lift_percent": 2.23,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2607.12578",
            "source_location": "original paper online-result disclosure: product=Tmall; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dceo",
      "title": "DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search",
      "paper_url": "https://arxiv.org/abs/2608.25635",
      "detail_path": "reproductions/2608.25635-dceo/README.md",
      "topic": [
        "search-ranking",
        "long-term-value",
        "causal-optimization",
        "multi-objective-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group, Alibaba",
      "published": "2026-08-26",
      "code": null,
      "adapter": {
        "adapter_key": "dceo",
        "arxiv_id": "2608.25635",
        "title": "DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search",
        "paper_url": "https://arxiv.org/abs/2608.25635",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group, Alibaba",
        "published": "2026-08-26",
        "code_url": null,
        "topics": [
          "search-ranking",
          "long-term-value",
          "causal-optimization",
          "multi-objective-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/dceo",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "fixed multi-objective log fusion over the same four proxy scores",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "head share@10",
          "estimated relative causal effect"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba e-commerce search",
            "metric": "GMV",
            "lift_percent": 0.36,
            "traffic": "41-day production A/B test",
            "source_url": "https://arxiv.org/html/2608.25635v1#S5.SS7",
            "source_location": "Section 5.7",
            "experiment_duration": "41 days",
            "retrieved_at": "2026-08-28"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dcn-v2",
      "title": "DCN V2: Improved Deep & Cross Network and Practical Lessons for Web-scale Learning to Rank Systems",
      "paper_url": "https://arxiv.org/abs/2008.13535",
      "detail_path": "reproductions/2008.13535-dcn-v2/README.md",
      "topic": [
        "ranking",
        "classic",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "Google",
      "published": "2020-08-19",
      "code": null,
      "adapter": {
        "adapter_key": "dcn-v2",
        "arxiv_id": "2008.13535",
        "title": "DCN V2: Improved Deep & Cross Network and Practical Lessons for Web-scale Learning to Rank Systems",
        "paper_url": "https://arxiv.org/abs/2008.13535",
        "track": "recommendation",
        "organization": "Google",
        "published": "2020-08-19",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/dcn_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "deep-only",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确要求补齐经典搜广推论文；原文确认 Google 线上业务指标显著提升但未披露具体 lift。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "deepfm",
      "title": "DeepFM: A Factorization-Machine based Neural Network for CTR Prediction",
      "paper_url": "https://arxiv.org/abs/1703.04247",
      "detail_path": "reproductions/1703.04247-deepfm/README.md",
      "topic": [
        "ranking",
        "classic",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei Noah's Ark Lab",
      "published": "2017-03-13",
      "code": null,
      "adapter": {
        "adapter_key": "deepfm",
        "arxiv_id": "1703.04247",
        "title": "DeepFM: A Factorization-Machine based Neural Network for CTR Prediction",
        "paper_url": "https://arxiv.org/abs/1703.04247",
        "track": "recommendation",
        "organization": "Huawei Noah's Ark Lab",
        "published": "2017-03-13",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/deepfm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "embedding MLP，实验组为共享 embedding 的 FM + deep 分支",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.head_share_at_10_std",
          "baseline.hit_at_10",
          "baseline.hit_at_10_std",
          "baseline.ndcg_at_10",
          "baseline.ndcg_at_10_std",
          "method.head_share_at_10",
          "method.head_share_at_10_std",
          "method.hit_at_10",
          "method.hit_at_10_std",
          "method.ndcg_at_10",
          "method.ndcg_at_10_std",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确批准 DeepFM 为经典例外；不以该例外放宽新工业论文的量化线上证据门槛。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "degr",
      "title": "DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging",
      "paper_url": "https://arxiv.org/abs/2608.04809",
      "detail_path": "reproductions/2608.04809-degr/README.md",
      "topic": [
        "reranking",
        "slate-optimization",
        "exploration",
        "preference-optimization"
      ],
      "first_author": null,
      "first_author_affiliation": "JD.com",
      "published": "2026-08-05",
      "code": null,
      "adapter": {
        "adapter_key": "degr",
        "arxiv_id": "2608.04809",
        "title": "DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging",
        "paper_url": "https://arxiv.org/abs/2608.04809",
        "track": "recommendation",
        "organization": "JD.com",
        "published": "2026-08-05",
        "code_url": null,
        "topics": [
          "reranking",
          "slate-optimization",
          "exploration",
          "preference-optimization"
        ],
        "local_code_dir": "src/auto_research/reproductions/degr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同预算 CE generator，实验组加入 diversity 与 adaptive reward ORPO",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "degr.adaptive_reward_orpo_updates",
          "degr.hit_at_10",
          "degr.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "JD homepage recommendation",
            "metric": "UCTR",
            "lift_percent": 1.22,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2608.04809",
            "source_location": "original paper online-result disclosure: product=JD homepage recommendation; metric=UCTR"
          },
          {
            "product": "JD homepage recommendation",
            "metric": "PV",
            "lift_percent": 0.2,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2608.04809",
            "source_location": "original paper online-result disclosure: product=JD homepage recommendation; metric=PV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "degre",
      "title": "DeGRe: Listwise Generative Reranking with Offline Lookahead Distillation",
      "paper_url": "https://arxiv.org/abs/2605.25749",
      "detail_path": "reproductions/2605.25749-degre/README.md",
      "topic": [
        "generative-recommendation",
        "reranking",
        "distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Zhejiang University",
      "published": "2026-05-25",
      "code": null,
      "adapter": {
        "adapter_key": "degre",
        "arxiv_id": "2605.25749",
        "title": "DeGRe: Listwise Generative Reranking with Offline Lookahead Distillation",
        "paper_url": "https://arxiv.org/abs/2605.25749",
        "track": "recommendation",
        "organization": "Alibaba Group / Zhejiang University",
        "published": "2026-05-25",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "reranking",
          "distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/degre",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "相同候选与特征的 pointwise generator",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Flash Shopping",
            "metric": "CTR",
            "lift_percent": 2.85,
            "traffic": "8 days, 2% traffic",
            "source_url": "https://arxiv.org/abs/2605.25749",
            "source_location": "original paper online-result disclosure: product=Taobao Flash Shopping; metric=CTR"
          },
          {
            "product": "Taobao Flash Shopping",
            "metric": "GMV",
            "lift_percent": 3.75,
            "traffic": "8 days, 2% traffic",
            "source_url": "https://arxiv.org/abs/2605.25749",
            "source_location": "original paper online-result disclosure: product=Taobao Flash Shopping; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dien",
      "title": "Deep Interest Evolution Network for Click-Through Rate Prediction",
      "paper_url": "https://arxiv.org/abs/1809.03672",
      "detail_path": "reproductions/1809.03672-dien/README.md",
      "topic": [
        "ranking",
        "classic",
        "sequence-modeling"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2018-09-11",
      "code": "https://github.com/mouna99/dien",
      "adapter": {
        "adapter_key": "dien",
        "arxiv_id": "1809.03672",
        "title": "Deep Interest Evolution Network for Click-Through Rate Prediction",
        "paper_url": "https://arxiv.org/abs/1809.03672",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2018-09-11",
        "code_url": "https://github.com/mouna99/dien",
        "topics": [
          "ranking",
          "classic",
          "sequence-modeling"
        ],
        "local_code_dir": "src/auto_research/reproductions/dien",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "同一训练协议的 DIN",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao display advertising",
            "metric": "CTR",
            "lift_percent": 20.7,
            "traffic": "2018-06-07 to 2018-07-12",
            "source_url": "https://arxiv.org/abs/1809.03672",
            "source_location": "original paper online-result disclosure: product=Taobao display advertising; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "diffureason",
      "title": "DiffuReason: Bridging Latent Reasoning and Generative Refinement for Sequential Recommendation",
      "paper_url": "https://arxiv.org/abs/2602.09744",
      "detail_path": "reproductions/2602.09744-diffureason/README.md",
      "topic": [
        "generative-recommendation",
        "diffusion",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-02-10",
      "code": null,
      "adapter": {
        "adapter_key": "diffureason",
        "arxiv_id": "2602.09744",
        "title": "DiffuReason: Bridging Latent Reasoning and Generative Refinement for Sequential Recommendation",
        "paper_url": "https://arxiv.org/abs/2602.09744",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-02-10",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "diffusion",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/diffureason",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent Ads / WeChat Channels",
            "metric": "ad consumption",
            "lift_percent": 1.1462,
            "traffic": "20% traffic, five days",
            "source_url": "https://arxiv.org/html/2602.09744v1",
            "source_location": "Section 4.7",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "din",
      "title": "Deep Interest Network for Click-Through Rate Prediction",
      "paper_url": "https://arxiv.org/abs/1706.06978",
      "detail_path": "reproductions/1706.06978-din/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": "https://github.com/zhougr1993/DeepInterestNetwork",
      "adapter": {
        "adapter_key": "din",
        "arxiv_id": "1706.06978",
        "title": "Deep Interest Network for Click-Through Rate Prediction",
        "paper_url": "https://arxiv.org/abs/1706.06978",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": "https://github.com/zhougr1993/DeepInterestNetwork",
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/din",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "移除 candidate-aware attention、改用 mean pooling 的同参数模型",
        "metrics": [
          "din.hit_at_10",
          "din.hit_at_10_std",
          "din.ndcg_at_10",
          "din.ndcg_at_10_std",
          "mean_pool.hit_at_10",
          "mean_pool.hit_at_10_std",
          "mean_pool.ndcg_at_10",
          "mean_pool.ndcg_at_10_std",
          "ndcg_gain_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=320",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "director",
      "title": "DIRECTOR: Dynamic Index-based Recommendation with Transport-Optimized Retrieval",
      "paper_url": "https://arxiv.org/abs/2607.26418",
      "detail_path": "reproductions/2607.26418-director/README.md",
      "topic": [
        "reranking",
        "dynamic-index",
        "optimal-transport",
        "non-autoregressive"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Science and Technology of China",
      "published": "2026-07-29",
      "code": null,
      "adapter": {
        "adapter_key": "director",
        "arxiv_id": "2607.26418",
        "title": "DIRECTOR: Dynamic Index-based Recommendation with Transport-Optimized Retrieval",
        "paper_url": "https://arxiv.org/abs/2607.26418",
        "track": "recommendation",
        "organization": "University of Science and Technology of China",
        "published": "2026-07-29",
        "code_url": null,
        "topics": [
          "reranking",
          "dynamic-index",
          "optimal-transport",
          "non-autoregressive"
        ],
        "local_code_dir": "src/auto_research/reproductions/director",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "independent position-wise dynamic-index retrieval",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "matched_duplicate_count",
          "transport_row_error"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; six parallel positions",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou main application",
            "metric": "Valid View",
            "lift_percent": 0.519,
            "traffic": "7-day test; two mutually exclusive 10% buckets",
            "source_url": "https://arxiv.org/html/2607.26418v1",
            "source_location": "Section 6.2 and Appendix online protocol, Table 4",
            "significance": "p < 0.05; 95% CI [0.45%, 0.59%]",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:transport-index"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "dme",
      "title": "Douyin Multimodal Embedding Model Technical Report",
      "paper_url": "https://arxiv.org/abs/2608.02148",
      "detail_path": "reproductions/2608.02148-dme/README.md",
      "topic": [
        "content-understanding",
        "multimodal-retrieval",
        "embedding",
        "llm-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin",
      "published": "2026-08-03",
      "code": null,
      "adapter": {
        "adapter_key": "dme",
        "arxiv_id": "2608.02148",
        "title": "Douyin Multimodal Embedding Model Technical Report",
        "paper_url": "https://arxiv.org/abs/2608.02148",
        "track": "recommendation",
        "organization": "ByteDance / Douyin",
        "published": "2026-08-03",
        "code_url": null,
        "topics": [
          "content-understanding",
          "multimodal-retrieval",
          "embedding",
          "llm-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/dme",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 DME 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin Search",
            "metric": "Lifetime",
            "lift_percent": 0.1,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2608.02148",
            "source_location": "original paper online-result disclosure: product=Douyin Search; metric=Lifetime"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dos",
      "title": "DOS: Dual-Flow Orthogonal Semantic IDs for Recommendation in Meituan",
      "paper_url": "https://arxiv.org/abs/2602.04460",
      "detail_path": "reproductions/2602.04460-dos/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "orthogonal-quantization"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2026-02-04",
      "code": null,
      "adapter": {
        "adapter_key": "dos",
        "arxiv_id": "2602.04460",
        "title": "DOS: Dual-Flow Orthogonal Semantic IDs for Recommendation in Meituan",
        "paper_url": "https://arxiv.org/abs/2602.04460",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2026-02-04",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "orthogonal-quantization"
        ],
        "local_code_dir": "src/auto_research/reproductions/dos",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "未旋转的 content/collaborative ensemble",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan app",
            "metric": "revenue",
            "lift_percent": 1.15,
            "traffic": "30% traffic, one week",
            "source_url": "https://arxiv.org/abs/2602.04460",
            "source_location": "original paper online-result disclosure: product=Meituan app; metric=revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "downstream-rewards",
      "title": "Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning",
      "paper_url": "https://arxiv.org/abs/2607.14192",
      "detail_path": "reproductions/2607.14192-downstream-rewards/README.md",
      "topic": [
        "long-term-value",
        "reward-design",
        "multi-surface",
        "retention"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-15",
      "code": null,
      "adapter": {
        "adapter_key": "downstream-rewards",
        "arxiv_id": "2607.14192",
        "title": "Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning",
        "paper_url": "https://arxiv.org/abs/2607.14192",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-15",
        "code_url": null,
        "topics": [
          "long-term-value",
          "reward-design",
          "multi-surface",
          "retention"
        ],
        "local_code_dir": "src/auto_research/reproductions/downstream_rewards",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "即时 next-item engagement，实验组加入筛选后的 downstream reward",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest Homefeed",
            "metric": "Successful Sessions",
            "lift_percent": 0.36,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.14192",
            "source_location": "original paper online-result disclosure: product=Pinterest Homefeed; metric=Successful Sessions"
          },
          {
            "product": "Pinterest Search",
            "metric": "Search Fulfillment Rate",
            "lift_percent": 0.25,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.14192",
            "source_location": "original paper online-result disclosure: product=Pinterest Search; metric=Search Fulfillment Rate"
          },
          {
            "product": "Pinterest Related Pins",
            "metric": "Successful Sessions",
            "lift_percent": 0.15,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2607.14192",
            "source_location": "original paper online-result disclosure: product=Pinterest Related Pins; metric=Successful Sessions"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dream",
      "title": "DREAM: A Dual-Loop Recommendation Evolution Framework Powered by Large Language Models",
      "paper_url": "https://arxiv.org/abs/2608.09408",
      "detail_path": "reproductions/2608.09408-dream/README.md",
      "topic": [
        "llm-recommendation",
        "ranking",
        "reranking",
        "intent-understanding",
        "online-policy",
        "serving"
      ],
      "first_author": "DREAM author team (alphabetical order)",
      "first_author_affiliation": "Taobao & Tmall Group / Alibaba",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "dream",
        "arxiv_id": "2608.09408",
        "title": "DREAM: A Dual-Loop Recommendation Evolution Framework Powered by Large Language Models",
        "paper_url": "https://arxiv.org/abs/2608.09408",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group / Alibaba",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "ranking",
          "reranking",
          "intent-understanding",
          "online-policy",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/dream",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "retrieval/ranking backbone without DREAM overlay",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "3 offline replay generations",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao homepage recommendation",
            "metric": "IPV",
            "lift_percent": 2.71,
            "traffic": "platform-scale online deployment of fine-rank + rerank",
            "source_url": "https://arxiv.org/pdf/2608.09408",
            "source_location": "Section 5.3.1 Table 7",
            "retrieved_at": "2026-08-20"
          },
          {
            "product": "Taobao homepage recommendation",
            "metric": "Core IPV",
            "lift_percent": 3.06,
            "traffic": "platform-scale online deployment of fine-rank + rerank",
            "source_url": "https://arxiv.org/pdf/2608.09408",
            "source_location": "Section 5.3.1 Table 7",
            "retrieved_at": "2026-08-20"
          },
          {
            "product": "Taobao homepage recommendation",
            "metric": "GMV",
            "lift_percent": 1.31,
            "traffic": "platform-scale online deployment of fine-rank + rerank",
            "source_url": "https://arxiv.org/pdf/2608.09408",
            "source_location": "Section 5.3.1 Table 7",
            "retrieved_at": "2026-08-20"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "drem",
      "title": "DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.12778",
      "detail_path": "reproductions/2608.12778-drem/README.md",
      "topic": [
        "ranking",
        "multi-objective",
        "robust-learning",
        "video-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Shenzhen University",
      "published": "2026-08-13",
      "code": null,
      "adapter": {
        "adapter_key": "drem",
        "arxiv_id": "2608.12778",
        "title": "DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.12778",
        "track": "recommendation",
        "organization": "Shenzhen University",
        "published": "2026-08-13",
        "code_url": null,
        "topics": [
          "ranking",
          "multi-objective",
          "robust-learning",
          "video-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/drem",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (proxy multi-objective channels)"
        ],
        "baseline": "naive weighted pxtr fusion under the same perturbations",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "naive_mean_absolute_drift",
          "robust_mean_absolute_drift"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; 24 fixed logit perturbations",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "industrial video recommendation",
            "metric": "Comment",
            "lift_percent": 1.388,
            "traffic": "7-day experiment; 5.1% main traffic per group",
            "source_url": "https://arxiv.org/html/2608.12778v1",
            "source_location": "Section 5.4, Table 2",
            "significance": "p < 0.005",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:robust-preference"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "drl-put",
      "title": "Deep Reinforcement Learning for Ranking Utility Tuning in the Ad Recommender System at Pinterest",
      "paper_url": "https://arxiv.org/abs/2509.05292",
      "detail_path": "reproductions/2509.05292-drl-put/README.md",
      "topic": [
        "ads-ranking",
        "reinforcement-learning",
        "utility-tuning",
        "off-policy"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2025-09-05",
      "code": null,
      "adapter": {
        "adapter_key": "drl-put",
        "arxiv_id": "2509.05292",
        "title": "Deep Reinforcement Learning for Ranking Utility Tuning in the Ad Recommender System at Pinterest",
        "paper_url": "https://arxiv.org/abs/2509.05292",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2025-09-05",
        "code_url": null,
        "topics": [
          "ads-ranking",
          "reinforcement-learning",
          "utility-tuning",
          "off-policy"
        ],
        "local_code_dir": "src/auto_research/reproductions/drl_put",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "fixed ranking utility weights",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "paper_results.ctr_percent",
          "paper_results.cvr_percent",
          "paper_results.platform_revenue_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest ads",
            "metric": "platform revenue",
            "lift_percent": 0.27,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2509.05292",
            "source_location": "original paper online-result disclosure: product=Pinterest ads; metric=platform revenue"
          },
          {
            "product": "Pinterest ads",
            "metric": "CTR",
            "lift_percent": 1.62,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2509.05292",
            "source_location": "original paper online-result disclosure: product=Pinterest ads; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dual-rerank",
      "title": "Dual-Rerank: Fusing Sequential Dependencies and Utility for Generative Reranking",
      "paper_url": "https://arxiv.org/abs/2604.07420",
      "detail_path": "reproductions/2604.07420-dual-rerank/README.md",
      "topic": [
        "reranking",
        "knowledge-distillation",
        "listwise-rl",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-04-08",
      "code": null,
      "adapter": {
        "adapter_key": "dual-rerank",
        "arxiv_id": "2604.07420",
        "title": "Dual-Rerank: Fusing Sequential Dependencies and Utility for Generative Reranking",
        "paper_url": "https://arxiv.org/abs/2604.07420",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-04-08",
        "code_url": null,
        "topics": [
          "reranking",
          "knowledge-distillation",
          "listwise-rl",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/dual_rerank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 dual-rerank 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.latency_ms",
          "paper_results.whole_page_ctr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.ldro_detached_list_reward",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Search",
            "metric": "Long View",
            "lift_percent": 1.107,
            "traffic": "5% traffic, one month",
            "source_url": "https://arxiv.org/abs/2604.07420",
            "source_location": "original paper online-result disclosure: product=Kuaishou Search; metric=Long View"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dual-sid",
      "title": "Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2607.24865",
      "detail_path": "reproductions/2607.24865-dual-sid/README.md",
      "topic": [
        "semantic-id",
        "retrieval",
        "ranking",
        "content-understanding",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Google DeepMind / YouTube",
      "published": "2026-07-26",
      "code": null,
      "adapter": {
        "adapter_key": "dual-sid",
        "arxiv_id": "2607.24865",
        "title": "Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2607.24865",
        "track": "recommendation",
        "organization": "Google DeepMind / YouTube",
        "published": "2026-07-26",
        "code_url": null,
        "topics": [
          "semantic-id",
          "retrieval",
          "ranking",
          "content-understanding",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/dual_sid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "同切分的 dense transition-content retrieval，实验组加入 Dual-purpose SID 与 SiDec",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "YouTube Watchpage ranking",
            "metric": "sitewide objective",
            "lift_percent": 0.09,
            "traffic": "production online experiment",
            "source_url": "https://arxiv.org/html/2607.24865v1#S4.SS2",
            "source_location": "Section 4.2 Table 1",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "YouTube retrieval",
            "metric": "homepage objective",
            "lift_percent": 0.13,
            "traffic": "production online experiment",
            "source_url": "https://arxiv.org/html/2607.24865v1#S4.SS2",
            "source_location": "Section 4.2 Table 1",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dualgr",
      "title": "DualGR: Generative Retrieval with Long and Short-Term Interests Modeling",
      "paper_url": "https://arxiv.org/abs/2511.12518",
      "detail_path": "reproductions/2511.12518-dualgr/README.md",
      "topic": [
        "retrieval",
        "generative-recommendation",
        "semantic-id",
        "long-short-interest"
      ],
      "first_author": null,
      "first_author_affiliation": "USTC / Kuaishou Technology",
      "published": "2025-11-16",
      "code": null,
      "adapter": {
        "adapter_key": "dualgr",
        "arxiv_id": "2511.12518",
        "title": "DualGR: Generative Retrieval with Long and Short-Term Interests Modeling",
        "paper_url": "https://arxiv.org/abs/2511.12518",
        "track": "recommendation",
        "organization": "USTC / Kuaishou Technology",
        "published": "2025-11-16",
        "code_url": null,
        "topics": [
          "retrieval",
          "generative-recommendation",
          "semantic-id",
          "long-short-interest"
        ],
        "local_code_dir": "src/auto_research/reproductions/dualgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 dualgr 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.exposure_aware_next_token_loss",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Video Views",
            "lift_percent": 0.527,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2511.12518",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=Video Views"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "dynamic-codebook",
      "title": "From a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.21012",
      "detail_path": "reproductions/2608.21012-dynamic-codebook/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "serving-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-08-21",
      "code": null,
      "adapter": {
        "adapter_key": "dynamic-codebook",
        "arxiv_id": "2608.21012",
        "title": "From a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.21012",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-08-21",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "serving-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/dynamic_codebook",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "primary consumption",
            "lift_percent": 0.792,
            "traffic": "2.5% traffic, 5 days",
            "source_url": "https://arxiv.org/html/2608.21012v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "easq",
      "title": "Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation",
      "paper_url": "https://arxiv.org/abs/2601.20215",
      "detail_path": "reproductions/2601.20215-easq/README.md",
      "topic": [
        "satisfaction-alignment",
        "preference-learning",
        "online-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-01-28",
      "code": null,
      "adapter": {
        "adapter_key": "easq",
        "arxiv_id": "2601.20215",
        "title": "Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation",
        "paper_url": "https://arxiv.org/abs/2601.20215",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-01-28",
        "code_url": null,
        "topics": [
          "satisfaction-alignment",
          "preference-learning",
          "online-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/easq",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou video recommendation",
            "metric": "User satisfaction metric",
            "lift_percent": 5.1,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.20215v1",
            "source_location": "Section 5.3",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:questionnaire-alignment"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "egr",
      "title": "EGR: Embedding-Native Generative Retrieval with a Shared LLM",
      "paper_url": "https://arxiv.org/abs/2607.23038",
      "detail_path": "reproductions/2607.23038-egr/README.md",
      "topic": [
        "retrieval",
        "generative-retrieval",
        "shared-encoder"
      ],
      "first_author": null,
      "first_author_affiliation": "Snap Inc.",
      "published": "2026-07-25",
      "code": null,
      "adapter": {
        "adapter_key": "egr",
        "arxiv_id": "2607.23038",
        "title": "EGR: Embedding-Native Generative Retrieval with a Shared LLM",
        "paper_url": "https://arxiv.org/abs/2607.23038",
        "track": "recommendation",
        "organization": "Snap Inc.",
        "published": "2026-07-25",
        "code_url": null,
        "topics": [
          "retrieval",
          "generative-retrieval",
          "shared-encoder"
        ],
        "local_code_dir": "src/auto_research/reproductions/egr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "separate transition/content retrieval",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "shared_encoder_passes",
          "indexed_items"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Snap DPA",
            "metric": "CVR",
            "lift_percent": 2.91,
            "traffic": "two-week test; 10%/10% traffic split",
            "source_url": "https://arxiv.org/html/2607.23038v1",
            "source_location": "Section 4.5, Table 6",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:embedding-native"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "ektm",
      "title": "Effective Knowledge Transfer for Multi-Task Recommendation Models",
      "paper_url": "https://arxiv.org/abs/2605.05730",
      "detail_path": "reproductions/2605.05730-ektm/README.md",
      "topic": [
        "multi-task-learning",
        "knowledge-transfer",
        "conversion"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei Technologies",
      "published": "2026-05-07",
      "code": null,
      "adapter": {
        "adapter_key": "ektm",
        "arxiv_id": "2605.05730",
        "title": "Effective Knowledge Transfer for Multi-Task Recommendation Models",
        "paper_url": "https://arxiv.org/abs/2605.05730",
        "track": "recommendation",
        "organization": "Huawei Technologies",
        "published": "2026-05-07",
        "code_url": null,
        "topics": [
          "multi-task-learning",
          "knowledge-transfer",
          "conversion"
        ],
        "local_code_dir": "src/auto_research/reproductions/ektm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "commercial recommendation platform",
            "metric": "eCPM",
            "lift_percent": 3.93,
            "traffic": "5%→20%→50%→100% traffic",
            "source_url": "https://arxiv.org/html/2605.05730v1",
            "source_location": "Section 4.4.2 / Figure 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "elise",
      "title": "Multilingual Semantic Retrieval for Apple Music Search",
      "paper_url": "https://arxiv.org/abs/2607.10239",
      "detail_path": "reproductions/2607.10239-elise/README.md",
      "topic": [
        "search",
        "multilingual-retrieval",
        "score-calibration"
      ],
      "first_author": null,
      "first_author_affiliation": "Apple",
      "published": "2026-07-11",
      "code": null,
      "adapter": {
        "adapter_key": "elise",
        "arxiv_id": "2607.10239",
        "title": "Multilingual Semantic Retrieval for Apple Music Search",
        "paper_url": "https://arxiv.org/abs/2607.10239",
        "track": "recommendation",
        "organization": "Apple",
        "published": "2026-07-11",
        "code_url": null,
        "topics": [
          "search",
          "multilingual-retrieval",
          "score-calibration"
        ],
        "local_code_dir": "src/auto_research/reproductions/elise",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "lexical/token-index retrieval",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "retrieval_sources",
          "quantile_matched"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Apple Music worldwide search",
            "metric": "Conversion Rate",
            "lift_percent": 2.28,
            "traffic": "18-day test; 10% treatment and 10% control",
            "source_url": "https://arxiv.org/html/2607.10239v1",
            "source_location": "Section 7.2, Table 8",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:quantile-fusion"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "esmm",
      "title": "Entire Space Multi-Task Model: An Effective Approach for Estimating Post-Click Conversion Rate",
      "paper_url": "https://arxiv.org/abs/1804.07931",
      "detail_path": "reproductions/1804.07931-esmm/README.md",
      "topic": [
        "ranking",
        "classic",
        "multi-task",
        "conversion"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2018-04-21",
      "code": null,
      "adapter": {
        "adapter_key": "esmm",
        "arxiv_id": "1804.07931",
        "title": "Entire Space Multi-Task Model: An Effective Approach for Estimating Post-Click Conversion Rate",
        "paper_url": "https://arxiv.org/abs/1804.07931",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2018-04-21",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "multi-task",
          "conversion"
        ],
        "local_code_dir": "src/auto_research/reproductions/esmm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K entire-space multitask construction"
        ],
        "baseline": "只在 clicked space 训练 CVR tower",
        "metrics": [
          "baseline.click_auc",
          "baseline.click_auc_std",
          "baseline.click_logloss",
          "baseline.click_logloss_std",
          "baseline.conversion_auc",
          "baseline.conversion_auc_std",
          "baseline.conversion_logloss",
          "baseline.conversion_logloss_std",
          "baseline.mean_auc",
          "baseline.mean_auc_std",
          "method.click_auc",
          "method.click_auc_std",
          "method.click_logloss",
          "method.click_logloss_std",
          "method.conversion_auc",
          "method.conversion_auc_std",
          "method.conversion_logloss",
          "method.conversion_logloss_std",
          "method.mean_auc",
          "method.mean_auc_std",
          "relative.conversion_auc_percent",
          "relative.mean_auc_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=200",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确批准 ESMM 为经典例外；原文工业部署不满足当前新论文的量化线上证据格式。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "evorec",
      "title": "EvoRec: Self-Evolving Agentic Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2606.28368",
      "detail_path": "reproductions/2606.28368-evorec/README.md",
      "topic": [
        "auto-research",
        "agent",
        "skill-evolution"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce Group",
      "published": "2026-06-15",
      "code": null,
      "adapter": {
        "adapter_key": "evorec",
        "arxiv_id": "2606.28368",
        "title": "EvoRec: Self-Evolving Agentic Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2606.28368",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce Group",
        "published": "2026-06-15",
        "code_url": null,
        "topics": [
          "auto-research",
          "agent",
          "skill-evolution"
        ],
        "local_code_dir": "src/auto_research/reproductions/evorec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "固定 ensemble，实验组为三代 skill-memory 进化结果",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba international recommendation",
            "metric": "Revenue",
            "lift_percent": 1.85,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2606.28368",
            "source_location": "original paper online-result disclosure: product=Alibaba international recommendation; metric=Revenue"
          },
          {
            "product": "Alibaba international recommendation",
            "metric": "CTR",
            "lift_percent": 1.02,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2606.28368",
            "source_location": "original paper online-result disclosure: product=Alibaba international recommendation; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "feedback-policy",
      "title": "From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.27789",
      "detail_path": "reproductions/2607.27789-feedback-policy/README.md",
      "topic": [
        "generative-recommendation",
        "policy-optimization",
        "distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Huazhong Agricultural University (Kuaishou internship)",
      "published": "2026-07-30",
      "code": null,
      "adapter": {
        "adapter_key": "feedback-policy",
        "arxiv_id": "2607.27789",
        "title": "From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.27789",
        "track": "recommendation",
        "organization": "Huazhong Agricultural University (Kuaishou internship)",
        "published": "2026-07-30",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "policy-optimization",
          "distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/feedback_policy",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou advertising",
            "metric": "Revenue",
            "lift_percent": 4.506,
            "traffic": "large-scale online A/B",
            "source_url": "https://arxiv.org/html/2607.27789v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "filterllm",
      "title": "FilterLLM: Text-To-Distribution LLM for Billion-Scale Cold-Start Recommendation",
      "paper_url": "https://arxiv.org/abs/2502.16924",
      "detail_path": "reproductions/2502.16924-filterllm/README.md",
      "topic": [
        "llm-recommendation",
        "cold-start",
        "retrieval",
        "text-to-distribution"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2025-02-24",
      "code": null,
      "adapter": {
        "adapter_key": "filterllm",
        "arxiv_id": "2502.16924",
        "title": "FilterLLM: Text-To-Distribution LLM for Billion-Scale Cold-Start Recommendation",
        "paper_url": "https://arxiv.org/abs/2502.16924",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2025-02-24",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "cold-start",
          "retrieval",
          "text-to-distribution"
        ],
        "local_code_dir": "src/auto_research/reproductions/filterllm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "content-to-item judgment",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "paper_results.gmv_percent",
          "paper_results.latency_reduction_percent",
          "paper_results.pctr_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba cold-start",
            "metric": "Cold-PV",
            "lift_percent": 5.13,
            "traffic": "two-month A/B",
            "source_url": "https://arxiv.org/abs/2502.16924",
            "source_location": "original paper online-result disclosure: product=Alibaba cold-start; metric=Cold-PV"
          },
          {
            "product": "Alibaba cold-start",
            "metric": "GMV",
            "lift_percent": 10.86,
            "traffic": "two-month A/B",
            "source_url": "https://arxiv.org/abs/2502.16924",
            "source_location": "original paper online-result disclosure: product=Alibaba cold-start; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "fluid",
      "title": "FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.21832",
      "detail_path": "reproductions/2605.21832-fluid/README.md",
      "topic": [
        "llm-recommendation",
        "multimodal",
        "semantic-id",
        "cold-start",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "TikTok / ByteDance",
      "published": "2026-05-20",
      "code": null,
      "adapter": {
        "adapter_key": "fluid",
        "arxiv_id": "2605.21832",
        "title": "FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.21832",
        "track": "recommendation",
        "organization": "TikTok / ByteDance",
        "published": "2026-05-20",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "multimodal",
          "semantic-id",
          "cold-start",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/fluid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "含 item transition/popularity 的 ID ranker",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "TikTok / ByteDance livestreaming",
            "metric": "Quality Watch Duration",
            "lift_percent": 0.55,
            "traffic": "production online A/B test",
            "source_url": "https://arxiv.org/abs/2605.21832",
            "source_location": "original paper online-result disclosure: product=TikTok / ByteDance livestreaming; metric=Quality Watch Duration"
          },
          {
            "product": "TikTok / ByteDance livestreaming",
            "metric": "Cold-Start Room Views",
            "lift_percent": 2.05,
            "traffic": "production online A/B test",
            "source_url": "https://arxiv.org/abs/2605.21832",
            "source_location": "original paper online-result disclosure: product=TikTok / ByteDance livestreaming; metric=Cold-Start Room Views"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "friend-gnn",
      "title": "Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling",
      "paper_url": "https://arxiv.org/abs/2608.27413",
      "detail_path": "reproductions/2608.27413-friend-gnn/README.md",
      "topic": [
        "friend-recommendation",
        "graph-ranking",
        "multi-hash-embedding",
        "temporal-sampling"
      ],
      "first_author": null,
      "first_author_affiliation": "AI VK",
      "published": "2026-08-27",
      "code": "https://github.com/makut/VK-GNN",
      "adapter": {
        "adapter_key": "friend-gnn",
        "arxiv_id": "2608.27413",
        "title": "Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling",
        "paper_url": "https://arxiv.org/abs/2608.27413",
        "track": "recommendation",
        "organization": "AI VK",
        "published": "2026-08-27",
        "code_url": "https://github.com/makut/VK-GNN",
        "topics": [
          "friend-recommendation",
          "graph-ranking",
          "multi-hash-embedding",
          "temporal-sampling"
        ],
        "local_code_dir": "src/auto_research/reproductions/friend_gnn",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "popularity ranker on the identical full candidate catalog",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "hash table compression",
          "temporal sampling complexity"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "VK friend recommendation",
            "metric": "friend additions",
            "lift_percent": 16.0,
            "traffic": "production A/B test",
            "source_url": "https://arxiv.org/html/2608.27413v1#S6.SS6",
            "source_location": "Section 6.6",
            "retrieved_at": "2026-08-29"
          },
          {
            "product": "VK friend recommendation",
            "metric": "unique friend adders",
            "lift_percent": 11.5,
            "traffic": "production A/B test",
            "source_url": "https://arxiv.org/html/2608.27413v1#S6.SS6",
            "source_location": "Section 6.6",
            "retrieved_at": "2026-08-29"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "fuxi-alpha",
      "title": "FuXi-α: Scaling Recommendation Model with Feature Interaction Enhanced Transformer",
      "paper_url": "https://arxiv.org/abs/2502.03036",
      "detail_path": "reproductions/2502.03036-fuxi-alpha/README.md",
      "topic": [
        "ranking",
        "transformer",
        "feature-interaction",
        "scaling"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei / USTC",
      "published": "2025-02-05",
      "code": "https://github.com/USTC-StarTeam/FuXi-alpha",
      "adapter": {
        "adapter_key": "fuxi-alpha",
        "arxiv_id": "2502.03036",
        "title": "FuXi-α: Scaling Recommendation Model with Feature Interaction Enhanced Transformer",
        "paper_url": "https://arxiv.org/abs/2502.03036",
        "track": "recommendation",
        "organization": "Huawei / USTC",
        "published": "2025-02-05",
        "code_url": "https://github.com/USTC-StarTeam/FuXi-alpha",
        "topics": [
          "ranking",
          "transformer",
          "feature-interaction",
          "scaling"
        ],
        "local_code_dir": "src/auto_research/reproductions/fuxi_alpha",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "single-channel sequential attention",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Huawei Music",
            "metric": "songs played",
            "lift_percent": 4.67,
            "traffic": "30% traffic, 7 days",
            "source_url": "https://arxiv.org/abs/2502.03036",
            "source_location": "original paper online-result disclosure: product=Huawei Music; metric=songs played"
          },
          {
            "product": "Huawei Music",
            "metric": "listening duration",
            "lift_percent": 5.1,
            "traffic": "30% traffic, 7 days",
            "source_url": "https://arxiv.org/abs/2502.03036",
            "source_location": "original paper online-result disclosure: product=Huawei Music; metric=listening duration"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "g2rec",
      "title": "Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.20554",
      "detail_path": "reproductions/2606.20554-g2rec/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "g2rec",
        "arxiv_id": "2606.20554",
        "title": "Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.20554",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/g2rec",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "Amazon Beauty 5-core"
        ],
        "baseline": "参数级别匹配的 Item-only Autoregressive Decoder",
        "metrics": [
          "configuration.profile_loss_weight",
          "ndcg_gain_percent",
          "results.g2rec_item_plus_interest_tokens.hit_at_10",
          "results.g2rec_item_plus_interest_tokens.ndcg_at_10",
          "results.item_tokens_only.hit_at_10",
          "results.item_tokens_only.ndcg_at_10",
          "training.g2rec_final_loss",
          "training.item_only_final_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gala",
      "title": "GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System",
      "paper_url": "https://arxiv.org/abs/2607.29213",
      "detail_path": "reproductions/2607.29213-gala/README.md",
      "topic": [
        "multimodal-recommendation",
        "representation-alignment",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Rajax Network Technology / Taobao Shangou / Alibaba",
      "published": "2026-07-31",
      "code": null,
      "adapter": {
        "adapter_key": "gala",
        "arxiv_id": "2607.29213",
        "title": "GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System",
        "paper_url": "https://arxiv.org/abs/2607.29213",
        "track": "recommendation",
        "organization": "Rajax Network Technology / Taobao Shangou / Alibaba",
        "published": "2026-07-31",
        "code_url": null,
        "topics": [
          "multimodal-recommendation",
          "representation-alignment",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/gala",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Shangou",
            "metric": "order volume",
            "lift_percent": 0.55,
            "traffic": "randomized traffic split",
            "source_url": "https://arxiv.org/html/2607.29213v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gatesid",
      "title": "GateSID: Adaptive Gating for Semantic-Collaborative Alignment in Cold-Start Recommendation",
      "paper_url": "https://arxiv.org/abs/2603.22916",
      "detail_path": "reproductions/2603.22916-gatesid/README.md",
      "topic": [
        "semantic-id",
        "cold-start",
        "contrastive-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce",
      "published": "2026-03-24",
      "code": null,
      "adapter": {
        "adapter_key": "gatesid",
        "arxiv_id": "2603.22916",
        "title": "GateSID: Adaptive Gating for Semantic-Collaborative Alignment in Cold-Start Recommendation",
        "paper_url": "https://arxiv.org/abs/2603.22916",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce",
        "published": "2026-03-24",
        "code_url": null,
        "topics": [
          "semantic-id",
          "cold-start",
          "contrastive-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/gatesid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "industrial recommendation",
            "metric": "GMV",
            "lift_percent": 2.6,
            "traffic": "20% traffic, two weeks",
            "source_url": "https://arxiv.org/html/2603.22916v1",
            "source_location": "Section 3.4",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "genfacet",
      "title": "GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce",
      "paper_url": "https://arxiv.org/abs/2603.19665",
      "detail_path": "reproductions/2603.19665-genfacet/README.md",
      "topic": [
        "e-commerce-search",
        "facet-generation",
        "preference-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "JD.com",
      "published": "2026-03-20",
      "code": null,
      "adapter": {
        "adapter_key": "genfacet",
        "arxiv_id": "2603.19665",
        "title": "GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce",
        "paper_url": "https://arxiv.org/abs/2603.19665",
        "track": "recommendation",
        "organization": "JD.com",
        "published": "2026-03-20",
        "code_url": null,
        "topics": [
          "e-commerce-search",
          "facet-generation",
          "preference-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/genfacet",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "JD.com e-commerce search",
            "metric": "Facet CTR",
            "lift_percent": 42.0,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2603.19665v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:facet-preference"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "genpage",
      "title": "GenPage: Towards End-to-End Generative Homepage Construction at Netflix",
      "paper_url": "https://arxiv.org/abs/2606.31031",
      "detail_path": "reproductions/2606.31031-genpage/README.md",
      "topic": [
        "generative-recommendation",
        "page-generation",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Netflix",
      "published": "2026-06-30",
      "code": null,
      "adapter": {
        "adapter_key": "genpage",
        "arxiv_id": "2606.31031",
        "title": "GenPage: Towards End-to-End Generative Homepage Construction at Netflix",
        "paper_url": "https://arxiv.org/abs/2606.31031",
        "track": "recommendation",
        "organization": "Netflix",
        "published": "2026-06-30",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "page-generation",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/genpage",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Netflix homepage",
            "metric": "core engagement",
            "lift_percent": 0.24,
            "traffic": "online A/B; p<0.001",
            "source_url": "https://arxiv.org/html/2606.31031v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "genrank",
      "title": "Towards Large-scale Generative Ranking",
      "paper_url": "https://arxiv.org/abs/2505.04180",
      "detail_path": "reproductions/2505.04180-genrank/README.md",
      "topic": [
        "generative-ranking",
        "action-modeling",
        "efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiaohongshu",
      "published": "2025-05",
      "code": null,
      "adapter": {
        "adapter_key": "genrank",
        "arxiv_id": "2505.04180",
        "title": "Towards Large-scale Generative Ranking",
        "paper_url": "https://arxiv.org/abs/2505.04180",
        "track": "recommendation",
        "organization": "Xiaohongshu",
        "published": "2025-05",
        "code_url": null,
        "topics": [
          "generative-ranking",
          "action-modeling",
          "efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/genrank",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K explicit action sequence"
        ],
        "baseline": "item/action 交错序列模型",
        "metrics": [
          "auc.genrank.mean",
          "auc.genrank.std",
          "auc.interleaved.mean",
          "auc.interleaved.std",
          "auc.relative_change_percent",
          "latency_ms_per_example.genrank.mean",
          "latency_ms_per_example.genrank.std",
          "latency_ms_per_example.interleaved.mean",
          "latency_ms_per_example.interleaved.std",
          "latency_ms_per_example.relative_change_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Explore Feed",
            "metric": "engagements",
            "lift_percent": 1.2474,
            "traffic": "10% treatment/control, 15 days",
            "source_url": "https://arxiv.org/abs/2505.04180",
            "source_location": "original paper online-result disclosure: product=Explore Feed; metric=engagements"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "genrec",
      "title": "GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation",
      "paper_url": "https://arxiv.org/abs/2604.14878",
      "detail_path": "reproductions/2604.14878-genrec/README.md",
      "topic": [
        "generative-recommendation",
        "grpo",
        "page-wise"
      ],
      "first_author": null,
      "first_author_affiliation": "JD.com",
      "published": "2026-04-16",
      "code": null,
      "adapter": {
        "adapter_key": "genrec",
        "arxiv_id": "2604.14878",
        "title": "GenRec: A Preference-Oriented Generative Framework for Large-Scale Recommendation",
        "paper_url": "https://arxiv.org/abs/2604.14878",
        "track": "recommendation",
        "organization": "JD.com",
        "published": "2026-04-16",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "grpo",
          "page-wise"
        ],
        "local_code_dir": "src/auto_research/reproductions/genrec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "point-wise ranker，实验组为 page-wise NTP + GRPO-SR",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "JD recommendation",
            "metric": "Clicks",
            "lift_percent": 9.5,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2604.14878",
            "source_location": "original paper online-result disclosure: product=JD recommendation; metric=Clicks"
          },
          {
            "product": "JD recommendation",
            "metric": "Transactions",
            "lift_percent": 8.7,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2604.14878",
            "source_location": "original paper online-result disclosure: product=JD recommendation; metric=Transactions"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "genrec-netflix",
      "title": "GenRec: An LLM-Backed Recommendation Ranker at Netflix",
      "paper_url": "https://arxiv.org/abs/2608.10257",
      "detail_path": "reproductions/2608.10257-genrec-netflix/README.md",
      "topic": [
        "ranking",
        "llm-recommendation",
        "post-training",
        "reward-weighting",
        "context-engineering",
        "training-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Netflix",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "genrec-netflix",
        "arxiv_id": "2608.10257",
        "title": "GenRec: An LLM-Backed Recommendation Ranker at Netflix",
        "paper_url": "https://arxiv.org/abs/2608.10257",
        "track": "recommendation",
        "organization": "Netflix",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "ranking",
          "llm-recommendation",
          "post-training",
          "reward-weighting",
          "context-engineering",
          "training-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/genrec_netflix",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "ID-only discriminative GRU ranker with matched Phase-2 examples",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "MRR",
          "head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Netflix batch-compute recommendation surfaces",
            "metric": "short-term homepage engagement",
            "lift_percent": 0.115,
            "traffic": "approximately 10% traffic",
            "source_url": "https://arxiv.org/html/2608.10257v1#S5.SS1",
            "source_location": "Section 5.1 / Figure 3",
            "experiment_duration": "4 weeks",
            "significance": "P = 3.1e-10",
            "retrieved_at": "2026-08-13"
          },
          {
            "product": "Netflix batch-compute recommendation surfaces",
            "metric": "long-term core metric",
            "lift_percent": 0.006,
            "traffic": "approximately 10% traffic",
            "source_url": "https://arxiv.org/html/2608.10257v1#S5.SS1",
            "source_location": "Section 5.1 / Figure 3",
            "experiment_duration": "4 weeks",
            "significance": "P = 0.025",
            "retrieved_at": "2026-08-13"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gese",
      "title": "Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation",
      "paper_url": "https://arxiv.org/abs/2609.15094",
      "detail_path": "reproductions/2609.15094-gese/README.md",
      "topic": [
        "presentation-layer",
        "headline-generation",
        "gspo",
        "bandit-selection"
      ],
      "first_author": null,
      "first_author_affiliation": "Baidu",
      "published": "2026-09-14",
      "code": null,
      "adapter": {
        "adapter_key": "gese",
        "arxiv_id": "2609.15094",
        "title": "Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation",
        "paper_url": "https://arxiv.org/abs/2609.15094",
        "track": "recommendation",
        "organization": "Baidu",
        "published": "2026-09-14",
        "code_url": null,
        "topics": [
          "presentation-layer",
          "headline-generation",
          "gspo",
          "bandit-selection"
        ],
        "local_code_dir": "src/auto_research/reproductions/gese",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "commercial information feed with 100M+ DAU",
            "metric": "CTR",
            "lift_percent": 2.57,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.15094v1",
            "source_location": "Section 4.2; Table 2",
            "retrieved_at": "2026-09-16"
          },
          {
            "product": "commercial information feed with 100M+ DAU",
            "metric": "dwell time",
            "lift_percent": 0.87,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2609.15094v1",
            "source_location": "Section 4.2; Table 2",
            "retrieved_at": "2026-09-16"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "glide",
      "title": "Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify",
      "paper_url": "https://arxiv.org/abs/2603.17540",
      "detail_path": "reproductions/2603.17540-glide/README.md",
      "topic": [
        "generative-retrieval",
        "semantic-id",
        "soft-prompt"
      ],
      "first_author": null,
      "first_author_affiliation": "Spotify",
      "published": "2026-03-18",
      "code": null,
      "adapter": {
        "adapter_key": "glide",
        "arxiv_id": "2603.17540",
        "title": "Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify",
        "paper_url": "https://arxiv.org/abs/2603.17540",
        "track": "recommendation",
        "organization": "Spotify",
        "published": "2026-03-18",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "semantic-id",
          "soft-prompt"
        ],
        "local_code_dir": "src/auto_research/reproductions/glide",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "传统 transition/content retrieval，实验组为 Semantic-ID 双 prompt 检索",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Spotify",
            "metric": "Non-habitual streaming",
            "lift_percent": 5.4,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.17540",
            "source_location": "original paper online-result disclosure: product=Spotify; metric=Non-habitual streaming"
          },
          {
            "product": "Spotify",
            "metric": "New-show discovery",
            "lift_percent": 14.3,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.17540",
            "source_location": "original paper online-result disclosure: product=Spotify; metric=New-show discovery"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "glorank",
      "title": "From Local Indices to Global Identifiers: Generative Reranking via Global Action Space",
      "paper_url": "https://arxiv.org/abs/2604.25291",
      "detail_path": "reproductions/2604.25291-glorank/README.md",
      "topic": [
        "reranking",
        "generative-recommendation",
        "semantic-id",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "City University of Hong Kong / Kuaishou / UC San Diego",
      "published": "2026-04-28",
      "code": null,
      "adapter": {
        "adapter_key": "glorank",
        "arxiv_id": "2604.25291",
        "title": "From Local Indices to Global Identifiers: Generative Reranking via Global Action Space",
        "paper_url": "https://arxiv.org/abs/2604.25291",
        "track": "recommendation",
        "organization": "City University of Hong Kong / Kuaishou / UC San Diego",
        "published": "2026-04-28",
        "code_url": null,
        "topics": [
          "reranking",
          "generative-recommendation",
          "semantic-id",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/glorank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 glorank 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.group_relative_reward_update",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Watch Time",
            "lift_percent": 0.095,
            "traffic": "7.8% traffic, 14 days",
            "source_url": "https://arxiv.org/abs/2604.25291",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=Watch Time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gpl-prerank",
      "title": "Generative Pseudo-Labeling for Pre-Ranking with LLMs",
      "paper_url": "https://arxiv.org/abs/2602.20995",
      "detail_path": "reproductions/2602.20995-gpl-prerank/README.md",
      "topic": [
        "pre-ranking",
        "pseudo-labeling",
        "llm-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Renmin University",
      "published": "2026-02-24",
      "code": null,
      "adapter": {
        "adapter_key": "gpl-prerank",
        "arxiv_id": "2602.20995",
        "title": "Generative Pseudo-Labeling for Pre-Ranking with LLMs",
        "paper_url": "https://arxiv.org/abs/2602.20995",
        "track": "recommendation",
        "organization": "Alibaba Group / Renmin University",
        "published": "2026-02-24",
        "code_url": null,
        "topics": [
          "pre-ranking",
          "pseudo-labeling",
          "llm-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/gpl_prerank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Guess What You Like",
            "metric": "CTR",
            "lift_percent": 3.07,
            "traffic": "hundreds of millions DAU, two weeks",
            "source_url": "https://arxiv.org/html/2602.20995v1",
            "source_location": "Section 4.5 / Table 4",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gr4ad",
      "title": "Generative Recommendation for Large-Scale Advertising",
      "paper_url": "https://arxiv.org/abs/2602.22732",
      "detail_path": "reproductions/2602.22732-gr4ad/README.md",
      "topic": [
        "generative-retrieval",
        "advertising",
        "reinforcement-learning",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-02",
      "code": null,
      "adapter": {
        "adapter_key": "gr4ad",
        "arxiv_id": "2602.22732",
        "title": "Generative Recommendation for Large-Scale Advertising",
        "paper_url": "https://arxiv.org/abs/2602.22732",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-02",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "advertising",
          "reinforcement-learning",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/gr4ad",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "DIN，GR4AD NDCG@10 相对 DIN +69.67%",
        "metrics": [
          "paper_online_ab.ad_revenue_percent",
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.dlrm.hit_at_10",
          "results.dlrm.ndcg_at_10",
          "results.gr4ad.hit_at_10",
          "results.gr4ad.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Ads",
            "metric": "ad revenue",
            "lift_percent": 4.2,
            "traffic": "large-scale online A/B",
            "source_url": "https://arxiv.org/abs/2602.22732",
            "source_location": "original paper online-result disclosure: product=Kuaishou Ads; metric=ad revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "grc",
      "title": "Learning to Reflect and Correct: Towards Better Decoding Trajectories for Large-Scale Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2602.23639",
      "detail_path": "reproductions/2602.23639-grc/README.md",
      "topic": [
        "generative-recommendation",
        "reinforcement-learning",
        "self-correction"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International / Wuhan University",
      "published": "2026-02-27",
      "code": null,
      "adapter": {
        "adapter_key": "grc",
        "arxiv_id": "2602.23639",
        "title": "Learning to Reflect and Correct: Towards Better Decoding Trajectories for Large-Scale Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2602.23639",
        "track": "recommendation",
        "organization": "Alibaba International / Wuhan University",
        "published": "2026-02-27",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "reinforcement-learning",
          "self-correction"
        ],
        "local_code_dir": "src/auto_research/reproductions/grc",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "同一 SID 的 GR backbone",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba International",
            "metric": "Revenue",
            "lift_percent": 1.79,
            "traffic": "2026-01-02 to 2026-01-12, 15%/15%",
            "source_url": "https://arxiv.org/abs/2602.23639",
            "source_location": "original paper online-result disclosure: product=Alibaba International; metric=Revenue"
          },
          {
            "product": "Alibaba International",
            "metric": "CTR",
            "lift_percent": 2.11,
            "traffic": "2026-01-02 to 2026-01-12, 15%/15%",
            "source_url": "https://arxiv.org/abs/2602.23639",
            "source_location": "original paper online-result disclosure: product=Alibaba International; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "growthgr",
      "title": "Towards Sustainable Growth: A Multi-Value-Aware Retrieval Framework for E-Commerce Search",
      "paper_url": "https://arxiv.org/abs/2605.17994",
      "detail_path": "reproductions/2605.17994-growthgr/README.md",
      "topic": [
        "generative-recommendation",
        "reinforcement-learning",
        "new-items"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Taobao & Tmall",
      "published": "2026-05-18",
      "code": null,
      "adapter": {
        "adapter_key": "growthgr",
        "arxiv_id": "2605.17994",
        "title": "Towards Sustainable Growth: A Multi-Value-Aware Retrieval Framework for E-Commerce Search",
        "paper_url": "https://arxiv.org/abs/2605.17994",
        "track": "recommendation",
        "organization": "Alibaba Group / Taobao & Tmall",
        "published": "2026-05-18",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "reinforcement-learning",
          "new-items"
        ],
        "local_code_dir": "src/auto_research/reproductions/growthgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "同一 transition policy 的 NTP retrieval",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao/Tmall Search",
            "metric": "new-item GMV",
            "lift_percent": 5.3,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2605.17994",
            "source_location": "original paper online-result disclosure: product=Taobao/Tmall Search; metric=new-item GMV"
          },
          {
            "product": "Taobao/Tmall Search",
            "metric": "overall search GMV",
            "lift_percent": 0.3,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2605.17994",
            "source_location": "original paper online-result disclosure: product=Taobao/Tmall Search; metric=overall search GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "gryphon-v2",
      "title": "Gryphon-v2: One Model in Place of a Cascade — Generate-and-Rank Recommender with Rollout Distillation",
      "paper_url": "https://arxiv.org/abs/2608.06213",
      "detail_path": "reproductions/2608.06213-gryphon-v2/README.md",
      "topic": [
        "generative-recommendation",
        "retrieval",
        "ranking",
        "rollout-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Yandex",
      "published": "2026-08-06",
      "code": null,
      "adapter": {
        "adapter_key": "gryphon-v2",
        "arxiv_id": "2608.06213",
        "title": "Gryphon-v2: One Model in Place of a Cascade — Generate-and-Rank Recommender with Rollout Distillation",
        "paper_url": "https://arxiv.org/abs/2608.06213",
        "track": "recommendation",
        "organization": "Yandex",
        "published": "2026-08-06",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "retrieval",
          "ranking",
          "rollout-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/gryphon_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同预算生成式召回，实验组加入双来源蒸馏与 ranker",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "gryphon_v2.hit_at_10",
          "gryphon_v2.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Yandex Music large-scale recommendation surface",
            "metric": "active users",
            "lift_percent": 1.41,
            "traffic": "single model replaces 15+ candidate generators, pre-ranking and final ranking at comparable latency",
            "source_url": "https://arxiv.org/abs/2608.06213",
            "source_location": "original paper online-result disclosure: product=Yandex Music large-scale recommendation surface; metric=active users"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "guess-where-you-go",
      "title": "Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap",
      "paper_url": "https://arxiv.org/abs/2607.26073",
      "detail_path": "reproductions/2607.26073-guess-where-you-go/README.md",
      "topic": [
        "generative-recommendation",
        "next-poi",
        "semantic-id",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Amap / Alibaba",
      "published": "2026-07-13",
      "code": "https://github.com/alibaba/SimCIT",
      "adapter": {
        "adapter_key": "guess-where-you-go",
        "arxiv_id": "2607.26073",
        "title": "Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap",
        "paper_url": "https://arxiv.org/abs/2607.26073",
        "track": "recommendation",
        "organization": "Amap / Alibaba",
        "published": "2026-07-13",
        "code_url": "https://github.com/alibaba/SimCIT",
        "topics": [
          "generative-recommendation",
          "next-poi",
          "semantic-id",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/guess_where_you_go",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Amap homepage",
            "metric": "P-CTR",
            "lift_percent": 5.83,
            "traffic": "one-month A/B",
            "source_url": "https://arxiv.org/html/2607.26073v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ha-moe",
      "title": "Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study",
      "paper_url": "https://arxiv.org/abs/2607.27577",
      "detail_path": "reproductions/2607.27577-ha-moe/README.md",
      "topic": [
        "ranking",
        "mixture-of-experts",
        "heterogeneity",
        "diversity"
      ],
      "first_author": null,
      "first_author_affiliation": "Google / Discover",
      "published": "2026-07-30",
      "code": null,
      "adapter": {
        "adapter_key": "ha-moe",
        "arxiv_id": "2607.27577",
        "title": "Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study",
        "paper_url": "https://arxiv.org/abs/2607.27577",
        "track": "recommendation",
        "organization": "Google / Discover",
        "published": "2026-07-30",
        "code_url": null,
        "topics": [
          "ranking",
          "mixture-of-experts",
          "heterogeneity",
          "diversity"
        ],
        "local_code_dir": "src/auto_research/reproductions/ha_moe",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "同切分的 homogeneous transition-content ranker，实验组加入 HA-MoE",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Google Discover",
            "metric": "DAU",
            "lift_percent": 0.22,
            "traffic": "7-day 1% live-traffic A/B",
            "source_url": "https://arxiv.org/html/2607.27577v1#S4.SS4",
            "source_location": "Section 4.4 Table 4",
            "experiment_duration": "7 days",
            "significance": "±0.11%",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "Google Discover",
            "metric": "Diverse Engagement Rate",
            "lift_percent": 0.54,
            "traffic": "7-day 1% live-traffic A/B",
            "source_url": "https://arxiv.org/html/2607.27577v1#S4.SS4",
            "source_location": "Section 4.4 Table 4",
            "experiment_duration": "7 days",
            "significance": "±0.07%",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hap",
      "title": "Not All Candidates are Created Equal: Heterogeneity-Aware Pre-ranking",
      "paper_url": "https://arxiv.org/abs/2603.03770",
      "detail_path": "reproductions/2603.03770-hap/README.md",
      "topic": [
        "pre-ranking",
        "contrastive-learning",
        "dynamic-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Toutiao",
      "published": "2026-03-04",
      "code": "https://github.com/Toutiao-Rec/HAP",
      "adapter": {
        "adapter_key": "hap",
        "arxiv_id": "2603.03770",
        "title": "Not All Candidates are Created Equal: Heterogeneity-Aware Pre-ranking",
        "paper_url": "https://arxiv.org/abs/2603.03770",
        "track": "recommendation",
        "organization": "ByteDance / Toutiao",
        "published": "2026-03-04",
        "code_url": "https://github.com/Toutiao-Rec/HAP",
        "topics": [
          "pre-ranking",
          "contrastive-learning",
          "dynamic-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/hap",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 hap 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Toutiao",
            "metric": "App Usage Duration",
            "lift_percent": 0.4,
            "traffic": "nine-month deployment",
            "source_url": "https://arxiv.org/abs/2603.03770",
            "source_location": "original paper online-result disclosure: product=Toutiao; metric=App Usage Duration"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "harmonrank",
      "title": "Rethinking Multi-objective Ranking Ensemble in Recommender System: From Score Fusion to Rank Consistency",
      "paper_url": "https://arxiv.org/abs/2601.02955",
      "detail_path": "reproductions/2601.02955-harmonrank/README.md",
      "topic": [
        "multi-objective-ranking",
        "rank-consistency",
        "ensemble"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-01-06",
      "code": null,
      "adapter": {
        "adapter_key": "harmonrank",
        "arxiv_id": "2601.02955",
        "title": "Rethinking Multi-objective Ranking Ensemble in Recommender System: From Score Fusion to Rank Consistency",
        "paper_url": "https://arxiv.org/abs/2601.02955",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-01-06",
        "code_url": null,
        "topics": [
          "multi-objective-ranking",
          "rank-consistency",
          "ensemble"
        ],
        "local_code_dir": "src/auto_research/reproductions/harmonrank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou live e-commerce",
            "metric": "Purchase",
            "lift_percent": 2.635,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.02955v1",
            "source_location": "Section 5.7",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:rank-consistency"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "harness-lm",
      "title": "HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval",
      "paper_url": "https://arxiv.org/abs/2605.23572",
      "detail_path": "reproductions/2605.23572-harness-lm/README.md",
      "topic": [
        "llm-recommendation",
        "retrieval",
        "distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Microsoft AI / Bing Ads",
      "published": "2026-05-22",
      "code": null,
      "adapter": {
        "adapter_key": "harness-lm",
        "arxiv_id": "2605.23572",
        "title": "HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval",
        "paper_url": "https://arxiv.org/abs/2605.23572",
        "track": "recommendation",
        "organization": "Microsoft AI / Bing Ads",
        "published": "2026-05-22",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "retrieval",
          "distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/harness_lm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "小型对称内容 retriever",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Bing Ads",
            "metric": "Revenue",
            "lift_percent": 1.0,
            "traffic": "production deployment",
            "source_url": "https://arxiv.org/abs/2605.23572",
            "source_location": "original paper online-result disclosure: product=Bing Ads; metric=Revenue"
          },
          {
            "product": "Bing Ads",
            "metric": "Clicks",
            "lift_percent": 0.4,
            "traffic": "production deployment",
            "source_url": "https://arxiv.org/abs/2605.23572",
            "source_location": "original paper online-result disclosure: product=Bing Ads; metric=Clicks"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hcub",
      "title": "Hierarchical Contextual Uplift Bandits for Catalog Personalization",
      "paper_url": "https://arxiv.org/abs/2601.14333",
      "detail_path": "reproductions/2601.14333-hcub/README.md",
      "topic": [
        "bandit",
        "uplift-modeling",
        "catalog-personalization"
      ],
      "first_author": null,
      "first_author_affiliation": "Dream11",
      "published": "2026-01-20",
      "code": null,
      "adapter": {
        "adapter_key": "hcub",
        "arxiv_id": "2601.14333",
        "title": "Hierarchical Contextual Uplift Bandits for Catalog Personalization",
        "paper_url": "https://arxiv.org/abs/2601.14333",
        "track": "recommendation",
        "organization": "Dream11",
        "published": "2026-01-20",
        "code_url": null,
        "topics": [
          "bandit",
          "uplift-modeling",
          "catalog-personalization"
        ],
        "local_code_dir": "src/auto_research/reproductions/hcub",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Dream11 catalog personalization",
            "metric": "Revenue",
            "lift_percent": 0.51,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.14333v1",
            "source_location": "Introduction and online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:hierarchical-uplift"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "higr",
      "title": "HiGR: Industrial-Scale Hierarchical Generative Slate Recommendation Framework in Tencent",
      "paper_url": "https://arxiv.org/abs/2512.24787",
      "detail_path": "reproductions/2512.24787-higr/README.md",
      "topic": [
        "generative-recommendation",
        "slate-recommendation",
        "semantic-id",
        "preference-optimization"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2025-12-31",
      "code": null,
      "adapter": {
        "adapter_key": "higr",
        "arxiv_id": "2512.24787",
        "title": "HiGR: Industrial-Scale Hierarchical Generative Slate Recommendation Framework in Tencent",
        "paper_url": "https://arxiv.org/abs/2512.24787",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2025-12-31",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "slate-recommendation",
          "semantic-id",
          "preference-optimization"
        ],
        "local_code_dir": "src/auto_research/reproductions/higr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "flat item-level slate ranking",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent video",
            "metric": "stay time",
            "lift_percent": 1.03,
            "traffic": "5% traffic",
            "source_url": "https://arxiv.org/abs/2512.24787",
            "source_location": "original paper online-result disclosure: product=Tencent video; metric=stay time"
          },
          {
            "product": "Tencent video",
            "metric": "video views",
            "lift_percent": 1.73,
            "traffic": "5% traffic",
            "source_url": "https://arxiv.org/abs/2512.24787",
            "source_location": "original paper online-result disclosure: product=Tencent video; metric=video views"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hill-index",
      "title": "Efficient Retrieval Scaling with Hierarchical Indexing for Large Scale Recommendation",
      "paper_url": "https://arxiv.org/abs/2604.12965",
      "detail_path": "reproductions/2604.12965-hill-index/README.md",
      "topic": [
        "retrieval",
        "hierarchical-index",
        "residual-quantization",
        "test-time-training",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta / Facebook and Instagram Ads",
      "published": "2026-04-14",
      "code": null,
      "adapter": {
        "adapter_key": "hill-index",
        "arxiv_id": "2604.12965",
        "title": "Efficient Retrieval Scaling with Hierarchical Indexing for Large Scale Recommendation",
        "paper_url": "https://arxiv.org/abs/2604.12965",
        "track": "recommendation",
        "organization": "Meta / Facebook and Instagram Ads",
        "published": "2026-04-14",
        "code_url": null,
        "topics": [
          "retrieval",
          "hierarchical-index",
          "residual-quantization",
          "test-time-training",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/hill_index",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "one-layer learned index with the same public item features and retrieval protocol",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "head_share_at_10",
          "mean_scored_items"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "6 coarse nodes; up to 6 residual child nodes per parent",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta Ads Retrieval",
            "metric": "online ads metric",
            "lift_percent": 2.57,
            "traffic": "production online A/B: 2-layer MoNN Large/Small versus MoNN Small",
            "source_url": "https://arxiv.org/html/2604.12965v1#S4.SS5",
            "source_location": "Section 4.5, Table 8",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "rankmixer_hill_index"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "hisac",
      "title": "HiSAC: Hierarchical Sparse Activation Compression for Ultra-long Sequence Modeling in Recommenders",
      "paper_url": "https://arxiv.org/abs/2602.21009",
      "detail_path": "reproductions/2602.21009-hisac/README.md",
      "topic": [
        "long-sequence",
        "sparse-activation",
        "semantic-id"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2026-02-24",
      "code": null,
      "adapter": {
        "adapter_key": "hisac",
        "arxiv_id": "2602.21009",
        "title": "HiSAC: Hierarchical Sparse Activation Compression for Ultra-long Sequence Modeling in Recommenders",
        "paper_url": "https://arxiv.org/abs/2602.21009",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2026-02-24",
        "code_url": null,
        "topics": [
          "long-sequence",
          "sparse-activation",
          "semantic-id"
        ],
        "local_code_dir": "src/auto_research/reproductions/hisac",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "recent-window dense proxy",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao recommendation",
            "metric": "CTR",
            "lift_percent": 1.65,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.21009",
            "source_location": "original paper online-result disclosure: product=Taobao recommendation; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hpgr",
      "title": "Beyond the Flat Sequence: Hierarchical and Preference-Aware Generative Recommendations",
      "paper_url": "https://arxiv.org/abs/2603.00980",
      "detail_path": "reproductions/2603.00980-hpgr/README.md",
      "topic": [
        "generative-recommendation",
        "hierarchical-sequence",
        "sparse-attention"
      ],
      "first_author": null,
      "first_author_affiliation": "Harbin Institute of Technology",
      "published": "2026-03-01",
      "code": null,
      "adapter": {
        "adapter_key": "hpgr",
        "arxiv_id": "2603.00980",
        "title": "Beyond the Flat Sequence: Hierarchical and Preference-Aware Generative Recommendations",
        "paper_url": "https://arxiv.org/abs/2603.00980",
        "track": "recommendation",
        "organization": "Harbin Institute of Technology",
        "published": "2026-03-01",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "hierarchical-sequence",
          "sparse-attention"
        ],
        "local_code_dir": "src/auto_research/reproductions/hpgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Huawei AppGallery recommendation",
            "metric": "eCPM",
            "lift_percent": 1.99,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2603.00980v1",
            "source_location": "Section 1 and online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:hierarchical-preference"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "hrpo",
      "title": "Hierarchical Residual Policy Optimization for Generative Recommendations",
      "paper_url": "https://arxiv.org/abs/2608.00750",
      "detail_path": "reproductions/2608.00750-hrpo/README.md",
      "topic": [
        "generative-recommendation",
        "reinforcement-learning",
        "semantic-id",
        "credit-assignment"
      ],
      "first_author": null,
      "first_author_affiliation": "City University of Hong Kong / Kuaishou",
      "published": "2026-08-01",
      "code": "https://github.com/Applied-Machine-Learning-Lab/KDD2026-HRPO",
      "adapter": {
        "adapter_key": "hrpo",
        "arxiv_id": "2608.00750",
        "title": "Hierarchical Residual Policy Optimization for Generative Recommendations",
        "paper_url": "https://arxiv.org/abs/2608.00750",
        "track": "recommendation",
        "organization": "City University of Hong Kong / Kuaishou",
        "published": "2026-08-01",
        "code_url": "https://github.com/Applied-Machine-Learning-Lab/KDD2026-HRPO",
        "topics": [
          "generative-recommendation",
          "reinforcement-learning",
          "semantic-id",
          "credit-assignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/hrpo",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "paper_results.fiction_target_cost_percent",
          "paper_results.mini_game_target_cost_percent",
          "paper_results.short_drama_target_cost_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "variants.hrpo residual-return policy.hit_at_10",
          "variants.hrpo residual-return policy.ndcg_at_10",
          "variants.sid sft.hit_at_10",
          "variants.sid sft.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Fiction IAA",
            "metric": "Target Cost",
            "lift_percent": 3.49,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2608.00750",
            "source_location": "original paper online-result disclosure: product=Kuaishou Fiction IAA; metric=Target Cost"
          },
          {
            "product": "Kuaishou Mini-Game IAA",
            "metric": "Target Cost",
            "lift_percent": 0.186,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2608.00750",
            "source_location": "original paper online-result disclosure: product=Kuaishou Mini-Game IAA; metric=Target Cost"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hstu",
      "title": "Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations",
      "paper_url": "https://arxiv.org/abs/2402.17152",
      "detail_path": "reproductions/2402.17152-hstu/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": "https://github.com/meta-recsys/generative-recommenders",
      "adapter": {
        "adapter_key": "hstu",
        "arxiv_id": "2402.17152",
        "title": "Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations",
        "paper_url": "https://arxiv.org/abs/2402.17152",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": "https://github.com/meta-recsys/generative-recommenders",
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/hstu",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "维度、层数、heads、loss 和训练步数匹配的 SASRec",
        "metrics": [
          "hstu.hit_at_10",
          "hstu.hit_at_10_std",
          "hstu.ndcg_at_10",
          "hstu.ndcg_at_10_std",
          "ndcg_gain_percent",
          "sasrec.hit_at_10",
          "sasrec.hit_at_10_std",
          "sasrec.ndcg_at_10",
          "sasrec.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=320",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "hyformer",
      "title": "HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction",
      "paper_url": "https://arxiv.org/abs/2601.12681",
      "detail_path": "reproductions/2601.12681-hyformer/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "hyformer",
        "arxiv_id": "2601.12681",
        "title": "HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction",
        "paper_url": "https://arxiv.org/abs/2601.12681",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/hyformer",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "独立 sequence Transformer+dense MLP 的 Late Fusion",
        "metrics": [
          "ndcg_gain_percent",
          "results.hyformer.hit_at_10",
          "results.hyformer.hit_at_10_std",
          "results.hyformer.ndcg_at_10",
          "results.hyformer.ndcg_at_10_std",
          "results.late_fusion.hit_at_10",
          "results.late_fusion.hit_at_10_std",
          "results.late_fusion.ndcg_at_10",
          "results.late_fusion.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "idproxy",
      "title": "IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs",
      "paper_url": "https://arxiv.org/abs/2603.01590",
      "detail_path": "reproductions/2603.01590-idproxy/README.md",
      "topic": [
        "multimodal-llm",
        "id-alignment",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiaohongshu / Shanghai Jiao Tong University / Fudan University",
      "published": "2026-03-02",
      "code": null,
      "adapter": {
        "adapter_key": "idproxy",
        "arxiv_id": "2603.01590",
        "title": "IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs",
        "paper_url": "https://arxiv.org/abs/2603.01590",
        "track": "recommendation",
        "organization": "Xiaohongshu / Shanghai Jiao Tong University / Fudan University",
        "published": "2026-03-02",
        "code_url": null,
        "topics": [
          "multimodal-llm",
          "id-alignment",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/idproxy",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "ID-only ranker，实验组为 coarse-to-fine IDProxy",
        "metrics": [
          "alignment.contrastive_final_loss",
          "alignment.contrastive_initial_loss",
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=40",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Xiaohongshu content feed",
            "metric": "Engagement",
            "lift_percent": 0.5,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.01590",
            "source_location": "original paper online-result disclosure: product=Xiaohongshu content feed; metric=Engagement"
          },
          {
            "product": "Xiaohongshu ads",
            "metric": "ADVV",
            "lift_percent": 1.93,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.01590",
            "source_location": "original paper online-result disclosure: product=Xiaohongshu ads; metric=ADVV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "incrementality",
      "title": "From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.10182",
      "detail_path": "reproductions/2608.10182-incrementality/README.md",
      "topic": [
        "causal-recommendation",
        "uplift",
        "bandit",
        "constrained-allocation"
      ],
      "first_author": null,
      "first_author_affiliation": "LinkedIn",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "incrementality",
        "arxiv_id": "2608.10182",
        "title": "From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.10182",
        "track": "recommendation",
        "organization": "LinkedIn",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "causal-recommendation",
          "uplift",
          "bandit",
          "constrained-allocation"
        ],
        "local_code_dir": "src/auto_research/reproductions/incrementality",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K causal targeting simulation"
        ],
        "baseline": "predictive treated-outcome targeting at the same budget",
        "metrics": [
          "policy_value",
          "total_incremental_value",
          "uplift_rank_correlation"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users; 30% treatment budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "LinkedIn Feed marketing traffic",
            "metric": "primary long-term-value KPI",
            "lift_percent": 7.2,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/html/2608.10182v1",
            "source_location": "Section 4 online evaluation",
            "significance": "p = 0.041",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:incrementality"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "inthq",
      "title": "IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.09634",
      "detail_path": "reproductions/2608.09634-inthq/README.md",
      "topic": [
        "multi-task-learning",
        "generative-recommendation",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "Amap / Alibaba",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "inthq",
        "arxiv_id": "2608.09634",
        "title": "IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.09634",
        "track": "recommendation",
        "organization": "Amap / Alibaba",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "multi-task-learning",
          "generative-recommendation",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/inthq",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Amap",
            "metric": "UVCTR",
            "lift_percent": 1.6,
            "traffic": "20% per bucket, 7 days",
            "source_url": "https://arxiv.org/html/2608.09634v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "intsr",
      "title": "IntSR: An Integrated Generative Framework for Search and Recommendation",
      "paper_url": "https://arxiv.org/abs/2509.21179",
      "detail_path": "reproductions/2509.21179-intsr/README.md",
      "topic": [
        "search",
        "recommendation",
        "generative-retrieval",
        "content-understanding"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Amap",
      "published": "2025-09-25",
      "code": null,
      "adapter": {
        "adapter_key": "intsr",
        "arxiv_id": "2509.21179",
        "title": "IntSR: An Integrated Generative Framework for Search and Recommendation",
        "paper_url": "https://arxiv.org/abs/2509.21179",
        "track": "recommendation",
        "organization": "Alibaba / Amap",
        "published": "2025-09-25",
        "code_url": null,
        "topics": [
          "search",
          "recommendation",
          "generative-retrieval",
          "content-understanding"
        ],
        "local_code_dir": "src/auto_research/reproductions/intsr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 intsr 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.gmv_percent",
          "paper_results.poi_ctr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Amap",
            "metric": "GMV",
            "lift_percent": 9.34,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2509.21179",
            "source_location": "original paper online-result disclosure: product=Amap; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "journeyformer",
      "title": "JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling",
      "paper_url": "https://arxiv.org/abs/2606.19108",
      "detail_path": "reproductions/2606.19108-journeyformer/README.md",
      "topic": [
        "search-ranking",
        "sequence-modeling",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "Airbnb",
      "published": "2026-06-17",
      "code": null,
      "adapter": {
        "adapter_key": "journeyformer",
        "arxiv_id": "2606.19108",
        "title": "JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling",
        "paper_url": "https://arxiv.org/abs/2606.19108",
        "track": "recommendation",
        "organization": "Airbnb",
        "published": "2026-06-17",
        "code_url": null,
        "topics": [
          "search-ranking",
          "sequence-modeling",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/journeyformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Airbnb Search",
            "metric": "bookers",
            "lift_percent": 0.55,
            "traffic": "3-week A/B; p<0.01",
            "source_url": "https://arxiv.org/html/2606.19108v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "kar",
      "title": "Towards Open-World Recommendation with Knowledge Augmentation from Large Language Models",
      "paper_url": "https://arxiv.org/abs/2306.10933",
      "detail_path": "reproductions/2306.10933-kar/README.md",
      "topic": [
        "llm-recommendation",
        "knowledge-augmentation",
        "ctr-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei",
      "published": "2023-06",
      "code": null,
      "adapter": {
        "adapter_key": "kar",
        "arxiv_id": "2306.10933",
        "title": "Towards Open-World Recommendation with Knowledge Augmentation from Large Language Models",
        "paper_url": "https://arxiv.org/abs/2306.10933",
        "track": "recommendation",
        "organization": "Huawei",
        "published": "2023-06",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "knowledge-augmentation",
          "ctr-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/kar",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K title/genre text"
        ],
        "baseline": "纯 ID ranker",
        "metrics": [
          "auc.id_ranker.mean",
          "auc.id_ranker.std",
          "auc.kar_hybrid_expert.mean",
          "auc.kar_hybrid_expert.std",
          "auc.mean_absolute_gain",
          "auc.mean_relative_gain_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Huawei News",
            "metric": "recall",
            "lift_percent": 7.0,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2306.10933",
            "source_location": "original paper online-result disclosure: product=Huawei News; metric=recall"
          },
          {
            "product": "Huawei Music",
            "metric": "song play count",
            "lift_percent": 1.7,
            "traffic": "10% treatment/control, 7 days",
            "source_url": "https://arxiv.org/abs/2306.10933",
            "source_location": "original paper online-result disclosure: product=Huawei Music; metric=song play count"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "kgd",
      "title": "Knowledge–Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.02738",
      "detail_path": "reproductions/2608.02738-kgd/README.md",
      "topic": [
        "sequential-recommendation",
        "pretraining",
        "streaming",
        "transfer"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiamen University / Shopee",
      "published": "2026-08-03",
      "code": "https://github.com/FuCongResearchSquad/KGD4REC",
      "adapter": {
        "adapter_key": "kgd",
        "arxiv_id": "2608.02738",
        "title": "Knowledge–Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.02738",
        "track": "recommendation",
        "organization": "Xiamen University / Shopee",
        "published": "2026-08-03",
        "code_url": "https://github.com/FuCongResearchSquad/KGD4REC",
        "topics": [
          "sequential-recommendation",
          "pretraining",
          "streaming",
          "transfer"
        ],
        "local_code_dir": "src/auto_research/reproductions/kgd",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "paper_results.advertising_revenue_percent",
          "paper_results.gmv_per_user_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "variants.adjacent ntp transfer.hit_at_10",
          "variants.adjacent ntp transfer.ndcg_at_10",
          "variants.kgd bmtp + read-only transfer + acr.hit_at_10",
          "variants.kgd bmtp + read-only transfer + acr.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Shopee Homepage Search",
            "metric": "GMV per user",
            "lift_percent": 1.75,
            "traffic": "live A/B; fully deployed",
            "source_url": "https://arxiv.org/abs/2608.02738",
            "source_location": "original paper online-result disclosure: product=Shopee Homepage Search; metric=GMV per user"
          },
          {
            "product": "Shopee Homepage Search",
            "metric": "advertising revenue",
            "lift_percent": 1.53,
            "traffic": "live A/B; fully deployed",
            "source_url": "https://arxiv.org/abs/2608.02738",
            "source_location": "original paper online-result disclosure: product=Shopee Homepage Search; metric=advertising revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "kunlun",
      "title": "Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design",
      "paper_url": "https://arxiv.org/abs/2602.10016",
      "detail_path": "reproductions/2602.10016-kunlun/README.md",
      "topic": [
        "ranking",
        "scaling-law",
        "long-sequence",
        "mixture-of-experts",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-02-10",
      "code": null,
      "adapter": {
        "adapter_key": "kunlun",
        "arxiv_id": "2602.10016",
        "title": "Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design",
        "paper_url": "https://arxiv.org/abs/2602.10016",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-02-10",
        "code_url": null,
        "topics": [
          "ranking",
          "scaling-law",
          "long-sequence",
          "mixture-of-experts",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/kunlun",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "shallow transition-content ranker，实验组执行 Kunlun compact core",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta Ads",
            "metric": "topline",
            "lift_percent": 1.2,
            "traffic": "deployed across major Ads models",
            "source_url": "https://arxiv.org/html/2602.10016v3#S5.SS5",
            "source_location": "Section 5.5",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "l2rec",
      "title": "L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.26717",
      "detail_path": "reproductions/2605.26717-l2rec/README.md",
      "topic": [
        "llm-recommendation",
        "parameter-efficient-tuning",
        "multi-view"
      ],
      "first_author": null,
      "first_author_affiliation": "NetEase Cloud Music",
      "published": "2026-05-26",
      "code": null,
      "adapter": {
        "adapter_key": "l2rec",
        "arxiv_id": "2605.26717",
        "title": "L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.26717",
        "track": "recommendation",
        "organization": "NetEase Cloud Music",
        "published": "2026-05-26",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "parameter-efficient-tuning",
          "multi-view"
        ],
        "local_code_dir": "src/auto_research/reproductions/l2rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "homepage feed",
            "metric": "CTR",
            "lift_percent": 9.24,
            "traffic": "6% user traffic, one month; p<0.01",
            "source_url": "https://arxiv.org/html/2605.26717v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "lazformer",
      "title": "LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training",
      "paper_url": "https://arxiv.org/abs/2609.14978",
      "detail_path": "reproductions/2609.14978-lazformer/README.md",
      "topic": [
        "ranking",
        "generative-pretraining",
        "residual-adapter",
        "hybrid-sparse-attention"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce Group",
      "published": "2026-09-14",
      "code": null,
      "adapter": {
        "adapter_key": "lazformer",
        "arxiv_id": "2609.14978",
        "title": "LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training",
        "paper_url": "https://arxiv.org/abs/2609.14978",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce Group",
        "published": "2026-09-14",
        "code_url": null,
        "topics": [
          "ranking",
          "generative-pretraining",
          "residual-adapter",
          "hybrid-sparse-attention"
        ],
        "local_code_dir": "src/auto_research/reproductions/lazformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "large-scale e-commerce homepage ranking",
            "metric": "IPV",
            "lift_percent": 5.21,
            "traffic": "two-week production A/B",
            "source_url": "https://arxiv.org/html/2609.14978v1",
            "source_location": "Section 4.7; Table 7",
            "experiment_duration": "two weeks",
            "retrieved_at": "2026-09-16"
          },
          {
            "product": "large-scale e-commerce homepage ranking",
            "metric": "orders",
            "lift_percent": 3.38,
            "traffic": "two-week production A/B",
            "source_url": "https://arxiv.org/html/2609.14978v1",
            "source_location": "Section 4.7; Table 7",
            "experiment_duration": "two weeks",
            "retrieved_at": "2026-09-16"
          },
          {
            "product": "large-scale e-commerce homepage ranking",
            "metric": "buyers",
            "lift_percent": 3.7,
            "traffic": "two-week production A/B",
            "source_url": "https://arxiv.org/html/2609.14978v1",
            "source_location": "Section 4.7; Table 7",
            "experiment_duration": "two weeks",
            "retrieved_at": "2026-09-16"
          },
          {
            "product": "large-scale e-commerce homepage ranking",
            "metric": "GMV",
            "lift_percent": 9.85,
            "traffic": "two-week production A/B",
            "source_url": "https://arxiv.org/html/2609.14978v1",
            "source_location": "Section 4.7; Table 7",
            "experiment_duration": "two weeks",
            "retrieved_at": "2026-09-16"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "leadre",
      "title": "LEADRE: Multi-Faceted Knowledge Enhanced LLM Empowered Display Advertisement Recommender System",
      "paper_url": "https://arxiv.org/abs/2411.13789",
      "detail_path": "reproductions/2411.13789-leadre/README.md",
      "topic": [
        "llm-recommendation",
        "generative-retrieval",
        "advertising",
        "preference-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent / WeChat",
      "published": "2024-11",
      "code": null,
      "adapter": {
        "adapter_key": "leadre",
        "arxiv_id": "2411.13789",
        "title": "LEADRE: Multi-Faceted Knowledge Enhanced LLM Empowered Display Advertisement Recommender System",
        "paper_url": "https://arxiv.org/abs/2411.13789",
        "track": "recommendation",
        "organization": "Tencent / WeChat",
        "published": "2024-11",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "generative-retrieval",
          "advertising",
          "preference-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/leadre",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "DIN，LEADRE NDCG@10 相对 DIN +12.94%",
        "metrics": [
          "paper_online_ab.channels_gmv_percent",
          "paper_online_ab.moments_gmv_percent",
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.leadre_dpo.hit_at_10",
          "results.leadre_dpo.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.sft.hit_at_10",
          "results.sft.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "WeChat Channels",
            "metric": "GMV",
            "lift_percent": 1.57,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/abs/2411.13789",
            "source_location": "original paper online-result disclosure: product=WeChat Channels; metric=GMV"
          },
          {
            "product": "WeChat Moments",
            "metric": "GMV",
            "lift_percent": 1.17,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/abs/2411.13789",
            "source_location": "original paper online-result disclosure: product=WeChat Moments; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "learn",
      "title": "Knowledge Adaptation from Large Language Model to Recommendation for Practical Industrial Application",
      "paper_url": "https://arxiv.org/abs/2405.03988",
      "detail_path": "reproductions/2405.03988-learn/README.md",
      "topic": [
        "llm-recommendation",
        "knowledge-adaptation",
        "cold-start"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2024-05",
      "code": null,
      "adapter": {
        "adapter_key": "learn",
        "arxiv_id": "2405.03988",
        "title": "Knowledge Adaptation from Large Language Model to Recommendation for Practical Industrial Application",
        "paper_url": "https://arxiv.org/abs/2405.03988",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2024-05",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "knowledge-adaptation",
          "cold-start"
        ],
        "local_code_dir": "src/auto_research/reproductions/learn",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K title/genre text"
        ],
        "baseline": "frozen LLM semantic mean",
        "metrics": [
          "hit_at_10.frozen_llm_semantic_mean.mean",
          "hit_at_10.frozen_llm_semantic_mean.std",
          "hit_at_10.learn_ceg_pch.mean",
          "hit_at_10.learn_ceg_pch.std",
          "hit_at_10.relative_change_percent",
          "ndcg_at_10.frozen_llm_semantic_mean.mean",
          "ndcg_at_10.frozen_llm_semantic_mean.std",
          "ndcg_at_10.learn_ceg_pch.mean",
          "ndcg_at_10.learn_ceg_pch.std",
          "ndcg_at_10.relative_change_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=140",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou e-commerce ads",
            "metric": "cold-start item revenue",
            "lift_percent": 8.77,
            "traffic": "20% traffic, 9 days",
            "source_url": "https://arxiv.org/abs/2405.03988",
            "source_location": "original paper online-result disclosure: product=Kuaishou e-commerce ads; metric=cold-start item revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "linkedin-feed-sr",
      "title": "An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking",
      "paper_url": "https://arxiv.org/abs/2602.12354",
      "detail_path": "reproductions/2602.12354-linkedin-feed-sr/README.md",
      "topic": [
        "ranking",
        "sequential-recommendation",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "LinkedIn",
      "published": "2026-02-12",
      "code": null,
      "adapter": {
        "adapter_key": "linkedin-feed-sr",
        "arxiv_id": "2602.12354",
        "title": "An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking",
        "paper_url": "https://arxiv.org/abs/2602.12354",
        "track": "recommendation",
        "organization": "LinkedIn",
        "published": "2026-02-12",
        "code_url": null,
        "topics": [
          "ranking",
          "sequential-recommendation",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/linkedin_feed_sr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "LinkedIn Feed",
            "metric": "time spent",
            "lift_percent": 2.1,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/html/2602.12354v1",
            "source_location": "Section 7 / Table 5",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "llatte",
      "title": "LLaTTE: Scaling Laws for Multi-Stage Sequence Modeling in Large-Scale Ads Recommendation",
      "paper_url": "https://arxiv.org/abs/2601.20083",
      "detail_path": "reproductions/2601.20083-llatte/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "llatte",
        "arxiv_id": "2601.20083",
        "title": "LLaTTE: Scaling Laws for Multi-Stage Sequence Modeling in Large-Scale Ads Recommendation",
        "paper_url": "https://arxiv.org/abs/2601.20083",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/llatte",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "相同 ID/语义 embedding 的 short online sequence",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.llatte_mla_dhen.hit_at_10",
          "results.llatte_mla_dhen.hit_at_10_std",
          "results.llatte_mla_dhen.ndcg_at_10",
          "results.llatte_mla_dhen.ndcg_at_10_std",
          "results.short_online_sequence.hit_at_10",
          "results.short_online_sequence.hit_at_10_std",
          "results.short_online_sequence.ndcg_at_10",
          "results.short_online_sequence.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=75",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "llm-ad-retrieval",
      "title": "LLM Retrieval for Stable and Predictable Ad Recommendations",
      "paper_url": "https://arxiv.org/abs/2605.21969",
      "detail_path": "reproductions/2605.21969-llm-ad-retrieval/README.md",
      "topic": [
        "llm-recommendation",
        "retrieval",
        "stability"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-05",
      "code": null,
      "adapter": {
        "adapter_key": "llm-ad-retrieval",
        "arxiv_id": "2605.21969",
        "title": "LLM Retrieval for Stable and Predictable Ad Recommendations",
        "paper_url": "https://arxiv.org/abs/2605.21969",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-05",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "retrieval",
          "stability"
        ],
        "local_code_dir": "src/auto_research/reproductions/llm_ad_retrieval",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K titles, genres, and chronological positive feedback"
        ],
        "baseline": "Collaborative Item Graph",
        "metrics": [
          "paper_online_ab.final_stage_recall_lift_percent",
          "results.collaborative_graph.ndcg_at_20",
          "results.collaborative_graph.recall_at_20",
          "results.collaborative_plus_llm_graph.ndcg_at_20",
          "results.collaborative_plus_llm_graph.recall_at_20",
          "results.ndcg_relative_gain_percent",
          "results.recall_relative_gain_percent",
          "training.attribute_head_final_loss",
          "training.attribute_head_initial_loss",
          "training.domain_sft_final_loss",
          "training.domain_sft_initial_loss"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta Ads",
            "metric": "top-line performance",
            "lift_percent": 0.45,
            "traffic": "large-scale industrial online A/B",
            "source_url": "https://arxiv.org/abs/2605.21969",
            "source_location": "original paper online-result disclosure: product=Meta Ads; metric=top-line performance"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "llm-ts-prior",
      "title": "LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.03382",
      "detail_path": "reproductions/2608.03382-llm-ts-prior/README.md",
      "topic": [
        "llm-recommendation",
        "bandit",
        "cold-start",
        "comment-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "NAVER WEBTOON",
      "published": "2026-08-04",
      "code": null,
      "adapter": {
        "adapter_key": "llm-ts-prior",
        "arxiv_id": "2608.03382",
        "title": "LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.03382",
        "track": "recommendation",
        "organization": "NAVER WEBTOON",
        "published": "2026-08-04",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "bandit",
          "cold-start",
          "comment-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/llm_ts_prior",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "paper_results.content_prior_overall_ctr_percent",
          "paper_results.gender_prior_cold_10_49_ctr_percent",
          "paper_results.gender_prior_overall_ctr_percent",
          "relative.cold_start_ctr_percent",
          "relative.ctr_percent",
          "variants.llm semantic prior.cold_start_ctr",
          "variants.llm semantic prior.ctr",
          "variants.uniform thompson prior.cold_start_ctr",
          "variants.uniform thompson prior.ctr"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "WEBTOON comment recommendation",
            "metric": "Gender-prior overall CTR",
            "lift_percent": 1.48,
            "traffic": "four-week A/B/C; about 595K users per arm",
            "significance": "p=0.144, not significant",
            "source_url": "https://arxiv.org/abs/2608.03382",
            "source_location": "original paper online-result disclosure: product=WEBTOON comment recommendation; metric=Gender-prior overall CTR"
          },
          {
            "product": "WEBTOON 10-49 exposure bucket",
            "metric": "Gender-prior CTR",
            "lift_percent": 9.51,
            "traffic": "A/B/C cold-start subgroup",
            "significance": "p<0.001",
            "source_url": "https://arxiv.org/abs/2608.03382",
            "source_location": "original paper online-result disclosure: product=WEBTOON 10-49 exposure bucket; metric=Gender-prior CTR"
          },
          {
            "product": "WEBTOON overall",
            "metric": "Content-prior CTR",
            "lift_percent": -5.68,
            "traffic": "four-week A/B/C",
            "significance": "p<0.001",
            "source_url": "https://arxiv.org/abs/2608.03382",
            "source_location": "original paper online-result disclosure: product=WEBTOON overall; metric=Content-prior CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "long-history-transformer",
      "title": "Long-History User Transformers for Real-Time Ad Ranking",
      "paper_url": "https://arxiv.org/abs/2607.14331",
      "detail_path": "reproductions/2607.14331-long-history-transformer/README.md",
      "topic": [
        "advertising",
        "long-sequence",
        "cached-user-representation",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Yandex",
      "published": "2026-07-15",
      "code": null,
      "adapter": {
        "adapter_key": "long-history-transformer",
        "arxiv_id": "2607.14331",
        "title": "Long-History User Transformers for Real-Time Ad Ranking",
        "paper_url": "https://arxiv.org/abs/2607.14331",
        "track": "recommendation",
        "organization": "Yandex",
        "published": "2026-07-15",
        "code_url": null,
        "topics": [
          "advertising",
          "long-sequence",
          "cached-user-representation",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/long_history_transformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "request-time recent-history Transformer，实验组为缓存全历史加轻量在线 Transformer",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Yandex Search Ads",
            "metric": "Primary ranking metric",
            "lift_percent": 2.77,
            "traffic": "production A/B; p<0.05",
            "source_url": "https://arxiv.org/abs/2607.14331",
            "source_location": "original paper online-result disclosure: product=Yandex Search Ads; metric=Primary ranking metric"
          },
          {
            "product": "Yandex Search Ads",
            "metric": "Revenue",
            "lift_percent": 2.26,
            "traffic": "production A/B; p<0.05",
            "source_url": "https://arxiv.org/abs/2607.14331",
            "source_location": "original paper online-result disclosure: product=Yandex Search Ads; metric=Revenue"
          },
          {
            "product": "Yandex Advertising Network",
            "metric": "Primary ranking metric",
            "lift_percent": 2.1,
            "traffic": "production A/B; p<0.05",
            "source_url": "https://arxiv.org/abs/2607.14331",
            "source_location": "original paper online-result disclosure: product=Yandex Advertising Network; metric=Primary ranking metric"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "longer",
      "title": "LONGER: Scaling Up Long Sequence Modeling in Industrial Recommenders",
      "paper_url": "https://arxiv.org/abs/2505.04421",
      "detail_path": "reproductions/2505.04421-longer/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "longer",
        "arxiv_id": "2505.04421",
        "title": "LONGER: Scaling Up Long Sequence Modeling in Industrial Recommenders",
        "paper_url": "https://arxiv.org/abs/2505.04421",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/longer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "recent sequence transformer",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.longer_hybrid_attention.hit_at_10",
          "results.longer_hybrid_attention.hit_at_10_std",
          "results.longer_hybrid_attention.ndcg_at_10",
          "results.longer_hybrid_attention.ndcg_at_10_std",
          "results.recent_sequence_transformer.hit_at_10",
          "results.recent_sequence_transformer.hit_at_10_std",
          "results.recent_sequence_transformer.ndcg_at_10",
          "results.recent_sequence_transformer.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=90",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "lsvcr",
      "title": "A Large Language Model Enhanced Sequential Recommender for Joint Video and Comment Recommendation",
      "paper_url": "https://arxiv.org/abs/2403.13574",
      "detail_path": "reproductions/2403.13574-lsvcr/README.md",
      "topic": [
        "LLM recommendation",
        "comment recommendation",
        "preference alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2024-03",
      "code": "https://github.com/RUCAIBox/LSVCR",
      "adapter": {
        "adapter_key": "lsvcr",
        "arxiv_id": "2403.13574",
        "title": "A Large Language Model Enhanced Sequential Recommender for Joint Video and Comment Recommendation",
        "paper_url": "https://arxiv.org/abs/2403.13574",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2024-03",
        "code_url": "https://github.com/RUCAIBox/LSVCR",
        "topics": [
          "LLM recommendation",
          "comment recommendation",
          "preference alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/lsvcr",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "Amazon Beauty 5-core product interactions and real review text"
        ],
        "baseline": "相同 SR 网络但不做 LLM preference alignment",
        "metrics": [
          "aggregate.baseline_comment_ndcg_mean",
          "aggregate.baseline_item_ndcg_mean",
          "aggregate.lsvcr_comment_ndcg_mean",
          "aggregate.lsvcr_item_ndcg_mean",
          "per_seed.42.baseline_comment_ndcg_at_10",
          "per_seed.42.baseline_item_ndcg_at_10",
          "per_seed.42.lsvcr_comment_ndcg_at_10",
          "per_seed.42.lsvcr_item_ndcg_at_10",
          "per_seed.43.baseline_comment_ndcg_at_10",
          "per_seed.43.baseline_item_ndcg_at_10",
          "per_seed.43.lsvcr_comment_ndcg_at_10",
          "per_seed.43.lsvcr_item_ndcg_at_10",
          "per_seed.44.baseline_comment_ndcg_at_10",
          "per_seed.44.baseline_item_ndcg_at_10",
          "per_seed.44.lsvcr_comment_ndcg_at_10",
          "per_seed.44.lsvcr_item_ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou video",
            "metric": "Watch Time",
            "lift_percent": 0.3649,
            "traffic": "20K users, 2 weeks",
            "source_url": "https://arxiv.org/abs/2403.13574",
            "source_location": "original paper online-result disclosure: product=Kuaishou video; metric=Watch Time"
          },
          {
            "product": "Kuaishou comments",
            "metric": "Watch Time",
            "lift_percent": 4.1264,
            "traffic": "20K users, 2 weeks",
            "source_url": "https://arxiv.org/abs/2403.13574",
            "source_location": "original paper online-result disclosure: product=Kuaishou comments; metric=Watch Time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ltv-video-ranking",
      "title": "A Long-term Value Prediction Framework In Video Ranking",
      "paper_url": "https://arxiv.org/abs/2602.17058",
      "detail_path": "reproductions/2602.17058-ltv-video-ranking/README.md",
      "topic": [
        "ranking",
        "long-term-value",
        "debiasing"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group / Tsinghua University",
      "published": "2026-02-19",
      "code": null,
      "adapter": {
        "adapter_key": "ltv-video-ranking",
        "arxiv_id": "2602.17058",
        "title": "A Long-term Value Prediction Framework In Video Ranking",
        "paper_url": "https://arxiv.org/abs/2602.17058",
        "track": "recommendation",
        "organization": "Alibaba Group / Tsinghua University",
        "published": "2026-02-19",
        "code_url": null,
        "topics": [
          "ranking",
          "long-term-value",
          "debiasing"
        ],
        "local_code_dir": "src/auto_research/reproductions/ltv_video_ranking",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao video ranking",
            "metric": "VV",
            "lift_percent": 2.49,
            "traffic": "multi-day production A/B",
            "source_url": "https://arxiv.org/html/2602.17058v1",
            "source_location": "Section 5.3 / Table 6",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "lum",
      "title": "Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model",
      "paper_url": "https://arxiv.org/abs/2502.08309",
      "detail_path": "reproductions/2502.08309-lum/README.md",
      "topic": [
        "large user model",
        "generative pretraining",
        "knowledge querying",
        "CTR"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2025-02",
      "code": null,
      "adapter": {
        "adapter_key": "lum",
        "arxiv_id": "2502.08309",
        "title": "Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model",
        "paper_url": "https://arxiv.org/abs/2502.08309",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2025-02",
        "code_url": null,
        "topics": [
          "large user model",
          "generative pretraining",
          "knowledge querying",
          "CTR"
        ],
        "local_code_dir": "src/auto_research/reproductions/lum",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-1M ratings, genres, chronological behavior"
        ],
        "baseline": "ID-DLRM",
        "metrics": [
          "aggregate.dlrm_auc_mean",
          "aggregate.dlrm_auc_std",
          "aggregate.lum_auc_mean",
          "aggregate.lum_auc_std",
          "per_seed.42.dlrm_auc",
          "per_seed.42.lum_auc",
          "per_seed.43.dlrm_auc",
          "per_seed.43.lum_auc",
          "per_seed.44.dlrm_auc",
          "per_seed.44.lum_auc"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=200",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao sponsored search",
            "metric": "CTR",
            "lift_percent": 2.9,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2502.08309",
            "source_location": "original paper online-result disclosure: product=Taobao sponsored search; metric=CTR"
          },
          {
            "product": "Taobao sponsored search",
            "metric": "RPM",
            "lift_percent": 1.2,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2502.08309",
            "source_location": "original paper online-result disclosure: product=Taobao sponsored search; metric=RPM"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "lwgr",
      "title": "LWGR: Lagrangian-Constrained Personalized World Knowledge for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.18771",
      "detail_path": "reproductions/2605.18771-lwgr/README.md",
      "topic": [
        "generative-recommendation",
        "soft-prompt",
        "world-knowledge",
        "lagrangian"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International / CAS",
      "published": "2026-05",
      "code": null,
      "adapter": {
        "adapter_key": "lwgr",
        "arxiv_id": "2605.18771",
        "title": "LWGR: Lagrangian-Constrained Personalized World Knowledge for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.18771",
        "track": "recommendation",
        "organization": "Alibaba International / CAS",
        "published": "2026-05",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "soft-prompt",
          "world-knowledge",
          "lagrangian"
        ],
        "local_code_dir": "src/auto_research/reproductions/lwgr",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MiniOneRec Office"
        ],
        "baseline": "相同 Office SID、相同 48 维 GR backbone、seeds 42/43/44 的冻结 reference",
        "metrics": [
          "selected_relative_to_reference_percent.ndcg_at_10",
          "selected_relative_to_reference_percent.recall_at_10",
          "test.lwgr.ndcg_at_10",
          "test.lwgr.ndcg_at_5",
          "test.lwgr.recall_at_10",
          "test.lwgr.recall_at_5",
          "test.reference.ndcg_at_10",
          "test.reference.ndcg_at_5",
          "test.reference.recall_at_10",
          "test.reference.recall_at_5",
          "test.unconstrained.ndcg_at_10",
          "test.unconstrained.ndcg_at_5",
          "test.unconstrained.recall_at_10",
          "test.unconstrained.recall_at_5"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=180",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Southeast Asia Ads",
            "metric": "Revenue",
            "lift_percent": 1.35,
            "traffic": "15% users, 2025-12-19 to 2025-12-30",
            "source_url": "https://arxiv.org/abs/2605.18771",
            "source_location": "original paper online-result disclosure: product=Southeast Asia Ads; metric=Revenue"
          },
          {
            "product": "Southeast Asia Ads",
            "metric": "CTR",
            "lift_percent": 1.17,
            "traffic": "p<0.05",
            "source_url": "https://arxiv.org/abs/2605.18771",
            "source_location": "original paper online-result disclosure: product=Southeast Asia Ads; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "m6rec",
      "title": "M6-Rec: Generative Pretrained Language Models are Open-Ended Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2205.08084",
      "detail_path": "reproductions/2205.08084-m6rec/README.md",
      "topic": [
        "llm-recommendation",
        "foundation-model",
        "parameter-efficient-tuning"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2022-05",
      "code": null,
      "adapter": {
        "adapter_key": "m6rec",
        "arxiv_id": "2205.08084",
        "title": "M6-Rec: Generative Pretrained Language Models are Open-Ended Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2205.08084",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2022-05",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "foundation-model",
          "parameter-efficient-tuning"
        ],
        "local_code_dir": "src/auto_research/reproductions/m6rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K title and genre text"
        ],
        "baseline": "只训练 option prototype 的 Option Tuning",
        "metrics": [
          "summary.option_adapter_auc_mean",
          "summary.option_adapter_auc_std",
          "summary.option_tuning_auc_mean",
          "summary.option_tuning_auc_std",
          "summary.relative_auc_gain_percent_mean",
          "summary.relative_auc_gain_percent_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alipay",
            "metric": "mini-app retrieval CTR",
            "lift_percent": 1.0,
            "traffic": "live replacement; fully deployed",
            "source_url": "https://arxiv.org/abs/2205.08084",
            "source_location": "original paper online-result disclosure: product=Alipay; metric=mini-app retrieval CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "marc",
      "title": "Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations",
      "paper_url": "https://arxiv.org/abs/2604.18146",
      "detail_path": "reproductions/2604.18146-marc/README.md",
      "topic": [
        "llm-recommendation",
        "representation-compression",
        "modular-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Shanghai Jiao Tong University",
      "published": "2026-04-20",
      "code": null,
      "adapter": {
        "adapter_key": "marc",
        "arxiv_id": "2604.18146",
        "title": "Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations",
        "paper_url": "https://arxiv.org/abs/2604.18146",
        "track": "recommendation",
        "organization": "Shanghai Jiao Tong University",
        "published": "2026-04-20",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "representation-compression",
          "modular-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/marc",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Commercial search advertising",
            "metric": "eCPM",
            "lift_percent": 2.82,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2604.18146v1",
            "source_location": "Abstract and experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:modular-compression"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "mbgr",
      "title": "MBGR: Multi-Business Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2604.02684",
      "detail_path": "reproductions/2604.02684-mbgr/README.md",
      "topic": [
        "generative-recommendation",
        "multi-domain",
        "semantic-id"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2026-04-03",
      "code": null,
      "adapter": {
        "adapter_key": "mbgr",
        "arxiv_id": "2604.02684",
        "title": "MBGR: Multi-Business Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2604.02684",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2026-04-03",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "multi-domain",
          "semantic-id"
        ],
        "local_code_dir": "src/auto_research/reproductions/mbgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "共享 next-item 模型",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan multi-business recommendation",
            "metric": "CTCVR",
            "lift_percent": 3.98,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2604.02684",
            "source_location": "original paper online-result disclosure: product=Meituan multi-business recommendation; metric=CTCVR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mdcns",
      "title": "Divergence Meets Consensus: A Multi-Source Negative Sampling Framework for Sequential Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.19651",
      "detail_path": "reproductions/2605.19651-mdcns/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": "https://github.com/Lyz103/SIGIR26-MDCNS",
      "adapter": {
        "adapter_key": "mdcns",
        "arxiv_id": "2605.19651",
        "title": "Divergence Meets Consensus: A Multi-Source Negative Sampling Framework for Sequential Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.19651",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": "https://github.com/Lyz103/SIGIR26-MDCNS",
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/mdcns",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "Amazon Beauty 5-core authors' split"
        ],
        "baseline": "Uniform negative sampling，辅助基线是 DNS",
        "metrics": [
          "ndcg_gain_vs_uniform_percent",
          "results.dns.hit_at_10",
          "results.dns.ndcg_at_10",
          "results.mdcns.hit_at_10",
          "results.mdcns.ndcg_at_10",
          "results.uniform.hit_at_10",
          "results.uniform.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "epochs=4",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mdl",
      "title": "MDL: A Unified Multi-Distribution Learner in Large-scale Industrial Recommendation through Tokenization",
      "paper_url": "https://arxiv.org/abs/2602.07520",
      "detail_path": "reproductions/2602.07520-mdl/README.md",
      "topic": [
        "ranking",
        "multi-scenario",
        "multi-task",
        "tokenization"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin",
      "published": "2026-02-07",
      "code": null,
      "adapter": {
        "adapter_key": "mdl",
        "arxiv_id": "2602.07520",
        "title": "MDL: A Unified Multi-Distribution Learner in Large-scale Industrial Recommendation through Tokenization",
        "paper_url": "https://arxiv.org/abs/2602.07520",
        "track": "recommendation",
        "organization": "ByteDance / Douyin",
        "published": "2026-02-07",
        "code_url": null,
        "topics": [
          "ranking",
          "multi-scenario",
          "multi-task",
          "tokenization"
        ],
        "local_code_dir": "src/auto_research/reproductions/mdl",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享但非 tokenized ranker",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin search",
            "metric": "LT30",
            "lift_percent": 0.0626,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.07520",
            "source_location": "original paper online-result disclosure: product=Douyin search; metric=LT30"
          },
          {
            "product": "Douyin search",
            "metric": "query rewrite rate",
            "lift_percent": -0.3267,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.07520",
            "source_location": "original paper online-result disclosure: product=Douyin search; metric=query rewrite rate"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "melo",
      "title": "Melo: A Production LLM-Powered Music Recommendation Agent",
      "paper_url": "https://arxiv.org/abs/2607.23718",
      "detail_path": "reproductions/2607.23718-melo/README.md",
      "topic": [
        "llm-recommendation",
        "agent",
        "entity-grounding",
        "reflection"
      ],
      "first_author": null,
      "first_author_affiliation": "NetEase Cloud Music / Zhejiang University of Technology",
      "published": "2026-07-26",
      "code": null,
      "adapter": {
        "adapter_key": "melo",
        "arxiv_id": "2607.23718",
        "title": "Melo: A Production LLM-Powered Music Recommendation Agent",
        "paper_url": "https://arxiv.org/abs/2607.23718",
        "track": "recommendation",
        "organization": "NetEase Cloud Music / Zhejiang University of Technology",
        "published": "2026-07-26",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "agent",
          "entity-grounding",
          "reflection"
        ],
        "local_code_dir": "src/auto_research/reproductions/melo",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "无运行时修复的 catalog recommender，实验组为 grounding + retry",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation_only_model_selection.fresh_hit_at_10",
          "stages.validation_only_model_selection.hit_at_10",
          "stages.validation_only_model_selection.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "NetEase Cloud Music playlist surfaces",
            "metric": "playlist retention lower bound (pp)",
            "lift_percent": 2.0,
            "traffic": "one-month randomized system-level A/B",
            "source_url": "https://arxiv.org/abs/2607.23718",
            "source_location": "original paper online-result disclosure: product=NetEase Cloud Music playlist surfaces; metric=playlist retention lower bound (pp)"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "memento",
      "title": "Memento: Personalized RAG-Style Long-Retention Data Scaling for Online Ads Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.24051",
      "detail_path": "reproductions/2605.24051-memento/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "memento",
        "arxiv_id": "2605.24051",
        "title": "Memento: Personalized RAG-Style Long-Retention Data Scaling for Online Ads Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.24051",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/memento",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "LastN 历史截断",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.last_n.hit_at_10",
          "results.last_n.ndcg_at_10",
          "results.memento_mmr.hit_at_10",
          "results.memento_mmr.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "memory-layer",
      "title": "Memory Layer: Train the In-Model Cache for Recommendation Models",
      "paper_url": "https://arxiv.org/abs/2607.25110",
      "detail_path": "reproductions/2607.25110-memory-layer/README.md",
      "topic": [
        "ranking",
        "training-serving-consistency",
        "cold-start",
        "cache",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta / Instagram Reels",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "memory-layer",
        "arxiv_id": "2607.25110",
        "title": "Memory Layer: Train the In-Model Cache for Recommendation Models",
        "paper_url": "https://arxiv.org/abs/2607.25110",
        "track": "recommendation",
        "organization": "Meta / Instagram Reels",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "ranking",
          "training-serving-consistency",
          "cold-start",
          "cache",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/memory_layer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "same item tower with an external early frozen cache and no always-on miss path",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "head_share_at_10",
          "snapshot_coverage",
          "memory_coverage"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; one chronological writeback pass",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Instagram Reels early-stage ranking",
            "metric": "cold-start reshare rate",
            "lift_percent": 5.0,
            "traffic": "post-launch A/B backtest; paper reports a statistically significant +5% to +6% range",
            "source_url": "https://arxiv.org/html/2607.25110v1#S6.SS3",
            "source_location": "Section 6.3, Table 1",
            "significance": "all Table 1 A/B improvements statistically significant",
            "retrieved_at": "2026-09-01"
          },
          {
            "product": "Instagram Reels early-stage ranking",
            "metric": "video views for media younger than one hour",
            "lift_percent": 6.0,
            "traffic": "post-launch A/B backtest; paper reports a +6% to +7% range",
            "source_url": "https://arxiv.org/html/2607.25110v1#S6.SS3",
            "source_location": "Section 6.3, Table 1",
            "significance": "statistically significant",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "rankmixer_memory_layer"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "mesh",
      "title": "MESH: Scaling Up Retrieval with Heterogeneous Content Unification",
      "paper_url": "https://arxiv.org/abs/2607.12392",
      "detail_path": "reproductions/2607.12392-mesh/README.md",
      "topic": [
        "retrieval",
        "fresh-content",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "mesh",
        "arxiv_id": "2607.12392",
        "title": "MESH: Scaling Up Retrieval with Heterogeneous Content Unification",
        "paper_url": "https://arxiv.org/abs/2607.12392",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "retrieval",
          "fresh-content",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/mesh",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "flat retrieval",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest",
            "metric": "fresh-item repins",
            "lift_percent": 5.5,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2607.12392",
            "source_location": "original paper online-result disclosure: product=Pinterest; metric=fresh-item repins"
          },
          {
            "product": "Pinterest",
            "metric": "retention",
            "lift_percent": 0.46,
            "traffic": "online A/B test",
            "source_url": "https://arxiv.org/abs/2607.12392",
            "source_location": "original paper online-result disclosure: product=Pinterest; metric=retention"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "metastrategy",
      "title": "MetaStrategy: Generative Ranking with Executable LLM Strategies",
      "paper_url": "https://arxiv.org/abs/2608.09440",
      "detail_path": "reproductions/2608.09440-metastrategy/README.md",
      "topic": [
        "ranking",
        "llm-recommendation",
        "executable-strategy",
        "online-policy"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2026-08-10",
      "code": null,
      "adapter": {
        "adapter_key": "metastrategy",
        "arxiv_id": "2608.09440",
        "title": "MetaStrategy: Generative Ranking with Executable LLM Strategies",
        "paper_url": "https://arxiv.org/abs/2608.09440",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2026-08-10",
        "code_url": null,
        "topics": [
          "ranking",
          "llm-recommendation",
          "executable-strategy",
          "online-policy"
        ],
        "local_code_dir": "src/auto_research/reproductions/metastrategy",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同预算单目标排序器，实验组为 typed strategy generator + deterministic compiler",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "metastrategy.hit_at_10",
          "metastrategy.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Homepage Guess You Like",
            "metric": "click PV",
            "lift_percent": 2.11,
            "traffic": "seven-day user-randomized online A/B",
            "source_url": "https://arxiv.org/pdf/2608.09440",
            "source_location": "Section 5.4 / online A/B table",
            "experiment_duration": "7 days",
            "retrieved_at": "2026-08-13"
          },
          {
            "product": "Taobao Homepage Guess You Like",
            "metric": "transaction amount",
            "lift_percent": 2.83,
            "traffic": "seven-day user-randomized online A/B",
            "source_url": "https://arxiv.org/pdf/2608.09440",
            "source_location": "Section 5.4 / online A/B table",
            "experiment_duration": "7 days",
            "retrieved_at": "2026-08-13"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mfli",
      "title": "Rethinking ANN-based Retrieval: Multifaceted Learnable Index for Large-scale Recommendation System",
      "paper_url": "https://arxiv.org/abs/2602.16124",
      "detail_path": "reproductions/2602.16124-mfli/README.md",
      "topic": [
        "retrieval",
        "learnable-index",
        "fresh-content",
        "diversity",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-02-18",
      "code": null,
      "adapter": {
        "adapter_key": "mfli",
        "arxiv_id": "2602.16124",
        "title": "Rethinking ANN-based Retrieval: Multifaceted Learnable Index for Large-scale Recommendation System",
        "paper_url": "https://arxiv.org/abs/2602.16124",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-02-18",
        "code_url": null,
        "topics": [
          "retrieval",
          "learnable-index",
          "fresh-content",
          "diversity",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/mfli",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "同切分的 single-space ANN proxy，实验组加入四 facet MFLI",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation",
            "metric": "low-view exposure",
            "lift_percent": 279.0,
            "traffic": "7-day online A/B",
            "source_url": "https://arxiv.org/html/2602.16124v1#S4.SS6",
            "source_location": "Section 4.6",
            "experiment_duration": "7 days",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "Meta recommendation",
            "metric": "diversity",
            "lift_percent": 0.3,
            "traffic": "7-day online A/B",
            "source_url": "https://arxiv.org/html/2602.16124v1#S4.SS6",
            "source_location": "Section 4.6",
            "experiment_duration": "7 days",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mgoe",
      "title": "Macro Graph of Experts for Billion-Scale Multi-Task Recommendation",
      "paper_url": "https://arxiv.org/abs/2506.10520",
      "detail_path": "reproductions/2506.10520-mgoe/README.md",
      "topic": [
        "multi-task-learning",
        "mixture-of-experts",
        "graph-neural-network",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2025-06-12",
      "code": "https://github.com/RainmannnnN/MGOE",
      "adapter": {
        "adapter_key": "mgoe",
        "arxiv_id": "2506.10520",
        "title": "Macro Graph of Experts for Billion-Scale Multi-Task Recommendation",
        "paper_url": "https://arxiv.org/abs/2506.10520",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2025-06-12",
        "code_url": "https://github.com/RainmannnnN/MGOE",
        "topics": [
          "multi-task-learning",
          "mixture-of-experts",
          "graph-neural-network",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/mgoe",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "MMoE independent task gates",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "paper_results.cvr_percent",
          "paper_results.gmv_percent",
          "paper_results.pctr_percent",
          "paper_results.uctr_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba",
            "metric": "PCTR",
            "lift_percent": 2.16,
            "traffic": "production A/B vs MMoE",
            "source_url": "https://arxiv.org/abs/2506.10520",
            "source_location": "original paper online-result disclosure: product=Alibaba; metric=PCTR"
          },
          {
            "product": "Alibaba",
            "metric": "GMV",
            "lift_percent": 16.46,
            "traffic": "production A/B vs MMoE",
            "source_url": "https://arxiv.org/abs/2506.10520",
            "source_location": "original paper online-result disclosure: product=Alibaba; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mim",
      "title": "MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling",
      "paper_url": "https://arxiv.org/abs/2502.00321",
      "detail_path": "reproductions/2502.00321-mim/README.md",
      "topic": [
        "multimodal-recommendation",
        "user-modeling",
        "pretraining",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2025-02-01",
      "code": "https://pan.quark.cn/s/8fc8ec3e74f3",
      "adapter": {
        "adapter_key": "mim",
        "arxiv_id": "2502.00321",
        "title": "MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling",
        "paper_url": "https://arxiv.org/abs/2502.00321",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2025-02-01",
        "code_url": "https://pan.quark.cn/s/8fc8ec3e74f3",
        "topics": [
          "multimodal-recommendation",
          "user-modeling",
          "pretraining",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/mim",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "ID co-occurrence interest model",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "paper_results.ctr_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao",
            "metric": "CTR",
            "lift_percent": 14.14,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2502.00321",
            "source_location": "original paper online-result disclosure: product=Taobao; metric=CTR"
          },
          {
            "product": "Taobao",
            "metric": "RPM",
            "lift_percent": 4.12,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2502.00321",
            "source_location": "original paper online-result disclosure: product=Taobao; metric=RPM"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mima",
      "title": "MIMA: Multi-Interest Recommendation via Multi-Positive Exclusive Assignment",
      "paper_url": "https://arxiv.org/abs/2609.12842",
      "detail_path": "reproductions/2609.12842-mima/README.md",
      "topic": [
        "retrieval",
        "multi-interest",
        "exclusive-assignment",
        "industrial-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce Group",
      "published": "2026-09-11",
      "code": null,
      "adapter": {
        "adapter_key": "mima",
        "arxiv_id": "2609.12842",
        "title": "MIMA: Multi-Interest Recommendation via Multi-Positive Exclusive Assignment",
        "paper_url": "https://arxiv.org/abs/2609.12842",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce Group",
        "published": "2026-09-11",
        "code_url": null,
        "topics": [
          "retrieval",
          "multi-interest",
          "exclusive-assignment",
          "industrial-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/mima",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "large-scale e-commerce homepage retrieval",
            "metric": "transaction count",
            "lift_percent": 5.6,
            "traffic": "seven-day production A/B",
            "source_url": "https://arxiv.org/html/2609.12842v1",
            "source_location": "Section 5.5.2, Table 6",
            "experiment_duration": "seven days",
            "retrieved_at": "2026-09-15"
          },
          {
            "product": "large-scale e-commerce homepage retrieval",
            "metric": "transaction amount",
            "lift_percent": 5.44,
            "traffic": "seven-day production A/B",
            "source_url": "https://arxiv.org/html/2609.12842v1",
            "source_location": "Section 5.5.2, Table 6",
            "experiment_duration": "seven days",
            "retrieved_at": "2026-09-15"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mixformer",
      "title": "MixFormer: Co-Scaling Up Dense and Sequence in Industrial Recommenders",
      "paper_url": "https://arxiv.org/abs/2602.14110",
      "detail_path": "reproductions/2602.14110-mixformer/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "mixformer",
        "arxiv_id": "2602.14110",
        "title": "MixFormer: Co-Scaling Up Dense and Sequence in Industrial Recommenders",
        "paper_url": "https://arxiv.org/abs/2602.14110",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/mixformer",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "参数量匹配的 Stacked Dense+Sequence",
        "metrics": [
          "ndcg_gain_percent",
          "results.stacked_dense_plus_sequence.hit_at_10",
          "results.stacked_dense_plus_sequence.hit_at_10_std",
          "results.stacked_dense_plus_sequence.ndcg_at_10",
          "results.stacked_dense_plus_sequence.ndcg_at_10_std",
          "results.unified_mixformer.hit_at_10",
          "results.unified_mixformer.hit_at_10_std",
          "results.unified_mixformer.ndcg_at_10",
          "results.unified_mixformer.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ml-dcn",
      "title": "ML-DCN: Masked Low-Rank Deep Crossing Network Towards Scalable Ads Click-through Rate Prediction at Pinterest",
      "paper_url": "https://arxiv.org/abs/2602.09194",
      "detail_path": "reproductions/2602.09194-ml-dcn/README.md",
      "topic": [
        "advertising",
        "feature-crossing",
        "serving-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-02-09",
      "code": null,
      "adapter": {
        "adapter_key": "ml-dcn",
        "arxiv_id": "2602.09194",
        "title": "ML-DCN: Masked Low-Rank Deep Crossing Network Towards Scalable Ads Click-through Rate Prediction at Pinterest",
        "paper_url": "https://arxiv.org/abs/2602.09194",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-02-09",
        "code_url": null,
        "topics": [
          "advertising",
          "feature-crossing",
          "serving-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/ml_dcn",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest Ads",
            "metric": "platform-wide CTR",
            "lift_percent": 1.89,
            "traffic": "production A/B at neutral cost",
            "source_url": "https://arxiv.org/html/2602.09194v1",
            "source_location": "Section 4.2 / Table 6",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mlcc",
      "title": "Compress, Cross and Scale: Multi-Level Compression Cross Networks for Efficient Scaling in Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2602.12041",
      "detail_path": "reproductions/2602.12041-mlcc/README.md",
      "topic": [
        "feature-interaction",
        "compression",
        "scaling-law"
      ],
      "first_author": null,
      "first_author_affiliation": "Bilibili",
      "published": "2026-02-12",
      "code": null,
      "adapter": {
        "adapter_key": "mlcc",
        "arxiv_id": "2602.12041",
        "title": "Compress, Cross and Scale: Multi-Level Compression Cross Networks for Efficient Scaling in Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2602.12041",
        "track": "recommendation",
        "organization": "Bilibili",
        "published": "2026-02-12",
        "code_url": null,
        "topics": [
          "feature-interaction",
          "compression",
          "scaling-law"
        ],
        "local_code_dir": "src/auto_research/reproductions/mlcc",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Bilibili advertising",
            "metric": "Advertiser value",
            "lift_percent": 32.0,
            "traffic": "production online A/B under latency constraint",
            "source_url": "https://arxiv.org/html/2602.12041v1",
            "source_location": "Online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:multi-level-cross"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "mm-llm",
      "title": "A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2605.09338",
      "detail_path": "reproductions/2605.09338-mm-llm/README.md",
      "topic": [
        "multimodal",
        "llm-recommendation",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-05",
      "code": null,
      "adapter": {
        "adapter_key": "mm-llm",
        "arxiv_id": "2605.09338",
        "title": "A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2605.09338",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-05",
        "code_url": null,
        "topics": [
          "multimodal",
          "llm-recommendation",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/mm_llm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K content proxy"
        ],
        "baseline": "DIN，MM-LLM NDCG@10 相对 DIN -13.23%",
        "metrics": [
          "paper_online_ab.offline_auc_percent",
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.mm_llm_features.hit_at_10",
          "results.mm_llm_features.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.visual_id_baseline.hit_at_10",
          "results.visual_id_baseline.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation",
            "metric": "engagement",
            "lift_percent": 0.02,
            "traffic": "large-scale online A/B",
            "source_url": "https://arxiv.org/abs/2605.09338",
            "source_location": "original paper online-result disclosure: product=Meta recommendation; metric=engagement"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mmoe",
      "title": "Modeling Task Relationships in Multi-task Learning with Multi-gate Mixture-of-Experts",
      "paper_url": "https://research.google/pubs/modeling-task-relationships-in-multi-task-learning-with-multi-gate-mixture-of-experts/",
      "detail_path": "reproductions/kdd2018-mmoe-mmoe/README.md",
      "topic": [
        "ranking",
        "classic",
        "multi-task",
        "mixture-of-experts"
      ],
      "first_author": null,
      "first_author_affiliation": "Google",
      "published": "2018-08-19",
      "code": null,
      "adapter": {
        "adapter_key": "mmoe",
        "arxiv_id": "kdd2018-mmoe",
        "title": "Modeling Task Relationships in Multi-task Learning with Multi-gate Mixture-of-Experts",
        "paper_url": "https://research.google/pubs/modeling-task-relationships-in-multi-task-learning-with-multi-gate-mixture-of-experts/",
        "track": "recommendation",
        "organization": "Google",
        "published": "2018-08-19",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "multi-task",
          "mixture-of-experts"
        ],
        "local_code_dir": "src/auto_research/reproductions/mmoe",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K entire-space multitask construction"
        ],
        "baseline": "shared-bottom 双任务网络，实验组为每任务独立 gate 的共享 experts",
        "metrics": [
          "baseline.click_auc",
          "baseline.click_auc_std",
          "baseline.click_logloss",
          "baseline.click_logloss_std",
          "baseline.conversion_auc",
          "baseline.conversion_auc_std",
          "baseline.conversion_logloss",
          "baseline.conversion_logloss_std",
          "baseline.mean_auc",
          "baseline.mean_auc_std",
          "method.click_auc",
          "method.click_auc_std",
          "method.click_logloss",
          "method.click_logloss_std",
          "method.conversion_auc",
          "method.conversion_auc_std",
          "method.conversion_logloss",
          "method.conversion_logloss_std",
          "method.mean_auc",
          "method.mean_auc_std",
          "relative.conversion_auc_percent",
          "relative.mean_auc_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=200",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确批准 MMoE 为经典例外；原文生产任务未披露当前门槛要求的量化线上 A/B lift。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mosaic",
      "title": "Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta",
      "paper_url": "https://arxiv.org/abs/2607.24015",
      "detail_path": "reproductions/2607.24015-mosaic/README.md",
      "topic": [
        "user-embedding",
        "multi-task-learning",
        "sequential-recommendation",
        "mixture-of-experts"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "mosaic",
        "arxiv_id": "2607.24015",
        "title": "Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta",
        "paper_url": "https://arxiv.org/abs/2607.24015",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "user-embedding",
          "multi-task-learning",
          "sequential-recommendation",
          "mixture-of-experts"
        ],
        "local_code_dir": "src/auto_research/reproductions/mosaic",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同一 MovieLens-1M 切分、同一 full-catalog 候选集上的单 GRU sequential embedding",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "training.baseline.final_loss",
          "training.baseline.initial_loss",
          "training.mosaic.final_loss",
          "training.mosaic.final_mrm_loss",
          "training.mosaic.initial_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta Surface 1",
            "metric": "topline engagement",
            "lift_percent": 0.1,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2607.24015",
            "source_location": "original paper online-result disclosure: product=Meta Surface 1; metric=topline engagement"
          },
          {
            "product": "Meta Surface 2",
            "metric": "topline engagement",
            "lift_percent": 0.15,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2607.24015",
            "source_location": "original paper online-result disclosure: product=Meta Surface 2; metric=topline engagement"
          },
          {
            "product": "Meta Surface 3",
            "metric": "topline engagement",
            "lift_percent": 0.28,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2607.24015",
            "source_location": "original paper online-result disclosure: product=Meta Surface 3; metric=topline engagement"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "mpformer",
      "title": "MPFormer: Adaptive Framework for Industrial Multi-Task Personalized Sequential Retriever",
      "paper_url": "https://arxiv.org/abs/2508.20400",
      "detail_path": "reproductions/2508.20400-mpformer/README.md",
      "topic": [
        "retrieval",
        "multi-task",
        "sequence",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2025-08-28",
      "code": null,
      "adapter": {
        "adapter_key": "mpformer",
        "arxiv_id": "2508.20400",
        "title": "MPFormer: Adaptive Framework for Industrial Multi-Task Personalized Sequential Retriever",
        "paper_url": "https://arxiv.org/abs/2508.20400",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2025-08-28",
        "code_url": null,
        "topics": [
          "retrieval",
          "multi-task",
          "sequence",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/mpformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 mpformer 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Watch Time",
            "lift_percent": 0.426,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2508.20400",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=Watch Time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "msd",
      "title": "Balancing Efficiency and Effectiveness: An LLM-Infused Approach for Optimized CTR Prediction",
      "paper_url": "https://arxiv.org/abs/2412.06860",
      "detail_path": "reproductions/2412.06860-msd/README.md",
      "topic": [
        "LLM distillation",
        "CTR",
        "serving efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2024-12",
      "code": null,
      "adapter": {
        "adapter_key": "msd",
        "arxiv_id": "2412.06860",
        "title": "Balancing Efficiency and Effectiveness: An LLM-Infused Approach for Optimized CTR Prediction",
        "paper_url": "https://arxiv.org/abs/2412.06860",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2024-12",
        "code_url": null,
        "topics": [
          "LLM distillation",
          "CTR",
          "serving efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/msd",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-100K title/genre CTR"
        ],
        "baseline": "ID-only CTR ranker",
        "metrics": [
          "aggregate.id_auc_mean",
          "aggregate.id_auc_std",
          "aggregate.msd_auc_mean",
          "aggregate.msd_auc_std",
          "per_seed.42.distill_loss_final",
          "per_seed.42.distill_loss_initial",
          "per_seed.42.id_auc",
          "per_seed.42.msd_auc",
          "per_seed.43.distill_loss_final",
          "per_seed.43.distill_loss_initial",
          "per_seed.43.id_auc",
          "per_seed.43.msd_auc",
          "per_seed.44.distill_loss_final",
          "per_seed.44.distill_loss_initial",
          "per_seed.44.id_auc",
          "per_seed.44.msd_auc"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan sponsored search",
            "metric": "CTR",
            "lift_percent": 2.12,
            "traffic": "2024-10-20 to 2024-10-30",
            "source_url": "https://arxiv.org/abs/2412.06860",
            "source_location": "original paper online-result disclosure: product=Meituan sponsored search; metric=CTR"
          },
          {
            "product": "Meituan sponsored search",
            "metric": "CPM",
            "lift_percent": 2.59,
            "traffic": "2024-10-20 to 2024-10-30",
            "source_url": "https://arxiv.org/abs/2412.06860",
            "source_location": "original paper online-result disclosure: product=Meituan sponsored search; metric=CPM"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "msn",
      "title": "MSN: A Memory-based Sparse Activation Scaling Framework for Large-scale Industrial Recommendation",
      "paper_url": "https://arxiv.org/abs/2602.07526",
      "detail_path": "reproductions/2602.07526-msn/README.md",
      "topic": [
        "search-ranking",
        "sparse-memory",
        "product-key-memory"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin Search",
      "published": "2026-02-07",
      "code": null,
      "adapter": {
        "adapter_key": "msn",
        "arxiv_id": "2602.07526",
        "title": "MSN: A Memory-based Sparse Activation Scaling Framework for Large-scale Industrial Recommendation",
        "paper_url": "https://arxiv.org/abs/2602.07526",
        "track": "recommendation",
        "organization": "ByteDance / Douyin Search",
        "published": "2026-02-07",
        "code_url": null,
        "topics": [
          "search-ranking",
          "sparse-memory",
          "product-key-memory"
        ],
        "local_code_dir": "src/auto_research/reproductions/msn",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "dense transition/content ranker，实验组为 gated top-k PKM",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "memory.active_slots_per_request",
          "memory.occupied_slots",
          "memory.slots",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin Search",
            "metric": "Watch time",
            "lift_percent": 0.2958,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.07526",
            "source_location": "original paper online-result disclosure: product=Douyin Search; metric=Watch time"
          },
          {
            "product": "Douyin Search",
            "metric": "Finish rate",
            "lift_percent": 0.2071,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.07526",
            "source_location": "original paper online-result disclosure: product=Douyin Search; metric=Finish rate"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "muchator",
      "title": "MuChator: Enabling Active Music Discovery via Conversational Music LLMs in Douyin Music",
      "paper_url": "https://arxiv.org/abs/2605.27103",
      "detail_path": "reproductions/2605.27103-muchator/README.md",
      "topic": [
        "music-recommendation",
        "conversational-llm",
        "active-discovery"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-05-26",
      "code": null,
      "adapter": {
        "adapter_key": "muchator",
        "arxiv_id": "2605.27103",
        "title": "MuChator: Enabling Active Music Discovery via Conversational Music LLMs in Douyin Music",
        "paper_url": "https://arxiv.org/abs/2605.27103",
        "track": "recommendation",
        "organization": "ByteDance",
        "published": "2026-05-26",
        "code_url": null,
        "topics": [
          "music-recommendation",
          "conversational-llm",
          "active-discovery"
        ],
        "local_code_dir": "src/auto_research/reproductions/muchator",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin Music",
            "metric": "Active days",
            "lift_percent": 46.49,
            "traffic": "approximately one month; >0.1B daily users",
            "source_url": "https://arxiv.org/html/2605.27103v1",
            "source_location": "Section 4.2, Table 2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:conversational-intent"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "netflix-mediafm",
      "title": "Multimedia Asset Personalization via Multimodal Embeddings at Netflix",
      "paper_url": "https://arxiv.org/abs/2608.18322",
      "detail_path": "reproductions/2608.18322-netflix-mediafm/README.md",
      "topic": [
        "multimodal-recommendation",
        "content-understanding",
        "cold-start"
      ],
      "first_author": null,
      "first_author_affiliation": "Netflix",
      "published": "2026-08-18",
      "code": null,
      "adapter": {
        "adapter_key": "netflix-mediafm",
        "arxiv_id": "2608.18322",
        "title": "Multimedia Asset Personalization via Multimodal Embeddings at Netflix",
        "paper_url": "https://arxiv.org/abs/2608.18322",
        "track": "recommendation",
        "organization": "Netflix",
        "published": "2026-08-18",
        "code_url": null,
        "topics": [
          "multimodal-recommendation",
          "content-understanding",
          "cold-start"
        ],
        "local_code_dir": "src/auto_research/reproductions/netflix_mediafm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Netflix Search",
            "metric": "playthrough rate",
            "lift_percent": 0.36,
            "traffic": "Search canvas A/B",
            "source_url": "https://arxiv.org/html/2608.18322v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "next-vlm",
      "title": "NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model",
      "paper_url": "https://arxiv.org/abs/2607.24789",
      "detail_path": "reproductions/2607.24789-next-vlm/README.md",
      "topic": [
        "multimodal",
        "reasoning",
        "retrieval",
        "knowledge-graph",
        "vlm"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-06-27",
      "code": null,
      "adapter": {
        "adapter_key": "next-vlm",
        "arxiv_id": "2607.24789",
        "title": "NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model",
        "paper_url": "https://arxiv.org/abs/2607.24789",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-06-27",
        "code_url": null,
        "topics": [
          "multimodal",
          "reasoning",
          "retrieval",
          "knowledge-graph",
          "vlm"
        ],
        "local_code_dir": "src/auto_research/reproductions/next_vlm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "multi-path transition/semantic ranker",
        "metrics": [
          "Hit@10",
          "NDCG@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "commercial short-form video platform",
            "metric": "watch time",
            "lift_percent": 0.53,
            "traffic": "multi-week A/B at approximately 100M users",
            "source_url": "https://arxiv.org/html/2607.24789v1#S5.SS2",
            "source_location": "Section 5.2 Table 5",
            "experiment_duration": "multiple weeks",
            "retrieved_at": "2026-08-24"
          },
          {
            "product": "commercial short-form video platform",
            "metric": "distinct video exposure",
            "lift_percent": 0.51,
            "traffic": "multi-week A/B at approximately 100M users",
            "source_url": "https://arxiv.org/html/2607.24789v1#S5.SS2",
            "source_location": "Section 5.2 Table 5",
            "experiment_duration": "multiple weeks",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "nontp",
      "title": "Not Only NTP: Extending Training Signal Coverage for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.12277",
      "detail_path": "reproductions/2607.12277-nontp/README.md",
      "topic": [
        "generative-recommendation",
        "contrastive-learning",
        "multi-domain"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "nontp",
        "arxiv_id": "2607.12277",
        "title": "Not Only NTP: Extending Training Signal Coverage for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.12277",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "contrastive-learning",
          "multi-domain"
        ],
        "local_code_dir": "src/auto_research/reproductions/nontp",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K chronological leave-two-out; primary genre domain"
        ],
        "baseline": "相同 causal backbone、相同初始化和训练预算的 ntp",
        "metrics": [
          "relative_nontp_vs_ntp_percent.hit_at_10",
          "relative_nontp_vs_ntp_percent.ndcg_at_10",
          "results.nontp.hit_at_10",
          "results.nontp.hit_at_10_std",
          "results.nontp.ndcg_at_10",
          "results.nontp.ndcg_at_10_std",
          "results.ntp.hit_at_10",
          "results.ntp.hit_at_10_std",
          "results.ntp.ndcg_at_10",
          "results.ntp.ndcg_at_10_std",
          "results.tcl.hit_at_10",
          "results.tcl.hit_at_10_std",
          "results.tcl.ndcg_at_10",
          "results.tcl.ndcg_at_10_std",
          "results.tdl.hit_at_10",
          "results.tdl.hit_at_10_std",
          "results.tdl.ndcg_at_10",
          "results.tdl.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan DSP recall",
            "metric": "CTR",
            "lift_percent": 1.8,
            "traffic": "5% traffic each, 14 days, p<0.01",
            "source_url": "https://arxiv.org/abs/2607.12277",
            "source_location": "original paper online-result disclosure: product=Meituan DSP recall; metric=CTR"
          },
          {
            "product": "Meituan DSP recall",
            "metric": "GMV",
            "lift_percent": 2.1,
            "traffic": "5% traffic each, 14 days, p<0.01",
            "source_url": "https://arxiv.org/abs/2607.12277",
            "source_location": "original paper online-result disclosure: product=Meituan DSP recall; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "notellm",
      "title": "NoteLLM: A Retrievable Large Language Model for Note Recommendation",
      "paper_url": "https://arxiv.org/abs/2403.01744",
      "detail_path": "reproductions/2403.01744-notellm/README.md",
      "topic": [
        "llm-recommendation",
        "contrastive-learning",
        "i2i-retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiaohongshu",
      "published": "2024-03",
      "code": null,
      "adapter": {
        "adapter_key": "notellm",
        "arxiv_id": "2403.01744",
        "title": "NoteLLM: A Retrievable Large Language Model for Note Recommendation",
        "paper_url": "https://arxiv.org/abs/2403.01744",
        "track": "recommendation",
        "organization": "Xiaohongshu",
        "published": "2024-03",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "contrastive-learning",
          "i2i-retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/notellm",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K title/genre and co-occurrence pairs"
        ],
        "baseline": "冻结 compression-state embedding",
        "metrics": [
          "hit_at_10.frozen_compression_embedding.mean",
          "hit_at_10.frozen_compression_embedding.std",
          "hit_at_10.notellm_gcl_csft.mean",
          "hit_at_10.notellm_gcl_csft.std",
          "hit_at_10.relative_change_percent",
          "ndcg_at_10.frozen_compression_embedding.mean",
          "ndcg_at_10.frozen_compression_embedding.std",
          "ndcg_at_10.notellm_gcl_csft.mean",
          "ndcg_at_10.notellm_gcl_csft.std",
          "ndcg_at_10.relative_change_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=40",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Xiaohongshu I2I",
            "metric": "CTR",
            "lift_percent": 16.2,
            "traffic": "week-long online experiment",
            "source_url": "https://arxiv.org/abs/2403.01744",
            "source_location": "original paper online-result disclosure: product=Xiaohongshu I2I; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "nova",
      "title": "NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2606.27243",
      "detail_path": "reproductions/2606.27243-nova/README.md",
      "topic": [
        "auto-research",
        "architecture-evolution",
        "verification"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-06-25",
      "code": null,
      "adapter": {
        "adapter_key": "nova",
        "arxiv_id": "2606.27243",
        "title": "NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2606.27243",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-06-25",
        "code_url": null,
        "topics": [
          "auto-research",
          "architecture-evolution",
          "verification"
        ],
        "local_code_dir": "src/auto_research/reproductions/nova",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "固定启发式 ensemble，实验组为经过验证级联选择的 specialist",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent advertising",
            "metric": "GMV objective 1",
            "lift_percent": 1.25,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2606.27243",
            "source_location": "original paper online-result disclosure: product=Tencent advertising; metric=GMV objective 1"
          },
          {
            "product": "Tencent advertising",
            "metric": "GMV objective 2",
            "lift_percent": 1.7,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2606.27243",
            "source_location": "original paper online-result disclosure: product=Tencent advertising; metric=GMV objective 2"
          },
          {
            "product": "Tencent advertising",
            "metric": "GMV objective 3",
            "lift_percent": 2.02,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2606.27243",
            "source_location": "original paper online-result disclosure: product=Tencent advertising; metric=GMV objective 3"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ogr",
      "title": "Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs",
      "paper_url": "https://arxiv.org/abs/2608.17613",
      "detail_path": "reproductions/2608.17613-ogr/README.md",
      "topic": [
        "generative-recommendation",
        "slate-ranking",
        "semantic-id",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-08-18",
      "code": null,
      "adapter": {
        "adapter_key": "ogr",
        "arxiv_id": "2608.17613",
        "title": "Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs",
        "paper_url": "https://arxiv.org/abs/2608.17613",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-08-18",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "slate-ranking",
          "semantic-id",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/ogr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "Effective Views",
            "lift_percent": 1.12,
            "traffic": "3% production traffic",
            "source_url": "https://arxiv.org/html/2608.17613v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onemall",
      "title": "OneMall: One Model, More Scenarios -- End-to-End Generative Recommender Family at Kuaishou E-Commerce",
      "paper_url": "https://arxiv.org/abs/2601.21770",
      "detail_path": "reproductions/2601.21770-onemall/README.md",
      "topic": [
        "generative-recommendation",
        "multi-scenario",
        "semantic-id"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-01-29",
      "code": null,
      "adapter": {
        "adapter_key": "onemall",
        "arxiv_id": "2601.21770",
        "title": "OneMall: One Model, More Scenarios -- End-to-End Generative Recommender Family at Kuaishou E-Commerce",
        "paper_url": "https://arxiv.org/abs/2601.21770",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-01-29",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "multi-scenario",
          "semantic-id"
        ],
        "local_code_dir": "src/auto_research/reproductions/onemall",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition/content ensemble",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou product-card",
            "metric": "GMV",
            "lift_percent": 13.01,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2601.21770",
            "source_location": "original paper online-result disclosure: product=Kuaishou product-card; metric=GMV"
          },
          {
            "product": "Kuaishou short-video",
            "metric": "orders",
            "lift_percent": 15.32,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2601.21770",
            "source_location": "original paper online-result disclosure: product=Kuaishou short-video; metric=orders"
          },
          {
            "product": "Kuaishou live",
            "metric": "orders",
            "lift_percent": 2.78,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2601.21770",
            "source_location": "original paper online-result disclosure: product=Kuaishou live; metric=orders"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onemodel",
      "title": "OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking",
      "paper_url": "https://arxiv.org/abs/2608.18606",
      "detail_path": "reproductions/2608.18606-onemodel/README.md",
      "topic": [
        "ranking",
        "multi-scenario",
        "foundation-model",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiaohongshu",
      "published": "2026-08-19",
      "code": null,
      "adapter": {
        "adapter_key": "onemodel",
        "arxiv_id": "2608.18606",
        "title": "OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking",
        "paper_url": "https://arxiv.org/abs/2608.18606",
        "track": "recommendation",
        "organization": "Xiaohongshu",
        "published": "2026-08-19",
        "code_url": null,
        "topics": [
          "ranking",
          "multi-scenario",
          "foundation-model",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/onemodel",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "shared global sequential ranker",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Xiaohongshu Explore Feed",
            "metric": "time spent",
            "lift_percent": 0.33,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/html/2608.18606v1#S5.SS3",
            "source_location": "Section 5.3 Table 4",
            "retrieved_at": "2026-08-24"
          },
          {
            "product": "Xiaohongshu Feed Ads",
            "metric": "advertising value",
            "lift_percent": 3.43,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/html/2608.18606v1#S5.SS3",
            "source_location": "Section 5.3 Table 4",
            "retrieved_at": "2026-08-24"
          },
          {
            "product": "Xiaohongshu Merchant Recommendation",
            "metric": "DGMV",
            "lift_percent": 1.1867,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/html/2608.18606v1#S5.SS3",
            "source_location": "Section 5.3 Table 4",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onepiece",
      "title": "OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking",
      "paper_url": "https://arxiv.org/abs/2509.18091",
      "detail_path": "reproductions/2509.18091-onepiece/README.md",
      "topic": [
        "ranking",
        "retrieval",
        "latent-reasoning",
        "multi-task"
      ],
      "first_author": null,
      "first_author_affiliation": "Shopee",
      "published": "2025-09-22",
      "code": null,
      "adapter": {
        "adapter_key": "onepiece",
        "arxiv_id": "2509.18091",
        "title": "OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking",
        "paper_url": "https://arxiv.org/abs/2509.18091",
        "track": "recommendation",
        "organization": "Shopee",
        "published": "2025-09-22",
        "code_url": null,
        "topics": [
          "ranking",
          "retrieval",
          "latent-reasoning",
          "multi-task"
        ],
        "local_code_dir": "src/auto_research/reproductions/onepiece",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 onepiece 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.ad_revenue_percent",
          "paper_results.ranking_gmv_uu_percent",
          "paper_results.retrieval_gmv_uu_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=3",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Shopee",
            "metric": "Advertising Revenue",
            "lift_percent": 2.9,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2509.18091",
            "source_location": "original paper online-result disclosure: product=Shopee; metric=Advertising Revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onerank",
      "title": "OneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.16838",
      "detail_path": "reproductions/2606.16838-onerank/README.md",
      "topic": [
        "ranking",
        "multi-task",
        "transformer"
      ],
      "first_author": null,
      "first_author_affiliation": "Renmin University of China",
      "published": "2026-06-15",
      "code": null,
      "adapter": {
        "adapter_key": "onerank",
        "arxiv_id": "2606.16838",
        "title": "OneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.16838",
        "track": "recommendation",
        "organization": "Renmin University of China",
        "published": "2026-06-15",
        "code_url": null,
        "topics": [
          "ranking",
          "multi-task",
          "transformer"
        ],
        "local_code_dir": "src/auto_research/reproductions/onerank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "Transformer encoder plus separate task predictor",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "task_private_channels",
          "gradient_detach_boundaries"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Shopee personalized ranking",
            "metric": "GMV per user",
            "lift_percent": 1.01,
            "traffic": "seven-day test; 10% treatment and 10% control",
            "source_url": "https://arxiv.org/html/2606.16838v1",
            "source_location": "Section 4.5, Table 3",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:unified-ranker"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "oneranker",
      "title": "OneRanker: Unified Generation and Ranking with One Model in Industrial Advertising Recommendation",
      "paper_url": "https://arxiv.org/abs/2603.02999",
      "detail_path": "reproductions/2603.02999-oneranker/README.md",
      "topic": [
        "advertising",
        "generative-recommendation",
        "ranking",
        "multi-task"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-03-03",
      "code": null,
      "adapter": {
        "adapter_key": "oneranker",
        "arxiv_id": "2603.02999",
        "title": "OneRanker: Unified Generation and Ranking with One Model in Industrial Advertising Recommendation",
        "paper_url": "https://arxiv.org/abs/2603.02999",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-03-03",
        "code_url": null,
        "topics": [
          "advertising",
          "generative-recommendation",
          "ranking",
          "multi-task"
        ],
        "local_code_dir": "src/auto_research/reproductions/oneranker",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 oneranker 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.gmv_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.distribution_consistency_loss",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Weixin Channels Ads",
            "metric": "GMV",
            "lift_percent": 1.34,
            "traffic": "full deployment",
            "source_url": "https://arxiv.org/abs/2603.02999",
            "source_location": "original paper online-result disclosure: product=Weixin Channels Ads; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onerec",
      "title": "OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment",
      "paper_url": "https://arxiv.org/abs/2502.18965",
      "detail_path": "reproductions/2502.18965-onerec/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "onerec",
        "arxiv_id": "2502.18965",
        "title": "OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment",
        "paper_url": "https://arxiv.org/abs/2502.18965",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/onerec",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 1M"
        ],
        "baseline": "Session Generator SFT",
        "metrics": [
          "configuration.reward_steps",
          "results.onerec_iterative_preference_alignment.hit_at_10",
          "results.onerec_iterative_preference_alignment.ndcg_at_10",
          "results.session_generator_sft.hit_at_10",
          "results.session_generator_sft.ndcg_at_10",
          "training.dpo_final_loss",
          "training.dpo_initial_loss",
          "training.reward_final_loss",
          "training.sft_final_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onerec-v2",
      "title": "OneRec-V2 Technical Report",
      "paper_url": "https://arxiv.org/abs/2508.20900",
      "detail_path": "reproductions/2508.20900-onerec-v2/README.md",
      "topic": [
        "llm-recommendation",
        "generative-retrieval",
        "reinforcement-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2025-08",
      "code": null,
      "adapter": {
        "adapter_key": "onerec-v2",
        "arxiv_id": "2508.20900",
        "title": "OneRec-V2 Technical Report",
        "paper_url": "https://arxiv.org/abs/2508.20900",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2025-08",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "generative-retrieval",
          "reinforcement-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/onerec_v2",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "KuaiRand-Pure official standard feed logs"
        ],
        "baseline": "Encoder-Decoder，实验组 Lazy SFT 的延迟 -54.78%、validation loss -0.34%",
        "metrics": [
          "summary.encoder_loss_mean",
          "summary.lazy_latency_reduction_percent",
          "summary.lazy_loss_mean"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou",
            "metric": "app stay time",
            "lift_percent": 0.467,
            "traffic": "5% traffic, one week",
            "source_url": "https://arxiv.org/abs/2508.20900",
            "source_location": "original paper online-result disclosure: product=Kuaishou; metric=app stay time"
          },
          {
            "product": "Kuaishou Lite",
            "metric": "app stay time",
            "lift_percent": 0.741,
            "traffic": "5% traffic, one week",
            "source_url": "https://arxiv.org/abs/2508.20900",
            "source_location": "original paper online-result disclosure: product=Kuaishou Lite; metric=app stay time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "oneshot-index",
      "title": "OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval",
      "paper_url": "https://arxiv.org/abs/2607.27475",
      "detail_path": "reproductions/2607.27475-oneshot-index/README.md",
      "topic": [
        "retrieval",
        "learnable-index",
        "neural-scoring",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta / Instagram",
      "published": "2026-07-29",
      "code": null,
      "adapter": {
        "adapter_key": "oneshot-index",
        "arxiv_id": "2607.27475",
        "title": "OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval",
        "paper_url": "https://arxiv.org/abs/2607.27475",
        "track": "recommendation",
        "organization": "Meta / Instagram",
        "published": "2026-07-29",
        "code_url": null,
        "topics": [
          "retrieval",
          "learnable-index",
          "neural-scoring",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/oneshot_index",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "two-tower dot-product retrieval",
        "metrics": [
          "Hit@10",
          "NDCG@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Instagram short video",
            "metric": "daily sessions",
            "lift_percent": 0.035,
            "traffic": "fully deployed to global traffic",
            "source_url": "https://arxiv.org/html/2607.27475v2#S5.SS1.SSS2",
            "source_location": "Section 5.1.2 Table 3",
            "retrieved_at": "2026-08-24"
          },
          {
            "product": "Instagram short video",
            "metric": "watch time",
            "lift_percent": 0.136,
            "traffic": "fully deployed to global traffic",
            "source_url": "https://arxiv.org/html/2607.27475v2#S5.SS1.SSS2",
            "source_location": "Section 5.1.2 Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "onetrans",
      "title": "OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer in Industrial Recommender",
      "paper_url": "https://arxiv.org/abs/2510.26104",
      "detail_path": "reproductions/2510.26104-onetrans/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "onetrans",
        "arxiv_id": "2510.26104",
        "title": "OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer in Industrial Recommender",
        "paper_url": "https://arxiv.org/abs/2510.26104",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/onetrans",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "独立 sequence encoder 后与 candidate 交互的 Encode-then-Interact",
        "metrics": [
          "ndcg_gain_percent",
          "results.encode_then_interact.hit_at_10",
          "results.encode_then_interact.hit_at_10_std",
          "results.encode_then_interact.ndcg_at_10",
          "results.encode_then_interact.ndcg_at_10_std",
          "results.onetrans.hit_at_10",
          "results.onetrans.hit_at_10_std",
          "results.onetrans.ndcg_at_10",
          "results.onetrans.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "open-web-ufm",
      "title": "Building a User Foundation Model for the Open Web",
      "paper_url": "https://arxiv.org/abs/2607.28019",
      "detail_path": "reproductions/2607.28019-open-web-ufm/README.md",
      "topic": [
        "advertising",
        "user-foundation-model",
        "self-supervised-learning",
        "llm-optimizer"
      ],
      "first_author": null,
      "first_author_affiliation": "Teads",
      "published": "2026-07-30",
      "code": null,
      "adapter": {
        "adapter_key": "open-web-ufm",
        "arxiv_id": "2607.28019",
        "title": "Building a User Foundation Model for the Open Web",
        "paper_url": "https://arxiv.org/abs/2607.28019",
        "track": "recommendation",
        "organization": "Teads",
        "published": "2026-07-30",
        "code_url": null,
        "topics": [
          "advertising",
          "user-foundation-model",
          "self-supervised-learning",
          "llm-optimizer"
        ],
        "local_code_dir": "src/auto_research/reproductions/open_web_ufm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M (240 users / 400 items)"
        ],
        "baseline": "matched control without the open-web-ufm mechanism",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "method.pretraining_updates",
          "relative_ndcg_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Teads click-optimized RTB",
            "metric": "CTR",
            "lift_percent": 2.13,
            "traffic": "full traffic, 50/50 user-level split, 7 days",
            "source_url": "https://arxiv.org/abs/2607.28019",
            "source_location": "original paper online-result disclosure: product=Teads click-optimized RTB; metric=CTR"
          },
          {
            "product": "Teads visit-optimized RTB",
            "metric": "visit rate",
            "lift_percent": 2.37,
            "traffic": "full traffic, 50/50 user-level split, 7 days",
            "source_url": "https://arxiv.org/abs/2607.28019",
            "source_location": "original paper online-result disclosure: product=Teads visit-optimized RTB; metric=visit rate"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "oxygenrec-v2",
      "title": "OxygenREC-v2: Internalizing Discrimination into Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.24255",
      "detail_path": "reproductions/2607.24255-oxygenrec-v2/README.md",
      "topic": [
        "generative-recommendation",
        "privileged-distillation",
        "behavior-instruction"
      ],
      "first_author": null,
      "first_author_affiliation": "JD.COM",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "oxygenrec-v2",
        "arxiv_id": "2607.24255",
        "title": "OxygenREC-v2: Internalizing Discrimination into Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.24255",
        "track": "recommendation",
        "organization": "JD.COM",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "privileged-distillation",
          "behavior-instruction"
        ],
        "local_code_dir": "src/auto_research/reproductions/oxygenrec_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "matched control without the oxygenrec-v2 mechanism",
        "metrics": [
          "paper_results.offline_recall_at_512",
          "paper_results.online_gmv_best_lift_percent",
          "relative.entropy_routed_positions_percent",
          "relative.final_loss_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.initial_loss_percent",
          "relative.ndcg_at_10_percent",
          "relative.parameters_percent",
          "variants.OxygenREC-v2 core.final_loss",
          "variants.OxygenREC-v2 core.hit_at_10",
          "variants.OxygenREC-v2 core.initial_loss",
          "variants.OxygenREC-v2 core.ndcg_at_10",
          "variants.PT-only generator.final_loss",
          "variants.PT-only generator.hit_at_10",
          "variants.PT-only generator.initial_loss",
          "variants.PT-only generator.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=60",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "JD.COM six production surfaces",
            "metric": "UCTCVR",
            "lift_percent": 4.44,
            "traffic": "5–20% traffic, 5–8 days",
            "source_url": "https://arxiv.org/abs/2607.24255",
            "source_location": "original paper online-result disclosure: product=JD.COM six production surfaces; metric=UCTCVR"
          },
          {
            "product": "JD.COM homepage floor",
            "metric": "GMV",
            "lift_percent": 21.21,
            "traffic": "bucketed A/B, p<0.05",
            "source_url": "https://arxiv.org/abs/2607.24255",
            "source_location": "original paper online-result disclosure: product=JD.COM homepage floor; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pa-bridge",
      "title": "Bridging Passive and Active: Enhancing Conversation Starter Recommendation via Active Expression Modeling",
      "paper_url": "https://arxiv.org/abs/2605.05855",
      "detail_path": "reproductions/2605.05855-pa-bridge/README.md",
      "topic": [
        "conversation-starter",
        "distribution-alignment",
        "debiasing"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-05-07",
      "code": null,
      "adapter": {
        "adapter_key": "pa-bridge",
        "arxiv_id": "2605.05855",
        "title": "Bridging Passive and Active: Enhancing Conversation Starter Recommendation via Active Expression Modeling",
        "paper_url": "https://arxiv.org/abs/2605.05855",
        "track": "recommendation",
        "organization": "ByteDance",
        "published": "2026-05-07",
        "code_url": null,
        "topics": [
          "conversation-starter",
          "distribution-alignment",
          "debiasing"
        ],
        "local_code_dir": "src/auto_research/reproductions/pa_bridge",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "ByteDance conversation starter",
            "metric": "Feature penetration",
            "lift_percent": 0.54,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2605.05855v1",
            "source_location": "Section 3.3, Table 2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:active-expression"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "pearl-percentile",
      "title": "PEARL: Unbiased Percentile Estimation via Contrastive Learning for Industrial-Scale Livestream Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.21752",
      "detail_path": "reproductions/2605.21752-pearl-percentile/README.md",
      "topic": [
        "ranking",
        "contrastive-learning",
        "debiasing"
      ],
      "first_author": null,
      "first_author_affiliation": "TikTok",
      "published": "2026-05-20",
      "code": null,
      "adapter": {
        "adapter_key": "pearl-percentile",
        "arxiv_id": "2605.21752",
        "title": "PEARL: Unbiased Percentile Estimation via Contrastive Learning for Industrial-Scale Livestream Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.21752",
        "track": "recommendation",
        "organization": "TikTok",
        "published": "2026-05-20",
        "code_url": null,
        "topics": [
          "ranking",
          "contrastive-learning",
          "debiasing"
        ],
        "local_code_dir": "src/auto_research/reproductions/pearl_percentile",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "livestream platform",
            "metric": "Watch Duration",
            "lift_percent": 2.1,
            "traffic": "week-long online A/B",
            "source_url": "https://arxiv.org/html/2605.21752v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "piano",
      "title": "PIANO: Personalized Reranking via Information Aggregation Node for Music Search Optimization",
      "paper_url": "https://arxiv.org/abs/2606.16641",
      "detail_path": "reproductions/2606.16641-piano/README.md",
      "topic": [
        "search",
        "reranking",
        "listwise"
      ],
      "first_author": null,
      "first_author_affiliation": "NetEase Cloud Music",
      "published": "2026-06-15",
      "code": null,
      "adapter": {
        "adapter_key": "piano",
        "arxiv_id": "2606.16641",
        "title": "PIANO: Personalized Reranking via Information Aggregation Node for Music Search Optimization",
        "paper_url": "https://arxiv.org/abs/2606.16641",
        "track": "recommendation",
        "organization": "NetEase Cloud Music",
        "published": "2026-06-15",
        "code_url": null,
        "topics": [
          "search",
          "reranking",
          "listwise"
        ],
        "local_code_dir": "src/auto_research/reproductions/piano",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "pointwise personalized reranker",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "interest_refiner",
          "information_nodes"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "NetEase Cloud Music search",
            "metric": "CVR",
            "lift_percent": 4.45,
            "traffic": "multi-week stable-bucket experiment",
            "source_url": "https://arxiv.org/html/2606.16641v1",
            "source_location": "Section 5.1, Table 6",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:listwise-node"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "pin-scale",
      "title": "Pin-SCALE: Semantic Cascading and Alignment Learning for Engagement-Aware IDs in Cold-Start Recommendations",
      "paper_url": "https://sigir2026.org/SIGIR2026_program.pdf",
      "detail_path": "reproductions/sigir2026-pin-scale-pin-scale/README.md",
      "topic": [
        "semantic-id",
        "engagement-aware",
        "generative-retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-19",
      "code": null,
      "adapter": {
        "adapter_key": "pin-scale",
        "arxiv_id": "sigir2026-pin-scale",
        "title": "Pin-SCALE: Semantic Cascading and Alignment Learning for Engagement-Aware IDs in Cold-Start Recommendations",
        "paper_url": "https://sigir2026.org/SIGIR2026_program.pdf",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-19",
        "code_url": null,
        "topics": [
          "semantic-id",
          "engagement-aware",
          "generative-retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/pin_scale",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "unweighted semantic/content ranker",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest",
            "metric": "Repin",
            "lift_percent": 3.67,
            "traffic": "online A/B",
            "source_url": "https://sigir2026.org/SIGIR2026_program.pdf",
            "source_location": "original paper online-result disclosure: product=Pinterest; metric=Repin"
          },
          {
            "product": "Pinterest",
            "metric": "DAU",
            "lift_percent": 0.05,
            "traffic": "online A/B",
            "source_url": "https://sigir2026.org/SIGIR2026_program.pdf",
            "source_location": "original paper online-result disclosure: product=Pinterest; metric=DAU"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pinclip",
      "title": "PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest",
      "paper_url": "https://arxiv.org/abs/2603.03544",
      "detail_path": "reproductions/2603.03544-pinclip/README.md",
      "topic": [
        "multimodal",
        "contrastive-learning",
        "cold-start"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-03-03",
      "code": null,
      "adapter": {
        "adapter_key": "pinclip",
        "arxiv_id": "2603.03544",
        "title": "PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest",
        "paper_url": "https://arxiv.org/abs/2603.03544",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-03-03",
        "code_url": null,
        "topics": [
          "multimodal",
          "contrastive-learning",
          "cold-start"
        ],
        "local_code_dir": "src/auto_research/reproductions/pinclip",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "raw genre/content similarity",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest organic fresh content",
            "metric": "Repin",
            "lift_percent": 15.0,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.03544",
            "source_location": "original paper online-result disclosure: product=Pinterest organic fresh content; metric=Repin"
          },
          {
            "product": "Pinterest new Ads",
            "metric": "clicks",
            "lift_percent": 8.7,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2603.03544",
            "source_location": "original paper online-result disclosure: product=Pinterest new Ads; metric=clicks"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pindco",
      "title": "PinDCO: Whole-Page Aware Dynamic Creative Optimization at Scale",
      "paper_url": "https://arxiv.org/abs/2609.11943",
      "detail_path": "reproductions/2609.11943-pindco/README.md",
      "topic": [
        "advertising",
        "creative-optimization",
        "whole-page-optimization",
        "multi-tower"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-21",
      "code": null,
      "adapter": {
        "adapter_key": "pindco",
        "arxiv_id": "2609.11943",
        "title": "PinDCO: Whole-Page Aware Dynamic Creative Optimization at Scale",
        "paper_url": "https://arxiv.org/abs/2609.11943",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-21",
        "code_url": null,
        "topics": [
          "advertising",
          "creative-optimization",
          "whole-page-optimization",
          "multi-tower"
        ],
        "local_code_dir": "src/auto_research/reproductions/pindco",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest Ads",
            "metric": "ad CTR",
            "lift_percent": 3.09,
            "traffic": "production A/B followed by platform launch",
            "source_url": "https://arxiv.org/html/2609.11943v1",
            "source_location": "Abstract; Section 4.2",
            "retrieved_at": "2026-09-15"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pinequalizer",
      "title": "PinEqualizer: Full Funnel Content Exploration and Debiasing System at Pinterest",
      "paper_url": "https://arxiv.org/abs/2607.22518",
      "detail_path": "reproductions/2607.22518-pinequalizer/README.md",
      "topic": [
        "cold-start",
        "exploration",
        "debiasing",
        "ranking",
        "retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "pinequalizer",
        "arxiv_id": "2607.22518",
        "title": "PinEqualizer: Full Funnel Content Exploration and Debiasing System at Pinterest",
        "paper_url": "https://arxiv.org/abs/2607.22518",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-07-23",
        "code_url": null,
        "topics": [
          "cold-start",
          "exploration",
          "debiasing",
          "ranking",
          "retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/pinequalizer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "matched control without the pinequalizer mechanism",
        "metrics": [
          "baseline.fresh_ndcg_at_10",
          "baseline.ndcg_at_10",
          "baseline.underexplored_exposure_at_10",
          "pinequalizer.fresh_ndcg_at_10",
          "pinequalizer.ndcg_at_10",
          "relative_percent.fresh_ndcg_at_10",
          "relative_percent.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Related Pins",
            "metric": "fresh-content engagement volume, ranking architecture",
            "lift_percent": 8.63,
            "traffic": "component-level user A/B",
            "source_url": "https://arxiv.org/abs/2607.22518",
            "source_location": "original paper online-result disclosure: product=Related Pins; metric=fresh-content engagement volume, ranking architecture"
          },
          {
            "product": "Related Pins",
            "metric": "underexplored-content engagement volume, ranking architecture",
            "lift_percent": 6.57,
            "traffic": "component-level user A/B",
            "source_url": "https://arxiv.org/abs/2607.22518",
            "source_location": "original paper online-result disclosure: product=Related Pins; metric=underexplored-content engagement volume, ranking architecture"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pinfm",
      "title": "PinFM: Foundation Model for User Activity Sequences at a Billion-scale Visual Discovery Platform",
      "paper_url": "https://arxiv.org/abs/2507.12704",
      "detail_path": "reproductions/2507.12704-pinfm/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "pinfm",
        "arxiv_id": "2507.12704",
        "title": "PinFM: Foundation Model for User Activity Sequences at a Billion-scale Visual Discovery Platform",
        "paper_url": "https://arxiv.org/abs/2507.12704",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/pinfm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "scratch DCAT",
        "metrics": [
          "test.pinfm.hit_at_10",
          "test.pinfm.hit_at_10_std",
          "test.pinfm.ndcg_at_10",
          "test.pinfm.ndcg_at_10_std",
          "test.scratch_dcat.hit_at_10",
          "test.scratch_dcat.hit_at_10_std",
          "test.scratch_dcat.ndcg_at_10",
          "test.scratch_dcat.ndcg_at_10_std",
          "test_ndcg_gain_percent",
          "validation.ndcg_gain_percent",
          "validation.pinfm.ndcg_at_10",
          "validation.pinfm.ndcg_at_10_std",
          "validation.scratch_dcat.ndcg_at_10",
          "validation.scratch_dcat.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pinrec",
      "title": "PinRec: Outcome-Conditioned, Multi-Token Generative Retrieval for Industry-Scale Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2504.10507",
      "detail_path": "reproductions/2504.10507-pinrec/README.md",
      "topic": [
        "generative-retrieval",
        "outcome-conditioning",
        "multi-token"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2025-04",
      "code": null,
      "adapter": {
        "adapter_key": "pinrec",
        "arxiv_id": "2504.10507",
        "title": "PinRec: Outcome-Conditioned, Multi-Token Generative Retrieval for Industry-Scale Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2504.10507",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2025-04",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "outcome-conditioning",
          "multi-token"
        ],
        "local_code_dir": "src/auto_research/reproductions/pinrec",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K rating outcomes"
        ],
        "baseline": "unconditioned next-token 模型",
        "metrics": [
          "ndcg_at_10.outcome_conditioned_multi_token.mean",
          "ndcg_at_10.outcome_conditioned_multi_token.std",
          "ndcg_at_10.relative_change_percent",
          "ndcg_at_10.unconditioned.mean",
          "ndcg_at_10.unconditioned.std",
          "unordered_recall_at_10.outcome_conditioned_multi_token.mean",
          "unordered_recall_at_10.outcome_conditioned_multi_token.std",
          "unordered_recall_at_10.relative_change_percent",
          "unordered_recall_at_10.unconditioned.mean",
          "unordered_recall_at_10.unconditioned.std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=200",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest Homefeed",
            "metric": "grid clicks",
            "lift_percent": 4.01,
            "traffic": "global traffic, CUPED adjusted",
            "source_url": "https://arxiv.org/abs/2504.10507",
            "source_location": "original paper online-result disclosure: product=Pinterest Homefeed; metric=grid clicks"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pinterest-ads-llm",
      "title": "Fine-Tuned LLM as a Complementary Predictor Improving Ads System",
      "paper_url": "https://arxiv.org/abs/2605.27856",
      "detail_path": "reproductions/2605.27856-pinterest-ads-llm/README.md",
      "topic": [
        "advertising",
        "llm-sft",
        "grpo",
        "candidate-generation"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-05",
      "code": null,
      "adapter": {
        "adapter_key": "pinterest-ads-llm",
        "arxiv_id": "2605.27856",
        "title": "Fine-Tuned LLM as a Complementary Predictor Improving Ads System",
        "paper_url": "https://arxiv.org/abs/2605.27856",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-05",
        "code_url": null,
        "topics": [
          "advertising",
          "llm-sft",
          "grpo",
          "candidate-generation"
        ],
        "local_code_dir": "src/auto_research/reproductions/pinterest_ads_llm",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MiniOneRec Office"
        ],
        "baseline": "同一 SmolLM2-135M、同一公开 advertiser 集合下的 SFT",
        "metrics": [
          "downstream.ranking_auc_baseline",
          "downstream.ranking_auc_relative_percent",
          "downstream.ranking_auc_with_llm_feature",
          "downstream.retrieval_recall_at_50_baseline",
          "downstream.retrieval_recall_at_50_complementary",
          "test.sft.recall_at_1",
          "test.sft.recall_at_20",
          "test.sft.recall_at_5",
          "test.sft_grpo.recall_at_1",
          "test.sft_grpo.recall_at_20",
          "test.sft_grpo.recall_at_5"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "US Shopping Ads",
            "metric": "RoAS",
            "lift_percent": 4.94,
            "traffic": "p=0.021",
            "source_url": "https://arxiv.org/abs/2605.27856",
            "source_location": "original paper online-result disclosure: product=US Shopping Ads; metric=RoAS"
          },
          {
            "product": "Opt-in US Shopping Ads",
            "metric": "RoAS",
            "lift_percent": 6.69,
            "traffic": "p=0.029",
            "source_url": "https://arxiv.org/abs/2605.27856",
            "source_location": "original paper online-result disclosure: product=Opt-in US Shopping Ads; metric=RoAS"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "pit",
      "title": "PIT: A Dynamic Personalized Item Tokenizer for End-to-End Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2602.08530",
      "detail_path": "reproductions/2602.08530-pit/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "dynamic-tokenizer"
      ],
      "first_author": null,
      "first_author_affiliation": "Beijing University of Posts and Telecommunications",
      "published": "2026-02-09",
      "code": null,
      "adapter": {
        "adapter_key": "pit",
        "arxiv_id": "2602.08530",
        "title": "PIT: A Dynamic Personalized Item Tokenizer for End-to-End Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2602.08530",
        "track": "recommendation",
        "organization": "Beijing University of Posts and Telecommunications",
        "published": "2026-02-09",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "dynamic-tokenizer"
        ],
        "local_code_dir": "src/auto_research/reproductions/pit",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou generative recommendation",
            "metric": "Online business metric",
            "lift_percent": 0.402,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2602.08530v1",
            "source_location": "Online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:personalized-tokenizer"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "ple",
      "title": "Progressive Layered Extraction (PLE): A Novel Multi-Task Learning Model for Personalized Recommendations",
      "paper_url": "https://doi.org/10.1145/3383313.3412236",
      "detail_path": "reproductions/recsys2020-ple-ple/README.md",
      "topic": [
        "ranking",
        "classic",
        "multi-task",
        "mixture-of-experts"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2020-09-22",
      "code": null,
      "adapter": {
        "adapter_key": "ple",
        "arxiv_id": "recsys2020-ple",
        "title": "Progressive Layered Extraction (PLE): A Novel Multi-Task Learning Model for Personalized Recommendations",
        "paper_url": "https://doi.org/10.1145/3383313.3412236",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2020-09-22",
        "code_url": null,
        "topics": [
          "ranking",
          "classic",
          "multi-task",
          "mixture-of-experts"
        ],
        "local_code_dir": "src/auto_research/reproductions/ple",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K entire-space multitask construction"
        ],
        "baseline": "MMoE，实验组为共享与任务专属 experts 的 CGC/PLE",
        "metrics": [
          "baseline.click_auc",
          "baseline.click_auc_std",
          "baseline.click_logloss",
          "baseline.click_logloss_std",
          "baseline.conversion_auc",
          "baseline.conversion_auc_std",
          "baseline.conversion_logloss",
          "baseline.conversion_logloss_std",
          "baseline.mean_auc",
          "baseline.mean_auc_std",
          "method.click_auc",
          "method.click_auc_std",
          "method.click_logloss",
          "method.click_logloss_std",
          "method.conversion_auc",
          "method.conversion_auc_std",
          "method.conversion_logloss",
          "method.conversion_logloss_std",
          "method.mean_auc",
          "method.mean_auc_std",
          "relative.conversion_auc_percent",
          "relative.mean_auc_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=200",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确批准 PLE 为经典例外；原文腾讯视频部署证据不按当前新论文的量化线上门槛计入。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "plum",
      "title": "PLUM: Adapting Pre-trained Language Models for Industrial-scale Generative Recommendations",
      "paper_url": "https://arxiv.org/abs/2510.07784",
      "detail_path": "reproductions/2510.07784-plum/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "plum",
        "arxiv_id": "2510.07784",
        "title": "PLUM: Adapting Pre-trained Language Models for Industrial-scale Generative Recommendations",
        "paper_url": "https://arxiv.org/abs/2510.07784",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/plum",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 1M"
        ],
        "baseline": "随机初始化无 CPT（R1），实验组是随机初始化有 CPT（CR1）",
        "metrics": [
          "variants.CR1.cpt_final_loss",
          "variants.CR1.ndcg_at_10",
          "variants.CR1.recall_at_10",
          "variants.CR1.sft_final_loss",
          "variants.CR2.cpt_final_loss",
          "variants.CR2.ndcg_at_10",
          "variants.CR2.recall_at_10",
          "variants.CR2.sft_final_loss",
          "variants.R1.ndcg_at_10",
          "variants.R1.recall_at_10",
          "variants.R1.sft_final_loss",
          "variants.R2.ndcg_at_10",
          "variants.R2.recall_at_10",
          "variants.R2.sft_final_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "podcast-mtl",
      "title": "Cold-Starting Podcast Ads and Promotions with Multi-Task Learning on Spotify",
      "paper_url": "https://arxiv.org/abs/2601.02306",
      "detail_path": "reproductions/2601.02306-podcast-mtl/README.md",
      "topic": [
        "cold-start",
        "multi-task",
        "ads"
      ],
      "first_author": null,
      "first_author_affiliation": "Spotify",
      "published": "2026-01-05",
      "code": null,
      "adapter": {
        "adapter_key": "podcast-mtl",
        "arxiv_id": "2601.02306",
        "title": "Cold-Starting Podcast Ads and Promotions with Multi-Task Learning on Spotify",
        "paper_url": "https://arxiv.org/abs/2601.02306",
        "track": "recommendation",
        "organization": "Spotify",
        "published": "2026-01-05",
        "code_url": null,
        "topics": [
          "cold-start",
          "multi-task",
          "ads"
        ],
        "local_code_dir": "src/auto_research/reproductions/podcast_mtl",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "single-task popularity/content ranker",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Spotify podcast ads",
            "metric": "effective cost per stream",
            "lift_percent": -22.0,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2601.02306",
            "source_location": "original paper online-result disclosure: product=Spotify podcast ads; metric=effective cost per stream"
          },
          {
            "product": "Spotify podcast promotions",
            "metric": "stream rate",
            "lift_percent": 24.0,
            "traffic": "online A/B, upper reported lift",
            "source_url": "https://arxiv.org/abs/2601.02306",
            "source_location": "original paper online-result disclosure: product=Spotify podcast promotions; metric=stream rate"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "poem",
      "title": "POEM: Partial-Order Enhanced Real-Time Sequential Modeling for Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.29946",
      "detail_path": "reproductions/2606.29946-poem/README.md",
      "topic": [
        "sequential-recommendation",
        "partial-order",
        "real-time"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-06-29",
      "code": null,
      "adapter": {
        "adapter_key": "poem",
        "arxiv_id": "2606.29946",
        "title": "POEM: Partial-Order Enhanced Real-Time Sequential Modeling for Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.29946",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-06-29",
        "code_url": null,
        "topics": [
          "sequential-recommendation",
          "partial-order",
          "real-time"
        ],
        "local_code_dir": "src/auto_research/reproductions/poem",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "chronological sequential ranking",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "ranking_signals",
          "partial_order_pairs"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou main page",
            "metric": "Usage Time per User",
            "lift_percent": 0.249,
            "traffic": "seven-day test; 5% treatment and 5% control",
            "source_url": "https://arxiv.org/html/2606.29946v1",
            "source_location": "Section 4.2.3, Table 5",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:partial-order"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "policy-facet",
      "title": "Policy-Grounded Dynamic Facet Suggestions for Job Search",
      "paper_url": "https://arxiv.org/abs/2605.16479",
      "detail_path": "reproductions/2605.16479-policy-facet/README.md",
      "topic": [
        "job-search",
        "facet-retrieval",
        "policy-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "LinkedIn",
      "published": "2026-05-15",
      "code": null,
      "adapter": {
        "adapter_key": "policy-facet",
        "arxiv_id": "2605.16479",
        "title": "Policy-Grounded Dynamic Facet Suggestions for Job Search",
        "paper_url": "https://arxiv.org/abs/2605.16479",
        "track": "recommendation",
        "organization": "LinkedIn",
        "published": "2026-05-15",
        "code_url": null,
        "topics": [
          "job-search",
          "facet-retrieval",
          "policy-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/policy_facet",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "LinkedIn Job Search",
            "metric": "Facet CTR",
            "lift_percent": 34.8,
            "traffic": "production A/B; p<0.0001",
            "source_url": "https://arxiv.org/html/2605.16479v1",
            "source_location": "Section 4.2, Table 5",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:policy-facet"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "precise",
      "title": "PRECISE: Pre-training Sequential Recommenders with Collaborative and Semantic Information",
      "paper_url": "https://arxiv.org/abs/2412.06308",
      "detail_path": "reproductions/2412.06308-precise/README.md",
      "topic": [
        "LLM semantic embedding",
        "sequential pre-training",
        "MoE",
        "targeted training"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent / WeChat",
      "published": "2024-12",
      "code": null,
      "adapter": {
        "adapter_key": "precise",
        "arxiv_id": "2412.06308",
        "title": "PRECISE: Pre-training Sequential Recommenders with Collaborative and Semantic Information",
        "paper_url": "https://arxiv.org/abs/2412.06308",
        "track": "recommendation",
        "organization": "Tencent / WeChat",
        "published": "2024-12",
        "code_url": null,
        "topics": [
          "LLM semantic embedding",
          "sequential pre-training",
          "MoE",
          "targeted training"
        ],
        "local_code_dir": "src/auto_research/reproductions/precise",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "只做目标任务训练的 PRECISE-TT",
        "metrics": [
          "aggregate.relative_lift.cold_recall_at_10_percent",
          "aggregate.relative_lift.ndcg_at_10_percent",
          "aggregate.relative_lift.recall_at_10_percent",
          "aggregate.tt_only.cold_recall_at_10_mean",
          "aggregate.tt_only.cold_recall_at_10_std",
          "aggregate.tt_only.ndcg_at_10_mean",
          "aggregate.tt_only.ndcg_at_10_std",
          "aggregate.tt_only.recall_at_10_mean",
          "aggregate.tt_only.recall_at_10_std",
          "aggregate.ut_plus_tt.cold_recall_at_10_mean",
          "aggregate.ut_plus_tt.cold_recall_at_10_std",
          "aggregate.ut_plus_tt.ndcg_at_10_mean",
          "aggregate.ut_plus_tt.ndcg_at_10_std",
          "aggregate.ut_plus_tt.recall_at_10_mean",
          "aggregate.ut_plus_tt.recall_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "WeChat article ranking",
            "metric": "Clicks",
            "lift_percent": 1.961,
            "traffic": "180M participants",
            "source_url": "https://arxiv.org/abs/2412.06308",
            "source_location": "original paper online-result disclosure: product=WeChat article ranking; metric=Clicks"
          },
          {
            "product": "WeChat article ranking",
            "metric": "Shares",
            "lift_percent": 1.433,
            "traffic": "180M participants",
            "source_url": "https://arxiv.org/abs/2412.06308",
            "source_location": "original paper online-result disclosure: product=WeChat article ranking; metric=Shares"
          },
          {
            "product": "WeChat share U2I recall",
            "metric": "Shares",
            "lift_percent": 2.56,
            "traffic": "26M participants",
            "source_url": "https://arxiv.org/abs/2412.06308",
            "source_location": "original paper online-result disclosure: product=WeChat share U2I recall; metric=Shares"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "primal-dual-decoding",
      "title": "Stochastic Primal-Dual Decoding for Multiobjective Generative Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2607.19357",
      "detail_path": "reproductions/2607.19357-primal-dual-decoding/README.md",
      "topic": [
        "generative-recommendation",
        "multiobjective",
        "constrained-decoding"
      ],
      "first_author": null,
      "first_author_affiliation": "Spotify",
      "published": "2026-05-26",
      "code": null,
      "adapter": {
        "adapter_key": "primal-dual-decoding",
        "arxiv_id": "2607.19357",
        "title": "Stochastic Primal-Dual Decoding for Multiobjective Generative Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2607.19357",
        "track": "recommendation",
        "organization": "Spotify",
        "published": "2026-05-26",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "multiobjective",
          "constrained-decoding"
        ],
        "local_code_dir": "src/auto_research/reproductions/primal_dual_decoding",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Spotify recommender",
            "metric": "Auxiliary objective",
            "lift_percent": 1.8,
            "traffic": "large-scale online A/B; zero user-satisfaction cost",
            "source_url": "https://arxiv.org/html/2607.19357v1",
            "source_location": "Section 5.2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:primal-dual"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "prl-puts",
      "title": "A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2605.16344",
      "detail_path": "reproductions/2605.16344-prl-puts/README.md",
      "topic": [
        "reinforcement-learning",
        "multi-objective-ranking",
        "homefeed"
      ],
      "first_author": null,
      "first_author_affiliation": "Pinterest",
      "published": "2026-05-08",
      "code": null,
      "adapter": {
        "adapter_key": "prl-puts",
        "arxiv_id": "2605.16344",
        "title": "A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2605.16344",
        "track": "recommendation",
        "organization": "Pinterest",
        "published": "2026-05-08",
        "code_url": null,
        "topics": [
          "reinforcement-learning",
          "multi-objective-ranking",
          "homefeed"
        ],
        "local_code_dir": "src/auto_research/reproductions/prl_puts",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Pinterest Homefeed",
            "metric": "P2P impressions",
            "lift_percent": 0.3,
            "traffic": "1% per arm, two weeks",
            "source_url": "https://arxiv.org/html/2605.16344v1",
            "source_location": "Section 6.4 / Table 1",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "promise",
      "title": "PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations",
      "paper_url": "https://arxiv.org/abs/2601.04674",
      "detail_path": "reproductions/2601.04674-promise/README.md",
      "topic": [
        "generative-recommendation",
        "process-reward",
        "test-time-scaling"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-01-08",
      "code": null,
      "adapter": {
        "adapter_key": "promise",
        "arxiv_id": "2601.04674",
        "title": "PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations",
        "paper_url": "https://arxiv.org/abs/2601.04674",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-01-08",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "process-reward",
          "test-time-scaling"
        ],
        "local_code_dir": "src/auto_research/reproductions/promise",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou generative recommendation",
            "metric": "Online core metric",
            "lift_percent": 5.0,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.04674v1",
            "source_location": "Section 4.3",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:process-reward"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "prompt-generation",
      "title": "Prompt Generation Technical Report",
      "paper_url": "https://arxiv.org/abs/2607.11326",
      "detail_path": "reproductions/2607.11326-prompt-generation/README.md",
      "topic": [
        "llm-recommendation",
        "generative-retrieval",
        "autoresearch",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao Search",
      "published": "2026-07",
      "code": null,
      "adapter": {
        "adapter_key": "prompt-generation",
        "arxiv_id": "2607.11326",
        "title": "Prompt Generation Technical Report",
        "paper_url": "https://arxiv.org/abs/2607.11326",
        "track": "recommendation",
        "organization": "Alibaba / Taobao Search",
        "published": "2026-07",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "generative-retrieval",
          "autoresearch",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/prompt_generation",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MiniOneRec Amazon Office_Products"
        ],
        "baseline": "相同 Qwen2.5-0.5B、相同步数和候选集下的 SID only",
        "metrics": [
          "variants.sid_only.final_loss",
          "variants.sid_only.initial_loss",
          "variants.sid_plus_merged_title_brand.final_loss",
          "variants.sid_plus_merged_title_brand.initial_loss",
          "variants.sid_plus_title.final_loss",
          "variants.sid_plus_title.initial_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=20",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Search",
            "metric": "transaction count",
            "lift_percent": 0.47,
            "traffic": "1% traffic for 14 days",
            "source_url": "https://arxiv.org/abs/2607.11326",
            "source_location": "original paper online-result disclosure: product=Taobao Search; metric=transaction count"
          },
          {
            "product": "Taobao Search",
            "metric": "GMV",
            "lift_percent": 0.51,
            "traffic": "1% traffic for 14 days",
            "source_url": "https://arxiv.org/abs/2607.11326",
            "source_location": "original paper online-result disclosure: product=Taobao Search; metric=GMV"
          },
          {
            "product": "Taobao Recommendation Newdetail",
            "metric": "IPV",
            "lift_percent": 0.66,
            "traffic": "2% traffic for 12 days",
            "source_url": "https://arxiv.org/abs/2607.11326",
            "source_location": "original paper online-result disclosure: product=Taobao Recommendation Newdetail; metric=IPV"
          },
          {
            "product": "Taobao Shop Search",
            "metric": "transaction count",
            "lift_percent": 4.01,
            "traffic": "10% traffic for over two weeks",
            "source_url": "https://arxiv.org/abs/2607.11326",
            "source_location": "original paper online-result disclosure: product=Taobao Shop Search; metric=transaction count"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "proximity-features",
      "title": "Proximity Features: Privacy-Compliant Cold-Start Personalization at Airbnb",
      "paper_url": "https://arxiv.org/abs/2607.12246",
      "detail_path": "reproductions/2607.12246-proximity-features/README.md",
      "topic": [
        "cold-start",
        "privacy",
        "features"
      ],
      "first_author": null,
      "first_author_affiliation": "Airbnb",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "proximity-features",
        "arxiv_id": "2607.12246",
        "title": "Proximity Features: Privacy-Compliant Cold-Start Personalization at Airbnb",
        "paper_url": "https://arxiv.org/abs/2607.12246",
        "track": "recommendation",
        "organization": "Airbnb",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "cold-start",
          "privacy",
          "features"
        ],
        "local_code_dir": "src/auto_research/reproductions/proximity_features",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "global cold-start aggregate",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Airbnb marketing landing",
            "metric": "first-time bookers",
            "lift_percent": 2.0,
            "traffic": "experiments 2024-12 to 2026-03",
            "source_url": "https://arxiv.org/abs/2607.12246",
            "source_location": "original paper online-result disclosure: product=Airbnb marketing landing; metric=first-time bookers"
          },
          {
            "product": "Airbnb AutoSuggest",
            "metric": "global bookings",
            "lift_percent": 0.16,
            "traffic": "experiments 2024-12 to 2026-03",
            "source_url": "https://arxiv.org/abs/2607.12246",
            "source_location": "original paper online-result disclosure: product=Airbnb AutoSuggest; metric=global bookings"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "psg",
      "title": "PSG: Pair-Space Generation for Efficient Generative Reranking",
      "paper_url": "https://arxiv.org/abs/2607.26427",
      "detail_path": "reproductions/2607.26427-psg/README.md",
      "topic": [
        "reranking",
        "generative-recommendation",
        "pair-token",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-07-29",
      "code": null,
      "adapter": {
        "adapter_key": "psg",
        "arxiv_id": "2607.26427",
        "title": "PSG: Pair-Space Generation for Efficient Generative Reranking",
        "paper_url": "https://arxiv.org/abs/2607.26427",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-07-29",
        "code_url": null,
        "topics": [
          "reranking",
          "generative-recommendation",
          "pair-token",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/psg",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "item-space autoregressive scorer",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "decode_step_reduction",
          "duplicate_items"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; six-item slate",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou single-column feed",
            "metric": "Stay Time per user",
            "lift_percent": 0.178,
            "traffic": "7-day test; two disjoint 10% traffic buckets",
            "source_url": "https://arxiv.org/html/2607.26427v1",
            "source_location": "Section 5 online A/B test, Table 8",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:pair-space"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "pushdualgen",
      "title": "PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.07989",
      "detail_path": "reproductions/2608.07989-pushdualgen/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "llm-recommendation",
        "push"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-08-08",
      "code": null,
      "adapter": {
        "adapter_key": "pushdualgen",
        "arxiv_id": "2608.07989",
        "title": "PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.07989",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-08-08",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "llm-recommendation",
          "push"
        ],
        "local_code_dir": "src/auto_research/reproductions/pushdualgen",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Push",
            "metric": "effective play rate",
            "lift_percent": 8.5,
            "traffic": "15% traffic, 150M users, 14 days",
            "source_url": "https://arxiv.org/html/2608.07989v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "qgs",
      "title": "From Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark",
      "paper_url": "https://arxiv.org/abs/2605.25514",
      "detail_path": "reproductions/2605.25514-qgs/README.md",
      "topic": [
        "generative-search",
        "search-ranking",
        "long-sequence"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Science and Technology of China / Alibaba",
      "published": "2026-05-25",
      "code": null,
      "adapter": {
        "adapter_key": "qgs",
        "arxiv_id": "2605.25514",
        "title": "From Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark",
        "paper_url": "https://arxiv.org/abs/2605.25514",
        "track": "recommendation",
        "organization": "University of Science and Technology of China / Alibaba",
        "published": "2026-05-25",
        "code_url": null,
        "topics": [
          "generative-search",
          "search-ranking",
          "long-sequence"
        ],
        "local_code_dir": "src/auto_research/reproductions/qgs",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Quark Search",
            "metric": "CTR",
            "lift_percent": 0.62,
            "traffic": "2% traffic, 7 days",
            "source_url": "https://arxiv.org/html/2605.25514v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "quasid",
      "title": "Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale",
      "paper_url": "https://arxiv.org/abs/2603.00632",
      "detail_path": "reproductions/2603.00632-quasid/README.md",
      "topic": [
        "semantic-id",
        "collision-handling",
        "e-commerce"
      ],
      "first_author": null,
      "first_author_affiliation": "University of Electronic Science and Technology of China / Kuaishou",
      "published": "2026-02-28",
      "code": null,
      "adapter": {
        "adapter_key": "quasid",
        "arxiv_id": "2603.00632",
        "title": "Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale",
        "paper_url": "https://arxiv.org/abs/2603.00632",
        "track": "recommendation",
        "organization": "University of Electronic Science and Technology of China / Kuaishou",
        "published": "2026-02-28",
        "code_url": null,
        "topics": [
          "semantic-id",
          "collision-handling",
          "e-commerce"
        ],
        "local_code_dir": "src/auto_research/reproductions/quasid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou e-commerce",
            "metric": "GMV-S2",
            "lift_percent": 2.38,
            "traffic": "5% traffic, five days",
            "source_url": "https://arxiv.org/html/2603.00632v1",
            "source_location": "Section 5.4",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "radar",
      "title": "RADAR: Recall Augmentation through Deferred Asynchronous Retrieval",
      "paper_url": "https://arxiv.org/abs/2506.07261",
      "detail_path": "reproductions/2506.07261-radar/README.md",
      "topic": [
        "retrieval",
        "asynchronous-serving",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2025-06-08",
      "code": null,
      "adapter": {
        "adapter_key": "radar",
        "arxiv_id": "2506.07261",
        "title": "RADAR: Recall Augmentation through Deferred Asynchronous Retrieval",
        "paper_url": "https://arxiv.org/abs/2506.07261",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2025-06-08",
        "code_url": null,
        "topics": [
          "retrieval",
          "asynchronous-serving",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/radar",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 radar 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.recall_at_200_multiplier",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation product",
            "metric": "Engagement",
            "lift_percent": 0.8,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2506.07261",
            "source_location": "original paper online-result disclosure: product=Meta recommendation product; metric=Engagement"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rag-generation",
      "title": "Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale",
      "paper_url": "https://arxiv.org/abs/2606.25496",
      "detail_path": "reproductions/2606.25496-rag-generation/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "video-generation"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou / Beihang University",
      "published": "2026-06-24",
      "code": null,
      "adapter": {
        "adapter_key": "rag-generation",
        "arxiv_id": "2606.25496",
        "title": "Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale",
        "paper_url": "https://arxiv.org/abs/2606.25496",
        "track": "recommendation",
        "organization": "Kuaishou / Beihang University",
        "published": "2026-06-24",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "video-generation"
        ],
        "local_code_dir": "src/auto_research/reproductions/rag_generation",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "fixed-catalog generative recommendation",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "sid_levels",
          "sid_width"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou advertising",
            "metric": "Ad Revenue vs GRM",
            "lift_percent": 1.87,
            "traffic": "large-scale production A/B test",
            "source_url": "https://arxiv.org/html/2606.25496v1",
            "source_location": "Section 4.1, Table 1",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:disentangled-sid"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "rag-qac",
      "title": "Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment",
      "paper_url": "https://arxiv.org/abs/2602.01023",
      "detail_path": "reproductions/2602.01023-rag-qac/README.md",
      "topic": [
        "query-auto-completion",
        "retrieval-augmented-generation",
        "preference-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Apple",
      "published": "2026-02-01",
      "code": null,
      "adapter": {
        "adapter_key": "rag-qac",
        "arxiv_id": "2602.01023",
        "title": "Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment",
        "paper_url": "https://arxiv.org/abs/2602.01023",
        "track": "recommendation",
        "organization": "Apple",
        "published": "2026-02-01",
        "code_url": null,
        "topics": [
          "query-auto-completion",
          "retrieval-augmented-generation",
          "preference-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/rag_qac",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "production query auto-completion",
            "metric": "suggestions taken",
            "lift_percent": 3.46,
            "traffic": "10% production traffic",
            "source_url": "https://arxiv.org/html/2602.01023v1",
            "source_location": "Section 7 / Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ramp",
      "title": "RAMP: Robust Ad Recommendation Under Limited Personalized-Feature Availability via Masking and Alignment Pathways",
      "paper_url": "https://arxiv.org/abs/2607.17473",
      "detail_path": "reproductions/2607.17473-ramp/README.md",
      "topic": [
        "advertising",
        "privacy",
        "distillation",
        "missing-features"
      ],
      "first_author": null,
      "first_author_affiliation": "Huawei Ireland Research Center / University College Dublin",
      "published": "2026-07-20",
      "code": "https://github.com/Ruixinhua/RAMP",
      "adapter": {
        "adapter_key": "ramp",
        "arxiv_id": "2607.17473",
        "title": "RAMP: Robust Ad Recommendation Under Limited Personalized-Feature Availability via Masking and Alignment Pathways",
        "paper_url": "https://arxiv.org/abs/2607.17473",
        "track": "recommendation",
        "organization": "Huawei Ireland Research Center / University College Dublin",
        "published": "2026-07-20",
        "code_url": "https://github.com/Ruixinhua/RAMP",
        "topics": [
          "advertising",
          "privacy",
          "distillation",
          "missing-features"
        ],
        "local_code_dir": "src/auto_research/reproductions/ramp",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "缺失个性化字段的共享 CTR tower，实验组为 RAMP masked dual tower",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Huawei industrial CVR prediction",
            "metric": "Total advertiser value",
            "lift_percent": 3.0,
            "traffic": "production A/B; paper reports over 3%",
            "source_url": "https://arxiv.org/abs/2607.17473",
            "source_location": "original paper online-result disclosure: product=Huawei industrial CVR prediction; metric=Total advertiser value"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rankgraph2",
      "title": "RankGraph-2: Lifecycle Co-Design for Billion-Node Graph Learning in Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.18379",
      "detail_path": "reproductions/2606.18379-rankgraph2/README.md",
      "topic": [
        "graph-retrieval",
        "ppr",
        "residual-quantization"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-06-16",
      "code": null,
      "adapter": {
        "adapter_key": "rankgraph2",
        "arxiv_id": "2606.18379",
        "title": "RankGraph-2: Lifecycle Co-Design for Billion-Node Graph Learning in Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.18379",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-06-16",
        "code_url": null,
        "topics": [
          "graph-retrieval",
          "ppr",
          "residual-quantization"
        ],
        "local_code_dir": "src/auto_research/reproductions/rankgraph2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "one-hop retrieval，实验组为 debiased PPR + 两级 residual cluster index",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation products",
            "metric": "CTR",
            "lift_percent": 0.96,
            "traffic": "20+ production launches",
            "source_url": "https://arxiv.org/abs/2606.18379",
            "source_location": "original paper online-result disclosure: product=Meta recommendation products; metric=CTR"
          },
          {
            "product": "Meta recommendation products",
            "metric": "CVR",
            "lift_percent": 2.75,
            "traffic": "20+ production launches",
            "source_url": "https://arxiv.org/abs/2606.18379",
            "source_location": "original paper online-result disclosure: product=Meta recommendation products; metric=CVR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rankmixer",
      "title": "RankMixer: Scaling Up Ranking Models in Industrial Recommenders",
      "paper_url": "https://arxiv.org/abs/2507.15551",
      "detail_path": "reproductions/2507.15551-rankmixer/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "rankmixer",
        "arxiv_id": "2507.15551",
        "title": "RankMixer: Scaling Up Ranking Models in Industrial Recommenders",
        "paper_url": "https://arxiv.org/abs/2507.15551",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/rankmixer",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "Shared FFN",
        "metrics": [
          "results.rankmixer_dense.hit_at_10",
          "results.rankmixer_dense.ndcg_at_10",
          "results.rankmixer_smoe.hit_at_10",
          "results.rankmixer_smoe.ndcg_at_10",
          "results.shared_ffn.hit_at_10",
          "results.shared_ffn.ndcg_at_10",
          "sparse_vs_shared_ndcg_gain_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rankup",
      "title": "RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2604.17878",
      "detail_path": "reproductions/2604.17878-rankup/README.md",
      "topic": [
        "advertising",
        "representation-collapse",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-04-20",
      "code": null,
      "adapter": {
        "adapter_key": "rankup",
        "arxiv_id": "2604.17878",
        "title": "RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2604.17878",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-04-20",
        "code_url": null,
        "topics": [
          "advertising",
          "representation-collapse",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/rankup",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Weixin advertising",
            "metric": "GMV",
            "lift_percent": 4.81,
            "traffic": "fully deployed across three products",
            "source_url": "https://arxiv.org/html/2604.17878v1",
            "source_location": "Abstract and Section 1",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:high-rank-representation"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "rclrec",
      "title": "RCLRec: Reverse Curriculum Learning for Modeling Sparse Conversions in Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2603.28124",
      "detail_path": "reproductions/2603.28124-rclrec/README.md",
      "topic": [
        "generative-recommendation",
        "conversion-modeling",
        "curriculum-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce Group",
      "published": "2026-03-30",
      "code": null,
      "adapter": {
        "adapter_key": "rclrec",
        "arxiv_id": "2603.28124",
        "title": "RCLRec: Reverse Curriculum Learning for Modeling Sparse Conversions in Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2603.28124",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce Group",
        "published": "2026-03-30",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "conversion-modeling",
          "curriculum-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/rclrec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba advertising recommendation",
            "metric": "Advertising revenue",
            "lift_percent": 2.09,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2603.28124v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:reverse-curriculum"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "real-estate-rerank",
      "title": "LLM-Based Re-Ranking for Real Estate Search",
      "paper_url": "https://arxiv.org/abs/2607.14835",
      "detail_path": "reproductions/2607.14835-real-estate-rerank/README.md",
      "topic": [
        "search-ranking",
        "llm-reranking",
        "content-understanding"
      ],
      "first_author": null,
      "first_author_affiliation": "QuintoAndar",
      "published": "2026-07-16",
      "code": null,
      "adapter": {
        "adapter_key": "real-estate-rerank",
        "arxiv_id": "2607.14835",
        "title": "LLM-Based Re-Ranking for Real Estate Search",
        "paper_url": "https://arxiv.org/abs/2607.14835",
        "track": "recommendation",
        "organization": "QuintoAndar",
        "published": "2026-07-16",
        "code_url": null,
        "topics": [
          "search-ranking",
          "llm-reranking",
          "content-understanding"
        ],
        "local_code_dir": "src/auto_research/reproductions/real_estate_rerank",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "QuintoAndar conversational search",
            "metric": "CTR",
            "lift_percent": 5.3,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/html/2607.14835v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rec-distill",
      "title": "Rec-Distill: An Industrial Distillation Pipeline for Large-Scale Recommendation Models",
      "paper_url": "https://arxiv.org/abs/2605.29755",
      "detail_path": "reproductions/2605.29755-rec-distill/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "rec-distill",
        "arxiv_id": "2605.29755",
        "title": "Rec-Distill: An Industrial Distillation Pipeline for Large-Scale Recommendation Models",
        "paper_url": "https://arxiv.org/abs/2605.29755",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/rec_distill",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "相同日程训练的 Raw Student",
        "metrics": [
          "results.large_teacher.hit_at_10",
          "results.large_teacher.ndcg_at_10",
          "results.raw_student.hit_at_10",
          "results.raw_student.ndcg_at_10",
          "results.rec_distill_student.hit_at_10",
          "results.rec_distill_student.ndcg_at_10",
          "validation_ndcg_by_alpha.0.1",
          "validation_ndcg_by_alpha.0.3",
          "validation_ndcg_by_alpha.1.0",
          "validation_ndcg_by_alpha.3.0"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "recap",
      "title": "RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.15730",
      "detail_path": "reproductions/2607.15730-recap/README.md",
      "topic": [
        "llm-recommendation",
        "semantic-profile",
        "grpo"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology / USTC",
      "published": "2026-07-17",
      "code": null,
      "adapter": {
        "adapter_key": "recap",
        "arxiv_id": "2607.15730",
        "title": "RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.15730",
        "track": "recommendation",
        "organization": "Kuaishou Technology / USTC",
        "published": "2026-07-17",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "semantic-profile",
          "grpo"
        ],
        "local_code_dir": "src/auto_research/reproductions/recap",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "open-loop SFT 流式画像",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "ndcg_at_10_relative_percent",
          "training.grpo_reward_first",
          "training.grpo_reward_last",
          "training.sft_final_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou short-video recommendation",
            "metric": "average application usage time per user",
            "lift_percent": 0.139,
            "traffic": "7-day online A/B; statistically significant",
            "source_url": "https://arxiv.org/abs/2607.15730",
            "source_location": "original paper online-result disclosure: product=Kuaishou short-video recommendation; metric=average application usage time per user"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "recevolve",
      "title": "RecEvolve: A Knowledge-Driven Autonomous Agent System for Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2609.01622",
      "detail_path": "reproductions/2609.01622-recevolve/README.md",
      "topic": [
        "auto-research",
        "agent",
        "two-tower",
        "reward-hacking"
      ],
      "first_author": null,
      "first_author_affiliation": "Google",
      "published": "2026-07-20",
      "code": null,
      "adapter": {
        "adapter_key": "recevolve",
        "arxiv_id": "2609.01622",
        "title": "RecEvolve: A Knowledge-Driven Autonomous Agent System for Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2609.01622",
        "track": "recommendation",
        "organization": "Google",
        "published": "2026-07-20",
        "code_url": null,
        "topics": [
          "auto-research",
          "agent",
          "two-tower",
          "reward-hacking"
        ],
        "local_code_dir": "src/auto_research/reproductions/recevolve",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "fixed Two-Tower-style similarity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "rollbacks",
          "reward hacks blocked"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Google production Two-Tower retrieval",
            "metric": "user satisfaction",
            "lift_percent": 3.77,
            "traffic": "live production A/B champion versus production baseline",
            "source_url": "https://arxiv.org/pdf/2609.01622v1",
            "source_location": "Section 5.7, Table 2",
            "retrieved_at": "2026-09-06"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "controller:recevolve-knowledge-vcs-loop"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "recgpt-mobile",
      "title": "RecGPT-Mobile: On-Device Large Language Models for User Intent Understanding in Taobao Feed Recommendation",
      "paper_url": "https://arxiv.org/abs/2605.04726",
      "detail_path": "reproductions/2605.04726-recgpt-mobile/README.md",
      "topic": [
        "llm-recommendation",
        "on-device",
        "intent-understanding",
        "serving-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2026-05-06",
      "code": null,
      "adapter": {
        "adapter_key": "recgpt-mobile",
        "arxiv_id": "2605.04726",
        "title": "RecGPT-Mobile: On-Device Large Language Models for User Intent Understanding in Taobao Feed Recommendation",
        "paper_url": "https://arxiv.org/abs/2605.04726",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2026-05-06",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "on-device",
          "intent-understanding",
          "serving-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/recgpt_mobile",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 1M next-intent proxy"
        ],
        "baseline": "同一 SmolLM2-135M-Instruct 的零样本 intent completion",
        "metrics": [
          "baseline.examples",
          "baseline.mean_latency_ms",
          "baseline.primary_intent_accuracy",
          "baseline.semantic_intent_accuracy",
          "method.examples",
          "method.mean_latency_ms",
          "method.primary_intent_accuracy",
          "method.semantic_intent_accuracy",
          "paper_results.online_GMV_percent",
          "quantized_method.mean_latency_ms",
          "quantized_method.primary_intent_accuracy",
          "quantized_method.semantic_intent_accuracy",
          "relative.lora_semantic_accuracy_percent",
          "relative.quantized_vs_lora_semantic_percent",
          "relative.serialized_size_reduction_percent",
          "training.final_loss",
          "training.initial_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Mobile Taobao feed",
            "metric": "CLICK",
            "lift_percent": 1.8,
            "traffic": "one-month test across four scenarios",
            "source_url": "https://arxiv.org/abs/2605.04726",
            "source_location": "original paper online-result disclosure: product=Mobile Taobao feed; metric=CLICK"
          },
          {
            "product": "Mobile Taobao feed",
            "metric": "PAY",
            "lift_percent": 2.7,
            "traffic": "one-month test across four scenarios",
            "source_url": "https://arxiv.org/abs/2605.04726",
            "source_location": "original paper online-result disclosure: product=Mobile Taobao feed; metric=PAY"
          },
          {
            "product": "Mobile Taobao feed",
            "metric": "GMV",
            "lift_percent": 2.5,
            "traffic": "one-month test across four scenarios",
            "source_url": "https://arxiv.org/abs/2605.04726",
            "source_location": "original paper online-result disclosure: product=Mobile Taobao feed; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "recgpt-v2",
      "title": "RecGPT-V2 Technical Report",
      "paper_url": "https://arxiv.org/abs/2512.14503",
      "detail_path": "reproductions/2512.14503-recgpt-v2/README.md",
      "topic": [
        "llm-recommendation",
        "multi-agent",
        "reinforcement-learning",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2025-12-16",
      "code": null,
      "adapter": {
        "adapter_key": "recgpt-v2",
        "arxiv_id": "2512.14503",
        "title": "RecGPT-V2 Technical Report",
        "paper_url": "https://arxiv.org/abs/2512.14503",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2025-12-16",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "multi-agent",
          "reinforcement-learning",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/recgpt_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "RecGPT-V1 single-route interest representation",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.mrr_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.mrr_at_10",
          "method.ndcg_at_10",
          "paper_results.ctr_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.mrr_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao",
            "metric": "CTR",
            "lift_percent": 2.98,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2512.14503",
            "source_location": "original paper online-result disclosure: product=Taobao; metric=CTR"
          },
          {
            "product": "Taobao",
            "metric": "IPV",
            "lift_percent": 3.71,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2512.14503",
            "source_location": "original paper online-result disclosure: product=Taobao; metric=IPV"
          },
          {
            "product": "Taobao",
            "metric": "NER",
            "lift_percent": 11.46,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2512.14503",
            "source_location": "original paper online-result disclosure: product=Taobao; metric=NER"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "recgpt-v3",
      "title": "RecGPT-V3 Technical Report",
      "paper_url": "https://arxiv.org/abs/2607.15591",
      "detail_path": "reproductions/2607.15591-recgpt-v3/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "user-memory",
        "latent-reasoning"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2026-07-17",
      "code": null,
      "adapter": {
        "adapter_key": "recgpt-v3",
        "arxiv_id": "2607.15591",
        "title": "RecGPT-V3 Technical Report",
        "paper_url": "https://arxiv.org/abs/2607.15591",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2026-07-17",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "user-memory",
          "latent-reasoning"
        ],
        "local_code_dir": "src/auto_research/reproductions/recgpt_v3",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 1M"
        ],
        "baseline": "同一 MovieLens-1M split、item tower 和训练步数下，重算完整 40-event 历史的无状态 hybrid Transformer",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "diagnostics.memory_input_tokens",
          "diagnostics.memory_token_reduction_percent",
          "diagnostics.memory_traceable_fraction",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.feed_CTR_percent",
          "paper_results.feed_GMV_percent",
          "paper_results.item_CTR_percent",
          "paper_results.item_GMV_percent",
          "paper_results.memory_compute_reduction_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "rqvae.final_loss",
          "rqvae.initial_loss",
          "setup.memory_slots"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=180",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Guess What You Like (feed)",
            "metric": "IPV",
            "lift_percent": 1.28,
            "traffic": "1% treatment vs 1% RecGPT-V2 control",
            "source_url": "https://arxiv.org/abs/2607.15591",
            "source_location": "original paper online-result disclosure: product=Taobao Guess What You Like (feed); metric=IPV"
          },
          {
            "product": "Taobao Guess What You Like (feed)",
            "metric": "CTR",
            "lift_percent": 1.0,
            "traffic": "1% treatment vs 1% RecGPT-V2 control",
            "source_url": "https://arxiv.org/abs/2607.15591",
            "source_location": "original paper online-result disclosure: product=Taobao Guess What You Like (feed); metric=CTR"
          },
          {
            "product": "Taobao Guess What You Like (feed)",
            "metric": "GMV",
            "lift_percent": 3.97,
            "traffic": "1% treatment vs 1% RecGPT-V2 control",
            "source_url": "https://arxiv.org/abs/2607.15591",
            "source_location": "original paper online-result disclosure: product=Taobao Guess What You Like (feed); metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "recharness",
      "title": "RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2607.29241",
      "detail_path": "reproductions/2607.29241-recharness/README.md",
      "topic": [
        "auto-research",
        "bandit",
        "ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Huazhong Agricultural University (Kuaishou internship)",
      "published": "2026-07-31",
      "code": "https://github.com/6lyc/RecHarness",
      "adapter": {
        "adapter_key": "recharness",
        "arxiv_id": "2607.29241",
        "title": "RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2607.29241",
        "track": "recommendation",
        "organization": "Huazhong Agricultural University (Kuaishou internship)",
        "published": "2026-07-31",
        "code_url": "https://github.com/6lyc/RecHarness",
        "topics": [
          "auto-research",
          "bandit",
          "ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/recharness",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "short-video advertising",
            "metric": "ADVV",
            "lift_percent": 2.084,
            "traffic": "10% traffic, 7 days",
            "source_url": "https://arxiv.org/html/2607.29241v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "reco-reward",
      "title": "RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.25901",
      "detail_path": "reproductions/2607.25901-reco-reward/README.md",
      "topic": [
        "llm-recommendation",
        "multimodal",
        "reinforcement-learning",
        "retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou / Nankai University / Chinese Academy of Sciences",
      "published": "2026-07-28",
      "code": null,
      "adapter": {
        "adapter_key": "reco-reward",
        "arxiv_id": "2607.25901",
        "title": "RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.25901",
        "track": "recommendation",
        "organization": "Kuaishou / Nankai University / Chinese Academy of Sciences",
        "published": "2026-07-28",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "multimodal",
          "reinforcement-learning",
          "retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/reco_reward",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "content-only semantic recall，实验组为 RAS 选择",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation_only_model_selection.fresh_hit_at_10",
          "stages.validation_only_model_selection.hit_at_10",
          "stages.validation_only_model_selection.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou live recommendation",
            "metric": "key-page effective-user penetration",
            "lift_percent": 0.265,
            "traffic": "one-week online A/B",
            "source_url": "https://arxiv.org/abs/2607.25901",
            "source_location": "original paper online-result disclosure: product=Kuaishou live recommendation; metric=key-page effective-user penetration"
          },
          {
            "product": "Kuaishou live recommendation",
            "metric": "outflow exposure",
            "lift_percent": 0.791,
            "traffic": "one-week online A/B",
            "source_url": "https://arxiv.org/abs/2607.25901",
            "source_location": "original paper online-result disclosure: product=Kuaishou live recommendation; metric=outflow exposure"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rest",
      "title": "From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs",
      "paper_url": "https://arxiv.org/abs/2609.01240",
      "detail_path": "reproductions/2609.01240-rest/README.md",
      "topic": [
        "ranking-network",
        "long-sequence",
        "shared-prefix-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-09-01",
      "code": null,
      "adapter": {
        "adapter_key": "rest",
        "arxiv_id": "2609.01240",
        "title": "From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs",
        "paper_url": "https://arxiv.org/abs/2609.01240",
        "track": "recommendation",
        "organization": "ByteDance",
        "published": "2026-09-01",
        "code_url": null,
        "topics": [
          "ranking-network",
          "long-sequence",
          "shared-prefix-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/rest",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "production advertising platform",
            "metric": "core revenue metric",
            "lift_percent": 11.93,
            "traffic": "one-week online A/B; fully deployed",
            "source_url": "https://arxiv.org/html/2609.01240v1",
            "source_location": "Abstract; Section 3.5",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:rest-dual-gate"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "reward-guided-decoding",
      "title": "Reward Guided Decoding for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.25344",
      "detail_path": "reproductions/2607.25344-reward-guided-decoding/README.md",
      "topic": [
        "generative-recommendation",
        "decoding",
        "reward",
        "business-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Institute of Information Engineering, Chinese Academy of Sciences",
      "published": "2026-07-28",
      "code": null,
      "adapter": {
        "adapter_key": "reward-guided-decoding",
        "arxiv_id": "2607.25344",
        "title": "Reward Guided Decoding for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.25344",
        "track": "recommendation",
        "organization": "Institute of Information Engineering, Chinese Academy of Sciences",
        "published": "2026-07-28",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "decoding",
          "reward",
          "business-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/reward_guided_decoding",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "generator likelihood decoding",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "guided_expected_reward",
          "kl_from_generator"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; beta=0.55",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou live-streaming recommendation",
            "metric": "watch time",
            "lift_percent": 0.689,
            "traffic": "two-week online A/B test",
            "source_url": "https://arxiv.org/html/2607.25344v1",
            "source_location": "Section 5.4 online A/B test",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:reward-guided"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "rgalign-rec",
      "title": "RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2602.12968",
      "detail_path": "reproductions/2602.12968-rgalign-rec/README.md",
      "topic": [
        "llm-recommendation",
        "query-reasoning",
        "preference-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Forth AI / Shopee / Singapore University of Technology and Design",
      "published": "2026-02-13",
      "code": null,
      "adapter": {
        "adapter_key": "rgalign-rec",
        "arxiv_id": "2602.12968",
        "title": "RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2602.12968",
        "track": "recommendation",
        "organization": "Forth AI / Shopee / Singapore University of Technology and Design",
        "published": "2026-02-13",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "query-reasoning",
          "preference-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/rgalign_rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "production zero-query chatbot",
            "metric": "CTR@3 incremental over QE-Rec",
            "lift_percent": 0.13,
            "traffic": "large-scale online A/B",
            "source_url": "https://arxiv.org/html/2602.12968v1",
            "source_location": "Section 5.4 / Table 5",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rocs",
      "title": "ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.27744",
      "detail_path": "reproductions/2607.27744-rocs/README.md",
      "topic": [
        "retrieval",
        "ranking",
        "serving",
        "compute-sharing"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta AI",
      "published": "2026-07-30",
      "code": "https://github.com/pytorch/FBGEMM/tree/main/fbgemm_gpu/experimental/ikbo",
      "adapter": {
        "adapter_key": "rocs",
        "arxiv_id": "2607.27744",
        "title": "ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.27744",
        "track": "recommendation",
        "organization": "Meta AI",
        "published": "2026-07-30",
        "code_url": "https://github.com/pytorch/FBGEMM/tree/main/fbgemm_gpu/experimental/ikbo",
        "topics": [
          "retrieval",
          "ranking",
          "serving",
          "compute-sharing"
        ],
        "local_code_dir": "src/auto_research/reproductions/rocs",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M (240 users / 400 items)"
        ],
        "baseline": "逐候选重复编码",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative_ndcg_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta retrieval systems",
            "metric": "QPS",
            "lift_percent": 200.0,
            "traffic": "deployed across ads and organic surfaces",
            "source_url": "https://arxiv.org/abs/2607.27744",
            "source_location": "original paper online-result disclosure: product=Meta retrieval systems; metric=QPS"
          },
          {
            "product": "Meta short-form video ranking",
            "metric": "QPS",
            "lift_percent": 50.0,
            "traffic": "production deployment; LogLoss -0.5%",
            "source_url": "https://arxiv.org/abs/2607.27744",
            "source_location": "original paper online-result disclosure: product=Meta short-form video ranking; metric=QPS"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "rolegen",
      "title": "Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning",
      "paper_url": "https://arxiv.org/abs/2602.13134",
      "detail_path": "reproductions/2602.13134-rolegen/README.md",
      "topic": [
        "generative-recommendation",
        "counterfactual-reasoning",
        "dormant-users"
      ],
      "first_author": null,
      "first_author_affiliation": "Beihang University",
      "published": "2026-02-13",
      "code": null,
      "adapter": {
        "adapter_key": "rolegen",
        "arxiv_id": "2602.13134",
        "title": "Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning",
        "paper_url": "https://arxiv.org/abs/2602.13134",
        "track": "recommendation",
        "organization": "Beihang University",
        "published": "2026-02-13",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "counterfactual-reasoning",
          "dormant-users"
        ],
        "local_code_dir": "src/auto_research/reproductions/rolegen",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou e-commerce",
            "metric": "Order volume",
            "lift_percent": 7.3,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2602.13134v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:counterfactual-role"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "rq-gmm",
      "title": "RQ-GMM: Residual Quantized Gaussian Mixture Model for Multimodal Semantic Discretization in CTR Prediction",
      "paper_url": "https://arxiv.org/abs/2602.12593",
      "detail_path": "reproductions/2602.12593-rq-gmm/README.md",
      "topic": [
        "multimodal-recommendation",
        "semantic-tokenization",
        "ctr-prediction"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-02-13",
      "code": null,
      "adapter": {
        "adapter_key": "rq-gmm",
        "arxiv_id": "2602.12593",
        "title": "RQ-GMM: Residual Quantized Gaussian Mixture Model for Multimodal Semantic Discretization in CTR Prediction",
        "paper_url": "https://arxiv.org/abs/2602.12593",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-02-13",
        "code_url": null,
        "topics": [
          "multimodal-recommendation",
          "semantic-tokenization",
          "ctr-prediction"
        ],
        "local_code_dir": "src/auto_research/reproductions/rq_gmm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent short-video advertising",
            "metric": "Advertiser value",
            "lift_percent": 1.502,
            "traffic": "large-scale production online A/B",
            "source_url": "https://arxiv.org/html/2602.12593v1",
            "source_location": "Abstract and online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:residual-gmm"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "s-grec",
      "title": "S-GRec: Personalized Semantic-Aware Generative Recommendation with Asymmetric Advantage",
      "paper_url": "https://arxiv.org/abs/2602.10606",
      "detail_path": "reproductions/2602.10606-s-grec/README.md",
      "topic": [
        "generative-recommendation",
        "llm-as-judge",
        "grpo",
        "a2po"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent / WeChat Channels",
      "published": "2026-02",
      "code": null,
      "adapter": {
        "adapter_key": "s-grec",
        "arxiv_id": "2602.10606",
        "title": "S-GRec: Personalized Semantic-Aware Generative Recommendation with Asymmetric Advantage",
        "paper_url": "https://arxiv.org/abs/2602.10606",
        "track": "recommendation",
        "organization": "Tencent / WeChat Channels",
        "published": "2026-02",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "llm-as-judge",
          "grpo",
          "a2po"
        ],
        "local_code_dir": "src/auto_research/reproductions/s_grec",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MiniOneRec Amazon Office_Products"
        ],
        "baseline": "相同公开 Office 数据、相同 SID Transformer 和 600-step 训练预算的 MiniOneRec-style business SFT checkpoint",
        "metrics": [
          "psj.aligned_point_accuracy",
          "psj.pairwise_accuracy",
          "psj.sft_final_loss",
          "psj.sft_initial_loss",
          "psj.sft_point_accuracy",
          "test.a2po.ndcg_at_10",
          "test.adv_sum.ndcg_at_10",
          "test.business.ndcg_at_10",
          "test.reward_sum.hr_at_10",
          "test.reward_sum.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "WeChat Channels",
            "metric": "GMV",
            "lift_percent": 1.19,
            "traffic": "20% advertising traffic",
            "source_url": "https://arxiv.org/abs/2602.10606",
            "source_location": "original paper online-result disclosure: product=WeChat Channels; metric=GMV"
          },
          {
            "product": "WeChat Channels",
            "metric": "CTR",
            "lift_percent": 1.16,
            "traffic": "20% advertising traffic",
            "source_url": "https://arxiv.org/abs/2602.10606",
            "source_location": "original paper online-result disclosure: product=WeChat Channels; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "s2gr",
      "title": "S2GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation",
      "paper_url": "https://arxiv.org/abs/2601.18664",
      "detail_path": "reproductions/2601.18664-s2gr/README.md",
      "topic": [
        "generative-recommendation",
        "latent-reasoning",
        "semantic-id"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-01-26",
      "code": null,
      "adapter": {
        "adapter_key": "s2gr",
        "arxiv_id": "2601.18664",
        "title": "S2GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation",
        "paper_url": "https://arxiv.org/abs/2601.18664",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-01-26",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "latent-reasoning",
          "semantic-id"
        ],
        "local_code_dir": "src/auto_research/reproductions/s2gr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou recommendation",
            "metric": "Online core metric",
            "lift_percent": 5.25,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.18664v1",
            "source_location": "Section 5.4",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:stepwise-semantic-reasoning"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "safro",
      "title": "SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search",
      "paper_url": "https://arxiv.org/abs/2603.19585",
      "detail_path": "reproductions/2603.19585-safro/README.md",
      "topic": [
        "search-ranking",
        "reinforcement-learning",
        "multi-task-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-03-20",
      "code": null,
      "adapter": {
        "adapter_key": "safro",
        "arxiv_id": "2603.19585",
        "title": "SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search",
        "paper_url": "https://arxiv.org/abs/2603.19585",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-03-20",
        "code_url": null,
        "topics": [
          "search-ranking",
          "reinforcement-learning",
          "multi-task-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/safro",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Search",
            "metric": "watch time",
            "lift_percent": 0.611,
            "traffic": "10% traffic, two months",
            "source_url": "https://arxiv.org/html/2603.19585v1",
            "source_location": "Section 5.4 / Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sam",
      "title": "Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy",
      "paper_url": "https://arxiv.org/abs/2607.12714",
      "detail_path": "reproductions/2607.12714-sam/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "satiation"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba Group",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "sam",
        "arxiv_id": "2607.12714",
        "title": "Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy",
        "paper_url": "https://arxiv.org/abs/2607.12714",
        "track": "recommendation",
        "organization": "Alibaba Group",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "satiation"
        ],
        "local_code_dir": "src/auto_research/reproductions/sam",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "movielens 100k"
        ],
        "baseline": "DIN-like interest score",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba recommendation",
            "metric": "CTR",
            "lift_percent": 1.1,
            "traffic": "1% traffic",
            "source_url": "https://arxiv.org/abs/2607.12714",
            "source_location": "original paper online-result disclosure: product=Alibaba recommendation; metric=CTR"
          },
          {
            "product": "Alibaba recommendation",
            "metric": "GMV",
            "lift_percent": 0.9,
            "traffic": "1% traffic",
            "source_url": "https://arxiv.org/abs/2607.12714",
            "source_location": "original paper online-result disclosure: product=Alibaba recommendation; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sarm",
      "title": "SARM: LLM-Augmented Semantic Anchor for End-to-End Live-Streaming Ranking",
      "paper_url": "https://arxiv.org/abs/2602.09401",
      "detail_path": "reproductions/2602.09401-sarm/README.md",
      "topic": [
        "live-streaming",
        "semantic-anchor",
        "multimodal-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Institute of Information Engineering, CAS / Kuaishou",
      "published": "2026-02-10",
      "code": null,
      "adapter": {
        "adapter_key": "sarm",
        "arxiv_id": "2602.09401",
        "title": "SARM: LLM-Augmented Semantic Anchor for End-to-End Live-Streaming Ranking",
        "paper_url": "https://arxiv.org/abs/2602.09401",
        "track": "recommendation",
        "organization": "Institute of Information Engineering, CAS / Kuaishou",
        "published": "2026-02-10",
        "code_url": null,
        "topics": [
          "live-streaming",
          "semantic-anchor",
          "multimodal-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/sarm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Lite live-streaming",
            "metric": "watch count",
            "lift_percent": 1.19,
            "traffic": "two-week A/B; subsequently fully deployed",
            "source_url": "https://arxiv.org/html/2602.09401v1",
            "source_location": "Section 4.4 / Table 3",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sasrec",
      "title": "Self-Attentive Sequential Recommendation",
      "paper_url": "https://arxiv.org/abs/1808.09781",
      "detail_path": "reproductions/1808.09781-sasrec/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": "https://github.com/kang205/SASRec",
      "adapter": {
        "adapter_key": "sasrec",
        "arxiv_id": "1808.09781",
        "title": "Self-Attentive Sequential Recommendation",
        "paper_url": "https://arxiv.org/abs/1808.09781",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": "https://github.com/kang205/SASRec",
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/sasrec",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "popularity 排序",
        "metrics": [
          "ndcg_gain_percent",
          "popularity.hit_at_10",
          "popularity.ndcg_at_10",
          "sasrec.hit_at_10",
          "sasrec.hit_at_10_std",
          "sasrec.ndcg_at_10",
          "sasrec.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=320",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "saviorrec",
      "title": "SaviorRec: Semantic-Behavior Alignment for Cold-Start Recommendation",
      "paper_url": "https://arxiv.org/abs/2508.01375",
      "detail_path": "reproductions/2508.01375-saviorrec/README.md",
      "topic": [
        "cold start",
        "semantic ID",
        "multimodal recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2025-08",
      "code": null,
      "adapter": {
        "adapter_key": "saviorrec",
        "arxiv_id": "2508.01375",
        "title": "SaviorRec: Semantic-Behavior Alignment for Cold-Start Recommendation",
        "paper_url": "https://arxiv.org/abs/2508.01375",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2025-08",
        "code_url": null,
        "topics": [
          "cold start",
          "semantic ID",
          "multimodal recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/saviorrec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K genres and chronological co-interactions"
        ],
        "baseline": "等预算 Content Ranker",
        "metrics": [
          "aggregate.auc_relative_percent",
          "aggregate.cold_auc_relative_percent",
          "aggregate.content_auc_mean",
          "aggregate.content_auc_std",
          "aggregate.content_cold_auc_mean",
          "aggregate.content_cold_auc_std",
          "aggregate.positive_auc_seeds",
          "aggregate.positive_cold_auc_seeds",
          "aggregate.saviorrec_auc_mean",
          "aggregate.saviorrec_auc_std",
          "aggregate.saviorrec_cold_auc_mean",
          "aggregate.saviorrec_cold_auc_std",
          "per_seed.42.content_auc",
          "per_seed.42.content_cold_auc",
          "per_seed.42.saviorrec_auc",
          "per_seed.42.saviorrec_cold_auc",
          "per_seed.43.content_auc",
          "per_seed.43.content_cold_auc",
          "per_seed.43.saviorrec_auc",
          "per_seed.43.saviorrec_cold_auc",
          "per_seed.44.content_auc",
          "per_seed.44.content_cold_auc",
          "per_seed.44.saviorrec_auc",
          "per_seed.44.saviorrec_cold_auc"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=180",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Guess You Like cold-start",
            "metric": "Clicks",
            "lift_percent": 13.31,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2508.01375",
            "source_location": "original paper online-result disclosure: product=Taobao Guess You Like cold-start; metric=Clicks"
          },
          {
            "product": "Taobao Guess You Like cold-start",
            "metric": "Orders",
            "lift_percent": 13.44,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2508.01375",
            "source_location": "original paper online-result disclosure: product=Taobao Guess You Like cold-start; metric=Orders"
          },
          {
            "product": "Taobao Guess You Like cold-start",
            "metric": "CTR",
            "lift_percent": 12.8,
            "traffic": "production A/B",
            "source_url": "https://arxiv.org/abs/2508.01375",
            "source_location": "original paper online-result disclosure: product=Taobao Guess You Like cold-start; metric=CTR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "scalr",
      "title": "Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2606.00282",
      "detail_path": "reproductions/2606.00282-scalr/README.md",
      "topic": [
        "cross-domain",
        "synthetic-data",
        "sampling",
        "conversion",
        "data-augmentation"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-05-29",
      "code": null,
      "adapter": {
        "adapter_key": "scalr",
        "arxiv_id": "2606.00282",
        "title": "Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2606.00282",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-05-29",
        "code_url": null,
        "topics": [
          "cross-domain",
          "synthetic-data",
          "sampling",
          "conversion",
          "data-augmentation"
        ],
        "local_code_dir": "src/auto_research/reproductions/scalr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items; genre-derived domains)"
        ],
        "baseline": "deterministic top-k translation under the identical source events and candidate catalog",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "head_share_at_10",
          "synthetic_catalog_coverage"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "two synthetic targets per source event",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta industrial recommendation platform",
            "metric": "conversion rate",
            "lift_percent": 0.14,
            "traffic": "live traffic over multiple weeks; paper reports a consistent +0.14% to +0.24% range",
            "source_url": "https://arxiv.org/html/2606.00282v1#S5.SS2",
            "source_location": "Section 5.2",
            "experiment_duration": "multiple weeks",
            "significance": "statistically significant",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "data:scalr"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "self-evolving-rec",
      "title": "Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents",
      "paper_url": "https://arxiv.org/abs/2602.10226",
      "detail_path": "reproductions/2602.10226-self-evolving-rec/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "self-evolving-rec",
        "arxiv_id": "2602.10226",
        "title": "Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents",
        "paper_url": "https://arxiv.org/abs/2602.10226",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/self_evolving_rec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "Human/Adagrad 配置",
        "metrics": [
          "relative_ndcg_change_percent",
          "results.human_baseline.hit_at_10",
          "results.human_baseline.hit_at_10_std",
          "results.human_baseline.ndcg_at_10",
          "results.human_baseline.ndcg_at_10_std",
          "results.llm_agent_promoted.hit_at_10",
          "results.llm_agent_promoted.hit_at_10_std",
          "results.llm_agent_promoted.ndcg_at_10",
          "results.llm_agent_promoted.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "semantic-native-longseq",
      "title": "Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling",
      "paper_url": "https://arxiv.org/abs/2606.07546",
      "detail_path": "reproductions/2606.07546-semantic-native-longseq/README.md",
      "topic": [
        "long-sequence",
        "semantic-id",
        "rq-vae",
        "efficient-transformer",
        "cold-start"
      ],
      "first_author": null,
      "first_author_affiliation": "Google",
      "published": "2026-05-04",
      "code": null,
      "adapter": {
        "adapter_key": "semantic-native-longseq",
        "arxiv_id": "2606.07546",
        "title": "Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling",
        "paper_url": "https://arxiv.org/abs/2606.07546",
        "track": "recommendation",
        "organization": "Google",
        "published": "2026-05-04",
        "code_url": null,
        "topics": [
          "long-sequence",
          "semantic-id",
          "rq-vae",
          "efficient-transformer",
          "cold-start"
        ],
        "local_code_dir": "src/auto_research/reproductions/semantic_native_longseq",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "12-event item-ID feature attention under the same public split and full catalog",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "head_share_at_10",
          "attention_pair_reduction"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "48 events folded by 4 into 12 local tokens plus two global queries",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Google global short-video platform",
            "metric": "actively engaged users",
            "lift_percent": 0.52,
            "traffic": "large-scale online A/B; full SID + compressed-transformer system versus L=800 Video-ID baseline",
            "source_url": "https://arxiv.org/html/2606.07546v1#S3.SS5",
            "source_location": "Section 3.5, Table 4",
            "significance": "p < 0.05",
            "retrieved_at": "2026-09-01"
          },
          {
            "product": "Google global short-video platform",
            "metric": "satisfied watch time",
            "lift_percent": 1.42,
            "traffic": "large-scale online A/B; full SID + compressed-transformer system",
            "source_url": "https://arxiv.org/html/2606.07546v1#S3.SS5",
            "source_location": "Section 3.5, Table 4",
            "significance": "p < 0.05",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "rankmixer_semantic_native_longseq"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "sequenceo1",
      "title": "SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching",
      "paper_url": "https://arxiv.org/abs/2609.08443",
      "detail_path": "reproductions/2609.08443-sequenceo1/README.md",
      "topic": [
        "long-sequence",
        "sketch-attention",
        "prototype-compression",
        "industrial-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin",
      "published": "2026-09-08",
      "code": null,
      "adapter": {
        "adapter_key": "sequenceo1",
        "arxiv_id": "2609.08443",
        "title": "SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching",
        "paper_url": "https://arxiv.org/abs/2609.08443",
        "track": "recommendation",
        "organization": "ByteDance / Douyin",
        "published": "2026-09-08",
        "code_url": null,
        "topics": [
          "long-sequence",
          "sketch-attention",
          "prototype-compression",
          "industrial-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/sequenceo1",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin and Douyin Lite recommender",
            "metric": "30-day activeness",
            "lift_percent": 0.1968,
            "traffic": "one-month A/B followed by full-traffic deployment",
            "source_url": "https://arxiv.org/html/2609.08443",
            "source_location": "Section 4.3, Table 4",
            "experiment_duration": "one month",
            "significance": "all reported effects statistically significant",
            "retrieved_at": "2026-09-12"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "seral",
      "title": "Bursting Filter Bubble: Enhancing Serendipity Recommendations with Aligned Large Language Models",
      "paper_url": "https://arxiv.org/abs/2502.13539",
      "detail_path": "reproductions/2502.13539-seral/README.md",
      "topic": [
        "llm-recommendation",
        "preference-alignment",
        "serendipity"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao",
      "published": "2025-02",
      "code": null,
      "adapter": {
        "adapter_key": "seral",
        "arxiv_id": "2502.13539",
        "title": "Bursting Filter Bubble: Enhancing Serendipity Recommendations with Aligned Large Language Models",
        "paper_url": "https://arxiv.org/abs/2502.13539",
        "track": "recommendation",
        "organization": "Alibaba / Taobao",
        "published": "2025-02",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "preference-alignment",
          "serendipity"
        ],
        "local_code_dir": "src/auto_research/reproductions/seral",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "DIN，SERAL NDCG@10 相对 DIN +50.60%",
        "metrics": [
          "results.din.hit_at_10",
          "results.din.ndcg_at_10",
          "results.ndcg_ablation_percent",
          "results.ndcg_vs_din_percent",
          "results.seral_ipo.hit_at_10",
          "results.seral_ipo.ndcg_at_10",
          "results.sft.hit_at_10",
          "results.sft.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=100",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Guess What You Like",
            "metric": "serendipity clicks",
            "lift_percent": 29.56,
            "traffic": "fully deployed online experiment",
            "source_url": "https://arxiv.org/abs/2502.13539",
            "source_location": "original paper online-result disclosure: product=Taobao Guess What You Like; metric=serendipity clicks"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sessionrec",
      "title": "SessionRec: Next Session Prediction Paradigm For Generative Sequential Recommendation",
      "paper_url": "https://arxiv.org/abs/2502.10157",
      "detail_path": "reproductions/2502.10157-sessionrec/README.md",
      "topic": [
        "session recommendation",
        "generative retrieval"
      ],
      "first_author": null,
      "first_author_affiliation": "Meituan",
      "published": "2025-02",
      "code": null,
      "adapter": {
        "adapter_key": "sessionrec",
        "arxiv_id": "2502.10157",
        "title": "SessionRec: Next Session Prediction Paradigm For Generative Sequential Recommendation",
        "paper_url": "https://arxiv.org/abs/2502.10157",
        "track": "recommendation",
        "organization": "Meituan",
        "published": "2025-02",
        "code_url": null,
        "topics": [
          "session recommendation",
          "generative retrieval"
        ],
        "local_code_dir": "src/auto_research/reproductions/sessionrec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "KuaiRand-Pure standard exposure log"
        ],
        "baseline": "等预算的扁平 Item Transformer",
        "metrics": [
          "aggregate.item_transformer.ndcg_at_20_mean",
          "aggregate.item_transformer.ndcg_at_20_std",
          "aggregate.item_transformer.recall_at_20_mean",
          "aggregate.item_transformer.recall_at_20_std",
          "aggregate.sessionrec_ndcg_relative_percent",
          "aggregate.sessionrec_transformer.ndcg_at_20_mean",
          "aggregate.sessionrec_transformer.ndcg_at_20_std",
          "aggregate.sessionrec_transformer.recall_at_20_mean",
          "aggregate.sessionrec_transformer.recall_at_20_std",
          "per_seed.42.item_transformer_ndcg_at_20",
          "per_seed.42.sessionrec_ndcg_at_20",
          "per_seed.43.item_transformer_ndcg_at_20",
          "per_seed.43.sessionrec_ndcg_at_20",
          "per_seed.44.item_transformer_ndcg_at_20",
          "per_seed.44.sessionrec_ndcg_at_20"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=180",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan homepage",
            "metric": "Pay PV",
            "lift_percent": 0.603,
            "traffic": "7 days",
            "source_url": "https://arxiv.org/abs/2502.10157",
            "source_location": "original paper online-result disclosure: product=Meituan homepage; metric=Pay PV"
          },
          {
            "product": "Meituan homepage",
            "metric": "PVCTCVR",
            "lift_percent": 0.564,
            "traffic": "7 days",
            "source_url": "https://arxiv.org/abs/2502.10157",
            "source_location": "original paper online-result disclosure: product=Meituan homepage; metric=PVCTCVR"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "setmir",
      "title": "SetMIR: Multi-Interest Retrieval as Set Prediction",
      "paper_url": "https://arxiv.org/abs/2608.30251",
      "detail_path": "reproductions/2608.30251-setmir/README.md",
      "topic": [
        "multi-interest-retrieval",
        "set-prediction",
        "dynamic-dispatch"
      ],
      "first_author": null,
      "first_author_affiliation": "Snap Inc.",
      "published": "2026-08-31",
      "code": null,
      "adapter": {
        "adapter_key": "setmir",
        "arxiv_id": "2608.30251",
        "title": "SetMIR: Multi-Interest Retrieval as Set Prediction",
        "paper_url": "https://arxiv.org/abs/2608.30251",
        "track": "recommendation",
        "organization": "Snap Inc.",
        "published": "2026-08-31",
        "code_url": null,
        "topics": [
          "multi-interest-retrieval",
          "set-prediction",
          "dynamic-dispatch"
        ],
        "local_code_dir": "src/auto_research/reproductions/setmir",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Snap Dynamic Product Ads",
            "metric": "overall CVR",
            "lift_percent": 3.1,
            "traffic": "deployed production retrieval source",
            "source_url": "https://arxiv.org/html/2608.30251v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:setmir-query-set"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "sid-coord",
      "title": "SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search",
      "paper_url": "https://arxiv.org/abs/2604.10471",
      "detail_path": "reproductions/2604.10471-sid-coord/README.md",
      "topic": [
        "short-video-search",
        "semantic-id",
        "long-tail-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-04-12",
      "code": null,
      "adapter": {
        "adapter_key": "sid-coord",
        "arxiv_id": "2604.10471",
        "title": "SID-Coord: Coordinating Semantic IDs for ID-based Ranking in Short-Video Search",
        "paper_url": "https://arxiv.org/abs/2604.10471",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-04-12",
        "code_url": null,
        "topics": [
          "short-video-search",
          "semantic-id",
          "long-tail-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/sid_coord",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou short-video search",
            "metric": "Long-play rate",
            "lift_percent": 0.664,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2604.10471v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:sid-coordination"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "sigma",
      "title": "SIGMA: A Semantic-Grounded Instruction-Driven Generative Multi-Task Recommender at AliExpress",
      "paper_url": "https://arxiv.org/abs/2602.22913",
      "detail_path": "reproductions/2602.22913-sigma/README.md",
      "topic": [
        "generative-recommendation",
        "multi-task-sft",
        "hybrid-token",
        "semantic-grounding"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / AliExpress",
      "published": "2026-02",
      "code": null,
      "adapter": {
        "adapter_key": "sigma",
        "arxiv_id": "2602.22913",
        "title": "SIGMA: A Semantic-Grounded Instruction-Driven Generative Multi-Task Recommender at AliExpress",
        "paper_url": "https://arxiv.org/abs/2602.22913",
        "track": "recommendation",
        "organization": "Alibaba / AliExpress",
        "published": "2026-02",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "multi-task-sft",
          "hybrid-token",
          "semantic-grounding"
        ],
        "local_code_dir": "src/auto_research/reproductions/sigma",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MiniOneRec Office"
        ],
        "baseline": "同一 grounded SmolLM、相同七任务 SFT 与 fused item vectors 下的 idonly item head",
        "metrics": [
          "selected_relative_to_id_only_percent.ndcg_at_10",
          "test.apf.ndcg_at_10",
          "test.id_only.ndcg_at_10",
          "test.top1_prefix.ndcg_at_10",
          "training.grounding_final_loss",
          "training.grounding_initial_loss",
          "training.sft_final_loss",
          "training.sft_initial_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=480",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "AliExpress",
            "metric": "Order Volume",
            "lift_percent": 2.8,
            "traffic": "5% traffic, 2 weeks",
            "source_url": "https://arxiv.org/abs/2602.22913",
            "source_location": "original paper online-result disclosure: product=AliExpress; metric=Order Volume"
          },
          {
            "product": "AliExpress",
            "metric": "GMV",
            "lift_percent": 7.84,
            "traffic": "5% traffic, 2 weeks",
            "source_url": "https://arxiv.org/abs/2602.22913",
            "source_location": "original paper online-result disclosure: product=AliExpress; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sim",
      "title": "Search-based User Interest Modeling with Lifelong Sequential Behavior Data for CTR Prediction",
      "paper_url": "https://arxiv.org/abs/2006.05639",
      "detail_path": "reproductions/2006.05639-sim/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "training-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba",
      "published": "2020-06-10",
      "code": null,
      "adapter": {
        "adapter_key": "sim",
        "arxiv_id": "2006.05639",
        "title": "Search-based User Interest Modeling with Lifelong Sequential Behavior Data for CTR Prediction",
        "paper_url": "https://arxiv.org/abs/2006.05639",
        "track": "recommendation",
        "organization": "Alibaba",
        "published": "2020-06-10",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "training-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/sim",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "shared transition + content baseline，实验组为 SIM，只改变论文核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.ctr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba display advertising",
            "metric": "CTR",
            "lift_percent": 7.1,
            "traffic": "main traffic",
            "source_url": "https://arxiv.org/abs/2006.05639",
            "source_location": "original paper online-result disclosure: product=Alibaba display advertising; metric=CTR"
          },
          {
            "product": "Alibaba display advertising",
            "metric": "RPM",
            "lift_percent": 4.4,
            "traffic": "main traffic",
            "source_url": "https://arxiv.org/abs/2006.05639",
            "source_location": "original paper online-result disclosure: product=Alibaba display advertising; metric=RPM"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sirf",
      "title": "SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control",
      "paper_url": "https://arxiv.org/abs/2609.11752",
      "detail_path": "reproductions/2609.11752-sirf/README.md",
      "topic": [
        "content-understanding",
        "risk-control",
        "foundation-model",
        "industrial-deployment"
      ],
      "first_author": null,
      "first_author_affiliation": "Xiaohongshu",
      "published": "2026-09-10",
      "code": null,
      "adapter": {
        "adapter_key": "sirf",
        "arxiv_id": "2609.11752",
        "title": "SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control",
        "paper_url": "https://arxiv.org/abs/2609.11752",
        "track": "recommendation",
        "organization": "Xiaohongshu",
        "published": "2026-09-10",
        "code_url": null,
        "topics": [
          "content-understanding",
          "risk-control",
          "foundation-model",
          "industrial-deployment"
        ],
        "local_code_dir": "src/auto_research/reproductions/sirf",
        "fidelity": "concept_demo",
        "evaluation_tier": "l1_mechanism",
        "datasets": [
          "deterministic synthetic policy cases"
        ],
        "baseline": "same-source SFT linear features",
        "metrics": [
          "precision",
          "black_recall",
          "accuracy"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "4,000 train / 2,000 held-out policy cases",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Xiaohongshu freezing-risk adjudication",
            "metric": "relative mis-penalization reduction",
            "lift_percent": 70.0,
            "traffic": "random treatment/control split over the same released-user population; cumulative million-user scale",
            "source_url": "https://arxiv.org/html/2609.11752",
            "source_location": "Section 5.2",
            "significance": "weekly active penetration significantly better; paper reports high-single-digit to low-double-digit relative lift without an exact scalar",
            "retrieved_at": "2026-09-14"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "slimper",
      "title": "SlimPer: Make Personalization Model Slim and Smart",
      "paper_url": "https://arxiv.org/abs/2607.12281",
      "detail_path": "reproductions/2607.12281-slimper/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "serving-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta Platforms, Inc.",
      "published": "2026-07-14",
      "code": null,
      "adapter": {
        "adapter_key": "slimper",
        "arxiv_id": "2607.12281",
        "title": "SlimPer: Make Personalization Model Slim and Smart",
        "paper_url": "https://arxiv.org/abs/2607.12281",
        "track": "recommendation",
        "organization": "Meta Platforms, Inc.",
        "published": "2026-07-14",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "serving-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/slimper",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "参数匹配的 6-layer full-sequence Transformer（138,337 参数）",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "baseline.parameters",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "method.parameters",
          "relative.attention_score_reduction_percent",
          "relative.hit_at_10_percent",
          "relative.intermediate_reduction_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "User explicitly accepts the paper's statistically significant full-traffic Instagram launch as online evidence although exact lift percentages are undisclosed.",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "smes",
      "title": "SMES: Towards Scalable Multi-Task Recommendation via Expert Sparsity",
      "paper_url": "https://arxiv.org/abs/2602.09386",
      "detail_path": "reproductions/2602.09386-smes/README.md",
      "topic": [
        "multi-task-learning",
        "sparse-moe",
        "expert-routing"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-02-10",
      "code": null,
      "adapter": {
        "adapter_key": "smes",
        "arxiv_id": "2602.09386",
        "title": "SMES: Towards Scalable Multi-Task Recommendation via Expert Sparsity",
        "paper_url": "https://arxiv.org/abs/2602.09386",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-02-10",
        "code_url": null,
        "topics": [
          "multi-task-learning",
          "sparse-moe",
          "expert-routing"
        ],
        "local_code_dir": "src/auto_research/reproductions/smes",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou short-video recommendation",
            "metric": "User watch time",
            "lift_percent": 0.31,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2602.09386v1",
            "source_location": "Section 4.7",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:expert-balance"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "snaplgr",
      "title": "LLM-Based Generative Retrieval for Snapchat Content Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.28895",
      "detail_path": "reproductions/2607.28895-snaplgr/README.md",
      "topic": [
        "retrieval",
        "generative-recommendation",
        "semantic-id",
        "llm",
        "multimodal"
      ],
      "first_author": null,
      "first_author_affiliation": "Snap Inc.",
      "published": "2026-07-30",
      "code": null,
      "adapter": {
        "adapter_key": "snaplgr",
        "arxiv_id": "2607.28895",
        "title": "LLM-Based Generative Retrieval for Snapchat Content Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.28895",
        "track": "recommendation",
        "organization": "Snap Inc.",
        "published": "2026-07-30",
        "code_url": null,
        "topics": [
          "retrieval",
          "generative-recommendation",
          "semantic-id",
          "llm",
          "multimodal"
        ],
        "local_code_dir": "src/auto_research/reproductions/snaplgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K content/co-engagement proxy"
        ],
        "baseline": "vanilla residual-quantized semantic IDs",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "sid_utilization",
          "sid_collision_rate"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; 3-level width-8 SID",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Snapchat content recommendation",
            "metric": "View Time",
            "lift_percent": 0.37,
            "traffic": "7-day production A/B test",
            "source_url": "https://arxiv.org/html/2607.28895v1",
            "source_location": "Section 4.5, Table 8",
            "significance": "p = 0.007",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:snaplgr-sid"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "solaris",
      "title": "SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling",
      "paper_url": "https://arxiv.org/abs/2604.12110",
      "detail_path": "reproductions/2604.12110-solaris/README.md",
      "topic": [
        "foundation-model",
        "serving",
        "latent-cache"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-04-13",
      "code": null,
      "adapter": {
        "adapter_key": "solaris",
        "arxiv_id": "2604.12110",
        "title": "SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling",
        "paper_url": "https://arxiv.org/abs/2604.12110",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-04-13",
        "code_url": null,
        "topics": [
          "foundation-model",
          "serving",
          "latent-cache"
        ],
        "local_code_dir": "src/auto_research/reproductions/solaris",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (260 users / 420 items)"
        ],
        "baseline": "request-time ranker，实验组为 predictive latent cache",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation",
            "metric": "Top-line revenue",
            "lift_percent": 0.67,
            "traffic": "fully deployed",
            "source_url": "https://arxiv.org/abs/2604.12110",
            "source_location": "original paper online-result disclosure: product=Meta recommendation; metric=Top-line revenue"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sona",
      "title": "Sona Technical Report",
      "paper_url": "https://arxiv.org/abs/2608.11015",
      "detail_path": "reproductions/2608.11015-sona/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "ranking",
        "history-compression"
      ],
      "first_author": null,
      "first_author_affiliation": "Yandex",
      "published": "2026-08-11",
      "code": null,
      "adapter": {
        "adapter_key": "sona",
        "arxiv_id": "2608.11015",
        "title": "Sona Technical Report",
        "paper_url": "https://arxiv.org/abs/2608.11015",
        "track": "recommendation",
        "organization": "Yandex",
        "published": "2026-08-11",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "ranking",
          "history-compression"
        ],
        "local_code_dir": "src/auto_research/reproductions/sona",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同预算共享 encoder 排序器，实验组为 history compression + SID decoder + item ranker",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "sona.hit_at_10",
          "sona.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Yandex Music My Vibe smart speakers",
            "metric": "active users",
            "lift_percent": 4.53,
            "traffic": "live-traffic online A/B; cascade replaced by one model",
            "source_url": "https://arxiv.org/pdf/2608.11015",
            "source_location": "Online evaluation section",
            "significance": "reported statistically significant",
            "retrieved_at": "2026-08-13"
          },
          {
            "product": "Yandex Music My Vibe smart speakers",
            "metric": "total listening time",
            "lift_percent": 6.3,
            "traffic": "live-traffic online A/B; cascade replaced by one model",
            "source_url": "https://arxiv.org/pdf/2608.11015",
            "source_location": "Online evaluation section",
            "significance": "reported statistically significant",
            "retrieved_at": "2026-08-13"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sort-gen",
      "title": "A Generative Re-ranking Model for List-level Multi-objective Optimization at Taobao",
      "paper_url": "https://arxiv.org/abs/2505.07197",
      "detail_path": "reproductions/2505.07197-sort-gen/README.md",
      "topic": [
        "reranking",
        "multi-objective",
        "ordered-regression",
        "diversity"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba / Taobao & Tmall",
      "published": "2025-05-12",
      "code": null,
      "adapter": {
        "adapter_key": "sort-gen",
        "arxiv_id": "2505.07197",
        "title": "A Generative Re-ranking Model for List-level Multi-objective Optimization at Taobao",
        "paper_url": "https://arxiv.org/abs/2505.07197",
        "track": "recommendation",
        "organization": "Alibaba / Taobao & Tmall",
        "published": "2025-05-12",
        "code_url": null,
        "topics": [
          "reranking",
          "multi-objective",
          "ordered-regression",
          "diversity"
        ],
        "local_code_dir": "src/auto_research/reproductions/sort_gen",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 1M exposure-slate proxy"
        ],
        "baseline": "item-level greedy formula",
        "metrics": [
          "baseline.click_per_slate",
          "baseline.gmv_proxy_per_slate",
          "baseline.ilad",
          "baseline.model_calls_per_slate",
          "baseline.pay_per_slate",
          "method.click_per_slate",
          "method.gmv_proxy_per_slate",
          "method.ilad",
          "method.model_calls_per_slate",
          "method.pay_per_slate",
          "paper_results.latency_ms",
          "paper_results.vs_deployed_FFT_fastDPP_GMV_percent",
          "paper_results.vs_formula_GMV_percent",
          "relative.click_per_slate_percent",
          "relative.gmv_proxy_per_slate_percent",
          "relative.ilad_percent",
          "relative.pay_per_slate_percent",
          "training.final_loss",
          "training.initial_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=180",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Baiyibutie",
            "metric": "CLICK",
            "lift_percent": 4.13,
            "traffic": "two-week A/B vs deployed FFT context model + fastDPP",
            "source_url": "https://arxiv.org/abs/2505.07197",
            "source_location": "original paper online-result disclosure: product=Taobao Baiyibutie; metric=CLICK"
          },
          {
            "product": "Taobao Baiyibutie",
            "metric": "GMV",
            "lift_percent": 8.1,
            "traffic": "two-week A/B vs deployed FFT context model + fastDPP",
            "source_url": "https://arxiv.org/abs/2505.07197",
            "source_location": "original paper online-result disclosure: product=Taobao Baiyibutie; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sort-ranking",
      "title": "SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders",
      "paper_url": "https://arxiv.org/abs/2603.03988",
      "detail_path": "reproductions/2603.03988-sort-ranking/README.md",
      "topic": [
        "ranking",
        "transformer",
        "serving-efficiency"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce",
      "published": "2026-03-04",
      "code": null,
      "adapter": {
        "adapter_key": "sort-ranking",
        "arxiv_id": "2603.03988",
        "title": "SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders",
        "paper_url": "https://arxiv.org/abs/2603.03988",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce",
        "published": "2026-03-04",
        "code_url": null,
        "topics": [
          "ranking",
          "transformer",
          "serving-efficiency"
        ],
        "local_code_dir": "src/auto_research/reproductions/sort_ranking",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "AliExpress recommendation",
            "metric": "orders",
            "lift_percent": 6.35,
            "traffic": "three production scenarios",
            "source_url": "https://arxiv.org/html/2603.03988v1",
            "source_location": "Section 4.7 / Table 5",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "sparsectr",
      "title": "Unleashing the Potential of Sparse Attention on Long-term Behaviors for CTR Prediction",
      "paper_url": "https://arxiv.org/abs/2601.17836",
      "detail_path": "reproductions/2601.17836-sparsectr/README.md",
      "topic": [
        "ctr-prediction",
        "long-sequence",
        "sparse-attention"
      ],
      "first_author": null,
      "first_author_affiliation": "Institute of Software, Chinese Academy of Sciences",
      "published": "2026-01-25",
      "code": null,
      "adapter": {
        "adapter_key": "sparsectr",
        "arxiv_id": "2601.17836",
        "title": "Unleashing the Potential of Sparse Attention on Long-term Behaviors for CTR Prediction",
        "paper_url": "https://arxiv.org/abs/2601.17836",
        "track": "recommendation",
        "organization": "Institute of Software, Chinese Academy of Sciences",
        "published": "2026-01-25",
        "code_url": null,
        "topics": [
          "ctr-prediction",
          "long-sequence",
          "sparse-attention"
        ],
        "local_code_dir": "src/auto_research/reproductions/sparsectr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meituan list advertising",
            "metric": "CTR",
            "lift_percent": 1.72,
            "traffic": "1% traffic production online A/B for 7 days",
            "source_url": "https://arxiv.org/html/2601.17836v1",
            "source_location": "Section 4.7",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:evolutionary-sparse-attention"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "spear",
      "title": "SPEAR: Selection-aware Personalized End-to-end Adaptive Rewriting and Retrieval for Community Search",
      "paper_url": "https://arxiv.org/abs/2608.01738",
      "detail_path": "reproductions/2608.01738-spear/README.md",
      "topic": [
        "search",
        "query-rewriting",
        "retrieval",
        "personalization"
      ],
      "first_author": null,
      "first_author_affiliation": "Dewu",
      "published": "2026-08-03",
      "code": "https://github.com/mallocagi1-cell/spear",
      "adapter": {
        "adapter_key": "spear",
        "arxiv_id": "2608.01738",
        "title": "SPEAR: Selection-aware Personalized End-to-end Adaptive Rewriting and Retrieval for Community Search",
        "paper_url": "https://arxiv.org/abs/2608.01738",
        "track": "recommendation",
        "organization": "Dewu",
        "published": "2026-08-03",
        "code_url": "https://github.com/mallocagi1-cell/spear",
        "topics": [
          "search",
          "query-rewriting",
          "retrieval",
          "personalization"
        ],
        "local_code_dir": "src/auto_research/reproductions/spear",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 SPEAR 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.click_recall_at_10_percent",
          "paper_results.query_view_ctr_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Dewu community search",
            "metric": "Query-view CTR",
            "lift_percent": 0.259,
            "traffic": "online A/B; fully deployed",
            "source_url": "https://arxiv.org/abs/2608.01738",
            "source_location": "original paper online-result disclosure: product=Dewu community search; metric=Query-view CTR"
          },
          {
            "product": "Dewu community search",
            "metric": "Average reading depth",
            "lift_percent": 0.733,
            "traffic": "online A/B; fully deployed",
            "source_url": "https://arxiv.org/abs/2608.01738",
            "source_location": "original paper online-result disclosure: product=Dewu community search; metric=Average reading depth"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "specformer",
      "title": "SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.24025",
      "detail_path": "reproductions/2607.24025-specformer/README.md",
      "topic": [
        "ranking",
        "transformer",
        "spectral-softening"
      ],
      "first_author": null,
      "first_author_affiliation": "Zhejiang University",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "specformer",
        "arxiv_id": "2607.24025",
        "title": "SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.24025",
        "track": "recommendation",
        "organization": "Zhejiang University",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "ranking",
          "transformer",
          "spectral-softening"
        ],
        "local_code_dir": "src/auto_research/reproductions/specformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "standard Transformer/DLRM-style interaction",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "spectral_condition_before",
          "softened_rank"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba e-commerce advertising",
            "metric": "CTR",
            "lift_percent": 1.34,
            "traffic": "10-day test; 10% production traffic",
            "source_url": "https://arxiv.org/html/2607.24025v1",
            "source_location": "Section V-F, Table V",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:spectral-soften"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "ssrlive",
      "title": "SSRLive: Live Streaming Recommendation with Dynamic Semantic ID",
      "paper_url": "https://arxiv.org/abs/2606.06970",
      "detail_path": "reproductions/2606.06970-ssrlive/README.md",
      "topic": [
        "live-streaming",
        "semantic-id",
        "multitask-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group, Alibaba",
      "published": "2026-06-05",
      "code": null,
      "adapter": {
        "adapter_key": "ssrlive",
        "arxiv_id": "2606.06970",
        "title": "SSRLive: Live Streaming Recommendation with Dynamic Semantic ID",
        "paper_url": "https://arxiv.org/abs/2606.06970",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group, Alibaba",
        "published": "2026-06-05",
        "code_url": null,
        "topics": [
          "live-streaming",
          "semantic-id",
          "multitask-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/ssrlive",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba live streaming",
            "metric": "Watch time",
            "lift_percent": 3.38,
            "traffic": "production A/B; statistically significant",
            "source_url": "https://arxiv.org/html/2606.06970v1",
            "source_location": "Section 6, Table 4",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:dynamic-sid"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "steps",
      "title": "A Self-Triggered Agentic Push Recommendation System",
      "paper_url": "https://arxiv.org/abs/2608.01949",
      "detail_path": "reproductions/2608.01949-steps/README.md",
      "topic": [
        "push-recommendation",
        "agentic-recommendation",
        "decision-transformer",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance / Douyin",
      "published": "2026-08-03",
      "code": null,
      "adapter": {
        "adapter_key": "steps",
        "arxiv_id": "2608.01949",
        "title": "A Self-Triggered Agentic Push Recommendation System",
        "paper_url": "https://arxiv.org/abs/2608.01949",
        "track": "recommendation",
        "organization": "ByteDance / Douyin",
        "published": "2026-08-03",
        "code_url": null,
        "topics": [
          "push-recommendation",
          "agentic-recommendation",
          "decision-transformer",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/steps",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "共享 transition + content scorer，实验组只加入 STEPS 核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.execution_agent_trajectory_reward",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Douyin Push",
            "metric": "Active days",
            "lift_percent": 0.2843,
            "traffic": "fully deployed; online A/B",
            "source_url": "https://arxiv.org/abs/2608.01949",
            "source_location": "original paper online-result disclosure: product=Douyin Push; metric=Active days"
          },
          {
            "product": "Douyin Push",
            "metric": "Push permission disablement",
            "lift_percent": -1.9089,
            "traffic": "fully deployed; online A/B",
            "source_url": "https://arxiv.org/abs/2608.01949",
            "source_location": "original paper online-result disclosure: product=Douyin Push; metric=Push permission disablement"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "swag-bid",
      "title": "Beyond Single-Episode Optimization: Sliding-Window Aware Generative Auto-Bidding for Long-Term Advertising Effectiveness",
      "paper_url": "https://arxiv.org/abs/2607.25233",
      "detail_path": "reproductions/2607.25233-swag-bid/README.md",
      "topic": [
        "advertising",
        "generative-model",
        "decision-transformer",
        "long-horizon"
      ],
      "first_author": null,
      "first_author_affiliation": "Alibaba International Digital Commerce / Dalian University of Technology",
      "published": "2026-07-28",
      "code": null,
      "adapter": {
        "adapter_key": "swag-bid",
        "arxiv_id": "2607.25233",
        "title": "Beyond Single-Episode Optimization: Sliding-Window Aware Generative Auto-Bidding for Long-Term Advertising Effectiveness",
        "paper_url": "https://arxiv.org/abs/2607.25233",
        "track": "recommendation",
        "organization": "Alibaba International Digital Commerce / Dalian University of Technology",
        "published": "2026-07-28",
        "code_url": null,
        "topics": [
          "advertising",
          "generative-model",
          "decision-transformer",
          "long-horizon"
        ],
        "local_code_dir": "src/auto_research/reproductions/swag_bid",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "single-episode Decision Transformer proxy，实验组为 sliding-window planner",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.cost_percent",
          "paper_results.gmv_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation_only_model_selection.fresh_hit_at_10",
          "stages.validation_only_model_selection.hit_at_10",
          "stages.validation_only_model_selection.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=True",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "AliExpress advertising",
            "metric": "GMV",
            "lift_percent": 3.42,
            "traffic": "21-day campaign-randomized online A/B",
            "source_url": "https://arxiv.org/abs/2607.25233",
            "source_location": "original paper online-result disclosure: product=AliExpress advertising; metric=GMV"
          },
          {
            "product": "AliExpress advertising",
            "metric": "ROAS",
            "lift_percent": 5.65,
            "traffic": "21-day campaign-randomized online A/B",
            "source_url": "https://arxiv.org/abs/2607.25233",
            "source_location": "original paper online-result disclosure: product=AliExpress advertising; metric=ROAS"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "tagllm",
      "title": "TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation",
      "paper_url": "https://arxiv.org/abs/2603.21481",
      "detail_path": "reproductions/2603.21481-tagllm/README.md",
      "topic": [
        "content-understanding",
        "tag-generation",
        "knowledge-distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "Tongji University",
      "published": "2026-03-23",
      "code": null,
      "adapter": {
        "adapter_key": "tagllm",
        "arxiv_id": "2603.21481",
        "title": "TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation",
        "paper_url": "https://arxiv.org/abs/2603.21481",
        "track": "recommendation",
        "organization": "Tongji University",
        "published": "2026-03-23",
        "code_url": null,
        "topics": [
          "content-understanding",
          "tag-generation",
          "knowledge-distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/tagllm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Note recommendation",
            "metric": "Cold-start page-view CTR",
            "lift_percent": 32.37,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2603.21481v1",
            "source_location": "Abstract",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:fine-grained-tags"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "tagr",
      "title": "TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising",
      "paper_url": "https://arxiv.org/abs/2608.24034",
      "detail_path": "reproductions/2608.24034-tagr/README.md",
      "topic": [
        "generative-recommendation",
        "live-streaming-advertising",
        "semantic-id",
        "online-rl"
      ],
      "first_author": "Wencai Ye",
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-08-25",
      "code": null,
      "adapter": {
        "adapter_key": "tagr",
        "arxiv_id": "2608.24034",
        "title": "TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising",
        "paper_url": "https://arxiv.org/abs/2608.24034",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-08-25",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "live-streaming-advertising",
          "semantic-id",
          "online-rl"
        ],
        "local_code_dir": "src/auto_research/reproductions/tagr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "production-style first-order transition recommender",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou live-stream advertising",
            "metric": "live-room entry rate",
            "lift_percent": 8.5,
            "traffic": "production A/B under the same downstream stack",
            "source_url": "https://arxiv.org/html/2608.24034v1#S4.SS3",
            "source_location": "Section 4.3 / Table 1",
            "retrieved_at": "2026-08-26"
          },
          {
            "product": "Kuaishou live-stream advertising",
            "metric": "shopping-cart click rate",
            "lift_percent": 7.4,
            "traffic": "production A/B under the same downstream stack",
            "source_url": "https://arxiv.org/html/2608.24034v1#S4.SS3",
            "source_location": "Section 4.3 / Table 1",
            "retrieved_at": "2026-08-26"
          },
          {
            "product": "Kuaishou live-stream advertising",
            "metric": "revenue",
            "lift_percent": 16.1,
            "traffic": "multi-week production experiment",
            "source_url": "https://arxiv.org/html/2608.24034v1#S4.SS3",
            "source_location": "Section 4.3 / Table 1",
            "retrieved_at": "2026-08-26"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "taiji",
      "title": "Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.03866",
      "detail_path": "reproductions/2606.03866-taiji/README.md",
      "topic": [
        "advertising",
        "reinforcement-alignment",
        "pareto-optimization"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-06-02",
      "code": null,
      "adapter": {
        "adapter_key": "taiji",
        "arxiv_id": "2606.03866",
        "title": "Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.03866",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-06-02",
        "code_url": null,
        "topics": [
          "advertising",
          "reinforcement-alignment",
          "pareto-optimization"
        ],
        "local_code_dir": "src/auto_research/reproductions/taiji",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou advertising",
            "metric": "Revenue",
            "lift_percent": 3.3,
            "traffic": "7 days; 10% control and 10% treatment",
            "source_url": "https://arxiv.org/html/2606.03866v1",
            "source_location": "Section 3.4, Table 2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:pareto-semantic-id"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "tgr",
      "title": "TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning",
      "paper_url": "https://arxiv.org/abs/2609.00986",
      "detail_path": "reproductions/2609.00986-tgr/README.md",
      "topic": [
        "generative-recommendation",
        "ranking-network",
        "reason-token"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent",
      "published": "2026-09-01",
      "code": null,
      "adapter": {
        "adapter_key": "tgr",
        "arxiv_id": "2609.00986",
        "title": "TGR: Advancing Industrial Recommendation from Generative-Paradigm Ranking toward Unified Generation and Reasoning",
        "paper_url": "https://arxiv.org/abs/2609.00986",
        "track": "recommendation",
        "organization": "Tencent",
        "published": "2026-09-01",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "ranking-network",
          "reason-token"
        ],
        "local_code_dir": "src/auto_research/reproductions/tgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tencent production surfaces",
            "metric": "advertising revenue",
            "lift_percent": 1.71,
            "traffic": "five A/B-tested scenarios; full launches",
            "source_url": "https://arxiv.org/html/2609.00986v1",
            "source_location": "Abstract and online results",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:tgr-generation-reasoning"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "tiger",
      "title": "Recommender Systems with Generative Retrieval",
      "paper_url": "https://arxiv.org/abs/2305.05065",
      "detail_path": "reproductions/2305.05065-tiger/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "tiger",
        "arxiv_id": "2305.05065",
        "title": "Recommender Systems with Generative Retrieval",
        "paper_url": "https://arxiv.org/abs/2305.05065",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/tiger",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K genre content"
        ],
        "baseline": "词表容量和参数量匹配的随机分层 ID 生成器",
        "metrics": [
          "ndcg_gain_percent",
          "random_id.hit_at_10",
          "random_id.hit_at_10_std",
          "random_id.ndcg_at_10",
          "random_id.ndcg_at_10_std",
          "rqvae.final_loss",
          "rqvae.initial_loss",
          "tiger.hit_at_10",
          "tiger.hit_at_10_std",
          "tiger.ndcg_at_10",
          "tiger.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=240",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "tm20k",
      "title": "Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.07055",
      "detail_path": "reproductions/2608.07055-tm20k/README.md",
      "topic": [
        "advertising",
        "long-sequence",
        "token-merging",
        "distillation"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-08-07",
      "code": null,
      "adapter": {
        "adapter_key": "tm20k",
        "arxiv_id": "2608.07055",
        "title": "Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.07055",
        "track": "recommendation",
        "organization": "ByteDance",
        "published": "2026-08-07",
        "code_url": null,
        "topics": [
          "advertising",
          "long-sequence",
          "token-merging",
          "distillation"
        ],
        "local_code_dir": "src/auto_research/reproductions/tm20k",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (full public histories)"
        ],
        "baseline": "same merged-token student without teacher distillation",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "compression_ratio",
          "distilled_teacher_mse"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; at most 8 merged tokens",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "ByteDance e-commerce advertising",
            "metric": "ADSS",
            "lift_percent": 1.036,
            "traffic": "5-day experiment serving hundreds of millions of users",
            "source_url": "https://arxiv.org/html/2608.07055v1",
            "source_location": "Section 5.4, Table 7",
            "significance": "reported p-value 0% after rounding",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:tm20k-merge"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "tmallgs",
      "title": "TMallGS: Scaling Unified Feature and Sequence Modeling for Generative E-commerce Search",
      "paper_url": "https://arxiv.org/abs/2607.13398",
      "detail_path": "reproductions/2607.13398-tmallgs/README.md",
      "topic": [
        "search-ranking",
        "transformer",
        "scaling",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group of Alibaba",
      "published": "2026-07-15",
      "code": null,
      "adapter": {
        "adapter_key": "tmallgs",
        "arxiv_id": "2607.13398",
        "title": "TMallGS: Scaling Unified Feature and Sequence Modeling for Generative E-commerce Search",
        "paper_url": "https://arxiv.org/abs/2607.13398",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group of Alibaba",
        "published": "2026-07-15",
        "code_url": null,
        "topics": [
          "search-ranking",
          "transformer",
          "scaling",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/tmallgs",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "DIN/RankMixer 风格 late-fusion Transformer，实验组为 TMallGS field-adaptive gated Transformer",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=60",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tmall Search",
            "metric": "UCTCVR",
            "lift_percent": 1.38,
            "traffic": "30 days; p<0.05",
            "source_url": "https://arxiv.org/abs/2607.13398",
            "source_location": "original paper online-result disclosure: product=Tmall Search; metric=UCTCVR"
          },
          {
            "product": "Tmall Search",
            "metric": "GMV",
            "lift_percent": 1.52,
            "traffic": "30 days; p<0.05",
            "source_url": "https://arxiv.org/abs/2607.13398",
            "source_location": "original paper online-result disclosure: product=Tmall Search; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "tokenminds",
      "title": "TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2606.25147",
      "detail_path": "reproductions/2606.25147-tokenminds/README.md",
      "topic": [
        "llm-recommendation",
        "user-modeling",
        "semantic-id",
        "cross-scenario",
        "ranking",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Google DeepMind / YouTube",
      "published": "2026-06-23",
      "code": null,
      "adapter": {
        "adapter_key": "tokenminds",
        "arxiv_id": "2606.25147",
        "title": "TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2606.25147",
        "track": "recommendation",
        "organization": "Google DeepMind / YouTube",
        "published": "2026-06-23",
        "code_url": null,
        "topics": [
          "llm-recommendation",
          "user-modeling",
          "semantic-id",
          "cross-scenario",
          "ranking",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/tokenminds",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同数据、同 seed、同 120 steps 的 dense-only GRU 用户编码器",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "training.baseline.final_ranking_loss",
          "training.baseline.initial_ranking_loss",
          "training.tokenminds.final_ranking_loss",
          "training.tokenminds.final_sid_loss",
          "training.tokenminds.initial_ranking_loss"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=120",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "YouTube SFV",
            "metric": "Engaged Users",
            "lift_percent": 0.11,
            "traffic": "seven-day production A/B; subsequently full user traffic",
            "source_url": "https://arxiv.org/pdf/2606.25147",
            "source_location": "Table 4 and Section 4.3",
            "experiment_duration": "7 days",
            "significance": "95% confidence",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "YouTube SFV",
            "metric": "Satisfied Engagement",
            "lift_percent": 0.62,
            "traffic": "seven-day production A/B; subsequently full user traffic",
            "source_url": "https://arxiv.org/pdf/2606.25147",
            "source_location": "Table 4 and Section 4.3",
            "experiment_duration": "7 days",
            "significance": "95% confidence",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "tokenmixer-large",
      "title": "TokenMixer-Large: Scaling Up Large Ranking Models in Industrial Recommenders",
      "paper_url": "https://arxiv.org/abs/2602.06563",
      "detail_path": "reproductions/2602.06563-tokenmixer-large/README.md",
      "topic": [
        "ranking",
        "token-mixing",
        "scaling"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance",
      "published": "2026-02-06",
      "code": null,
      "adapter": {
        "adapter_key": "tokenmixer-large",
        "arxiv_id": "2602.06563",
        "title": "TokenMixer-Large: Scaling Up Large Ranking Models in Industrial Recommenders",
        "paper_url": "https://arxiv.org/abs/2602.06563",
        "track": "recommendation",
        "organization": "ByteDance",
        "published": "2026-02-06",
        "code_url": null,
        "topics": [
          "ranking",
          "token-mixing",
          "scaling"
        ],
        "local_code_dir": "src/auto_research/reproductions/tokenmixer_large",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MovieLens 100K (932 users / 1682 items)"
        ],
        "baseline": "同协议 RankMixer dense，实验组为 TokenMixer-Large",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "baseline.parameters",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "method.parameters",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "ByteDance e-commerce",
            "metric": "Orders",
            "lift_percent": 1.66,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.06563",
            "source_location": "original paper online-result disclosure: product=ByteDance e-commerce; metric=Orders"
          },
          {
            "product": "ByteDance e-commerce",
            "metric": "Per-capita payment GMV",
            "lift_percent": 2.98,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.06563",
            "source_location": "original paper online-result disclosure: product=ByteDance e-commerce; metric=Per-capita payment GMV"
          },
          {
            "product": "ByteDance ads",
            "metric": "ADSS",
            "lift_percent": 2.0,
            "traffic": "online A/B",
            "source_url": "https://arxiv.org/abs/2602.06563",
            "source_location": "original paper online-result disclosure: product=ByteDance ads; metric=ADSS"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "toolrec",
      "title": "ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants",
      "paper_url": "https://arxiv.org/abs/2606.08466",
      "detail_path": "reproductions/2606.08466-toolrec/README.md",
      "topic": [
        "query-recommendation",
        "preference-alignment",
        "tool-use"
      ],
      "first_author": null,
      "first_author_affiliation": "Huazhong University of Science and Technology",
      "published": "2026-06-07",
      "code": null,
      "adapter": {
        "adapter_key": "toolrec",
        "arxiv_id": "2606.08466",
        "title": "ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants",
        "paper_url": "https://arxiv.org/abs/2606.08466",
        "track": "recommendation",
        "organization": "Huazhong University of Science and Technology",
        "published": "2026-06-07",
        "code_url": null,
        "topics": [
          "query-recommendation",
          "preference-alignment",
          "tool-use"
        ],
        "local_code_dir": "src/auto_research/reproductions/toolrec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "OPPO Xiaobu",
            "metric": "CTR",
            "lift_percent": 3.32,
            "traffic": "7 days; 5% traffic per model",
            "source_url": "https://arxiv.org/html/2606.08466v1",
            "source_location": "Section 5.2, Table 1",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:tool-calibration"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "transact-v2",
      "title": "TransAct V2: Lifelong User Action Sequence Modeling on Pinterest Recommendation",
      "paper_url": "https://arxiv.org/abs/2506.02267",
      "detail_path": "reproductions/2506.02267-transact-v2/README.md",
      "topic": [],
      "first_author": null,
      "first_author_affiliation": null,
      "published": null,
      "code": null,
      "adapter": {
        "adapter_key": "transact-v2",
        "arxiv_id": "2506.02267",
        "title": "TransAct V2: Lifelong User Action Sequence Modeling on Pinterest Recommendation",
        "paper_url": "https://arxiv.org/abs/2506.02267",
        "track": "recommendation",
        "organization": null,
        "published": null,
        "code_url": null,
        "topics": [],
        "local_code_dir": "src/auto_research/reproductions/transact_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "参数量匹配的 TransAct",
        "metrics": [
          "ndcg_gain_percent",
          "transact.hit_at_10",
          "transact.hit_at_10_std",
          "transact.ndcg_at_10",
          "transact.ndcg_at_10_std",
          "transact_v2.hit_at_10",
          "transact_v2.hit_at_10_std",
          "transact_v2.ndcg_at_10",
          "transact_v2.ndcg_at_10_std"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=160",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "transretrieval",
      "title": "TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation",
      "paper_url": "https://arxiv.org/abs/2608.25528",
      "detail_path": "reproductions/2608.25528-transretrieval/README.md",
      "topic": [
        "retrieval",
        "transformer-scaling",
        "target-token-compression",
        "multi-domain"
      ],
      "first_author": null,
      "first_author_affiliation": "Renmin University of China / Taobao & Tmall Group, Alibaba",
      "published": "2026-08-26",
      "code": null,
      "adapter": {
        "adapter_key": "transretrieval",
        "arxiv_id": "2608.25528",
        "title": "TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation",
        "paper_url": "https://arxiv.org/abs/2608.25528",
        "track": "recommendation",
        "organization": "Renmin University of China / Taobao & Tmall Group, Alibaba",
        "published": "2026-08-26",
        "code_url": null,
        "topics": [
          "retrieval",
          "transformer-scaling",
          "target-token-compression",
          "multi-domain"
        ],
        "local_code_dir": "src/auto_research/reproductions/transretrieval",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "same-feature Transformer-style two-tower mean aggregation",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "head share@10",
          "token norm dispersion"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Alibaba display advertising",
            "metric": "platform revenue",
            "lift_percent": 2.53,
            "traffic": "5% traffic; month-long A/B; p<0.0001",
            "source_url": "https://arxiv.org/html/2608.25528v1#S4.SS5",
            "source_location": "Section 4.5 / Table 7",
            "experiment_duration": "one month",
            "significance": "p<0.0001",
            "retrieved_at": "2026-08-28"
          },
          {
            "product": "Alibaba display advertising",
            "metric": "RPM",
            "lift_percent": 1.28,
            "traffic": "5% traffic; month-long A/B; p<0.0001",
            "source_url": "https://arxiv.org/html/2608.25528v1#S4.SS5",
            "source_location": "Section 4.5 / Table 7",
            "experiment_duration": "one month",
            "significance": "p<0.0001",
            "retrieved_at": "2026-08-28"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "transx",
      "title": "TransX: Scaling Transformer-based Recommendation via Behavioral and Serving Stream Crossings",
      "paper_url": "https://arxiv.org/abs/2607.28940",
      "detail_path": "reproductions/2607.28940-transx/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "cross-attention",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "LinkedIn",
      "published": "2026-07-31",
      "code": null,
      "adapter": {
        "adapter_key": "transx",
        "arxiv_id": "2607.28940",
        "title": "TransX: Scaling Transformer-based Recommendation via Behavioral and Serving Stream Crossings",
        "paper_url": "https://arxiv.org/abs/2607.28940",
        "track": "recommendation",
        "organization": "LinkedIn",
        "published": "2026-07-31",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "cross-attention",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/transx",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "monolithic recent-sequence scorer",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "attention_pair_reduction"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; global token plus 8 cached local tokens",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "LinkedIn recommender systems",
            "metric": "CTR",
            "lift_percent": 6.0,
            "traffic": "large-scale online A/B test",
            "source_url": "https://arxiv.org/html/2607.28940v1",
            "source_location": "Abstract and Section 6",
            "significance": "statistically significant for users with eligible history",
            "retrieved_at": "2026-09-01"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:transx-cross-stream"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "tsgr",
      "title": "TSGR: Taobao Search Generative Retrieval",
      "paper_url": "https://arxiv.org/abs/2607.18796",
      "detail_path": "reproductions/2607.18796-tsgr/README.md",
      "topic": [
        "generative-retrieval",
        "semantic-id",
        "search",
        "pre-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group of Alibaba / Zhejiang University",
      "published": "2026-07-21",
      "code": null,
      "adapter": {
        "adapter_key": "tsgr",
        "arxiv_id": "2607.18796",
        "title": "TSGR: Taobao Search Generative Retrieval",
        "paper_url": "https://arxiv.org/abs/2607.18796",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group of Alibaba / Zhejiang University",
        "published": "2026-07-21",
        "code_url": null,
        "topics": [
          "generative-retrieval",
          "semantic-id",
          "search",
          "pre-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/tsgr",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "语义召回加传统预排代理，实验组为 QP-SID 加联合 VRM",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Search",
            "metric": "IPV",
            "lift_percent": 0.43,
            "traffic": "1% traffic; 38 days; statistically significant",
            "source_url": "https://arxiv.org/abs/2607.18796",
            "source_location": "original paper online-result disclosure: product=Taobao Search; metric=IPV"
          },
          {
            "product": "Taobao Search",
            "metric": "Transaction Count",
            "lift_percent": 1.12,
            "traffic": "1% traffic; 38 days; statistically significant",
            "source_url": "https://arxiv.org/abs/2607.18796",
            "source_location": "original paper online-result disclosure: product=Taobao Search; metric=Transaction Count"
          },
          {
            "product": "Taobao Search",
            "metric": "GMV",
            "lift_percent": 1.64,
            "traffic": "1% traffic; 38 days; statistically significant",
            "source_url": "https://arxiv.org/abs/2607.18796",
            "source_location": "original paper online-result disclosure: product=Taobao Search; metric=GMV"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "tubifm",
      "title": "TubiFM: Unified Item, Carousel, and Search Ranking for Streaming Discovery",
      "paper_url": "https://arxiv.org/abs/2605.23702",
      "detail_path": "reproductions/2605.23702-tubifm/README.md",
      "topic": [
        "foundation-model",
        "multi-task-learning",
        "search-ranking"
      ],
      "first_author": null,
      "first_author_affiliation": "Tubi",
      "published": "2026-05-22",
      "code": null,
      "adapter": {
        "adapter_key": "tubifm",
        "arxiv_id": "2605.23702",
        "title": "TubiFM: Unified Item, Carousel, and Search Ranking for Streaming Discovery",
        "paper_url": "https://arxiv.org/abs/2605.23702",
        "track": "recommendation",
        "organization": "Tubi",
        "published": "2026-05-22",
        "code_url": null,
        "topics": [
          "foundation-model",
          "multi-task-learning",
          "search-ranking"
        ],
        "local_code_dir": "src/auto_research/reproductions/tubifm",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Tubi Search",
            "metric": "total viewing time",
            "lift_percent": 3.9,
            "traffic": "production A/B; p<0.05",
            "source_url": "https://arxiv.org/html/2605.23702v1",
            "source_location": "paper online evaluation section",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "twice",
      "title": "TWICE: Two-Clock, Two-Window Learning for Long-Horizon Conversion Prediction in Online Advertising",
      "paper_url": "https://arxiv.org/abs/2607.25404",
      "detail_path": "reproductions/2607.25404-twice/README.md",
      "topic": [
        "advertising",
        "cvr",
        "delayed-feedback",
        "full-traffic"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-07-28",
      "code": null,
      "adapter": {
        "adapter_key": "twice",
        "arxiv_id": "2607.25404",
        "title": "TWICE: Two-Clock, Two-Window Learning for Long-Horizon Conversion Prediction in Online Advertising",
        "paper_url": "https://arxiv.org/abs/2607.25404",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-07-28",
        "code_url": null,
        "topics": [
          "advertising",
          "cvr",
          "delayed-feedback",
          "full-traffic"
        ],
        "local_code_dir": "src/auto_research/reproductions/twice",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "mature-label next-item CVR，实验组为双时钟 current-status",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "paper_results.expected_revenue_percent",
          "paper_results.revenue_percent",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation_only_model_selection.fresh_hit_at_10",
          "stages.validation_only_model_selection.hit_at_10",
          "stages.validation_only_model_selection.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kwai advertising",
            "metric": "expected revenue",
            "lift_percent": 2.486,
            "traffic": "online A/B; later full traffic",
            "source_url": "https://arxiv.org/abs/2607.25404",
            "source_location": "original paper online-result disclosure: product=Kwai advertising; metric=expected revenue"
          },
          {
            "product": "Kwai advertising",
            "metric": "conversions",
            "lift_percent": 2.061,
            "traffic": "online A/B; later full traffic",
            "source_url": "https://arxiv.org/abs/2607.25404",
            "source_location": "original paper online-result disclosure: product=Kwai advertising; metric=conversions"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "twin-v2",
      "title": "TWIN V2: Scaling Ultra-Long User Behavior Sequence Modeling for Enhanced CTR Prediction at Kuaishou",
      "paper_url": "https://arxiv.org/abs/2407.16357",
      "detail_path": "reproductions/2407.16357-twin-v2/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "training-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2024-07-23",
      "code": null,
      "adapter": {
        "adapter_key": "twin-v2",
        "arxiv_id": "2407.16357",
        "title": "TWIN V2: Scaling Ultra-Long User Behavior Sequence Modeling for Enhanced CTR Prediction at Kuaishou",
        "paper_url": "https://arxiv.org/abs/2407.16357",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2024-07-23",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "training-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/twin_v2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "shared transition + content baseline，实验组为 TWIN-V2，只改变论文核心机制",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.validation.fresh_hit_at_10",
          "stages.validation.hit_at_10",
          "stages.validation.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Featured-Video",
            "metric": "watch time",
            "lift_percent": 0.672,
            "traffic": "main traffic",
            "source_url": "https://arxiv.org/abs/2407.16357",
            "source_location": "original paper online-result disclosure: product=Kuaishou Featured-Video; metric=watch time"
          },
          {
            "product": "Kuaishou Discovery",
            "metric": "watch time",
            "lift_percent": 0.8,
            "traffic": "main traffic",
            "source_url": "https://arxiv.org/abs/2407.16357",
            "source_location": "original paper online-result disclosure: product=Kuaishou Discovery; metric=watch time"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "twitch-mor",
      "title": "Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting",
      "paper_url": "https://arxiv.org/abs/2608.04455",
      "detail_path": "reproductions/2608.04455-twitch-mor/README.md",
      "topic": [
        "ranking",
        "multi-task-learning",
        "mmoe",
        "live-streaming"
      ],
      "first_author": null,
      "first_author_affiliation": "Twitch",
      "published": "2026-08-05",
      "code": null,
      "adapter": {
        "adapter_key": "twitch-mor",
        "arxiv_id": "2608.04455",
        "title": "Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting",
        "paper_url": "https://arxiv.org/abs/2608.04455",
        "track": "recommendation",
        "organization": "Twitch",
        "published": "2026-08-05",
        "code_url": null,
        "topics": [
          "ranking",
          "multi-task-learning",
          "mmoe",
          "live-streaming"
        ],
        "local_code_dir": "src/auto_research/reproductions/twitch_mor",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "去掉论文特有机制、其余数据切分与预算相同的 matched control",
        "metrics": [
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "relative.objective_mse_percent",
          "variants.fresh-delayed lifecycle mmoe.hit_at_10",
          "variants.fresh-delayed lifecycle mmoe.ndcg_at_10",
          "variants.single-objective dnn.hit_at_10",
          "variants.single-objective dnn.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Twitch live recommendation",
            "metric": "daily active viewers",
            "lift_percent": 0.09,
            "traffic": "14-day A/B",
            "significance": "p<0.01",
            "source_url": "https://arxiv.org/abs/2608.04455",
            "source_location": "original paper online-result disclosure: product=Twitch live recommendation; metric=daily active viewers"
          },
          {
            "product": "Twitch engaged viewers",
            "metric": "capped ARPU",
            "lift_percent": 0.56,
            "traffic": "14-day A/B",
            "significance": "p<0.05",
            "source_url": "https://arxiv.org/abs/2608.04455",
            "source_location": "original paper online-result disclosure: product=Twitch engaged viewers; metric=capped ARPU"
          },
          {
            "product": "Twitch mobile livefeed",
            "metric": "positive interactions",
            "lift_percent": 1.12,
            "traffic": "14-day A/B",
            "significance": "p<0.001",
            "source_url": "https://arxiv.org/abs/2608.04455",
            "source_location": "original paper online-result disclosure: product=Twitch mobile livefeed; metric=positive interactions"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "uame",
      "title": "Uncertainty as Remedy: Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking",
      "paper_url": "https://arxiv.org/abs/2607.17092",
      "detail_path": "reproductions/2607.17092-uame/README.md",
      "topic": [
        "multi-objective-ranking",
        "uncertainty",
        "loss-design"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-07-19",
      "code": null,
      "adapter": {
        "adapter_key": "uame",
        "arxiv_id": "2607.17092",
        "title": "Uncertainty as Remedy: Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking",
        "paper_url": "https://arxiv.org/abs/2607.17092",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-07-19",
        "code_url": null,
        "topics": [
          "multi-objective-ranking",
          "uncertainty",
          "loss-design"
        ],
        "local_code_dir": "src/auto_research/reproductions/uame",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "同 backbone 的 deterministic multi-objective pairwise ranker",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "ndcg_at_10_relative_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou short-video feed vs EMER",
            "metric": "LongView",
            "lift_percent": 1.614,
            "traffic": "7 days; 5% traffic; p<0.005",
            "source_url": "https://arxiv.org/abs/2607.17092",
            "source_location": "original paper online-result disclosure: product=Kuaishou short-video feed vs EMER; metric=LongView"
          },
          {
            "product": "Kuaishou short-video feed vs EASQ",
            "metric": "Forward",
            "lift_percent": 1.598,
            "traffic": "7 days; 5% traffic; p<0.005",
            "source_url": "https://arxiv.org/abs/2607.17092",
            "source_location": "original paper online-result disclosure: product=Kuaishou short-video feed vs EASQ; metric=Forward"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "ug-sep",
      "title": "Compute Only Once: UG-Separation for Efficient Large Recommendation Models",
      "paper_url": "https://arxiv.org/abs/2602.10455",
      "detail_path": "reproductions/2602.10455-ug-sep/README.md",
      "topic": [
        "ranking-network",
        "inference-efficiency",
        "token-mixing"
      ],
      "first_author": null,
      "first_author_affiliation": "ByteDance AML",
      "published": "2026-02-11",
      "code": null,
      "adapter": {
        "adapter_key": "ug-sep",
        "arxiv_id": "2602.10455",
        "title": "Compute Only Once: UG-Separation for Efficient Large Recommendation Models",
        "paper_url": "https://arxiv.org/abs/2602.10455",
        "track": "recommendation",
        "organization": "ByteDance AML",
        "published": "2026-02-11",
        "code_url": null,
        "topics": [
          "ranking-network",
          "inference-efficiency",
          "token-mixing"
        ],
        "local_code_dir": "src/auto_research/reproductions/ug_sep",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "ByteDance recommendation",
            "metric": "Inference latency reduction",
            "lift_percent": 20.0,
            "traffic": "production online A/B and deployment",
            "source_url": "https://arxiv.org/html/2602.10455v1",
            "source_location": "Abstract and online experiments",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "head:ug-separation"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "ultra-hstu",
      "title": "Bending the Scaling Law Curve in Large-Scale Recommendation Systems",
      "paper_url": "https://arxiv.org/abs/2602.16986",
      "detail_path": "reproductions/2602.16986-ultra-hstu/README.md",
      "topic": [
        "ranking",
        "long-sequence",
        "scaling-law",
        "attention",
        "serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta",
      "published": "2026-02-19",
      "code": null,
      "adapter": {
        "adapter_key": "ultra-hstu",
        "arxiv_id": "2602.16986",
        "title": "Bending the Scaling Law Curve in Large-Scale Recommendation Systems",
        "paper_url": "https://arxiv.org/abs/2602.16986",
        "track": "recommendation",
        "organization": "Meta",
        "published": "2026-02-19",
        "code_url": null,
        "topics": [
          "ranking",
          "long-sequence",
          "scaling-law",
          "attention",
          "serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/ultra_hstu",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K (220 users / 360 items)"
        ],
        "baseline": "short-history transition-content ranker，实验组执行 ULTRA-HSTU compact core",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta recommendation",
            "metric": "consumption",
            "lift_percent": 4.11,
            "traffic": "multiple rigorous 30-day A/B tests; fully deployed",
            "source_url": "https://arxiv.org/html/2602.16986v2#S5.SS4",
            "source_location": "Section 5.4",
            "experiment_duration": "30 days",
            "retrieved_at": "2026-08-09"
          },
          {
            "product": "Meta recommendation",
            "metric": "engagement",
            "lift_percent": 8.0,
            "traffic": "reported range +2% to +8%; fully deployed",
            "source_url": "https://arxiv.org/html/2602.16986v2#S5.SS4",
            "source_location": "Section 5.4",
            "experiment_duration": "30 days",
            "retrieved_at": "2026-08-09"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "uniformer",
      "title": "UniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation",
      "paper_url": "https://arxiv.org/abs/2606.27058",
      "detail_path": "reproductions/2606.27058-uniformer/README.md",
      "topic": [
        "ranking",
        "feature-tokenization",
        "multi-task"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-06-25",
      "code": null,
      "adapter": {
        "adapter_key": "uniformer",
        "arxiv_id": "2606.27058",
        "title": "UniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation",
        "paper_url": "https://arxiv.org/abs/2606.27058",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-06-25",
        "code_url": null,
        "topics": [
          "ranking",
          "feature-tokenization",
          "multi-task"
        ],
        "local_code_dir": "src/auto_research/reproductions/uniformer",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "single-space feature interaction",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "feature_spaces",
          "task_tokens"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou Lite",
            "metric": "Watch Time",
            "lift_percent": 1.113,
            "traffic": "seven-day test; 5% production traffic",
            "source_url": "https://arxiv.org/html/2606.27058v1",
            "source_location": "Section 5.6, Table 2",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:unified-token"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "unimvt",
      "title": "Jointly Optimizing Debiased CTR and Uplift for Coupons Marketing: A Unified Causal Framework",
      "paper_url": "https://arxiv.org/abs/2602.12972",
      "detail_path": "reproductions/2602.12972-unimvt/README.md",
      "topic": [
        "causal-recommendation",
        "uplift-modeling",
        "coupon-marketing"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou Technology",
      "published": "2026-02-13",
      "code": null,
      "adapter": {
        "adapter_key": "unimvt",
        "arxiv_id": "2602.12972",
        "title": "Jointly Optimizing Debiased CTR and Uplift for Coupons Marketing: A Unified Causal Framework",
        "paper_url": "https://arxiv.org/abs/2602.12972",
        "track": "recommendation",
        "organization": "Kuaishou Technology",
        "published": "2026-02-13",
        "code_url": null,
        "topics": [
          "causal-recommendation",
          "uplift-modeling",
          "coupon-marketing"
        ],
        "local_code_dir": "src/auto_research/reproductions/unimvt",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou coupon marketing",
            "metric": "Coupon revenue",
            "lift_percent": 18.14,
            "traffic": "10% production traffic online A/B",
            "source_url": "https://arxiv.org/html/2602.12972v1",
            "source_location": "Section 5.4",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "reward:causal-uplift"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "unir2",
      "title": "Unifying Generative Recall and Multi-Objective Ranking in a Single Decoder-Only Sequence",
      "paper_url": "https://arxiv.org/abs/2607.24439",
      "detail_path": "reproductions/2607.24439-unir2/README.md",
      "topic": [
        "generative-recommendation",
        "unified-recall-ranking",
        "multi-objective-ranking",
        "lora"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou / IIE, CAS / UCAS",
      "published": "2026-07-27",
      "code": null,
      "adapter": {
        "adapter_key": "unir2",
        "arxiv_id": "2607.24439",
        "title": "Unifying Generative Recall and Multi-Objective Ranking in a Single Decoder-Only Sequence",
        "paper_url": "https://arxiv.org/abs/2607.24439",
        "track": "recommendation",
        "organization": "Kuaishou / IIE, CAS / UCAS",
        "published": "2026-07-27",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "unified-recall-ranking",
          "multi-objective-ranking",
          "lora"
        ],
        "local_code_dir": "src/auto_research/reproductions/unir2",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-1M"
        ],
        "baseline": "同一 MovieLens-1M 数据、SID、训练 step 和 full-catalog 候选上的独立生成 recall + ranking cascade",
        "metrics": [
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "relative.sid_code_accuracy_percent",
          "variants.UniR2.final_loss",
          "variants.UniR2.hit_at_10",
          "variants.UniR2.initial_loss",
          "variants.UniR2.ndcg_at_10",
          "variants.UniR2.sid_code_accuracy",
          "variants.separate cascade.final_loss",
          "variants.separate cascade.hit_at_10",
          "variants.separate cascade.initial_loss",
          "variants.separate cascade.ndcg_at_10",
          "variants.separate cascade.sid_code_accuracy"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=130",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou App",
            "metric": "play volume",
            "lift_percent": 1.177,
            "traffic": "5% traffic, two weeks",
            "source_url": "https://arxiv.org/abs/2607.24439",
            "source_location": "original paper online-result disclosure: product=Kuaishou App; metric=play volume"
          },
          {
            "product": "Kuaishou App",
            "metric": "like rate",
            "lift_percent": 2.56,
            "traffic": "5% traffic, two weeks",
            "source_url": "https://arxiv.org/abs/2607.24439",
            "source_location": "original paper online-result disclosure: product=Kuaishou App; metric=like rate"
          },
          {
            "product": "Kuaishou Lite",
            "metric": "total gifting amount",
            "lift_percent": 2.569,
            "traffic": "5% traffic, two weeks",
            "source_url": "https://arxiv.org/abs/2607.24439",
            "source_location": "original paper online-result disclosure: product=Kuaishou Lite; metric=total gifting amount"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "unirec",
      "title": "UniRec: Cross-stage Multi-Task Fusion with Preference Alignment for Cascaded Recommender Systems",
      "paper_url": "https://arxiv.org/abs/2609.11052",
      "detail_path": "reproductions/2609.11052-unirec/README.md",
      "topic": [
        "pre-ranking",
        "ranking",
        "cross-stage-alignment",
        "industrial-recommendation"
      ],
      "first_author": null,
      "first_author_affiliation": "Kuaishou",
      "published": "2026-09-10",
      "code": null,
      "adapter": {
        "adapter_key": "unirec",
        "arxiv_id": "2609.11052",
        "title": "UniRec: Cross-stage Multi-Task Fusion with Preference Alignment for Cascaded Recommender Systems",
        "paper_url": "https://arxiv.org/abs/2609.11052",
        "track": "recommendation",
        "organization": "Kuaishou",
        "published": "2026-09-10",
        "code_url": null,
        "topics": [
          "pre-ranking",
          "ranking",
          "cross-stage-alignment",
          "industrial-recommendation"
        ],
        "local_code_dir": "src/auto_research/reproductions/unirec",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Kuaishou live recommender",
            "metric": "app usage",
            "lift_percent": 0.616,
            "traffic": "20% live traffic followed by full deployment",
            "source_url": "https://arxiv.org/html/2609.11052",
            "source_location": "Section 5.4, Table 5",
            "retrieved_at": "2026-09-12"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "unirec-coa",
      "title": "UniRec: Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute",
      "paper_url": "https://arxiv.org/abs/2604.12234",
      "detail_path": "reproductions/2604.12234-unirec-coa/README.md",
      "topic": [
        "generative-recommendation",
        "semantic-id",
        "preference-alignment"
      ],
      "first_author": null,
      "first_author_affiliation": "Authors did not disclose affiliation / large-scale e-commerce platform",
      "published": "2026-04-14",
      "code": null,
      "adapter": {
        "adapter_key": "unirec-coa",
        "arxiv_id": "2604.12234",
        "title": "UniRec: Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute",
        "paper_url": "https://arxiv.org/abs/2604.12234",
        "track": "recommendation",
        "organization": "Authors did not disclose affiliation / large-scale e-commerce platform",
        "published": "2026-04-14",
        "code_url": null,
        "topics": [
          "generative-recommendation",
          "semantic-id",
          "preference-alignment"
        ],
        "local_code_dir": "src/auto_research/reproductions/unirec_coa",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "e-commerce feed and landing page",
            "metric": "GMV",
            "lift_percent": 5.6,
            "traffic": "20% user traffic per bucket",
            "source_url": "https://arxiv.org/html/2604.12234v1",
            "source_location": "Section 4.2 / Table 5",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "uniscale",
      "title": "UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking",
      "paper_url": "https://arxiv.org/abs/2603.24226",
      "detail_path": "reproductions/2603.24226-uniscale/README.md",
      "topic": [
        "search-ranking",
        "model-scaling",
        "entire-space-learning"
      ],
      "first_author": null,
      "first_author_affiliation": "Taobao & Tmall Group / Alibaba",
      "published": "2026-03-25",
      "code": null,
      "adapter": {
        "adapter_key": "uniscale",
        "arxiv_id": "2603.24226",
        "title": "UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking",
        "paper_url": "https://arxiv.org/abs/2603.24226",
        "track": "recommendation",
        "organization": "Taobao & Tmall Group / Alibaba",
        "published": "2026-03-25",
        "code_url": null,
        "topics": [
          "search-ranking",
          "model-scaling",
          "entire-space-learning"
        ],
        "local_code_dir": "src/auto_research/reproductions/uniscale",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K"
        ],
        "baseline": "shared transition + content scorer",
        "metrics": [
          "Hit@10",
          "NDCG@10",
          "Fresh Hit@10",
          "Head share@10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Taobao Search",
            "metric": "GMV",
            "lift_percent": 2.04,
            "traffic": "5% traffic, ten days",
            "source_url": "https://arxiv.org/html/2603.24226v1",
            "source_location": "Section 4.5",
            "retrieved_at": "2026-08-24"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "univa",
      "title": "Unified Value Alignment for Generative Recommendation in Industrial Advertising",
      "paper_url": "https://arxiv.org/abs/2605.05803",
      "detail_path": "reproductions/2605.05803-univa/README.md",
      "topic": [
        "generative-advertising",
        "commercial-sid",
        "ppo",
        "value-aware-serving"
      ],
      "first_author": null,
      "first_author_affiliation": "Tencent / WeChat Channels",
      "published": "2026-05",
      "code": null,
      "adapter": {
        "adapter_key": "univa",
        "arxiv_id": "2605.05803",
        "title": "Unified Value Alignment for Generative Recommendation in Industrial Advertising",
        "paper_url": "https://arxiv.org/abs/2605.05803",
        "track": "recommendation",
        "organization": "Tencent / WeChat Channels",
        "published": "2026-05",
        "code_url": null,
        "topics": [
          "generative-advertising",
          "commercial-sid",
          "ppo",
          "value-aware-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/univa",
        "fidelity": "full_pipeline",
        "evaluation_tier": "l3_paper_pipeline",
        "datasets": [
          "MiniOneRec Amazon Office_Products"
        ],
        "baseline": "同一 MiniOneRec Office 数据、相同 HSTU/decoder 容量、步数、随机种子和全商品目录下的 semanticsidsl（原始三级 Semantic SID + 监督学习）",
        "metrics": [
          "selected_relative_to_semantic_sid_percent.wndcg_at_100",
          "test.commercial_sid_sl.wndcg_at_100",
          "test.semantic_sid_sl.wndcg_at_100",
          "test.univa_full.wndcg_at_100"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "WeChat Channels Ads",
            "metric": "GMV",
            "lift_percent": 1.5,
            "traffic": "5% traffic, 2026-03-07 to 2026-03-11",
            "source_url": "https://arxiv.org/abs/2605.05803",
            "source_location": "original paper online-result disclosure: product=WeChat Channels Ads; metric=GMV"
          },
          {
            "product": "WeChat Channels Ads",
            "metric": "GMV(normal)",
            "lift_percent": 1.42,
            "traffic": "5% traffic, 2026-03-07 to 2026-03-11",
            "source_url": "https://arxiv.org/abs/2605.05803",
            "source_location": "original paper online-result disclosure: product=WeChat Channels Ads; metric=GMV(normal)"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "whale",
      "title": "WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture",
      "paper_url": "https://arxiv.org/abs/2607.17017",
      "detail_path": "reproductions/2607.17017-whale/README.md",
      "topic": [
        "ranking",
        "hstu",
        "feature-interaction",
        "scaling"
      ],
      "first_author": null,
      "first_author_affiliation": "Meta Platforms, Inc.",
      "published": "2026-07-19",
      "code": null,
      "adapter": {
        "adapter_key": "whale",
        "arxiv_id": "2607.17017",
        "title": "WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture",
        "paper_url": "https://arxiv.org/abs/2607.17017",
        "track": "recommendation",
        "organization": "Meta Platforms, Inc.",
        "published": "2026-07-19",
        "code_url": null,
        "topics": [
          "ranking",
          "hstu",
          "feature-interaction",
          "scaling"
        ],
        "local_code_dir": "src/auto_research/reproductions/whale",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "双分支 late fusion，实验组为 WHALE 渐进交换",
        "metrics": [
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42
        ],
        "budget": "steps=60",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Meta social recommendation surface",
            "metric": "Primary metric",
            "lift_percent": 0.113,
            "traffic": "14 days; production baseline",
            "source_url": "https://arxiv.org/abs/2607.17017",
            "source_location": "original paper online-result disclosure: product=Meta social recommendation surface; metric=Primary metric"
          },
          {
            "product": "Meta social recommendation surface",
            "metric": "Metric 1",
            "lift_percent": 0.824,
            "traffic": "14 days; production baseline",
            "source_url": "https://arxiv.org/abs/2607.17017",
            "source_location": "original paper online-result disclosure: product=Meta social recommendation surface; metric=Metric 1"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "wide-deep",
      "title": "Wide & Deep Learning for Recommender Systems",
      "paper_url": "https://arxiv.org/abs/1606.07792",
      "detail_path": "reproductions/1606.07792-wide-deep/README.md",
      "topic": [
        "ranking",
        "classic",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "Google",
      "published": "2016-06-24",
      "code": "https://github.com/tensorflow/models/tree/master/official/r1/wide_deep",
      "adapter": {
        "adapter_key": "wide-deep",
        "arxiv_id": "1606.07792",
        "title": "Wide & Deep Learning for Recommender Systems",
        "paper_url": "https://arxiv.org/abs/1606.07792",
        "track": "recommendation",
        "organization": "Google",
        "published": "2016-06-24",
        "code_url": "https://github.com/tensorflow/models/tree/master/official/r1/wide_deep",
        "topics": [
          "ranking",
          "classic",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/wide_deep",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "参数匹配的 deep-only 模型",
        "metrics": [
          "baseline.ndcg_at_10",
          "method.ndcg_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Google Play",
            "metric": "app acquisition",
            "lift_percent": 3.9,
            "traffic": "1% treatment vs 1% control, three weeks",
            "source_url": "https://arxiv.org/abs/1606.07792",
            "source_location": "original paper online-result disclosure: product=Google Play; metric=app acquisition"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "youtube-dnn",
      "title": "Deep Neural Networks for YouTube Recommendations",
      "paper_url": "https://research.google/pubs/deep-neural-networks-for-youtube-recommendations/",
      "detail_path": "reproductions/recsys2016-youtube-dnn-youtube-dnn/README.md",
      "topic": [
        "retrieval",
        "ranking",
        "classic",
        "two-stage"
      ],
      "first_author": null,
      "first_author_affiliation": "Google / YouTube",
      "published": "2016-09-15",
      "code": null,
      "adapter": {
        "adapter_key": "youtube-dnn",
        "arxiv_id": "recsys2016-youtube-dnn",
        "title": "Deep Neural Networks for YouTube Recommendations",
        "paper_url": "https://research.google/pubs/deep-neural-networks-for-youtube-recommendations/",
        "track": "recommendation",
        "organization": "Google / YouTube",
        "published": "2016-09-15",
        "code_url": null,
        "topics": [
          "retrieval",
          "ranking",
          "classic",
          "two-stage"
        ],
        "local_code_dir": "src/auto_research/reproductions/youtube_dnn",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens-100K compact"
        ],
        "baseline": "历史均值 two-tower，实验组增加 YouTube DNN 非线性用户塔",
        "metrics": [
          "baseline.head_share_at_10",
          "baseline.head_share_at_10_std",
          "baseline.hit_at_10",
          "baseline.hit_at_10_std",
          "baseline.ndcg_at_10",
          "baseline.ndcg_at_10_std",
          "method.head_share_at_10",
          "method.head_share_at_10_std",
          "method.hit_at_10",
          "method.hit_at_10_std",
          "method.ndcg_at_10",
          "method.ndcg_at_10_std",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "steps=80",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [],
        "selection_exception": "用户明确批准 YouTube DNN 为经典例外；论文描述线上服务系统但未披露可核验的量化 lift。",
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "youtube-freshness",
      "title": "Breaking the Loop: An Empirical Comparison of Strategies for Novelty and Freshness in YouTube Music",
      "paper_url": "https://arxiv.org/abs/2607.23749",
      "detail_path": "reproductions/2607.23749-youtube-freshness/README.md",
      "topic": [
        "ranking",
        "feedback-loop",
        "freshness",
        "exploration"
      ],
      "first_author": null,
      "first_author_affiliation": "YouTube Music / Google",
      "published": "2026-07-26",
      "code": null,
      "adapter": {
        "adapter_key": "youtube-freshness",
        "arxiv_id": "2607.23749",
        "title": "Breaking the Loop: An Empirical Comparison of Strategies for Novelty and Freshness in YouTube Music",
        "paper_url": "https://arxiv.org/abs/2607.23749",
        "track": "recommendation",
        "organization": "YouTube Music / Google",
        "published": "2026-07-26",
        "code_url": null,
        "topics": [
          "ranking",
          "feedback-loop",
          "freshness",
          "exploration"
        ],
        "local_code_dir": "src/auto_research/reproductions/youtube_freshness",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "popularity-biased continuous ranker，实验组为四机制组合",
        "metrics": [
          "baseline.fresh_hit_at_10",
          "baseline.head_share_at_10",
          "baseline.hit_at_10",
          "baseline.ndcg_at_10",
          "method.fresh_hit_at_10",
          "method.head_share_at_10",
          "method.hit_at_10",
          "method.ndcg_at_10",
          "relative.fresh_hit_at_10_percent",
          "relative.head_share_at_10_percent",
          "relative.hit_at_10_percent",
          "relative.ndcg_at_10_percent",
          "stages.architecture_bias_tower_removed_at_serving",
          "stages.validation_only_model_selection.fresh_hit_at_10",
          "stages.validation_only_model_selection.hit_at_10",
          "stages.validation_only_model_selection.ndcg_at_10"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cpu",
          "mps",
          "cuda"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "YouTube Music homepage",
            "metric": "1-day new-release engagement",
            "lift_percent": 4.33,
            "traffic": "two-week A/B; millions of daily users per arm",
            "source_url": "https://arxiv.org/abs/2607.23749",
            "source_location": "original paper online-result disclosure: product=YouTube Music homepage; metric=1-day new-release engagement"
          }
        ],
        "selection_exception": null,
        "evolve_operators": []
      }
    },
    {
      "domain": "recommendation",
      "key": "zenith",
      "title": "Zenith: Scaling up Ranking Models for Billion-scale Livestreaming Recommendation",
      "paper_url": "https://arxiv.org/abs/2601.21285",
      "detail_path": "reproductions/2601.21285-zenith/README.md",
      "topic": [
        "ranking-network",
        "scaling-law",
        "feature-interaction"
      ],
      "first_author": null,
      "first_author_affiliation": "North Carolina State University",
      "published": "2026-01-29",
      "code": null,
      "adapter": {
        "adapter_key": "zenith",
        "arxiv_id": "2601.21285",
        "title": "Zenith: Scaling up Ranking Models for Billion-scale Livestreaming Recommendation",
        "paper_url": "https://arxiv.org/abs/2601.21285",
        "track": "recommendation",
        "organization": "North Carolina State University",
        "published": "2026-01-29",
        "code_url": null,
        "topics": [
          "ranking-network",
          "scaling-law",
          "feature-interaction"
        ],
        "local_code_dir": "src/auto_research/reproductions/zenith",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "transition + content + popularity",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "fresh_hit_at_10",
          "head_share_at_10"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "TikTok Live",
            "metric": "Quality watch sessions per user",
            "lift_percent": 9.93,
            "traffic": "production online A/B",
            "source_url": "https://arxiv.org/html/2601.21285v1",
            "source_location": "Table 4",
            "retrieved_at": "2026-09-05"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "zenith"
        ]
      }
    },
    {
      "domain": "recommendation",
      "key": "zorro",
      "title": "ZoRRO: A Zero-Weight Personalized Recommender System for Scalable News Recommendation",
      "paper_url": "https://arxiv.org/abs/2607.10910",
      "detail_path": "reproductions/2607.10910-zorro/README.md",
      "topic": [
        "news-recommendation",
        "training-free",
        "recency"
      ],
      "first_author": null,
      "first_author_affiliation": "Technical University of Denmark",
      "published": "2026-07-12",
      "code": null,
      "adapter": {
        "adapter_key": "zorro",
        "arxiv_id": "2607.10910",
        "title": "ZoRRO: A Zero-Weight Personalized Recommender System for Scalable News Recommendation",
        "paper_url": "https://arxiv.org/abs/2607.10910",
        "track": "recommendation",
        "organization": "Technical University of Denmark",
        "published": "2026-07-12",
        "code_url": null,
        "topics": [
          "news-recommendation",
          "training-free",
          "recency"
        ],
        "local_code_dir": "src/auto_research/reproductions/zorro",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "MovieLens 100K"
        ],
        "baseline": "most-popular/content-transition ranker",
        "metrics": [
          "hit_at_10",
          "ndcg_at_10",
          "trainable_parameters",
          "history_items"
        ],
        "default_seeds": [
          42,
          43,
          44
        ],
        "budget": "220 users / 360 items; validation-only blend selection",
        "device_capabilities": [
          "cpu"
        ],
        "requires_gpu_validation": false,
        "gpu_validation_artifact": null,
        "online_evidence": [
          {
            "product": "Ekstra Bladet",
            "metric": "CTR",
            "lift_percent": 4.19,
            "traffic": "six-day live test; 45% treatment traffic",
            "source_url": "https://arxiv.org/html/2607.10910v1",
            "source_location": "Section 4.3, Table 7",
            "retrieved_at": "2026-09-02"
          }
        ],
        "selection_exception": null,
        "evolve_operators": [
          "context:zero-weight"
        ]
      }
    }
  ]
}
