{
  "paper": {
    "arxiv_id": "2607.25344",
    "title": "Reward Guided Decoding for Generative Recommendation",
    "url": "https://arxiv.org/abs/2607.25344",
    "organization": "Institute of Information Engineering, Chinese Academy of Sciences"
  },
  "dataset": {
    "name": "MovieLens 100K",
    "users": 220,
    "items": 360
  },
  "setup": {
    "adapter": "reward-guided-decoding",
    "same_split_and_candidates": true
  },
  "baseline": {
    "name": "generator likelihood decoding",
    "hit_at_10": 0.10909090909090909,
    "ndcg_at_10": 0.05400546778896325,
    "fresh_hit_at_10": 0.031746031746031744,
    "head_share_at_10": 0.23772727272727273
  },
  "method": {
    "name": "closed-form KL-regularized reward-guided decoding",
    "hit_at_10": 0.05,
    "ndcg_at_10": 0.022488850977521433,
    "fresh_hit_at_10": 0.09523809523809523,
    "head_share_at_10": 0.009545454545454546
  },
  "relative": {
    "hit_at_10_percent": -54.166666666666664,
    "ndcg_at_10_percent": -58.358196126731194,
    "fresh_hit_at_10_percent": 200.0,
    "head_share_at_10_percent": -95.98470363288718
  },
  "stages": {
    "beta": 0.55,
    "prior_expected_reward": 0.2464720335950939,
    "guided_expected_reward": 0.2529322696652782,
    "kl_from_generator": 0.005818833685295781,
    "generator_retrained": false
  },
  "paper_results": {
    "page_ctr_lift_percent": 0.392,
    "watch_time_lift_percent": 0.689,
    "watch_count_lift_percent": 0.349,
    "experiment_weeks": 2
  },
  "scope": "实际执行 Q*(j) ∝ P(j) exp(R(j)/beta) 的闭式重加权、KL 距离和 reward 控制；公开 reward 使用内容相关性与新颖度代理，未复刻 Kuaishou SID generator、共享 decoder reward model 和线上 beam search。",
  "schema_version": 2,
  "manifest": {
    "adapter_key": "reward-guided-decoding",
    "arxiv_id": "2607.25344",
    "title": "Reward Guided Decoding for Generative Recommendation",
    "paper_url": "https://arxiv.org/abs/2607.25344",
    "track": "recommendation",
    "organization": "Institute of Information Engineering, Chinese Academy of Sciences",
    "published": "2026-07-28",
    "code_url": null,
    "topics": [
      "generative-recommendation",
      "decoding",
      "reward",
      "business-alignment"
    ],
    "local_code_dir": "src/auto_research/reproductions/industrial_2026",
    "fidelity": "core_mechanism",
    "evaluation_tier": "l2_public_dataset",
    "datasets": [
      "MovieLens 100K"
    ],
    "baseline": "generator likelihood decoding",
    "metrics": [
      "hit_at_10",
      "ndcg_at_10",
      "guided_expected_reward",
      "kl_from_generator"
    ],
    "default_seeds": [
      42,
      43,
      44
    ],
    "budget": "220 users / 360 items; beta=0.55",
    "device_capabilities": [
      "cpu",
      "mps",
      "cuda"
    ],
    "requires_gpu_validation": false,
    "gpu_validation_artifact": null,
    "online_evidence": [
      {
        "product": "Kuaishou live-streaming recommendation",
        "metric": "watch time",
        "lift_percent": 0.689,
        "traffic": "two-week online A/B test",
        "source_url": "https://arxiv.org/html/2607.25344v1",
        "source_location": "Section 5.4 online A/B test",
        "retrieved_at": "2026-09-01"
      }
    ],
    "selection_exception": null,
    "evolve_operators": []
  },
  "provenance": {
    "created_at": "2026-09-01T10:55:37.841053+00:00",
    "code_commit": "996ac89dd9bb16d0ac38be27d53639bc9d4ff859",
    "python": "3.12.9",
    "platform": "macOS-26.5.2-arm64-arm-64bit",
    "dataset_dir": "/Users/bytedance/Documents/git_daiwk/auto-research/data",
    "dataset_fingerprint": "e66c261317a7b3179720ef3e3f5f79d7a204b135d1f217e2911b153ad2ce50a0",
    "packages": {
      "auto-research": "0.1.0",
      "numpy": "2.5.2",
      "torch": "2.13.0",
      "transformers": "5.14.1"
    },
    "artifact_path": "docs/reproductions/2607.25344-reward-guided-decoding/metrics/public-seeds42-44.json"
  },
  "evaluation_protocol": {
    "tier": "l2_public_dataset",
    "tier_label": "L2 公开数据集训练",
    "seeds": [
      42,
      43,
      44
    ],
    "budget": "220 users / 360 items; beta=0.55",
    "formal_comparison": true,
    "claim_policy": "formal multi-seed comparison"
  },
  "seed_results": [
    {
      "paper": {
        "arxiv_id": "2607.25344",
        "title": "Reward Guided Decoding for Generative Recommendation",
        "url": "https://arxiv.org/abs/2607.25344",
        "organization": "Institute of Information Engineering, Chinese Academy of Sciences"
      },
      "dataset": {
        "name": "MovieLens 100K",
        "users": 220,
        "items": 360
      },
      "setup": {
        "adapter": "reward-guided-decoding",
        "same_split_and_candidates": true
      },
      "baseline": {
        "name": "generator likelihood decoding",
        "hit_at_10": 0.10909090909090909,
        "ndcg_at_10": 0.05400546778896325,
        "fresh_hit_at_10": 0.031746031746031744,
        "head_share_at_10": 0.23772727272727273
      },
      "method": {
        "name": "closed-form KL-regularized reward-guided decoding",
        "hit_at_10": 0.05,
        "ndcg_at_10": 0.022488850977521433,
        "fresh_hit_at_10": 0.09523809523809523,
        "head_share_at_10": 0.009545454545454546
      },
      "relative": {
        "hit_at_10_percent": -54.166666666666664,
        "ndcg_at_10_percent": -58.358196126731194,
        "fresh_hit_at_10_percent": 200.0,
        "head_share_at_10_percent": -95.98470363288718
      },
      "stages": {
        "beta": 0.55,
        "prior_expected_reward": 0.2464720335950939,
        "guided_expected_reward": 0.2529322696652782,
        "kl_from_generator": 0.005818833685295781,
        "generator_retrained": false
      },
      "paper_results": {
        "page_ctr_lift_percent": 0.392,
        "watch_time_lift_percent": 0.689,
        "watch_count_lift_percent": 0.349,
        "experiment_weeks": 2
      },
      "scope": "实际执行 Q*(j) ∝ P(j) exp(R(j)/beta) 的闭式重加权、KL 距离和 reward 控制；公开 reward 使用内容相关性与新颖度代理，未复刻 Kuaishou SID generator、共享 decoder reward model 和线上 beam search。"
    },
    {
      "paper": {
        "arxiv_id": "2607.25344",
        "title": "Reward Guided Decoding for Generative Recommendation",
        "url": "https://arxiv.org/abs/2607.25344",
        "organization": "Institute of Information Engineering, Chinese Academy of Sciences"
      },
      "dataset": {
        "name": "MovieLens 100K",
        "users": 220,
        "items": 360
      },
      "setup": {
        "adapter": "reward-guided-decoding",
        "same_split_and_candidates": true
      },
      "baseline": {
        "name": "generator likelihood decoding",
        "hit_at_10": 0.10909090909090909,
        "ndcg_at_10": 0.05400546778896325,
        "fresh_hit_at_10": 0.031746031746031744,
        "head_share_at_10": 0.23772727272727273
      },
      "method": {
        "name": "closed-form KL-regularized reward-guided decoding",
        "hit_at_10": 0.05,
        "ndcg_at_10": 0.022488850977521433,
        "fresh_hit_at_10": 0.09523809523809523,
        "head_share_at_10": 0.009545454545454546
      },
      "relative": {
        "hit_at_10_percent": -54.166666666666664,
        "ndcg_at_10_percent": -58.358196126731194,
        "fresh_hit_at_10_percent": 200.0,
        "head_share_at_10_percent": -95.98470363288718
      },
      "stages": {
        "beta": 0.55,
        "prior_expected_reward": 0.2464720335950939,
        "guided_expected_reward": 0.2529322696652782,
        "kl_from_generator": 0.005818833685295781,
        "generator_retrained": false
      },
      "paper_results": {
        "page_ctr_lift_percent": 0.392,
        "watch_time_lift_percent": 0.689,
        "watch_count_lift_percent": 0.349,
        "experiment_weeks": 2
      },
      "scope": "实际执行 Q*(j) ∝ P(j) exp(R(j)/beta) 的闭式重加权、KL 距离和 reward 控制；公开 reward 使用内容相关性与新颖度代理，未复刻 Kuaishou SID generator、共享 decoder reward model 和线上 beam search。"
    },
    {
      "paper": {
        "arxiv_id": "2607.25344",
        "title": "Reward Guided Decoding for Generative Recommendation",
        "url": "https://arxiv.org/abs/2607.25344",
        "organization": "Institute of Information Engineering, Chinese Academy of Sciences"
      },
      "dataset": {
        "name": "MovieLens 100K",
        "users": 220,
        "items": 360
      },
      "setup": {
        "adapter": "reward-guided-decoding",
        "same_split_and_candidates": true
      },
      "baseline": {
        "name": "generator likelihood decoding",
        "hit_at_10": 0.10909090909090909,
        "ndcg_at_10": 0.05400546778896325,
        "fresh_hit_at_10": 0.031746031746031744,
        "head_share_at_10": 0.23772727272727273
      },
      "method": {
        "name": "closed-form KL-regularized reward-guided decoding",
        "hit_at_10": 0.05,
        "ndcg_at_10": 0.022488850977521433,
        "fresh_hit_at_10": 0.09523809523809523,
        "head_share_at_10": 0.009545454545454546
      },
      "relative": {
        "hit_at_10_percent": -54.166666666666664,
        "ndcg_at_10_percent": -58.358196126731194,
        "fresh_hit_at_10_percent": 200.0,
        "head_share_at_10_percent": -95.98470363288718
      },
      "stages": {
        "beta": 0.55,
        "prior_expected_reward": 0.2464720335950939,
        "guided_expected_reward": 0.2529322696652782,
        "kl_from_generator": 0.005818833685295781,
        "generator_retrained": false
      },
      "paper_results": {
        "page_ctr_lift_percent": 0.392,
        "watch_time_lift_percent": 0.689,
        "watch_count_lift_percent": 0.349,
        "experiment_weeks": 2
      },
      "scope": "实际执行 Q*(j) ∝ P(j) exp(R(j)/beta) 的闭式重加权、KL 距离和 reward 控制；公开 reward 使用内容相关性与新颖度代理，未复刻 Kuaishou SID generator、共享 decoder reward model 和线上 beam search。"
    }
  ],
  "aggregate_metrics": {
    "dataset.users": {
      "mean": 220.0,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "dataset.items": {
      "mean": 360.0,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "baseline.hit_at_10": {
      "mean": 0.10909090909090909,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "baseline.ndcg_at_10": {
      "mean": 0.05400546778896325,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "baseline.fresh_hit_at_10": {
      "mean": 0.031746031746031744,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "baseline.head_share_at_10": {
      "mean": 0.2377272727272727,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "method.hit_at_10": {
      "mean": 0.05000000000000001,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "method.ndcg_at_10": {
      "mean": 0.022488850977521433,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "method.fresh_hit_at_10": {
      "mean": 0.09523809523809523,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "method.head_share_at_10": {
      "mean": 0.009545454545454546,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "relative.hit_at_10_percent": {
      "mean": -54.166666666666664,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "relative.ndcg_at_10_percent": {
      "mean": -58.358196126731194,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "relative.fresh_hit_at_10_percent": {
      "mean": 200.0,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "relative.head_share_at_10_percent": {
      "mean": -95.98470363288716,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "stages.beta": {
      "mean": 0.55,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "stages.prior_expected_reward": {
      "mean": 0.24647203359509393,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "stages.guided_expected_reward": {
      "mean": 0.2529322696652782,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "stages.kl_from_generator": {
      "mean": 0.005818833685295781,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "paper_results.page_ctr_lift_percent": {
      "mean": 0.39200000000000007,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "paper_results.watch_time_lift_percent": {
      "mean": 0.689,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "paper_results.watch_count_lift_percent": {
      "mean": 0.349,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    },
    "paper_results.experiment_weeks": {
      "mean": 2.0,
      "std": 0.0,
      "ci95": 0.0,
      "n": 3
    }
  },
  "manifest_ref": "reproduction:reward-guided-decoding"
}
