{
  "protocol": {
    "dataset": "OpenAI GSM8K official train/test JSONL",
    "task": "six-candidate answer policy; exact-answer outcome reward",
    "train_examples": 512,
    "validation_examples": 128,
    "steps": 300,
    "learning_rate": 0.08,
    "group_size": 4,
    "seed": 42,
    "fidelity": "mechanism reproduction; not full-sequence LLM post-training"
  },
  "untrained_policy": {
    "accuracy": 0.1640625,
    "mean_reward": 0.31261065795890286
  },
  "results": {
    "dpo": {
      "accuracy": 0.8046875,
      "mean_reward": 0.8346500627127349,
      "kl_from_reference": 0.06833317338028673
    },
    "grpo": {
      "accuracy": 0.78125,
      "mean_reward": 0.8168955128271573,
      "kl_from_reference": 1.0400522058527373,
      "rollout_policy_refreshes": 18,
      "value_model_parameters": 0
    },
    "lightning-opd": {
      "accuracy": 0.8359375,
      "mean_reward": 0.8560566488710981,
      "kl_from_reference": 0.826884638864772,
      "teacher_prefill_calls": 512,
      "online_teacher_calls": 0
    },
    "gprl": {
      "accuracy": 0.3671875,
      "mean_reward": 0.5002428742813487,
      "kl_from_reference": 1.102159422210548,
      "drift_events": 257
    },
    "tcr": {
      "accuracy": 0.8359375,
      "mean_reward": 0.855992353047812,
      "kl_from_reference": 0.5628950911504872
    }
  },
  "schema_version": 2,
  "manifest_ref": "experiments:post-training-gsm8k-candidate-seed42",
  "evaluation_protocol": {
    "tier": "l1_mechanism",
    "seeds": [
      42
    ],
    "formal_comparison": false,
    "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
  },
  "provenance": {
    "artifact_path": "docs/experiments/post-training-gsm8k-candidate-seed42.json",
    "historical_migration": "historical-metrics-v2-2026-08-09",
    "original_code_commit": "not recorded",
    "dataset_fingerprint": "not recorded in historical artifact"
  }
}
