{
  "algorithm": "uc-mopd",
  "dataset": "arithmetic-smoke",
  "baseline": {
    "accuracy": 0.1953125,
    "mean_reward": 0.359689058826365,
    "entropy": 1.791759469222057,
    "kl_from_reference": 0.0
  },
  "final": {
    "accuracy": 0.1953125,
    "mean_reward": 0.359689058826365,
    "entropy": 1.791759469222057,
    "kl_from_reference": 0.0
  },
  "relative_accuracy": 0.0,
  "training": {
    "steps": 100,
    "learning_rate": 0.08,
    "group_size": 4,
    "train_examples": 512,
    "validation_examples": 128,
    "data_source": "deterministic arithmetic smoke suite",
    "teacher_cache_entries": 0,
    "teacher_prefill_calls": 0,
    "online_teacher_calls": 0,
    "drift_events": 0,
    "critic_updates": 0,
    "rollout_policy_refreshes": 6,
    "last_diagnostics": {
      "dual_temperature": 1.35,
      "positive_advantage_density": 0.0,
      "cll_retention_rate": 0.5,
      "hot_sampling_entropy": 1.791759469222055,
      "loss": -0.0,
      "policy_entropy": 1.791759469222055
    },
    "fidelity": "mechanism reproduction on a candidate-policy model"
  },
  "history": [
    {
      "step": 1.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 10.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 20.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 30.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 40.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 50.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 60.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 70.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 80.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 90.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    },
    {
      "step": 100.0,
      "loss": -0.0,
      "accuracy": 0.1953125,
      "mean_reward": 0.359689058826365,
      "entropy": 1.791759469222057,
      "kl_from_reference": 0.0
    }
  ],
  "schema_version": 2,
  "manifest_ref": "post-training:arithmetic-smoke-seed42",
  "evaluation_protocol": {
    "tier": "l1_mechanism",
    "seeds": [
      42
    ],
    "formal_comparison": false,
    "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
  },
  "provenance": {
    "artifact_path": "docs/post-training/2608.26735-uc-mopd/metrics/arithmetic-smoke-seed42.json",
    "dataset_fingerprint": "not recorded in historical artifact",
    "historical_migration": "historical-metrics-v2-2026-08-09",
    "original_code_commit": "not recorded"
  }
}
