{
  "schema_version": 2,
  "method": "nsd",
  "dataset": "deterministic mechanism mini-suite",
  "seeds": [
    42,
    43,
    44
  ],
  "runs": [
    {
      "seed": 42,
      "accuracy": 0.546875,
      "mean_reward": 0.6567863836899481,
      "entropy": 1.7916906081223065,
      "kl_from_reference": 6.886109974846055e-05,
      "negative_teacher_divergence": 0.472774913339141,
      "reasoning_gate_mean": 0.5329958853348871,
      "protected_token_fraction": 0.5,
      "update_weight_abs_mean": 0.08886452335753094,
      "loss": -0.08942848322524428,
      "policy_entropy": 1.7916733400095728
    },
    {
      "seed": 43,
      "accuracy": 0.28125,
      "mean_reward": 0.45429363230689995,
      "entropy": 1.7913129391858351,
      "kl_from_reference": 0.00044653003622007685,
      "negative_teacher_divergence": 0.4640569651524509,
      "reasoning_gate_mean": 0.75,
      "protected_token_fraction": 0.25,
      "update_weight_abs_mean": 0.1420542923728271,
      "loss": -0.25511489016000866,
      "policy_entropy": 1.7914415520796605
    },
    {
      "seed": 44,
      "accuracy": 0.640625,
      "mean_reward": 0.7177429126822532,
      "entropy": 1.7917547748967946,
      "kl_from_reference": 4.694325260504617e-06,
      "negative_teacher_divergence": 0.46784319253897877,
      "reasoning_gate_mean": 0.5679814711652168,
      "protected_token_fraction": 0.25,
      "update_weight_abs_mean": 0.11546388171826309,
      "loss": -0.06572958630718699,
      "policy_entropy": 1.7917547353474705
    }
  ],
  "aggregate_metrics": {
    "accuracy_mean": 0.4895833333333333,
    "accuracy_std": 0.18641177258513833,
    "entropy_mean": 1.7915861074016455,
    "entropy_std": 0.0002387362547536122,
    "kl_from_reference_mean": 0.00017336182040968067,
    "kl_from_reference_std": 0.00023873625475369977,
    "loss_mean": -0.13675765323081332,
    "loss_std": 0.10318302224163838,
    "mean_reward_mean": 0.6096076428930338,
    "mean_reward_std": 0.13791575696764927,
    "negative_teacher_divergence_mean": 0.46822502367685687,
    "negative_teacher_divergence_std": 0.004371498760132896,
    "policy_entropy_mean": 1.791623209145568,
    "policy_entropy_std": 0.00016249851523459947,
    "protected_token_fraction_mean": 0.3333333333333333,
    "protected_token_fraction_std": 0.14433756729740643,
    "reasoning_gate_mean_mean": 0.6169924521667013,
    "reasoning_gate_mean_std": 0.11650859899356475,
    "seed_mean": 43.0,
    "seed_std": 1.0,
    "update_weight_abs_mean_mean": 0.11546089914954039,
    "update_weight_abs_mean_std": 0.026594884633081736
  },
  "manifest_ref": "post-training:nsd",
  "evaluation_protocol": {
    "tier": "l1_mechanism",
    "formal_comparison": false,
    "diagnostic_only": true,
    "claim_policy": "mechanism execution only; not a paper-scale capability result",
    "seeds": [
      42,
      43,
      44
    ]
  },
  "provenance": {
    "commit": "6149448867b0e247d25957486b37a4e06629c5d7",
    "command": "PYTHONPATH=src python scripts/generate_sep_14_2026_artifacts.py",
    "artifact_path": "docs/post-training/2609.11699-nsd/metrics/mechanism-seeds42-44.json",
    "dataset_fingerprint": "not recorded in historical artifact"
  }
}
