{
  "seed": {
    "benchmark": "planbench-mini",
    "metrics": {
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 0.9799999999999974
    },
    "axis_metrics": {
      "cross_episode_execution": 1.0
    },
    "diagnostics": {
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 108,
      "reasoning_steps": 0,
      "actions": 0,
      "reflections": 0,
      "skills_created": 12,
      "skills_reused": 108,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 12,
      "dense_credit_updates": 360,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "fidelity": "mechanism reproduction on deterministic benchmark mini-suites"
    }
  },
  "cast": {
    "benchmark": "planbench-mini",
    "metrics": {
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 1.5
    },
    "axis_metrics": {
      "cross_episode_execution": 1.0
    },
    "diagnostics": {
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 360,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 2040,
      "turn_credit_updates": 360,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "fidelity": "mechanism reproduction on deterministic benchmark mini-suites"
    }
  },
  "turn-opd": {
    "benchmark": "scalemcp-mini",
    "metrics": {
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 1.3333333333333333
    },
    "axis_metrics": {
      "cross_episode_execution": 1.0,
      "in_episode_execution": 1.0
    },
    "diagnostics": {
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 360,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 320,
      "solver_value_queries": 0,
      "turn_credit_updates": 360,
      "rollout_turns_saved": 40,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "fidelity": "mechanism reproduction on deterministic benchmark mini-suites"
    }
  },
  "hiskill": {
    "benchmark": "planbench-mini",
    "metrics": {
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 0.6899999999999994
    },
    "axis_metrics": {
      "cross_episode_execution": 1.0
    },
    "diagnostics": {
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 0,
      "reflections": 0,
      "skills_created": 12,
      "skills_reused": 108,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 48,
      "skill_graph_edges": 60,
      "atomic_ops_reused": 324,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "fidelity": "mechanism reproduction on deterministic benchmark mini-suites"
    }
  },
  "unimem": {
    "benchmark": "evomem-mini",
    "metrics": {
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 0.520000000000001
    },
    "axis_metrics": {
      "in_episode_knowledge": 1.0,
      "cross_episode_knowledge": 1.0,
      "in_episode_execution": 1.0,
      "cross_episode_execution": 1.0
    },
    "diagnostics": {
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 96,
      "reasoning_steps": 0,
      "actions": 0,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 24,
      "parametric_routes": 96,
      "memory_consolidations": 12,
      "fidelity": "mechanism reproduction on deterministic benchmark mini-suites"
    }
  },
  "schema_version": 2,
  "manifest_ref": "experiments:agent-20260729-seed42",
  "evaluation_protocol": {
    "tier": "l1_mechanism",
    "seeds": [
      42
    ],
    "formal_comparison": false,
    "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
  },
  "provenance": {
    "artifact_path": "docs/experiments/agent-20260729-seed42.json",
    "historical_migration": "historical-metrics-v2-2026-08-09",
    "original_code_commit": "not recorded",
    "dataset_fingerprint": "not recorded in historical artifact"
  }
}
