{
  "schema_version": 2,
  "method": "sciencebuddy",
  "dataset": "deterministic mechanism mini-suite",
  "seeds": [
    42,
    43,
    44
  ],
  "runs": [
    {
      "seed": 42,
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 5.0,
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 360,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "search_queries": 0,
      "retrieved_tokens_masked": 0,
      "outcome_rewards": 0,
      "trajectory_rollouts": 0,
      "trajectory_filters": 0,
      "critic_baseline_updates": 0,
      "gradient_clips": 0,
      "echo_trap_events": 0,
      "reasoning_rewards": 0,
      "off_policy_reuses": 0,
      "leave_one_out_updates": 0,
      "per_token_clips": 0,
      "context_compressions": 0,
      "parallel_trajectory_groups": 0,
      "multi_turn_group_updates": 0,
      "simulated_user_turns": 0,
      "intent_refinements": 0,
      "real_tool_responses": 0,
      "task_completion_rewards": 0,
      "tools_exposed": 0,
      "tools_available": 0,
      "tool_exposure_reduction": 0.0,
      "cost_aware_stops": 0,
      "regret_weighted_labels": 0,
      "skill_document_updates": 0,
      "cross_task_skill_reuses": 0,
      "downstream_credit_updates": 0,
      "step_value_queries": 0,
      "step_gae_updates": 0,
      "step_sequence_ratios": 0,
      "intra_group_advantages": 0,
      "inter_group_advantages": 0,
      "transition_targets": 0,
      "transition_accuracy": 0.0,
      "reflective_groups": 0,
      "success_failure_contrasts": 0,
      "privileged_guidance_updates": 0,
      "world_rehearsals": 0,
      "rolewise_advantage_updates": 0,
      "private_rehearsals": 0,
      "recursive_belief_updates": 0,
      "pivotal_turns": 0,
      "observation_calibrations": 0,
      "scaffold_ablations": 0,
      "local_verifier_calls": 0,
      "global_verifier_calls": 0,
      "memory_operations": 0,
      "coevolution_alternations": 0,
      "router_updates": 0,
      "memory_bank_updates": 0,
      "harness_generations": 0,
      "harness_repairs": 0,
      "archive_distillations": 0,
      "reopened_approaches": 0,
      "versioned_edits": 0,
      "tool_necessity_filters": 0,
      "redundant_calls_avoided": 0,
      "reliability_reflections": 0,
      "prefix_hits": 0,
      "critical_path_updates": 0,
      "aging_promotions": 0,
      "counterfactual_probes": 0,
      "bayesian_edge_updates": 0,
      "progress_predictions": 0,
      "meta_gate_decisions": 0,
      "budget_downgrades": 0,
      "deciding_tool_attributions": 0,
      "validation_ratchet_accepts": 0,
      "validation_ratchet_rejects": 0,
      "accuracy_gates": 0,
      "complexity_calibrations": 0,
      "diversity_accepts": 0,
      "diversity_rejections": 0,
      "state_snapshots": 0,
      "subplan_revisions": 0,
      "runtime_feedback_repairs": 0,
      "atomic_memory_writes": 0,
      "multi_hop_retrievals": 0,
      "task_skill_retrievals": 0,
      "step_skill_retrievals": 0,
      "meta_skill_updates": 0,
      "shadow_executions": 0,
      "product_order_admissions": 0,
      "unsafe_scalar_rejections": 0,
      "within_harness_groups": 0,
      "cross_harness_groups": 0,
      "heldout_harness_evaluations": 0,
      "procedural_graph_edges": 0,
      "heldout_edit_accepts": 0,
      "heldout_edit_rejects": 0,
      "event_tree_partitions": 0,
      "progressive_merges": 0,
      "anchor_propagations": 0,
      "early_action_guidance": 0,
      "feedback_observations": 0,
      "late_stage_enrichments": 0,
      "accepted_solution_updates": 0,
      "reused_executable_states": 0,
      "bandit_allocations": 0,
      "skill_evolutions": 0,
      "cross_instance_failures": 0,
      "fdcr_repairs": 0,
      "environment_probes": 0,
      "memory_admissions": 0,
      "stale_rejections": 0,
      "answer_first_generations": 0,
      "textual_gradient_edits": 0,
      "profile_bottlenecks": 0,
      "sharding_proposals": 0,
      "evidence_graph_edges": 0,
      "unsupported_answer_flags": 0,
      "anchor_penalties": 0,
      "replay_retrievals": 0,
      "tito_tokens": 0,
      "routing_replays": 0,
      "turn_boundary_repairs": 0,
      "simulated_dialogues": 0,
      "framing_checks": 0,
      "verifiable_motives": 0,
      "harness_allocations": 0,
      "gradient_sketch_updates": 0,
      "inner_harness_updates": 12,
      "outer_policy_updates": 120,
      "cross_branch_lessons": 108
    },
    {
      "seed": 43,
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 5.0,
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 360,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "search_queries": 0,
      "retrieved_tokens_masked": 0,
      "outcome_rewards": 0,
      "trajectory_rollouts": 0,
      "trajectory_filters": 0,
      "critic_baseline_updates": 0,
      "gradient_clips": 0,
      "echo_trap_events": 0,
      "reasoning_rewards": 0,
      "off_policy_reuses": 0,
      "leave_one_out_updates": 0,
      "per_token_clips": 0,
      "context_compressions": 0,
      "parallel_trajectory_groups": 0,
      "multi_turn_group_updates": 0,
      "simulated_user_turns": 0,
      "intent_refinements": 0,
      "real_tool_responses": 0,
      "task_completion_rewards": 0,
      "tools_exposed": 0,
      "tools_available": 0,
      "tool_exposure_reduction": 0.0,
      "cost_aware_stops": 0,
      "regret_weighted_labels": 0,
      "skill_document_updates": 0,
      "cross_task_skill_reuses": 0,
      "downstream_credit_updates": 0,
      "step_value_queries": 0,
      "step_gae_updates": 0,
      "step_sequence_ratios": 0,
      "intra_group_advantages": 0,
      "inter_group_advantages": 0,
      "transition_targets": 0,
      "transition_accuracy": 0.0,
      "reflective_groups": 0,
      "success_failure_contrasts": 0,
      "privileged_guidance_updates": 0,
      "world_rehearsals": 0,
      "rolewise_advantage_updates": 0,
      "private_rehearsals": 0,
      "recursive_belief_updates": 0,
      "pivotal_turns": 0,
      "observation_calibrations": 0,
      "scaffold_ablations": 0,
      "local_verifier_calls": 0,
      "global_verifier_calls": 0,
      "memory_operations": 0,
      "coevolution_alternations": 0,
      "router_updates": 0,
      "memory_bank_updates": 0,
      "harness_generations": 0,
      "harness_repairs": 0,
      "archive_distillations": 0,
      "reopened_approaches": 0,
      "versioned_edits": 0,
      "tool_necessity_filters": 0,
      "redundant_calls_avoided": 0,
      "reliability_reflections": 0,
      "prefix_hits": 0,
      "critical_path_updates": 0,
      "aging_promotions": 0,
      "counterfactual_probes": 0,
      "bayesian_edge_updates": 0,
      "progress_predictions": 0,
      "meta_gate_decisions": 0,
      "budget_downgrades": 0,
      "deciding_tool_attributions": 0,
      "validation_ratchet_accepts": 0,
      "validation_ratchet_rejects": 0,
      "accuracy_gates": 0,
      "complexity_calibrations": 0,
      "diversity_accepts": 0,
      "diversity_rejections": 0,
      "state_snapshots": 0,
      "subplan_revisions": 0,
      "runtime_feedback_repairs": 0,
      "atomic_memory_writes": 0,
      "multi_hop_retrievals": 0,
      "task_skill_retrievals": 0,
      "step_skill_retrievals": 0,
      "meta_skill_updates": 0,
      "shadow_executions": 0,
      "product_order_admissions": 0,
      "unsafe_scalar_rejections": 0,
      "within_harness_groups": 0,
      "cross_harness_groups": 0,
      "heldout_harness_evaluations": 0,
      "procedural_graph_edges": 0,
      "heldout_edit_accepts": 0,
      "heldout_edit_rejects": 0,
      "event_tree_partitions": 0,
      "progressive_merges": 0,
      "anchor_propagations": 0,
      "early_action_guidance": 0,
      "feedback_observations": 0,
      "late_stage_enrichments": 0,
      "accepted_solution_updates": 0,
      "reused_executable_states": 0,
      "bandit_allocations": 0,
      "skill_evolutions": 0,
      "cross_instance_failures": 0,
      "fdcr_repairs": 0,
      "environment_probes": 0,
      "memory_admissions": 0,
      "stale_rejections": 0,
      "answer_first_generations": 0,
      "textual_gradient_edits": 0,
      "profile_bottlenecks": 0,
      "sharding_proposals": 0,
      "evidence_graph_edges": 0,
      "unsupported_answer_flags": 0,
      "anchor_penalties": 0,
      "replay_retrievals": 0,
      "tito_tokens": 0,
      "routing_replays": 0,
      "turn_boundary_repairs": 0,
      "simulated_dialogues": 0,
      "framing_checks": 0,
      "verifiable_motives": 0,
      "harness_allocations": 0,
      "gradient_sketch_updates": 0,
      "inner_harness_updates": 12,
      "outer_policy_updates": 120,
      "cross_branch_lessons": 108
    },
    {
      "seed": 44,
      "answer_accuracy": 1.0,
      "plan_success": 1.0,
      "joint_success": 1.0,
      "average_cost": 5.0,
      "episodes": 120,
      "memory_size": 24,
      "tool_evictions": 0,
      "reused_plans": 0,
      "reasoning_steps": 0,
      "actions": 360,
      "reflections": 0,
      "skills_created": 0,
      "skills_reused": 0,
      "verification_retries": 0,
      "tree_nodes_expanded": 0,
      "search_rollouts": 0,
      "backtracks": 0,
      "tool_call_candidates": 0,
      "tool_calls_accepted": 0,
      "refinements": 0,
      "plans_created": 0,
      "worker_calls": 0,
      "agent_messages": 0,
      "critic_rounds": 0,
      "plan_explorations": 0,
      "policy_updates": 0,
      "router_calls": 0,
      "symbolic_expert_calls": 0,
      "model_matches": 0,
      "dependency_edges": 0,
      "memories_retrieved": 0,
      "reflection_syntheses": 0,
      "archival_writes": 0,
      "page_ins": 0,
      "interrupts": 0,
      "browser_queries": 0,
      "references_collected": 0,
      "rejection_candidates": 0,
      "affordance_checks": 0,
      "infeasible_skills_filtered": 0,
      "programs_generated": 0,
      "interpreter_calls": 0,
      "task_examples_retrieved": 0,
      "generation_pauses": 0,
      "task_library_updates": 0,
      "hindsight_skills": 0,
      "dense_credit_updates": 0,
      "solver_value_queries": 0,
      "turn_credit_updates": 0,
      "rollout_turns_saved": 0,
      "skill_graph_nodes": 0,
      "skill_graph_edges": 0,
      "atomic_ops_reused": 0,
      "episodic_routes": 0,
      "parametric_routes": 0,
      "memory_consolidations": 0,
      "search_queries": 0,
      "retrieved_tokens_masked": 0,
      "outcome_rewards": 0,
      "trajectory_rollouts": 0,
      "trajectory_filters": 0,
      "critic_baseline_updates": 0,
      "gradient_clips": 0,
      "echo_trap_events": 0,
      "reasoning_rewards": 0,
      "off_policy_reuses": 0,
      "leave_one_out_updates": 0,
      "per_token_clips": 0,
      "context_compressions": 0,
      "parallel_trajectory_groups": 0,
      "multi_turn_group_updates": 0,
      "simulated_user_turns": 0,
      "intent_refinements": 0,
      "real_tool_responses": 0,
      "task_completion_rewards": 0,
      "tools_exposed": 0,
      "tools_available": 0,
      "tool_exposure_reduction": 0.0,
      "cost_aware_stops": 0,
      "regret_weighted_labels": 0,
      "skill_document_updates": 0,
      "cross_task_skill_reuses": 0,
      "downstream_credit_updates": 0,
      "step_value_queries": 0,
      "step_gae_updates": 0,
      "step_sequence_ratios": 0,
      "intra_group_advantages": 0,
      "inter_group_advantages": 0,
      "transition_targets": 0,
      "transition_accuracy": 0.0,
      "reflective_groups": 0,
      "success_failure_contrasts": 0,
      "privileged_guidance_updates": 0,
      "world_rehearsals": 0,
      "rolewise_advantage_updates": 0,
      "private_rehearsals": 0,
      "recursive_belief_updates": 0,
      "pivotal_turns": 0,
      "observation_calibrations": 0,
      "scaffold_ablations": 0,
      "local_verifier_calls": 0,
      "global_verifier_calls": 0,
      "memory_operations": 0,
      "coevolution_alternations": 0,
      "router_updates": 0,
      "memory_bank_updates": 0,
      "harness_generations": 0,
      "harness_repairs": 0,
      "archive_distillations": 0,
      "reopened_approaches": 0,
      "versioned_edits": 0,
      "tool_necessity_filters": 0,
      "redundant_calls_avoided": 0,
      "reliability_reflections": 0,
      "prefix_hits": 0,
      "critical_path_updates": 0,
      "aging_promotions": 0,
      "counterfactual_probes": 0,
      "bayesian_edge_updates": 0,
      "progress_predictions": 0,
      "meta_gate_decisions": 0,
      "budget_downgrades": 0,
      "deciding_tool_attributions": 0,
      "validation_ratchet_accepts": 0,
      "validation_ratchet_rejects": 0,
      "accuracy_gates": 0,
      "complexity_calibrations": 0,
      "diversity_accepts": 0,
      "diversity_rejections": 0,
      "state_snapshots": 0,
      "subplan_revisions": 0,
      "runtime_feedback_repairs": 0,
      "atomic_memory_writes": 0,
      "multi_hop_retrievals": 0,
      "task_skill_retrievals": 0,
      "step_skill_retrievals": 0,
      "meta_skill_updates": 0,
      "shadow_executions": 0,
      "product_order_admissions": 0,
      "unsafe_scalar_rejections": 0,
      "within_harness_groups": 0,
      "cross_harness_groups": 0,
      "heldout_harness_evaluations": 0,
      "procedural_graph_edges": 0,
      "heldout_edit_accepts": 0,
      "heldout_edit_rejects": 0,
      "event_tree_partitions": 0,
      "progressive_merges": 0,
      "anchor_propagations": 0,
      "early_action_guidance": 0,
      "feedback_observations": 0,
      "late_stage_enrichments": 0,
      "accepted_solution_updates": 0,
      "reused_executable_states": 0,
      "bandit_allocations": 0,
      "skill_evolutions": 0,
      "cross_instance_failures": 0,
      "fdcr_repairs": 0,
      "environment_probes": 0,
      "memory_admissions": 0,
      "stale_rejections": 0,
      "answer_first_generations": 0,
      "textual_gradient_edits": 0,
      "profile_bottlenecks": 0,
      "sharding_proposals": 0,
      "evidence_graph_edges": 0,
      "unsupported_answer_flags": 0,
      "anchor_penalties": 0,
      "replay_retrievals": 0,
      "tito_tokens": 0,
      "routing_replays": 0,
      "turn_boundary_repairs": 0,
      "simulated_dialogues": 0,
      "framing_checks": 0,
      "verifiable_motives": 0,
      "harness_allocations": 0,
      "gradient_sketch_updates": 0,
      "inner_harness_updates": 12,
      "outer_policy_updates": 120,
      "cross_branch_lessons": 108
    }
  ],
  "aggregate_metrics": {
    "accepted_solution_updates_mean": 0.0,
    "accepted_solution_updates_std": 0.0,
    "accuracy_gates_mean": 0.0,
    "accuracy_gates_std": 0.0,
    "actions_mean": 360.0,
    "actions_std": 0.0,
    "affordance_checks_mean": 0.0,
    "affordance_checks_std": 0.0,
    "agent_messages_mean": 0.0,
    "agent_messages_std": 0.0,
    "aging_promotions_mean": 0.0,
    "aging_promotions_std": 0.0,
    "anchor_penalties_mean": 0.0,
    "anchor_penalties_std": 0.0,
    "anchor_propagations_mean": 0.0,
    "anchor_propagations_std": 0.0,
    "answer_accuracy_mean": 1.0,
    "answer_accuracy_std": 0.0,
    "answer_first_generations_mean": 0.0,
    "answer_first_generations_std": 0.0,
    "archival_writes_mean": 0.0,
    "archival_writes_std": 0.0,
    "archive_distillations_mean": 0.0,
    "archive_distillations_std": 0.0,
    "atomic_memory_writes_mean": 0.0,
    "atomic_memory_writes_std": 0.0,
    "atomic_ops_reused_mean": 0.0,
    "atomic_ops_reused_std": 0.0,
    "average_cost_mean": 5.0,
    "average_cost_std": 0.0,
    "backtracks_mean": 0.0,
    "backtracks_std": 0.0,
    "bandit_allocations_mean": 0.0,
    "bandit_allocations_std": 0.0,
    "bayesian_edge_updates_mean": 0.0,
    "bayesian_edge_updates_std": 0.0,
    "browser_queries_mean": 0.0,
    "browser_queries_std": 0.0,
    "budget_downgrades_mean": 0.0,
    "budget_downgrades_std": 0.0,
    "coevolution_alternations_mean": 0.0,
    "coevolution_alternations_std": 0.0,
    "complexity_calibrations_mean": 0.0,
    "complexity_calibrations_std": 0.0,
    "context_compressions_mean": 0.0,
    "context_compressions_std": 0.0,
    "cost_aware_stops_mean": 0.0,
    "cost_aware_stops_std": 0.0,
    "counterfactual_probes_mean": 0.0,
    "counterfactual_probes_std": 0.0,
    "critic_baseline_updates_mean": 0.0,
    "critic_baseline_updates_std": 0.0,
    "critic_rounds_mean": 0.0,
    "critic_rounds_std": 0.0,
    "critical_path_updates_mean": 0.0,
    "critical_path_updates_std": 0.0,
    "cross_branch_lessons_mean": 108.0,
    "cross_branch_lessons_std": 0.0,
    "cross_harness_groups_mean": 0.0,
    "cross_harness_groups_std": 0.0,
    "cross_instance_failures_mean": 0.0,
    "cross_instance_failures_std": 0.0,
    "cross_task_skill_reuses_mean": 0.0,
    "cross_task_skill_reuses_std": 0.0,
    "deciding_tool_attributions_mean": 0.0,
    "deciding_tool_attributions_std": 0.0,
    "dense_credit_updates_mean": 0.0,
    "dense_credit_updates_std": 0.0,
    "dependency_edges_mean": 0.0,
    "dependency_edges_std": 0.0,
    "diversity_accepts_mean": 0.0,
    "diversity_accepts_std": 0.0,
    "diversity_rejections_mean": 0.0,
    "diversity_rejections_std": 0.0,
    "downstream_credit_updates_mean": 0.0,
    "downstream_credit_updates_std": 0.0,
    "early_action_guidance_mean": 0.0,
    "early_action_guidance_std": 0.0,
    "echo_trap_events_mean": 0.0,
    "echo_trap_events_std": 0.0,
    "environment_probes_mean": 0.0,
    "environment_probes_std": 0.0,
    "episodes_mean": 120.0,
    "episodes_std": 0.0,
    "episodic_routes_mean": 0.0,
    "episodic_routes_std": 0.0,
    "event_tree_partitions_mean": 0.0,
    "event_tree_partitions_std": 0.0,
    "evidence_graph_edges_mean": 0.0,
    "evidence_graph_edges_std": 0.0,
    "fdcr_repairs_mean": 0.0,
    "fdcr_repairs_std": 0.0,
    "feedback_observations_mean": 0.0,
    "feedback_observations_std": 0.0,
    "framing_checks_mean": 0.0,
    "framing_checks_std": 0.0,
    "generation_pauses_mean": 0.0,
    "generation_pauses_std": 0.0,
    "global_verifier_calls_mean": 0.0,
    "global_verifier_calls_std": 0.0,
    "gradient_clips_mean": 0.0,
    "gradient_clips_std": 0.0,
    "gradient_sketch_updates_mean": 0.0,
    "gradient_sketch_updates_std": 0.0,
    "harness_allocations_mean": 0.0,
    "harness_allocations_std": 0.0,
    "harness_generations_mean": 0.0,
    "harness_generations_std": 0.0,
    "harness_repairs_mean": 0.0,
    "harness_repairs_std": 0.0,
    "heldout_edit_accepts_mean": 0.0,
    "heldout_edit_accepts_std": 0.0,
    "heldout_edit_rejects_mean": 0.0,
    "heldout_edit_rejects_std": 0.0,
    "heldout_harness_evaluations_mean": 0.0,
    "heldout_harness_evaluations_std": 0.0,
    "hindsight_skills_mean": 0.0,
    "hindsight_skills_std": 0.0,
    "infeasible_skills_filtered_mean": 0.0,
    "infeasible_skills_filtered_std": 0.0,
    "inner_harness_updates_mean": 12.0,
    "inner_harness_updates_std": 0.0,
    "intent_refinements_mean": 0.0,
    "intent_refinements_std": 0.0,
    "inter_group_advantages_mean": 0.0,
    "inter_group_advantages_std": 0.0,
    "interpreter_calls_mean": 0.0,
    "interpreter_calls_std": 0.0,
    "interrupts_mean": 0.0,
    "interrupts_std": 0.0,
    "intra_group_advantages_mean": 0.0,
    "intra_group_advantages_std": 0.0,
    "joint_success_mean": 1.0,
    "joint_success_std": 0.0,
    "late_stage_enrichments_mean": 0.0,
    "late_stage_enrichments_std": 0.0,
    "leave_one_out_updates_mean": 0.0,
    "leave_one_out_updates_std": 0.0,
    "local_verifier_calls_mean": 0.0,
    "local_verifier_calls_std": 0.0,
    "memories_retrieved_mean": 0.0,
    "memories_retrieved_std": 0.0,
    "memory_admissions_mean": 0.0,
    "memory_admissions_std": 0.0,
    "memory_bank_updates_mean": 0.0,
    "memory_bank_updates_std": 0.0,
    "memory_consolidations_mean": 0.0,
    "memory_consolidations_std": 0.0,
    "memory_operations_mean": 0.0,
    "memory_operations_std": 0.0,
    "memory_size_mean": 24.0,
    "memory_size_std": 0.0,
    "meta_gate_decisions_mean": 0.0,
    "meta_gate_decisions_std": 0.0,
    "meta_skill_updates_mean": 0.0,
    "meta_skill_updates_std": 0.0,
    "model_matches_mean": 0.0,
    "model_matches_std": 0.0,
    "multi_hop_retrievals_mean": 0.0,
    "multi_hop_retrievals_std": 0.0,
    "multi_turn_group_updates_mean": 0.0,
    "multi_turn_group_updates_std": 0.0,
    "observation_calibrations_mean": 0.0,
    "observation_calibrations_std": 0.0,
    "off_policy_reuses_mean": 0.0,
    "off_policy_reuses_std": 0.0,
    "outcome_rewards_mean": 0.0,
    "outcome_rewards_std": 0.0,
    "outer_policy_updates_mean": 120.0,
    "outer_policy_updates_std": 0.0,
    "page_ins_mean": 0.0,
    "page_ins_std": 0.0,
    "parallel_trajectory_groups_mean": 0.0,
    "parallel_trajectory_groups_std": 0.0,
    "parametric_routes_mean": 0.0,
    "parametric_routes_std": 0.0,
    "per_token_clips_mean": 0.0,
    "per_token_clips_std": 0.0,
    "pivotal_turns_mean": 0.0,
    "pivotal_turns_std": 0.0,
    "plan_explorations_mean": 0.0,
    "plan_explorations_std": 0.0,
    "plan_success_mean": 1.0,
    "plan_success_std": 0.0,
    "plans_created_mean": 0.0,
    "plans_created_std": 0.0,
    "policy_updates_mean": 0.0,
    "policy_updates_std": 0.0,
    "prefix_hits_mean": 0.0,
    "prefix_hits_std": 0.0,
    "private_rehearsals_mean": 0.0,
    "private_rehearsals_std": 0.0,
    "privileged_guidance_updates_mean": 0.0,
    "privileged_guidance_updates_std": 0.0,
    "procedural_graph_edges_mean": 0.0,
    "procedural_graph_edges_std": 0.0,
    "product_order_admissions_mean": 0.0,
    "product_order_admissions_std": 0.0,
    "profile_bottlenecks_mean": 0.0,
    "profile_bottlenecks_std": 0.0,
    "programs_generated_mean": 0.0,
    "programs_generated_std": 0.0,
    "progress_predictions_mean": 0.0,
    "progress_predictions_std": 0.0,
    "progressive_merges_mean": 0.0,
    "progressive_merges_std": 0.0,
    "real_tool_responses_mean": 0.0,
    "real_tool_responses_std": 0.0,
    "reasoning_rewards_mean": 0.0,
    "reasoning_rewards_std": 0.0,
    "reasoning_steps_mean": 0.0,
    "reasoning_steps_std": 0.0,
    "recursive_belief_updates_mean": 0.0,
    "recursive_belief_updates_std": 0.0,
    "redundant_calls_avoided_mean": 0.0,
    "redundant_calls_avoided_std": 0.0,
    "references_collected_mean": 0.0,
    "references_collected_std": 0.0,
    "refinements_mean": 0.0,
    "refinements_std": 0.0,
    "reflection_syntheses_mean": 0.0,
    "reflection_syntheses_std": 0.0,
    "reflections_mean": 0.0,
    "reflections_std": 0.0,
    "reflective_groups_mean": 0.0,
    "reflective_groups_std": 0.0,
    "regret_weighted_labels_mean": 0.0,
    "regret_weighted_labels_std": 0.0,
    "rejection_candidates_mean": 0.0,
    "rejection_candidates_std": 0.0,
    "reliability_reflections_mean": 0.0,
    "reliability_reflections_std": 0.0,
    "reopened_approaches_mean": 0.0,
    "reopened_approaches_std": 0.0,
    "replay_retrievals_mean": 0.0,
    "replay_retrievals_std": 0.0,
    "retrieved_tokens_masked_mean": 0.0,
    "retrieved_tokens_masked_std": 0.0,
    "reused_executable_states_mean": 0.0,
    "reused_executable_states_std": 0.0,
    "reused_plans_mean": 0.0,
    "reused_plans_std": 0.0,
    "rolewise_advantage_updates_mean": 0.0,
    "rolewise_advantage_updates_std": 0.0,
    "rollout_turns_saved_mean": 0.0,
    "rollout_turns_saved_std": 0.0,
    "router_calls_mean": 0.0,
    "router_calls_std": 0.0,
    "router_updates_mean": 0.0,
    "router_updates_std": 0.0,
    "routing_replays_mean": 0.0,
    "routing_replays_std": 0.0,
    "runtime_feedback_repairs_mean": 0.0,
    "runtime_feedback_repairs_std": 0.0,
    "scaffold_ablations_mean": 0.0,
    "scaffold_ablations_std": 0.0,
    "search_queries_mean": 0.0,
    "search_queries_std": 0.0,
    "search_rollouts_mean": 0.0,
    "search_rollouts_std": 0.0,
    "seed_mean": 43.0,
    "seed_std": 1.0,
    "shadow_executions_mean": 0.0,
    "shadow_executions_std": 0.0,
    "sharding_proposals_mean": 0.0,
    "sharding_proposals_std": 0.0,
    "simulated_dialogues_mean": 0.0,
    "simulated_dialogues_std": 0.0,
    "simulated_user_turns_mean": 0.0,
    "simulated_user_turns_std": 0.0,
    "skill_document_updates_mean": 0.0,
    "skill_document_updates_std": 0.0,
    "skill_evolutions_mean": 0.0,
    "skill_evolutions_std": 0.0,
    "skill_graph_edges_mean": 0.0,
    "skill_graph_edges_std": 0.0,
    "skill_graph_nodes_mean": 0.0,
    "skill_graph_nodes_std": 0.0,
    "skills_created_mean": 0.0,
    "skills_created_std": 0.0,
    "skills_reused_mean": 0.0,
    "skills_reused_std": 0.0,
    "solver_value_queries_mean": 0.0,
    "solver_value_queries_std": 0.0,
    "stale_rejections_mean": 0.0,
    "stale_rejections_std": 0.0,
    "state_snapshots_mean": 0.0,
    "state_snapshots_std": 0.0,
    "step_gae_updates_mean": 0.0,
    "step_gae_updates_std": 0.0,
    "step_sequence_ratios_mean": 0.0,
    "step_sequence_ratios_std": 0.0,
    "step_skill_retrievals_mean": 0.0,
    "step_skill_retrievals_std": 0.0,
    "step_value_queries_mean": 0.0,
    "step_value_queries_std": 0.0,
    "subplan_revisions_mean": 0.0,
    "subplan_revisions_std": 0.0,
    "success_failure_contrasts_mean": 0.0,
    "success_failure_contrasts_std": 0.0,
    "symbolic_expert_calls_mean": 0.0,
    "symbolic_expert_calls_std": 0.0,
    "task_completion_rewards_mean": 0.0,
    "task_completion_rewards_std": 0.0,
    "task_examples_retrieved_mean": 0.0,
    "task_examples_retrieved_std": 0.0,
    "task_library_updates_mean": 0.0,
    "task_library_updates_std": 0.0,
    "task_skill_retrievals_mean": 0.0,
    "task_skill_retrievals_std": 0.0,
    "textual_gradient_edits_mean": 0.0,
    "textual_gradient_edits_std": 0.0,
    "tito_tokens_mean": 0.0,
    "tito_tokens_std": 0.0,
    "tool_call_candidates_mean": 0.0,
    "tool_call_candidates_std": 0.0,
    "tool_calls_accepted_mean": 0.0,
    "tool_calls_accepted_std": 0.0,
    "tool_evictions_mean": 0.0,
    "tool_evictions_std": 0.0,
    "tool_exposure_reduction_mean": 0.0,
    "tool_exposure_reduction_std": 0.0,
    "tool_necessity_filters_mean": 0.0,
    "tool_necessity_filters_std": 0.0,
    "tools_available_mean": 0.0,
    "tools_available_std": 0.0,
    "tools_exposed_mean": 0.0,
    "tools_exposed_std": 0.0,
    "trajectory_filters_mean": 0.0,
    "trajectory_filters_std": 0.0,
    "trajectory_rollouts_mean": 0.0,
    "trajectory_rollouts_std": 0.0,
    "transition_accuracy_mean": 0.0,
    "transition_accuracy_std": 0.0,
    "transition_targets_mean": 0.0,
    "transition_targets_std": 0.0,
    "tree_nodes_expanded_mean": 0.0,
    "tree_nodes_expanded_std": 0.0,
    "turn_boundary_repairs_mean": 0.0,
    "turn_boundary_repairs_std": 0.0,
    "turn_credit_updates_mean": 0.0,
    "turn_credit_updates_std": 0.0,
    "unsafe_scalar_rejections_mean": 0.0,
    "unsafe_scalar_rejections_std": 0.0,
    "unsupported_answer_flags_mean": 0.0,
    "unsupported_answer_flags_std": 0.0,
    "validation_ratchet_accepts_mean": 0.0,
    "validation_ratchet_accepts_std": 0.0,
    "validation_ratchet_rejects_mean": 0.0,
    "validation_ratchet_rejects_std": 0.0,
    "verifiable_motives_mean": 0.0,
    "verifiable_motives_std": 0.0,
    "verification_retries_mean": 0.0,
    "verification_retries_std": 0.0,
    "versioned_edits_mean": 0.0,
    "versioned_edits_std": 0.0,
    "within_harness_groups_mean": 0.0,
    "within_harness_groups_std": 0.0,
    "worker_calls_mean": 0.0,
    "worker_calls_std": 0.0,
    "world_rehearsals_mean": 0.0,
    "world_rehearsals_std": 0.0
  },
  "manifest_ref": "agent-research:sciencebuddy",
  "evaluation_protocol": {
    "tier": "l1_mechanism",
    "seeds": [
      42,
      43,
      44
    ],
    "formal_comparison": false,
    "diagnostic_only": true,
    "claim_policy": "mechanism execution only; not a paper-scale capability result"
  },
  "provenance": {
    "commit": "working tree before commit",
    "command": "PYTHONPATH=src python scripts/generate_sep_16_2026_artifacts.py",
    "artifact_path": "docs/agent-research/2609.17523-sciencebuddy/metrics/mechanism-seeds42-44.json",
    "dataset_fingerprint": "deterministic-sep16-mechanism-mini-suite-v1"
  }
}
