{
  "schema_version": 2,
  "manifest_ref": "agent-research:agent-evolve:toolroute-l2.1-v1",
  "method": "agent-evolve",
  "benchmark": "toolroute-l2.1",
  "dataset": "toolroute-l2.1-v1",
  "seeds": [
    42,
    43,
    44
  ],
  "metrics": {
    "answer_accuracy": 0.8000000000000002,
    "answer_accuracy_std": 1.3597399555105182e-16,
    "plan_exact_match": 0.8000000000000002,
    "plan_exact_match_std": 1.3597399555105182e-16,
    "plan_step_f1": 0.8327307260640594,
    "plan_step_f1_std": 0.0009395476107850075,
    "joint_success": 0.8000000000000002,
    "joint_success_std": 1.3597399555105182e-16,
    "recovery_success_rate": 0.6666666666666666,
    "recovery_success_rate_std": 0.0,
    "invalid_tool_rate": 0.035644054235870325,
    "invalid_tool_rate_std": 0.00016195458446435212,
    "irreversible_error_rate": 0.0,
    "irreversible_error_rate_std": 0.0,
    "average_tool_calls": 5.611111111111111,
    "average_tool_calls_std": 0.025458753860866077,
    "average_cost": 4.966222222222222,
    "average_cost_std": 0.021922422142468423,
    "reuse_rate": 4.566666666666666,
    "reuse_rate_std": 0.028867513459481187,
    "recovery_rate": 0.6666666666666666,
    "recovery_rate_std": 0.0,
    "verification_rate": 0.0,
    "verification_rate_std": 0.0,
    "compression_rate": 0.0,
    "compression_rate_std": 0.0,
    "primary": 0.8137175560717079
  },
  "baseline_metrics": {
    "answer_accuracy": 0.35000000000000003,
    "answer_accuracy_std": 0.016666666666666663,
    "plan_exact_match": 0.35000000000000003,
    "plan_exact_match_std": 0.016666666666666663,
    "plan_step_f1": 0.5212301587301588,
    "plan_step_f1_std": 0.012826425681661901,
    "joint_success": 0.35000000000000003,
    "joint_success_std": 0.016666666666666663,
    "recovery_success_rate": 0.0,
    "recovery_success_rate_std": 0.0,
    "invalid_tool_rate": 0.053211908639440475,
    "invalid_tool_rate_std": 0.01516947708034028,
    "irreversible_error_rate": 0.07222222222222223,
    "irreversible_error_rate_std": 0.00962250448649376,
    "average_tool_calls": 3.1444444444444444,
    "average_tool_calls_std": 0.07876359377087677,
    "average_cost": 2.857111111111111,
    "average_cost_std": 0.0644785350444742,
    "reuse_rate": 0.0,
    "reuse_rate_std": 0.0,
    "recovery_rate": 0.0,
    "recovery_rate_std": 0.0,
    "verification_rate": 0.0,
    "verification_rate_std": 0.0,
    "compression_rate": 0.0,
    "compression_rate_std": 0.0,
    "primary": 0.33965960278684965
  },
  "diagnostics": {
    "fidelity": "held-out no-guide multi-generation capability evolution",
    "oracle_fields_exposed": false,
    "guide_endpoint": "absent",
    "generations": 3,
    "population": 9,
    "workers": 3,
    "episodes_per_split": 60,
    "trials": 28,
    "champion_id": "g2-t2",
    "champion_genome": {
      "architecture": "composable-agent",
      "dimensions": 64,
      "layers": 2,
      "learning_rate": 0.0003,
      "optimizer": "adamw",
      "batch_size": 48,
      "experts": 4,
      "interval_residual": 2,
      "auxiliary_weight": 0.15,
      "heads": 4,
      "kv_heads": 4,
      "sequence_length": 128,
      "expansion": 4,
      "data_recipe": "wikitext",
      "data_mix_ratio": 0.2,
      "post_training": "none",
      "neftune_alpha": 0.0,
      "post_steps": 0,
      "group_size": 4,
      "post_data_recipe": "base",
      "post_teacher": "auto",
      "post_rollout": "on-policy",
      "gradient_accumulation": 1,
      "mixed_precision": "no",
      "agent_memory": "evoharness-rl",
      "agent_planner": "pearl",
      "agent_tool_policy": "direct",
      "agent_critic": "none",
      "agent_policy": "heuristic",
      "agent_failure_recovery": "retry",
      "agent_reflection": "none",
      "agent_verifier": "none",
      "agent_context_compression": "full",
      "memory_size": 48,
      "genrec_context": "recent",
      "genrec_head": "id-catalog",
      "genrec_reward": "uniform",
      "genrec_distillation": "none",
      "multimodal_objective": "cross_entropy",
      "checkpoint_prompt_style": "direct",
      "checkpoint_use_hint": true,
      "checkpoint_image_size": 0,
      "checkpoint_max_new_tokens": 16,
      "reasoning_samples": 1,
      "reasoning_max_new_tokens": 96,
      "reasoning_stop_consensus": 1.0,
      "reasoning_verifier": "self-consistency"
    },
    "lineage": [
      {
        "trial_id": "g0-t0",
        "generation": 0,
        "parent_id": null,
        "source": "baseline",
        "source_papers": [],
        "rationale": "冻结的 agent 初始基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5433862433862434,
          "joint_success": 0.3444444444444444,
          "invalid_tool_rate": 0.05618802325514396,
          "average_cost": 2.559111111111111,
          "recovery_rate": 0.0,
          "fitness": 0.3419820442353321
        }
      },
      {
        "trial_id": "g1-t1",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2305.11738"
        ],
        "rationale": "论文算子单组件消融：critic:critic；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "critic",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5433862433862434,
          "joint_success": 0.3444444444444444,
          "invalid_tool_rate": 0.05618802325514396,
          "average_cost": 2.615777777777778,
          "recovery_rate": 0.0,
          "fitness": 0.3408487109019988
        }
      },
      {
        "trial_id": "g1-t2",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2304.03442"
        ],
        "rationale": "论文算子单组件消融：memory:generative-agents；其余组件保持基线",
        "components": {
          "memory": "generative-agents",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.6068783068783069,
          "joint_success": 0.43333333333333335,
          "invalid_tool_rate": 0.05116522022599371,
          "average_cost": 2.7600000000000002,
          "recovery_rate": 0.0,
          "fitness": 0.4337046419985646
        }
      },
      {
        "trial_id": "g1-t3",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2204.01691"
        ],
        "rationale": "论文算子单组件消融：planner:saycan；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "saycan",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7213043129709797,
          "joint_success": 0.6,
          "invalid_tool_rate": 0.05539590780978173,
          "average_cost": 3.813333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6069908405161197
        }
      },
      {
        "trial_id": "g1-t4",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2112.09332"
        ],
        "rationale": "论文算子单组件消融：tool:webgpt；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "webgpt",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5783068783068783,
          "joint_success": 0.3888888888888889,
          "invalid_tool_rate": 0.06536190066916324,
          "average_cost": 2.6862222222222223,
          "recovery_rate": 0.0,
          "fitness": 0.38645894220821597
        }
      },
      {
        "trial_id": "g1-t5",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.17651"
        ],
        "rationale": "论文算子单组件消融：critic:self-refine；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "self-refine",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5433862433862434,
          "joint_success": 0.3444444444444444,
          "invalid_tool_rate": 0.05618802325514396,
          "average_cost": 2.615777777777778,
          "recovery_rate": 0.0,
          "fitness": 0.3408487109019988
        }
      },
      {
        "trial_id": "g1-t6",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2508.03680"
        ],
        "rationale": "论文算子单组件消融：policy:agent-lightning；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "agent-lightning",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5433862433862434,
          "joint_success": 0.3444444444444444,
          "invalid_tool_rate": 0.05618802325514396,
          "average_cost": 2.559111111111111,
          "recovery_rate": 0.0,
          "fitness": 0.3419820442353321
        }
      },
      {
        "trial_id": "g1-t7",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.11366"
        ],
        "rationale": "论文算子单组件消融：recovery:reflexion；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "reflexion",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.736171236171236,
          "joint_success": 0.6777777777777777,
          "invalid_tool_rate": 0.03892166313713224,
          "average_cost": 3.7035555555555555,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7067649573034103
        }
      },
      {
        "trial_id": "g1-t8",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "whitelisted-combination",
        "source_papers": [],
        "rationale": "论文算子单组件消融：reflection:reflexion；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.5433862433862434,
          "joint_success": 0.3444444444444444,
          "invalid_tool_rate": 0.05618802325514396,
          "average_cost": 2.615777777777778,
          "recovery_rate": 0.0,
          "fitness": 0.3408487109019988
        }
      },
      {
        "trial_id": "g1-t9",
        "generation": 1,
        "parent_id": "g0-t0",
        "source": "whitelisted-combination",
        "source_papers": [],
        "rationale": "论文算子单组件消融：verifier:public-evidence；其余组件保持基线",
        "components": {
          "memory": "none",
          "planner": "long-context",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "public-evidence",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.6132756132756132,
          "joint_success": 0.3888888888888889,
          "invalid_tool_rate": 0.07885935173094073,
          "average_cost": 3.270222222222222,
          "recovery_rate": 0.0,
          "fitness": 0.37692607059891176
        }
      },
      {
        "trial_id": "g2-t1",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.09014",
          "2608.04843",
          "2608.16156"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memorycpt",
          "planner": "art",
          "tool": "direct",
          "critic": "trca",
          "policy": "pairwise-policy",
          "recovery": "retry",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.8312850729517396,
          "joint_success": 0.8055555555555557,
          "invalid_tool_rate": 0.04074821199339813,
          "average_cost": 4.376111111111111,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.8304203527625009
        }
      },
      {
        "trial_id": "g2-t2",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2601.20439",
          "2608.05446"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "evoharness-rl",
          "planner": "pearl",
          "tool": "direct",
          "critic": "none",
          "policy": "heuristic",
          "recovery": "retry",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.8312850729517396,
          "joint_success": 0.8055555555555557,
          "invalid_tool_rate": 0.04074821199339813,
          "average_cost": 4.34,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.8311425749847232
        }
      },
      {
        "trial_id": "g2-t3",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2310.08560",
          "2504.20073",
          "2606.26859",
          "2608.02650"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memgpt",
          "planner": "agentx",
          "tool": "hyperagent",
          "critic": "ragen",
          "policy": "heuristic",
          "recovery": "retry",
          "reflection": "reflexion",
          "verifier": "public-evidence",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.8022486772486772,
          "joint_success": 0.7722222222222223,
          "invalid_tool_rate": 0.05136097531534794,
          "average_cost": 4.130111111111112,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7980421035266663
        }
      },
      {
        "trial_id": "g2-t4",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2112.09332",
          "2305.11738",
          "2310.08560",
          "2405.15793",
          "2508.03680"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memgpt",
          "planner": "swe-agent",
          "tool": "webgpt",
          "critic": "critic",
          "policy": "agent-lightning",
          "recovery": "none",
          "reflection": "reflexion",
          "verifier": "public-evidence",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.702873977873978,
          "joint_success": 0.6055555555555555,
          "invalid_tool_rate": 0.05939217773410846,
          "average_cost": 3.5863333333333336,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6148437355695424
        }
      },
      {
        "trial_id": "g2-t5",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2305.11738",
          "2508.03680",
          "2606.26859",
          "2607.27083",
          "2608.06153"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "gse",
          "planner": "agentx",
          "tool": "cam-df",
          "critic": "critic",
          "policy": "agent-lightning",
          "recovery": "none",
          "reflection": "reflexion",
          "verifier": "public-evidence",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.8572222222222226,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6469417545120356
        }
      },
      {
        "trial_id": "g2-t6",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2302.04761",
          "2305.11738",
          "2308.00352"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "none",
          "planner": "metagpt",
          "tool": "toolformer",
          "critic": "critic",
          "policy": "replay-policy",
          "recovery": "none",
          "reflection": "reflexion",
          "verifier": "public-evidence",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.6718494468494468,
          "joint_success": 0.5555555555555555,
          "invalid_tool_rate": 0.05364057909454532,
          "average_cost": 3.4293333333333336,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.5654564423310457
        }
      },
      {
        "trial_id": "g2-t7",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2305.16291",
          "2407.16741",
          "2502.01600",
          "2503.09516"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "voyager",
          "planner": "openhands",
          "tool": "search-r1",
          "critic": "loop",
          "policy": "pairwise-policy",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.832333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6474395322898134
        }
      },
      {
        "trial_id": "g2-t8",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2308.08155",
          "2607.26784",
          "2608.03468",
          "2608.16156",
          "2608.19842"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "skillrise",
          "planner": "autogen",
          "tool": "toollift",
          "critic": "trca",
          "policy": "sapo",
          "recovery": "retry",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.8312850729517396,
          "joint_success": 0.8055555555555557,
          "invalid_tool_rate": 0.04074821199339813,
          "average_cost": 4.376111111111111,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.8304203527625009
        }
      },
      {
        "trial_id": "g2-t9",
        "generation": 2,
        "parent_id": "g1-t7",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2405.15793",
          "2504.20073",
          "2507.21428",
          "2608.05810"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "vag",
          "planner": "swe-agent",
          "tool": "memtool",
          "critic": "ragen",
          "policy": "heuristic",
          "recovery": "retry",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.8022486772486772,
          "joint_success": 0.7722222222222223,
          "invalid_tool_rate": 0.05136097531534794,
          "average_cost": 4.093666666666667,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7987709924155552
        }
      },
      {
        "trial_id": "g3-t1",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2205.00445",
          "2504.20073",
          "2606.26859",
          "2608.15703"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "hymem",
          "planner": "agentx",
          "tool": "mrkl",
          "critic": "ragen",
          "policy": "replay-policy",
          "recovery": "retry",
          "reflection": "reflexion",
          "verifier": "public-evidence",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.8022486772486772,
          "joint_success": 0.7722222222222223,
          "invalid_tool_rate": 0.05136097531534794,
          "average_cost": 4.130111111111112,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7980421035266663
        }
      },
      {
        "trial_id": "g3-t2",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.17580",
          "2310.08560",
          "2607.27083",
          "2608.06301"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memgpt",
          "planner": "hugginggpt",
          "tool": "cam-df",
          "critic": "harnessopt-bench",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.832333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6474395322898134
        }
      },
      {
        "trial_id": "g3-t3",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2210.03629",
          "2303.11366",
          "2507.21428",
          "2608.05446",
          "2608.04788",
          "2608.19842"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "evoharness-rl",
          "planner": "react",
          "tool": "memtool",
          "critic": "ocsd",
          "policy": "sapo",
          "recovery": "reflexion",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.8312850729517396,
          "joint_success": 0.8055555555555557,
          "invalid_tool_rate": 0.04074821199339813,
          "average_cost": 4.376111111111111,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.8304203527625009
        }
      },
      {
        "trial_id": "g3-t4",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2112.09332",
          "2405.15793",
          "2504.20073",
          "2508.03680",
          "2608.05810"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "vag",
          "planner": "swe-agent",
          "tool": "webgpt",
          "critic": "ragen",
          "policy": "agent-lightning",
          "recovery": "retry",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.8022486772486772,
          "joint_success": 0.7722222222222223,
          "invalid_tool_rate": 0.05136097531534794,
          "average_cost": 4.093666666666667,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7987709924155552
        }
      },
      {
        "trial_id": "g3-t5",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.09014",
          "2504.20073",
          "2608.03137",
          "2608.03468",
          "2608.11967",
          "2608.19842"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "vermem",
          "planner": "art",
          "tool": "toollift",
          "critic": "ragen",
          "policy": "sapo",
          "recovery": "loongreflect",
          "reflection": "none",
          "verifier": "none",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.702873977873978,
          "joint_success": 0.6055555555555555,
          "invalid_tool_rate": 0.05939217773410846,
          "average_cost": 3.5498888888888893,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6155726244584313
        }
      },
      {
        "trial_id": "g3-t6",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.11366",
          "2608.03137",
          "2608.04934",
          "2608.06197"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "vermem",
          "planner": "state2state",
          "tool": "direct",
          "critic": "envace",
          "policy": "pairwise-policy",
          "recovery": "reflexion",
          "reflection": "none",
          "verifier": "none",
          "context": "compressed"
        },
        "validation": {
          "plan_step_f1": 0.8022486772486772,
          "joint_success": 0.7722222222222223,
          "invalid_tool_rate": 0.05136097531534794,
          "average_cost": 4.093666666666667,
          "recovery_rate": 0.6666666666666666,
          "fitness": 0.7987709924155552
        }
      },
      {
        "trial_id": "g3-t7",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2204.01691",
          "2211.10435",
          "2310.08560",
          "2608.06197"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memgpt",
          "planner": "saycan",
          "tool": "pal",
          "critic": "envace",
          "policy": "heuristic",
          "recovery": "none",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.832333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6474395322898134
        }
      },
      {
        "trial_id": "g3-t8",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2303.17651",
          "2607.27083",
          "2607.28527",
          "2608.04843",
          "2608.11967"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "memorycpt",
          "planner": "manta",
          "tool": "cam-df",
          "critic": "self-refine",
          "policy": "pairwise-policy",
          "recovery": "loongreflect",
          "reflection": "reflexion",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.832333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6474395322898134
        }
      },
      {
        "trial_id": "g3-t9",
        "generation": 3,
        "parent_id": "g2-t2",
        "source": "implemented-paper-operator",
        "source_papers": [
          "2407.16741",
          "2508.03680",
          "2508.18669",
          "2607.26784",
          "2608.06128"
        ],
        "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
        "components": {
          "memory": "skillrise",
          "planner": "openhands",
          "tool": "mua-rl",
          "critic": "cipo",
          "policy": "agent-lightning",
          "recovery": "none",
          "reflection": "none",
          "verifier": "none",
          "context": "full"
        },
        "validation": {
          "plan_step_f1": 0.7319103735770401,
          "joint_success": 0.6388888888888888,
          "invalid_tool_rate": 0.04660393956779499,
          "average_cost": 3.832333333333334,
          "recovery_rate": 0.3333333333333333,
          "fitness": 0.6474395322898134
        }
      }
    ],
    "rounds": [
      {
        "generation": 1,
        "parent": "g0-t0",
        "hypotheses": [
          {
            "trial_id": "g1-t1",
            "rationale": "论文算子单组件消融：critic:critic；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t2",
            "rationale": "论文算子单组件消融：memory:generative-agents；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t3",
            "rationale": "论文算子单组件消融：planner:saycan；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t4",
            "rationale": "论文算子单组件消融：tool:webgpt；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t5",
            "rationale": "论文算子单组件消融：critic:self-refine；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t6",
            "rationale": "论文算子单组件消融：policy:agent-lightning；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t7",
            "rationale": "论文算子单组件消融：recovery:reflexion；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t8",
            "rationale": "论文算子单组件消融：reflection:reflexion；其余组件保持基线",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g1-t9",
            "rationale": "论文算子单组件消融：verifier:public-evidence；其余组件保持基线",
            "architecture": "composable-agent"
          }
        ],
        "observations": [
          {
            "trial_id": "g1-t7",
            "fitness": 0.7067649573034103,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6777777777777777,
              "answer_accuracy_std": 0.025458753860865747,
              "plan_exact_match": 0.6777777777777777,
              "plan_exact_match_std": 0.025458753860865747,
              "plan_step_f1": 0.736171236171236,
              "plan_step_f1_std": 0.019290713037763717,
              "joint_success": 0.6777777777777777,
              "joint_success_std": 0.025458753860865747,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.03892166313713224,
              "invalid_tool_rate_std": 0.011752057540989845,
              "irreversible_error_rate": 0.08888888888888889,
              "irreversible_error_rate_std": 0.00962250448649377,
              "average_tool_calls": 4.022222222222222,
              "average_tool_calls_std": 0.12729376930432906,
              "average_cost": 3.7035555555555555,
              "average_cost_std": 0.10569628046295512,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.7067649573034103,
              "primary_std": 0.02644733341394056,
              "fitness": 0.7067649573034103,
              "fitness_std": 0.02644733341394056
            }
          },
          {
            "trial_id": "g1-t3",
            "fitness": 0.6069908405161197,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6,
              "answer_accuracy_std": 0.016666666666666663,
              "plan_exact_match": 0.6,
              "plan_exact_match_std": 0.016666666666666663,
              "plan_step_f1": 0.7213043129709797,
              "plan_step_f1_std": 0.004177866860251781,
              "joint_success": 0.6,
              "joint_success_std": 0.016666666666666663,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05539590780978173,
              "invalid_tool_rate_std": 0.003633126785934547,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.211111111111111,
              "average_tool_calls_std": 0.03469443332443542,
              "average_cost": 3.813333333333334,
              "average_cost_std": 0.03301178240837333,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6069908405161197,
              "primary_std": 0.017922954957502336,
              "fitness": 0.6069908405161197,
              "fitness_std": 0.017922954957502336
            }
          },
          {
            "trial_id": "g1-t2",
            "fitness": 0.4337046419985646,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.43333333333333335,
              "answer_accuracy_std": 0.016666666666666663,
              "plan_exact_match": 0.43333333333333335,
              "plan_exact_match_std": 0.016666666666666663,
              "plan_step_f1": 0.6068783068783069,
              "plan_step_f1_std": 0.010775350187521873,
              "joint_success": 0.43333333333333335,
              "joint_success_std": 0.016666666666666663,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05116522022599371,
              "invalid_tool_rate_std": 0.014103470164672859,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 3.0444444444444443,
              "average_tool_calls_std": 0.03469443332443567,
              "average_cost": 2.7600000000000002,
              "average_cost_std": 0.03075350025245559,
              "reuse_rate": 2.75,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.4337046419985646,
              "primary_std": 0.01869442706936344,
              "fitness": 0.4337046419985646,
              "fitness_std": 0.01869442706936344
            }
          },
          {
            "trial_id": "g1-t4",
            "fitness": 0.38645894220821597,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3888888888888889,
              "answer_accuracy_std": 0.019245008972987553,
              "plan_exact_match": 0.3888888888888889,
              "plan_exact_match_std": 0.019245008972987553,
              "plan_step_f1": 0.5783068783068783,
              "plan_step_f1_std": 0.013569649315589603,
              "joint_success": 0.3888888888888889,
              "joint_success_std": 0.019245008972987553,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.06536190066916324,
              "invalid_tool_rate_std": 0.00922321629016469,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 2.977777777777778,
              "average_tool_calls_std": 0.05853140973807079,
              "average_cost": 2.6862222222222223,
              "average_cost_std": 0.0582154364154132,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.38645894220821597,
              "primary_std": 0.02033389140132491,
              "fitness": 0.38645894220821597,
              "fitness_std": 0.02033389140132491
            }
          },
          {
            "trial_id": "g1-t9",
            "fitness": 0.37692607059891176,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3888888888888889,
              "answer_accuracy_std": 0.019245008972987553,
              "plan_exact_match": 0.3888888888888889,
              "plan_exact_match_std": 0.019245008972987553,
              "plan_step_f1": 0.6132756132756132,
              "plan_step_f1_std": 0.007185659106207503,
              "joint_success": 0.3888888888888889,
              "joint_success_std": 0.019245008972987553,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.07885935173094073,
              "invalid_tool_rate_std": 0.0052853663776035115,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 3.522222222222222,
              "average_tool_calls_std": 0.03469443332443542,
              "average_cost": 3.270222222222222,
              "average_cost_std": 0.02572792113494473,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 1.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.37692607059891176,
              "primary_std": 0.020596868503928372,
              "fitness": 0.37692607059891176,
              "fitness_std": 0.020596868503928372
            }
          },
          {
            "trial_id": "g1-t6",
            "fitness": 0.3419820442353321,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3444444444444444,
              "answer_accuracy_std": 0.02545875386086577,
              "plan_exact_match": 0.3444444444444444,
              "plan_exact_match_std": 0.02545875386086577,
              "plan_step_f1": 0.5433862433862434,
              "plan_step_f1_std": 0.016823400101147763,
              "joint_success": 0.3444444444444444,
              "joint_success_std": 0.02545875386086577,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05618802325514396,
              "invalid_tool_rate_std": 0.01608795442206165,
              "irreversible_error_rate": 0.08888888888888889,
              "irreversible_error_rate_std": 0.00962250448649377,
              "average_tool_calls": 2.777777777777778,
              "average_tool_calls_std": 0.05091750772173162,
              "average_cost": 2.559111111111111,
              "average_cost_std": 0.0439410379351104,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.3419820442353321,
              "primary_std": 0.027931755879012723,
              "fitness": 0.3419820442353321,
              "fitness_std": 0.027931755879012723
            }
          },
          {
            "trial_id": "g1-t1",
            "fitness": 0.3408487109019988,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3444444444444444,
              "answer_accuracy_std": 0.02545875386086577,
              "plan_exact_match": 0.3444444444444444,
              "plan_exact_match_std": 0.02545875386086577,
              "plan_step_f1": 0.5433862433862434,
              "plan_step_f1_std": 0.016823400101147763,
              "joint_success": 0.3444444444444444,
              "joint_success_std": 0.02545875386086577,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05618802325514396,
              "invalid_tool_rate_std": 0.01608795442206165,
              "irreversible_error_rate": 0.08888888888888889,
              "irreversible_error_rate_std": 0.00962250448649377,
              "average_tool_calls": 2.777777777777778,
              "average_tool_calls_std": 0.05091750772173162,
              "average_cost": 2.615777777777778,
              "average_cost_std": 0.04231145541409875,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.3408487109019988,
              "primary_std": 0.027964462976738536,
              "fitness": 0.3408487109019988,
              "fitness_std": 0.027964462976738536
            }
          },
          {
            "trial_id": "g1-t5",
            "fitness": 0.3408487109019988,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3444444444444444,
              "answer_accuracy_std": 0.02545875386086577,
              "plan_exact_match": 0.3444444444444444,
              "plan_exact_match_std": 0.02545875386086577,
              "plan_step_f1": 0.5433862433862434,
              "plan_step_f1_std": 0.016823400101147763,
              "joint_success": 0.3444444444444444,
              "joint_success_std": 0.02545875386086577,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05618802325514396,
              "invalid_tool_rate_std": 0.01608795442206165,
              "irreversible_error_rate": 0.08888888888888889,
              "irreversible_error_rate_std": 0.00962250448649377,
              "average_tool_calls": 2.777777777777778,
              "average_tool_calls_std": 0.05091750772173162,
              "average_cost": 2.615777777777778,
              "average_cost_std": 0.04231145541409875,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.3408487109019988,
              "primary_std": 0.027964462976738536,
              "fitness": 0.3408487109019988,
              "fitness_std": 0.027964462976738536
            }
          },
          {
            "trial_id": "g1-t8",
            "fitness": 0.3408487109019988,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.3444444444444444,
              "answer_accuracy_std": 0.02545875386086577,
              "plan_exact_match": 0.3444444444444444,
              "plan_exact_match_std": 0.02545875386086577,
              "plan_step_f1": 0.5433862433862434,
              "plan_step_f1_std": 0.016823400101147763,
              "joint_success": 0.3444444444444444,
              "joint_success_std": 0.02545875386086577,
              "recovery_success_rate": 0.0,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05618802325514396,
              "invalid_tool_rate_std": 0.01608795442206165,
              "irreversible_error_rate": 0.08888888888888889,
              "irreversible_error_rate_std": 0.00962250448649377,
              "average_tool_calls": 2.777777777777778,
              "average_tool_calls_std": 0.05091750772173162,
              "average_cost": 2.615777777777778,
              "average_cost_std": 0.04231145541409875,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.0,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.3408487109019988,
              "primary_std": 0.027964462976738536,
              "fitness": 0.3408487109019988,
              "fitness_std": 0.027964462976738536
            }
          }
        ],
        "decision": "下一轮围绕 g1-t7 / composable-agent 继续搜索",
        "improved": true
      },
      {
        "generation": 2,
        "parent": "g1-t7",
        "hypotheses": [
          {
            "trial_id": "g2-t1",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t2",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t3",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t4",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t5",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t6",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t7",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t8",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g2-t9",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          }
        ],
        "observations": [
          {
            "trial_id": "g2-t2",
            "fitness": 0.8311425749847232,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.8055555555555557,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.8055555555555557,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8312850729517396,
              "plan_step_f1_std": 0.004021581554604451,
              "joint_success": 0.8055555555555557,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04074821199339813,
              "invalid_tool_rate_std": 0.0021015026371944694,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.772222222222222,
              "average_tool_calls_std": 0.01924500897298746,
              "average_cost": 4.34,
              "average_cost_std": 0.01571976816340224,
              "reuse_rate": 3.8555555555555556,
              "reuse_rate_std": 0.05091750772173162,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.8311425749847232,
              "primary_std": 0.010138101052552894,
              "fitness": 0.8311425749847232,
              "fitness_std": 0.010138101052552894
            }
          },
          {
            "trial_id": "g2-t1",
            "fitness": 0.8304203527625009,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.8055555555555557,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.8055555555555557,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8312850729517396,
              "plan_step_f1_std": 0.004021581554604451,
              "joint_success": 0.8055555555555557,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04074821199339813,
              "invalid_tool_rate_std": 0.0021015026371944694,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.772222222222222,
              "average_tool_calls_std": 0.01924500897298746,
              "average_cost": 4.376111111111111,
              "average_cost_std": 0.015536098943118666,
              "reuse_rate": 3.8555555555555556,
              "reuse_rate_std": 0.05091750772173162,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.8304203527625009,
              "primary_std": 0.010157344105173289,
              "fitness": 0.8304203527625009,
              "fitness_std": 0.010157344105173289
            }
          },
          {
            "trial_id": "g2-t8",
            "fitness": 0.8304203527625009,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.8055555555555557,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.8055555555555557,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8312850729517396,
              "plan_step_f1_std": 0.004021581554604451,
              "joint_success": 0.8055555555555557,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04074821199339813,
              "invalid_tool_rate_std": 0.0021015026371944694,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.772222222222222,
              "average_tool_calls_std": 0.01924500897298746,
              "average_cost": 4.376111111111111,
              "average_cost_std": 0.015536098943118666,
              "reuse_rate": 3.8555555555555556,
              "reuse_rate_std": 0.05091750772173162,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.8304203527625009,
              "primary_std": 0.010157344105173289,
              "fitness": 0.8304203527625009,
              "fitness_std": 0.010157344105173289
            }
          },
          {
            "trial_id": "g2-t9",
            "fitness": 0.7987709924155552,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.7722222222222223,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.7722222222222223,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8022486772486772,
              "plan_step_f1_std": 0.004624226934468002,
              "joint_success": 0.7722222222222223,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05136097531534794,
              "invalid_tool_rate_std": 0.0032406044441206584,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.438888888888889,
              "average_tool_calls_std": 0.09622504486493728,
              "average_cost": 4.093666666666667,
              "average_cost_std": 0.08025445643562573,
              "reuse_rate": 3.616666666666667,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.7987709924155552,
              "primary_std": 0.008721199253301231,
              "fitness": 0.7987709924155552,
              "fitness_std": 0.008721199253301231
            }
          },
          {
            "trial_id": "g2-t3",
            "fitness": 0.7980421035266663,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.7722222222222223,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.7722222222222223,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8022486772486772,
              "plan_step_f1_std": 0.004624226934468002,
              "joint_success": 0.7722222222222223,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05136097531534794,
              "invalid_tool_rate_std": 0.0032406044441206584,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.438888888888889,
              "average_tool_calls_std": 0.09622504486493728,
              "average_cost": 4.130111111111112,
              "average_cost_std": 0.07412027263046739,
              "reuse_rate": 3.616666666666667,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.45555555555555555,
              "verification_rate_std": 0.07698003589195011,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.7980421035266663,
              "primary_std": 0.00884435234581903,
              "fitness": 0.7980421035266663,
              "fitness_std": 0.00884435234581903
            }
          },
          {
            "trial_id": "g2-t7",
            "fitness": 0.6474395322898134,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.832333333333334,
              "average_cost_std": 0.025208023414072776,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6474395322898134,
              "primary_std": 0.01023355421816295,
              "fitness": 0.6474395322898134,
              "fitness_std": 0.01023355421816295
            }
          },
          {
            "trial_id": "g2-t5",
            "fitness": 0.6469417545120356,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.8572222222222226,
              "average_cost_std": 0.018608042864827683,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.3111111111111111,
              "verification_rate_std": 0.10715167512214395,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6469417545120356,
              "primary_std": 0.010291230318944949,
              "fitness": 0.6469417545120356,
              "fitness_std": 0.010291230318944949
            }
          },
          {
            "trial_id": "g2-t4",
            "fitness": 0.6148437355695424,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6055555555555555,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6055555555555555,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.702873977873978,
              "plan_step_f1_std": 0.006204000184607034,
              "joint_success": 0.6055555555555555,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05939217773410846,
              "invalid_tool_rate_std": 0.0037911604930860863,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 3.838888888888889,
              "average_tool_calls_std": 0.09179284245476826,
              "average_cost": 3.5863333333333336,
              "average_cost_std": 0.08101508775804939,
              "reuse_rate": 3.1833333333333336,
              "reuse_rate_std": 0.0763762615825973,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.45555555555555555,
              "verification_rate_std": 0.07698003589195011,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.6148437355695424,
              "primary_std": 0.008953803795466595,
              "fitness": 0.6148437355695424,
              "fitness_std": 0.008953803795466595
            }
          },
          {
            "trial_id": "g2-t6",
            "fitness": 0.5654564423310457,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.5555555555555555,
              "answer_accuracy_std": 0.01924500897298752,
              "plan_exact_match": 0.5555555555555555,
              "plan_exact_match_std": 0.01924500897298752,
              "plan_step_f1": 0.6718494468494468,
              "plan_step_f1_std": 0.012597680893695276,
              "joint_success": 0.5555555555555555,
              "joint_success_std": 0.01924500897298752,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05364057909454532,
              "invalid_tool_rate_std": 0.00746866822253627,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 3.6277777777777778,
              "average_tool_calls_std": 0.03849001794597492,
              "average_cost": 3.4293333333333336,
              "average_cost_std": 0.03716629297271031,
              "reuse_rate": 0.0,
              "reuse_rate_std": 0.0,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 1.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.5,
              "compression_rate_std": 0.0,
              "primary": 0.5654564423310457,
              "primary_std": 0.020380970106831386,
              "fitness": 0.5654564423310457,
              "fitness_std": 0.020380970106831386
            }
          }
        ],
        "decision": "下一轮围绕 g2-t2 / composable-agent 继续搜索",
        "improved": true
      },
      {
        "generation": 3,
        "parent": "g2-t2",
        "hypotheses": [
          {
            "trial_id": "g3-t1",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t2",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t3",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t4",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t5",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t6",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t7",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t8",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          },
          {
            "trial_id": "g3-t9",
            "rationale": "论文检索约束下的 Agent 组合 genome：搜索 memory / planner / tool / critic / policy / recovery / reflection / verifier / context / capacity",
            "architecture": "composable-agent"
          }
        ],
        "observations": [
          {
            "trial_id": "g3-t3",
            "fitness": 0.8304203527625009,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.8055555555555557,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.8055555555555557,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8312850729517396,
              "plan_step_f1_std": 0.004021581554604451,
              "joint_success": 0.8055555555555557,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04074821199339813,
              "invalid_tool_rate_std": 0.0021015026371944694,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.772222222222222,
              "average_tool_calls_std": 0.01924500897298746,
              "average_cost": 4.376111111111111,
              "average_cost_std": 0.015536098943118666,
              "reuse_rate": 3.8555555555555556,
              "reuse_rate_std": 0.05091750772173162,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.8304203527625009,
              "primary_std": 0.010157344105173289,
              "fitness": 0.8304203527625009,
              "fitness_std": 0.010157344105173289
            }
          },
          {
            "trial_id": "g3-t4",
            "fitness": 0.7987709924155552,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.7722222222222223,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.7722222222222223,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8022486772486772,
              "plan_step_f1_std": 0.004624226934468002,
              "joint_success": 0.7722222222222223,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05136097531534794,
              "invalid_tool_rate_std": 0.0032406044441206584,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.438888888888889,
              "average_tool_calls_std": 0.09622504486493728,
              "average_cost": 4.093666666666667,
              "average_cost_std": 0.08025445643562573,
              "reuse_rate": 3.616666666666667,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.7987709924155552,
              "primary_std": 0.008721199253301231,
              "fitness": 0.7987709924155552,
              "fitness_std": 0.008721199253301231
            }
          },
          {
            "trial_id": "g3-t6",
            "fitness": 0.7987709924155552,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.7722222222222223,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.7722222222222223,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8022486772486772,
              "plan_step_f1_std": 0.004624226934468002,
              "joint_success": 0.7722222222222223,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05136097531534794,
              "invalid_tool_rate_std": 0.0032406044441206584,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.438888888888889,
              "average_tool_calls_std": 0.09622504486493728,
              "average_cost": 4.093666666666667,
              "average_cost_std": 0.08025445643562573,
              "reuse_rate": 3.616666666666667,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.7987709924155552,
              "primary_std": 0.008721199253301231,
              "fitness": 0.7987709924155552,
              "fitness_std": 0.008721199253301231
            }
          },
          {
            "trial_id": "g3-t1",
            "fitness": 0.7980421035266663,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.7722222222222223,
              "answer_accuracy_std": 0.00962250448649373,
              "plan_exact_match": 0.7722222222222223,
              "plan_exact_match_std": 0.00962250448649373,
              "plan_step_f1": 0.8022486772486772,
              "plan_step_f1_std": 0.004624226934468002,
              "joint_success": 0.7722222222222223,
              "joint_success_std": 0.00962250448649373,
              "recovery_success_rate": 0.6666666666666666,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05136097531534794,
              "invalid_tool_rate_std": 0.0032406044441206584,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.438888888888889,
              "average_tool_calls_std": 0.09622504486493728,
              "average_cost": 4.130111111111112,
              "average_cost_std": 0.07412027263046739,
              "reuse_rate": 3.616666666666667,
              "reuse_rate_std": 0.07264831572567788,
              "recovery_rate": 0.6666666666666666,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.45555555555555555,
              "verification_rate_std": 0.07698003589195011,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.7980421035266663,
              "primary_std": 0.00884435234581903,
              "fitness": 0.7980421035266663,
              "fitness_std": 0.00884435234581903
            }
          },
          {
            "trial_id": "g3-t2",
            "fitness": 0.6474395322898134,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.832333333333334,
              "average_cost_std": 0.025208023414072776,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6474395322898134,
              "primary_std": 0.01023355421816295,
              "fitness": 0.6474395322898134,
              "fitness_std": 0.01023355421816295
            }
          },
          {
            "trial_id": "g3-t7",
            "fitness": 0.6474395322898134,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.832333333333334,
              "average_cost_std": 0.025208023414072776,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6474395322898134,
              "primary_std": 0.01023355421816295,
              "fitness": 0.6474395322898134,
              "fitness_std": 0.01023355421816295
            }
          },
          {
            "trial_id": "g3-t8",
            "fitness": 0.6474395322898134,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.832333333333334,
              "average_cost_std": 0.025208023414072776,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6474395322898134,
              "primary_std": 0.01023355421816295,
              "fitness": 0.6474395322898134,
              "fitness_std": 0.01023355421816295
            }
          },
          {
            "trial_id": "g3-t9",
            "fitness": 0.6474395322898134,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6388888888888888,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6388888888888888,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.7319103735770401,
              "plan_step_f1_std": 0.003076560805742859,
              "joint_success": 0.6388888888888888,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.04660393956779499,
              "invalid_tool_rate_std": 0.002273250010052192,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 4.172222222222223,
              "average_tool_calls_std": 0.02545875386086569,
              "average_cost": 3.832333333333334,
              "average_cost_std": 0.025208023414072776,
              "reuse_rate": 3.422222222222222,
              "reuse_rate_std": 0.07876359377087677,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.0,
              "compression_rate_std": 0.0,
              "primary": 0.6474395322898134,
              "primary_std": 0.01023355421816295,
              "fitness": 0.6474395322898134,
              "fitness_std": 0.01023355421816295
            }
          },
          {
            "trial_id": "g3-t5",
            "fitness": 0.6155726244584313,
            "status": "completed",
            "validation": {
              "answer_accuracy": 0.6055555555555555,
              "answer_accuracy_std": 0.009622504486493794,
              "plan_exact_match": 0.6055555555555555,
              "plan_exact_match_std": 0.009622504486493794,
              "plan_step_f1": 0.702873977873978,
              "plan_step_f1_std": 0.006204000184607034,
              "joint_success": 0.6055555555555555,
              "joint_success_std": 0.009622504486493794,
              "recovery_success_rate": 0.3333333333333333,
              "recovery_success_rate_std": 0.0,
              "invalid_tool_rate": 0.05939217773410846,
              "invalid_tool_rate_std": 0.0037911604930860863,
              "irreversible_error_rate": 0.0,
              "irreversible_error_rate_std": 0.0,
              "average_tool_calls": 3.838888888888889,
              "average_tool_calls_std": 0.09179284245476826,
              "average_cost": 3.5498888888888893,
              "average_cost_std": 0.08611383508236412,
              "reuse_rate": 3.1833333333333336,
              "reuse_rate_std": 0.0763762615825973,
              "recovery_rate": 0.3333333333333333,
              "recovery_rate_std": 0.0,
              "verification_rate": 0.0,
              "verification_rate_std": 0.0,
              "compression_rate": 0.22777777777777777,
              "compression_rate_std": 0.03849001794597506,
              "primary": 0.6155726244584313,
              "primary_std": 0.008830712006787485,
              "fitness": 0.6155726244584313,
              "fitness_std": 0.008830712006787485
            }
          }
        ],
        "decision": "下一轮围绕 g2-t2 / composable-agent 继续搜索",
        "improved": false
      }
    ]
  },
  "evaluation_protocol": {
    "tier": "l2_capability",
    "seeds": [
      42,
      43,
      44
    ],
    "formal_comparison": true,
    "claim_policy": "validation selects the champion; isolated test runs once after all generations"
  },
  "provenance": {
    "artifact_path": "docs/agent-research/metrics/toolroute-l21-evolve-seeds42-44.json",
    "dataset_fingerprint": "toolroute-l2.1 deterministic generator",
    "original_code_commit": "generated from repository source"
  }
}
