ProgRouter:在线进展驱动的多 Agent 路由¶
复现级别:核心机制 mini-suite。 真实执行论文特有的控制流/目标;未把确定性任务成功率当作论文 benchmark 复现。
论文信息¶
| 字段 | 内容 |
|---|---|
| 论文链接 | arXiv 2608.25992 |
| 公司 / 机构 | Aston University(第一作者第一署名单位) |
| 首次公开日期 | 2026-08-26(arXiv v1) |
| 原作者代码 | 否:未发现原作者公开代码(核查日期:2026-08-28) |
| 本地 adapter / 方法 | progrouter |
| 本地复现代码 | src/auto_research/agent_research/latest_20260827.py |
原始论文总结¶
背景与主要改动¶
用多视角 scorer 衡量子任务完成度、进展趋势和状态质量,再由双路径 predictor 估计候选模型的边际进展,以 meta-gate 在质量、时间和长期成本预算间逐步决策。
flowchart LR
I[任务与当前状态] --> M[progress predictor / meta gate / budget routing]
M --> O[策略动作或训练目标]
O --> E[可审计指标与反馈]
E --> M
原论文关键图¶
原论文 Figure 2(关键图):展示原论文的整体流程、关键阶段及其数据流向。图片来自原论文,版权归原作者所有;点击图片可查看来源。
核心公式¶
论文离线与线上效果¶
HumanEval+ pass rate 93.0% 且满足 4800J 预算;MBPP 79.4%、3376J;ASQA citation precision 92.1%。
本地复现¶
L2 隔离能力评测(主结果)¶
ProgRouter 把验证后的工具选择压缩为可复用程序路由,validation/test 冻结路由后再执行。ToolRoute-L2.1 三 seed的 joint success 为 0.7778,plan step F1 为 0.8037,平均成本 4.6324。
指标见 metrics/toolroute-l2-seeds42-44.json。下方 PlanBench-mini 只作机制诊断。
本地对照口径:PlanBench-mini 120 episodes,joint success 1.0000、平均成本 0.3100;关注 progress predictions、meta-gate 和 budget downgrade。
指标见 metrics/progrouter-planbench-mini-seed42.json。 批次索引见 ../../experiments/latest-20260827-seed42.json。
复现边界¶
本地 mini-suite 用公开、确定性的候选/计划任务隔离机制差异;论文 checkpoint、私有训练数据、外部服务和完整 benchmark 均未声称已复刻。
