Multi-Harness RL:训练收益究竟来自策略还是执行 Harness¶
复现级别:CPU 分组信用与可微训练算子。 在相同 rollout 上计算 task×harness 与 task 两种标准化优势;尚不包含真实编码 Agent 的 held-out harness 迁移实验。
论文信息¶
| 字段 | 内容 |
|---|---|
| 论文链接 | arXiv 2609.04518 |
| 公司/机构 | New York University(第一作者第一署名单位) |
| 首次公开日期 | 2026-09-03(arXiv v1) |
| 原文开源代码 | 否:论文称结果 artifact 已发布,但未找到可核验的公共仓库链接(核查日期:2026-09-07) |
| Adapter / 方法 | multi-harness-rl |
| 本地复现代码 | src/auto_research/agent_research/latest_20260907.py |
原始论文总结¶
背景与主要改动¶
多 Harness RL 同时改变了执行环境多样性和 GRPO 的分组边界,难以判断增益来源。论文冻结相同 task-harness 轨迹,只比较组内和跨 harness advantage,并用训练中未见的最小 harness 审计能力是否真正迁移。
flowchart LR
T[相同任务] --> H[Aider/OpenHands/Qwen Code/SWE-agent]
H --> F[冻结轨迹与奖励]
F --> W[Within-harness GRPO]
F --> C[Cross-harness GRPO]
W --> O[源 Harness + 未见 Harness]
C --> O
原论文关键图¶
原论文 Figure 1(关键图):展示冻结经验、两种信用分组与 sealed held-out 评测。图片来自原论文,版权归原作者所有。
核心公式¶
Within 在每个 \((task,harness)\) 内标准化 reward;Cross 在同一 task 的不同 harness 间标准化。真正的迁移量以未见 harness 上 \(\Delta=R_{cross}-R_{within}\) 及置信区间报告。
论文离线与线上效果¶
24,000 次 sealed SWE-bench Verified 评估中,评测 harness 令平均解决率从 2.14% 变化到 9.27%,而训练配方影响小得多;held-out 上 Cross-Within 仅 +0.25pp,95% CI 为 [-0.48,+1.02]。
本地复现¶
2026-09-08 保真度更正¶
旧版直接返回评测标签,原准确率/计划成功率作废。入口现在只接收 task_id、intent、context;读取 answer、plan 或隐藏 required_tools 会在回归测试中报错。新 legacy 结果仅是公开文本格式解析诊断,即使为 1 也不是 Agent 能力;cost 是读取记录数,不是实际工具费用。
实际算子位置:sep7_mechanisms.py。运行 python -m pytest tests/test_sep7_fidelity.py -q 检查记忆路径、私有技能编辑、拒绝后状态不变、组间信用差异与反向传播。独立算子不能被当作已集成完整 LLM、真实工具环境或端到端 evolve 的证明。
seeds 42/43/44 的 within/cross 分组、held-out 审计、rolewise update 与成本见 metrics/mini-suite-seeds42-44.json。
本地对照口径:本地验证实验协议和计数器,不伪装成 SWE-bench Verified、Aider 或 OpenHands 已接入。
复现边界¶
真实 coding harness、Qwen3-8B RL 和 sealed oracle 均未在本地复刻;该实现用于防止未来 Evolve 实验把 harness 差异误报为模型能力。
