跳转至

HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning

复现级别:L1 核心机制诊断。 本地执行在线 harness 调度;没有进行大模型 RL。

论文信息

字段 内容
论文链接 HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning
公司/机构 Harbin Institute of Technology / Alibaba Cloud(按第一作者署名单位)
首次公开日期 2026-09-12(arXiv v1)
原文开源代码 否:截至 2026-09-16 未找到原作者公开仓库
Adapter / 方法 harness-bandit
本地复现代码 src/auto_research/agent_research/latest_20260916.py

原始论文总结

背景与主要改动

联合 learnability、transferability 与探索 bonus 分配多 harness 训练预算。

本地 reference kernel 保留决定性门控、权重或状态转换,并输出可审计中间量,以便与相邻方法在统一预算下比较。

flowchart LR
  I[公开输入与状态] --> M[harness-bandit 核心机制]
  M --> A[可审计中间量]
  A --> O[输出或策略更新]

原论文关键图

HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning 原论文 Figure 1

原论文 Figure 1(关键图):展示原论文方法的总体设计和关键组成。图片来自原论文,版权归原作者所有;点击图片可查看来源。

核心公式

实现保留论文的决定性状态转换,并输出权重、门控、深度、阶段或缓存统计;固定预算和三种子只用于检查机制不变量,不等同于论文规模训练。

论文离线与线上效果

论文报告的能力、速度或成本结论只作为原文事实记录;本地指标不与其直接横比,也不外推线上收益。

本地复现

三种子结果见 metrics/mechanism-seeds42-44.json。统一 receipt 标记 diagnostic_only=true,不会被公开看板当成完整能力提升。

复现边界

本地执行在线 harness 调度;没有进行大模型 RL。