Agent 论文研究¶
这里是论文实现与评测库中的 Agent 分支,覆盖记忆、规划、
工具使用、多 Agent 协作和自我进化。确定性 mini-suite 验证状态与跨 episode 复用;
swebench-local 则创建真实临时仓库、修改代码并执行回归测试。这些方法与评测器也是
Agent 自动进化 adapter的组件底座。
复现保真度
mini-suite 属于Agent 机制复现;代码 sandbox 属于真实执行的 micro benchmark, 但不是官方 SWE-bench Lite。每篇详情页分开列出论文结果、本地映射与边界。
快速入口¶
- AtomRec:原子偏好记忆、语义协同链接与多跳推荐证据。
- CoSkill:联合训练推理策略、元技能策略和层级技能库。
- SiLR:影子执行、逐分支乘积序准入与同源过程奖励。
- Multi-Harness RL:固定经验后区分分组信用与执行 harness 的可迁移性审计。
-
DRACO:动态 rubric 与闭式步骤信用重分配。
-
自动进化中的 Agent:查看当前支持状态、组合轴和执行边界。
- 方法索引:按记忆、规划、工具管理等方向浏览。
- 分类浏览:按机构/公司/学校 · 按主题 · 按年份。
- 论文谱系与缺口:系统审计经典主干、最新覆盖和真实环境前置条件。
- 统一评测协议:mini-suite、成本定义、公平比较与新增方法门槛。
- L2.1 隔离能力评测与自动进化:删除 guide/oracle,隔离 train/validation/test,并把九轴 Agent genome 接入统一多轮控制器。
- 可训练 policy 与真实 executor:Agent Lightning checkpoint 更新与同预算代码执行矩阵。
- SPO++:按生成事件冻结 prompt value,并在 action-token measure 下校正异步 advantage。
- SkillForge:显式创建、调用、验证与修订可复用技能。
- AHEAD:普通步骤注入环境反馈,错误步骤再注入纠错 hint。
- SMITH:联合优化工具创建和使用,并分离 schema、代码与结果验证。
- JIT-Agent:按任务即时生成 memory、planning、action protocol 与 tools/skills,并从失败中修复 harness。
- TraceML:把执行轨迹转成可训练的状态、动作与信用记录,支持跨任务诊断和复用。
- AdaVDR:根据验证不确定性动态分配检索深度,并用证据一致性约束最终回答。
- TOPAS:用 typed observation、planning 和 action schema 约束长程工具执行。
- CaSKG:构造因果技能知识图,按任务检索、组合并验证可复用技能路径。
- ProgRouter:依据任务与运行中反馈渐进路由 planner、tools 和 recovery policy。
- Agent-G²:从已有 rollout 在线估计高斯 guidance band,无额外 probing。
- AutoSaddler:由失败 trace 诊断、生成并验证 durable harness patch。
- Toolformer:按 token loss improvement 自监督过滤工具调用。
- Self-Refine:同一模型生成、自反馈并迭代改写。
- ReWOO:Planner、Worker、Solver 解耦,减少观察重放。
- AutoGen:角色化多 Agent 消息编排与显式终止。
- PEARL:离线工具探索与 planning-centric GRPO。
- Tree of Thoughts:thought tree、value 与 BFS 回溯。
- LATS:MCTS、环境反馈与自反思搜索。
- ReAct:Thought、Action、Observation 的交替执行轨迹。
- Reflexion:失败反馈转语言反思并跨 trial 复用。
- Voyager:自动课程、执行验证和可增长技能库。
- U-Mem:成本感知的主动知识获取与记忆验证。
- LEGOMem:可组合的编排器与执行过程记忆。
- MemTool:有限上下文中的动态工具记忆。
- MetaGPT:产品、架构、工程、测试的 SOP。
- CRITIC:用真实工具反馈迭代修订。
- Agent Lightning:执行/训练解耦与 credit assignment。
- GiGPO:在 trajectory group 与共享 step group 中分别归因。
- StepPO:以环境 step 为 MDP 单位做 GAE 与 ratio clip。
- SWE-agent:软件工程 Agent-Computer Interface。
- OpenHands:编辑器、终端与 sandbox event stream。
- MRKL:router 分发神经与离散符号专家。
- HuggingGPT:规划、专家模型匹配、依赖执行和汇总。
- Generative Agents:记忆流打分、反思与计划。
- MemGPT:core/working/archival 虚拟上下文与 interrupt。
- WebGPT:浏览轨迹、引用约束和 reward-model 拒绝采样。
- SayCan:语言相关性乘以技能 affordance。
- PAL:生成程序并交由确定性解释器执行。
- ART:检索任务示例,在工具调用处暂停与恢复。
- SEED:从完成轨迹提炼 hindsight skill 并形成稠密 credit。
- CAST:用 solver value 差分提供 turn 级监督。
- TurnOPD:自适应 rollout 深度与 turn-normalized OPD。
- Search-R1:推理/搜索交错、检索 token mask 与结果奖励。
- RAGEN:StarPO-S 轨迹 RL、Echo Trap 检测与稳定化。
- LOOP:无 value model 的 leave-one-out PPO, 复用旧 rollout 并做逐 token clip,面向长时程交互。
- WebAgent-R1:动态压缩网页上下文,以并行完整轨迹和 M-GRPO 结果奖励训练网页 Agent。
- MUA-RL:把模拟用户纳入 rollout,学习多轮澄清意图、 调用真实工具并只依赖最终任务奖励。
- HiSkill:高层 skill、AtomicOp 与 typed edge 的层次图。
- UniMem:episodic/parametric memory 自路由与巩固。
- CAM-DF:把冻结工具排序转成成本感知的前缀停止决策。
- SkillRise:跨相关任务交替求解与维护技能文档。
- TAPO:同一 rollout 交替优化 policy 与 action-conditioned transition prediction。
- GRSD:对照同组成功/失败反思生成 turn-level privileged guidance。
- EnvACE:同一策略交替 act/rehearse,并按角色分别计算 group advantage。
- AgentOPSD:递归汇聚 privileged token gap,形成关键 turn 的贝叶斯信用。
- OCSD:对照 full 与 observation-ablated replay,消除 scaffold 混杂。
- VerMem:统一管理 LTM、活动上下文和 episodic history,并用双层 verifier 审核。
- CoEvo-Mem:交替更新检索路由器和记忆库,闭合使用—更新反馈环。
- OSReward / OS-Shepherd:跨平台 CUA reward 的双类召回、balanced accuracy 与 leniency 审计。
- DeepResearcher、ReTool 与 ToolRL:补齐深度研究轨迹奖励和工具选择/执行强化学习。
- SAGE、MemSkill 与 Memento-Skills:从轨迹记忆抽象、修订并检索可复用技能。
- SEARL 与 Agent0:联合优化策略/工具图,并以零数据多 Agent curriculum 自进化。
- Agent-R1、CAMEL、ToolBench 与 GAIA:补齐 step-level Agent RL、多 Agent role-playing、工具指令学习与通用公共评测。
2026-08-09 P0/P1 增量¶
- EvoHarness-RL、VaG 与 GSE:覆盖 harness policy、技能写入前验证和全局技能图进化。
2026-08-13 MR7 增量¶
- SinkFlex-RL:把 attention sink、sliding window 与无 critic group-relative RL 组合,用于长程工具 Agent。
- CIPO、State2State 与 HindSearch:覆盖证据信用、环境派生任务和失败轨迹 hindsight。
- HarnessOpt-Bench、CodeGrep 与 MemoryCPT:覆盖 harness 优化评测、代码检索策略和成本感知记忆。
九个方法均接入统一 runner 和 Agent evolve 组合 genome,并在 PlanBench mini-suite 上留下固定 seed 结果。
2026-08-24 增量¶
- AgentX:把有界提案、仓库约束实现、护栏 A/B、正负结果资产化和 SGPO harness 更新组成工业推荐自迭代闭环。
- AUSO:以渐进技能生命周期和动作级 JSD 信号统一技能内化、探索与有界利用。
2026 历史扫描 B10~B11¶
- SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning:同一自回归骨干在不同因果边界输出 policy/value,结合 PPO、on-policy SARSA 和 trajectory GAE。
- SPADE: Self-Play in Adaptive Synthetic Executable Environments:同一 LLM 分饰环境设计者和推理 Agent,以有/无 privileged hint 的 regret 学习能力边界上的可执行环境。
- RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training:把多轮 rollout 组织成稀疏反向树,按时间逆序更新 turn,令决策与下游 continuation 保持 on-policy。
- PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs:在成功轨迹内同时比较 trajectory turn 数和单 turn response 长度,形成 coarse-to-fine planning advantages。
- TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents:无需成功 anchor,从每个状态转移的 Evidence、Execution、Invalidity rubric 构造基础和 breakthrough reward。
- LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation:把 reflect/backtrack 视为可逆轨迹树的 memory-control actions,以 privileged teacher 快通道和 outcome GRPO 慢通道协调训练。
- HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation:把 planning、execution 和 isolated reasoning 分层,结构化摘要在 context refresh 间保存任务进展。
- OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks:把 observation/planning/memory/action/verification/recovery 等 Loop Policy 资产版本化,以 Champion–Challenger、发布监控和回滚治理进化。
- Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution:用层级 phase planner 条件化 episodic retrieval,再用记忆轨迹统计检测 stuck 并重规划,以真实执行 verdict 验证。
- ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning:把工具级历史轨迹提升为可跨工具集迁移的 function workflow graph,再解耦 workflow planning 与 tool selection。
- HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents:把工具建模为 input-schema→output-schema 超边,先构造 Task DAG,再按状态缺口扩展 producer tool support graph。
- MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems:根据任务先验初始化通信拓扑,运行中监控协作 trace,并有界调整角色、边、顺序、可见性和验证路径。
研究闭环¶
flowchart LR
P["Agent 论文与能力假设"] --> I["统一方法接口"]
B["EvoMem / PlanBench / ScaleMCP mini-suite"] --> E["Episode"]
I --> E
E --> A["Agent policy"]
A --> M["知识 / 过程 / 工具记忆"]
M --> O["answer / plan / action"]
O --> F["成功、成本、复用、淘汰反馈"]
F --> A
F --> R["trace、指标与中文报告"]
R --> P
当前实现¶
| 方向 | 方法 | 核心机制 | 本地评测 | 状态 |
|---|---|---|---|---|
| 环境 rehearsal / Agent RL | EnvACE | act/rehearse 双角色、private observation、role-wise GRPO | PlanBench mini | 机制复现 |
| 公平基线 | Long-context | 保留全部历史,不压缩记忆 | EvoMem mini | 已实现 |
| 工具学习 | Toolformer | 候选 API call 与自监督 loss 过滤 | ScaleMCP mini | 机制复现 |
| 自我迭代 | Self-Refine | generate、feedback、refine 循环 | PlanBench mini | 机制复现 |
| 解耦规划 | ReWOO | Planner/Worker/Solver 与证据变量 | PlanBench mini | 机制复现 |
| 多 Agent | AutoGen | 角色消息、交接、critic 与 termination | PlanBench mini | 机制复现 |
| 规划强化学习 | PEARL | tool exploration、plan reward、group update | PlanBench mini | 机制复现 |
| 推理搜索 | Tree of Thoughts | thought expansion、value、BFS/backtrack | PlanBench mini | 机制复现 |
| Agent 搜索 | LATS | UCT、trajectory rollout、环境反馈与反思 | PlanBench mini | 机制复现 |
| 推理与行动 | ReAct | Thought → Action → Observation | ScaleMCP mini | 机制复现 |
| 自我改进 | Reflexion | verbal feedback 与 episodic reflection | PlanBench mini | 机制复现 |
| 终身学习 | Voyager | curriculum、skill library、self-verification | PlanBench mini | 机制复现 |
| 主动记忆 | U-Mem | 分级获取、语义检索、Thompson sampling | EvoMem mini | 机制复现 |
| 过程记忆 | LEGOMem | 编排与执行过程单元跨 episode 复用 | PlanBench mini | 机制复现 |
| 工具记忆 | MemTool | 工作流保护与近期性/成功率淘汰 | ScaleMCP mini | 机制复现 |
| 多 Agent 软件工程 | MetaGPT | 四角色 SOP 与结构化交付物 | SWE-style local code | 真实执行 |
| 工具反馈 | CRITIC | 失败 patch、测试反馈、修订 | SWE-style local code | 真实执行 |
| Agent RL | Agent Lightning | transition、credit update、策略复用 | SWE-style local code | 真实执行 |
| Agent group credit | GiGPO | macro trajectory advantage + micro step advantage | PlanBench mini | 机制复现 |
| Step-aligned Agent RL | StepPO | step critic、GAE 与 within-step ratio aggregation | PlanBench mini | 机制复现 |
| Agent transition RL | TAPO | policy objective + next-observation supervision | PlanBench mini | 机制复现 |
| Group-reflective RL | GRSD | 成败组反思、stop-gradient guidance 与 turn credit | PlanBench mini | 机制复现 |
| CUA Reward 评测 | OSReward / OS-Shepherd | success/fail recall、balanced accuracy、leniency | OSReward mini | 评测协议复现 |
| 软件工程 ACI | SWE-agent | 定位、编辑、回归测试 | SWE-style local code | 真实执行 |
| 通用软件 Agent | OpenHands | 编辑器/终端 event stream | SWE-style local code | 真实执行 |
| 神经符号路由 | MRKL | router、神经/符号专家、结果汇总 | ScaleMCP mini | 机制复现 |
| 专家模型编排 | HuggingGPT | planning、model selection、DAG execution | PlanBench mini | 机制复现 |
| 记忆与反思 | Generative Agents | recency/importance/relevance、reflection、plan | EvoMem mini | 机制复现 |
| 虚拟上下文 | MemGPT | tiered memory、page-in/out、interrupt | EvoMem mini | 机制复现 |
| 浏览问答 | WebGPT | browser trajectory、citation、rejection sampling | ScaleMCP mini | 机制复现 |
| 具身规划 | SayCan | language relevance × affordance | PlanBench mini | 机制复现 |
| 程序推理 | PAL | program generation + symbolic runtime | ScaleMCP mini | 机制复现 |
| 自动工具推理 | ART | demo retrieval、pause/tool/resume、library update | PlanBench mini | 机制复现 |
| Agentic RL | SEED | hindsight skill 与稠密 on-policy credit | PlanBench mini | 机制复现 |
| Agentic RL | CAST | solver value 差分与 turn credit | PlanBench mini | 机制复现 |
| Agentic OPD | TurnOPD | 深度 probe、动态 rollout 与 turn normalization | ScaleMCP mini | 机制复现 |
| 搜索 Agent RL | Search-R1 | 多轮 search/reason、retrieval loss mask、outcome reward | ScaleMCP mini | 机制复现 |
| 多轮 Agent RL | RAGEN | trajectory filtering、critic baseline、decoupled clipping | PlanBench mini | 机制复现 |
| 长时程 Agent RL | LOOP | leave-one-out advantage、off-policy reuse、per-token clip | PlanBench mini | 机制复现 |
| 网页 Agent RL | WebAgent-R1 | context compression、parallel trajectory、M-GRPO | ScaleMCP mini | 机制复现 |
| 多轮用户 Agent RL | MUA-RL | simulated user、intent refinement、real tool response、final reward | ScaleMCP mini | 机制复现 |
| 层次技能 | HiSkill | skill/AtomicOp 节点与 typed edge 子图 | PlanBench mini | 机制复现 |
| 持续记忆 | UniMem | episodic/parametric route 与 consolidation | EvoMem mini | 机制复现 |
| 工具获取控制 | CAM-DF | payoff gap、regret weight 与异构成本停止 | ScaleMCP mini | 机制复现 |
| 跨任务技能 | SkillRise | solve/curate 双 phase 与下游折扣 credit | PlanBench mini | 机制复现 |
本地实验快照¶
固定 120 episodes、seed 42。经典方法用于验证状态演化:Reflexion 明确让每个新任务 族首次失败再学习,因此不能只按最终成功率排序,也不应与论文 benchmark 横向比较。
| 方法与 benchmark | joint success | 平均成本 | 额外诊断 |
|---|---|---|---|
| Long-context · EvoMem mini | 1.0000 | 64.5000 | 上下文成本随历史线性增长 |
| U-Mem · EvoMem mini | 1.0000 | 3.0500 | 检索失败后升级 tool research |
| LEGOMem · PlanBench mini | 1.0000 | 1.1200 | 108 次过程单元复用 |
| MemTool · ScaleMCP mini | 1.0000 | 1.9812 | 200 次受控工具淘汰 |
| ReAct · ScaleMCP mini | 1.0000 | 3.0000 | 360 reasoning/action steps |
| Reflexion · PlanBench mini | 0.9000 | 1.1000 | 12 条反思、108 次复用 |
| Voyager · PlanBench mini | 1.0000 | 1.1200 | 12 个技能、108 次复用 |
| Tree of Thoughts · PlanBench mini | 1.0000 | 2.5000 | 1200 节点、480 次回溯 |
| LATS · PlanBench mini | 1.0000 | 4.0000 | 480 rollouts、360 次反思 |
| Toolformer · ScaleMCP mini | 1.0000 | 3.0000 | 540 候选、360 接受调用 |
| Self-Refine · PlanBench mini | 1.0000 | 2.0000 | 120 次反馈与 refinement |
| ReWOO · PlanBench mini | 1.0000 | 3.5000 | 120 份计划、360 次 worker 调用 |
| AutoGen · PlanBench mini | 1.0000 | 3.0000 | 360 条跨角色消息 |
| PEARL · PlanBench mini | 1.0000 | 1.1200 | 24 次探索、12 次 policy update |
| MetaGPT · SWE local | 1.0000 | 3.5000 | 48 条角色 artifact |
| CRITIC · SWE local | 1.0000 | 4.0000 | 24 轮工具反馈与修订 |
| Agent Lightning · SWE local | 1.0000 | 3.6250 | patch reuse 0.7500 |
| SWE-agent · SWE local | 1.0000 | 2.5000 | 12 次真实文件编辑 |
| OpenHands · SWE local | 1.0000 | 2.5000 | 编辑器/终端事件流 |
| MRKL · ScaleMCP mini | 1.0000 | 1.2500 | 360 router calls;170 symbolic calls |
| HuggingGPT · PlanBench mini | 1.0000 | 2.3500 | 360 model matches;240 dependency edges |
| Generative Agents · EvoMem mini | 1.0000 | 1.7900 | 354 memories;30 reflections |
| MemGPT · EvoMem mini | 1.0000 | 0.9200 | 108 writes;96 page-ins;108 interrupts |
| WebGPT · ScaleMCP mini | 1.0000 | 3.0000 | 600 references;240 candidates |
| SayCan · PlanBench mini | 1.0000 | 3.3750 | 1350 affordance checks |
| PAL · ScaleMCP mini | 1.0000 | 1.4000 | 120 programs / interpreter calls |
| ART · PlanBench mini | 1.0000 | 1.5500 | 108 retrievals;360 pauses |
| SEED · PlanBench mini | 1.0000 | 0.9800 | 12 hindsight skills;360 dense credit updates |
| CAST · PlanBench mini | 1.0000 | 1.5000 | 2040 solver queries;360 turn credits |
| TurnOPD · ScaleMCP mini | 1.0000 | 1.3333 | 节省 40 rollout turns |
| Search-R1 · ScaleMCP mini | 1.0000 | 2.7500 | 240 queries;1800 masked tokens |
| RAGEN · PlanBench mini | 1.0000 | 1.6000 | 480 rollouts;120 filtered;19 Echo Trap probes |
| LOOP · PlanBench mini | 1.0000 | 2.2000 | 476 次旧轨迹复用;480 次 LOO update;120 次 clip |
| WebAgent-R1 · ScaleMCP mini | 1.0000 | 2.6000 | 360 个压缩 token;120 个并行组与 M-GRPO update |
| MUA-RL · ScaleMCP mini | 1.0000 | 2.2500 | 360 个用户 turn;240 次意图修正;120 个最终任务奖励 |
| HiSkill · PlanBench mini | 1.0000 | 0.6900 | 48 nodes;60 edges;324 AtomicOp reuses |
| UniMem · EvoMem mini | 1.0000 | 0.5200 | 24 episodic;96 parametric;12 consolidations |
| CAM-DF · ScaleMCP mini | 1.0000 | 4.7333 | 工具 exposure -51.02%;120 次提前停止 |
| SkillRise · PlanBench mini | 1.0000 | 0.6550 | 119 次跨任务 skill 复用;360 次下游 credit |
| GiGPO · PlanBench mini | 1.0000 | 1.6500 | 36 个组内与 36 个组间 advantage |
| StepPO · PlanBench mini | 1.0000 | 0.9000 | 36 次 step GAE 与 sequence-ratio 聚合 |
| TAPO · PlanBench mini | 1.0000 | 1.0500 | 360 个 transition targets,accuracy 1.0000 |
| GRSD · PlanBench mini | 1.0000 | 1.3500 | 120 反思组、360 次 guidance update |
完整指标定义见统一评测协议,稳定指标见
agent-mini-suites-seed42.json。
经典 Agent 稳定指标见
classic-agent-mini-suites-seed42.json。
真实代码 sandbox 指标见
agent-code-sandbox-seed42.json。
本轮 TAPO / GRSD 指标见
tapo-grsd-planbench-seed42.json。
本批经典缺口指标见
p0-missing-agent-mini-suites-seed42.json。
P1 候选指标见
p1-agent-candidates-mini-suites-seed42.json。
本批 Agentic RL 与记忆指标见
agent-20260729-seed42.json。
经典 Agentic RL / OPD 补充指标见
classic-agentic-rl-opd-seed42.json。
本批遗漏方法的固定 seed 指标见
omitted-agentic-rl-opd-seed42.json。
本页新增 step-credit 算法的固定 seed 指标见
rl-papers-summary-seed42.json。
2026-08-29 最新方法¶
- SWE-Prime:轨迹与语义段两级筛选。
- HarnessLens:行为相关任务选择和可归因验证。
- CoVeMem:可训练协同向量记忆。
- SPT:多文件 skill package 的 Reference Insert 与中训练。
统一批次索引见 latest-20260829-seed42.json。
一键运行¶
auto-research agent-eval --method u-mem --benchmark evomem-mini
auto-research agent-eval --method legomem --benchmark planbench-mini
auto-research agent-eval --method memtool --benchmark scalemcp-mini \
--episodes 200 --memory-size 8
auto-research agent-eval --method reflexion --benchmark planbench-mini \
--episodes 120 --memory-size 24
auto-research agent-eval --method pearl --benchmark planbench-mini \
--episodes 120 --memory-size 24
auto-research agent-eval --method critic --benchmark swebench-local \
--episodes 12 --seed 42
产物写入 runs/agent-research/<method>-<benchmark>-seed<seed>/,包含逐步 trace、
metrics.json 和中文 report.md。
后续扩展约定¶
新增论文时必须同时完成方法实现、独立论文页、方法索引、统一协议实验和稳定指标。 论文页固定包含论文信息、背景与主要改动、架构图、核心公式/算法、论文效果、本地 映射、复现实验和保真边界;入口页只维护全局状态和可比较快照。