Agent 论文谱系与缺口¶
本页维护 Agent 论文系统审计。覆盖范围从推理-行动、反思、规划搜索、工具学习, 延伸到多 Agent 编排、终身学习和 2026 年规划强化学习;最新边界检查至 2026-08-08。
谱系覆盖¶
| 谱系 | 代表方法 | 状态 | 本仓库覆盖 |
|---|---|---|---|
| 推理与行动 | ReAct、ReWOO | 已实现 | 逐步交互;Planner/Worker/Solver 解耦 |
| 自我改进 | Self-Refine、Reflexion | 已实现 | episode 内迭代;跨 trial 语言反思 |
| 显式搜索 | Tree of Thoughts、LATS | 已实现 | BFS thought tree;MCTS + environment feedback |
| 工具学习 | Toolformer、PEARL | 已实现 | 自监督工具标注;工具探索 + Planner RL |
| 多 Agent 编排 | AutoGen、MetaGPT | 已实现 | 角色消息、交接、终止;软件 SOP 与角色 artifact |
| 终身学习与记忆 | Voyager、U-Mem、LEGOMem、MemTool、HiSkill、UniMem、SkillRise | 已实现 | 技能、知识、过程、工具、层次图、跨任务 skill document 与 episodic→parametric 记忆 |
| 外部反馈 | CRITIC | 已实现 | 真实失败 patch、测试反馈和修订 |
| Agent RL / OPD | Agent Lightning、Search-R1、RAGEN、LOOP、WebAgent-R1、MUA-RL、SEED、CAST、TurnOPD | 已实现 | 搜索/网页/长时程/多轮用户 RL、轨迹稳定化、hindsight skill、turn credit、动态 rollout budget |
| 软件工程 Agent | SWE-agent、OpenHands | 已实现(local) | 真实临时仓库、编辑、命令和回归测试 |
| CUA reward 评测 | OSReward / OS-Shepherd | 已实现(protocol mini-suite) | success/fail recall、balanced accuracy 与 leniency 审计 |
| 模块化专家系统 | MRKL、HuggingGPT | 已实现 | 神经符号 router;模型能力匹配与依赖图执行 |
| 经典长期状态 | Generative Agents、MemGPT | 已实现 | 记忆打分/反思;虚拟上下文换入换出 |
| 浏览与引用 | WebGPT | 已实现(deterministic) | 浏览动作、证据引用与轨迹拒绝采样 |
| 具身技能 grounding | SayCan | 已实现(simulation) | 语言相关性乘以技能 affordance |
| 程序与自动工具推理 | PAL、ART | 已实现 | 符号解释器;task-library 检索与工具暂停 |
| 深度研究与工具 RL | DeepResearcher、ReTool、ToolRL | 已实现 | 引用奖励、交错工具推理、工具选择/参数/执行反馈 |
| 技能固化与自进化 | SAGE、MemSkill、Memento-Skills、SEARL | 已实现 | 技能生成/修订、memory-to-skill、版本化技能、策略—工具图共进化 |
| 零数据多 Agent 课程 | Agent0 | 已实现 | 自生成任务、多 executor 投票与能力边界课程 |
| Step-level Agent RL 与公共评测 | Agent-R1、CAMEL、ToolBench、GAIA | 已实现 | transition-level context/credit、多 Agent role-play、工具指令检索、三级通用助理 mini-suite |
静态能力收口¶
本轮复查新增的 8 个算法 P0 已全部实现:DeepResearcher、ReTool、ToolRL、SAGE、 MemSkill、Memento-Skills、SEARL 和 Agent0;它们补齐 deep research、工具 RL、技能固化、 自进化 RL 与多 Agent curriculum,并已接入组合式 evolve genome。完整证据与实现边界见 全主题系统缺口审计。
本轮 4 个 P1 也已实现:Agent-R1、CAMEL、ToolBench/ToolLLM 与 GAIA;GAIA 使用
gaia-mini 验证公开协议与工具证据链,不冒充官方 466 题 leaderboard。
| 环境 | 当前状态 | 完成证据或边界 |
|---|---|---|
| Agent Lightning LLM RL | 已连接可训练 policy | PR #116:SmolLM2 pairwise update、transition credit 与真实代码 executor |
| Agent 组合式 evolve | 已完成 | PR #117:memory/planner/tool/critic/policy/recovery/capacity 七轴组合和三 seed 晋级 |
| 官方 SWE-bench Lite、ToolHop 全集、真实浏览器 | 用户已延后 | 需要官方容器、模型调用预算、隔离 sandbox、网络与凭据策略;不冒充已接入 |
当前结论¶
经典主干已覆盖思考/行动、搜索、反思、神经符号与专家模型编排、多 Agent、长期记忆、
虚拟上下文、Planner RL、可训练 LLM policy 和真实代码执行。swebench-local 的受控
fixture 边界保持显式;当前没有尚未实现的静态 P0/P1,新的工作来自动态论文扫描,或由
用户恢复上述延后环境。
本轮系统复查补齐了三个互补分支:LOOP 的长时程 leave-one-out PPO 与旧轨迹复用、
WebAgent-R1 的上下文压缩和并行完整轨迹 M-GRPO、MUA-RL 的模拟用户澄清与真实工具
交互。它们均已作为 critic、planner 或 tool genome 算子进入统一 evolve。