跳转至

Agent 论文谱系与缺口

本页维护 Agent 论文系统审计。覆盖范围从推理-行动、反思、规划搜索、工具学习, 延伸到多 Agent 编排、终身学习和 2026 年规划强化学习;最新边界检查至 2026-08-08

谱系覆盖

谱系 代表方法 状态 本仓库覆盖
推理与行动 ReAct、ReWOO 已实现 逐步交互;Planner/Worker/Solver 解耦
自我改进 Self-Refine、Reflexion 已实现 episode 内迭代;跨 trial 语言反思
显式搜索 Tree of Thoughts、LATS 已实现 BFS thought tree;MCTS + environment feedback
工具学习 Toolformer、PEARL 已实现 自监督工具标注;工具探索 + Planner RL
多 Agent 编排 AutoGen、MetaGPT 已实现 角色消息、交接、终止;软件 SOP 与角色 artifact
终身学习与记忆 Voyager、U-Mem、LEGOMem、MemTool、HiSkill、UniMem、SkillRise 已实现 技能、知识、过程、工具、层次图、跨任务 skill document 与 episodic→parametric 记忆
外部反馈 CRITIC 已实现 真实失败 patch、测试反馈和修订
Agent RL / OPD Agent Lightning、Search-R1、RAGEN、LOOP、WebAgent-R1、MUA-RL、SEED、CAST、TurnOPD 已实现 搜索/网页/长时程/多轮用户 RL、轨迹稳定化、hindsight skill、turn credit、动态 rollout budget
软件工程 Agent SWE-agent、OpenHands 已实现(local) 真实临时仓库、编辑、命令和回归测试
CUA reward 评测 OSReward / OS-Shepherd 已实现(protocol mini-suite) success/fail recall、balanced accuracy 与 leniency 审计
模块化专家系统 MRKL、HuggingGPT 已实现 神经符号 router;模型能力匹配与依赖图执行
经典长期状态 Generative Agents、MemGPT 已实现 记忆打分/反思;虚拟上下文换入换出
浏览与引用 WebGPT 已实现(deterministic) 浏览动作、证据引用与轨迹拒绝采样
具身技能 grounding SayCan 已实现(simulation) 语言相关性乘以技能 affordance
程序与自动工具推理 PAL、ART 已实现 符号解释器;task-library 检索与工具暂停
深度研究与工具 RL DeepResearcher、ReTool、ToolRL 已实现 引用奖励、交错工具推理、工具选择/参数/执行反馈
技能固化与自进化 SAGE、MemSkill、Memento-Skills、SEARL 已实现 技能生成/修订、memory-to-skill、版本化技能、策略—工具图共进化
零数据多 Agent 课程 Agent0 已实现 自生成任务、多 executor 投票与能力边界课程
Step-level Agent RL 与公共评测 Agent-R1、CAMEL、ToolBench、GAIA 已实现 transition-level context/credit、多 Agent role-play、工具指令检索、三级通用助理 mini-suite

静态能力收口

本轮复查新增的 8 个算法 P0 已全部实现:DeepResearcher、ReTool、ToolRL、SAGE、 MemSkill、Memento-Skills、SEARL 和 Agent0;它们补齐 deep research、工具 RL、技能固化、 自进化 RL 与多 Agent curriculum,并已接入组合式 evolve genome。完整证据与实现边界见 全主题系统缺口审计

本轮 4 个 P1 也已实现:Agent-R1、CAMEL、ToolBench/ToolLLM 与 GAIA;GAIA 使用 gaia-mini 验证公开协议与工具证据链,不冒充官方 466 题 leaderboard。

环境 当前状态 完成证据或边界
Agent Lightning LLM RL 已连接可训练 policy PR #116:SmolLM2 pairwise update、transition credit 与真实代码 executor
Agent 组合式 evolve 已完成 PR #117:memory/planner/tool/critic/policy/recovery/capacity 七轴组合和三 seed 晋级
官方 SWE-bench Lite、ToolHop 全集、真实浏览器 用户已延后 需要官方容器、模型调用预算、隔离 sandbox、网络与凭据策略;不冒充已接入

当前结论

经典主干已覆盖思考/行动、搜索、反思、神经符号与专家模型编排、多 Agent、长期记忆、 虚拟上下文、Planner RL、可训练 LLM policy 和真实代码执行。swebench-local 的受控 fixture 边界保持显式;当前没有尚未实现的静态 P0/P1,新的工作来自动态论文扫描,或由 用户恢复上述延后环境。

本轮系统复查补齐了三个互补分支:LOOP 的长时程 leave-one-out PPO 与旧轨迹复用、 WebAgent-R1 的上下文压缩和并行完整轨迹 M-GRPO、MUA-RL 的模拟用户澄清与真实工具 交互。它们均已作为 criticplannertool genome 算子进入统一 evolve。