跳转至

Agent 研究:按年份

按首次公开年份浏览;同年论文按日期倒序排列,每篇独占一行并附主要方法简介。

2026

2025

  • 2025-12 · SAGEsage):从成功轨迹抽象技能,失败时修订或淘汰,并以任务回报学习技能检索与复用。
  • 2025-11 · Agent0agent0):任务生成 Agent 提议可验证工具任务,多个执行 Agent 产生候选并多数投票,课程按当前能力边界升级。
  • 2025-11 · Agent-R1agent-r1):把每次 agent/environment 交互作为独立 transition,以可插拔上下文管理、环境接口与优化器支持 token 或 step 级信用。
  • 2025-10 · LEGOMemlegomem):整段成功轨迹难以迁移到新任务,单一全局记忆又混合了任务分解和工具执行。LEGOMem 把经验拆成像积木一样的 procedural units:orchestrator memory 保存任务分解与委派,agent memory 保存具体动作模板,运行时按新任务重新组合。
  • 2025-08 · MUA-RLmua-rl):既有 tool-use RL 通常把用户请求视为固定输入,但真实用户会根据 Agent 回答不断修改需求。MUA-RL 将 LLM 模拟用户直接放入 rollout,Agent 在对话中澄清意图并调用真实 MCP/数据库工具;用户消息和工具结果不计入策略 loss,只用最终任务完成奖励鼓励探索。
  • 2025-08 · ToolGrad: Efficient Tool-Use Dataset Generation with Textual Gradientstoolgrad):先从目标答案反推工具轨迹,再使用 textual gradient 定位并修订失败调用,降低人工轨迹标注成本。
  • 2025-08 · Agent Lightningagent-lightning):传统 Agent RL 常把所有上下文拼成单序列并与框架强耦合。Agent Lightning 将执行记录成统一 MDP transition,以 credit assignment 拆解轨迹,并采用训练/执行分离架构。
  • 2025-07 · MemToolmemtool):大量 MCP 工具描述会迅速占满上下文,静态截断又可能删掉当前工作流需要的工具。MemTool 比较 autonomous、workflow 和 hybrid 管理方式;hybrid 策略保护当前工作流的必需工具,其余工具依据近期性和历史成功率动态淘汰。
  • 2025-05 · WebAgent-R1webagent-r1):网页交互会不断累积 HTML 和历史动作,单轮 GRPO 无法处理状态变化。WebAgent-R1 动态保留近期和任务相关上下文,并行采集完整多轮轨迹,再用 M-GRPO 根据最终成功奖励执行组内相对更新;论文同时强调行为克隆 warm-up 和长 CoT 初始化。
  • 2025-05 · GiGPOgigpo):多轮 Agent 的最终奖励稀疏,整条轨迹的 group relative advantage 无法判断哪个 environment step 做对了。GiGPO 先在完整轨迹组上计算 macro advantage,再按跨轨迹重复到达的 anchor state 建立 step group,计算 micro relative advantage。
  • 2025-04 · RAGENragen):单轮数学 RL 的优化单位是一次回答,而 Agent 要在随机环境中跨多轮决策。RAGEN 提出 StarPO,把 state、thinking、action 和 reward 组织成完整轨迹。
  • 2025-04 · ToolRLtoolrl):联合优化工具选择、参数生成和执行结果;动态 reward scaling 让不同工具难度进入同一 RL batch。
  • 2025-04 · ReToolretool):策略在自然语言 reasoning 与工具执行之间交替,并由可执行反馈学习调用、纠错和停止。
  • 2025-04 · DeepResearcherdeepresearcher):把 search、browse、证据收集和带引用回答作为一条轨迹,用答案与引用联合奖励训练研究策略。
  • 2025-03 · Search-R1search-r1):普通 RAG 一次检索后再回答,无法让策略根据中间证据继续调整查询。Search-R1 把搜索引擎视为环境:模型可在 reasoning 中多次输出搜索动作,环境返回文档后继续推理。
  • 2025-02 · LOOPloop):长程数字 Agent 的 rollout 昂贵,而传统 PPO 还要维护 value model。LOOP 把 PPO trust region 与 leave-one-out baseline 结合:无需 critic,可对同一批轨迹进行多次更新;逐 token importance ratio 只裁剪漂移 token,不丢弃整条长轨迹。

2024

  • 2024-07 · OpenHandsopenhands):OpenHands 提供开放的软件 Agent 平台,把终端、编辑器、浏览器等动作统一到 event stream,并以 sandbox 隔离执行,覆盖修 bug、写代码和仓库维护。
  • 2024-05 · SWE-agentswe-agent):通用 shell 对 LLM 而言动作空间过宽、输出冗长。SWE-agent 用专门 ACI 约束仓库搜索、文件查看、精确编辑和测试,让模型能围绕 issue 定位故障并验证 patch。

2023

  • 2023-11 · GAIAgaia):以 466 个真实问题联合考查推理、多模态、网页浏览与工具使用,采用精确短答案和三级难度。
  • 2023-10 · MemGPTmemgpt):有限 context window 使长文档和多轮会话不断遗忘。MemGPT 借鉴操作系统虚拟内存,把常驻核心信息、当前工作上下文和外部归档分层管理;模型通过函数调用移动数据,并以 interrupt/heartbeat 控制继续推理和与用户交互。
  • 2023-10 · LATSlats):ReAct 等方法通常沿单条轨迹行动,失败后缺少系统搜索。LATS 把 LM 同时作为 agent、value function 和 optimizer,嵌入 Monte Carlo Tree Search;环境执行提供外部 reward,失败轨迹生成 reflection,帮助后续搜索避开错误。
  • 2023-08 · AutoGenautogen):复杂应用常需要多个模型、工具和人类协作,手写控制流难复用。AutoGen 提供 ConversableAgent 与 conversation programming:每个角色声明能力、回复策略和终止条件,通过群聊或嵌套会话组合成工作流。
  • 2023-08 · MetaGPTmetagpt):简单串联多个聊天 Agent 容易让幻觉级联。MetaGPT 把人类软件团队的 SOP 编码成角色化消息流程,每个角色生产结构化中间物,由下游角色消费和验证。
  • 2023-05 · ReWOOrewoo):ReAct 在每次工具返回后重新调用 LLM,token 和推理成本随轨迹增长。ReWOO 的 Planner 用变量引用写出完整多步计划,Worker 只负责填入工具证据,Solver 最后读取计划与证据生成答案,因此 Planner 不被中间观察反复打断。
  • 2023-05 · ToolBenchtoolbench):分析开源 LLM 工具失败后,组合程序化使用样例、system prompt、in-context demonstration retriever 与生成格式约束。
  • 2023-05 · Voyagervoyager):开放世界 Agent 需要持续选择有新颖性的任务、把成功行为积累为技能,并根据环境报错修复程序。Voyager 用 GPT-4 自动生成 curriculum,以代码作为动作空间;成功程序按描述索引进 skill library,新任务检索并组合已有技能。
  • 2023-05 · CRITICcritic):仅让 LLM 反思自己的文本可能重复同一错误。CRITIC 调用搜索、代码解释器等外部工具,把可观测反馈带回修订循环,使 critique 有环境证据。
  • 2023-05 · Tree of Thoughtstree-of-thoughts):自回归生成和单条 CoT 很难撤销早期错误。ToT 将中间推理视为可独立评价的 thought,在树上生成多个候选,使用语言模型 value 函数选择 BFS/DFS frontier,并允许 lookahead 和 backtracking。
  • 2023-04 · Generative Agentsgenerative-agents):只把完整历史塞给 LLM 无法支撑长期一致行为。论文把每次观察写入 memory stream,按 recency、importance、relevance 检索;累计重要事件达到阈值后生成更高层 reflection,再结合记忆与当前状态制定日程和行动计划。
  • 2023-03 · CAMELcamel):用 inception prompting 固定 user/assistant 的角色、目标和边界,通过轮流消息完成任务并生成可研究的多 Agent 社会轨迹。
  • 2023-03 · HuggingGPThugginggpt):单个 LLM 难以覆盖视觉、语音和其他专业任务,而模型社区已有大量专家。HuggingGPT 让 ChatGPT 充当控制器:先把请求拆成带依赖的子任务,再按 Hugging Face 模型描述匹配专家,按拓扑顺序执行,最后把多模型输出组织为用户答案。
  • 2023-03 · Self-Refineself-refine):一次生成很难同时满足所有约束。Self-Refine 让同一个 LLM 先生成初稿,再针对任务维度给出可执行反馈,最后据此改写;若反馈判断已满足要求则停止,不需要额外训练数据、人工反馈或外部 reward model。
  • 2023-03 · Reflexionreflexion):传统 RL 要大量采样与参数更新。Reflexion 把稀疏标量/二值反馈“放大”为可执行的自然语言经验,写入长期 episodic memory;Actor 在下一 trial 读取反思,Evaluator 继续判定成功与否。
  • 2023-03 · ARTart):既有 tool-use prompting 常需为每个任务手写示例和调用顺序。ART 根据新任务自动检索相近的推理/工具示例,让冻结 LLM 生成程序;运行器遇到工具标记就暂停生成,执行工具并注入结果后继续。
  • 2023-02 · Toolformertoolformer):手工标注工具调用昂贵,纯 prompting 又难以让较小模型稳定决定何时调用。Toolformer 先用少量 demonstration 采样 API call,再比较插入真实返回值、隐藏返回值和完全不调用时的后续 token loss,只保留确实有用的调用并继续语言模型训练。

2022

  • 2022-11 · PALpal):LLM 擅长把问题分解成步骤,却会在算术和符号执行阶段出错。PAL 让 LLM 输出带变量和控制流的程序,最终计算完全交给 Python 等确定性 runtime;模型只承担自然语言理解和程序合成。
  • 2022-10 · ReActreact):纯 CoT 容易在封闭知识上幻觉,纯 action agent 又缺少计划与状态跟踪。ReAct 让模型交替生成自然语言推理和环境 action,再把 observation 放回下一步上下文,使推理可以纠错、行动可以获取外部事实。
  • 2022-05 · MRKLmrkl):单个 LLM 容易在精确计算、时效知识和可验证推理上失败。MRKL 把 LLM 放入系统架构,由 router 根据输入选择语言模型、知识库、计算器等专家;离散模块保证确定性能力,语言模型负责理解和自然语言接口。
  • 2022-04 · SayCansaycan):LLM 知道“应该做什么”,却不知道当前机器人“能不能做”。SayCan 为每个预训练技能同时计算语言相关性和 value-function affordance,选择乘积最高的技能并执行,再把动作追加到上下文继续规划。

2021

  • 2021-12 · WebGPTwebgpt):长文本问答容易幻觉,且很难核查依据。WebGPT 让模型在文本浏览器里搜索、点击和滚动,回答必须收集引用;训练先做行为克隆,再用人类偏好 reward model 从多条浏览/回答轨迹中做拒绝采样。