跳转至

Agent 研究:按主题

采用“研究方向 → 方法簇 → 论文”的两级结构。一级用于快速定位研究范式,二级保留可比较的方法族;每篇论文独占一行,实验结果与复现边界请进入详情页查看。

其他

Agent 数据质量

研究自动化

  • AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systemsagentx):传统推荐迭代需要工程师串联假设、生产代码、上线 A/B 和归因,经验也难以跨实验积累。AgentX 将流程改造成四阶段闭环:Brainstorm Agent 从实验库、系统知识、数据分析和外部论文生成有证据的候选;Developing Agent 在仓库约束下实现并验证;Evaluation Agent 用护栏否决的线上 A/B 判断;最后以 SGPO 从成功与失败轨迹更新 Agent harness。

技能进化

论文到代码状态子规划

轨迹精炼

Harness 自进化

GUI Agent

Agent 评测

Agent 记忆

编程 Agent

记忆

工具规划

长期记忆

反思

自进化

Agentic RL

代码 Agent

训练服务优化

红队技能进化

科学 Agent

搜索 Agent

Agentic RL / efficient long context

  • Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Taskssinkflex-rl):长程工具 Agent 的 on-policy rollout 同时受环境状态、长上下文和训练显存限制。SinkFlex-RL 把 Gymnasium 双控制环境、VERL 风格数据流、无 value model 的 GRPO 与 sink-aware FlexAttention 组合,causal / sliding-window mask 下仍保留模型特有 sink scaling。

技能检索

工具调用与环境执行

工具选择、反馈与程序执行

  • Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasksfeedback-scaffold):论文指出统一反馈不适合整个探索过程:早期能力不足时使用 action guidance 降低搜索难度,后期则改为 observation enrichment,让 Agent 自己选择动作,避免长期依赖示范。
  • AdaVDR: Adaptive Tool Use and Reflection for Video Deep Researchadavdr):先以目标模型能力过滤不必要工具调用,只在中间证据不可靠时回退反思;SFT 后用 redundancy-aware reward 做 RL,兼顾视频理解、外部检索和调用成本。
  • SMITH: Self-Improving Tool-Using Agents through Multi-Aspect Verificationsmith):现有工具创建通常在推理时让冻结模型写代码,创建者与使用者没有联合信号。SMITH 在同一 policy 中混合 build task(从样例写 schema/backend)和 use task(在 held-out 问题调用池中工具),分别给 schema 合法性、代码执行和最终答案奖励,并用更难问题鼓励可复用抽象。
  • ToolGrad: Efficient Tool-Use Dataset Generation with Textual Gradientstoolgrad):先从目标答案反推工具轨迹,再使用 textual gradient 定位并修订失败调用,降低人工轨迹标注成本。
  • ToolRLtoolrl):联合优化工具选择、参数生成和执行结果;动态 reward scaling 让不同工具难度进入同一 RL batch。
  • ReToolretool):策略在自然语言 reasoning 与工具执行之间交替,并由可执行反馈学习调用、纠错和停止。
  • ToolBenchtoolbench):分析开源 LLM 工具失败后,组合程序化使用样例、system prompt、in-context demonstration retriever 与生成格式约束。
  • CRITICcritic):仅让 LLM 反思自己的文本可能重复同一错误。CRITIC 调用搜索、代码解释器等外部工具,把可观测反馈带回修订循环,使 critique 有环境证据。
  • ARTart):既有 tool-use prompting 常需为每个任务手写示例和调用顺序。ART 根据新任务自动检索相近的推理/工具示例,让冻结 LLM 生成程序;运行器遇到工具标记就暂停生成,执行工具并注入结果后继续。
  • Toolformertoolformer):手工标注工具调用昂贵,纯 prompting 又难以让较小模型稳定决定何时调用。Toolformer 先用少量 demonstration 采样 API call,再比较插入真实返回值、隐藏返回值和完全不调用时的后续 token loss,只保留确实有用的调用并继续语言模型训练。
  • PALpal):LLM 擅长把问题分解成步骤,却会在算术和符号执行阶段出错。PAL 让 LLM 输出带变量和控制流的程序,最终计算完全交给 Python 等确定性 runtime;模型只承担自然语言理解和程序合成。

电脑操作与 reward 评测

  • HarnessOpt-Bench: Evaluating LLMs at Harness Optimizationharnessopt-bench):主题:Harness 优化评测。 在固定 target-evaluation 预算下,让优化器修改 prompt、工具、控制流和记忆;隐藏测试集与可信执行环境隔离搜索反馈,保留候选版本以供审计。
  • OSReward / OS-Shepherdos-shepherd):电脑操作 Agent 需要 reward model 判断完整轨迹是否真的完成任务,但普通 accuracy 会掩盖“几乎全判成功”的宽松偏差。OSReward 汇集 Windows、macOS、Ubuntu、Android 的人工验证任务与轨迹,同时发布 Hard 和 Multi 子集;统一报告 success recall、fail recall 与两者均值 balanced accuracy,并用 OS-Shepherd-100K 训练开放 9B/35B judge。
  • GAIAgaia):以 466 个真实问题联合考查推理、多模态、网页浏览与工具使用,采用精确短答案和三级难度。

专家路由与具身 / 浏览环境

  • HuggingGPThugginggpt):单个 LLM 难以覆盖视觉、语音和其他专业任务,而模型社区已有大量专家。HuggingGPT 让 ChatGPT 充当控制器:先把请求拆成带依赖的子任务,再按 Hugging Face 模型描述匹配专家,按拓扑顺序执行,最后把多模型输出组织为用户答案。
  • MRKLmrkl):单个 LLM 容易在精确计算、时效知识和可验证推理上失败。MRKL 把 LLM 放入系统架构,由 router 根据输入选择语言模型、知识库、计算器等专家;离散模块保证确定性能力,语言模型负责理解和自然语言接口。
  • SayCansaycan):LLM 知道“应该做什么”,却不知道当前机器人“能不能做”。SayCan 为每个预训练技能同时计算语言相关性和 value-function affordance,选择乘积最高的技能并执行,再把动作追加到上下文继续规划。
  • WebGPTwebgpt):长文本问答容易幻觉,且很难核查依据。WebGPT 让模型在文本浏览器里搜索、点击和滚动,回答必须收集引用;训练先做行为克隆,再用人类偏好 reward model 从多条浏览/回答轨迹中做拒绝采样。

安全准入与可验证执行

  • SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agentssilr):系统已经违规时,安全门不能简单拒绝所有仍不安全的动作,而要允许逐步恢复。SiLR 先 shadow-execute 提案,再比较每个受约束分支的严重度;只有在乘积序上不恶化的动作可进入真实环境,同一结构信号还能作为 GRPO 过程奖励。

Agentic RL 与后训练

技能、turn 与 rollout credit

  • Agent-G²: Gaussian Guidance for Agentic Reinforcement Learningagent-g2):Hint-based Agent RL 保留专家轨迹前缀再让策略探索,但固定深度忽略任务难度,逐样本 probe 又浪费 rollout。Agent-G² 从已有 policy rollout 按难度簇估计 guidance band 的中心和方差,对每个任务采样不同前缀深度。
  • AUSO: Action-Level Unified Skill Optimization from Internalization to Utilizationauso):外部技能检索有上下文开销,完全内化又失去按任务选择能力;按整条轨迹成功率硬切阶段还无法判断某一个动作是否真正受益。AUSO 先用 skill-conditioned teacher 内化通用技能,再进行 outcome-driven exploration,最后对每个动作比较有技能和无技能策略的 JSD,以有界权重调整 GRPO advantage。
  • AgentOPSDagent-opsd):轨迹奖励难定位少数关键决策。AgentOPSD 把 privileged replay 的 token teacher/student log-prob gap 聚合成 turn evidence,再在 log-odds 空间递归更新成功信念,以相邻信念修订量识别 pivotal turn。
  • OCSDocsd):直接重放未来 observation 时,token 分数变化同时来自观测信息和重放脚手架。OCSD 构造结构完全匹配的 Full 与 Observation-Ablated 两个 replay,仅以二者残差调制高不确定 step 的 GRPO 更新。
  • CASTcast):把求解器状态价值的相邻差分变成 solver advantage,为稀疏结果奖励补充 turn 级 credit。
  • SEEDseed):从已完成轨迹中反思出可复用 hindsight skill,再用 skill 条件前后的动作概率变化形成稠密 on-policy 蒸馏信号。
  • TurnOPDturn-opd):用 probe 统计自适应决定 rollout 深度,并逐步把 token KL 预算迁移为 turn-normalized 监督。
  • SEARLsearl):把工具和成功转移维护为图记忆;新 rollout 同时更新 policy 与图边权,形成经验池—检索—改进闭环。

通用轨迹与 credit assignment

  • HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learningharness-bandit):联合 learnability、transferability 与探索 bonus 分配多 harness 训练预算。
  • T1: Terminal Agent Reinforcement Learning for Long-Horizon Taskst1-terminal-rl):TITO 使用 rollout 实际采样 token id 训练,turn boundary repair 修正漂移,R3 重放 MoE 路由选择。
  • What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agentsmulti-harness-rl):多 Harness RL 同时改变了执行环境多样性和 GRPO 的分组边界,难以判断增益来源。论文冻结相同 task-harness 轨迹,只比较组内和跨 harness advantage,并用训练中未见的最小 harness 审计能力是否真正迁移。
  • SPO++: Stabilizing Asynchronous Agentic Reinforcement Learning via Measure-Theoretic Token Correctionspo-plus-plus):SPO 用单 rollout 和持久 prompt value 避免等待 sibling,但 completion 顺序会污染历史,而且 trajectory whitening 与 token-mean actor loss 的测度不一致。SPO++ 按生成策略事件组织证据、dispatch 时冻结 baseline,并用动作 token 数加权标准化 advantage。
  • Group-Reflective Self-Distillationgrsd):轨迹终局 reward 混合了真正有效行为、重复错误与偶然选择。GRSD 让当前 policy 对同题 on-policy group 中每条已验证轨迹反思,再由参数相同的 stop-gradient 快照对比成功/失败反思,形成只在训练期可见的 DO/AVOID guidance,并调制 turn-level advantage。
  • TAPOtapo):稀疏任务 reward 只告诉 Agent 最终成败,没有利用每次动作后的环境反馈。TAPO 复用同一 rollout,在共享 backbone 上交替训练策略目标与 \((s_t,a_t)\to s_{t+1}\) 的 next-observation 预测,不增加采样、专家数据或推理开销。
  • StepPOsteppo):Agent 的自然决策单位是“观察—动作”的 environment step,token-level MDP 会让动作粒度和信用粒度错位。StepPO 将交互重写为 step-level MDP,在 step boundary 估值和做 GAE,并把 step 内 token ratio 聚合后再裁剪。
  • Agent-R1agent-r1):把每次 agent/environment 交互作为独立 transition,以可插拔上下文管理、环境接口与优化器支持 token 或 step 级信用。
  • Agent Lightningagent-lightning):传统 Agent RL 常把所有上下文拼成单序列并与框架强耦合。Agent Lightning 将执行记录成统一 MDP transition,以 credit assignment 拆解轨迹,并采用训练/执行分离架构。
  • GiGPOgigpo):多轮 Agent 的最终奖励稀疏,整条轨迹的 group relative advantage 无法判断哪个 environment step 做对了。GiGPO 先在完整轨迹组上计算 macro advantage,再按跨轨迹重复到达的 anchor state 建立 step group,计算 micro relative advantage。

环境模型与 world rehearsal

  • AHEAD: Agentic Hints for Effective Agent Developmentahead):轨迹级 GRPO 给所有步骤同一 advantage;统一 privileged information 又浪费在普通步骤上。AHEAD 先分析失败轨迹定位关键错误:所有步骤的 teacher 都看到环境反馈,只有错误步骤额外看到 LLM corrective hint;teacher/student log-prob gap 被有界地注入 GRPO advantage。
  • EnvACEenvace):EnvACE 不另训 world model,而让同一个 agent policy 在真实 act 之间切换到 rehearsal role,自行预测下一 observation;训练时分别为 acting 与 rehearsal 轨迹计算 group-relative advantage,避免两种奖励尺度互相污染,测试时可用少量私有 rehearsal 扩展规划。
  • State2State: Environment-Derived Mid-Training for LLM Agentsstate2state):主题:环境派生中训练。 从环境探索自动采样起点与目标状态,用规则化状态匹配做 verifier,形成无需人工任务与专家轨迹的可扩展 mid-training。

Harness 与运行时策略

搜索、网页与多轮交互 RL

  • Contextual Information Policy Optimization for Search Agentscipo):主题:搜索 Agent RL。 只奖励最终答案会让检索退化成确认偏见。
  • HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learninghindsearch):主题:搜索轨迹 hindsight。 冻结 judge 利用 gold answer 为失败搜索轨迹生成逐轨迹 critique,把只有成败的稀疏信号转成辅助 on-policy distillation 信号,并与 GRPO 联合。
  • PEARLpearl):多跳工具调用同时受工具幻觉、参数错误和长程规划薄弱影响。PEARL 的离线阶段用 trial-and-error 建立工具用法与失败条件;在线阶段把 Planner 与 Executor 解耦,用计划正确性、工具链与最终结果组成的密集 reward 进行 GRPO,而不是只依赖稀疏成功信号。
  • MUA-RLmua-rl):既有 tool-use RL 通常把用户请求视为固定输入,但真实用户会根据 Agent 回答不断修改需求。MUA-RL 将 LLM 模拟用户直接放入 rollout,Agent 在对话中澄清意图并调用真实 MCP/数据库工具;用户消息和工具结果不计入策略 loss,只用最终任务完成奖励鼓励探索。
  • WebAgent-R1webagent-r1):网页交互会不断累积 HTML 和历史动作,单轮 GRPO 无法处理状态变化。WebAgent-R1 动态保留近期和任务相关上下文,并行采集完整多轮轨迹,再用 M-GRPO 根据最终成功奖励执行组内相对更新;论文同时强调行为克隆 warm-up 和长 CoT 初始化。
  • RAGENragen):单轮数学 RL 的优化单位是一次回答,而 Agent 要在随机环境中跨多轮决策。RAGEN 提出 StarPO,把 state、thinking、action 和 reward 组织成完整轨迹。
  • DeepResearcherdeepresearcher):把 search、browse、证据收集和带引用回答作为一条轨迹,用答案与引用联合奖励训练研究策略。
  • Search-R1search-r1):普通 RAG 一次检索后再回答,无法让策略根据中间证据继续调整查询。Search-R1 把搜索引擎视为环境:模型可在 reasoning 中多次输出搜索动作,环境返回文档后继续推理。
  • LOOPloop):长程数字 Agent 的 rollout 昂贵,而传统 PPO 还要维护 value model。LOOP 把 PPO trust region 与 leave-one-out baseline 结合:无需 critic,可对同一批轨迹进行多次更新;逐 token importance ratio 只裁剪漂移 token,不丢弃整条长轨迹。

多 Agent 与软件工程

角色协作与软件开发

  • CERA-MoA: Co-Evolving Router and Agents for Mixture-of-Agentscera-moa):用中层隐藏状态估计 Agent 对样本的熟悉度,以累计阈值自适应选专家,并把训练样本定向分配给相应专家。
  • CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agentscodegrep):主题:代码检索 Agent。 以 GRPO 训练 14B 检索 Agent 并行发出 grep/glob/read,多轮缩小候选文件,再交给冻结 coding agent;优化的是下游修复收益而非孤立检索分数。
  • MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systemsmanta):根据任务先验初始化通信拓扑,运行中监控协作 trace,并有界调整角色、边、顺序、可见性和验证路径。
  • Agent0agent0):任务生成 Agent 提议可验证工具任务,多个执行 Agent 产生候选并多数投票,课程按当前能力边界升级。
  • OpenHandsopenhands):OpenHands 提供开放的软件 Agent 平台,把终端、编辑器、浏览器等动作统一到 event stream,并以 sandbox 隔离执行,覆盖修 bug、写代码和仓库维护。
  • SWE-agentswe-agent):通用 shell 对 LLM 而言动作空间过宽、输出冗长。SWE-agent 用专门 ACI 约束仓库搜索、文件查看、精确编辑和测试,让模型能围绕 issue 定位故障并验证 patch。
  • AutoGenautogen):复杂应用常需要多个模型、工具和人类协作,手写控制流难复用。AutoGen 提供 ConversableAgent 与 conversation programming:每个角色声明能力、回复策略和终止条件,通过群聊或嵌套会话组合成工作流。
  • MetaGPTmetagpt):简单串联多个聊天 Agent 容易让幻觉级联。MetaGPT 把人类软件团队的 SOP 编码成角色化消息流程,每个角色生产结构化中间物,由下游角色消费和验证。
  • CAMELcamel):用 inception prompting 固定 user/assistant 的角色、目标和边界,通过轮流消息完成任务并生成可研究的多 Agent 社会轨迹。

运行成本与工具暴露控制

  • ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffsprogrouter):用多视角 scorer 衡量子任务完成度、进展趋势和状态质量,再由双路径 predictor 估计候选模型的边际进展,以 meta-gate 在质量、时间和长期成本预算间逐步决策。
  • TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Servingtopas):在共享 KV-cache 预算下,同时估算工作流最长剩余路径与下游 prefix reuse 收益,并纳入 prefix 移动、抢占和 aging,避免只优化局部命中率或单请求进度。
  • CAM-DFcam-df):工具 router 只能给出相关性排序,不能回答“应该开放前几个工具”。CAM-DF 在任何工具执行前虚拟遍历排序前缀,以任务充分性减异构工具成本作为 payoff;停止当前前缀与最佳后续前缀的 payoff gap 决定标签,gap 绝对值决定错误的 regret 权重。

ML / 软件开发轨迹

记忆、技能与持续学习

主动 / 长期记忆

  • MemForest: Efficient Agent Memory Management via EventTree Partitioning and Progressive Mergingmemforest):MemForest 不把全部历史压进一条摘要,而是先按事件切分成多棵树,再在容量压力下渐进合并节点。查询从语义 anchor 出发向邻域传播,保留时间结构和跨事件关联。
  • AtomRec: Evolving Atomic Memory for Agentic Recommendationatomrec):粗粒度用户摘要会在重写时覆盖旧偏好,单一协同边又难以解释推荐。AtomRec 将用户和物品历史拆成可独立演化的原子字段,建立语义协同链接,并以多跳路径取回“为什么推荐”的证据。
  • When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systemscovemem):文本记忆要反复调用 LLM 重写,且丢掉全目录协同几何。CoVeMem 用冻结 LightGCN 状态构造 bank,由当前候选集检索相关历史,投影成 soft token,并通过语义对齐和 masked listwise 联训让 LLM 真正读取记忆。
  • MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-offmemorycpt):主题:端到端 Agent 记忆。 QAD 将离线记忆构建链蒸馏为紧凑模型;QAR 用 RRF 检索和 LoRA summarizer 生成查询相关上下文,并以成本感知 GRPO 优化 Quality per Cost。
  • VerMemvermem):长期记忆、活动上下文与 episodic history 往往分开优化,轨迹奖励无法判断单次记忆操作是否正确。VerMem 用一个策略管理三类状态和七种原子操作,以 local verifier 审核状态转移、global verifier 审核证据一致性。
  • U-Memu-mem):传统 Agent 记忆通常被动写入和检索,缺少“当前知识不够时主动去哪里找”的决策。U-Mem 将获取过程建模为成本递增的级联:先尝试 self/teacher,再做工具研究,最后请求 expert;检索结合语义相似度与 Thompson sampling,并在写回前验证和整理记忆。
  • LEGOMemlegomem):整段成功轨迹难以迁移到新任务,单一全局记忆又混合了任务分解和工具执行。LEGOMem 把经验拆成像积木一样的 procedural units:orchestrator memory 保存任务分解与委派,agent memory 保存具体动作模板,运行时按新任务重新组合。
  • MemToolmemtool):大量 MCP 工具描述会迅速占满上下文,静态截断又可能删掉当前工作流需要的工具。MemTool 比较 autonomous、workflow 和 hybrid 管理方式;hybrid 策略保护当前工作流的必需工具,其余工具依据近期性和历史成功率动态淘汰。
  • MemGPTmemgpt):有限 context window 使长文档和多轮会话不断遗忘。MemGPT 借鉴操作系统虚拟内存,把常驻核心信息、当前工作上下文和外部归档分层管理;模型通过函数调用移动数据,并以 interrupt/heartbeat 控制继续推理和与用户交互。
  • Generative Agentsgenerative-agents):只把完整历史塞给 LLM 无法支撑长期一致行为。论文把每次观察写入 memory stream,按 recency、importance、relevance 检索;累计重要事件达到阈值后生成更高层 reflection,再结合记忆与当前状态制定日程和行动计划。

技能图与跨任务积累

  • CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolutioncoskill):以往技能库要么与策略优化分离,要么把元技能写成固定工作流。CoSkill 让 Reasoning Agent 使用任务技能及其子步骤技能,让可学习 Meta-Skill Agent 根据执行回报改写技能;二者共享 backbone 并端到端联合训练。
  • SPT: Skills as Pre-Training Data for Agentic Language Modelsspt):Agent 轨迹昂贵且只描述一次执行;skill package 则显式编码可复用工作流。SPT 在 post-training 前对 SkillCorpus 做 causal LM mid-training,并把被引用文件插到主说明的首次引用附近。
  • CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrievalcaskg):先从语义、词法、I/O 和结构证据建高召回有向图,再以 remove、substitute、reorder 三类文本反事实探针校准边,Bayesian smoothing 后只发布可靠关系。
  • SkillForge: Automated Skill Discovery and Refinement for Tool-Using Agentsskillforge):SkillRL 类方法从轨迹提取技能后只追加,错误和过时技能会永久污染库。SkillForge 让 policy 输出环境动作时显式选择技能,把调用决策纳入 RL;成功、失败和对比轨迹经多路径 induction 生成候选,环境证据再决定激活、修订或去重。
  • Learning Globally Reusable Skills for Coding Agentsgse):主题:全局技能进化。 GSE 用 Skill Relation Graph 显式维护技能关系,以聚类合并局部经验,并通过 replay verification 防止过拟合与行为回退。
  • When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agentsvag):主题:技能进化安全。 技能一旦进入上下文会污染后代,事后删除无法彻底回滚。
  • CoEvo-Memcoevo-mem):只优化 query routing 或只更新 memory bank 会忽略二者反馈环。CoEvo-Mem 让冻结 LLM 生成 route-specific rewrite 和 prior,轻量 residual router 在线修正;任务结果更新路由,轨迹反馈更新 memory value 与 graph relation,并交替冻结一侧控制非平稳性。
  • SkillRiseskillrise):标准 Agent RL 把任务视为独立 episode,外部 skill bank 又把抽取、检索和执行缠在一起。SkillRise 把相关但不同的任务排成由易到难的序列,让同一 policy 交替求解当前任务与整理一个直接传给下一任务的 skill document;求解阶段由当前结果监督,整理阶段由折扣后的下游任务结果监督。
  • HiSkillhiskill):用高层 skill、可执行 AtomicOp 和多类有向边组织经验,推理时只检索任务相关子图来落地动作。
  • UniMemunimem):新颖任务先进入 episodic buffer;反复出现且可靠的执行模式再被自路由控制器固化到可扩展 parametric memory。
  • Memento-Skillsmemento-skills):从执行日志反思出结构化技能说明,按任务检索并写回版本化技能,而不是原样堆叠轨迹。
  • MemSkillmemskill):controller 从历史 episode 选择记忆,designer 将重复成功模式编译为技能,并随新反馈升级技能版本。
  • SAGEsage):从成功轨迹抽象技能,失败时修订或淘汰,并以任务回报学习技能检索与复用。
  • Voyagervoyager):开放世界 Agent 需要持续选择有新颖性的任务、把成功行为积累为技能,并根据环境报错修复程序。Voyager 用 GPT-4 自动生成 curriculum,以代码作为动作空间;成功程序按描述索引进 skill library,新任务检索并组合已有技能。

规划、搜索与反思

Harness 与自我改进

树搜索与自我改进

  • LATSlats):ReAct 等方法通常沿单条轨迹行动,失败后缺少系统搜索。LATS 把 LM 同时作为 agent、value function 和 optimizer,嵌入 Monte Carlo Tree Search;环境执行提供外部 reward,失败轨迹生成 reflection,帮助后续搜索避开错误。
  • Tree of Thoughtstree-of-thoughts):自回归生成和单条 CoT 很难撤销早期错误。ToT 将中间推理视为可独立评价的 thought,在树上生成多个候选,使用语言模型 value 函数选择 BFS/DFS frontier,并允许 lookahead 和 backtracking。
  • Self-Refineself-refine):一次生成很难同时满足所有约束。Self-Refine 让同一个 LLM 先生成初稿,再针对任务维度给出可执行反馈,最后据此改写;若反馈判断已满足要求则停止,不需要额外训练数据、人工反馈或外部 reward model。
  • Reflexionreflexion):传统 RL 要大量采样与参数更新。Reflexion 把稀疏标量/二值反馈“放大”为可执行的自然语言经验,写入长期 episodic memory;Actor 在下一 trial 读取反思,Evaluator 继续判定成功与否。

交替推理与任务分解

  • ReWOOrewoo):ReAct 在每次工具返回后重新调用 LLM,token 和推理成本随轨迹增长。ReWOO 的 Planner 用变量引用写出完整多步计划,Worker 只负责填入工具证据,Solver 最后读取计划与证据生成答案,因此 Planner 不被中间观察反复打断。
  • ReActreact):纯 CoT 容易在封闭知识上幻觉,纯 action agent 又缺少计划与状态跟踪。ReAct 让模型交替生成自然语言推理和环境 action,再把 observation 放回下一步上下文,使推理可以纠错、行动可以获取外部事实。