跳转至

Agent 研究:按机构/公司/学校

按论文一作的第一署名单位聚合;单位内按首次公开日期倒序排列。每篇论文同时显示一作姓名,并附一至两句中文方法简介。联合工作不会重复归入所有合作单位。

AI21 Labs

  • 2022-05-01 · 一作:Ehud Karpas · MRKLmrkl):单个 LLM 容易在精确计算、时效知识和可验证推理上失败。MRKL 把 LLM 放入系统架构,由 router 根据输入选择语言模型、知识库、计算器等专家;离散模块保证确定性能力,语言模型负责理解和自然语言接口。

AMAP, Alibaba Group

  • 2026-08-25 · 一作:Shidong Yang · SkillForge: Automated Skill Discovery and Refinement for Tool-Using Agentsskillforge):SkillRL 类方法从轨迹提取技能后只追加,错误和过时技能会永久污染库。SkillForge 让 policy 输出环境动作时显式选择技能,把调用决策纳入 RL;成功、失败和对比轨迹经多路径 induction 生成候选,环境证据再决定激活、修订或去重。

AWS AI Labs / Purdue University

  • 2026-08-25 · 一作:Xiaolong Jin · AHEAD: Agentic Hints for Effective Agent Developmentahead):轨迹级 GRPO 给所有步骤同一 advantage;统一 privileged information 又浪费在普通步骤上。AHEAD 先分析失败轨迹定位关键错误:所有步骤的 teacher 都看到环境反馈,只有错误步骤额外看到 LLM corrective hint;teacher/student log-prob gap 被有界地注入 GRPO advantage。

Academic author team

  • 2026-07-07 · 一作:Yuhang Zhou · TurnOPDturn-opd):用 probe 统计自适应决定 rollout 深度,并逐步把 token KL 预算迁移为 turn-normalized 监督。

Accio Team, Alibaba Group

Adelaide University

All-Hands-AI

  • 2024-07-23 · 一作:Xingyao Wang · OpenHandsopenhands):OpenHands 提供开放的软件 Agent 平台,把终端、编辑器、浏览器等动作统一到 event stream,并以 sandbox 隔离执行,覆盖修 bug、写代码和仓库维护。

Appier AI Research / National Taiwan University

  • 2026-08-25 · 一作:Zhi Rui Tam · SMITH: Self-Improving Tool-Using Agents through Multi-Aspect Verificationsmith):现有工具创建通常在推理时让冻结模型写代码,创建者与使用者没有联合信号。SMITH 在同一 policy 中混合 build task(从样例写 schema/backend)和 use task(在 held-out 问题调用池中工具),分别给 schema 合法性、代码执行和最终答案奖励,并用更难问题鼓励可复用抽象。

Apple

  • 2025-02-03 · 一作:Kevin Chen · LOOPloop):长程数字 Agent 的 rollout 昂贵,而传统 PPO 还要维护 value model。LOOP 把 PPO trust region 与 leave-one-out baseline 结合:无需 critic,可对同一批轨迹进行多次更新;逐 token importance ratio 只裁剪漂移 token,不丢弃整条长轨迹。

Aston University

Authors did not disclose affiliation

Baidu

  • 2026-08-24 · 一作:Zixuan Wang · Agent-G²: Gaussian Guidance for Agentic Reinforcement Learningagent-g2):Hint-based Agent RL 保留专家轨迹前缀再让策略探索,但固定深度忽略任务难度,逐样本 probe 又浪费 rollout。Agent-G² 从已有 policy rollout 按难度簇估计 guidance band 的中心和方差,对每个任务采样不同前缀深度。

Baidu Inc.

  • 2026-07-30 · 一作:Binbin Zheng · Group-Reflective Self-Distillationgrsd):轨迹终局 reward 混合了真正有效行为、重复错误与偶然选择。GRSD 让当前 policy 对同题 on-policy group 中每条已验证轨迹反思,再由参数相同的 stop-gradient 快照对比成功/失败反思,形成只在训练期可见的 DO/AVOID guidance,并调制 turn-level advantage。

Beihang University

Beijing University of Posts and Telecommunications

  • 2026-08-27 · 一作:Yufei Sun · SPT: Skills as Pre-Training Data for Agentic Language Modelsspt):Agent 轨迹昂贵且只描述一次执行;skill package 则显式编码可复用工作流。SPT 在 post-training 前对 SkillCorpus 做 causal LM mid-training,并把被引用文件插到主说明的首次引用附近。
  • 2026-07-28 · 一作:Yu Hao · HiSkillhiskill):用高层 skill、可执行 AtomicOp 和多类有向边组织经验,推理时只检索任务相关子图来落地动作。

ByteDance Seed

  • 2025-04-15 · 一作:Jiazhan Feng · ReToolretool):策略在自然语言 reasoning 与工具执行之间交替,并由可执行反馈学习调用、纠错和停止。

CASIA

  • 2026-07-28 · 一作:Siyu Xia · UniMemunimem):新颖任务先进入 episodic buffer;反复出现且可靠的执行模式再被自路由控制器固化到可扩展 parametric memory。

Capital One AI Foundations

  • 2026-08-11 · 一作:Zelei Cheng · Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Taskssinkflex-rl):长程工具 Agent 的 on-policy rollout 同时受环境状态、长上下文和训练显存限制。SinkFlex-RL 把 Gymnasium 双控制环境、VERL 风格数据流、无 value model 的 GRPO 与 sink-aware FlexAttention 组合,causal / sliding-window mask 下仍保留模型特有 sink scaling。

Carnegie Mellon University

  • 2026-08-26 · 一作:Jiarui Yan · TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Developmenttraceml):统一记录每个代码版本、得分、动作意图、编辑规模和效果,比较 4465 条人类轨迹与 Agent 轨迹;把人类会交替阶段、回开旧方案的规律蒸馏成 planning prior。
  • 2023-03-30 · 一作:Aman Madaan · Self-Refineself-refine):一次生成很难同时满足所有约束。Self-Refine 让同一个 LLM 先生成初稿,再针对任务维度给出可执行反馈,最后据此改写;若反馈判断已满足要求则停止,不需要额外训练数据、人工反馈或外部 reward model。
  • 2022-11-18 · 一作:Luyu Gao · PALpal):LLM 擅长把问题分解成步骤,却会在算术和符号执行阶段出错。PAL 让 LLM 输出带变量和控制流的程序,最终计算完全交给 Python 等确定性 runtime;模型只承担自然语言理解和程序合成。

Chengdu Institute of Computer Applications, Chinese Academy of Sciences

City University of Hong Kong

Cornell University

DeepWisdom

  • 2023-08-01 · 一作:Sirui Hong · MetaGPTmetagpt):简单串联多个聊天 Agent 容易让幻觉级联。MetaGPT 把人类软件团队的 SOP 编码成角色化消息流程,每个角色生产结构化中间物,由下游角色消费和验证。

Duke University

Fudan University

Gen-Verse research collaboration

Google

Google Research / Hebrew University of Jerusalem / University of Cambridge

HKU

  • 2025-04-04 · 一作:Yuxiang Zheng · DeepResearcherdeepresearcher):把 search、browse、证据收集和带引用回答作为一条轨迹,用答案与引用联合奖励训练研究策略。

Harbin Institute of Technology / Alibaba Cloud

Harbin Institute of Technology, Shenzhen

  • 2026-09-10 · 一作:Kesheng Chen · MAPLE: Memory-Augmented Planning with Language and Evolutionmaple):MAPLE 把自然语言优化知识变成可持续修改的程序状态:生成候选、检查可执行性、接纳更好的方案,并把已接受程序带到后续问题中继续进化,而不是每次从零提示。

Harbin Institute of Technology, Shenzhen / Pengcheng Laboratory

Hong Kong University of Science and Technology / Tencent LIGHTSPEED STUDIOS

Huawei Technologies Co., Ltd

  • 2026-08-27 · 一作:Xingshan Zeng · What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agentsace-data):论文把 Agent 数据统一表示为 \((E,q,\tau,v)\):环境、任务、交互轨迹与可选 verifier。Accuracy 先限定可信支持集,Complexity 相对指定学习者校准难度,Diversity 再控制环境、任务和行为覆盖。

IIIS, Tsinghua University

Institute of Automation, Chinese Academy of Sciences

Institute of Computing Technology, Chinese Academy of Sciences

Institute of Science Tokyo

  • 2026-09-03 · 一作:Chenyu Zhou · SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agentssilr):系统已经违规时,安全门不能简单拒绝所有仍不安全的动作,而要允许逐步恢复。SiLR 先 shadow-execute 提案,再比较每个受约束分支的严重度;只有在乘积序上不恶化的动作可进入真实环境,同一结构信号还能作为 GRPO 过程奖励。

Jilin University / Ant Group

King Abdullah University of Science and Technology

  • 2023-03-31 · 一作:Guohao Li · CAMELcamel):用 inception prompting 固定 user/assistant 的角色、目标和边界,通过轮流消息完成任务并生成可研究的多 Agent 社会轨迹。

Kuaishou

  • 2026-06-26 · 一作:AgentX Team · AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systemsagentx):传统推荐迭代需要工程师串联假设、生产代码、上线 A/B 和归因,经验也难以跨实验积累。AgentX 将流程改造成四阶段闭环:Brainstorm Agent 从实验库、系统知识、数据分析和外部论文生成有证据的候选;Developing Agent 在仓库约束下实现并验证;Evaluation Agent 用护栏否决的线上 A/B 判断;最后以 SGPO 从成功与失败轨迹更新 Agent harness。

LV-NUS Lab

Manulife

Meituan

  • 2025-08-26 · 一作:Weikang Zhao · MUA-RLmua-rl):既有 tool-use RL 通常把用户请求视为固定输入,但真实用户会根据 Agent 回答不断修改需求。MUA-RL 将 LLM 模拟用户直接放入 rollout,Agent 在对话中澄清意图并调用真实 MCP/数据库工具;用户消息和工具结果不计入策略 loss,只用最终任务完成奖励鼓励探索。

Memento Team

  • 2026-03-19 · 一作:Huichi Zhou · Memento-Skillsmemento-skills):从执行日志反思出结构化技能说明,按任务检索并写回版本化技能,而不是原样堆叠轨迹。

Meta AI

  • 2023-11-21 · 一作:Grégoire Mialon · GAIAgaia):以 466 个真实问题联合考查推理、多模态、网页浏览与工具使用,采用精确短答案和三级难度。

Meta AI Research

  • 2023-02-09 · 一作:Timo Schick · Toolformertoolformer):手工标注工具调用昂贵,纯 prompting 又难以让较小模型稳定决定何时调用。Toolformer 先用少量 demonstration 采样 API call,再比较插入真实返回值、隐藏返回值和完全不调用时的后续 token loss,只保留确实有用的调用并继续语言模型训练。

Microsoft

  • 2026-09-09 · 一作:Susheel Suresh · Grounding Agent Memory: Environment-Probing Curation for Enterprise Agentsgrounded-memory):给异步记忆 curator 最小权限只读工具,在写入前验证、限定作用域并刷新候选记忆。
  • 2023-05-19 · 一作:Zhibin Gou · CRITICcritic):仅让 LLM 反思自己的文本可能重复同一错误。CRITIC 调用搜索、代码解释器等外部工具,把可观测反馈带回修订循环,使 critique 有环境证据。

Microsoft / POSTECH

  • 2026-08-24 · 一作:Sungho Park · AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Tracesautosaddler):长任务中 prompt、tool configuration 和 middleware 的小错误会累积,而人工调 harness 成本高。AutoSaddler 把 harness 当代码:从 mini-batch 失败 trace 做深度诊断,生成有边界的结构化 patch,在同 batch 检查因果效果,再用 dev set 选更新并写入 EvoDAG,形成可持续版本。

Microsoft Research

  • 2025-10-06 · 一作:Dongge Han · LEGOMemlegomem):整段成功轨迹难以迁移到新任务,单一全局记忆又混合了任务分解和工具执行。LEGOMem 把经验拆成像积木一样的 procedural units:orchestrator memory 保存任务分解与委派,agent memory 保存具体动作模板,运行时按新任务重新组合。
  • 2025-08-05 · 一作:Xufang Luo · Agent Lightningagent-lightning):传统 Agent RL 常把所有上下文拼成单序列并与框架强耦合。Agent Lightning 将执行记录成统一 MDP transition,以 credit assignment 拆解轨迹,并采用训练/执行分离架构。
  • 2023-08-16 · 一作:Qingyun Wu · AutoGenautogen):复杂应用常需要多个模型、工具和人类协作,手写控制流难复用。AutoGen 提供 ConversableAgent 与 conversation programming:每个角色声明能力、回复策略和终止条件,通过群聊或嵌套会话组合成工作流。
  • 2023-05-29 · 一作:Binfeng Xu · ReWOOrewoo):ReAct 在每次工具返回后重新调用 LLM,token 和推理成本随轨迹增长。ReWOO 的 Planner 用变量引用写出完整多步计划,Worker 只负责填入工具证据,Solver 最后读取计划与证据生成答案,因此 Planner 不被中间观察反复打断。

NVIDIA

  • 2023-05-25 · 一作:Guanzhi Wang · Voyagervoyager):开放世界 Agent 需要持续选择有新颖性的任务、把成功行为积累为技能,并根据环境报错修复程序。Voyager 用 GPT-4 自动生成 curriculum,以代码作为动作空间;成功程序按描述索引进 skill library,新任务检索并组合已有技能。

Nanjing University

  • 2026-08-05 · 一作:Yi Yang · OCSDocsd):直接重放未来 observation 时,token 分数变化同时来自观测信息和重放脚手架。OCSD 构造结构完全匹配的 Full 与 Observation-Ablated 两个 replay,仅以二者残差调制高不确定 step 的 GRPO 更新。

Nanyang Technological University

  • 2026-02-02 · 一作:Haozhen Zhang · MemSkillmemskill):controller 从历史 episode 选择记忆,designer 将重复成功模式编译为技能,并随新反馈升级技能版本。
  • 2025-05-16 · 一作:Lang Feng · GiGPOgigpo):多轮 Agent 的最终奖励稀疏,整条轨迹的 group relative advantage 无法判断哪个 environment step 做对了。GiGPO 先在完整轨迹组上计算 macro advantage,再按跨轨迹重复到达的 anchor state 建立 step group,计算 micro relative advantage。

National University of Singapore

  • 2026-02-25 · 一作:Xinle Wu · U-Memu-mem):传统 Agent 记忆通常被动写入和检索,缺少“当前知识不够时主动去哪里找”的决策。U-Mem 将获取过程建模为成本递增的级联:先尝试 self/teacher,再做工具研究,最后请求 expert;检索结合语义相似度与 Thompson sampling,并在写回前验证和整理记忆。

National University of Singapore / Tencent

NetEase Guangzhou AI Lab

  • 2026-08-06 · 一作:Wuya Chen · CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agentscodegrep):主题:代码检索 Agent。 以 GRPO 训练 14B 检索 Agent 并行发出 grep/glob/read,多轮缩小候选文件,再交给冻结 coding agent;优化的是下游修复收益而非孤立检索分数。

New York University

Northeastern University

  • 2023-03-20 · 一作:Noah Shinn · Reflexionreflexion):传统 RL 要大量采样与参数更新。Reflexion 把稀疏标量/二值反馈“放大”为可执行的自然语言经验,写入长期 episodic memory;Actor 在下一 trial 读取反思,Evaluator 继续判定成功与否。

Northwestern

  • 2025-04-24 · 一作:Zihan Wang · RAGENragen):单轮数学 RL 的优化单位是一次回答,而 Agent 要在随机环境中跨多轮决策。RAGEN 提出 StarPO,把 state、thinking、action 和 reward 组织成完整轨迹。

OpenAI

  • 2021-12-17 · 一作:Reiichiro Nakano · WebGPTwebgpt):长文本问答容易幻觉,且很难核查依据。WebGPT 让模型在文本浏览器里搜索、点击和滚动,回答必须收集引用;训练先做行为克隆,再用人类偏好 reward model 从多条浏览/回答轨迹中做拒绝采样。

Peking University

  • 2026-07-30 · 一作:Cong Li · TAPOtapo):稀疏任务 reward 只告诉 Agent 最终成败,没有利用每次动作后的环境反馈。TAPO 复用同一 rollout,在共享 backbone 上交替训练策略目标与 \((s_t,a_t)\to s_{t+1}\) 的 next-observation 预测,不增加采样、专家数据或推理开销。
  • 2026-07-29 · 一作:Yicheng Feng · CAM-DFcam-df):工具 router 只能给出相关性排序,不能回答“应该开放前几个工具”。CAM-DF 在任何工具执行前虚拟遍历排序前缀,以任务充分性减异构工具成本作为 payoff;停止当前前缀与最佳后续前缀的 payoff gap 决定标签,gap 绝对值决定错误的 regret 权重。

PricewaterhouseCoopers Commercial Technology and Innovation Office

  • 2025-07-29 · 一作:Elias Lumer · MemToolmemtool):大量 MCP 工具描述会迅速占满上下文,静态截断又可能删掉当前工作流需要的工具。MemTool 比较 autonomous、workflow 和 hybrid 管理方式;hybrid 策略保护当前工作流的必需工具,其余工具依据近期性和历史成功率动态淘汰。

Princeton University

  • 2024-05-06 · 一作:John Yang · SWE-agentswe-agent):通用 shell 对 LLM 而言动作空间过宽、输出冗长。SWE-agent 用专门 ACI 约束仓库搜索、文件查看、精确编辑和测试,让模型能围绕 issue 定位故障并验证 patch。
  • 2023-05-17 · 一作:Shunyu Yao · Tree of Thoughtstree-of-thoughts):自回归生成和单条 CoT 很难撤销早期错误。ToT 将中间推理视为可独立评价的 thought,在树上生成多个候选,使用语言模型 value 函数选择 BFS/DFS frontier,并允许 lookahead 和 backtracking。
  • 2022-10-06 · 一作:Shunyu Yao · ReActreact):纯 CoT 容易在封闭知识上幻觉,纯 action agent 又缺少计划与状态跟踪。ReAct 让模型交替生成自然语言推理和环境 action,再把 observation 放回下一步上下文,使推理可以纠错、行动可以获取外部事实。

Renmin University of China

Robotics at Google

  • 2022-04-04 · 一作:Michael Ahn · SayCansaycan):LLM 知道“应该做什么”,却不知道当前机器人“能不能做”。SayCan 为每个预训练技能同时计算语言相关性和 value-function affordance,选择乘积最高的技能并执行,再把动作追加到上下文继续规划。

Santa Clara University

Scale AI

  • 2026-08-06 · 一作:Varun Ursekar · HarnessOpt-Bench: Evaluating LLMs at Harness Optimizationharnessopt-bench):主题:Harness 优化评测。 在固定 target-evaluation 预算下,让优化器修改 prompt、工具、控制流和记忆;隐藏测试集与可信执行环境隔离搜索反馈,保留候选版本以供审计。

Shanghai AI Laboratory

  • 2026-04-09 · 一作:Xinshun Feng · SEARLsearl):把工具和成功转移维护为图记忆;新 rollout 同时更新 policy 与图边权,形成经验池—检索—改进闭环。

Shanghai Jiao Tong

  • 2026-08-06 · 一作:Zishan Xu · EnvACEenvace):EnvACE 不另训 world model,而让同一个 agent policy 在真实 act 之间切换到 rehearsal role,自行预测下一 observation;训练时分别为 acting 与 rehearsal 轨迹计算 group-relative advantage,避免两种奖励尺度互相污染,测试时可用少量私有 rehearsal 扩展规划。

Shanghai Jiao Tong University

ShanghaiTech University

Shenzhen Technology University

Stanford University

  • 2023-04-07 · 一作:Joon Sung Park · Generative Agentsgenerative-agents):只把完整历史塞给 LLM 无法支撑长期一致行为。论文把每次观察写入 memory stream,按 recency、importance、relevance 检索;累计重要事件达到阈值后生成更高层 reflection,再结合记忆与当前状态制定日程和行动计划。

Sun Yat-sen University

  • 2026-08-27 · 一作:Dewu Zheng · SWE-Prime: Fewer Trajectories, Better Performanceswe-prime):成功轨迹仍可能冗余、危险或不可学习。SWE-Prime 先按过程、结果和代表性选轨迹,再按贡献、可学习性和风险选语义段;上下文完整保留,但只对选中段计算 SFT loss。
  • 2026-08-04 · 一作:Xiaolong Sun · VerMemvermem):长期记忆、活动上下文与 episodic history 往往分开优化,轨迹奖励无法判断单次记忆操作是否正确。VerMem 用一个策略管理三类状态和七种原子操作,以 local verifier 审核状态转移、global verifier 审核证据一致性。

The Chinese University of Hong Kong, Shenzhen

The University of Hong Kong

  • 2026-07-30 · 一作:Qiushi Sun · OSReward / OS-Shepherdos-shepherd):电脑操作 Agent 需要 reward model 判断完整轨迹是否真的完成任务,但普通 accuracy 会掩盖“几乎全判成功”的宽松偏差。OSReward 汇集 Windows、macOS、Ubuntu、Android 的人工验证任务与轨迹,同时发布 Hard 和 Multi 子集;统一报告 success recall、fail recall 与两者均值 balanced accuracy,并用 OS-Shepherd-100K 训练开放 9B/35B judge。

Tianjin University

  • 2026-08-06 · 一作:Chen Yang · Learning Globally Reusable Skills for Coding Agentsgse):主题:全局技能进化。 GSE 用 Skill Relation Graph 显式维护技能关系,以聚类合并局部经验,并通过 replay verification 防止过拟合与行为回退。

Tsinghua University

  • 2026-08-10 · 一作:Siqi Wang · OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasksopenloopevolve):把 observation/planning/memory/action/verification/recovery 等 Loop Policy 资产版本化,以 Champion–Challenger、发布监控和回滚治理进化。
  • 2026-08-06 · 一作:Zi-Han Wang · AgentOPSDagent-opsd):轨迹奖励难定位少数关键决策。AgentOPSD 把 privileged replay 的 token teacher/student log-prob gap 聚合成 turn evidence,再在 log-odds 空间递归更新成功信念,以相邻信念修订量识别 pivotal turn。
  • 2026-07-16 · 一作:Jinyang Wu · SEEDseed):从已完成轨迹中反思出可复用 hindsight skill,再用 skill 条件前后的动作概率变化形成稠密 on-policy 蒸馏信号。
  • 2023-05-25 · 一作:Qiantong Xu · ToolBenchtoolbench):分析开源 LLM 工具失败后,组合程序化使用样例、system prompt、in-context demonstration retriever 与生成格式约束。

Tsinghua University AIR / Alibaba Group

  • 2026-08-05 · 一作:Xuanyu Lei · State2State: Environment-Derived Mid-Training for LLM Agentsstate2state):主题:环境派生中训练。 从环境探索自动采样起点与目标状态,用规则化状态匹配做 verifier,形成无需人工任务与专家轨迹的可扩展 mid-training。

University of California, Berkeley

  • 2023-10-12 · 一作:Charles Packer · MemGPTmemgpt):有限 context window 使长文档和多轮会话不断遗忘。MemGPT 借鉴操作系统虚拟内存,把常驻核心信息、当前工作上下文和外部归档分层管理;模型通过函数调用移动数据,并以 interrupt/heartbeat 控制继续推理和与用户交互。

University of Illinois Urbana-Champaign

  • 2025-04-16 · 一作:Cheng Qian · ToolRLtoolrl):联合优化工具选择、参数生成和执行结果;动态 reward scaling 让不同工具难度进入同一 RL batch。
  • 2025-03-12 · 一作:Bowen Jin · Search-R1search-r1):普通 RAG 一次检索后再回答,无法让策略根据中间证据继续调整查询。Search-R1 把搜索引擎视为环境:模型可在 reasoning 中多次输出搜索动作,环境返回文档后继续推理。
  • 2023-10-06 · 一作:Andy Zhou · LATSlats):ReAct 等方法通常沿单条轨迹行动,失败后缺少系统搜索。LATS 把 LM 同时作为 agent、value function 和 optimizer,嵌入 Monte Carlo Tree Search;环境执行提供外部 reward,失败轨迹生成 reflection,帮助后续搜索避开错误。

University of Illinois Urbana–Champaign / Meta AI

University of Maryland / Google

University of Massachusetts Amherst

  • 2026-09-17 · 一作:Run-Ze Fan · An Empirical Study of Harness Design for Coding Agentsharness-design-study):固定底层执行循环,分别控制 planning、action space 与 context management,隔离 coding-agent harness 中真正影响效果和成本的因素。

University of New South Wales

University of North Carolina at Chapel Hill

  • 2025-11-20 · 一作:Peng Xia · Agent0agent0):任务生成 Agent 提议可验证工具任务,多个执行 Agent 产生候选并多数投票,课程按当前能力边界升级。

University of Science and Technology of China

  • 2026-08-26 · 一作:Hongqiu Ni · TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Servingtopas):在共享 KV-cache 预算下,同时估算工作流最长剩余路径与下游 prefix reuse 收益,并纳入 prefix 移动、抢占和 aging,避免只优化局部命中率或单请求进度。
  • 2026-08-21 · 一作:Huizu Lin · AUSO: Action-Level Unified Skill Optimization from Internalization to Utilizationauso):外部技能检索有上下文开销,完全内化又失去按任务选择能力;按整条轨迹成功率硬切阶段还无法判断某一个动作是否真正受益。AUSO 先用 skill-conditioned teacher 内化通用技能,再进行 outcome-driven exploration,最后对每个动作比较有技能和无技能策略的 JSD,以有界权重调整 GRPO advantage。
  • 2026-07-28 · 一作:Yu Wang · CASTcast):把求解器状态价值的相邻差分变成 solver advantage,为稀疏结果奖励补充 turn 级 credit。
  • 2026-04-20 · 一作:Daoyu Wang · StepPOsteppo):Agent 的自然决策单位是“观察—动作”的 environment step,token-level MDP 会让动作粒度和信用粒度错位。StepPO 将交互重写为 step-level MDP,在 step boundary 估值和做 GAE,并把 step 内 token ratio 聚合后再裁剪。
  • 2025-11-18 · 一作:Mingyue Cheng · Agent-R1agent-r1):把每次 agent/environment 交互作为独立 transition,以可插拔上下文管理、环境接口与优化器支持 token 或 step 级信用。

University of Virginia

  • 2025-05-22 · 一作:Zhepei Wei · WebAgent-R1webagent-r1):网页交互会不断累积 HTML 和历史动作,单轮 GRPO 无法处理状态变化。WebAgent-R1 动态保留近期和任务相关上下文,并行采集完整多轮轨迹,再用 M-GRPO 根据最终成功奖励执行组内相对更新;论文同时强调行为克隆 warm-up 和长 CoT 初始化。

University of Washington

  • 2026-08-19 · 一作:Bo Liu · SPADE: Self-Play in Adaptive Synthetic Executable Environmentsspade):同一 LLM 分饰环境设计者和推理 Agent,以有/无 privileged hint 的 regret 学习能力边界上的可执行环境。
  • 2023-03-16 · 一作:Bhargavi Paranjape · ARTart):既有 tool-use prompting 常需为每个任务手写示例和调用顺序。ART 根据新任务自动检索相近的推理/工具示例,让冻结 LLM 生成程序;运行器遇到工具标记就暂停生成,执行工具并注入结果后继续。

University of Wisconsin–Madison

  • 2025-12-18 · 一作:Jiongxiao Wang · SAGEsage):从成功轨迹抽象技能,失败时修订或淘汰,并以任务回报学习技能检索与复用。

Vanderbilt University

Xi'an Jiaotong-Liverpool University

  • 2026-09-04 · 一作:Peiyu Hu · AtomRec: Evolving Atomic Memory for Agentic Recommendationatomrec):粗粒度用户摘要会在重写时覆盖旧偏好,单一协同边又难以解释推荐。AtomRec 将用户和物品历史拆成可独立演化的原子字段,建立语义协同链接,并以多跳路径取回“为什么推荐”的证据。

Xiamen University

Zhejiang University

  • 2026-09-15 · 一作:Bofan Chen · Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agentsevoskill-gui):把 GUI 技能拆成可编辑组件,执行失败后由信息隔离 critic 反思,并只修改责任组件,验证后的技能可跨任务复用。
  • 2026-07-29 · 一作:Zhiyuan Yao · SkillRiseskillrise):标准 Agent RL 把任务视为独立 episode,外部 skill bank 又把抽取、检索和执行缠在一起。SkillRise 把相关但不同的任务排成由易到难的序列,让同一 policy 交替求解当前任务与整理一个直接传给下一任务的 skill document;求解阶段由当前结果监督,整理阶段由折扣后的下游任务结果监督。
  • 2023-03-30 · 一作:Yongliang Shen · HuggingGPThugginggpt):单个 LLM 难以覆盖视觉、语音和其他专业任务,而模型社区已有大量专家。HuggingGPT 让 ChatGPT 充当控制器:先把请求拆成带依赖的子任务,再按 Hugging Face 模型描述匹配专家,按拓扑顺序执行,最后把多模型输出组织为用户答案。

中国科学院信息工程研究所

  • 2026-01-28 · 一作:Qihao Wang · PEARLpearl):多跳工具调用同时受工具幻觉、参数错误和长程规划薄弱影响。PEARL 的离线阶段用 trial-and-error 建立工具用法与失败条件;在线阶段把 Planner 与 Executor 解耦,用计划正确性、工具链与最终结果组成的密集 reward 进行 GRPO,而不是只依赖稀疏成功信号。

论文未列机构

  • 2026-08-06 · 一作:Linfang Shang · When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agentsvag):主题:技能进化安全。 技能一旦进入上下文会污染后代,事后删除无法彻底回滚。
  • 2026-08-03 · 一作:Bowen Ye · CoEvo-Memcoevo-mem):只优化 query routing 或只更新 memory bank 会忽略二者反馈环。CoEvo-Mem 让冻结 LLM 生成 route-specific rewrite 和 prior,轻量 residual router 在线修正;任务结果更新路由,轨迹反馈更新 memory value 与 graph relation,并交替冻结一侧控制非平稳性。