跳转至

RedEvoAgent:经验驱动的自动红队技能进化

复现级别:核心机制 + deterministic mini-suite。 实现工具效果画像、Deciding-Tool Attribution 和 held-out validation ratchet。

论文信息

字段 内容
论文链接 arXiv 2608.27439
公司 / 机构 香港城市大学(第一作者第一署名单位)
首次公开日期 2026-08-27(arXiv v1)
原作者代码 否:未发现原作者公开代码(核查日期:2026-08-31)
本地 adapter / 方法 redevoagent
本地复现代码 src/auto_research/agent_research/latest_20260831.py

原始论文总结

背景与主要改动

RedEvoAgent 不直接检索冗长攻击轨迹,而把跨案例经验蒸馏成可读技能;只归因真正决定成败的工具,并且新技能必须在留出验证集上优于 incumbent 才能晋级。

flowchart LR
  T[攻击轨迹] --> A[Deciding-Tool Attribution]
  A --> S[候选技能]
  S --> V{held-out validation}
  V -->|提升| I[替换 incumbent]
  V -->|未提升| R[拒绝更新]

原论文关键图

RedEvoAgent:经验驱动的自动红队技能进化 原论文 Figure 1

原论文 Figure 1(关键图):展示原论文的训练流程与关键优化环节。图片来自原论文,版权归原作者所有;点击图片可查看来源。

核心公式

\[ s_{new}=\begin{cases}s_c,&Eval(s_c)>Eval(s_{inc})\\s_{inc},&\text{otherwise.}\end{cases} \]

本地复现

planbench-mini、120 episodes:joint success 1.0000、average cost 0.4300;关键价值是 validation ratchet/归因计数,而非简单任务的满分。指标见 metrics/planbench-mini-seed42.json

复现边界

未对真实产品 Agent 执行越权攻击;mini-suite 只验证安全的技能更新控制流。

公开 benchmark 产物回放

新增 public-agent-artifact-eval --method redevoagent:读取固定 revision 的 Agent Security Bench / AgentHarm 兼容脱敏导出,只保留 split、工具轨迹和成功标签;从 train 建工具画像、在 validation 做 incumbent ratchet、最后锁定 test,并用三种子等预算随机 skill 作对照。

该路径不会执行 jailbreak、不连接真实目标 Agent,也不会提交原始有害 prompt。上游当前未发布 RedEvoAgent 官方代码/产物,因此仓库只发布 schema 与安全 replay 结果,不伪造论文原始分数。