跳转至

LLM 后训练论文谱系与缺口

本页是系统审计账本:区分已实现的关键谱系、仍值得补的 P1,以及暂不应被“名字占位” 冒充复现的方法。筛选优先级综合经典影响力、机制差异、公开代码/数据和本地可验证性; 最新边界检查至 2026-08-08

谱系覆盖

谱系 代表方法 状态 本仓库覆盖
经典 RLHF PPO-RLHF、RLOO、ReMax 已实现 critic-based、leave-one-out、greedy baseline 三种路线
成对偏好 DPO 已实现 reference-relative pairwise objective
非成对/单阶段偏好 KTO、ORPO 已实现 单条二元反馈;SFT + odds ratio
Group-relative reasoning RL GRPO、DAPO、GSPO 已实现 group advantage、非对称 token clip、sequence clip
训推失配校正 TIS、IcePop、Online IcePop、KPop 已实现 单侧截断、固定双侧 mask、纯在线单次更新、binary-KL 自适应 mask
On-policy / context distillation GKD、MiniLLM、OPSD、OPCD、Lightning OPD、Relay-OPD、VAD 已实现 学生轨迹、reverse KL、特权上下文自蒸馏、上下文能力内化、离线教师缓存、有限教师接力、视觉证据归因 target reconstruction
多目标、过程奖励与分布保持 GPRL、TCR、CoRT、ReCo 已实现 分维 reward、checklist residual、反事实 token credit、响应/方差重权重
自由生成偏好 IPO、SimPO 已实现 token-level sequence probability、reference-relative / reference-free
长度与能力边界 LUSPO、CoBA-RL 已实现 长度无偏 sequence RL、动态课程边界与教师触发
AI 反馈安全对齐 Constitutional AI 已实现 显式原则、自我批评/修订、AI preference
Reward-ranked SFT RRHF、RAFT 已实现 全排序约束;在线采样 top-response filtering
序列校准与可控 SFT SLiC-HF、SteerLM 已实现 preference margin;多属性条件 SFT
自博弈对齐 SPIN 已实现 上一轮策略负例与迭代对手刷新
AI feedback 与过程监督 RLAIF、Let's Verify、Math-Shepherd 已实现 顺序去偏 AI 标签、主动步骤标注、MC continuation 自动标签
自奖励与零数据课程 Self-Rewarding、Absolute Zero、SPIRAL 已实现 自判偏好、任务 proposer/verifier、自博弈语言游戏
Test-time / intrinsic RL TTRL、INTUITOR 已实现 多数一致伪标签;self-certainty intrinsic reward
Off-policy 与序列稳定 LUFFY、CISPO、ConSPO 已实现 混合 support、token IS clip、长度归一化对比序列目标
异步/MoE 与 entropy 稳定 Stabilizing RL、Missing Old Logits、STARE 已实现 Routing Replay、old-logit 语义分解与 EWMA 修复、surprisal 分位数和目标 entropy 闭环

静态能力收口

二级主题复查识别出的 11 个 P0 已全部实现:RLAIF、Let's Verify Step by Step、 Math-Shepherd、Self-Rewarding LM、LUFFY、TTRL、Absolute Zero、INTUITOR、CISPO、 SPIRAL 和 ConSPO。每种目标都进入统一 candidate-policy 训练器和 evolve genome;证据、 固定 seed 指标与去重说明见全主题系统缺口审计

同页识别的 3 个 P1 也已闭环:Stabilizing RL with LLMs、Missing Old Logits 与 STARE。

此前登记的四项平台能力均已闭环:

  • PR #113 将 L2 切换到固定 revision 的 SmolLM2,接入 UltraFeedback,并完成 batch、gradient accumulation、mixed precision、 safe checkpoint 与 optimizer resume;
  • PR #115 为 CoBA-RL 增加 pass@k/教师双缓存、 固定 Qwen2.5 teacher revision、真实调用率和 token 成本;
  • PR #116 把 data、objective、teacher、 rollout、accumulation 和 precision 作为后训练 evolve 的可继承组合轴;
  • PR #117 将代表方法纳入可恢复的三 seed 证据晋级协议。

当前没有尚未实现的静态 P0/P1。扩大公开 rollout 规模或接入新方法属于动态研究批次, 必须重新登记并遵守同预算、多 seed 和 checkpoint-free 指标合同。

当前结论

当前已覆盖“RLHF → AI 反馈安全对齐 → 直接/全排序偏好与 reward 选优 → 序列校准、 多属性条件 SFT 与自博弈 → 单样本/ 单阶段偏好 → group-relative reasoning RL → 蒸馏/多目标/过程奖励 → 自由生成偏好与 能力边界”的主干。L1 candidate 与 L2 free-generation 路径独立保留,报告不能把两类 accuracy 混成同一公平表。

本轮系统复查补齐了 OPSD 和 OPCD:前者代表“学生自身作为带特权解题上下文的 on-policy 教师”,后者代表“把经验或系统提示从 context-conditioned teacher 蒸馏进 context-free student”。二者均已进入统一后训练 genome,不再只是独立复现入口。