跳转至

LLM 后训练研究

这里是论文实现与评测库中的 LLM 后训练分支,覆盖偏好优化、 在线强化学习、on-policy distillation、过程奖励和数据闭环。这里先建立可信算法组件 与公共评测;成熟组件可以继续接入自动进化,和网络结构、 预训练数据及超参数一起搜索。

复现保真度

候选策略 suite 用于低成本回归;IPO、SimPO、LUSPO、CoBA-RL 已升级为字符 tokenizer + causal LM 的真实自由生成路径,包含完整 sequence log-probability、 verifier、rollout 和多 seed。两种保真层级分别报告,均不冒充论文中的大模型训练。

快速入口

  • Sparse OPD:每条在线轨迹只监督教师—学生差异最大的一个或两个关键 token。
  • GAPO:按组内正确数自适应放宽稀有正确 rollout 的 clip 上界。

  • 自动进化中的基础模型:查看结构、数据和后训练的组合方式。

  • 方法索引:按研究方向查看基线、已实现论文、原作者代码和本地入口。
  • 分类浏览:按机构/公司/学校 · 按主题 · 按年份
  • OPDSearch+:先在学生在线搜索轨迹上做冻结教师 forward-KL 蒸馏,再用可验证奖励继续 RL refinement。
  • OPDVR:用正确性约束的 ReLU gate 校正 sampled-token OPD 隐式奖励符号,不增加额外损失超参数。
  • V-Rubrics:把视觉忠实度、推理一致性与指令遵循拆成原子 rubric,并执行局部信用分配。
  • Clue-OPSD:只在教师提示能够修复学生推理的 clue token 上执行 on-policy self-distillation。
  • GRIN:以组相对改进和难度自适应权重强化仍有学习空间的 reasoning rollout。
  • GRIP:把过程 rubric 与结果回报结合,给长推理轨迹分配更细粒度的信用。
  • 论文谱系与边界:系统审计已覆盖主干、静态能力收口和后续评测边界。
  • 统一评测协议:数据、指标、公平比较口径和新增方法验收标准。
  • SRPO:用自我反思 patch 构造同模型特权教师和 token 级稠密信用。
  • ERPO:以 reference typicality 与 Query-KL 稳定输入分布,同时保留回答侧探索。
  • DPO:reference-relative 偏好分类,无 reward model。
  • KTO:只需单条 desirable/undesirable 标签的前景理论目标。
  • ORPO:SFT 与 odds-ratio 偏好合一,无 reference model。
  • DeepSeekMath / GRPO:组相对、critic-free 的 reasoning RL。
  • TIS:单侧截断训练/rollout 引擎概率比,校正训推失配。
  • IcePop:以固定双侧 ratio mask 丢弃严重失配 token。
  • Online IcePop:每批 rollout 只更新一次,移除 stale-policy ratio 与 PPO clip。
  • RIPO:按旧策略概率自适应的 Fisher–Rao 几何 clip。
  • KPop:以双向 binary-KL 掩码处理异步训推失配。
  • GPPO:PPO 前向保持 clip、反向保留越界样本梯度。
  • Dr. GRPO:移除长度与组方差归一化的 group update。
  • ARMOR:混入 reference anchor rollout 防止长程退化。
  • REINFORCE++:用全局优势尺度取代 prompt-local 方差。
  • TACO:只衰减高尾部风险 token 的正向信用。
  • CHORD:退火式协调 expert SFT 与 on-policy RL。
  • VAPO:length-adaptive GAE 的 critic PPO。
  • InstructGPT / PPO-RLHF:旧策略、critic、clip 与 KL 的经典 RLHF。
  • RLOO:完整响应级 leave-one-out REINFORCE。
  • ReMax:以 greedy rollout 作 baseline 的 value-free RLHF。
  • GKD:学生自生成轨迹、教师密集反馈与 on/off-policy 混合。
  • MiniLLM:reverse KL、teacher-mixed sampling 与方差缩减。
  • OPSD:用同一模型的特权解题上下文作教师,对学生 on-policy 轨迹做逐 token 自蒸馏与 pointwise clipping。
  • DASH:以局部散度门控反向聚合自蒸馏 horizon,不增加 teacher forward。
  • U-OPSD:仅依赖模型多次采样的一致性构造伪教师,不使用外部监督。
  • RP-OPSD:以参考解消融产生的分布位移定位多语推理 pivot。
  • PCSD:累计持续 teacher support,并用趋势衰减过滤局部噪声。
  • ADRS:用回报相关 TVA gate 把教师 token 分数写入原生 advantage。
  • Distilled RL:反向教师比率、负样本 reset 和几何归一化的细粒度 RL。
  • MOPD:在学生 rollout 上整合多个独立领域 RL teacher。
  • OPDLM:冻结 AR 教师向双向 diffusion 学生做 on-policy 知识迁移。
  • OPCD:让无上下文学生拟合带经验/系统提示的上下文教师, 把测试时上下文能力蒸馏进参数。
  • DAPO:Clip-Higher、动态采样、token loss 与过长惩罚。
  • GSPO:长度归一化的 sequence-level importance ratio。
  • Lightning OPD:离线缓存教师分布的 on-policy distillation。
  • GPRL:多维偏好的 group-relative 强化学习。
  • TCR:thinking checklist 与残差过程奖励。
  • IPO:有限 preference log-ratio gap 的平方回归。
  • SimPO:reference-free、长度归一化偏好目标。
  • LUSPO:校正 sequence policy objective 的长度偏差。
  • CoBA-RL:能力边界探测、教师引导与课程 RL。
  • Constitutional AI:自我批评/修订与 AI preference RLAIF。
  • RRHF:全响应 reward ranking 与 best-response SFT。
  • RAFT:当前策略采样、reward 选优与迭代 SFT。
  • SLiC-HF:序列 likelihood margin 与监督正则。
  • SteerLM:多属性标注、条件 SFT 与推理时可控目标。
  • SPIN:上一轮策略自生成负例与迭代自博弈。
  • Relay-OPD:检测失败前缀并让教师有限接力。
  • β-OPSD:把 KL 正则策略最优解转成可调几何插值蒸馏目标。
  • VAD:用同一教师有/无视觉证据的分布差归因并重建 OPD target。
  • Flux-OPD:以稳定 teacher 为锚,按上下文冲突衰减演化修正。
  • CoRT:用反事实重放分配 token 级 rubric credit。
  • ReCo:按响应期望出现次数与 token 方差比重加权 GRPO。
  • RLAIF过程监督Math-Shepherd:补齐 AI feedback 和逐步奖励主干。
  • Self-RewardingAbsolute ZeroSPIRAL:覆盖自判偏好、零数据任务生成和语言游戏自博弈。
  • LUFFYTTRLINTUITORCISPOConSPO:覆盖离策略 guidance、test-time RL、intrinsic reward 和稳定序列目标。
  • Stabilizing RL with LLMsMissing Old LogitsSTARE:覆盖 MoE Routing Replay、异步 old-logit 修复和 surprisal 驱动的 entropy 闭环。

跨目录的后训练 adapter

以下实现保留原有详情 URL,但在新信息架构中归入 LLM 后训练,而不再出现在基础模型 或工业搜广推目录:

  • SIS:用 rejection sampling 将部分 stale-policy token 变换为 on-policy token;
  • Off-Context GRPO:以特权过程生成 rollout,再用 importance ratio 校正到无上下文策略;
  • DynamicRubric:让 rubric evaluator 与 policy 在训练过程中协同演化。

2026-08-09 P0/P1 增量

  • RRC:把生成式奖励模型的相对排序转成 self-competitive 与 anchor-guided reward。

2026-08-13 MR7 增量

  • Preference Tree Optimization:以对话树前瞻模拟构造长期偏好,并用 look-ahead reward 执行 DPO。
  • C²-DPO:比较完整与退化上下文的偏好 margin,以 Contextual Preference Gain 抑制多模态幻觉。
  • RAIL:按可恢复性收益学习 rollout 干预位置与预算。
  • SpecRoll:用快慢双路径适配 evolving policy,并以 exact verifier 保持 rollout 分布。

三者均接入统一 post-training runner 与组合式 evolve genome;稳定指标分别保存在各论文目录的 metrics/arithmetic-smoke-seed42.json,不再以日期批次文件作为事实源。

2026-08-24 增量

  • GCPO:诊断 rollout update 与预训练权重主奇异空间的重合,并以硬双侧正交投影限制更新可行域。

2026 历史扫描 B08~B09

研究闭环

flowchart LR
    P["论文与训练假设"] --> I["统一算法接口"]
    D["公开数据 / smoke suite"] --> R["候选 rollout group"]
    I --> R
    R --> S["结果、过程、多维偏好 reward"]
    S --> U["策略更新与 KL 约束"]
    U --> E["统一离线评测"]
    E --> A["指标、报告与失败分析"]
    A --> P

当前实现

类别 方法 核心机制 公开评测 状态
自适应自蒸馏 DASH clipped local divergence、stop-gradient gate、backward horizon Arithmetic candidate 机制复现
直接偏好优化 DPO reference-relative pairwise classification GSM8K candidate 机制复现
二元反馈对齐 KTO prospect utility、desirable/undesirable、KL 参照点 GSM8K candidate 机制复现
单阶段偏好 ORPO SFT NLL + odds-ratio penalty,无 reference GSM8K candidate 机制复现
在线推理 RL GRPO group advantage、old-policy clip、KL,无 critic GSM8K candidate 机制复现
训推失配校正 TIS training/rollout ratio、单侧上截断、保留低 ratio GSM8K candidate 机制复现
MoE 训推失配 IcePop fixed two-sided ratio mask、区间内原始 IS 权重 GSM8K candidate 机制复现
纯在线训推校正 Online IcePop 单次 rollout update、policy ratio=1、IcePop mask GSM8K candidate 机制复现
几何信任域 RIPO probability-dependent Fisher–Rao clip GSM8K candidate 机制复现
异步训推失配 KPop 双向 binary-KL keep/mask GSM8K candidate 机制复现
梯度保留 clip GPPO clipped forward、boundary-weighted backward GSM8K candidate 机制复现
GRPO 聚合偏置 Dr. GRPO group mean、无长度和组 std 归一化 GSM8K candidate 机制复现
Reference anchor ARMOR frozen-reference 与 on-policy mixed rollout GSM8K candidate 机制复现
全局优势估计 REINFORCE++ EMA global advantage scale GSM8K candidate 机制复现
Token 信用 TACO tail-risk 降低正 advantage GSM8K candidate 机制复现
SFT-RL 混合 CHORD decayed expert SFT + group RL GSM8K candidate 机制复现
Critic PPO VAPO length-adaptive GAE 与 actor-critic GSM8K candidate 机制复现
经典在线 RL PPO-RLHF old policy、clipped surrogate、critic、KL GSM8K candidate 机制复现
经典在线 RL RLOO response-level REINFORCE、leave-one-out baseline GSM8K candidate 机制复现
经典在线 RL ReMax sampled reward 减 greedy reward,无 critic GSM8K candidate 机制复现
经典 On-policy KD GKD 学生 rollout、教师反馈、on/off-policy 混合 GSM8K candidate 机制复现
生成模型蒸馏 MiniLLM reverse KL、teacher mix、variance baseline GSM8K candidate 机制复现
On-policy 自蒸馏 OPSD 特权解题上下文、学生 rollout、逐 token divergence 与 clip GSM8K candidate 机制复现
上下文蒸馏 OPCD context-conditioned teacher、context-free student、reverse KL GSM8K candidate 机制复现
长推理 RL DAPO 非对称 clip、动态采样、token loss、overlong shaping GSM8K candidate 机制复现
稳定序列 RL GSPO sequence ratio、group advantage、序列级 clip GSM8K candidate 机制复现
蒸馏 Lightning OPD SFT rollout 上预计算教师分布,训练期零在线教师调用 同上 机制复现
多目标 RL GPRL 分维度 group normalization 与漂移控制 同上 机制复现
过程奖励 TCR thinking checklist、EMA 残差奖励 同上 机制复现
离线偏好 IPO reference-relative gap 平方回归 arithmetic / GSM8K free generation token 级复现
离线偏好 SimPO 长度归一化、reference-free margin arithmetic / GSM8K free generation token 级复现
长度无偏 RL LUSPO length-unbiased sequence ratio arithmetic / GSM8K free generation token 级复现
课程 RL CoBA-RL 动态能力边界与 teacher guidance arithmetic / GSM8K free generation token 级复现
AI 反馈安全对齐 Constitutional AI constitution critique/revision + AI preference GSM8K candidate 机制复现
全排序偏好 RRHF reward ordering、ranking hinge、best SFT GSM8K candidate 机制复现
选优微调 RAFT policy sampling、reward top-1 filtering、SFT GSM8K candidate 机制复现
序列校准 SLiC-HF preference margin、SFT/reference regularization GSM8K candidate 机制复现
可控 SFT SteerLM 多属性 annotation 与条件生成目标 GSM8K candidate 机制复现
自博弈 SPIN previous-policy negative、偏好更新、对手刷新 GSM8K candidate 机制复现
On-policy distillation Relay-OPD 失败前缀触发、教师有限接力、学生恢复 GSM8K candidate 机制复现
On-policy self-distillation β-OPSD reference/teacher 几何插值与 return-to-go GSM8K candidate 机制复现
多模态 OPD VAD evidence intervention、单侧投影与 student-anchored target GSM8K candidate 机制复现
Context distillation Flux-OPD context-free anchor、差分修正与冲突权重 GSM8K candidate 机制复现
Token credit CoRT rubric/criteria-free 反事实重放与 token 权重 GSM8K candidate 机制复现
分布保持 RL ReCo 响应次数权重、token 方差比与 clipped group update Arithmetic / GSM8K candidate 机制复现

公开实验快照

固定 GSM8K candidate 512/128 train/validation examples、300 steps、seed 42。 指标是六候选 exact-answer 策略准确率,不是自由生成 Pass@1

方法 训练前 accuracy 训练后 accuracy KL(reference)
DPO 0.1641 0.8047 0.0683
KTO 0.1641 0.8359 0.0143
ORPO 0.1641 0.8438 0.8973
GRPO 0.1641 0.7812 1.0401
ReCo 0.1719 0.8750 0.2857
DAPO 0.1641 0.7578 1.0870
GSPO 0.1641 0.8281 0.7017
PPO-RLHF 0.1641 0.8125 0.8731
RLOO 0.1641 0.8281 0.5707
ReMax 0.1641 0.7031 0.7939
OPSD 0.2500 0.9062 0.3336
OPCD 0.2500 0.9688 0.5479
Lightning OPD 0.1641 0.8359 0.8269
GPRL 0.1641 0.3672 1.1022
TCR 0.1641 0.8359 0.5629
Constitutional AI 0.1641 0.8438 1.0214
RRHF 0.1641 0.8125 0.8344
RAFT 0.1641 0.8438 0.8789
SLiC-HF 0.1641 0.7812 0.2512
SteerLM 0.1641 0.8516 0.9112
SPIN 0.1641 0.8594 0.1294
Relay-OPD 0.1719 0.8906 0.5014
CoRT 0.1719 0.8906 0.0201

本轮新增算法使用同一候选策略,但为便于快速回归采用 256/64 train/validation examples、 120 steps、seed 42;因此只与本轮彼此比较,不与上表的 300-step 数值横比。

方法 训练前 accuracy 训练后 accuracy KL(reference)
RIPO 0.1719 0.8125 0.3228
TIS 0.1719 0.8906 0.5348
IcePop 0.1719 0.8906 0.5833
Online IcePop 0.1719 0.7969 0.7429
KPop 0.1719 0.8906 0.3490
GPPO 0.1719 0.8594 0.3507
Dr. GRPO 0.1719 0.8906 0.0325
ARMOR 0.1719 0.8750 0.0192
REINFORCE++ 0.1719 0.8594 0.2152
TACO 0.1719 0.8906 0.3490
CHORD 0.1719 0.7969 0.5713
VAPO 0.1719 0.8594 0.0122
β-OPSD 0.1719 0.7656 0.2789
Flux-OPD 0.1719 0.8438 0.5283

完整定义、smoke 结果和差异解释见统一评测协议,稳定指标见 post-training-gsm8k-candidate-seed42.json。 本轮 β-OPSD / Flux-OPD 指标见 beta-flux-opd-gsm8k-seed42.json。 经典 RL 稳定指标见 classic-post-training-gsm8k-seed42.json。 自由生成方法的三 seed 指标见 free-generation-post-training-seeds42-44.json。 本批经典缺口指标见 p0-missing-post-training-gsm8k-seed42.json。 P1 候选指标见 p1-alignment-candidates-gsm8k-seed42.json。 本批 OPD / token credit 指标见 post-training-20260729-seed42.json。 经典 Agentic RL / OPD 补充指标见 classic-agentic-rl-opd-seed42.json。 本批遗漏方法的固定 seed 指标见 omitted-agentic-rl-opd-seed42.json。 本页新增 RL 算法的固定 seed 指标见 rl-papers-summary-seed42.json

L2 小预算实验固定 arithmetic free generation、48 train examples、20-step SFT warmup、 6 次后训练更新和 seeds 42/43/44。四种方法的 exact accuracy 均为 0;SimPO 的 format rate 从 0 提升到 0.3333、mean verifier reward 从 0.1000 到 0.1333,其余 没有最终指标提升。这说明真实序列路径已跑通,但当前预算不足以支持“效果复现”结论。

2026-08-29 最新方法

统一批次索引见 latest-20260829-seed42.json

一键运行

auto-research post-train --algorithm lightning-opd \
  --dataset arithmetic-smoke --steps 100 --seed 42

auto-research post-train --algorithm gprl \
  --dataset gsm8k-candidate --maximum-examples 512 --steps 300

auto-research post-train --algorithm rloo \
  --dataset gsm8k-candidate --maximum-examples 512 --steps 300 --offline

auto-research post-train --algorithm dapo \
  --dataset gsm8k-candidate --maximum-examples 512 --steps 300 --offline

auto-research post-train --algorithm simpo \
  --dataset arithmetic-generate --maximum-examples 48 \
  --steps 6 --seeds 42,43,44 --offline

每次运行独立写入 runs/post-training/<algorithm>-<dataset>-seed<seed>/, 包含 metrics.json 和中文 report.md;checkpoint 只保存在本地,不提交 GitHub。

后续扩展约定

新增论文时必须同时完成算法实现、独立论文页、方法索引、统一协议实验和稳定指标。 论文页固定包含论文信息、背景与主要改动、架构图、核心公式、论文效果、本地映射、 复现实验和保真边界,避免入口页随着论文数量增长而失控。