LLM 后训练研究¶
这里是论文实现与评测库中的 LLM 后训练分支,覆盖偏好优化、 在线强化学习、on-policy distillation、过程奖励和数据闭环。这里先建立可信算法组件 与公共评测;成熟组件可以继续接入自动进化,和网络结构、 预训练数据及超参数一起搜索。
复现保真度
候选策略 suite 用于低成本回归;IPO、SimPO、LUSPO、CoBA-RL 已升级为字符 tokenizer + causal LM 的真实自由生成路径,包含完整 sequence log-probability、 verifier、rollout 和多 seed。两种保真层级分别报告,均不冒充论文中的大模型训练。
快速入口¶
- Sparse OPD:每条在线轨迹只监督教师—学生差异最大的一个或两个关键 token。
-
GAPO:按组内正确数自适应放宽稀有正确 rollout 的 clip 上界。
-
自动进化中的基础模型:查看结构、数据和后训练的组合方式。
- 方法索引:按研究方向查看基线、已实现论文、原作者代码和本地入口。
- 分类浏览:按机构/公司/学校 · 按主题 · 按年份。
- OPDSearch+:先在学生在线搜索轨迹上做冻结教师 forward-KL 蒸馏,再用可验证奖励继续 RL refinement。
- OPDVR:用正确性约束的 ReLU gate 校正 sampled-token OPD 隐式奖励符号,不增加额外损失超参数。
- V-Rubrics:把视觉忠实度、推理一致性与指令遵循拆成原子 rubric,并执行局部信用分配。
- Clue-OPSD:只在教师提示能够修复学生推理的 clue token 上执行 on-policy self-distillation。
- GRIN:以组相对改进和难度自适应权重强化仍有学习空间的 reasoning rollout。
- GRIP:把过程 rubric 与结果回报结合,给长推理轨迹分配更细粒度的信用。
- 论文谱系与边界:系统审计已覆盖主干、静态能力收口和后续评测边界。
- 统一评测协议:数据、指标、公平比较口径和新增方法验收标准。
- SRPO:用自我反思 patch 构造同模型特权教师和 token 级稠密信用。
- ERPO:以 reference typicality 与 Query-KL 稳定输入分布,同时保留回答侧探索。
- DPO:reference-relative 偏好分类,无 reward model。
- KTO:只需单条 desirable/undesirable 标签的前景理论目标。
- ORPO:SFT 与 odds-ratio 偏好合一,无 reference model。
- DeepSeekMath / GRPO:组相对、critic-free 的 reasoning RL。
- TIS:单侧截断训练/rollout 引擎概率比,校正训推失配。
- IcePop:以固定双侧 ratio mask 丢弃严重失配 token。
- Online IcePop:每批 rollout 只更新一次,移除 stale-policy ratio 与 PPO clip。
- RIPO:按旧策略概率自适应的 Fisher–Rao 几何 clip。
- KPop:以双向 binary-KL 掩码处理异步训推失配。
- GPPO:PPO 前向保持 clip、反向保留越界样本梯度。
- Dr. GRPO:移除长度与组方差归一化的 group update。
- ARMOR:混入 reference anchor rollout 防止长程退化。
- REINFORCE++:用全局优势尺度取代 prompt-local 方差。
- TACO:只衰减高尾部风险 token 的正向信用。
- CHORD:退火式协调 expert SFT 与 on-policy RL。
- VAPO:length-adaptive GAE 的 critic PPO。
- InstructGPT / PPO-RLHF:旧策略、critic、clip 与 KL 的经典 RLHF。
- RLOO:完整响应级 leave-one-out REINFORCE。
- ReMax:以 greedy rollout 作 baseline 的 value-free RLHF。
- GKD:学生自生成轨迹、教师密集反馈与 on/off-policy 混合。
- MiniLLM:reverse KL、teacher-mixed sampling 与方差缩减。
- OPSD:用同一模型的特权解题上下文作教师,对学生 on-policy 轨迹做逐 token 自蒸馏与 pointwise clipping。
- DASH:以局部散度门控反向聚合自蒸馏 horizon,不增加 teacher forward。
- U-OPSD:仅依赖模型多次采样的一致性构造伪教师,不使用外部监督。
- RP-OPSD:以参考解消融产生的分布位移定位多语推理 pivot。
- PCSD:累计持续 teacher support,并用趋势衰减过滤局部噪声。
- ADRS:用回报相关 TVA gate 把教师 token 分数写入原生 advantage。
- Distilled RL:反向教师比率、负样本 reset 和几何归一化的细粒度 RL。
- MOPD:在学生 rollout 上整合多个独立领域 RL teacher。
- OPDLM:冻结 AR 教师向双向 diffusion 学生做 on-policy 知识迁移。
- OPCD:让无上下文学生拟合带经验/系统提示的上下文教师, 把测试时上下文能力蒸馏进参数。
- DAPO:Clip-Higher、动态采样、token loss 与过长惩罚。
- GSPO:长度归一化的 sequence-level importance ratio。
- Lightning OPD:离线缓存教师分布的 on-policy distillation。
- GPRL:多维偏好的 group-relative 强化学习。
- TCR:thinking checklist 与残差过程奖励。
- IPO:有限 preference log-ratio gap 的平方回归。
- SimPO:reference-free、长度归一化偏好目标。
- LUSPO:校正 sequence policy objective 的长度偏差。
- CoBA-RL:能力边界探测、教师引导与课程 RL。
- Constitutional AI:自我批评/修订与 AI preference RLAIF。
- RRHF:全响应 reward ranking 与 best-response SFT。
- RAFT:当前策略采样、reward 选优与迭代 SFT。
- SLiC-HF:序列 likelihood margin 与监督正则。
- SteerLM:多属性标注、条件 SFT 与推理时可控目标。
- SPIN:上一轮策略自生成负例与迭代自博弈。
- Relay-OPD:检测失败前缀并让教师有限接力。
- β-OPSD:把 KL 正则策略最优解转成可调几何插值蒸馏目标。
- VAD:用同一教师有/无视觉证据的分布差归因并重建 OPD target。
- Flux-OPD:以稳定 teacher 为锚,按上下文冲突衰减演化修正。
- CoRT:用反事实重放分配 token 级 rubric credit。
- ReCo:按响应期望出现次数与 token 方差比重加权 GRPO。
- RLAIF、过程监督 与 Math-Shepherd:补齐 AI feedback 和逐步奖励主干。
- Self-Rewarding、Absolute Zero 与 SPIRAL:覆盖自判偏好、零数据任务生成和语言游戏自博弈。
- LUFFY、TTRL、INTUITOR、CISPO 与 ConSPO:覆盖离策略 guidance、test-time RL、intrinsic reward 和稳定序列目标。
- Stabilizing RL with LLMs、Missing Old Logits 与 STARE:覆盖 MoE Routing Replay、异步 old-logit 修复和 surprisal 驱动的 entropy 闭环。
跨目录的后训练 adapter¶
以下实现保留原有详情 URL,但在新信息架构中归入 LLM 后训练,而不再出现在基础模型 或工业搜广推目录:
- SIS:用 rejection sampling 将部分 stale-policy token 变换为 on-policy token;
- Off-Context GRPO:以特权过程生成 rollout,再用 importance ratio 校正到无上下文策略;
- DynamicRubric:让 rubric evaluator 与 policy 在训练过程中协同演化。
2026-08-09 P0/P1 增量¶
- RRC:把生成式奖励模型的相对排序转成 self-competitive 与 anchor-guided reward。
2026-08-13 MR7 增量¶
- Preference Tree Optimization:以对话树前瞻模拟构造长期偏好,并用 look-ahead reward 执行 DPO。
- C²-DPO:比较完整与退化上下文的偏好 margin,以 Contextual Preference Gain 抑制多模态幻觉。
- RAIL:按可恢复性收益学习 rollout 干预位置与预算。
- SpecRoll:用快慢双路径适配 evolving policy,并以 exact verifier 保持 rollout 分布。
三者均接入统一 post-training runner 与组合式 evolve genome;稳定指标分别保存在各论文目录的 metrics/arithmetic-smoke-seed42.json,不再以日期批次文件作为事实源。
2026-08-24 增量¶
- GCPO:诊断 rollout update 与预训练权重主奇异空间的重合,并以硬双侧正交投影限制更新可行域。
2026 历史扫描 B08~B09¶
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress:分别按教师奖励和独立进展奖励排序 reasoning spans,冲突时屏蔽蒸馏信号。
- SR-OPSD: Self-Referenced On-Policy Self-Distillation:把自教师与 reference 做几何插值得到有效目标,再用 Rényi divergence 控制投影几何和密度比敏感度。
- On-Policy Delta Distillation for Multilingual Math Reasoning:以 post-trained teacher 相对其 base model 的概率增量作为蒸馏信号,减少复制教师原有偏差。
- CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning:教师定位 on-policy 因果链第一个错误步骤,以短 horizon RL 修复,并按证据→机制→结论推进课程。
- SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation:先用 reward-priority 分别训练专长教师,再在学生自身轨迹上合并多个教师能力。
- Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance:只对负向零方差 group 启用教师,并在高熵或大 teacher-student gap token 上蒸馏,同时注入教师正确轨迹 SFT。
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization:逐 reward 维度标准化优势,并依据 batch 饱和度动态把梯度预算转移到尚未掌握的目标。
- Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL:每个 rollout group 共享随机丢弃的 rubric 子集,使策略无法持续利用固定 judge proxy。
- Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models:约束外部策略 rollout 长度,并对 on-policy/external 来源分别处理奖励以防联合归一化崩溃。
- Contrastive Reinforced Policy Optimization via Privileged Self-Distillation:按预测熵区分反思探索正位置和 exposure-bias 负位置,对 privileged self-distillation 做组内对比。
- SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning:让 Good–Normal–Bad 响应档案、query-specific rubrics 和 actor 策略形成三方闭环自进化。
- ISO: An RLVR-Native Optimization Stack:固定预训练权重奇异值,仅优化输入/输出 singular frames;同时提供无数据 specialist merger。
研究闭环¶
flowchart LR
P["论文与训练假设"] --> I["统一算法接口"]
D["公开数据 / smoke suite"] --> R["候选 rollout group"]
I --> R
R --> S["结果、过程、多维偏好 reward"]
S --> U["策略更新与 KL 约束"]
U --> E["统一离线评测"]
E --> A["指标、报告与失败分析"]
A --> P
当前实现¶
| 类别 | 方法 | 核心机制 | 公开评测 | 状态 |
|---|---|---|---|---|
| 自适应自蒸馏 | DASH | clipped local divergence、stop-gradient gate、backward horizon | Arithmetic candidate | 机制复现 |
| 直接偏好优化 | DPO | reference-relative pairwise classification | GSM8K candidate | 机制复现 |
| 二元反馈对齐 | KTO | prospect utility、desirable/undesirable、KL 参照点 | GSM8K candidate | 机制复现 |
| 单阶段偏好 | ORPO | SFT NLL + odds-ratio penalty,无 reference | GSM8K candidate | 机制复现 |
| 在线推理 RL | GRPO | group advantage、old-policy clip、KL,无 critic | GSM8K candidate | 机制复现 |
| 训推失配校正 | TIS | training/rollout ratio、单侧上截断、保留低 ratio | GSM8K candidate | 机制复现 |
| MoE 训推失配 | IcePop | fixed two-sided ratio mask、区间内原始 IS 权重 | GSM8K candidate | 机制复现 |
| 纯在线训推校正 | Online IcePop | 单次 rollout update、policy ratio=1、IcePop mask | GSM8K candidate | 机制复现 |
| 几何信任域 | RIPO | probability-dependent Fisher–Rao clip | GSM8K candidate | 机制复现 |
| 异步训推失配 | KPop | 双向 binary-KL keep/mask | GSM8K candidate | 机制复现 |
| 梯度保留 clip | GPPO | clipped forward、boundary-weighted backward | GSM8K candidate | 机制复现 |
| GRPO 聚合偏置 | Dr. GRPO | group mean、无长度和组 std 归一化 | GSM8K candidate | 机制复现 |
| Reference anchor | ARMOR | frozen-reference 与 on-policy mixed rollout | GSM8K candidate | 机制复现 |
| 全局优势估计 | REINFORCE++ | EMA global advantage scale | GSM8K candidate | 机制复现 |
| Token 信用 | TACO | tail-risk 降低正 advantage | GSM8K candidate | 机制复现 |
| SFT-RL 混合 | CHORD | decayed expert SFT + group RL | GSM8K candidate | 机制复现 |
| Critic PPO | VAPO | length-adaptive GAE 与 actor-critic | GSM8K candidate | 机制复现 |
| 经典在线 RL | PPO-RLHF | old policy、clipped surrogate、critic、KL | GSM8K candidate | 机制复现 |
| 经典在线 RL | RLOO | response-level REINFORCE、leave-one-out baseline | GSM8K candidate | 机制复现 |
| 经典在线 RL | ReMax | sampled reward 减 greedy reward,无 critic | GSM8K candidate | 机制复现 |
| 经典 On-policy KD | GKD | 学生 rollout、教师反馈、on/off-policy 混合 | GSM8K candidate | 机制复现 |
| 生成模型蒸馏 | MiniLLM | reverse KL、teacher mix、variance baseline | GSM8K candidate | 机制复现 |
| On-policy 自蒸馏 | OPSD | 特权解题上下文、学生 rollout、逐 token divergence 与 clip | GSM8K candidate | 机制复现 |
| 上下文蒸馏 | OPCD | context-conditioned teacher、context-free student、reverse KL | GSM8K candidate | 机制复现 |
| 长推理 RL | DAPO | 非对称 clip、动态采样、token loss、overlong shaping | GSM8K candidate | 机制复现 |
| 稳定序列 RL | GSPO | sequence ratio、group advantage、序列级 clip | GSM8K candidate | 机制复现 |
| 蒸馏 | Lightning OPD | SFT rollout 上预计算教师分布,训练期零在线教师调用 | 同上 | 机制复现 |
| 多目标 RL | GPRL | 分维度 group normalization 与漂移控制 | 同上 | 机制复现 |
| 过程奖励 | TCR | thinking checklist、EMA 残差奖励 | 同上 | 机制复现 |
| 离线偏好 | IPO | reference-relative gap 平方回归 | arithmetic / GSM8K free generation | token 级复现 |
| 离线偏好 | SimPO | 长度归一化、reference-free margin | arithmetic / GSM8K free generation | token 级复现 |
| 长度无偏 RL | LUSPO | length-unbiased sequence ratio | arithmetic / GSM8K free generation | token 级复现 |
| 课程 RL | CoBA-RL | 动态能力边界与 teacher guidance | arithmetic / GSM8K free generation | token 级复现 |
| AI 反馈安全对齐 | Constitutional AI | constitution critique/revision + AI preference | GSM8K candidate | 机制复现 |
| 全排序偏好 | RRHF | reward ordering、ranking hinge、best SFT | GSM8K candidate | 机制复现 |
| 选优微调 | RAFT | policy sampling、reward top-1 filtering、SFT | GSM8K candidate | 机制复现 |
| 序列校准 | SLiC-HF | preference margin、SFT/reference regularization | GSM8K candidate | 机制复现 |
| 可控 SFT | SteerLM | 多属性 annotation 与条件生成目标 | GSM8K candidate | 机制复现 |
| 自博弈 | SPIN | previous-policy negative、偏好更新、对手刷新 | GSM8K candidate | 机制复现 |
| On-policy distillation | Relay-OPD | 失败前缀触发、教师有限接力、学生恢复 | GSM8K candidate | 机制复现 |
| On-policy self-distillation | β-OPSD | reference/teacher 几何插值与 return-to-go | GSM8K candidate | 机制复现 |
| 多模态 OPD | VAD | evidence intervention、单侧投影与 student-anchored target | GSM8K candidate | 机制复现 |
| Context distillation | Flux-OPD | context-free anchor、差分修正与冲突权重 | GSM8K candidate | 机制复现 |
| Token credit | CoRT | rubric/criteria-free 反事实重放与 token 权重 | GSM8K candidate | 机制复现 |
| 分布保持 RL | ReCo | 响应次数权重、token 方差比与 clipped group update | Arithmetic / GSM8K candidate | 机制复现 |
公开实验快照¶
固定 GSM8K candidate 512/128 train/validation examples、300 steps、seed 42。 指标是六候选 exact-answer 策略准确率,不是自由生成 Pass@1。
| 方法 | 训练前 accuracy | 训练后 accuracy | KL(reference) |
|---|---|---|---|
| DPO | 0.1641 | 0.8047 | 0.0683 |
| KTO | 0.1641 | 0.8359 | 0.0143 |
| ORPO | 0.1641 | 0.8438 | 0.8973 |
| GRPO | 0.1641 | 0.7812 | 1.0401 |
| ReCo | 0.1719 | 0.8750 | 0.2857 |
| DAPO | 0.1641 | 0.7578 | 1.0870 |
| GSPO | 0.1641 | 0.8281 | 0.7017 |
| PPO-RLHF | 0.1641 | 0.8125 | 0.8731 |
| RLOO | 0.1641 | 0.8281 | 0.5707 |
| ReMax | 0.1641 | 0.7031 | 0.7939 |
| OPSD | 0.2500 | 0.9062 | 0.3336 |
| OPCD | 0.2500 | 0.9688 | 0.5479 |
| Lightning OPD | 0.1641 | 0.8359 | 0.8269 |
| GPRL | 0.1641 | 0.3672 | 1.1022 |
| TCR | 0.1641 | 0.8359 | 0.5629 |
| Constitutional AI | 0.1641 | 0.8438 | 1.0214 |
| RRHF | 0.1641 | 0.8125 | 0.8344 |
| RAFT | 0.1641 | 0.8438 | 0.8789 |
| SLiC-HF | 0.1641 | 0.7812 | 0.2512 |
| SteerLM | 0.1641 | 0.8516 | 0.9112 |
| SPIN | 0.1641 | 0.8594 | 0.1294 |
| Relay-OPD | 0.1719 | 0.8906 | 0.5014 |
| CoRT | 0.1719 | 0.8906 | 0.0201 |
本轮新增算法使用同一候选策略,但为便于快速回归采用 256/64 train/validation examples、 120 steps、seed 42;因此只与本轮彼此比较,不与上表的 300-step 数值横比。
| 方法 | 训练前 accuracy | 训练后 accuracy | KL(reference) |
|---|---|---|---|
| RIPO | 0.1719 | 0.8125 | 0.3228 |
| TIS | 0.1719 | 0.8906 | 0.5348 |
| IcePop | 0.1719 | 0.8906 | 0.5833 |
| Online IcePop | 0.1719 | 0.7969 | 0.7429 |
| KPop | 0.1719 | 0.8906 | 0.3490 |
| GPPO | 0.1719 | 0.8594 | 0.3507 |
| Dr. GRPO | 0.1719 | 0.8906 | 0.0325 |
| ARMOR | 0.1719 | 0.8750 | 0.0192 |
| REINFORCE++ | 0.1719 | 0.8594 | 0.2152 |
| TACO | 0.1719 | 0.8906 | 0.3490 |
| CHORD | 0.1719 | 0.7969 | 0.5713 |
| VAPO | 0.1719 | 0.8594 | 0.0122 |
| β-OPSD | 0.1719 | 0.7656 | 0.2789 |
| Flux-OPD | 0.1719 | 0.8438 | 0.5283 |
完整定义、smoke 结果和差异解释见统一评测协议,稳定指标见
post-training-gsm8k-candidate-seed42.json。
本轮 β-OPSD / Flux-OPD 指标见
beta-flux-opd-gsm8k-seed42.json。
经典 RL 稳定指标见
classic-post-training-gsm8k-seed42.json。
自由生成方法的三 seed 指标见
free-generation-post-training-seeds42-44.json。
本批经典缺口指标见
p0-missing-post-training-gsm8k-seed42.json。
P1 候选指标见
p1-alignment-candidates-gsm8k-seed42.json。
本批 OPD / token credit 指标见
post-training-20260729-seed42.json。
经典 Agentic RL / OPD 补充指标见
classic-agentic-rl-opd-seed42.json。
本批遗漏方法的固定 seed 指标见
omitted-agentic-rl-opd-seed42.json。
本页新增 RL 算法的固定 seed 指标见
rl-papers-summary-seed42.json。
L2 小预算实验固定 arithmetic free generation、48 train examples、20-step SFT warmup、 6 次后训练更新和 seeds 42/43/44。四种方法的 exact accuracy 均为 0;SimPO 的 format rate 从 0 提升到 0.3333、mean verifier reward 从 0.1000 到 0.1333,其余 没有最终指标提升。这说明真实序列路径已跑通,但当前预算不足以支持“效果复现”结论。
2026-08-29 最新方法¶
- TTPO:多数票路由的 OPSD 与 grouped RL。
- Weak-Model Guidance:弱模型前缀恢复 RLVR 探索。
- Uncertainty-Calibrated MOPD:双温轨迹筛选与 CLL token 门控。
- SPEAR:符号 milestone 和顺序敏感过程奖励。
统一批次索引见 latest-20260829-seed42.json。
一键运行¶
auto-research post-train --algorithm lightning-opd \
--dataset arithmetic-smoke --steps 100 --seed 42
auto-research post-train --algorithm gprl \
--dataset gsm8k-candidate --maximum-examples 512 --steps 300
auto-research post-train --algorithm rloo \
--dataset gsm8k-candidate --maximum-examples 512 --steps 300 --offline
auto-research post-train --algorithm dapo \
--dataset gsm8k-candidate --maximum-examples 512 --steps 300 --offline
auto-research post-train --algorithm simpo \
--dataset arithmetic-generate --maximum-examples 48 \
--steps 6 --seeds 42,43,44 --offline
每次运行独立写入 runs/post-training/<algorithm>-<dataset>-seed<seed>/,
包含 metrics.json 和中文 report.md;checkpoint 只保存在本地,不提交 GitHub。
后续扩展约定¶
新增论文时必须同时完成算法实现、独立论文页、方法索引、统一协议实验和稳定指标。 论文页固定包含论文信息、背景与主要改动、架构图、核心公式、论文效果、本地映射、 复现实验和保真边界,避免入口页随着论文数量增长而失控。