跳转至

LLM 后训练:按主题

采用“研究方向 → 方法簇 → 论文”的两级结构。一级用于快速定位研究范式,二级保留可比较的方法族;每篇论文独占一行,实验结果与复现边界请进入详情页查看。

奖励、信用与课程

课程与能力边界

  • CoBA-RLcoba-rl):普通 RLVR 可能只重新分配 base model 已有轨迹的概率,提升 pass@1 却不扩展高采样 pass@k 所反映的能力边界。该方法先用多次采样估计边界,在边界附近/之外注入教师推理,再用 RL 巩固。
  • SPIRALspiral):同一模型扮演出题者和解题者,在可自动判定的零和多轮语言游戏中形成逐步变难的课程。
  • INTUITORintuitor):把答案分布相对均匀分布的 KL 作为 intrinsic self-certainty reward,在没有答案和 verifier 时优化。
  • Absolute Zeroabsolute-zero):proposer 自己生成可验证任务,solver 求解,程序 verifier 提供奖励;按当前能力边界组织课程。

过程 / token 信用分配

  • SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learningspear):结果奖励过稀,神经 PRM 又昂贵。SPEAR 把教师推理投影为领域符号 milestone,用 LCS-F1 给学生轨迹提供顺序敏感的稠密奖励。
  • SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoningsrpo):长轨迹只给终局 reward 时,很难知道具体哪个 token/动作导致失败。SRPO 让当前模型先根据完整轨迹和环境结果写出简短 reflection patch,再把 patch 拼回原问题;同一个模型在这个特权上下文中充当教师,对学生的 on-policy rollout 给出逐 token 分数。
  • ADRSadrs):privileged teacher 的高置信并不必然与真实任务回报一致。ADRS 在每个交互 step 内标准化教师分数,以教师置信与 realized return 的相关性形成 TVA gate,再把 gated token signal 写入原生 reward-to-advantage 路径,推理时无需技能。
  • CoRTcort):对同一响应分别在带 rubric 和去 criteria 的上下文中重放,用 token 似然差重分配 GRPO 的响应级 advantage。
  • TCRtcr):只奖励最终答案会遗漏推理质量,直接叠加过程奖励又可能重复计算 outcome。TCR 为每个样本构造 thinking checklist,并从过程得分中减去 outcome 的指数滑动基线,把更新集中到“结果奖励尚未解释的思考增益”。
  • TACOtaco):整条回答正确时,统一的正 advantage 会把内部不合理的低概率 token 一起强化,形成 positive-credit contamination。TACO 依据局部上下文计算 tail risk,并仅平滑降低高 risk token 的正信用,负信用仍完整保留。
  • Math-Shepherdmath-shepherd):从中间步骤采样多条 continuation,以最终答案正确率构造自动 step label,再训练 verifier 和重排器。
  • Let's Verify Step by Stepprocess-supervision):逐步奖励模型判断每个推理步骤,并优先标注不确定步骤;本地与 outcome-only 奖励使用同一候选和预算。

奖励构造与排序信号

多模态与结构化 reward

蒸馏与训练闭环

on-policy / context 蒸馏

  • RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learningretire-opd):给不同技能配置解耦教师;学生同时执行 RL 与 on-policy distillation,当成功率接近教师且分布差距不再收缩时自动退休教师。
  • Trajectory Learnability for Offline On-Policy Distillationtrajectory-learnability):用成功轨迹训练参考模型,以参考与当前策略逐 token 对数似然变化衡量可学性,并据此重加权离线 OPD 轨迹。
  • Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillationgamma-opd):以折扣时间信用逼近序列级 reverse-KL,再用有界奖励优势补入可验证结果。
  • Know When to Stop, Where to Restart: Accelerating Multi-Turn Agentic On-Policy Distillationstride-opd):teacher 累积置信度越界时早停,并从最弱正确 turn 的缓存前缀重新开始。
  • Data-free On-policy Distillationdf-opd):由教师在自身策略空间生成问题,减少对外部后训练语料的依赖。本地实现保留决定性状态转换,并输出统一预算下可审计的中间量。
  • A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficientsadaptive-opd-gate):把熵、不确定性、reference 偏移和教师—学生差距组合成逐 token gate,在 FKL/RKL 蒸馏方向间自适应分配。
  • Distillation as Probability Transport: Routed On-Policy Distillationroute-opd):普通 OPD 对整个教师分布做密集匹配。RouteOPD 先识别学生高估的 source token 和低估的 destination token,再只搬运需要修正的概率质量,使监督更聚焦且可解释。
  • Extremely Sparse Supervision Incentivizes Reasoning Abilitysparse-opd):常规 on-policy distillation 对生成轨迹的每个 token 使用教师分布。论文发现只挑一到两个关键位置、约占全部 token 的 0.05%,也能达到或超过全 token 训练。
  • Where to Look Matters: On-Policy Self-Distillation for Long-Video Understandingclue-opsd):学生仍看完整长视频,冻结教师在训练时只看问题相关 clue interval;学生自己的 rollout 上做 on-policy self-distillation,推理时不需要 clue、标签或外部教师。
  • OPDSearch+: Search-Enhanced On-Policy Distillation with Reinforcement Learningopd-search-plus):搜索 Agent 的多轮 SFT 数据昂贵,任务专用教师又需先训练。OPDSearch+ 直接冻结通用 instruct teacher,在学生自己的在线搜索轨迹上用 forward-KL 蒸馏 query、推理和答案 token;随后 RL 从更好的行为分布继续优化,突破教师与纯 RL 的局部最优。
  • OPDVR: On-Policy Distillation with Verifiable Rewardsopdvr):Sampled-token OPD 的隐式奖励由教师/学生概率比决定,可能给正确轨迹负奖励、给错误轨迹正奖励。OPDVR 不再额外混合一个 RL loss,而是直接用 verifier correctness 对该隐式奖励做单侧 ReLU:正确轨迹只保留非负教师信号,错误轨迹只保留非正信号。
  • DASHdash):普通 OPSD 对每个 token 独立匹配 privileged teacher,难把后续可靠推理对前面决策的信用传回去。DASH 由局部 teacher/student divergence 产生停止梯度 gate,再从后向前递推聚合权重;不增加 teacher forward pass,却获得自适应 distillation horizon。
  • RP-OPSDrp-opsd):跨语言迁移中,表面措辞与真正改变推理状态的 pivot 不应同权。RP-OPSD 比较带英文参考解与去掉参考解的匹配教师视图,用分布位移定位 pivot,再在这些位置强化 privileged distillation 并保留 reference anchor。
  • U-OPSDu-opsd):U-OPSD 不使用答案、环境奖励或更大教师。模型多次采样后做多数投票,以最短一致解作为 privileged view,定点修复最长且高置信错误轨迹,是真正依赖内部一致性的自蒸馏。
  • PCSDpcsd):单 token teacher gap 容易受噪声影响,整步共享权重又会抹掉位置差异。PCSD 在自适应窗口内指数累积 teacher-favoring signal,并对下降趋势衰减,最后用连续 sigmoid gate 与 GRPO 联合训练。
  • Flux-OPDflux-opd):固定上下文很快被学生吸收,直接更换上下文 teacher 又会让目标跳变。Flux-OPD 固定 context-free teacher 为锚,只注入多个演化上下文 teacher 相对锚点的 log-probability 差,并用几何均值归一化常数表示冲突、冲突越大修正越弱。
  • VADvad):多模态 OPD 直接匹配 privileged-view teacher 时,教师修正同时混入视觉证据、语言先验和教师自身偏差。VAD 对同一冻结教师分别输入“相关视觉证据存在/移除”两种视图,以 centered log-probability 差构造带符号的视觉方向,再把原教师修正单侧投影到该方向,重建以学生当前分布为锚的 target;完整 privileged teacher 只保留为弱正则。
  • β-OPSDbeta-opsd):论文指出 vanilla OPSD 是 β=1 的 KL 正则策略优化特例。先推导 reference policy 与 privileged teacher 之间的最优几何插值,再把昂贵高方差的 RL 解转成 token-logit 蒸馏目标,并以 return-to-go 做长推理信用分配。
  • Relay-OPDrelay-opd):检测学生前缀失效后让教师短暂接管,再把轨迹交还学生;有限接力预算把监督集中到关键早期位置。
  • OPDLMopd-lm):ARLM 改成双向注意力后既会遗忘原知识,也有随机 mask 训练与 confidence decoding 推理之间的偏移。OPDLM 让双向学生在自身推理轨迹上生成,冻结 AR 教师在同一轨迹给 target logits。
  • Lightning OPDlightning-opd):传统在线蒸馏在每一步训练都调用教师,吞吐和成本受教师推理限制。Lightning OPD 先让学生在 SFT 数据上产生 on-policy rollout,再由同一个教师一次性计算 token 分布并缓存。
  • OPCDopcd):提示词、检索文档和历史经验在上下文清空后会消失。OPCD 让无上下文学生生成轨迹,再由带经验或系统提示的教师沿同一轨迹打分,以 reverse KL 把高概率行为内化到学生参数中。
  • OPSDopsd):普通 OPD 仍需独立教师。OPSD 让同一个模型形成两个条件分布:学生只看问题,教师额外看到验证过的解题过程或答案。
  • GKDgkd):固定教师轨迹会让学生训练时看到的前缀与推理时自身生成的前缀不一致。GKD 让学生生成当前策略轨迹,再让教师在这些学生实际访问的状态给出完整分布;同时用 student data fraction 在固定数据和 on-policy 数据之间插值,并允许 forward KL、reverse KL 或广义 JSD。
  • MiniLLMminillm):标准 forward KL 倾向覆盖教师所有概率质量,小学生可能因此高估教师的低概率区域。MiniLLM 改用 mode-seeking 的 reverse KL,在学生自身生成分布上优化,并通过 teacher-mixed sampling、单步分解、长度归一化和 reward baseline 稳定策略梯度。

教师锚点与 SFT-RL 混合

  • CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood Shiftscompass-opd):异构教师与学生的绝对概率刻度不可直接比较。CompassOPD 用教师相对其 reference 的后训练变化作“指南针”,并在模型族内中心化,保留方向而消除不同模型族的整体偏置。
  • Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillationoprd):OPRD 不直接模仿弱教师答案,而是先测量弱教师经过后训练后的 logit 变化方向,再沿这个方向增强强模型的可验证奖励梯度;核心假设是“学习方向”比弱模型最终能力更容易迁移。
  • Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPDuc-mopd):普通 MOPD 很少采到强正优势 token,也无法判断更新方向是否可靠。方法扩大温度覆盖,按轨迹正优势密度挑样本,再用熵校准 CLL 概率门控 token 更新。
  • From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injectiongrin):纯 on-policy RL 在新知识尚未掌握时几乎采不到正确答案。GRIN 在失败组注入 golden response,再以 mixed-policy importance correction 训练;能力提高后自动回到 on-policy 探索。
  • Distilled RLdistilled-rl):传统 RL 只有序列级奖励,OPD 又会无条件模仿教师。Distilled RL 把教师/学生反向概率比作为 token 级奖励重权重,只在正优势样本上启用教师,并以序列几何均值消除长度尺度偏差。
  • ARMORarmor):单纯 reverse-KL 只能被动惩罚偏离,无法保证 reference 中已有有效解法仍被覆盖。ARMOR 从冻结 reference 主动采样 anchor trajectories,与当前策略 rollout 混合优化,用数据而不是辅助 KL 项稳定长程 RL。
  • MOPDmopd):多能力联合 RL 会产生域间耦合,参数合并和离策略微调又容易丢能力。MOPD 先独立训练各域 RL teacher,再只在 student 自己的 rollout 上组合教师密集信号,使各域可并行演进。
  • CHORDchord):将 SFT 与 RL 串成两个独立阶段会造成 expert data 的过拟合或过早遗忘。CHORD 把专家 SFT 作为 on-policy RL 中动态退火的辅助目标,并以 token 级不确定性权重平滑从模仿过渡到探索。

其他

多模态上下文偏好校准

校准强化学习

OPD

偏好优化

post-training

  • Co-Evolving LLM Evaluators and Policies via DynamicRubricdynamic-rubric):固定 judge 或固定 rubric 会在策略模型进步后失去区分力。DynamicRubric 根据当前 prompt 和一组候选回答动态生成评估维度与权重,用 discriminability 目标寻找能区分当代 hard negatives 的标准,用 anchor 目标限制评估器漂移,再让 evaluator 和 policy 多轮协同进化。
  • Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignmentsis):异步 rollout、样本复用和 stale policy 会让 LLM 强化学习变成 off-policy 更新。标准 importance sampling(IS)在长序列上连乘后方差很大,直接 clipping 又会丢失有效梯度。

外部 rollout

RL 训练加速

RLVR

低秩后训练

DPO 偏好/优化尺度解耦

  • Disentangling Optimization Scale from Preference Scale in DPOnormalized-dpo):标准 DPO 的 \(\beta\) 同时改变偏好噪声尺度与梯度幅度,导致有效学习率被隐式重缩放。论文用除以 \(\beta\) 的 centered-softplus 保持相同 argmin,同时让梯度尺度在 \(\beta\to0\) 时不消失。

负向自蒸馏

rlvr

  • Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Informationoff-context-grpo):困难题上 vanilla GRPO 常因整组 rollout 都失败而没有有效优势信号。Off-Context GRPO 只在采样时向 behavior policy 提供解题草稿或提示等 privileged information,提高成功轨迹出现率;优化目标仍是原始无提示 policy,并用 importance ratio 校正两种采样分布的偏差,因此推理时不需要特权上下文。

多模态后训练

前瞻偏好树

校准奖励

跨领域 RLVR 能力融合

Rubric RL

多奖励 RL

测试时适配

强化学习

多轮 Agent 对齐

证据帧特权自蒸馏

在线强化学习与稳定性

信任域、clip 与梯度稳定

  • Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimizationerpo):传统 Policy-KL 直接压回答分布,稳定训练的同时消耗探索预算。ERPO 观察到 RL 过程中模型诱导的问题分布也会漂移,于是把正则放到输入侧:用冻结 reference 的问题似然给 query 静态加权,再以 Query-KL 控制环境分布漂移,不直接对 response score function 施压。
  • GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMsgcpo):GRPO 等 on-policy rollout RL 会偶发进入预训练权重的主奇异子空间,论文观察到这些 spike 常先于验证性能下降。GCPO 固定预训练矩阵两侧的 top-k 奇异空间,只允许低秩更新存在于输入、输出两侧的正交补中;这是硬可行域,不是依赖系数的软 penalty。
  • RIPOripo):固定 PPO ratio 区间在低概率区域过于保守、在高概率区域又可能过大。RIPO 以 Fisher–Rao 几何定义策略距离,并按旧策略概率设置等距 clip 半径,使不同概率区域获得更均衡的局部 KL 预算。
  • STAREstare):按 batch surprisal 分位数识别 entropy-critical token,重加权其 advantage,并以目标 entropy 闭环 gate 调节方向。
  • GPPOgppo):普通 PPO 在正优势高 ratio、负优势低 ratio 的越界象限直接令梯度为零,可能同时压制探索和从负样本学习。GPPO 保持 PPO 的前向 clipped objective,但通过 stop-gradient 边界权重恢复这些越界位置的反向信号。
  • CISPO / MiniMax-M1cispo):固定 rollout policy 采样,token 级计算 importance ratio,只裁剪比率以保留优势方向和有效梯度。
  • VAPOvapo):长 CoT 的 value-based PPO 易受 critic bias、异质 response 长度和稀疏奖励影响。VAPO 预训练 value model,并依 response 长度调节 actor 的 GAE/更新策略,以更稳定地进行 value-based 推理 RL。

序列目标、长度与聚合偏置

  • ReCoreco-grpo):GRPO 容易重复采到高概率回答,并继续放大已经占优的 token,导致大 \(k\) 下推理路径覆盖率下降。ReCo 同时修正 response 和 token:按 rollout 组中的期望出现次数抑制高频回答,再用 Bernoulli 方差比把更新集中到尚未饱和的决策点。
  • ConSPOconspo):将同组序列的优劣关系写成长度归一化 InfoNCE,避免 token 求和造成长度和组内尺度偏差。
  • LUSPOluspo):论文从目标函数分解解释不同 RLVR 算法为何产生不同的响应长度轨迹,并指出 GSPO 的 sequence ratio 仍含长度偏置。LUSPO 对 sequence log-probability 作长度无偏归一化,避免训练中的长度坍塌。
  • GSPOgspo):GRPO/PPO 常逐 token 裁剪 ratio,但 reward 在完整序列级给出;长序列中单个异常 token 会造成大量裁剪,MoE routing 变化还会放大不稳定。GSPO 对每条 response 取平均 log-ratio,再指数化为单一 sequence ratio,整条序列共享 clip 权重。
  • Dr. GRPOdr-grpo):原始 GRPO 的 response 内长度平均和组内标准差会引入长度与题目难度偏置。Dr. GRPO 移除这两个归一化项,保留中心化的组相对奖励,让每条轨迹以原始尺度参与更新。

PPO、REINFORCE 与 group RL

  • LUFFYluffy):把离线高质量推理与在线 rollout 放进同一 support,通过正则化 importance ratio 保留 on-policy 行为。
  • DAPOdapo):长 CoT 的在线 RL 容易被标准对称 clip 限制探索,且全对/全错的组没有学习信号。DAPO 用 Clip-Higher 放宽概率上升、Dynamic Sampling 丢弃零方差组、token-level loss 公平处理不同长度,并对过长回答分段惩罚。
  • RLOOrloo):PPO 为一般长时域 RL 设计,价值网络、GAE 和多轮 clipping 给 LLM RLHF 带来较大显存与调参开销。RLOO 把一整段 response 视作一个 action;同一 prompt 采样多个 response,用其余样本的平均 reward 作为当前样本 baseline。
  • DeepSeekMath / GRPOgrpo):PPO 的 value model 与 policy 同规模,数学推理 RL 训练显存昂贵。GRPO 对同一问题采样一组 response,以组内 reward 均值和标准差构造 advantage,删除 critic;策略部分仍使用 old policy ratio、clipping 与 reference KL。
  • ReMaxremax):ReMax 利用 LLM RLHF 的三项特征:模拟快、token 转移确定、reward 通常只在轨迹末端给出。它删除 PPO 的 value model,以当前策略 greedy decoding 的 reward 作 prompt-dependent baseline,降低 REINFORCE 方差。
  • InstructGPT / PPO-RLHFppo-rlhf):只扩大语言模型不能保证更符合用户意图。InstructGPT 建立了经典三阶段流程:先用标注员示范做 SFT,再用成对排序训练 reward model,最后用 PPO 优化策略,同时以 KL 惩罚限制策略偏离 SFT/reference model。

优势估计与多目标优化

  • Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generationprobe-erpo):论文用不依赖最终答案的 probe consistency ratio(PCR)估计当前题目的可信度:高一致样本可强化,低一致样本对排名靠后的候选施加负向约束,同时用熵项控制探索。
  • Boosting LLM Exploration via Weak-Model Guidance in RLVRweak-guide-rlvr):RLVR 容易熵坍缩。论文用更小弱模型生成部分推理前缀,迫使目标模型进入陌生轨迹,再以 entropy 截断和原生/前缀样本混训保持覆盖率。
  • TTPO: Test-Time Policy Optimizationttpo):多数票伪标签可能错误,但与多数票分歧的 rollout 通常仍是错的。TTPO 因而对同意分支做 OPSD,对分歧分支做 grouped RL,并分别过滤已收敛 token 与高置信错误。
  • GPRLgprl):单一标量 reward 容易掩盖 helpfulness、格式、推理和简洁度之间的冲突。GPRL 先在每个偏好维度内部计算 group-relative advantage,再根据上下文聚合;漂移控制器检测某个维度是否主导训练并调整权重。
  • TTRLttrl):同一测试题多次采样,以多数一致答案作为伪标签并即时更新模型,不访问 gold label。
  • REINFORCE++reinforce-plus):GRPO/RLOO 的 prompt-local 标准差会让不同难度组被随机方差重新加权。REINFORCE++ 保留组内中心化,但使用跨 batch 的全局优势尺度归一化,从而在不引入 critic 的前提下降低方差与局部偏置。

偏好建模与监督

安全对齐与可控监督

  • SteerLMsteerlm):传统 RLHF 把多维偏好压成一个 reward,用户推理时也不能改变目标。SteerLM 先用 attribute prediction model 为回答标注 helpfulness、quality 等属性,再把属性和值拼入条件做普通 SFT,推理时由用户指定目标属性。
  • RLAIFrlaif):AI labeler 对候选做顺序交换评判,去除位置偏差后训练 preference policy;本地落实双顺序标签与成对更新。
  • Constitutional AIconstitutional-ai):人工逐条标注有害回答成本高,而且价值规范不透明。论文把人类监督压缩成一组自然语言原则:第一阶段让模型依据原则批评并重写自己的回答,再对修订回答做 SFT;第二阶段让 AI 比较回答、训练 preference model,并以该奖励执行 RLAIF。

成对、单样本与排序偏好

  • SimPOsimpo):DPO 训练需要常驻 reference model,而且 sequence 概率天然偏向短响应。SimPO 用平均 token log-probability 作为隐式 reward,去掉 reference model,并在 Bradley–Terry 目标中加入固定 margin。
  • ORPOorpo):常见对齐流程先 SFT、再用 reference-relative 偏好目标训练。ORPO 把 chosen response 的 NLL 与 chosen/rejected 的 odds-ratio penalty 合成一个目标;概率接近 0 或 1 时,odds 会提供比普通概率差更敏感的对比信号。
  • KTOkto):DPO 需要成对偏好,而生产反馈常只有点赞、点踩或是否接受。KTO 将单样本反馈映射为 desirable / undesirable utility,并用 policy 与 reference 的 KL 期望作为“参照点”;两类样本可独立采集,也允许类别不平衡。
  • IPOipo):论文指出 RLHF 与 DPO 都依赖将成对偏好转成标量 reward 的假设,并提出直接在偏好概率上优化的 \(\Psi\)PO 框架。取恒等映射得到 IPO:拟合一个有限的目标间隔,而不是像 logistic loss 一样在训练集可分时持续放大 chosen/rejected 间隔。
  • DPOdpo):传统 RLHF 先拟合 reward model,再用 PPO 优化策略,链路复杂且不稳定。DPO 从 KL-regularized RLHF 的最优策略形式出发,把隐式 reward 写成 policy 与 reference log-ratio,最终只需在偏好对上做二分类。
  • SLiC-HFslic-hf):PPO-RLHF 需要策略、reward 和 value 等多套模型。SLiC-HF 直接要求偏好回答的序列 log-likelihood 高于拒绝回答,并用监督目标限制策略漂移;也能消费为其他模型采集的 off-policy 偏好数据。
  • RRHFrrhf):PPO-RLHF 需要 policy、old policy、reward 和 value 等多模型协同,训练和调参复杂。RRHF 从多个模型或人工答案中采样响应,以 reward 给出完整排序,让模型自身的平均 log-likelihood 顺序与 reward 顺序一致,并对最高质量响应继续做 SFT。

模型融合与推理效率

选优微调与自博弈

  • Self-Rewarding LMself-rewarding):每轮由当前模型生成候选并以 LLM-as-a-Judge 打分,形成新的偏好对继续 DPO,构成自举闭环。
  • SPINspin):额外偏好标注昂贵。SPIN 从 SFT 模型出发,用上一轮模型为训练 prompt 生成回答,把人类示范视作正例、自生成回答视作负例,通过自博弈判别目标得到下一轮模型,循环提升而不引入新的人工偏好数据。
  • RAFTraft):PPO 的在线更新不稳定,而在固定 SFT 数据上训练又无法持续利用变好的策略。RAFT 每轮从当前模型生成多个响应,用 reward model 排序并丢弃低质量样本,只对选中的高质量响应执行普通 maximum-likelihood fine-tuning,然后用新策略进入下一轮。

训推一致性与高效 rollout

重要性采样与引擎失配

  • KPopkpop):异步 rollout 中的 serving 概率与训练侧概率失配,固定 ratio mask 会误删正常探索或保留错误梯度。KPop 将当前 token 与“其余词表”压缩为二元分布,只有正反两个方向的 binary KL 都低于阈值时才保留该 token 的更新。
  • Missing Old Logitsmissing-old-logits):指出异步 RL 丢失历史训练侧 logits 后,训推校正与策略陈旧校正发生语义混叠;给出快照、old-logit model、中断同步和 PPO-EWMA 修复。
  • Online IcePoponline-icepop):普通 IcePop 同时面对训练/rollout 引擎差异和一次 rollout 被多次更新造成的策略陈旧。Online IcePop 强制每个 rollout batch 只更新一次,使 stale-policy ratio 恒为 1,从目标中移除 PPO ratio 与 clip;训练侧仍用 IcePop 双侧 mask 和区间内原始 ratio 校正引擎失配。
  • Stabilizing RL with LLMsminirl):分解训推差异与 policy staleness,on-policy 使用 importance correction,off-policy 结合 clipping 与 MoE Routing Replay。
  • IcePopicepop):MoE router 会放大训练引擎与 rollout 引擎的微小数值差异,单侧 TIS 仍可能保留严重偏小的失配 ratio。IcePop 对训练侧与 rollout 引擎的 token 概率比设置固定双侧区间;区间内保留原始校正权重,区间外 token 的本次策略梯度直接归零。
  • TIStis):混合训练框架由 rollout 引擎采样、训练引擎重算 log-prob;即使权重相同,数值精度和 kernel 差异也会让行为分布与训练分布偏离。TIS 将训练侧与 rollout 引擎概率比乘入策略梯度,并只对过大的校正权重做单侧上截断,保留小权重样本而控制重尾方差。

预算分配与 speculative rollout