跳转至

LLM 后训练:按机构/公司/学校

按论文一作的第一署名单位聚合;单位内按首次公开日期倒序排列。每篇论文同时显示一作姓名,并附一至两句中文方法简介。联合工作不会重复归入所有合作单位。

AMAP, Alibaba Group

Affiliation not listed in the paper

  • 2026-08-27 · 一作:Ivan Kruzhilov · Disentangling Optimization Scale from Preference Scale in DPOnormalized-dpo):标准 DPO 的 \(\beta\) 同时改变偏好噪声尺度与梯度幅度,导致有效学习率被隐式重缩放。论文用除以 \(\beta\) 的 centered-softplus 保持相同 argmin,同时让梯度尺度在 \(\beta\to0\) 时不消失。

Alibaba / Qwen

Alibaba DAMO Academy

  • 2023-04-11 · 一作:Zheng Yuan · RRHFrrhf):PPO-RLHF 需要 policy、old policy、reward 和 value 等多模型协同,训练和调参复杂。RRHF 从多个模型或人工答案中采样响应,以 reward 给出完整排序,让模型自身的平均 log-likelihood 顺序与 reward 顺序一致,并对最高质量响应继续做 SFT。

Alibaba Group

  • 2026-09-15 · 一作:Zishuo Zhao · Turn-level Multiscale Density Ratio Estimation for LLM Agentstlm-dre):按 turn 分配多尺度权重,并对正负 token 密度比采用非对称更新。
  • 2025-08-15 · 一作:Wenhao Zhang · CHORDchord):将 SFT 与 RL 串成两个独立阶段会造成 expert data 的过拟合或过早遗忘。CHORD 把专家 SFT 作为 on-policy RL 中动态退火的辅助目标,并以 token 级不确定性权重平滑从模仿过渡到探索。
  • 2025-08-11 · 一作:Zhenpeng Su · GPPOgppo):普通 PPO 在正优势高 ratio、负优势低 ratio 的越界象限直接令梯度为零,可能同时压制探索和从负样本学习。GPPO 保持 PPO 的前向 clipped objective,但通过 stop-gradient 边界权重恢复这些越界位置的反向信号。

Alibaba Qwen Team

  • 2025-12-01 · 一作:Chujie Zheng · Stabilizing RL with LLMsminirl):分解训推差异与 policy staleness,on-policy 使用 importance correction,off-policy 结合 clipping 与 MoE Routing Replay。
  • 2025-07-24 · 一作:Chujie Zheng · GSPOgspo):GRPO/PPO 常逐 token 裁剪 ratio,但 reward 在完整序列级给出;长序列中单个异常 token 会造成大量裁剪,MoE routing 变化还会放大不稳定。GSPO 对每条 response 取平均 log-ratio,再指数化为单一 sequence ratio,整条序列共享 clip 权重。

Amazon / Duke University

  • 2026-09-03 · 一作:Zhishuai Liu · Extremely Sparse Supervision Incentivizes Reasoning Abilitysparse-opd):常规 on-policy distillation 对生成轨迹的每个 token 使用教师分布。论文发现只挑一到两个关键位置、约占全部 token 的 0.05%,也能达到或超过全 token 训练。

Ant Group

  • 2025-12-16 · 一作:Jian Hu · Online IcePoponline-icepop):普通 IcePop 同时面对训练/rollout 引擎差异和一次 rollout 被多次更新造成的策略陈旧。Online IcePop 强制每个 rollout batch 只更新一次,使 stale-policy ratio 恒为 1,从目标中移除 PPO ratio 与 clip;训练侧仍用 IcePop 双侧 mask 和区间内原始 ratio 校正引擎失配。
  • 2025-10-21 · 一作:Ling Team · IcePopicepop):MoE router 会放大训练引擎与 rollout 引擎的微小数值差异,单侧 TIS 仍可能保留严重偏小的失配 ratio。IcePop 对训练侧与 rollout 引擎的 token 概率比设置固定双侧区间;区间内保留原始校正权重,区间外 token 的本次策略梯度直接归零。

Anthropic

  • 2022-12-15 · 一作:Yuntao Bai · Constitutional AIconstitutional-ai):人工逐条标注有害回答成本高,而且价值规范不透明。论文把人类监督压缩成一组自然语言原则:第一阶段让模型依据原则批评并重写自己的回答,再对修订回答做 SFT;第二阶段让 AI 比较回答、训练 preference model,并以该奖励执行 RLAIF。

Apple

  • 2025-06-30 · 一作:Bo Liu · SPIRALspiral):同一模型扮演出题者和解题者,在可自动判定的零和多轮语言游戏中形成逐步变难的课程。

Arizona State University / University of Virginia / Stevens Institute of Technology

Authors did not disclose affiliation

Beijing Institute of Technology

  • 2026-05-13 · 一作:Feng Zhang · ConSPOconspo):将同组序列的优劣关系写成长度归一化 InfoNCE,避免 token 求和造成长度和组内尺度偏差。

ByteDance Seed

  • 2025-04-07 · 一作:Yu Yue · VAPOvapo):长 CoT 的 value-based PPO 易受 critic bias、异质 response 长度和稀疏奖励影响。VAPO 预训练 value model,并依 response 长度调节 actor 的 GAE/更新策略,以更稳定地进行 value-based 推理 RL。
  • 2025-03-18 · 一作:Qiying Yu · DAPOdapo):长 CoT 的在线 RL 容易被标准对称 clip 限制探索,且全对/全错的组没有学习信号。DAPO 用 Clip-Higher 放宽概率上升、Dynamic Sampling 丢弃零方差组、token-level loss 公平处理不同长度,并对过长回答分段惩罚。

ByteDance internship

  • 2026-07-28 · 一作:Bo-Wen Zhang · CoRTcort):对同一响应分别在带 rubric 和去 criteria 的上下文中重放,用 token 似然差重分配 GRPO 的响应级 advantage。

Chongqing University

Cohere For AI

  • 2024-02-22 · 一作:Arash Ahmadian · RLOOrloo):PPO 为一般长时域 RL 设计,价值网络、GAE 和多轮 clipping 给 LLM RLHF 带来较大显存与调参开销。RLOO 把一整段 response 视作一个 action;同一 prompt 采样多个 response,用其余样本的平均 reward 作为当前样本 baseline。

Contextual AI

  • 2024-02-02 · 一作:Kawin Ethayarajh · KTOkto):DPO 需要成对偏好,而生产反馈常只有点赞、点踩或是否接受。KTO 将单样本反馈映射为 desirable / undesirable utility,并用 policy 与 reference 的 KL 期望作为“参照点”;两类样本可独立采集,也允许类别不平衡。

DeepSeek-AI

  • 2024-02-05 · 一作:Zhihong Shao · DeepSeekMath / GRPOgrpo):PPO 的 value model 与 policy 同规模,数学推理 RL 训练显存昂贵。GRPO 对同一问题采样一组 response,以组内 reward 均值和标准差构造 advantage,删除 critic;策略部分仍使用 old policy ratio、clipping 与 reference KL。

Fudan University

  • 2026-08-27 · 一作:Siye Wu · Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigmsrlvr-fusion):论文统一比较三种复用产物不同的跨域能力融合:Merge 合并专家 task vector,Mix RL 合并训练数据,MOPD 同时复用专家和数据。平均差距不超过 1.4 points,但单项可达 8.6 points,因此选择取决于专家、数据和成本条件。

Google DeepMind

  • 2023-10-18 · 一作:Mohammad Gheshlaghi Azar · IPOipo):论文指出 RLHF 与 DPO 都依赖将成对偏好转成标量 reward 的假设,并提出直接在偏好概率上优化的 \(\Psi\)PO 框架。取恒等映射得到 IPO:拟合一个有限的目标间隔,而不是像 logistic loss 一样在训练集可分时持续放大 chosen/rejected 间隔。
  • 2023-06-23 · 一作:Rishabh Agarwal · GKDgkd):固定教师轨迹会让学生训练时看到的前缀与推理时自身生成的前缀不一致。GKD 让学生生成当前策略轨迹,再让教师在这些学生实际访问的状态给出完整分布;同时用 student data fraction 在固定数据和 on-policy 数据之间插值,并允许 forward KL、reverse KL 或广义 JSD。
  • 2023-05-17 · 一作:Yao Zhao · SLiC-HFslic-hf):PPO-RLHF 需要策略、reward 和 value 等多套模型。SLiC-HF 直接要求偏好回答的序列 log-likelihood 高于拒绝回答,并用监督目标限制策略漂移;也能消费为其他模型采集的 off-policy 偏好数据。

Google Research

  • 2023-09-01 · 一作:Harrison Lee · RLAIFrlaif):AI labeler 对候选做顺序交换评判,去除位置偏差后训练 preference policy;本地落实双顺序标签与成对更新。

HKUST

  • 2023-04-13 · 一作:Hanze Dong · RAFTraft):PPO 的在线更新不稳定,而在固定 SFT 数据上训练又无法持续利用变好的策略。RAFT 每轮从当前模型生成多个响应,用 reward model 排序并丢弃低质量样本,只对选中的高质量响应执行普通 maximum-likelihood fine-tuning,然后用新策略进入下一轮。

Independent Researcher

Independent researchers

  • 2025-01-04 · 一作:Jian Hu · REINFORCE++reinforce-plus):GRPO/RLOO 的 prompt-local 标准差会让不同难度组被随机方差重新加权。REINFORCE++ 保留组内中心化,但使用跨 batch 的全局优势尺度归一化,从而在不引入 critic 的前提下降低方差与局部偏置。

Institute of Automation, Chinese Academy of Sciences / Tencent

  • 2026-09-12 · 一作:Gengsheng Li · Data-free On-policy Distillationdf-opd):由教师在自身策略空间生成问题,减少对外部后训练语料的依赖。本地实现保留决定性状态转换,并输出统一预算下可审计的中间量。

Institute of Information Engineering, Chinese Academy of Sciences

Johns Hopkins University

  • 2026-07-08 · 一作:Xiuyi Lou · TACOtaco):整条回答正确时,统一的正 advantage 会把内部不合理的低概率 token 一起强化,形成 positive-credit contamination。TACO 依据局部上下文计算 tail risk,并仅平滑降低高 risk token 的正信用,负信用仍完整保留。

KAIST

  • 2024-03-12 · 一作:Jiwoo Hong · ORPOorpo):常见对齐流程先 SFT、再用 reference-relative 偏好目标训练。ORPO 把 chosen response 的 NLL 与 chosen/rejected 的 odds-ratio penalty 合成一个目标;概率接近 0 或 1 时,odds 会提供比普通概率差更敏感的对比信号。

KAIST AI

Korea University

LeapLab, Tsinghua University

  • 2026-08-25 · 一作:Wenze Lin · OPDVR: On-Policy Distillation with Verifiable Rewardsopdvr):Sampled-token OPD 的隐式奖励由教师/学生概率比决定,可能给正确轨迹负奖励、给错误轨迹正奖励。OPDVR 不再额外混合一个 RL loss,而是直接用 verifier correctness 对该隐式奖励做单侧 ReLU:正确轨迹只保留非负教师信号,错误轨迹只保留非正信号。

Ling / Ring Team

  • 2026-06-13 · 一作:Ang Li · KPopkpop):异步 rollout 中的 serving 概率与训练侧概率失配,固定 ratio mask 会误删正常探索或保留错误梯度。KPop 将当前 token 与“其余词表”压缩为二元分布,只有正反两个方向的 binary KL 都低于阈值时才保留该 token 的更新。

MIT HAN Lab

  • 2026-04-14 · 一作:Yecheng Wu · Lightning OPDlightning-opd):传统在线蒸馏在每一步训练都调用教师,吞吐和成本受教师推理限制。Lightning OPD 先让学生在 SFT 数据上产生 on-policy rollout,再由同一个教师一次性计算 token 分布并缓存。

Massachusetts Institute of Technology

Meituan

  • 2026-02-05 · 一作:Fanfan Liu · LUSPOluspo):论文从目标函数分解解释不同 RLVR 算法为何产生不同的响应长度轨迹,并指出 GSPO 的 sequence ratio 仍含长度偏置。LUSPO 对 sequence log-probability 作长度无偏归一化,避免训练中的长度坍塌。

Meta AI

  • 2026-07-21 · 一作:Priyank Agrawal · Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Informationoff-context-grpo):困难题上 vanilla GRPO 常因整组 rollout 都失败而没有有效优势信号。Off-Context GRPO 只在采样时向 behavior policy 提供解题草稿或提示等 privileged information,提高成功轨迹出现率;优化目标仍是原始无提示 policy,并用 importance ratio 校正两种采样分布的偏差,因此推理时不需要特权上下文。
  • 2024-01-18 · 一作:Weizhe Yuan · Self-Rewarding LMself-rewarding):每轮由当前模型生成候选并以 LLM-as-a-Judge 打分,形成新的偏好对继续 DPO,构成自举闭环。

Microsoft Research

  • 2026-02-12 · 一作:Tianzhu Ye · OPCDopcd):提示词、检索文档和历史经验在上下文清空后会消失。OPCD 让无上下文学生生成轨迹,再由带经验或系统提示的教师沿同一轨迹打分,以 reverse KL 把高概率行为内化到学生参数中。

MiniMax

  • 2025-06-16 · 一作:MiniMax · CISPO / MiniMax-M1cispo):固定 rollout policy 采样,token 级计算 importance ratio,只裁剪比率以保留优势方向和有效梯度。

NVIDIA

  • 2023-10-09 · 一作:Yi Dong · SteerLMsteerlm):传统 RLHF 把多维偏好压成一个 reward,用户推理时也不能改变目标。SteerLM 先用 attribute prediction model 为回答标注 helpfulness、quality 等属性,再把属性和值拼入条件做普通 SFT,推理时由用户指定目标属性。

Nanjing University

  • 2026-08-06 · 一作:Zhiyan Hou · DASHdash):普通 OPSD 对每个 token 独立匹配 privileged teacher,难把后续可靠推理对前面决策的信用传回去。DASH 由局部 teacher/student divergence 产生停止梯度 gate,再从后向前递推聚合权重;不增加 teacher forward pass,却获得自适应 distillation horizon。
  • 2026-08-06 · 一作:Xinye Wang · RP-OPSDrp-opsd):跨语言迁移中,表面措辞与真正改变推理状态的 pivot 不应同权。RP-OPSD 比较带英文参考解与去掉参考解的匹配教师视图,用分布位移定位 pivot,再在这些位置强化 privileged distillation 并保留 reference anchor。

Nankai University

  • 2026-07-19 · 一作:Chen Wang · Distilled RLdistilled-rl):传统 RL 只有序列级奖励,OPD 又会无条件模仿教师。Distilled RL 把教师/学生反向概率比作为 token 级奖励重权重,只在正优势样本上启用教师,并以序列几何均值消除长度尺度偏差。

Nanyang Technological University

National University of Defense Technology

National University of Singapore

Northeastern University

OpenAI

  • 2023-05-31 · 一作:Hunter Lightman · Let's Verify Step by Stepprocess-supervision):逐步奖励模型判断每个推理步骤,并优先标注不确定步骤;本地与 outcome-only 奖励使用同一候选和预算。
  • 2022-03-04 · 一作:Long Ouyang · InstructGPT / PPO-RLHFppo-rlhf):只扩大语言模型不能保证更符合用户意图。InstructGPT 建立了经典三阶段流程:先用标注员示范做 SFT,再用成对排序训练 reward model,最后用 PPO 优化策略,同时以 KL 惩罚限制策略偏离 SFT/reference model。

PRIME-RL author team

  • 2025-04-22 · 一作:Yuxin Zuo · TTRLttrl):同一测试题多次采样,以多数一致答案作为伪标签并即时更新模型,不访问 gold label。

Peking University

  • 2026-08-27 · 一作:Xingyu Shen · Boosting LLM Exploration via Weak-Model Guidance in RLVRweak-guide-rlvr):RLVR 容易熵坍缩。论文用更小弱模型生成部分推理前缀,迫使目标模型进入陌生轨迹,再以 entropy 截断和原生/前缀样本混训保持覆盖率。
  • 2026-08-27 · 一作:Ziyuan Liu · Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPDuc-mopd):普通 MOPD 很少采到强正优势 token,也无法判断更新方向是否可靠。方法扩大温度覆盖,按轨迹正优势密度挑样本,再用熵校准 CLL 概率门控 token 更新。
  • 2026-08-26 · 一作:Lam So · GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoninggrip):在 thinking 与 instruct 权重间,不使用单一全局系数,而由细粒度 reward 学习分层/参数插值,使模型保留推理准确率同时缩短输出。
  • 2026-07-30 · 一作:Yuran Wang · Flux-OPDflux-opd):固定上下文很快被学生吸收,直接更换上下文 teacher 又会让目标跳变。Flux-OPD 固定 context-free teacher 为锚,只注入多个演化上下文 teacher 相对锚点的 log-probability 差,并用几何均值归一化常数表示冲突、冲突越大修正越弱。
  • 2023-12-14 · 一作:Peiyi Wang · Math-Shepherdmath-shepherd):从中间步骤采样多条 continuation,以最终答案正确率构造自动 step label,再训练 verifier 和重排器。

Princeton University

  • 2024-05-23 · 一作:Yu Meng · SimPOsimpo):DPO 训练需要常驻 reference model,而且 sequence 概率天然偏向短响应。SimPO 用平均 token log-probability 作为隐式 reward,去掉 reference model,并在 Bradley–Terry 目标中加入固定 margin。

Reichman University

Renmin University of China

S-Lab, Nanyang Technological University

SAIL 研究团队

  • 2025-03-26 · 一作:Zichen Liu · Dr. GRPOdr-grpo):原始 GRPO 的 response 内长度平均和组内标准差会引入长度与题目难度偏置。Dr. GRPO 移除这两个归一化项,保留中心化的组相对奖励,让每条轨迹以原始尺度参与更新。

Scale AI

Seoul National University

  • 2026-08-03 · 一作:Wonseok Lee · Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Modelserils):约束外部策略 rollout 长度,并对 on-policy/external 来源分别处理奖励以防联合归一化崩溃。
  • 2026-07-29 · 一作:Junoh Park · ReCoreco-grpo):GRPO 容易重复采到高概率回答,并继续放大已经占优的 token,导致大 \(k\) 下推理路径覆盖率下降。ReCo 同时修正 response 和 token:按 rollout 组中的期望出现次数抑制高频回答,再用 Bernoulli 方差比把更新集中到尚未饱和的决策点。

Shanghai AI Laboratory

  • 2026-08-12 · 一作:Kai Yang · GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMsgcpo):GRPO 等 on-policy rollout RL 会偶发进入预训练权重的主奇异子空间,论文观察到这些 spike 常先于验证性能下降。GCPO 固定预训练矩阵两侧的 top-k 奇异空间,只允许低秩更新存在于输入、输出两侧的正交补中;这是硬可行域,不是依赖系数的软 penalty。

Shanghai Jiao Tong University

  • 2026-07-30 · 一作:Kangning Zhang · VADvad):多模态 OPD 直接匹配 privileged-view teacher 时,教师修正同时混入视觉证据、语言先验和教师自身偏差。VAD 对同一冻结教师分别输入“相关视觉证据存在/移除”两种视图,以 centered log-probability 差构造带符号的视觉方向,再把原教师修正单侧投影到该方向,重建以学生当前分布为锚的 target;完整 privileged teacher 只保留为弱正则。

Stanford University

  • 2026-05-18 · 一作:Muhammad Umer · GPRLgprl):单一标量 reward 容易掩盖 helpfulness、格式、推理和简洁度之间的冲突。GPRL 先在每个偏好维度内部计算 group-relative advantage,再根据上下文聚合;漂移控制器检测某个维度是否主导训练并调整权重。
  • 2023-05-29 · 一作:Rafael Rafailov · DPOdpo):传统 RLHF 先拟合 reward model,再用 PPO 优化策略,链路复杂且不稳定。DPO 从 KL-regularized RLHF 的最优策略形式出发,把隐式 reward 写成 policy 与 reference log-ratio,最终只需在偏好对上做二分类。

Tencent

Texas A&M University

  • 2026-06-04 · 一作:Xingyu Su · OPDLMopd-lm):ARLM 改成双向注意力后既会遗忘原知识,也有随机 mask 训练与 confidence decoding 推理之间的偏移。OPDLM 让双向学生在自身推理轨迹上生成,冻结 AR 教师在同一轨迹给 target logits。

The University of Texas at Austin

  • 2026-07-21 · 一作:Hanqing Zhu · ISO: An RLVR-Native Optimization Stackiso-rlvr):固定预训练权重奇异值,仅优化输入/输出 singular frames;同时提供无数据 specialist merger。

Tianjin University

Tsinghua University

  • 2026-07-11 · 一作:Zhicheng Cai · RIPOripo):固定 PPO ratio 区间在低概率区域过于保守、在高概率区域又可能过大。RIPO 以 Fisher–Rao 几何定义策略距离,并按旧策略概率设置等距 clip 半径,使不同概率区域获得更均衡的局部 KL 预算。
  • 2026-06-17 · 一作:Haipeng Luo · STAREstare):按 batch surprisal 分位数识别 entropy-critical token,重加权其 advantage,并以目标 entropy 闭环 gate 调节方向。
  • 2025-05-06 · 一作:Andrew Zhao · Absolute Zeroabsolute-zero):proposer 自己生成可验证任务,solver 求解,程序 verifier 提供奖励;按当前能力边界组织课程。
  • 2023-06-14 · 一作:Yuxian Gu · MiniLLMminillm):标准 forward KL 倾向覆盖教师所有概率质量,小学生可能因此高估教师的低概率区域。MiniLLM 改用 mode-seeking 的 reverse KL,在学生自身生成分布上优化,并通过 teacher-mixed sampling、单步分解、长度归一化和 reward baseline 稳定策略梯度。

Tsinghua University / DiDi Voyager Labs

University of California, Berkeley

  • 2026-09-16 · 一作:Peter Chen · A Zeroth-Order Paradigm for LLM Preference Alignmentcompo):不求偏好目标梯度,只比较正负参数扰动的结果得到一比特方向,再以逐坐标阈值抑制噪声。
  • 2025-05-26 · 一作:Xuandong Zhao · INTUITORintuitor):把答案分布相对均匀分布的 KL 作为 intrinsic self-certainty reward,在没有答案和 verifier 时优化。

University of California, Los Angeles

  • 2026-01-26 · 一作:Siyan Zhao · OPSDopsd):普通 OPD 仍需独立教师。OPSD 让同一个模型形成两个条件分布:学生只看问题,教师额外看到验证过的解题过程或答案。
  • 2024-01-02 · 一作:Zixiang Chen · SPINspin):额外偏好标注昂贵。SPIN 从 SFT 模型出发,用上一轮模型为训练 prompt 生成回答,把人类示范视作正例、自生成回答视作负例,通过自博弈判别目标得到下一轮模型,循环提升而不引入新的人工偏好数据。

University of California, Merced

University of California, San Diego

  • 2026-08-06 · 一作:Yijiang Li · U-OPSDu-opsd):U-OPSD 不使用答案、环境奖励或更大教师。模型多次采样后做多数投票,以最短一致解作为 privileged view,定点修复最长且高置信错误轨迹,是真正依赖内部一致性的自蒸馏。
  • 2025-08-05 · 一作:Feng Yao · TIStis):混合训练框架由 rollout 引擎采样、训练引擎重算 log-prob;即使权重相同,数值精度和 kernel 差异也会让行为分布与训练分布偏离。TIS 将训练侧与 rollout 引擎概率比乘入策略梯度,并只对过大的校正权重做单侧上截断,保留小权重样本而控制重尾方差。

University of Chinese Academy of Sciences

  • 2026-08-25 · 一作:Qinglin Ye · OPDSearch+: Search-Enhanced On-Policy Distillation with Reinforcement Learningopd-search-plus):搜索 Agent 的多轮 SFT 数据昂贵,任务专用教师又需先训练。OPDSearch+ 直接冻结通用 instruct teacher,在学生自己的在线搜索轨迹上用 forward-KL 蒸馏 query、推理和答案 token;随后 RL 从更好的行为分布继续优化,突破教师与纯 RL 的局部最优。

University of Florida

University of Maryland, College Park

  • 2026-08-26 · 一作:Kaishen Wang · Where to Look Matters: On-Policy Self-Distillation for Long-Video Understandingclue-opsd):学生仍看完整长视频,冻结教师在训练时只看问题相关 clue interval;学生自己的 rollout 上做 on-policy self-distillation,推理时不需要 clue、标签或外部教师。
  • 2026-07-30 · 一作:Jiawei Xu · β-OPSDbeta-opsd):论文指出 vanilla OPSD 是 β=1 的 KL 正则策略优化特例。先推导 reference policy 与 privileged teacher 之间的最优几何插值,再把昂贵高方差的 RL 解转成 token-logit 蒸馏目标,并以 return-to-go 做长推理信用分配。

University of Notre Dame / Amazon

University of Pittsburgh

University of Science and Technology of China

  • 2026-08-04 · 一作:Ranxu Zhang · ADRSadrs):privileged teacher 的高置信并不必然与真实任务回报一致。ADRS 在每个交互 step 内标准化教师分数,以教师置信与 realized return 的相关性形成 TVA gate,再把 gated token signal 写入原生 reward-to-advantage 路径,推理时无需技能。
  • 2026-07-11 · 一作:Kexin Huang · ARMORarmor):单纯 reverse-KL 只能被动惩罚偏离,无法保证 reference 中已有有效解法仍被覆盖。ARMOR 从冻结 reference 主动采样 anchor trajectories,与当前策略 rollout 混合优化,用数据而不是辅助 KL 项稳定长程 RL。

University of Science and Technology of China / Ant Group

University of Southern California

University of Virginia

University of Washington

  • 2026-09-10 · 一作:Dongfang Zhao · LOCUS: Task-Aware Low-Rank Post-Training for Token-Efficient Language Generationlocus):学习任务相关低秩后训练子空间,只在紧凑方向上更新以缩短回答,同时保留任务能力。
  • 2025-04-21 · 一作:Jianhao Yan · LUFFYluffy):把离线高质量推理与在线 rollout 放进同一 support,通过正则化 importance ratio 保留 on-policy 行为。

VNU University of Engineering and Technology / Viettel AI

Waseda University

WeChat / Tencent

  • 2026-07-22 · 一作:Beining Wang · Co-Evolving LLM Evaluators and Policies via DynamicRubricdynamic-rubric):固定 judge 或固定 rubric 会在策略模型进步后失去区分力。DynamicRubric 根据当前 prompt 和一组候选回答动态生成评估维度与权重,用 discriminability 目标寻找能区分当代 hard negatives 的标准,用 anchor 目标限制评估器漂移,再让 evaluator 和 policy 多轮协同进化。

WeChat AI, Tencent / Peking University

Wuhan University

  • 2026-08-24 · 一作:Jialong Liu · SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoningsrpo):长轨迹只给终局 reward 时,很难知道具体哪个 token/动作导致失败。SRPO 让当前模型先根据完整轨迹和环境结果写出简短 reflection patch,再把 patch 拼回原问题;同一个模型在这个特权上下文中充当教师,对学生的 on-policy rollout 给出逐 token 分数。

Xiaohongshu

Xiaomi

  • 2026-06-29 · 一作:Wenhan Ma · MOPDmopd):多能力联合 RL 会产生域间耦合,参数合并和离策略微调又容易丢能力。MOPD 先独立训练各域 RL teacher,再只在 student 自己的 rollout 上组合教师密集信号,使各域可并行演进。

Zhejiang University

  • 2026-09-17 · 一作:ZJU-REAL team · RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learningretire-opd):给不同技能配置解耦教师;学生同时执行 RL 与 on-policy distillation,当成功率接近教师且分布差距不再收缩时自动退休教师。
  • 2026-08-27 · 一作:Aozhe Wang · TTPO: Test-Time Policy Optimizationttpo):多数票伪标签可能错误,但与多数票分歧的 rollout 通常仍是错的。TTPO 因而对同意分支做 OPSD,对分歧分支做 grouped RL,并分别过滤已收敛 token 与高置信错误。
  • 2026-07-28 · 一作:Haolei Xu · Relay-OPDrelay-opd):检测学生前缀失效后让教师短暂接管,再把轨迹交还学生;有限接力预算把监督集中到关键早期位置。
  • 2026-06-21 · 一作:Pengxiang Cai · CoBA-RLcoba-rl):普通 RLVR 可能只重新分配 base model 已有轨迹的概率,提升 pass@1 却不扩展高采样 pass@k 所反映的能力边界。该方法先用多次采样估计边界,在边界附近/之外注入教师推理,再用 RL 巩固。

论文未列机构

  • 2026-08-03 · 一作:Chunji Lv · PCSDpcsd):单 token teacher gap 容易受噪声影响,整步共享权重又会抹掉位置差异。PCSD 在自适应窗口内指数累积 teacher-favoring signal,并对下降趋势衰减,最后用连续 sigmoid gate 与 GRPO 联合训练。
  • 2026-07-22 · 一作:Xubo Liu · TCRtcr):只奖励最终答案会遗漏推理质量,直接叠加过程奖励又可能重复计算 outcome。TCR 为每个样本构造 thinking checklist,并从过程得分中减去 outcome 的指数滑动基线,把更新集中到“结果奖励尚未解释的思考增益”。

香港中文大学(深圳)/ 深圳市大数据研究院

  • 2023-10-16 · 一作:Ziniu Li · ReMaxremax):ReMax 利用 LLM RLHF 的三项特征:模拟快、token 转移确定、reward 通常只在轨迹末端给出。它删除 PPO 的 value model,以当前策略 greedy decoding 的 reward 作 prompt-dependent baseline,降低 REINFORCE 方差。