Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion¶
复现级别:L1 核心机制诊断。 本地执行 alignment/diversity 集合目标;没有训练 53.9M 参数扩散检索器。
论文信息¶
| 字段 | 内容 |
|---|---|
| 论文链接 | Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion |
| 公司/机构 | University of Illinois Urbana-Champaign / Google Research(按第一作者署名单位) |
| 首次公开日期 | 2026-03-06(arXiv v1) |
| 原文开源代码 | 否:截至 2026-09-16 未找到原作者公开仓库 |
| Adapter / 方法 | r4t |
| 本地复现代码 | src/auto_research/foundation_latest_20260916.py |
原始论文总结¶
背景与主要改动¶
先以集合级复合奖励产生对齐目标,再把目标编译到单次扩散式 fan-out 检索器。
本地 reference kernel 保留决定性门控、权重或状态转换,并输出可审计中间量,以便与相邻方法在统一预算下比较。
flowchart LR
I[公开输入与状态] --> M[r4t 核心机制]
M --> A[可审计中间量]
A --> O[输出或策略更新]
原论文关键图¶
原论文 Figure 1(关键图):展示原论文方法的总体设计和关键组成。图片来自原论文,版权归原作者所有;点击图片可查看来源。
核心公式¶
实现保留论文的决定性状态转换,并输出权重、门控、深度、阶段或缓存统计;固定预算和三种子只用于检查机制不变量,不等同于论文规模训练。
论文离线与线上效果¶
论文报告的能力、速度或成本结论只作为原文事实记录;本地指标不与其直接横比,也不外推线上收益。
本地复现¶
三种子结果见 metrics/mechanism-seeds42-44.json。统一 receipt 标记 diagnostic_only=true,不会被公开看板当成完整能力提升。
复现边界¶
本地执行 alignment/diversity 集合目标;没有训练 53.9M 参数扩散检索器。
