跳转至

TagLLM:细粒度笔记标签生成

Fidelity: 核心机制复现。本地代码执行论文最有辨识度、可由公开数据验证的机制;私有数据、生产模型与服务栈明确列为边界。

论文信息

项目 内容
论文链接 arXiv 2603.21481
公司/机构 Tongji University(按第一作者所属机构聚合)
首次公开日期 2026-03-23(arXiv v1)
原文开源代码 否:未找到原作者公开代码(核查日期:2026-09-05)
Adapter tagllm
本地复现代码 src/auto_research/reproductions/tagllm/

原始论文总结

背景与主要改动

TagLLM 按笔记类目构建用户兴趣手册,用多模态 CoT 按兴趣维度抽取细粒度标签,再通过两阶段知识蒸馏把大模型标签能力迁移到小模型,兼顾解释性和线上效率。

flowchart LR
  A["公开行为与候选"] --> B["tagllm 核心机制"]
  B --> C["同预算方法输出"]
  A --> D["统一直接基线"]
  C --> E["全目录排序与结构诊断"]
  D --> E

原论文关键图

TagLLM:细粒度笔记标签生成 原论文 Figure 2

原论文 Figure 2(关键图):展示原论文的整体流程、关键阶段及其数据流向。图片来自原论文,版权归原作者所有;点击图片可查看来源。

核心公式

\[ \mathcal L=\mathcal L_{tag}+\lambda\,D_{KL}\!\left(p_{teacher}(y|x,H)\Vert p_{student}(y|x)\right). \]

论文离线与线上效果

  • 线上 A/B:人均观看时长 +0.31%、互动 +0.96%、冷启动 PV CTR +32.37%。
  • 上述数字只复述论文证据,不写入本地公开数据效果结论。

本地复现

本地对照口径:同一 MovieLens 全目录协议下,基线 NDCG@10 为 0.05401,实验组为 0.05147,相对变化 -4.69%。本地代理目标与论文生产任务不同,不能外推线上 lift。

三随机种子的完整结果、均值、标准差与 95% CI 见:

auto-research reproduce --paper tagllm --dataset-dir data --seeds 42,43,44

复现边界

本地使用 MovieLens-1M 的公开子集及可审计代理目标,只验证中心计算机制;不复现原论文的私有日志、生产基础模型、线上分桶和 serving 栈。因此本页不宣称复现原文绝对指标或线上增益。