跳转至

基础模型:按主题

采用“研究方向 → 方法簇 → 论文”的两级结构,覆盖架构、预训练、多模态和推理效率;训练后算法进入独立的 LLM 后训练研究域。

网络架构

条件记忆与知识注入

MoE、状态空间与残差路径

动态层路由与残差路径

递归与 latent computation

注意力与长上下文

稀疏、门控与动态注意力

KV cache 与上下文压缩

  • TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancytwinkv):现有 KV eviction 常按 token 重要性选择缓存,但可能同时保留多个几乎重复的 key,并删掉没有替代者的 orphan。TwinKV 不替代 StreamingLLM、H2O 等基础策略,而是一个可组合 repair pass:在完全不增加 KV budget 的前提下,找出“被删且没有相似保留项”的 orphan,与“已保留但有高度相似 twin”的 donor 成对交换。

位置编码与 KV 压缩

预训练与数据

训练框架与可组合实验

latent 与多步预测

数据清洗、编排与选择

优化器与训练效率

  • Muon is Scalable for LLM Trainingmuon):AdamW 把矩阵参数当作独立标量更新,Muon 则把隐藏层梯度视为矩阵,通过 momentum 与 Newton–Schulz 近似极分解得到正交化更新方向。论文为大规模训练补上 weight decay 和按参数形状缩放;非隐藏矩阵参数继续使用 AdamW。

多模态基础模型

视觉 token 与跨模态检索

  • PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inferencepace-vlm):VLM 的视觉 token 一方面在 prefill 阶段带来大量计算,另一方面在抽取阶段仍会保留大量与问题无关的内容。PACE 将两个阶段拆开处理:APC 用浅层 ViT preview 同时估计全局语义密度和局部细节,按图像难度自适应缩放;DDAE 再融合 LLM 与视觉编码器的注意力,以置信度决定两种证据各占多少权重,而不是固定只信一种注意力图。
  • MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representationsmllmclip):MLLM 的丰富视觉语义难以直接迁移到轻量 CLIP。论文从 teacher 各层按 attention 自适应选 token,以 CKA 对齐 student 图像/文本特征,保留部署时的双塔效率。
  • ReToken: One Token to Improve Vision–Language Models for Visual Retrievalretoken):常规 VLM 检索需要先用外部 retriever 找图,再把入选图重新编码,无法直接复用预填充的视觉 KV cache。ReToken 在输入中增加一个可学习 token,让它在最后一层 value projection 空间与每张图的平均 value 向量打分;只训练该 token 和一张投影矩阵,以 class-balanced BCE 监督相关/无关图,VLM 默认冻结。
  • Visual Instruction Tuningllava):冻结视觉 encoder,用可训练 projector 把视觉特征映射到 LLM token 空间,再在 GPT-4 生成的多模态指令数据上做端到端 instruction tuning。
  • Learning Transferable Visual Models From Natural Language Supervisionclip):用独立图像/文本 encoder 将配对样本映射到同一单位球面,通过双向 batch contrastive objective 学习可迁移零样本表示。

可验证视觉推理与评测

对比预训练与自蒸馏

生成辅助监督与理解增强

高效视觉 token 压缩

  • SmolVLM: Redefining small and efficient multimodal modelssmolvlm):SmolVLM 重新分配小模型视觉/语言侧算力,以 pixel shuffle 将相邻空间 token 搬到 channel 维,再用 MLP 映射到 LM 空间;同时研究长上下文、图像切片、学习位置 token 和数据配比, 使 256M/500M/2.2B 模型在低显存下保持图像与视频能力。

跨模态连接器与冻结骨干

推理与系统效率

推测解码与 KV cache

量化

动态计算与模型压缩