跳转至

基础模型:按机构/公司/学校

按论文一作的第一署名单位聚合;单位内按首次公开日期倒序排列。联合工作只归入一作的第一署名单位,不会重复归入全部合作单位。

Ai2

Authors did not disclose affiliation

Beijing University of Posts and Telecommunications

  • 2026-09-03 · Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representationslngram-v2):Lngram v2 把 backbone hidden state 投影成多路二进制地址,以最近 1/2-gram 的离散组合 O(1) 查 memory table;多个 route token 经 GQA 读回主干。硬地址保证表示可解释,反事实邻接地址提供训练梯度,零 Sink 允许模型拒绝无用记忆。

ByteDance

Carnegie Mellon University

DeepSeek

DeepSeek-AI

  • 2025-12-31 · mHC: Manifold-Constrained Hyper-Connectionsmhc):Hyper-Connections 把单一 residual stream 扩为多个流并动态混合,但任意残差矩阵会破坏 identity mapping,深层组合可能放大信号。mHC 将 \(H^{res}\) 投影到 Birkhoff polytope(非负、行列和均为 1),同时约束 \(H^{pre}\)\(H^{post}\) 非负;这样既保留跨流信息交换,又让每层残差映射非扩张。

EIT-NLP

FITec Labs

Fudan University

  • 2026-07-27 · DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Datadata-orchestra):固定 corpus-level 清洗会过度处理本来干净的文本,也会对不同噪声使用同一操作。DataOrchestra 为每个 1024-token chunk 生成计划:先选 Drop、Untouch 或 Clean;Clean 时再按 NP(Noise Pruning)→ SR(Surface Rectification)→ PA(Pedagogical Augmentation)选择阶段,并为 rewrite 生成该 chunk 专属 instruction。

Gensyn

  • 2026-09-15 · OPEN-1B: A Fully Auditable Training Runopen-1b-audit):固定 kernel reduction、数据批次与集体通信顺序,并用逐步状态哈希支持异构硬件单步重放审计。

Google Brain

Google DeepMind

Google Research

Hanyang University

Heinrich Heine University Düsseldorf

Huawei

  • 2026-07-20 · Convolution for Large Language Modelsconv-llm):自注意力擅长全局依赖,却没有显式的短程归纳偏置。论文固定 Qwen3 主干,系统比较 17 个卷积插入位置,最终选择在 Q/K/V 线性投影后、attention 聚合前加入 kernel=3 的逐通道一维卷积;残差旁路保留原投影,不加归一化或激活,额外参数低于 0.01%

Huawei ACS Lab

  • 2026-07-23 · Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMsadadsf):固定比例的 Mixture-of-Depths 会给每一层相同 token budget,但不同层对表示的改写强度并不相同。AdaDSF 先在 dense teacher 上测量各层输入/输出 cosine similarity,再把更多计算分给变化更大的层;每层 MLP router 只把 Top-K token 送入原 Transformer block,其他 token 走 residual bypass。

Huawei Technologies Canada

Huazhong University of Science and Technology

Hugging Face

  • 2025-04-07 · SmolVLM: Redefining small and efficient multimodal modelssmolvlm):SmolVLM 重新分配小模型视觉/语言侧算力,以 pixel shuffle 将相邻空间 token 搬到 channel 维,再用 MLP 映射到 LM 空间;同时研究长上下文、图像切片、学习位置 token 和数据配比, 使 256M/500M/2.2B 模型在低显存下保持图像与视频能力。

Independent researchers

Indian Institute of Technology Madras

Indian Institute of Technology Roorkee

Institute of Computing Technology, Chinese Academy of Sciences

KAIST

MIT

McGill University

  • 2026-07-20 · PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoningppl-factory):固定的“选最难/最容易”规则会随任务和数据预算失效。PPL-Factory 先用冻结基础模型计算任务相关 NLL:语言建模按 packed block,推理 SFT 只看 reasoning/answer response;再按预算切换策略,高预算偏 easy,较低预算选 middle,极低预算从 middle pool 随机抽样以保覆盖。

Meta

Meta FAIR

MiniMax

  • 2026-06-11 · MiniMax Sparse Attentionminimax-sparse-attention):长上下文 dense attention 的二次复杂度成为主要瓶颈。MSA 为每个 GQA 组增加轻量 index branch,先选择少数历史 block,主分支再对命中 token 做精确 attention;训练和推理使用同一路径。

Moonshot AI

  • 2025-02-24 · Muon is Scalable for LLM Trainingmuon):AdamW 把矩阵参数当作独立标量更新,Muon 则把隐藏层梯度视为矩阵,通过 momentum 与 Newton–Schulz 近似极分解得到正交化更新方向。论文为大规模训练补上 weight decay 和按参数形状缩放;非隐藏矩阵参数继续使用 AdamW。
  • 2025-02-18 · MoBA: Mixture of Block Attention for Long-Context LLMsmoba):把序列切成 block,以可微 router 为每个 query 选择少量相关块,同时保留当前因果块。

NVIDIA

  • 2026-07-23 · Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Contextwindowed-mtp):内置 MTP/NEXTN draft 通常每提出一个 token 都读取完整 KV cache;在百万 token 上,即使 target 已使用 GDN/Mamba 等便宜 verifier,draft 的全量 KV read 仍会成为瓶颈。Windowed-MTP 只改变 draft:保留最前面的 attention sink 与最近 \(W\) 个 token,同时 target 继续读取完整上下文并验证所有候选。
  • 2024-11-20 · Hymba: A Hybrid-head Architecture for Small Language Modelshymba):同一层并行执行 attention 与状态空间分支,再用输入相关 gate 融合局部精确检索和线性长程状态。

Nanyang Technological University

New York University

Oklahoma State University

OpenAI

Peking University

Pennsylvania State University

  • 2026-07-23 · Parameter-free Adaptive Sparse Attention via Compression-Based Content Selectiongzip-sparse-attention):固定 BigBird/Longformer mask 不理解内容,learned mask 又需要额外参数、梯度估计或专用 kernel。论文把字节序列切成固定 block,用 gzip 压缩率作为无需训练的信息密度信号:高于样本均值的 literal blocks 互相建立长程连接,所有 block 保留局部窗口,不设置固定 global token。

Princeton University

Qwen

Salesforce AI Research

Salesforce Research

Shanghai Jiao Tong University

Shanghai University of Finance and Economics

  • 2026-09-04 · KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPUkvmem):长寿命 Agent 的历史会同时超过显存和模型原生窗口;摘要压缩会丢证据,文本检索又要重复 prefill。KVMEM 把已计算 KV 分页放到 GPU、主存和 NVMe,用模型自身的注意力空间索引挑选相关 block,再物化为不超过原生窗口的执行视图。

Stanford University

Sun Yat-sen University

  • 2026-08-27 · PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inferencepace-vlm):VLM 的视觉 token 一方面在 prefill 阶段带来大量计算,另一方面在抽取阶段仍会保留大量与问题无关的内容。PACE 将两个阶段拆开处理:APC 用浅层 ViT preview 同时估计全局语义密度和局部细节,按图像难度自适应缩放;DDAE 再融合 LLM 与视觉编码器的注意力,以置信度决定两种证据各占多少权重,而不是固定只信一种注意力图。

Tencent HY LLM Frontier

The Hong Kong University of Science and Technology (Guangzhou)

  • 2026-08-27 · TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancytwinkv):现有 KV eviction 常按 token 重要性选择缓存,但可能同时保留多个几乎重复的 key,并删掉没有替代者的 orphan。TwinKV 不替代 StreamingLLM、H2O 等基础策略,而是一个可组合 repair pass:在完全不增加 KV budget 的前提下,找出“被删且没有相似保留项”的 orphan,与“已保留但有高度相似 twin”的 donor 成对交换。

Together AI

Tsinghua University

University of California, San Diego

University of Cambridge

University of Illinois Urbana-Champaign

  • 2026-07-30 · ReToken: One Token to Improve Vision–Language Models for Visual Retrievalretoken):常规 VLM 检索需要先用外部 retriever 找图,再把入选图重新编码,无法直接复用预填充的视觉 KV cache。ReToken 在输入中增加一个可学习 token,让它在最后一层 value projection 空间与每张图的平均 value 向量打分;只训练该 token 和一张投影矩阵,以 class-balanced BCE 监督相关/无关图,VLM 默认冻结。

University of Maryland

University of Texas at Austin

University of Washington

University of Wisconsin-Madison

  • 2023-04-17 · Visual Instruction Tuningllava):冻结视觉 encoder,用可训练 projector 把视觉特征映射到 LLM token 空间,再在 GPT-4 生成的多模态指令数据上做端到端 instruction tuning。

University of Wisconsin–Madison

WeChat Vision, Tencent

  • 2026-08-25 · WeMM-Embedding: WeChat Multi-Modal Embedding Technical Reportwemm-embedding):不同检索任务通常维护独立的文本、图像、视频或文档 encoder。WeMM 把任意交错多模态输入映射到同一空间:第一阶段用数亿 pair 做大规模 alignment;第二阶段加入精选 relevance、细粒度监督和跨尺度知识迁移,并用 Matryoshka 表征支持按成本选择输出维度。

Wuhan University

Zhejiang University

Zhuiyi Technology

论文未列机构

  • 2026-08-03 · Role-Decoupled Attention Residualsrd-attnres):Block AttnRes 让注意力层从全部历史 residual sources 动态读取,但 Q、K、V 共用一条深度路由。论文指出 QK 负责匹配、V 负责承载内容,两者偏好的深度未必相同;RD-AttnRes 在不改变 residual sources 和 attention 主体的情况下,只为 V 增加一个 model-width 路由向量。
  • 2026-07-28 · Penelope: Localized Latent Recurrence for Efficient Structured Reasoningpenelope):只在一个 decoder 边界执行共享权重的 latent recurrence,用门控状态反复精炼表示,避免整条 decoder 重跑。