跳转至

基础模型:按年份

按首次公开年份浏览;同年论文按日期倒序排列。

2026

2025

  • 2025-12 · mHC: Manifold-Constrained Hyper-Connectionsmhc):Hyper-Connections 把单一 residual stream 扩为多个流并动态混合,但任意残差矩阵会破坏 identity mapping,深层组合可能放大信号。mHC 将 \(H^{res}\) 投影到 Birkhoff polytope(非负、行列和均为 1),同时约束 \(H^{pre}\)\(H^{post}\) 非负;这样既保留跨流信息交换,又让每层残差映射非扩张。
  • 2025-05 · Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Freegated-attention):softmax attention 的 value aggregation 到 output projection 之间基本是线性映射。论文系统比较 30 种门控变体,发现最简单稳定的方案是在每个 attention head 的 SDPA 输出后施加 query-dependent sigmoid gate:既增加非线性,也能稀疏抑制无用 head 输出。
  • 2025-04 · SmolVLM: Redefining small and efficient multimodal modelssmolvlm):SmolVLM 重新分配小模型视觉/语言侧算力,以 pixel shuffle 将相邻空间 token 搬到 channel 维,再用 MLP 映射到 LM 空间;同时研究长上下文、图像切片、学习位置 token 和数据配比, 使 256M/500M/2.2B 模型在低显存下保持图像与视频能力。
  • 2025-02 · Muon is Scalable for LLM Trainingmuon):AdamW 把矩阵参数当作独立标量更新,Muon 则把隐藏层梯度视为矩阵,通过 momentum 与 Newton–Schulz 近似极分解得到正交化更新方向。论文为大规模训练补上 weight decay 和按参数形状缩放;非隐藏矩阵参数继续使用 AdamW。
  • 2025-02 · SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Featuressiglip2):SigLIP 2 在 SigLIP 的 pairwise sigmoid loss 上组合 captioning pretraining、global-local self-distillation、masked prediction、在线数据筛选和 NaFlex 动态分辨率,改善语义、定位、 dense feature 与多语言公平性。
  • 2025-02 · MoBA: Mixture of Block Attention for Long-Context LLMsmoba):把序列切成 block,以可微 router 为每个 query 选择少量相关块,同时保留当前因果块。
  • 2025-02 · Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attentionnative-sparse-attention):全注意力的计算和 KV 读取随上下文长度平方增长。NSA 不是在训练后裁剪 attention,而是从预训练开始并行学习三条路径:压缩历史块负责全局轮廓,query 相关的 block selection 恢复重要细节,滑窗保留近期精确信息;三路输出再由可学习门控融合。

2024

2023

2022

2021