跳转至

多模态大模型:按主题

按跨模态训练目标、连接器与视觉 token 压缩分组;每篇论文独占一行。

对比预训练与自蒸馏

生成辅助监督与理解增强

视觉 token 与跨模态检索

视频理解与 token 压缩

跨模态连接器与冻结骨干

高效视觉 token 压缩

  • 2025-04-07 · SmolVLM: Redefining small and efficient multimodal modelssmolvlm):SmolVLM 重新分配小模型视觉/语言侧算力,以 pixel shuffle 将相邻空间 token 搬到 channel 维,再用 MLP 映射到 LM 空间;同时研究长上下文、图像切片、学习位置 token 和数据配比, 使 256M/500M/2.2B 模型在低显存下保持图像与视频能力。