跳转至

多模态大模型:按机构/公司/学校

按论文一作第一署名单位聚合;单位内按首次公开日期倒序排列。

ByteDance

Google DeepMind

Hugging Face

  • 2025-04-07 · SmolVLM: Redefining small and efficient multimodal modelssmolvlm):SmolVLM 重新分配小模型视觉/语言侧算力,以 pixel shuffle 将相邻空间 token 搬到 channel 维,再用 MLP 映射到 LM 空间;同时研究长上下文、图像切片、学习位置 token 和数据配比, 使 256M/500M/2.2B 模型在低显存下保持图像与视频能力。

OpenAI

Salesforce Research

Sichuan University

University of Science and Technology of China

University of Wisconsin-Madison

  • 2023-04-17 · Visual Instruction Tuningllava):冻结视觉 encoder,用可训练 projector 把视觉特征映射到 LLM token 空间,再在 GPT-4 生成的多模态指令数据上做端到端 instruction tuning。