跳转至

多模态大模型:按年份

按 arXiv v1 首次公开年份浏览;同年论文按日期倒序排列。

2026

2025

2023

  • 2023-04 · Visual Instruction Tuningllava):冻结视觉 encoder,用可训练 projector 把视觉特征映射到 LLM token 空间,再在 GPT-4 生成的多模态指令数据上做端到端 instruction tuning。
  • 2023-01 · BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Modelsblip2):BLIP-2 冻结已有视觉 encoder 和 LLM,只训练轻量 Q-Former。固定数量的可学习 query 通过 cross-attention 从视觉 token 提取与语言最相关的信息;第一阶段做图文表征学习,第二阶段将 query 输出投影成冻结 LLM 的 soft visual prompt。

2021