多模态大模型方法索引¶
本页汇总已经具有独立 adapter、真实公开图像实验和固定指标的论文实现。 底座 connector 与论文 genome 的对应关系也在同一处维护。
已实现论文¶
可进入 evolve 的论文算子¶
| Genome | 来源 | 主要变化 |
|---|---|---|
micro_vlm_linear |
CLIP / LLaVA 基础投影 | 保留全部 patch token 的线性连接器 |
micro_vlm_mlp |
LLaVA | 两层非线性 projector |
micro_vlm_qformer |
BLIP-2 | 可学习 query cross-attention,16→4 token |
micro_vlm_pixelshuffle |
SmolVLM | 2×2 space-to-depth,16→4 token |
objective:siglip2 |
SigLIP 2 | sigmoid 图文目标与 masked-view consistency |