跳转至

多模态大模型研究

本研究域承载视觉—语言基础模型、训练数据、跨模态连接器和视觉后训练。第一阶段提供 一个可在 Mac、Linux CPU 和 GPU 从头训练的 micro-vlm,后续论文算子只有经过真实 图像实验和测试后才会进入 evolve。

当前能力

  • visual-shapes:完全离线生成颜色、形状和方位问答图像;
  • fashion-mnist-qa:约 30MB 的公开服饰图像,适合 Mac/CPU 快速复跑;
  • cifar10-qa:官方 CIFAR-10 自然图像,MD5 校验后缓存,固定分层 validation/test;
  • micro_vlm_linearmicro_vlm_mlpmicro_vlm_querymicro_vlm_qformermicro_vlm_gatedmicro_vlm_pixelshuffle 六种 connector;
  • CLIP、BLIP-2、LLaVA、SigLIP 2 与 SmolVLM 独立 adapter,以及可组合的 objective:siglip2 训练目标;
  • 强制报告原图、打乱图和空白图准确率,检查模型是否真的使用视觉信息;
  • multimodal-predict 真实加载公开 VLM checkpoint,支持 ScienceQA/POPE、不可变 revision、离线镜像与逐条续跑;
  • multimodal-retrieval-predict 真实加载 CLIP/SigLIP 类 checkpoint,为 COCO/Flickr 生成紧凑、可审计的双向 retrieval rank;
  • vlm-checkpoint 在冻结的真实 checkpoint 上,以 ScienceQA validation 多轮搜索 prompt、hint、图像预处理和解码预算,最终隔离 test;
  • ScienceQA、POPE、COCO/Flickr retrieval 的框架无关 L2 scorer,支持固定子集、三 seed、95% CI 和可审计预测文件;
  • multimodal-lmms-eval 可调用锁定 revision 的上游 L3 任务,并把结果、任务版本、样本数和效率指标规范化为 path-free schema-v2 证据;
  • multimodal-video-eval 用固定 SmolVLM2 revision 在 Video-MME-v2 运行三 seed、逐题续跑与置信区间;
  • multimodal-audio-eval 用固定 CLAP revision 在 ESC-50/ESC-10 运行真实 WAV 零样本评测,并校验文本 embedding 缓存;
  • embodied-post-train 审计公开 LeRobot episode,并通过官方 lerobot-train 执行 SmolVLA flow-matching 后训练;
  • 与推荐、micro-LLM、后训练和 Agent 共用多轮控制器、隔离 test 和研究看板。
python -m pip install -e '.[multimodal]'

auto-research evolve \
  --model micro-vlm \
  --dataset visual-shapes \
  --direction "比较 LLaVA、BLIP-2、SigLIP 2 和 SmolVLM 算子,要求模型真实使用视觉输入" \
  --offline --generations 2 --population 3 --steps 60 \
  --llm-dimensions 96 --llm-batch-size 16 --seeds 42

固定配方的 CIFAR-10 三 seed 正式入口,以及 ScienceQA/POPE/检索预测格式见 统一评测协议。预测器与 scorer 分离:前者加载真实 checkpoint 并落盘, 后者只读取标注和预测;随机基线仍只用于检查评测管线。

轻量公开图像入口(首次约下载 30MB,之后可加 --offline):

auto-research evolve \
  --model micro-vlm --dataset fashion-mnist-qa \
  --direction "在真实服饰图像上比较 connector,并检查视觉依赖" \
  --generations 2 --population 3 --steps 100 \
  --maximum-examples 2000 --seeds 42

彩色自然图像入口(首次约下载 163MB):

auto-research evolve \
  --model micro-vlm --dataset cifar10-qa \
  --direction "在真实图像上比较 connector,并检查视觉依赖" \
  --generations 2 --population 3 --steps 100 \
  --maximum-examples 2000 --seeds 42

浏览入口

已验证的 L1 结果

Fashion-MNIST 固定 2,000 train / 1,000 validation / 1,000 test,seed 42、每个候选 150 steps。query connector 的 validation accuracy 为 0.5010,相对线性 connector 的 0.4240 提升 7.7 points;隔离 test 为 0.4850,打乱图/空白图只有 0.1070/0.1000。结构化结果见 metrics/fashion-mnist-qa-seed42.json

CIFAR-10 固定 5,000 train / 1,000 validation / 1,000 test,query connector、300 steps、 seeds 42/43/44。validation accuracy 为 20.00% ± 1.28 points;隔离 test 为 19.43% ± 0.25 points,打乱图/空白图为 10.43%/10.00%,说明模型确实依赖视觉输入, 但这个小模型结果仍只是 L1 object-QA,不代表开放式 VQA。完整单 seed、均值、sample std 与 95% CI 见 metrics/cifar10-qa-seeds42-44.json

论文级公开图像结果

所有结果均使用 Fashion-MNIST 真实像素、2,000 条训练样本和 seed 42;论文原始结论与本地 缩小实验分开记录。

论文机制 公平基线 本地 test 视觉依赖 / 效率诊断
CLIP 对称式图文对比 均匀检索 10.0% 72.0% 打乱图 10.3%
LLaVA 两层 MLP projector 线性 connector 46.8% 43.4% -3.4 points;保留负结果
BLIP-2 四 query Q-Former 线性 connector 46.8% 41.5% -5.3 points;token 16→4
SigLIP 2 sigmoid + masked view 均匀检索 10.0% 66.9% 打乱图 10.8%
SmolVLM pixel shuffle 线性 connector 46.8% 65.8% +19.0 points;token 16→4
GAS MoT + NEP understanding-only 61.1% 63.5% +2.4 points;部署参数开销 0%

详细公式、原文结果、论文关键图、命令和边界见方法索引

真实公开 checkpoint 结果

MR6 在官方 ScienceQA 完整 test split 4,241 条上运行 SmolVLM2-256M-Video-Instruct (同一不可变 revision),确定性 zero-shot accuracy 为 54.92%;image/text 分项为 62.82% / 47.75%,覆盖率 100%,解析率 99.95%。这是完整 split 的单次 checkpoint 结果,不是多 seed 模型比较;聚合指标见 metrics/scienceqa-smolvlm2-256m-full.json

同一 checkpoint 在官方 POPE COCO adversarial 完整 3,000 条上的 accuracy 为 75.17%, precision/recall/F1 为 95.76% / 52.67% / 67.96%,解析率 100%。yes ratio 为 27.50%,说明该小模型偏向回答 no,因此结果用于可审计能力画像,不应只看 accuracy。 结构化结果见 metrics/pope-adversarial-smolvlm2-256m-full.json

MR8 又在统一 16-token 生成预算下完成 SmolVLM2 256M/500M/2.2B 的完整 ScienceQA 与 POPE 对照,并在 COCO Karpathy test 5K 比较 CLIP ViT-B/32 与 SigLIP2 Base P16-224。 ScienceQA accuracy 为 54.92% / 65.03% / 79.60%;POPE F1 为 67.90% / 81.54% / 82.85%;SigLIP2 与 CLIP 的 COCO mean recall 为 74.29% / 60.33%。完整公平协议、效率指标、异常诊断和边界见 多模态统一评测

MR9 进一步用上游 lmms-eval 0.7.2 的完整 scienceqa_img 2,017 条标准任务验证 SmolVLM2-2.2B,exact match 为 87.21% ± 0.74 points。这与本仓库 4,241 条图文混合 ScienceQA scorer 的样本集合不同,不能直接比较;锁定的上游 revision、兼容补丁、效率指标 和复现命令见多模态统一评测

此前在官方 ScienceQA test split 固定前 500 条上,SmolVLM2-256M-Video-Instruct (commit 067788b187b95ebe7b2e040b3e4299e342e5b8fd)确定性 zero-shot accuracy 为 56.80%;image/text 分项为 62.87% / 51.33%,输出解析率 99.80%。 模型先在 Apple Silicon Mac CPU 完成真实加载/单图冒烟,再在单卡 NVIDIA GPU 上评测。 这是固定子集的单次 checkpoint 结果,保留用于核对 MR4 与 MR6 的协议连续性。 结构化证据见 metrics/scienceqa-smolvlm2-256m-500.json

边界

visual-shapes 是 L0 系统 benchmark;Fashion-MNIST/CIFAR-10 是 L1 公开图像缩小实验。它们都 不是开放式 VQA 能力证明。ScienceQA/POPE 的真实 checkpoint 生成与公开 benchmark scorer 已接入 L2;COCO/Flickr 已接入真实 checkpoint 预测器和 scorer。MR7 新增可恢复的跨 checkpoint 同预算矩阵与可选 lmms-eval 后端;MR8 进一步提供锁定 revision 的完整 ScienceQA、POPE 与 COCO Karpathy test 5K 公平矩阵配置,并在执行前强制校验比较预算。 仓库不提交 checkpoint 或公开数据,完整任务套件仍属于 L3。论文 adapter 的 L1 缩小实验 不会被写成通用 VLM 能力证明。