多模态大模型研究¶
本研究域承载视觉—语言基础模型、训练数据、跨模态连接器和视觉后训练。第一阶段提供
一个可在 Mac、Linux CPU 和 GPU 从头训练的 micro-vlm,后续论文算子只有经过真实
图像实验和测试后才会进入 evolve。
当前能力¶
visual-shapes:完全离线生成颜色、形状和方位问答图像;fashion-mnist-qa:约 30MB 的公开服饰图像,适合 Mac/CPU 快速复跑;cifar10-qa:官方 CIFAR-10 自然图像,MD5 校验后缓存,固定分层 validation/test;micro_vlm_linear、micro_vlm_mlp、micro_vlm_query、micro_vlm_qformer、micro_vlm_gated、micro_vlm_pixelshuffle六种 connector;- CLIP、BLIP-2、LLaVA、SigLIP 2 与 SmolVLM 独立 adapter,以及可组合的
objective:siglip2训练目标; - 强制报告原图、打乱图和空白图准确率,检查模型是否真的使用视觉信息;
multimodal-predict真实加载公开 VLM checkpoint,支持 ScienceQA/POPE、不可变 revision、离线镜像与逐条续跑;multimodal-retrieval-predict真实加载 CLIP/SigLIP 类 checkpoint,为 COCO/Flickr 生成紧凑、可审计的双向 retrieval rank;vlm-checkpoint在冻结的真实 checkpoint 上,以 ScienceQA validation 多轮搜索 prompt、hint、图像预处理和解码预算,最终隔离 test;- ScienceQA、POPE、COCO/Flickr retrieval 的框架无关 L2 scorer,支持固定子集、三 seed、95% CI 和可审计预测文件;
multimodal-lmms-eval可调用锁定 revision 的上游 L3 任务,并把结果、任务版本、样本数和效率指标规范化为 path-free schema-v2 证据;multimodal-video-eval用固定 SmolVLM2 revision 在 Video-MME-v2 运行三 seed、逐题续跑与置信区间;multimodal-audio-eval用固定 CLAP revision 在 ESC-50/ESC-10 运行真实 WAV 零样本评测,并校验文本 embedding 缓存;embodied-post-train审计公开 LeRobot episode,并通过官方lerobot-train执行 SmolVLA flow-matching 后训练;- 与推荐、micro-LLM、后训练和 Agent 共用多轮控制器、隔离 test 和研究看板。
python -m pip install -e '.[multimodal]'
auto-research evolve \
--model micro-vlm \
--dataset visual-shapes \
--direction "比较 LLaVA、BLIP-2、SigLIP 2 和 SmolVLM 算子,要求模型真实使用视觉输入" \
--offline --generations 2 --population 3 --steps 60 \
--llm-dimensions 96 --llm-batch-size 16 --seeds 42
固定配方的 CIFAR-10 三 seed 正式入口,以及 ScienceQA/POPE/检索预测格式见 统一评测协议。预测器与 scorer 分离:前者加载真实 checkpoint 并落盘, 后者只读取标注和预测;随机基线仍只用于检查评测管线。
轻量公开图像入口(首次约下载 30MB,之后可加 --offline):
auto-research evolve \
--model micro-vlm --dataset fashion-mnist-qa \
--direction "在真实服饰图像上比较 connector,并检查视觉依赖" \
--generations 2 --population 3 --steps 100 \
--maximum-examples 2000 --seeds 42
彩色自然图像入口(首次约下载 163MB):
auto-research evolve \
--model micro-vlm --dataset cifar10-qa \
--direction "在真实图像上比较 connector,并检查视觉依赖" \
--generations 2 --population 3 --steps 100 \
--maximum-examples 2000 --seeds 42
浏览入口¶
已验证的 L1 结果¶
Fashion-MNIST 固定 2,000 train / 1,000 validation / 1,000 test,seed 42、每个候选
150 steps。query connector 的 validation accuracy 为 0.5010,相对线性 connector
的 0.4240 提升 7.7 points;隔离 test 为 0.4850,打乱图/空白图只有
0.1070/0.1000。结构化结果见
metrics/fashion-mnist-qa-seed42.json。
CIFAR-10 固定 5,000 train / 1,000 validation / 1,000 test,query connector、300 steps、
seeds 42/43/44。validation accuracy 为 20.00% ± 1.28 points;隔离 test 为
19.43% ± 0.25 points,打乱图/空白图为 10.43%/10.00%,说明模型确实依赖视觉输入,
但这个小模型结果仍只是 L1 object-QA,不代表开放式 VQA。完整单 seed、均值、sample std
与 95% CI 见
metrics/cifar10-qa-seeds42-44.json。
论文级公开图像结果¶
所有结果均使用 Fashion-MNIST 真实像素、2,000 条训练样本和 seed 42;论文原始结论与本地 缩小实验分开记录。
| 论文机制 | 公平基线 | 本地 test | 视觉依赖 / 效率诊断 |
|---|---|---|---|
| CLIP 对称式图文对比 | 均匀检索 10.0% | 72.0% | 打乱图 10.3% |
| LLaVA 两层 MLP projector | 线性 connector 46.8% | 43.4% | -3.4 points;保留负结果 |
| BLIP-2 四 query Q-Former | 线性 connector 46.8% | 41.5% | -5.3 points;token 16→4 |
| SigLIP 2 sigmoid + masked view | 均匀检索 10.0% | 66.9% | 打乱图 10.8% |
| SmolVLM pixel shuffle | 线性 connector 46.8% | 65.8% | +19.0 points;token 16→4 |
| GAS MoT + NEP | understanding-only 61.1% | 63.5% | +2.4 points;部署参数开销 0% |
详细公式、原文结果、论文关键图、命令和边界见方法索引。
真实公开 checkpoint 结果¶
MR6 在官方 ScienceQA 完整 test split 4,241 条上运行 SmolVLM2-256M-Video-Instruct
(同一不可变 revision),确定性 zero-shot accuracy 为 54.92%;image/text 分项为
62.82% / 47.75%,覆盖率 100%,解析率 99.95%。这是完整 split 的单次
checkpoint 结果,不是多 seed 模型比较;聚合指标见
metrics/scienceqa-smolvlm2-256m-full.json。
同一 checkpoint 在官方 POPE COCO adversarial 完整 3,000 条上的 accuracy 为 75.17%,
precision/recall/F1 为 95.76% / 52.67% / 67.96%,解析率 100%。yes ratio
为 27.50%,说明该小模型偏向回答 no,因此结果用于可审计能力画像,不应只看 accuracy。
结构化结果见
metrics/pope-adversarial-smolvlm2-256m-full.json。
MR8 又在统一 16-token 生成预算下完成 SmolVLM2 256M/500M/2.2B 的完整 ScienceQA 与 POPE 对照,并在 COCO Karpathy test 5K 比较 CLIP ViT-B/32 与 SigLIP2 Base P16-224。 ScienceQA accuracy 为 54.92% / 65.03% / 79.60%;POPE F1 为 67.90% / 81.54% / 82.85%;SigLIP2 与 CLIP 的 COCO mean recall 为 74.29% / 60.33%。完整公平协议、效率指标、异常诊断和边界见 多模态统一评测。
MR9 进一步用上游 lmms-eval 0.7.2 的完整 scienceqa_img 2,017 条标准任务验证
SmolVLM2-2.2B,exact match 为 87.21% ± 0.74 points。这与本仓库 4,241 条图文混合
ScienceQA scorer 的样本集合不同,不能直接比较;锁定的上游 revision、兼容补丁、效率指标
和复现命令见多模态统一评测。
此前在官方 ScienceQA test split 固定前 500 条上,SmolVLM2-256M-Video-Instruct
(commit 067788b187b95ebe7b2e040b3e4299e342e5b8fd)确定性 zero-shot accuracy 为
56.80%;image/text 分项为 62.87% / 51.33%,输出解析率 99.80%。
模型先在 Apple Silicon Mac CPU 完成真实加载/单图冒烟,再在单卡 NVIDIA GPU 上评测。
这是固定子集的单次 checkpoint 结果,保留用于核对 MR4 与 MR6 的协议连续性。
结构化证据见
metrics/scienceqa-smolvlm2-256m-500.json。
边界¶
visual-shapes 是 L0 系统 benchmark;Fashion-MNIST/CIFAR-10 是 L1 公开图像缩小实验。它们都
不是开放式 VQA 能力证明。ScienceQA/POPE 的真实 checkpoint 生成与公开 benchmark scorer
已接入 L2;COCO/Flickr 已接入真实 checkpoint 预测器和 scorer。MR7 新增可恢复的跨 checkpoint 同预算矩阵与可选 lmms-eval 后端;MR8 进一步提供锁定 revision 的完整
ScienceQA、POPE 与 COCO Karpathy test 5K 公平矩阵配置,并在执行前强制校验比较预算。
仓库不提交 checkpoint 或公开数据,完整任务套件仍属于 L3。论文 adapter 的 L1 缩小实验
不会被写成通用 VLM 能力证明。