基础模型统一评测协议¶
基础模型实验同时比较质量、计算成本和复现保真度。参数更少、mask 更稀疏或 理论 FLOPs 更低,不自动等于真实训练和 serving 更快。
评测层级¶
| 层级 | 环境 | 可声明结论 |
|---|---|---|
| L0 | Tiny Shakespeare / 极小配置 | 算子、梯度与报告链路可运行 |
| L1 | WikiText-2 / 公开小型数据 | 同预算质量和机制差异 |
| L2 | 标准公开 benchmark、多 seed | 可比较的缩小复现结果 |
| L3 | GPU kernel、论文模型和完整数据 | 论文规模质量与真实性能复现 |
必报指标¶
- 架构与预训练:参数量、训练 token/steps、validation/test perplexity、seed;
- 长上下文:训练长度、测试长度、任务质量、attention/KV 实际占用;
- 多模态:数据来源、encoder/tokenizer、任务指标及缺失模态处理;
- 量化和压缩:精度、模型大小、峰值内存、真实延迟和硬件;
- serving:TTFT、TPOT、吞吐、并发、显存、输入/输出长度与软件版本。
公平原则¶
主结果必须保持数据切分、token/step 预算、参数规模和评测代码可比较。结构增加参数 时需同时提供等参数或等计算量对照;动态稀疏方法若没有融合 kernel,只能报告选择 机制与理论/张量稀疏度,不能写成实际加速。所有负结果保留。