跳转至

基础模型统一评测协议

基础模型实验同时比较质量、计算成本和复现保真度。参数更少、mask 更稀疏或 理论 FLOPs 更低,不自动等于真实训练和 serving 更快。

评测层级

层级 环境 可声明结论
L0 Tiny Shakespeare / 极小配置 算子、梯度与报告链路可运行
L1 WikiText-2 / 公开小型数据 同预算质量和机制差异
L2 标准公开 benchmark、多 seed 可比较的缩小复现结果
L3 GPU kernel、论文模型和完整数据 论文规模质量与真实性能复现

必报指标

  • 架构与预训练:参数量、训练 token/steps、validation/test perplexity、seed;
  • 长上下文:训练长度、测试长度、任务质量、attention/KV 实际占用;
  • 多模态:数据来源、encoder/tokenizer、任务指标及缺失模态处理;
  • 量化和压缩:精度、模型大小、峰值内存、真实延迟和硬件;
  • serving:TTFT、TPOT、吞吐、并发、显存、输入/输出长度与软件版本。

公平原则

主结果必须保持数据切分、token/step 预算、参数规模和评测代码可比较。结构增加参数 时需同时提供等参数或等计算量对照;动态稀疏方法若没有融合 kernel,只能报告选择 机制与理论/张量稀疏度,不能写成实际加速。所有负结果保留。