{
  "schema_version": 2,
  "seeds_by_adapter": {
    "kvmem": [
      42,
      43,
      44
    ]
  },
  "budget": "paper-specific",
  "papers": {
    "kvmem": {
      "manifest": {
        "adapter_key": "kvmem",
        "arxiv_id": "2609.04852",
        "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
        "paper_url": "https://arxiv.org/abs/2609.04852",
        "track": "llm",
        "organization": "Shanghai University of Finance and Economics",
        "published": "2026-09-04",
        "code_url": "https://github.com/kvmem/kvmem-qw3",
        "topics": [
          "agent-memory",
          "kv-cache",
          "long-context",
          "inference-serving"
        ],
        "local_code_dir": "src/auto_research/reproductions/kvmem",
        "fidelity": "core_mechanism",
        "evaluation_tier": "l2_public_dataset",
        "datasets": [
          "public-domain long-context probe"
        ],
        "baseline": "equal-budget recent-context compaction",
        "metrics": [
          "attention-output cosine",
          "materialized blocks",
          "peak GPU memory"
        ],
        "default_seeds": [
          42
        ],
        "budget": "adapter-defined fixed budget",
        "device_capabilities": [
          "cuda"
        ],
        "requires_gpu_validation": true,
        "gpu_validation_artifact": "docs/gpu-validations/kvmem-a100-20260907.json",
        "online_evidence": [],
        "selection_exception": null,
        "evolve_operators": [
          "memory:query-conditioned-paged-kv"
        ]
      },
      "seed_results": [
        {
          "paper": {
            "arxiv_id": "2609.04852",
            "title": "KVMem",
            "url": "https://arxiv.org/abs/2609.04852",
            "organization": "Shanghai University of Finance and Economics"
          },
          "dataset": {
            "name": "deterministic paged-KV fixture",
            "tokens": 768
          },
          "setup": {
            "adapter": "kvmem",
            "seed": 42,
            "block_size": 32,
            "selected_blocks": 6
          },
          "baseline": {
            "name": "recent-context compaction",
            "attention_cosine": 0.628563404083252
          },
          "method": {
            "name": "query-conditioned paged KV",
            "attention_cosine": 0.572260320186615
          },
          "stages": {
            "workspace_blocks": 24,
            "materialized_blocks": 6,
            "virtualization_tiers": 3
          },
          "paper_results": {
            "deepswe_compaction_success_percent": 43.8,
            "deepswe_kvmem_success_percent": 48.4,
            "workspace_tokens": 1000000
          },
          "scope": "CPU fixture checks attention-space indexing and materialization; committed A100 receipt uses real checkpoint KV tensors.",
          "manifest_ref": "reproduction:kvmem",
          "runtime": {
            "requested_device": "cpu",
            "cpu_threads": null,
            "platform": "Darwin arm64",
            "resolved_device": "cpu",
            "torch_version": "2.13.0",
            "accelerator": "arm"
          },
          "seed": 42,
          "schema_version": 2,
          "manifest": {
            "adapter_key": "kvmem",
            "arxiv_id": "2609.04852",
            "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
            "paper_url": "https://arxiv.org/abs/2609.04852",
            "track": "llm",
            "organization": "Shanghai University of Finance and Economics",
            "published": "2026-09-04",
            "code_url": "https://github.com/kvmem/kvmem-qw3",
            "topics": [
              "agent-memory",
              "kv-cache",
              "long-context",
              "inference-serving"
            ],
            "local_code_dir": "src/auto_research/reproductions/kvmem",
            "fidelity": "core_mechanism",
            "evaluation_tier": "l2_public_dataset",
            "datasets": [
              "public-domain long-context probe"
            ],
            "baseline": "equal-budget recent-context compaction",
            "metrics": [
              "attention-output cosine",
              "materialized blocks",
              "peak GPU memory"
            ],
            "default_seeds": [
              42
            ],
            "budget": "adapter-defined fixed budget",
            "device_capabilities": [
              "cuda"
            ],
            "requires_gpu_validation": true,
            "gpu_validation_artifact": "docs/gpu-validations/kvmem-a100-20260907.json",
            "online_evidence": [],
            "selection_exception": null,
            "evolve_operators": [
              "memory:query-conditioned-paged-kv"
            ]
          },
          "provenance": {
            "created_at": "2026-09-07T08:31:45.165030+00:00",
            "code_commit": "f00cb330ae68d2de0253511148e7116708171291",
            "python": "3.12.9",
            "platform": "macOS-26.5.2-arm64-arm-64bit",
            "dataset_dir": "/Users/bytedance/Documents/git_daiwk/auto-research/data",
            "dataset_fingerprint": "e66c261317a7b3179720ef3e3f5f79d7a204b135d1f217e2911b153ad2ce50a0",
            "packages": {
              "auto-research": "0.1.0",
              "numpy": "2.5.2",
              "torch": "2.13.0",
              "transformers": "5.14.1"
            }
          },
          "evaluation_protocol": {
            "tier": "l2_public_dataset",
            "tier_label": "L2 公开数据集训练",
            "seeds": [
              42
            ],
            "budget": "paper-specific",
            "formal_comparison": false,
            "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
          }
        },
        {
          "paper": {
            "arxiv_id": "2609.04852",
            "title": "KVMem",
            "url": "https://arxiv.org/abs/2609.04852",
            "organization": "Shanghai University of Finance and Economics"
          },
          "dataset": {
            "name": "deterministic paged-KV fixture",
            "tokens": 768
          },
          "setup": {
            "adapter": "kvmem",
            "seed": 43,
            "block_size": 32,
            "selected_blocks": 6
          },
          "baseline": {
            "name": "recent-context compaction",
            "attention_cosine": 0.2890792489051819
          },
          "method": {
            "name": "query-conditioned paged KV",
            "attention_cosine": 0.5509865880012512
          },
          "stages": {
            "workspace_blocks": 24,
            "materialized_blocks": 6,
            "virtualization_tiers": 3
          },
          "paper_results": {
            "deepswe_compaction_success_percent": 43.8,
            "deepswe_kvmem_success_percent": 48.4,
            "workspace_tokens": 1000000
          },
          "scope": "CPU fixture checks attention-space indexing and materialization; committed A100 receipt uses real checkpoint KV tensors.",
          "manifest_ref": "reproduction:kvmem",
          "runtime": {
            "requested_device": "cpu",
            "cpu_threads": null,
            "platform": "Darwin arm64",
            "resolved_device": "cpu",
            "torch_version": "2.13.0",
            "accelerator": "arm"
          },
          "seed": 43,
          "schema_version": 2,
          "manifest": {
            "adapter_key": "kvmem",
            "arxiv_id": "2609.04852",
            "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
            "paper_url": "https://arxiv.org/abs/2609.04852",
            "track": "llm",
            "organization": "Shanghai University of Finance and Economics",
            "published": "2026-09-04",
            "code_url": "https://github.com/kvmem/kvmem-qw3",
            "topics": [
              "agent-memory",
              "kv-cache",
              "long-context",
              "inference-serving"
            ],
            "local_code_dir": "src/auto_research/reproductions/kvmem",
            "fidelity": "core_mechanism",
            "evaluation_tier": "l2_public_dataset",
            "datasets": [
              "public-domain long-context probe"
            ],
            "baseline": "equal-budget recent-context compaction",
            "metrics": [
              "attention-output cosine",
              "materialized blocks",
              "peak GPU memory"
            ],
            "default_seeds": [
              42
            ],
            "budget": "adapter-defined fixed budget",
            "device_capabilities": [
              "cuda"
            ],
            "requires_gpu_validation": true,
            "gpu_validation_artifact": "docs/gpu-validations/kvmem-a100-20260907.json",
            "online_evidence": [],
            "selection_exception": null,
            "evolve_operators": [
              "memory:query-conditioned-paged-kv"
            ]
          },
          "provenance": {
            "created_at": "2026-09-07T08:31:45.286820+00:00",
            "code_commit": "f00cb330ae68d2de0253511148e7116708171291",
            "python": "3.12.9",
            "platform": "macOS-26.5.2-arm64-arm-64bit",
            "dataset_dir": "/Users/bytedance/Documents/git_daiwk/auto-research/data",
            "dataset_fingerprint": "e66c261317a7b3179720ef3e3f5f79d7a204b135d1f217e2911b153ad2ce50a0",
            "packages": {
              "auto-research": "0.1.0",
              "numpy": "2.5.2",
              "torch": "2.13.0",
              "transformers": "5.14.1"
            }
          },
          "evaluation_protocol": {
            "tier": "l2_public_dataset",
            "tier_label": "L2 公开数据集训练",
            "seeds": [
              43
            ],
            "budget": "paper-specific",
            "formal_comparison": false,
            "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
          }
        },
        {
          "paper": {
            "arxiv_id": "2609.04852",
            "title": "KVMem",
            "url": "https://arxiv.org/abs/2609.04852",
            "organization": "Shanghai University of Finance and Economics"
          },
          "dataset": {
            "name": "deterministic paged-KV fixture",
            "tokens": 768
          },
          "setup": {
            "adapter": "kvmem",
            "seed": 44,
            "block_size": 32,
            "selected_blocks": 6
          },
          "baseline": {
            "name": "recent-context compaction",
            "attention_cosine": 0.2828383445739746
          },
          "method": {
            "name": "query-conditioned paged KV",
            "attention_cosine": 0.026661615818738937
          },
          "stages": {
            "workspace_blocks": 24,
            "materialized_blocks": 6,
            "virtualization_tiers": 3
          },
          "paper_results": {
            "deepswe_compaction_success_percent": 43.8,
            "deepswe_kvmem_success_percent": 48.4,
            "workspace_tokens": 1000000
          },
          "scope": "CPU fixture checks attention-space indexing and materialization; committed A100 receipt uses real checkpoint KV tensors.",
          "manifest_ref": "reproduction:kvmem",
          "runtime": {
            "requested_device": "cpu",
            "cpu_threads": null,
            "platform": "Darwin arm64",
            "resolved_device": "cpu",
            "torch_version": "2.13.0",
            "accelerator": "arm"
          },
          "seed": 44,
          "schema_version": 2,
          "manifest": {
            "adapter_key": "kvmem",
            "arxiv_id": "2609.04852",
            "title": "KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU",
            "paper_url": "https://arxiv.org/abs/2609.04852",
            "track": "llm",
            "organization": "Shanghai University of Finance and Economics",
            "published": "2026-09-04",
            "code_url": "https://github.com/kvmem/kvmem-qw3",
            "topics": [
              "agent-memory",
              "kv-cache",
              "long-context",
              "inference-serving"
            ],
            "local_code_dir": "src/auto_research/reproductions/kvmem",
            "fidelity": "core_mechanism",
            "evaluation_tier": "l2_public_dataset",
            "datasets": [
              "public-domain long-context probe"
            ],
            "baseline": "equal-budget recent-context compaction",
            "metrics": [
              "attention-output cosine",
              "materialized blocks",
              "peak GPU memory"
            ],
            "default_seeds": [
              42
            ],
            "budget": "adapter-defined fixed budget",
            "device_capabilities": [
              "cuda"
            ],
            "requires_gpu_validation": true,
            "gpu_validation_artifact": "docs/gpu-validations/kvmem-a100-20260907.json",
            "online_evidence": [],
            "selection_exception": null,
            "evolve_operators": [
              "memory:query-conditioned-paged-kv"
            ]
          },
          "provenance": {
            "created_at": "2026-09-07T08:31:45.314468+00:00",
            "code_commit": "f00cb330ae68d2de0253511148e7116708171291",
            "python": "3.12.9",
            "platform": "macOS-26.5.2-arm64-arm-64bit",
            "dataset_dir": "/Users/bytedance/Documents/git_daiwk/auto-research/data",
            "dataset_fingerprint": "e66c261317a7b3179720ef3e3f5f79d7a204b135d1f217e2911b153ad2ce50a0",
            "packages": {
              "auto-research": "0.1.0",
              "numpy": "2.5.2",
              "torch": "2.13.0",
              "transformers": "5.14.1"
            }
          },
          "evaluation_protocol": {
            "tier": "l2_public_dataset",
            "tier_label": "L2 公开数据集训练",
            "seeds": [
              44
            ],
            "budget": "paper-specific",
            "formal_comparison": false,
            "claim_policy": "single/few-seed smoke result; do not claim a stable improvement"
          }
        }
      ],
      "aggregate_metrics": {
        "dataset.tokens": {
          "mean": 768.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "setup.block_size": {
          "mean": 32.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "setup.selected_blocks": {
          "mean": 6.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "baseline.attention_cosine": {
          "mean": 0.4001603325208028,
          "std": 0.19782747419428062,
          "ci95": 0.22386286113917644,
          "n": 3
        },
        "method.attention_cosine": {
          "mean": 0.38330284133553505,
          "std": 0.3090434689875606,
          "ci95": 0.3497156068220772,
          "n": 3
        },
        "stages.workspace_blocks": {
          "mean": 24.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "stages.materialized_blocks": {
          "mean": 6.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "stages.virtualization_tiers": {
          "mean": 3.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "paper_results.deepswe_compaction_success_percent": {
          "mean": 43.79999999999999,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "paper_results.deepswe_kvmem_success_percent": {
          "mean": 48.4,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        },
        "paper_results.workspace_tokens": {
          "mean": 1000000.0,
          "std": 0.0,
          "ci95": 0.0,
          "n": 3
        }
      },
      "formal_comparison": true
    }
  },
  "manifest_ref": "reproduction:kvmem",
  "evaluation_protocol": {
    "tier": "l2_public_dataset",
    "seeds": [
      42,
      43,
      44
    ],
    "formal_comparison": true,
    "claim_policy": "formal multi-seed comparison"
  },
  "provenance": {
    "artifact_path": "docs/reproductions/2609.04852-kvmem/metrics/synthetic-workspace-seeds42-44.json",
    "dataset_fingerprint": "not recorded in historical artifact"
  }
}
