Local LLM performance report Leave unknown or unmeasured values explicitly unknown. Measurement date and timezone: Model repository, file/tag and revision/digest: Total and active parameters, if known: Weight quantization and format: GPU model(s), count and VRAM per device: CPU, system RAM and OS: Engine version, backend and driver: Offloaded layers/experts and device split: KV-cache type and placement: Configured context limit: Actual input tokens per run: Actual output tokens per run: Concurrent requests: Batch settings (not the same as request concurrency): Speculative decoding / draft model: Other settings and background load: Exact command/request and prompt (remove private content): Warmup procedure: Repetition count: Cached input / prefix reuse: Raw output or source URL: Per-run generation tokens/s: Per-run uncached prompt-processing tokens/s (or unknown): Time to first token and measurement method (or unmeasured): Wall-clock completion time: Peak memory use and measurement method: Range/median over repeated runs (never just the fastest): Loading time included or excluded: Task quality observations (separate from speed): Known limitations: