LOCAL LLM BENCHMARK
========================================================================
ID:              20260822-105943
Timestamp:       2026-08-22T10:59:43-07:00
Model:           llama3:latest
Context:         4096
Output tokens:   256
CPU threads:     8
Measured runs:   3

BENCHMARK SESSION
------------------------------------------------------------------------
Pre-scan:        0.054 s
Cold phase:      40.332 s
Warmup phase:    35.057 s
Measured phase:  103.842 s
Post-scan:       0.059 s
Benchmark phase: 179.731 s
Total session:   179.844 s

WARM PERFORMANCE
------------------------------------------------------------------------
Generation:      7.51 tok/s
Prompt eval:     311.23 tok/s
Average total:   34612.42 ms
Average wall:    34.610 s
Average load:    131.72 ms

COLD PERFORMANCE
------------------------------------------------------------------------
Generation:      7.36 tok/s
Prompt eval:     22.29 tok/s
Load time:       3410.50 ms
Total:           40329.83 ms
Wall:            40.332 s

COMPARISON TO PREVIOUS (20260822-104945)
------------------------------------------------------------------------
Generation tok/s         6.75 -> 7.51       performance +11.26%
Prompt tok/s           289.89 -> 311.23     performance +7.36%
Total duration       38456.42 -> 34612.42   performance +10.00%
Wall time               38.46 -> 34.61      performance +10.01%
Load time               128.1 -> 131.72     performance -2.83%

SESSION TIME COMPARISON
------------------------------------------------------------------------
Previous session: 199.262 s
Current session:  179.844 s
Performance:      +9.74%

CONFIGURATION CHANGES
------------------------------------------------------------------------
cpu_threads: 12 -> 8

WARMUP DETAILS
------------------------------------------------------------------------
Warmup 1: gen=7.41 tok/s | prompt=321.73 tok/s | wall=35.057s

RUN DETAILS
------------------------------------------------------------------------
Run 1: gen=7.48 tok/s | prompt=317.09 tok/s | wall=34.730s
Run 2: gen=7.48 tok/s | prompt=291.75 tok/s | wall=34.743s
Run 3: gen=7.56 tok/s | prompt=324.84 tok/s | wall=34.367s

RECOMMENDATIONS
------------------------------------------------------------------------
[MEDIUM] Low generation throughput
  Measured generation is 7.51 tok/s. Try a smaller quantization/model, lower context size, or verify that Ollama is offloading layers to the available GPU.