01:01
2026-09-15
gladlabs.io
large-language-models
Decode Speed Lies: phi4:14b Loses 79.7% of Its Throughput Before You See a Token
An analysis of 2,218 instrumented production calls over 30 days found that phi4:14b delivered only 25.3 tokens per second to callers versus its 124.7 tok/s Ollama-reported decode speed, losing 79.7% o…