18:44
2026-08-25
forum.level1techs.com
large-language-models
Self-hosting LLMs, my journey so far, and knowledge desired.
A user self-hosting large language models on an AMD Radeon RX 9700 reports achieving only ~22 tokens/s with Qwen 3.8 Q5_K_m, despite fitting 132k Q8_0 context, and seeks tips for improving performanceβ¦