14:29
2026-08-17
piszczek.pl
large-language-models
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP
A custom llama.cpp build with Qwen3.8-27B's embedded MTP drafter achieves 50.44 tokens per second on an NVIDIA RTX PRO 4000 Blackwell SFF with 24 GB VRAM, a 21.97% gain over clean master (55.40 vs 45.โฆ