Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory
On a 128GB unified memory system using AMD's Ryzen AI Max Plus 395 chip, a dense 9B model with a speculative drafter ran at just under 40 tokens per second, a 35B mixture-of-experts Qwen3.6 model with…