22:15
2026-10-08
twitter.com
large-language-models
Qwen3.8-27B at ~200 tok/s peak on an Apple M5 Max
Zhihao Jia announced the open-sourcing of lithos-metal, a project that runs Qwen3.8-27B at 200+ tokens/s per user peak on a single Apple M5 Max using megakernels and DSpark speculative decoding. The cā¦