10:38
2026-10-10
forum.level1techs.com
large-language-models
I didn't know it was IMPOSSIBLE!... I just needed it." - 400k+ Context on Qwen 3.6 MoE 35B on a Single 16GB GPU (RTX 5060 Ti) at 25 t/s
A user reported running a Qwen 3.6 MoE 35B model at roughly 2.6763 bits per weight (qwen3.6-35b-a3b-12gb-2.6763bpw.gguf) on a single 16GB RTX 5060 Ti at 25 tokens per second with over 400k context, wh…