22:05
2026-09-12
promptcube3.com
large-language-models
Gemini Forum, Qwen Coder local setup
A developer resolved CUDA out-of-memory crashes running Qwen2.5-Coder-32B on a 24GB RTX 3090 by capping the context window at 8k tokens instead of 32k via a custom Ollama Modelfile, cutting latency fr…