Jak rozjet lokální LLM napojený na Home Assistant A developer who had struggled for a year to run a local LLM successfully deployed Qwen 3.8 27B with llama.cpp and connected it to Home Assistant in just one hour, after community advice. The breakthrough came from replacing OpenWebUI with llama.cpp's built-in web UI and using a Q5_K_S quantization on dual RTX GPUs, which also resolved CPU idle spikes and CUDA access issues. The developer highlighted the model's built-in vision support for screenshots as a standout feature. Když se nedaří rozjet lokální model, bývá to většinou o jedné špatné komponentě. Uživatel se o tom přesvědčil na vlastní kůži: po roce vzdávání stačila hodina práce s llama.cpp a Qwen 3.8 27B se změnil z frustrace ve fungujícího agenta napojeného na Home Assistant. OP si v roce 2023 pořídil několik GPU pro Folding@Home a vždy chtěl vlastního lokálního agenta na pomoc s programováním a domácí automatizací. Jenže pokaždé, když to zkusil, nic nefungovalo, a tak to vždy vzdal. V komentáři k jinému příspěvku o Qwen 3.8 27B se svěřil se svou frustrací — a komunita mu poradila. Výsledek po jedné hodině práce: Nejvíc ho překvapila vestavěná vision podpora — model umí pracovat se screenshoty bez jakékoli další konfigurace. Pro někoho, kdo se půl roku trápil s tím, že mu nic nefunguje, je tohle přesně ten moment, kdy „tohle je magie". Z komentářů autora: Výběr Q5 K S není náhoda — na dvojici RTX 4090 + RTX 4070 Ti má model dost VRAM a běží rychle, přitom kvalita výstupu zůstává vysoko. Pro srovnání, mnozí uživatelé v komunitě volí pro 27B modely kvantizace od Q3 po Q5 podle velikosti VRAM. Zajímavé na celém vlákně je, jak častý problém OpenWebUI je. OP popsal, že si s ním nikdy neporozuměl, a v komentářích se našla spousta lidí s podobnou zkušeností: Důležité upozornění: OpenWebUI není jediná cesta. Jeden uživatel si posteskl, že nechce dávat pryč webové rozhraní, protože má Tailscale tunel do telefonu — a odpověď zní, že frontend lze oddělit od backendu. Nemusíš mít OpenWebUI vůbec. llama.cpp obsahuje vestavěné webové UI, které se aktivně vyvíjí: „llama.cpp má vlastní webové rozhraní. Stačí jít na http://serveraddress:port a budeš mít UI podobné chatgpt." — dashingdon Pokud jsi OpenWebUI nainstaloval během posledních pár týdnů, můžeš mít verzi s bugem, který nechává CPU vytížené i v idle. Pomohlo přidání do docker konfigurace: environment: - TIMER POLL INTERVAL=300 výchozí 1 - SCHEDULER POLL INTERVAL=60 výchozí 10 Uživateli to srazilo idle vytížení CPU z 30 % na 0,4 %. Další častý problém: OpenWebUI v dockeru nemá přístup k CUDA a embeddings běží na CPU. Stačí opravit přístup k CUDA a zátěž CPU výrazně klesne. llama.cpp jako backend + OpenWebUI jako jeden z frontendů — funguje v dockeru na Ryzen 5 3600 bez problémů. Můžeš klidně kombinovat. Nejvíce bodů 64 získal komentář, který shrnuje celý stack jednoho uživatele: „Qwen 3.8 + Llama.cpp + sbx opencode + searxng + pár MCP = Claude doma" — ThatsALovelyShirt Tedy: model + inference + coding agent + vyhledávání + MCP servery = lokální ekvivalent Claude. K výše zmíněnému stacku měl jeden uživatel dotaz na konfiguraci SearXNG — dostával irelevantní výsledky a rate limiting. Rada: „Většinou držím duckduckgo, wikipedia, github a google scholar, to mi dává skoro všechno, co potřebuji. Když použiješ výchozí konfiguraci s desítkami dalších vyhledávačů, dostaneš spoustu divných výsledků a rate limiting ." — ThatsALovelyShirt Tedy omezit počet vyhledávačů v konfiguraci na pár ověřených. Jednoduchá alternativa: „DeepSeek harness + Qwen 3.8 27b je ta správná cesta." — ComprehensiveRoyal41 Vlákno ukazuje dva důležité poznatky. Za prvé, největší překážka u lokálních modelů často není hardware ani model, ale frontend a konfigurace — a jednoduché řešení odebrat OpenWebUI, srovnat llama.cpp znamená rozdíl mezi vzdáním a fungujícím agentem. Za druhé, komunita je v těchto případech neuvěřitelně hodnotná — stačí se zeptat a říct, kde to bolí. Pokud to dáváš dohromady poprvé: začni s llama.cpp, vezmi Q5 K S kvantizaci Qwen 3.8 27B, a frontend řeš až poté, co backend běží. Inspirace: Qwen 3.8 27B, just wanted to say thanks to you guys https://www.reddit.com/r/LocalLLaMA/comments/1vwowbu/qwen 38 27b just wanted to say thanks to you guys/