{"slug": "jak-rozjet-lokalni-llm-napojeny-na-home-assistant", "title": "Jak rozjet lokální LLM napojený na Home Assistant", "summary": "A developer who had struggled for a year to run a local LLM successfully deployed Qwen 3.8 27B with llama.cpp and connected it to Home Assistant in just one hour, after community advice. The breakthrough came from replacing OpenWebUI with llama.cpp's built-in web UI and using a Q5_K_S quantization on dual RTX GPUs, which also resolved CPU idle spikes and CUDA access issues. The developer highlighted the model's built-in vision support for screenshots as a standout feature.", "body_md": "Když se nedaří rozjet lokální model, bývá to většinou o jedné špatné komponentě. Uživatel se o tom přesvědčil na vlastní kůži: po roce vzdávání stačila hodina práce s llama.cpp a Qwen 3.8 27B se změnil z frustrace ve fungujícího agenta napojeného na Home Assistant.\n\nOP si v roce 2023 pořídil několik GPU pro Folding@Home a vždy chtěl vlastního lokálního agenta na pomoc s programováním a domácí automatizací. Jenže pokaždé, když to zkusil, nic nefungovalo, a tak to vždy vzdal. V komentáři k jinému příspěvku o Qwen 3.8 27B se svěřil se svou frustrací — a komunita mu poradila.\n\nVýsledek po jedné hodině práce:\n\nNejvíc ho překvapila vestavěná vision podpora — model umí pracovat se screenshoty bez jakékoli další konfigurace. Pro někoho, kdo se půl roku trápil s tím, že mu nic nefunguje, je tohle přesně ten moment, kdy „tohle je magie\".\n\nZ komentářů autora:\n\nVýběr Q5_K_S není náhoda — na dvojici RTX 4090 + RTX 4070 Ti má model dost VRAM a běží rychle, přitom kvalita výstupu zůstává vysoko. Pro srovnání, mnozí uživatelé v komunitě volí pro 27B modely kvantizace od Q3 po Q5 podle velikosti VRAM.\n\nZajímavé na celém vlákně je, jak častý problém OpenWebUI je. OP popsal, že si s ním nikdy neporozuměl, a v komentářích se našla spousta lidí s podobnou zkušeností:\n\nDůležité upozornění: OpenWebUI není jediná cesta. Jeden uživatel si posteskl, že nechce dávat pryč webové rozhraní, protože má Tailscale tunel do telefonu — a odpověď zní, že frontend lze oddělit od backendu.\n\nNemusíš mít OpenWebUI vůbec. `llama.cpp`\n\nobsahuje vestavěné webové UI, které se aktivně vyvíjí:\n\n„llama.cpp má vlastní webové rozhraní. Stačí jít na\n\n[http://serveraddress:port]a budeš mít UI podobné chatgpt.\" — dashingdon\n\nPokud jsi OpenWebUI nainstaloval během posledních pár týdnů, můžeš mít verzi s bugem, který nechává CPU vytížené i v idle. Pomohlo přidání do docker konfigurace:\n\n```\nenvironment:\n  - TIMER_POLL_INTERVAL=300      # výchozí 1 (!)\n  - SCHEDULER_POLL_INTERVAL=60   # výchozí 10\n```\n\nUživateli to srazilo idle vytížení CPU z 30 % na 0,4 %.\n\nDalší častý problém: OpenWebUI v dockeru nemá přístup k CUDA a embeddings běží na CPU. Stačí opravit přístup k CUDA a zátěž CPU výrazně klesne.\n\nllama.cpp jako backend + OpenWebUI jako jeden z frontendů — funguje v dockeru na Ryzen 5 3600 bez problémů. Můžeš klidně kombinovat.\n\nNejvíce bodů (64) získal komentář, který shrnuje celý stack jednoho uživatele:\n\n„Qwen 3.8 + Llama.cpp + sbx opencode + searxng + pár MCP = Claude doma\" — ThatsALovelyShirt\n\nTedy: model + inference + coding agent + vyhledávání + MCP servery = lokální ekvivalent Claude.\n\nK výše zmíněnému stacku měl jeden uživatel dotaz na konfiguraci SearXNG — dostával irelevantní výsledky a rate limiting. Rada:\n\n„Většinou držím duckduckgo, wikipedia, github a google scholar, to mi dává skoro všechno, co potřebuji. Když použiješ výchozí konfiguraci s desítkami dalších vyhledávačů, dostaneš spoustu divných výsledků (a rate limiting).\" — ThatsALovelyShirt\n\nTedy omezit počet vyhledávačů v konfiguraci na pár ověřených.\n\nJednoduchá alternativa: „DeepSeek harness + Qwen 3.8 27b je ta správná cesta.\" — ComprehensiveRoyal41\n\nVlákno ukazuje dva důležité poznatky. Za prvé, největší překážka u lokálních modelů často není hardware ani model, ale frontend a konfigurace — a jednoduché řešení (odebrat OpenWebUI, srovnat llama.cpp) znamená rozdíl mezi vzdáním a fungujícím agentem. Za druhé, komunita je v těchto případech neuvěřitelně hodnotná — stačí se zeptat a říct, kde to bolí.\n\nPokud to dáváš dohromady poprvé: začni s llama.cpp, vezmi Q5_K_S kvantizaci Qwen 3.8 27B, a frontend řeš až poté, co backend běží.\n\n**Inspirace:** [Qwen 3.8 27B, just wanted to say thanks to you guys](https://www.reddit.com/r/LocalLLaMA/comments/1vwowbu/qwen_38_27b_just_wanted_to_say_thanks_to_you_guys/)", "url": "https://wpnews.pro/news/jak-rozjet-lokalni-llm-napojeny-na-home-assistant", "canonical_source": "https://dev.to/petr_baloun/jak-rozjet-lokalni-llm-napojeny-na-home-assistant-pribeh-z-rlocalllama-5gd3", "published_at": "2026-08-25 11:15:25+00:00", "updated_at": "2026-08-25 11:43:35.917686+00:00", "lang": "en", "topics": ["large-language-models", "ai-tools", "developer-tools", "ai-agents"], "entities": ["Qwen", "llama.cpp", "Home Assistant", "OpenWebUI", "RTX 4090", "RTX 4070 Ti", "SearXNG", "Claude"], "alternates": {"html": "https://wpnews.pro/news/jak-rozjet-lokalni-llm-napojeny-na-home-assistant", "markdown": "https://wpnews.pro/news/jak-rozjet-lokalni-llm-napojeny-na-home-assistant.md", "text": "https://wpnews.pro/news/jak-rozjet-lokalni-llm-napojeny-na-home-assistant.txt", "jsonld": "https://wpnews.pro/news/jak-rozjet-lokalni-llm-napojeny-na-home-assistant.jsonld"}}