# Jak rozjet lokální LLM napojený na Home Assistant

> Source: <https://dev.to/petr_baloun/jak-rozjet-lokalni-llm-napojeny-na-home-assistant-pribeh-z-rlocalllama-5gd3>
> Published: 2026-08-25 11:15:25+00:00

Když se nedaří rozjet lokální model, bývá to většinou o jedné špatné komponentě. Uživatel se o tom přesvědčil na vlastní kůži: po roce vzdávání stačila hodina práce s llama.cpp a Qwen 3.8 27B se změnil z frustrace ve fungujícího agenta napojeného na Home Assistant.

OP si v roce 2023 pořídil několik GPU pro Folding@Home a vždy chtěl vlastního lokálního agenta na pomoc s programováním a domácí automatizací. Jenže pokaždé, když to zkusil, nic nefungovalo, a tak to vždy vzdal. V komentáři k jinému příspěvku o Qwen 3.8 27B se svěřil se svou frustrací — a komunita mu poradila.

Výsledek po jedné hodině práce:

Nejvíc ho překvapila vestavěná vision podpora — model umí pracovat se screenshoty bez jakékoli další konfigurace. Pro někoho, kdo se půl roku trápil s tím, že mu nic nefunguje, je tohle přesně ten moment, kdy „tohle je magie".

Z komentářů autora:

Výběr Q5_K_S není náhoda — na dvojici RTX 4090 + RTX 4070 Ti má model dost VRAM a běží rychle, přitom kvalita výstupu zůstává vysoko. Pro srovnání, mnozí uživatelé v komunitě volí pro 27B modely kvantizace od Q3 po Q5 podle velikosti VRAM.

Zajímavé na celém vlákně je, jak častý problém OpenWebUI je. OP popsal, že si s ním nikdy neporozuměl, a v komentářích se našla spousta lidí s podobnou zkušeností:

Důležité upozornění: OpenWebUI není jediná cesta. Jeden uživatel si posteskl, že nechce dávat pryč webové rozhraní, protože má Tailscale tunel do telefonu — a odpověď zní, že frontend lze oddělit od backendu.

Nemusíš mít OpenWebUI vůbec. `llama.cpp`

obsahuje vestavěné webové UI, které se aktivně vyvíjí:

„llama.cpp má vlastní webové rozhraní. Stačí jít na

[http://serveraddress:port]a budeš mít UI podobné chatgpt." — dashingdon

Pokud jsi OpenWebUI nainstaloval během posledních pár týdnů, můžeš mít verzi s bugem, který nechává CPU vytížené i v idle. Pomohlo přidání do docker konfigurace:

```
environment:
  - TIMER_POLL_INTERVAL=300      # výchozí 1 (!)
  - SCHEDULER_POLL_INTERVAL=60   # výchozí 10
```

Uživateli to srazilo idle vytížení CPU z 30 % na 0,4 %.

Další častý problém: OpenWebUI v dockeru nemá přístup k CUDA a embeddings běží na CPU. Stačí opravit přístup k CUDA a zátěž CPU výrazně klesne.

llama.cpp jako backend + OpenWebUI jako jeden z frontendů — funguje v dockeru na Ryzen 5 3600 bez problémů. Můžeš klidně kombinovat.

Nejvíce bodů (64) získal komentář, který shrnuje celý stack jednoho uživatele:

„Qwen 3.8 + Llama.cpp + sbx opencode + searxng + pár MCP = Claude doma" — ThatsALovelyShirt

Tedy: model + inference + coding agent + vyhledávání + MCP servery = lokální ekvivalent Claude.

K výše zmíněnému stacku měl jeden uživatel dotaz na konfiguraci SearXNG — dostával irelevantní výsledky a rate limiting. Rada:

„Většinou držím duckduckgo, wikipedia, github a google scholar, to mi dává skoro všechno, co potřebuji. Když použiješ výchozí konfiguraci s desítkami dalších vyhledávačů, dostaneš spoustu divných výsledků (a rate limiting)." — ThatsALovelyShirt

Tedy omezit počet vyhledávačů v konfiguraci na pár ověřených.

Jednoduchá alternativa: „DeepSeek harness + Qwen 3.8 27b je ta správná cesta." — ComprehensiveRoyal41

Vlákno ukazuje dva důležité poznatky. Za prvé, největší překážka u lokálních modelů často není hardware ani model, ale frontend a konfigurace — a jednoduché řešení (odebrat OpenWebUI, srovnat llama.cpp) znamená rozdíl mezi vzdáním a fungujícím agentem. Za druhé, komunita je v těchto případech neuvěřitelně hodnotná — stačí se zeptat a říct, kde to bolí.

Pokud to dáváš dohromady poprvé: začni s llama.cpp, vezmi Q5_K_S kvantizaci Qwen 3.8 27B, a frontend řeš až poté, co backend běží.

**Inspirace:** [Qwen 3.8 27B, just wanted to say thanks to you guys](https://www.reddit.com/r/LocalLLaMA/comments/1vwowbu/qwen_38_27b_just_wanted_to_say_thanks_to_you_guys/)
