cd /news/large-language-models/jak-rozjet-lokalni-llm-napojeny-na-h… · home topics large-language-models article
[ARTICLE · art-110079] src=dev.to ↗ pub= topic=large-language-models verified=true sentiment=↑ positive

Jak rozjet lokální LLM napojený na Home Assistant

A developer who had struggled for a year to run a local LLM successfully deployed Qwen 3.8 27B with llama.cpp and connected it to Home Assistant in just one hour, after community advice. The breakthrough came from replacing OpenWebUI with llama.cpp's built-in web UI and using a Q5_K_S quantization on dual RTX GPUs, which also resolved CPU idle spikes and CUDA access issues. The developer highlighted the model's built-in vision support for screenshots as a standout feature.

read3 min views3 publishedAug 25, 2026

Když se nedaří rozjet lokální model, bývá to většinou o jedné špatné komponentě. Uživatel se o tom přesvědčil na vlastní kůži: po roce vzdávání stačila hodina práce s llama.cpp a Qwen 3.8 27B se změnil z frustrace ve fungujícího agenta napojeného na Home Assistant.

OP si v roce 2023 pořídil několik GPU pro Folding@Home a vždy chtěl vlastního lokálního agenta na pomoc s programováním a domácí automatizací. Jenže pokaždé, když to zkusil, nic nefungovalo, a tak to vždy vzdal. V komentáři k jinému příspěvku o Qwen 3.8 27B se svěřil se svou frustrací — a komunita mu poradila.

Výsledek po jedné hodině práce:

Nejvíc ho překvapila vestavěná vision podpora — model umí pracovat se screenshoty bez jakékoli další konfigurace. Pro někoho, kdo se půl roku trápil s tím, že mu nic nefunguje, je tohle přesně ten moment, kdy „tohle je magie".

Z komentářů autora:

Výběr Q5_K_S není náhoda — na dvojici RTX 4090 + RTX 4070 Ti má model dost VRAM a běží rychle, přitom kvalita výstupu zůstává vysoko. Pro srovnání, mnozí uživatelé v komunitě volí pro 27B modely kvantizace od Q3 po Q5 podle velikosti VRAM.

Zajímavé na celém vlákně je, jak častý problém OpenWebUI je. OP popsal, že si s ním nikdy neporozuměl, a v komentářích se našla spousta lidí s podobnou zkušeností:

Důležité upozornění: OpenWebUI není jediná cesta. Jeden uživatel si posteskl, že nechce dávat pryč webové rozhraní, protože má Tailscale tunel do telefonu — a odpověď zní, že frontend lze oddělit od backendu.

Nemusíš mít OpenWebUI vůbec. llama.cpp

obsahuje vestavěné webové UI, které se aktivně vyvíjí:

„llama.cpp má vlastní webové rozhraní. Stačí jít na

[http://serveraddress:port]a budeš mít UI podobné chatgpt." — dashingdon

Pokud jsi OpenWebUI nainstaloval během posledních pár týdnů, můžeš mít verzi s bugem, který nechává CPU vytížené i v idle. Pomohlo přidání do docker konfigurace:

environment:
  - TIMER_POLL_INTERVAL=300      # výchozí 1 (!)
  - SCHEDULER_POLL_INTERVAL=60   # výchozí 10

Uživateli to srazilo idle vytížení CPU z 30 % na 0,4 %.

Další častý problém: OpenWebUI v dockeru nemá přístup k CUDA a embeddings běží na CPU. Stačí opravit přístup k CUDA a zátěž CPU výrazně klesne.

llama.cpp jako backend + OpenWebUI jako jeden z frontendů — funguje v dockeru na Ryzen 5 3600 bez problémů. Můžeš klidně kombinovat.

Nejvíce bodů (64) získal komentář, který shrnuje celý stack jednoho uživatele:

„Qwen 3.8 + Llama.cpp + sbx opencode + searxng + pár MCP = Claude doma" — ThatsALovelyShirt

Tedy: model + inference + coding agent + vyhledávání + MCP servery = lokální ekvivalent Claude.

K výše zmíněnému stacku měl jeden uživatel dotaz na konfiguraci SearXNG — dostával irelevantní výsledky a rate limiting. Rada:

„Většinou držím duckduckgo, wikipedia, github a google scholar, to mi dává skoro všechno, co potřebuji. Když použiješ výchozí konfiguraci s desítkami dalších vyhledávačů, dostaneš spoustu divných výsledků (a rate limiting)." — ThatsALovelyShirt

Tedy omezit počet vyhledávačů v konfiguraci na pár ověřených.

Jednoduchá alternativa: „DeepSeek harness + Qwen 3.8 27b je ta správná cesta." — ComprehensiveRoyal41

Vlákno ukazuje dva důležité poznatky. Za prvé, největší překážka u lokálních modelů často není hardware ani model, ale frontend a konfigurace — a jednoduché řešení (odebrat OpenWebUI, srovnat llama.cpp) znamená rozdíl mezi vzdáním a fungujícím agentem. Za druhé, komunita je v těchto případech neuvěřitelně hodnotná — stačí se zeptat a říct, kde to bolí.

Pokud to dáváš dohromady poprvé: začni s llama.cpp, vezmi Q5_K_S kvantizaci Qwen 3.8 27B, a frontend řeš až poté, co backend běží.

Inspirace: Qwen 3.8 27B, just wanted to say thanks to you guys

── more in #large-language-models 4 stories · sorted by recency
── more on @qwen 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/jak-rozjet-lokalni-l…] indexed:0 read:3min 2026-08-25 ·