Když se nedaří rozjet lokální model, bývá to většinou o jedné špatné komponentě. Uživatel se o tom přesvědčil na vlastní kůži: po roce vzdávání stačila hodina práce s llama.cpp a Qwen 3.8 27B se změnil z frustrace ve fungujícího agenta napojeného na Home Assistant.
OP si v roce 2023 pořídil několik GPU pro Folding@Home a vždy chtěl vlastního lokálního agenta na pomoc s programováním a domácí automatizací. Jenže pokaždé, když to zkusil, nic nefungovalo, a tak to vždy vzdal. V komentáři k jinému příspěvku o Qwen 3.8 27B se svěřil se svou frustrací — a komunita mu poradila.
Výsledek po jedné hodině práce:
Nejvíc ho překvapila vestavěná vision podpora — model umí pracovat se screenshoty bez jakékoli další konfigurace. Pro někoho, kdo se půl roku trápil s tím, že mu nic nefunguje, je tohle přesně ten moment, kdy „tohle je magie".
Z komentářů autora:
Výběr Q5_K_S není náhoda — na dvojici RTX 4090 + RTX 4070 Ti má model dost VRAM a běží rychle, přitom kvalita výstupu zůstává vysoko. Pro srovnání, mnozí uživatelé v komunitě volí pro 27B modely kvantizace od Q3 po Q5 podle velikosti VRAM.
Zajímavé na celém vlákně je, jak častý problém OpenWebUI je. OP popsal, že si s ním nikdy neporozuměl, a v komentářích se našla spousta lidí s podobnou zkušeností:
Důležité upozornění: OpenWebUI není jediná cesta. Jeden uživatel si posteskl, že nechce dávat pryč webové rozhraní, protože má Tailscale tunel do telefonu — a odpověď zní, že frontend lze oddělit od backendu.
Nemusíš mít OpenWebUI vůbec. llama.cpp
obsahuje vestavěné webové UI, které se aktivně vyvíjí:
„llama.cpp má vlastní webové rozhraní. Stačí jít na
[http://serveraddress:port]a budeš mít UI podobné chatgpt." — dashingdon
Pokud jsi OpenWebUI nainstaloval během posledních pár týdnů, můžeš mít verzi s bugem, který nechává CPU vytížené i v idle. Pomohlo přidání do docker konfigurace:
environment:
- TIMER_POLL_INTERVAL=300 # výchozí 1 (!)
- SCHEDULER_POLL_INTERVAL=60 # výchozí 10
Uživateli to srazilo idle vytížení CPU z 30 % na 0,4 %.
Další častý problém: OpenWebUI v dockeru nemá přístup k CUDA a embeddings běží na CPU. Stačí opravit přístup k CUDA a zátěž CPU výrazně klesne.
llama.cpp jako backend + OpenWebUI jako jeden z frontendů — funguje v dockeru na Ryzen 5 3600 bez problémů. Můžeš klidně kombinovat.
Nejvíce bodů (64) získal komentář, který shrnuje celý stack jednoho uživatele:
„Qwen 3.8 + Llama.cpp + sbx opencode + searxng + pár MCP = Claude doma" — ThatsALovelyShirt
Tedy: model + inference + coding agent + vyhledávání + MCP servery = lokální ekvivalent Claude.
K výše zmíněnému stacku měl jeden uživatel dotaz na konfiguraci SearXNG — dostával irelevantní výsledky a rate limiting. Rada:
„Většinou držím duckduckgo, wikipedia, github a google scholar, to mi dává skoro všechno, co potřebuji. Když použiješ výchozí konfiguraci s desítkami dalších vyhledávačů, dostaneš spoustu divných výsledků (a rate limiting)." — ThatsALovelyShirt
Tedy omezit počet vyhledávačů v konfiguraci na pár ověřených.
Jednoduchá alternativa: „DeepSeek harness + Qwen 3.8 27b je ta správná cesta." — ComprehensiveRoyal41
Vlákno ukazuje dva důležité poznatky. Za prvé, největší překážka u lokálních modelů často není hardware ani model, ale frontend a konfigurace — a jednoduché řešení (odebrat OpenWebUI, srovnat llama.cpp) znamená rozdíl mezi vzdáním a fungujícím agentem. Za druhé, komunita je v těchto případech neuvěřitelně hodnotná — stačí se zeptat a říct, kde to bolí.
Pokud to dáváš dohromady poprvé: začni s llama.cpp, vezmi Q5_K_S kvantizaci Qwen 3.8 27B, a frontend řeš až poté, co backend běží.
Inspirace: Qwen 3.8 27B, just wanted to say thanks to you guys