Deset dílů, tři stroje, stovky měření. Co na lokální AI server skutečně nasadit

Začali jsme čipem, do kterého je model vypálený natvrdo. Skončili jsme u agenta, kterého přemluvil jeden řádek v patičce e-mailu. Mezi tím jsme změřili rychlost, kód, češtinu, agenty, velké modely i evropskou serverovnu. Tady je všechno v jedné tabulce — co nasadit, na jakou úlohu a co k tomu musí být v kódu.

Deset dílů. Jedna tabulka. Tři stroje, stovky měření — co na lokální AI server skutečně nasadit a co k tomu musí být v kódu.

Na čem stojí závěry

Série běžela na třech strojích a je potřeba je držet odděleně:

  • Ryzen 9 se 128 GB (díly 2–3) — hypotetická sestava, spočítaná, nekoupená,
  • VPS s 32 GB a 16 vlákny (srpen) — první měření kódu a nástrojů,
  • server s 62 GB a 24 virtuálními jádry (září, díly 4–8) — čtrnáct modelů, čtyři testovací sady, všechno skriptované.

Tabulky v tomhle dílu jsou ze zářijového serveru, pokud není uvedeno jinak. Grafická karta nebyla nikde.

Co na takový stroj nasadit

Úloha Model Proč
agent řídící proces — e-maily, rezervacegemma4:26b-a4b7/8, s kalkulačkou 8/8; jediný bez halucinované akce; prefill 77 t/s
kód — webové aplikaceqwen3.6:35b-a3b-codinghra 13/16 napoprvé, mini-úlohy nakonec 8/8
kód — krátká logika, rychleLaguna XS 2.1mini-úlohy 8/8 za 3,7 min, IČO 11/11 za 21 s, 15,7 t/s
kód — druhý názornorth-mini-code-1.0hra 15/16 po jedné iteraci
algoritmy napoprvéqwen3-next:80b-a3bmini-úlohy 7/8 napoprvé, přitom 8 t/s
nástroje + čtení obrázkůmuse-glimmer:30b-dflashnástroje 6/6, čte obrázky — ale 3 t/s
český chatgemma4:26b-a4b11/15 znalostních otázek, 8,6 t/s
dlouhé dokumenty, noční dávkyevropské mezipatro147 tisíc tokenů za minutu; fronta až 4,5 min; bez záruk
Model podle úlohy, ne podle žebříčku: agent řídící proces gemma4:26b, kód pro webové aplikace qwen3.6:35b-coding, rychlá krátká logika Laguna XS 2.1, druhý názor na kód north-mini-code, algoritmy napoprvé qwen3-next:80b, nástroje a obrázky muse-glimmer:30b, český chat gemma4:26b, dlouhé dokumenty v noci evropské mezipatro.

Všimněte si, že v tabulce není jeden „nejlepší model“. Laguna je nejrychlejší, má nejlepší kód a nejvíc odolala manipulaci — a v češtině dala 5 z 15, nejhorší výsledek série. Gemma je nejlepší agent a nejlepší v češtině — a podlehla třem pokusům o manipulaci z osmi.

Model se vybírá pro úlohu, ne podle žebříčku. Kdo chce jeden model na všechno, vybere špatně pokaždé.

Kdo chce jeden model na všechno, vybere špatně. Laguna: nejrychlejší, nejlepší kód, odolala 7 z 8 útoků — ale čeština 5 z 15. Gemma4: nejlepší agent, nejlepší čeština, bez vymyšlené akce — ale podlehla 3 z 8 útoků.

Jedno měření, které v sérii ještě nezaznělo: prefix cache

V pátém dílu jsme napsali, že jedinou pákou na pomalé čtení zadání je prefix cache. Od té doby to máme změřené:

  • stabilní začátek promptu ušetří 45 sekund na každém tahu — prefill klesne z 45,6 na 0,8 s,
  • účinnost je vlastnost modelu: gemma zrychlila 57×, Laguna 51×, qwen3.6 s MTP jen 1,9×,
  • jakákoli změna na začátku promptu cache zahodí; návrat k původnímu ji obnoví,
  • past: Ollama hlásí plný počet zpracovaných tokenů i při zásahu cache. Poznat to jde jen podle času.

Pro agenty s dlouhým systémovým promptem je to rozdíl mezi použitelným a nepoužitelným. A zase to není vlastnost hardwaru ani konfigurace — je to vlastnost konkrétního modelu.

Stabilní začátek promptu ušetří 45 sekund na tah: čtení zadání z 45,6 s na 0,8 s. Zrychlení: gemma4 57×, Laguna 51×, qwen3.6 1,9×. Pozor, Ollama hlásí plný počet tokenů i při zásahu cache — poznáte to jen podle času.

Sedm vět, které si z měření odnášíme

  1. Na procesoru rozhoduje architektura, ne počet parametrů. MoE se 3–4 miliardami aktivních parametrů běží 3–4× rychleji než dense model stejné velikosti na disku.
  2. Víc jader nepomůže. Strop je propustnost paměti. Generování je nasycené u osmi vláken, nad šestnáct klesá.
  3. Úzké hrdlo agentů je čtení zadání, ne psaní odpovědi. Osm tisíc tokenů systémového promptu je podle modelu 100 sekund, nebo sedm minut na tah. A pomůže jen prefix cache — pokud ji model umí využít.
  4. Přemýšlení je na procesoru luxus. Rozpočet 6 000 tokenů se prouvažuje beze zbytku a bez výsledku.
  5. Velikost modelu nekoreluje s užitečností. Modely o 119 a 122 miliardách parametrů prohrály s 26B modelem v češtině i jako agenti a v kódu ho nepředběhly o víc než jednu úlohu.
  6. U agentů se dnes neláme „umí zavolat nástroj“, ale „zavolá ho, i když může jen odpovědět“. A nejlépe poslouchající model nejlépe poslouchá i útočníka.
  7. Čísla, validace, řazení a limity patří do kódu, ne do modelu. Součet tří čísel spletl i vítěz. Validaci IČO napsaly správně 2 ze 14. České řazení nedal nikdo. Útok v patičce e-mailu prošel u všech. Kalkulačka jako nástroj opravila první chybu za jedno odpoledne; limit v kódu nástroje by zastavil tu poslední.

Jak se série sama opravovala

Tohle je podle nás nejcennější výsledek celé práce — cennější než kterékoli číslo:

Díl Rozumná hypotéza Co ukázalo měření
1specializovaný čip je prostě rychlejšírychlost se koupila obětováním univerzálnosti
2rozhoduje výkon procesoru a grafikyrozhoduje propustnost paměti
3paměť dokoupíme, až zlevníčtyři moduly vezmou třetinu propustnosti; zlevnění jen tak nepřijde
4pomalejší model píše lepší kóds testy a zpětnou vazbou to neplatí
5víc jader = víc rychlosti+50 % jader = +7 % rychlosti
6stačí model, který umí volat nástrojeumí to všichni; rozdíl je, jestli ho zavolají
7větší model = chytřejší model122B prohrál s 26B skoro ve všem
8nejlepší agent je nejbezpečnějšípořadí odolnosti vyšlo obráceně
9evropský cloud = kompromisní kvalitajiná silná stránka (kontext), jiná slabina (fronta, nástroje)

Devětkrát byla první úvaha rozumná. Devětkrát ji data opravila.

Devětkrát rozumná úvaha, devětkrát ji data opravila: od „čip je prostě rychlejší“ po „evropský cloud = horší kvalita“ — rozhoduje propustnost paměti, +50 % jader dá +7 % rychlosti, 122B prohrál s 26B skoro ve všem, pořadí odolnosti vyšlo obráceně.

A dvakrát jsme opravovali sami sebe. Čtvrtý díl přepsal závěr srpnového měření. Sedmý potvrdil hypotézu ze třetího a zároveň vyvrátil tu z druhého. Kdo rozhoduje o AI podle prvního dojmu, rozhoduje podle hypotézy, která se ve většině případů ukáže jako neúplná.

Trh se hýbe rychleji než měření

Ještě v srpnu zvládl spolehlivě volat nástroje jediný model, který jsme testovali. V září to dávaly tři nejlepší bez chyby. Model v evropském mezipatře se během našeho měření vyměnil. Ceny pamětí jsou mezitím na historickém maximu.

K 19. září přibyl v Ollamě za celý týden jediný nový model — a ten běží jen v cloudu. Dva další, které by se na náš stroj vešly, jsme zatím netestovali: ornith-1.5:35b (23 GB) a granite4.2:30b (18 GB).

Tabulka nahoře je tedy snímek. Za tři měsíce bude část jejích řádků jinak. Metoda ne: stejné úlohy, testy napsané dřív než výstupy, spuštění místo čtení a pojistky v kódu místo instrukcí v promptu.

Co z toho plyne pro firmy

Lokální AI na serveru bez grafické karty dnes funguje. Ne jako univerzální náhrada ChatGPT, ale jako nástroj na ohraničené úlohy nad firemními daty — tam, kde je důležitější, že data neopustí firmu, než že odpověď přijde za sekundu.

Aby fungovala, musí se udělat čtyři věci, které se nedají koupit s hardwarem:

  1. Vybrat model podle úlohy — a změřit ho na vlastních datech, ne na anglickém benchmarku výrobce.
  2. Nastavit ho — architektura, přemýšlení, cache. Rozdíl mezi špatně a dobře nastaveným strojem je rozdíl mezi sekundou a pěti minutami.
  3. Obalit ho kódem — kalkulačka, validace, řazení, limity. Model rozhoduje, nástroj počítá, kód hlídá.
  4. Nechat člověka schvalovat všechno, co firmu zavazuje.
Čtyři věci, které se nekoupí s hardwarem: vybrat model podle úlohy a změřit ho na vlastních datech, nastavit ho (architektura, přemýšlení, cache), obalit ho kódem (kalkulačka, validace, řazení, limity) a nechat člověka schvalovat vše, co firmu zavazuje.

Přesně tohle děláme u každého nasazení. Neptáme se „jaký model je nejlepší“, ale „na co tenhle stačí a co k němu musí být“. Deset dílů je záznam toho, jak k té odpovědi docházíme.

Celý seriál ve zkratce — 48 sekund:

Chcete AI, která nepustí data z firmy?

Otevřené modely na vlastním serveru stavíme klientům nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Model vybíráme podle vaší úlohy, změříme ho na vašich datech a pojistky dáváme do kódu. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.

Celý seriál: všech deset dílů najdete v rozcestníku Lokální LLM. Začíná se čipem s vypáleným modelem.

Držíme vás na první pozici. Teď i s AI. 💚

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet