Lokální LLM
Seriál o tom, jak dnes vypadá provoz jazykových modelů mimo velké cloudy — a co z toho dává smysl pro běžnou firmu. Deset dílů, tři stroje, stovky měření: od čipu s vypáleným modelem přes rychlost, kód, češtinu a agenty až po evropskou serverovnu. Závěrečný díl to shrnuje do jedné tabulky.
Proč to řešíme: u klientů, kteří nechtějí posílat firemní data do cizích cloudů, stavíme AI na jejich vlastních serverech. Otázka „co na to koupit“ pak přijde vždycky — a odpověď není tak přímočará, jak se zdá.
Díly seriálu
- Díl 1 — AI model vypálený přímo do čipu? Startup Taalas obětoval univerzálnost a hlásí 17 000 tokenů za sekundu. Co to říká o tom, kde se v AI ztrácí výkon.
- Díl 2 — Mac, AMD nebo klasické PC? U lokální AI je často důležitější paměť než procesor. Porovnáváme Mac mini, Mac Studio, AMD Ryzen AI Max a klasické PC se 128 GB DDR5.
- Díl 3 — Lokální AI server bez grafické karty Co by na běžném Ryzenu se 128 GB RAM reálně běželo, jak dlouho trvá stotisícový kontext a proč se plán „dokoupíme paměť později“ rozpadl.
- Díl 4 — Vypadá správně. Nefunguje. Čtrnáct lokálních modelů dostalo programátorské úlohy a jejich kód jsme spustili proti reálným datům. Validaci IČO zvládly dva.
- Díl 5 — Víc jader nepomůže. O polovinu víc výkonu zrychlilo modely o sedm procent. Změřili jsme propustnost paměti, dvanáct modelů, sweep vláken a tři pasti kolem přemýšlení.
- Díl 6 — Dokáže lokální AI řídit oddělení? Dvanáct modelů obsluhovalo pronájem dodávky — e-maily, rezervace, spam, eskalace. Vyhrál jeden, a jeho jediná chyba ukazuje, co nesmí počítat model.
- Díl 7 — Pomůže větší model? Do 62 GB jsme nacpali tři největší modely, které se vejdou. Prohrály s gemmou za 18 GB — a české řazení podle abecedy nedal ani jeden.
- Díl 8 — Agent před nasazením Kalkulačka, vynucené schéma a osm e-mailů s pokusem o manipulaci. Jeden řádek v patičce prošel u všech modelů.
- Díl 9 — Evropské mezipatro Velké modely v evropské serverovně: dlouhý dokument za minutu, ale nástroje napůl a noční fronta až čtyři minuty.
- Díl 10 — Co na lokální AI server skutečně nasadit Závěr seriálu: který model na jakou úlohu, sedm vět z měření a jak nás data devětkrát opravila.