Lokální LLM
Seriál o tom, jak dnes vypadá provoz jazykových modelů mimo velké cloudy — a co z toho dává smysl pro běžnou firmu. Začínáme u křemíku a končíme u konkrétní volby hardwaru.
Proč to řešíme: u klientů, kteří nechtějí posílat firemní data do cizích cloudů, stavíme AI na jejich vlastních serverech. Otázka „co na to koupit“ pak přijde vždycky — a odpověď není tak přímočará, jak se zdá.
Díly seriálu
- Díl 1 — AI model vypálený přímo do čipu? Startup Taalas obětoval univerzálnost a hlásí 17 000 tokenů za sekundu. Co to říká o tom, kde se v AI ztrácí výkon.
- Díl 2 — Mac, AMD nebo klasické PC? U lokální AI je často důležitější paměť než procesor. Porovnáváme Mac mini, Mac Studio, AMD Ryzen AI Max a klasické PC se 128 GB DDR5.
- Díl 3 — Lokální AI server bez grafické karty Co by na běžném Ryzenu se 128 GB RAM reálně běželo, jak dlouho trvá stotisícový kontext a proč se plán „dokoupíme paměť později“ rozpadl.
- Díl 4 — Vypadá správně. Nefunguje. Čtrnáct lokálních modelů dostalo programátorské úlohy a jejich kód jsme spustili proti reálným datům. Validaci IČO zvládly dva.
- Díl 5 — Připravujeme.