Lokální LLM

Seriál o tom, jak dnes vypadá provoz jazykových modelů mimo velké cloudy — a co z toho dává smysl pro běžnou firmu. Začínáme u křemíku a končíme u konkrétní volby hardwaru.

Proč to řešíme: u klientů, kteří nechtějí posílat firemní data do cizích cloudů, stavíme AI na jejich vlastních serverech. Otázka „co na to koupit“ pak přijde vždycky — a odpověď není tak přímočará, jak se zdá.

Díly seriálu

  • Díl 1AI model vypálený přímo do čipu? Startup Taalas obětoval univerzálnost a hlásí 17 000 tokenů za sekundu. Co to říká o tom, kde se v AI ztrácí výkon.
  • Díl 2Mac, AMD nebo klasické PC? U lokální AI je často důležitější paměť než procesor. Porovnáváme Mac mini, Mac Studio, AMD Ryzen AI Max a klasické PC se 128 GB DDR5.
  • Díl 3Lokální AI server bez grafické karty Co by na běžném Ryzenu se 128 GB RAM reálně běželo, jak dlouho trvá stotisícový kontext a proč se plán „dokoupíme paměť později“ rozpadl.
  • Díl 4Vypadá správně. Nefunguje. Čtrnáct lokálních modelů dostalo programátorské úlohy a jejich kód jsme spustili proti reálným datům. Validaci IČO zvládly dva.
  • Díl 5Připravujeme.

V této sekci 4

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet