Lokální AI server bez grafické karty: co dokáže Ryzen se 128 GB RAM

Ve druhém dílu nám ze srovnání vyšla jako nejzajímavější docela nudná sestava — běžný Ryzen a hodně obyčejné paměti. Teď se podíváme na to, co by na takovém stroji šlo reálně provozovat, jak dlouho by trvala práce se stotisícovým kontextem a proč se nám plán na její pozdější rozšíření rozpadl pod rukama.

Výchozí úvaha

Otázka zněla jednoduše. Proč kupovat drahé GPU, když chceme především:

  • velký model,
  • dlouhý kontext,
  • ochranu firemních dat,
  • jednoho nebo několik málo uživatelů,
  • a nevadí nám čekat několik sekund nebo minut?

Jako základ vyšel Ryzen 9 9900X. Dvanáct jader, dvacet čtyři vláken, integrovaná grafika, dva paměťové kanály. AMD při osazení dvou dual-rank modulů oficiálně podporuje DDR5-5600 a až 256 GB paměti.

K tomu jednoduchá deska B650, NVMe disk, kvalitní vzduchový chladič, několik set wattů zdroje. A žádná dedikovaná grafická karta.

Dvoukanálová DDR5-5600 nabízí teoreticky 89,6 GB/s. Prakticky bude jazykový model využívat méně, ale pořád jde o překvapivě použitelnou hodnotu.

Use-case 1: velký dense model

První možnost je klasický model kolem 70 miliard parametrů v kvantizaci Q4.

Takový model zabere podle architektury přibližně 40 až 50 GB paměti. Ve stodvacetiosmigigabajtovém stroji tedy zbývá dost prostoru na KV cache, dlouhý kontext, operační systém i pracovní buffery.

Kapacita tedy problém není. Rychlost ano.

Na podobném systému se Zen 5 dosahoval 32B dense model v Q4 rychlosti 3,54 tokenu za sekundu a prakticky narážel na propustnost dual-channel DDR5-5600. U 70B modelu proto při čistě procesorové inferenci očekáváme řádově 1 až 2 tokeny za sekundu.

To znamená, že tisícitokenová odpověď může trvat deset až dvacet minut.

Není to příjemný chatbot. Ale pro noční analýzu kódu, druhý názor nad architekturou nebo úlohu, kterou odešlete a mezitím děláte něco jiného, to být přijatelné může.

A co stotisícový kontext?

Tady je potřeba rozlišit dvě věci.

Prefill je fáze, kdy model musí vstupní text přečíst a vytvořit z něj interní stav. Kdybychom posílali celých sto tisíc tokenů při každém dotazu znovu, procesorový server by byl beznadějně pomalý.

Prompt cache to řeší. Pokud aplikace uchová už zpracovaný prefix, není potřeba u každé další otázky přepočítávat celý projekt nebo celou historii konverzace.

Modelová situace: sto tisíc tokenů projektu v cache, nový dotaz o tisíci tokenech, odpověď o tisíci tokenech.

U dense 70B modelu bychom orientačně očekávali:

  • nový prompt: řádově minuty,
  • generování: kolem 1 až 1,5 tokenu za sekundu,
  • odpověď: přibližně 12 až 17 minut,
  • celý cyklus: zhruba 15 až 20 minut.

Jde o technický odhad odvozený z propustnosti, ne o benchmark této konkrétní sestavy.

Pro interaktivní práci to není nic ideálního.

Use-case 2: MoE model

A tady se situace zásadně mění.

Model architektury Mixture-of-Experts může mít osmdesát miliard parametrů celkem, ale pro každý jednotlivý token aktivovat jen tři miliardy. Zbytek modelu leží v paměti a čeká.

Qwen3-Next-80B-A3B má právě 80B parametrů celkem, 3B aktivních, 48 vrstev, hybridní attention a nativní kontext 262 144 tokenů. Je to architektura navržená přímo pro dlouhé kontexty.

Na téměř ideálním referenčním systému — Zen 5, dvanáct jader, 96 GB DDR5-5600, bez grafické karty — dosáhl Qwen3-Coder-Next 80B/3B v Q4 7,74 tokenu za sekundu.

A to nemusí být strop. Autor benchmarku upozorňoval, že tehdejší implementace téhle architektury v llama.cpp nebyla optimální a že podle samotné matematiky propustnosti by potenciál byl výrazně vyšší.

Pro naši sestavu je proto realistické uvažovat řádově 6 až 10 tokenů za sekundu.

U takového modelu by běžná práce se stotisícovým kontextem vypadala takhle:

  • tisíc nových vstupních tokenů: desítky sekund až minuta či dvě,
  • tisíc výstupních tokenů: přibližně 1,5 až 3 minuty,
  • celý dotaz: řádově 2 až 4 minuty.

To už je jiná kategorie použitelnosti.

Není to ChatGPT reagující okamžitě. Ale pro copywriting, analýzu dokumentů, práci s tabulkami, interní znalostní systém, rešerše nad firemními daty nebo kontrolu smluv může být několik minut naprosto v pořádku.

128 GB neznamená „musíme provozovat 120B model“

To je možná nejdůležitější závěr celého dílu.

Smyslem velké paměti není nacpat do ní co největší model. Stomiliardový dense model sice lze silně kvantizovat, ale procesor ho bude generovat tak pomalu, že jeho praktická hodnota bude minimální.

Velká paměť je zajímavější jako prostor pro kombinaci: rozumný model, rozumná kvantizace, velmi dlouhý kontext, velká KV cache a rezerva na další služby.

Jenže rozšiřitelnost, se kterou jsme počítali, nefunguje

Napadlo nás logické řešení. Paměti jsou dnes drahé — tak koupíme desku se čtyřmi sloty, osadíme zatím dva moduly a zbytek dokoupíme, až ceny spadnou.

Narazili jsme hned dvakrát.

Za prvé technicky. Platforma AM5 má dva paměťové kanály a na každý připadají dva sloty. Když osadíte všechny čtyři, musí paměťový řadič procesoru zvládnout dvojnásobnou elektrickou zátěž — a nedokáže to na plné rychlosti. V praxi spadnete z DDR5-6000 někam ke čtyřem tisícům.

A protože propustnost paměti je u jazykových modelů to hlavní úzké hrdlo, znamená to konkrétně tohle:

  • dva moduly na DDR5-6000: zhruba 96 GB/s,
  • čtyři moduly na DDR5-4000: zhruba 64 GB/s.

Dokoupením paměti byste tedy získali kapacitu a ztratili asi třetinu propustnosti. Tedy přesně to, na čem celá tahle sestava stojí.

Za druhé ekonomicky. Celý plán stojí na předpokladu, že si počkáme na levnější paměti. Jenže ceny DDR5 jsou dnes vysoké proto, že výrobci přesměrovali kapacity na paměti pro AI datacentra — a jejich provozovatelé mají výrobu nasmlouvanou na roky dopředu. Analytici z toho odvozují víceletý cyklus, ne dočasný výkyv.

Čekání tedy není strategie. Je to jen odklad rozhodnutí.

Správná cesta k rozšíření proto není přikoupit, ale vyměnit — prodat stávající moduly a koupit dva větší. Ztráta na prodeji použité paměti bude menší než ztráta výkonu ze čtyř osazených slotů.

Je to drobnost, ale dobře ukazuje, proč se hardware nedá vybírat z tabulky. Úvaha byla naprosto rozumná. Platforma i trh se prostě chovají jinak, než by člověk čekal.

Co z toho plyne pro firmy

Lokální AI nemusí znamenat server se čtyřmi profesionálními grafickými kartami. Existuje celé spektrum:

  • GPU workstation — velmi rychlá, ale drahá a omezená kapacitou VRAM. Model se buď vejde, nebo ne.
  • Apple Silicon — vysoká paměťová propustnost a jednoduché řešení, ale vysoká cena za větší paměť.
  • AMD Ryzen AI Max — kompromis mezi kapacitou, propustností a výkonem grafiky.
  • Běžný Ryzen s velkou pamětí — výrazně pomalejší, ale jednoduchý, rozšiřitelný a plně pod vlastní kontrolou. Paměť je dnes ovšem jeho nejdražší součástkou, ne tou nejlevnější.

Pokud chatbot odpovídá zaměstnanci za dvě minuty místo dvou sekund, ale firemní dokumenty přitom nikdy neopustí vlastní infrastrukturu, nemusí být rychlost tím nejdůležitějším parametrem. Někdy je důležitější kapacita, kontrola nad daty a ekonomika celého řešení.

Jenže rychlost nakonec vůbec nebyla ta správná otázka

Celý tenhle díl počítá tokeny za sekundu. Kolik jich model zvládne, jak dlouho bude trvat odpověď, kde je hranice použitelnosti.

Když jsme pak ale modely doopravdy pustili na skutečnou práci, ukázalo se něco, co jsme nečekali.

Zadali jsme čtyřem lokálním modelům stejné úlohy. Nejenže jsme si přečetli, co napsaly — my jsme ten kód skutečně spustili.

Pořadí kvality vyšlo přesně opačně než pořadí rychlosti.

Ve čtvrtém dílu ukážeme konkrétní čísla i to, proč se chyba, kterou při čtení očima nepoznáte, projeví až u reálných dat.

Chcete AI, která nepustí data z firmy?

Otevřené modely na vlastním serveru stavíme klientům nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.

Souvisí: Ve druhém dílu jsme porovnávali platformy — Mac, AMD nebo klasické PC? — a vysvětlili, proč u lokální AI rozhoduje propustnost paměti.

Držíme vás na první pozici. Teď i s AI. 💚

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet