Pomůže větší model? Nacpali jsme do 62 GB největší, které se vejdou. Prohrály.

V minulém dílu si toho všiml každý: model o 122 miliardách parametrů skončil jako agent na 3 z 8, zatímco osmnáctigigabajtová gemma na 7 z 8. Tak jsme to prověřili napříč všemi sadami z předchozích dílů a přidali patnáct otázek s jednoznačnou odpovědí, na kterých si čeština vybírá daň. Velikost pomohla přesně ve dvou disciplínách. A české řazení podle abecedy nedal nikdo.

Pomůže větší model? Do 62 GB jsme nacpali ty největší. Prohrály.

Na čem se měřilo

Stejný server jako v pátém a šestém dílu: 62 GB RAM, 24 virtuálních jader Intel Xeon, bez grafické karty. Teplota 0, přemýšlení vypnuté.

Nejdřív: co se vůbec vejde

Otázka zněla jednoduše. Vejde se do 62 GB něco „velkého a chytrého“, co malé modely překoná?

V kvantizaci Q4, která je rozumným kompromisem mezi velikostí a kvalitou, se do stroje nevejde skoro nic velkého. Qwen3.5-122B má v Q4 81 GB. Nemotron-3-Super 87 GB. Mistral-Medium-3.5 se 128 miliardami parametrů je dense a má 80 GB.

Aby se velké modely vešly, museli jsme sáhnout po agresivnější kvantizaci — tříbitové varianty místo čtyřbitových. Tím se vešly tři:

Model Kvantizace Velikost
qwen3-next:80b-a3bQ450 GB
Qwen3.5-122B-A10BIQ3_S46,6 GB
Mistral-Small-4-119BQ3_K_S49,6 GB

Dva další (GLM-4.5-Air, Nemotron-3-Super) by se vešly taky, ale jejich soubory jsou rozdělené na části a Ollama takové stahování z registru zatím nepodporuje. Řešení existuje — stáhnout části ručně a spojit — ale prakticky to vyřazuje většinu kvantizací nad 50 GB.

A ještě jedna past, kterou stojí za to znát: při ručním vytváření modelu z blobu si Ollama vyžádá dvojnásobek místa a původní blob zůstane osiřelý. U 46GB modelu to znamená dočasně 92 GB a po ověření ruční úklid. Síť přitom dala 230 MB/s — 150 GB modelů se stáhlo za 17 minut. Disk byl větší omezení než linka.

Velké modely proti gemmě

Tři velké modely, jeden malý, všechny sady z předchozích dílů: mini-úlohy a hra v prohlížeči ze čtvrtého, rychlosti z pátého, agent ze šestého a nová těžká sada, kterou popisujeme níž.

qwen3-next 80B Qwen3.5 122B Mistral 119B gemma4 26B
velikost50 GB46 GB50 GB18 GB
RAM při 49k kontextu51 GB48 GB51 GB18 GB
rychlost generování8,1 t/s3,0 t/s5,3 t/s8,6 t/s
prefill 1,4k tokenů53 t/s20 t/s34 t/s77 t/s
mini-úlohy napoprvé7/86/85/85/8
mini-úlohy nakonec7/87/86/87/8
těžká sada (15 otázek)9/158/158/1511/15
hra v prohlížeči12/16——11/16
agent (8 scénářů)2/83/83/87/8

Žádný velký model v ničem podstatném nevyhrál.

Model o 122 miliardách parametrů, který zabral 48 GB paměti a jel tři tokeny za sekundu, odvedl horší práci než osmnáctigigabajtová gemma prakticky ve všem kromě jedné úlohy.

Víc paměti, méně výsledků: qwen3-next 80B 51 GB, 8,1 t/s, 9/15 otázek, agent 2/8; Qwen3.5-122B 48 GB, 3,0 t/s, 8/15, 3/8; Mistral 119B 51 GB, 5,3 t/s, 8/15, 3/8; gemma4 26B 18 GB, 8,6 t/s, 11/15, 7/8

Kde se velikost přece jen projevila

Byly přesně dvě disciplíny.

Parsování českých částek. Úloha: rozpoznat „1 234,56 Kč“, „234,- Kč“, „1 234 567,89“ i záporné hodnoty. Model 122B to dal na 12 z 12 napoprvé. Gemma potřebovala dvě opravná kola s neúspěšnými testy. Cloudový model velké evropské serverovny, o kterém píšeme od druhého dílu, zůstal na 10 z 12 i po třech kolech. Tady velikost pomohla jednoznačně.

Algoritmické mini-úlohy. qwen3-next s 80 miliardami parametrů dal 7 z 8 napoprvé — nejlepší výsledek ze všech čtrnácti modelů, které prošly čtvrtým dílem. A protože má jen 3 miliardy aktivních parametrů, běží rychlostí malého modelu. Je to jediný velký model, u kterého velikost nestála rychlost.

A pak Mistral. Jako jediný napsal validaci IČO správně napoprvé — 11 z 11. Jinak ale dopadl podprůměrně: Univerzitu Karlovu datoval do roku 863, Bertrandův paradox zaměnil za Monty Halla a na otázku na den v týdnu odpověděl „Použiji nástroj pro výpočet dne v týdnu“ — a žádný nástroj nezavolal, protože žádný neměl.

Naopak jako agenti selhaly všechny tři velké modely. Ze stejného důvodu, který jsme popsali v minulém dílu: e-maily píší místo toho, aby je poslaly.

Agent, 8 scénářů: Qwen3.5-122B (122 mld. parametrů, 48 GB) 3 z 8, gemma4 26B (čtyřikrát menší, 18 GB) 7 z 8. Velké modely jako agenti selhaly — e-maily napíší, místo aby je poslaly.

Patnáct otázek s jednoznačnou odpovědí

Aby se dalo měřit, jestli velikost pomáhá s jazykem a uvažováním, napsali jsme patnáct otázek, které mají jedinou správnou odpověď. Přemýšlení vypnuté, limit 120 tokenů, instrukce „odpověz jen výsledkem“. Hodnocení přísné: u číselných otázek musí být výsledek v prvních 40 znacích — jinak model vykládá a číslo v textu sedí náhodou.

Otázka Správně gemma 26B qwen3.6 35B qwen3-next 80B Qwen3.5 122B Mistral 119B
české řazení (ch za h)cibule, čaj, hrad, chata✗✗✗✗✗
Bertrandovy krabice2/3✓✗✗✗✗
nuly na konci 25!6✓✓✓✓✓
1. 1. 2000sobota✓✓✓✓✗
12 100 vč. DPH → základ / DPH10 000 / 2 100✓✗✗✓✓
slovní úloha: věk syna12✓✓✓✓✓
samohlásky ve slově13✗ (15)✓✗ (14)✗ (14)✗ (10)
kůň, 7. pád mn. č.koňmi✗ koní✓✗ kůňmi✗ koňích✗ Koněmi
ruka, 2. pád mn. č.rukou✓✓✓✓✓
„mít pod čepicí“být chytrý✓✗ tajit✓✗ opilý✗ opilý
„raining cats and dogs“lije jako z konve✗1✓✓✓✓
sídlo Kraje VysočinaJihlava✓✓✓✓✓
založení Univerzity Karlovy1348✓✓✓✓✗ (863)
středa + 100 dnípátek✓✓✓✗ po✓
5 strojů, 5 výrobků, 5 minut → 100/1005 minut✓✗2✗2✗2✓
celkem11/1510/159/158/158/15

1 Gemma přeložila jako „Lije jako ze šlepačic“ — slovo, které neexistuje.
2 Model místo výsledku spustil výklad a do 120 tokenů se k číslu nedostal.

Vyhrál nejmenší model. Gemma za 18 GB dala 11 z 15. Model za 48 GB dal 8 z 15 — a nejhůř dopadl právě na českých specifikách.

Nejmenší model vyhrál: 15 otázek s jednoznačnou odpovědí — gemma 26B 11, qwen3.6 35B 10, qwen3-next 80B 9, Qwen3.5-122B 8, Mistral 119B 8. Mistral datoval Univerzitu Karlovu do roku 863, dva velké modely si myslí, že „mít pod čepicí“ znamená být opilý.

České řazení nedal ani jeden

Otázka zněla: seřaď abecedně chata, čaj, hrad, cibule.

Správně je cibule, čaj, hrad, chata. V češtině je „ch“ samostatné písmeno, které se řadí až za „h“. Každý český slovník to tak má. Každá česká databáze s nastaveným collation to tak řadí.

Všech pět modelů řadilo podle Unicode nebo podle anglických pravidel — „chata“ dali hned za „cibule“, protože obě začínají na „c“.

„Ch“ patří za „h“. Žádný model to neví: všech 5 modelů seřadilo cibule, chata, čaj, hrad; správně je cibule, čaj, hrad, chata. Výstup vypadá seřazeně, takže si chyby nikdo nevšimne — řazení nad českými daty dělejte mimo model.

Tohle není akademická drobnost. Pokud lokální model třídí seznam klientů, produktů nebo faktur, seřadí ho špatně. A protože výstup vypadá seřazeně, nikdo si toho nevšimne.

Velikost modelu nekoreluje s užitečností

To je hlavní závěr tohohle dílu. A jde proti výchozí úvaze druhého a třetího dílu, kde jsme velkou paměť brali především jako cestu k velkému modelu.

Data říkají něco jiného. Velký model v tříbitové kvantizaci:

  • zabere dvaapůlkrát víc paměti,
  • běží třikrát pomaleji,
  • zpracovává vstup čtyřikrát pomaleji,
  • a v kódu, jazyce i agentních úlohách skončí pod modelem s pětinou parametrů.

Část toho může jít na vrub kvantizace — tříbitová verze ztrácí víc než čtyřbitová. Ověřit to nejde, protože čtyřbitová verze 122B má 81 GB a do stroje se nevejde.

A to je právě ta pointa: na stroji s 62 GB si velký model nevyberete v dobré kvantizaci. Buď ho vezmete ořezaný, nebo ho nevezmete vůbec. A ořezaný prohraje s malým modelem, který se vešel celý.

Velká paměť má smysl. Ale ne kvůli velkému modelu — kvůli dlouhému kontextu, velké cache a MoE architektuře, ze které se pro každý token používá zlomek. Tuhle hypotézu jsme vyslovili na konci třetího dílu. Tenhle díl ji potvrdil.

Co z toho plyne pro firmy

Když někdo nabízí lokální AI a argumentuje velikostí modelu, je to špatné měřítko. Správná otázka nezní „kolik má miliard parametrů“, ale:

  • jaká je architektura — MoE se 3–4 miliardami aktivních parametrů běží na procesoru čtyřikrát rychleji než dense model stejné velikosti,
  • v jaké kvantizaci se vejde do vašeho stroje — a jestli v ní ještě funguje,
  • jak dopadl na vaší konkrétní úloze — ne na anglickém benchmarku výrobce.

A ještě jedna věc specificky pro český trh: žádný model, který jsme testovali, nezvládá české řazení. Kdo nasazuje lokální AI nad českými daty, musí řazení dělat mimo model. Stejně jako aritmetiku. Stejně jako validace.

Neptejte se, kolik má miliard parametrů. Ptejte se: jaká je architektura (MoE se 3–4 mld. aktivních parametrů běží na CPU 4× rychleji), v jaké kvantizaci se vejde a jestli v ní ještě funguje, a jak dopadl na vaší úloze — ne na anglickém benchmarku výrobce.

A co se stane, když agenta pustíte mezi lidi?

Tenhle díl ukázal, že velký model na 62 GB nedává smysl. Ale zatím jsme agenta testovali v přátelském prostředí — zákazníci psali slušně a nikdo se ho nesnažil oklamat.

Tak jsme to změnili. Dali jsme vítěznému modelu kalkulačku jako nástroj a změřili, jestli to opraví tu jedinou chybu ze šestého dílu. Zkusili jsme vynutit volání nástrojů přes pevné schéma. A pak jsme agentovi poslali osm e-mailů, ve kterých se ho někdo snažil zmanipulovat.

Jeden z těch útoků prošel u všech modelů.

V osmém dílu ukážeme, co agentovi musí být v kódu, a ne v promptu — a proč pořadí odolnosti vyšlo přesně opačně než pořadí v přátelském testu.

Celý díl ve zkratce — 31 sekund:

Chcete AI, která nepustí data z firmy?

Otevřené modely na vlastním serveru stavíme klientům nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Výběr modelu přitom děláme podle vaší úlohy, ne podle počtu parametrů. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.

Souvisí: V šestém dílu jsme nechali dvanáct modelů obsluhovat pronájem dodávky — Dokáže lokální AI řídit oddělení? A v pátém jsme změřili, proč na procesoru nepomůže víc jader.

Držíme vás na první pozici. Teď i s AI. 💚

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet