Evropské mezipatro: co umí AI v cizí serverovně, když data nemají opustit Evropu
Osm dílů jsme drželi jeden předpoklad: data neopustí firmu. Mezitím vzniká třetí cesta mezi vlastním železem a americkým cloudem — evropská serverovna, která provozuje velké modely na vlastním hardwaru. Změřili jsme ji na stejných úlohách jako lokální modely a přes noc sledovali frontu. Umí něco, co náš stroj nezvládne. A propadla tam, kde bychom to nečekali.
Co to je
Ve druhém dílu jsme o „velké evropské serverovně“ psali bez jména, protože měření ještě běželo. Teď už ho říct můžeme: německý Hetzner, jeden z největších evropských provozovatelů serverů, spustil v rámci svého programu Experiments inferenční API. Je kompatibilní s rozhraním OpenAI, takže se do existujících nástrojů připojí změnou jedné adresy. A je zatím zdarma.
V srpnu na něm běžel jediný model: Qwen3.6-35B-A3B v přesnosti FP8. Jde o MoE architekturu s 35 miliardami parametrů celkem a 3 miliardami aktivních, s kontextem 262 144 tokenů, na text i obraz. V září už jsme na stejné adrese měřili Qwen3.8-27B. Model se během experimentu vyměnil. U experimentální služby je to v pořádku — a zároveň je to první věc, kterou si musí uvědomit každý, kdo by na ní chtěl něco stavět.
Limity na jeden klíč: 3 miliony vstupních a 60 tisíc výstupních tokenů za minutu, 500 milionů a 5 milionů za den.
Co o tom říká sám Hetzner
Podstatnější než technické parametry je, jak službu popisuje provozovatel:
- experimentální, poskytovaná „tak, jak je“, bez SLA a bez garance výkonu,
- bez záloh,
- výslovně nedoporučená pro produkční nasazení,
- kvalita odpovědí podle jejich vlastních slov pravděpodobně nebude na úrovni velkých poskytovatelů.
Hetzner otevřeně píše, proč to dělá: chce vědět, jak řešení škáluje a jestli je o takovou službu zájem. Uživatele vyzývá, ať testují limity.
To je poctivé. A tak jsme je testovali.
Kde to fyzicky běží
Dokumentace lokalitu neuvádí. Hetzner má datacentra v Německu, Finsku, USA a Singapuru.
Změřili jsme si to sami — pingem a podle IP adresy. Vyšel Norimberk.
Je potřeba to číst přesně: je to pozorování v jednom okamžiku, ne závazek poskytovatele. Neříká nic o tom, kde by běžel failover nebo budoucí rozšíření kapacity, a Hetzner nikde neslibuje, že to tam zůstane. U experimentu to ani slíbit nemůže.
Bereme to jako ukázku, že takhle postavená služba je technicky možná. Ne jako záruku, na které by šlo stavět rozhodnutí o citlivých datech.
Co se děje s obsahem dotazů
V oficiální dokumentaci jsme nenašli, jestli a jak Hetzner ukládá obsah požadavků a odpovědí. Komunitní nástroj třetí strany uvádí, že se ukládají jen metadata o využití — to ale není zdroj, na který bychom se mohli odvolat.
Veřejně doložené to není. Dokud nebude, nepovažujeme to za službu pro citlivá data.
Kde mezipatro vyhrává: dlouhý kontext
Tohle je jeho skutečná silná stránka — a jiná, než jsme čekali.
Čekali jsme kompromis: o něco lepší model než lokální, o něco horší než špičkový cloud. Ve skutečnosti je rozdíl hlavně jinde, ve zpracování dlouhého vstupu.
Na našem stroji je prefill úzké hrdlo. Nejlepší model z pátého dílu zpracuje kolem 77 tokenů za sekundu. Stotisícový dokument je pro něj práce na dlouhé desítky minut, s většími modely prakticky nemožnost. Čekání na dlouhý kontext jsme odhadovali už ve třetím dílu a realita ho potvrdila.
Mezipatro zpracovalo 147 tisíc tokenů za minutu.
Celá smlouva, celá dokumentace projektu, celý rok e-mailové komunikace s klientem. To, co lokálně nejde vůbec, tady trvá minutu.
Obstálo i ve čtení obrázků: ze syntetické faktury vytěžilo správně 9 z 9 položek.
Kde propadlo: nástroje
A pak přišlo volání nástrojů.
V srpnu jsme stejné sadě šesti scénářů podrobili lokální modely i mezipatro, tehdy ještě se srpnovým modelem Qwen3.6. Model v cloudu halucinoval volání v polovině případů — tvrdil, že něco udělal, a nezavolal nic. Přesně ten typ chyby, který jsme v šestém dílu popsali jako nejnebezpečnější.
Pro srovnání: v září, o pár týdnů později, dávaly tři nejlepší lokální modely na stejné sadě 6 z 6.
Stejné úlohy, přímé srovnání
V září jsme mezipatro pustili do stejné sady osmi programátorských mini-úloh jako čtrnáct lokálních modelů ve čtvrtém dílu:
| Napoprvé | Nakonec | Čas | |
|---|---|---|---|
| mezipatro (Qwen3.8-27B) | 6/8 | 6/8 | 2 min |
| nejlepší lokální napoprvé | 7/8 | 7/8 | 5 min |
| nejlepší lokální nakonec | 6/8 | 8/8 | 9 min |
Mezipatro bylo nejrychlejší — dvě minuty na celou sadu. Ale z opravných kol nevytěžilo nic. Co nedalo napoprvé, nedalo ani po zpětné vazbě. Zbyly mu chyby v parsování českých částek a ve validaci IČO, tedy v úlohách, na kterých padaly i lokální modely.
Rychlost ano. Chytřejší ne.
Fronta: kdy na odpověď čekáte čtyři minuty
Nejdůležitější měření přišlo až přes noc. Cron posílal stejný dotaz dvakrát za hodinu a měřil čekání na první token.
Noc 17./18. 8., 18 vzorků, časy UTC (u nás o dvě hodiny víc):
| Hodina (UTC) | Medián | Maximum |
|---|---|---|
| 20:00 | 38 s | 53 s |
| 21:00 | 60 s | 73 s |
| 22:00 | 93 s | 97 s |
| 23:00 | 7 s | 14 s |
| 00:00 | 142 s | 272 s |
| 01:00 | 230 s | 263 s |
| 02:00 | 210 s | 218 s |
| 03:00 | 245 s | 252 s |
| 04:00 | 163 s | 176 s |
Celkový medián 123 sekund. Rozsah od půl sekundy po čtyři a půl minuty.
Všech 18 požadavků prošlo. Není to nestabilita, je to fronta. Nejhorší okno 01:00–04:00 UTC odpovídá večernímu provozu v USA. A hodnota ve 23:00 ukazuje, že křivka není hladká: fronta se občas na chvíli protrhne.
Českou pracovní dobu, tedy 6:00–15:00 UTC, zatím proměřenou nemáme. Právě toto okno rozhodne, jestli je mezipatro použitelné pro firmu přes den. Do té doby platí jen noční závěr.
S frontou v řádu minut je mezipatro nástroj na dávky, ne na nic interaktivního. Pošlete zadání, jdete dělat něco jiného, výsledek si vyzvednete. Stejná kategorie použití jako lokální server bez grafické karty — jen s podstatně delším kontextem.
Tři patra
Série zatím jela na ose „vlastní železo, nebo cloud“. Po tomhle měření vidíme tři patra:
| Patro | Dlouhý kontext | Nástroje | Čekání | Data |
|---|---|---|---|---|
| vlastní server | pomalé čtení, u dlouhých dokumentů desítky minut | nejlepší lokální 6/6 | vždy stejné, bez fronty | pod vaší kontrolou |
| evropské mezipatro | 147 tisíc tokenů za minutu | halucinace v polovině případů | 0,5 s až 4,5 min | v Norimberku, bez záruky |
| špičkový cloud | nejrychlejší | nejspolehlivější | sekundy | u amerického poskytovatele |
Žádné patro nevyhrává všechno. A to je podstatné: u jednoho klienta můžou běžet dvě patra vedle sebe. Agent obsluhující procesy na vlastním serveru, kde se spoléhá na nástroje. Noční analýza dlouhých dokumentů v mezipatře, kde se spoléhá na kontext.
Proč to zatím není řešení — a proč nás to přesto mění
Dnes bychom mezipatro klientovi do provozu nedoporučili. Sám provozovatel ho do produkce nedoporučuje. Model se mění bez ohlášení. Ceník neexistuje, takže nejde spočítat ekonomiku. A u nástrojů propadlo přesně tam, kde je chyba nejdražší.
Ale mění nám pohled na rozhodování. Ještě před rokem byla volba binární: buď si postavíte vlastní server a přijmete jeho limity, nebo pošlete data za oceán. Teď vzniká patro, které umí věc, kterou vlastní server neumí, na hardwaru v Evropě.
Zatím jako experiment bez záruk. Až se to sejde s ceníkem, smlouvou a stabilním modelem, bude to patro, které dnes chybí. A je lepší ho mít změřené dřív, než přijde.
Co z celé série plyne
Devět dílů. Taalas, paměť, procesor, kód, rychlost, agenti, velké modely, obrana proti manipulaci, mezipatro. V každém dílu byla první hypotéza rozumná — a v každém ji měření opravilo.
V posledním, desátém dílu to shrneme do jedné tabulky: co na takový stroj nasadit, pro jakou úlohu a co k tomu musí být v kódu. Plus sedm vět, které si z celého měření odnášíme.
Celý díl ve zkratce — 42 sekund:
Chcete AI, která nepustí data z firmy?
Otevřené modely na vlastním serveru stavíme klientům nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Kde to dává smysl, kombinujeme víc pater — a vždy víme, kde která data leží. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.
Souvisí: V osmém dílu jsme agenta připravovali na provoz — kalkulačka, schéma a osm pokusů o manipulaci. A ve druhém, proč je u lokální AI důležitější paměť než procesor.
Držíme vás na první pozici. Teď i s AI. 💚