Evropské mezipatro: co umí AI v cizí serverovně, když data nemají opustit Evropu

Osm dílů jsme drželi jeden předpoklad: data neopustí firmu. Mezitím vzniká třetí cesta mezi vlastním železem a americkým cloudem — evropská serverovna, která provozuje velké modely na vlastním hardwaru. Změřili jsme ji na stejných úlohách jako lokální modely a přes noc sledovali frontu. Umí něco, co náš stroj nezvládne. A propadla tam, kde bychom to nečekali.

Evropské mezipatro. Mezi vlastním serverem a americkým cloudem vzniká třetí cesta. Změřili jsme ji na stejných úlohách a přes noc sledovali frontu.

Co to je

Ve druhém dílu jsme o „velké evropské serverovně“ psali bez jména, protože měření ještě běželo. Teď už ho říct můžeme: německý Hetzner, jeden z největších evropských provozovatelů serverů, spustil v rámci svého programu Experiments inferenční API. Je kompatibilní s rozhraním OpenAI, takže se do existujících nástrojů připojí změnou jedné adresy. A je zatím zdarma.

V srpnu na něm běžel jediný model: Qwen3.6-35B-A3B v přesnosti FP8. Jde o MoE architekturu s 35 miliardami parametrů celkem a 3 miliardami aktivních, s kontextem 262 144 tokenů, na text i obraz. V září už jsme na stejné adrese měřili Qwen3.8-27B. Model se během experimentu vyměnil. U experimentální služby je to v pořádku — a zároveň je to první věc, kterou si musí uvědomit každý, kdo by na ní chtěl něco stavět.

Limity na jeden klíč: 3 miliony vstupních a 60 tisíc výstupních tokenů za minutu, 500 milionů a 5 milionů za den.

Co o tom říká sám Hetzner

Podstatnější než technické parametry je, jak službu popisuje provozovatel:

  • experimentální, poskytovaná „tak, jak je“, bez SLA a bez garance výkonu,
  • bez záloh,
  • výslovně nedoporučená pro produkční nasazení,
  • kvalita odpovědí podle jejich vlastních slov pravděpodobně nebude na úrovni velkých poskytovatelů.

Hetzner otevřeně píše, proč to dělá: chce vědět, jak řešení škáluje a jestli je o takovou službu zájem. Uživatele vyzývá, ať testují limity.

To je poctivé. A tak jsme je testovali.

Velký model v Evropě, zatím experiment: inferenční API od Hetzneru, kompatibilní s OpenAI, zdarma — bez SLA, bez záloh, ne do produkce, bez ceníku. Model se během měření vyměnil z Qwen3.6-35B na Qwen3.8-27B.

Kde to fyzicky běží

Dokumentace lokalitu neuvádí. Hetzner má datacentra v Německu, Finsku, USA a Singapuru.

Změřili jsme si to sami — pingem a podle IP adresy. Vyšel Norimberk.

Je potřeba to číst přesně: je to pozorování v jednom okamžiku, ne závazek poskytovatele. Neříká nic o tom, kde by běžel failover nebo budoucí rozšíření kapacity, a Hetzner nikde neslibuje, že to tam zůstane. U experimentu to ani slíbit nemůže.

Bereme to jako ukázku, že takhle postavená služba je technicky možná. Ne jako záruku, na které by šlo stavět rozhodnutí o citlivých datech.

Co se děje s obsahem dotazů

V oficiální dokumentaci jsme nenašli, jestli a jak Hetzner ukládá obsah požadavků a odpovědí. Komunitní nástroj třetí strany uvádí, že se ukládají jen metadata o využití — to ale není zdroj, na který bychom se mohli odvolat.

Veřejně doložené to není. Dokud nebude, nepovažujeme to za službu pro citlivá data.

Kde mezipatro vyhrává: dlouhý kontext

Tohle je jeho skutečná silná stránka — a jiná, než jsme čekali.

Čekali jsme kompromis: o něco lepší model než lokální, o něco horší než špičkový cloud. Ve skutečnosti je rozdíl hlavně jinde, ve zpracování dlouhého vstupu.

Na našem stroji je prefill úzké hrdlo. Nejlepší model z pátého dílu zpracuje kolem 77 tokenů za sekundu. Stotisícový dokument je pro něj práce na dlouhé desítky minut, s většími modely prakticky nemožnost. Čekání na dlouhý kontext jsme odhadovali už ve třetím dílu a realita ho potvrdila.

Mezipatro zpracovalo 147 tisíc tokenů za minutu.

Celá smlouva, celá dokumentace projektu, celý rok e-mailové komunikace s klientem. To, co lokálně nejde vůbec, tady trvá minutu.

Obstálo i ve čtení obrázků: ze syntetické faktury vytěžilo správně 9 z 9 položek.

147 tisíc tokenů vstupu za minutu, na našem stroji kolem 77 za sekundu. Celá smlouva, dokumentace nebo rok e-mailů s klientem za minutu místo desítek minut. Fakturu z obrázku vytěžilo 9 z 9.

Kde propadlo: nástroje

A pak přišlo volání nástrojů.

V srpnu jsme stejné sadě šesti scénářů podrobili lokální modely i mezipatro, tehdy ještě se srpnovým modelem Qwen3.6. Model v cloudu halucinoval volání v polovině případů — tvrdil, že něco udělal, a nezavolal nic. Přesně ten typ chyby, který jsme v šestém dílu popsali jako nejnebezpečnější.

Pro srovnání: v září, o pár týdnů později, dávaly tři nejlepší lokální modely na stejné sadě 6 z 6.

Stejné úlohy, přímé srovnání

V září jsme mezipatro pustili do stejné sady osmi programátorských mini-úloh jako čtrnáct lokálních modelů ve čtvrtém dílu:

Napoprvé Nakonec Čas
mezipatro (Qwen3.8-27B)6/86/82 min
nejlepší lokální napoprvé7/87/85 min
nejlepší lokální nakonec6/88/89 min

Mezipatro bylo nejrychlejší — dvě minuty na celou sadu. Ale z opravných kol nevytěžilo nic. Co nedalo napoprvé, nedalo ani po zpětné vazbě. Zbyly mu chyby v parsování českých částek a ve validaci IČO, tedy v úlohách, na kterých padaly i lokální modely.

Rychlost ano. Chytřejší ne.

Rychlost ano, chytřejší ne. Volání nástrojů: v polovině případů tvrdilo, že něco udělalo, a nezavolalo nic. Osm programátorských úloh: mezipatro 6/8 napoprvé i nakonec za 2 minuty, lokální A 7/8 a 7/8 za 5 minut, lokální B 6/8 a 8/8 za 9 minut.

Fronta: kdy na odpověď čekáte čtyři minuty

Nejdůležitější měření přišlo až přes noc. Cron posílal stejný dotaz dvakrát za hodinu a měřil čekání na první token.

Noc 17./18. 8., 18 vzorků, časy UTC (u nás o dvě hodiny víc):

Hodina (UTC) Medián Maximum
20:0038 s53 s
21:0060 s73 s
22:0093 s97 s
23:007 s14 s
00:00142 s272 s
01:00230 s263 s
02:00210 s218 s
03:00245 s252 s
04:00163 s176 s

Celkový medián 123 sekund. Rozsah od půl sekundy po čtyři a půl minuty.

Všech 18 požadavků prošlo. Není to nestabilita, je to fronta. Nejhorší okno 01:00–04:00 UTC odpovídá večernímu provozu v USA. A hodnota ve 23:00 ukazuje, že křivka není hladká: fronta se občas na chvíli protrhne.

Českou pracovní dobu, tedy 6:00–15:00 UTC, zatím proměřenou nemáme. Právě toto okno rozhodne, jestli je mezipatro použitelné pro firmu přes den. Do té doby platí jen noční závěr.

S frontou v řádu minut je mezipatro nástroj na dávky, ne na nic interaktivního. Pošlete zadání, jdete dělat něco jiného, výsledek si vyzvednete. Stejná kategorie použití jako lokální server bez grafické karty — jen s podstatně delším kontextem.

Na první slovo čekáte až 4,5 minuty. Medián čekání na první token v noci 17./18. 8. podle hodiny UTC: 38, 60, 93, 7, 142, 230, 210, 245 a 163 sekund. Všech 18 dotazů prošlo — je to fronta, ne nestabilita. Nástroj na dávky, ne na chat.

Tři patra

Série zatím jela na ose „vlastní železo, nebo cloud“. Po tomhle měření vidíme tři patra:

Patro Dlouhý kontext Nástroje Čekání Data
vlastní serverpomalé čtení, u dlouhých dokumentů desítky minutnejlepší lokální 6/6vždy stejné, bez frontypod vaší kontrolou
evropské mezipatro147 tisíc tokenů za minutuhalucinace v polovině případů0,5 s až 4,5 minv Norimberku, bez záruky
špičkový cloudnejrychlejšínejspolehlivějšísekundyu amerického poskytovatele
Žádné patro nevyhrává všechno. Vlastní server: nástroje 6/6, kontext pomalý, čekání vždy stejné, data pod kontrolou. Evropské mezipatro: nástroje s halucinacemi v polovině případů, kontext 147 tisíc tokenů za minutu, čekání 0,5 s až 4,5 min, data v Norimberku podle našeho měření. Špičkový cloud: nejspolehlivější a nejrychlejší, čekání v sekundách, data v USA.

Žádné patro nevyhrává všechno. A to je podstatné: u jednoho klienta můžou běžet dvě patra vedle sebe. Agent obsluhující procesy na vlastním serveru, kde se spoléhá na nástroje. Noční analýza dlouhých dokumentů v mezipatře, kde se spoléhá na kontext.

Dvě patra vedle sebe: na vlastním serveru agent, který se spoléhá na nástroje, v mezipatře noční analýza dlouhých dokumentů. Do provozu zatím ne, ale je lepší ho mít změřené dřív, než přijde.

Proč to zatím není řešení — a proč nás to přesto mění

Dnes bychom mezipatro klientovi do provozu nedoporučili. Sám provozovatel ho do produkce nedoporučuje. Model se mění bez ohlášení. Ceník neexistuje, takže nejde spočítat ekonomiku. A u nástrojů propadlo přesně tam, kde je chyba nejdražší.

Ale mění nám pohled na rozhodování. Ještě před rokem byla volba binární: buď si postavíte vlastní server a přijmete jeho limity, nebo pošlete data za oceán. Teď vzniká patro, které umí věc, kterou vlastní server neumí, na hardwaru v Evropě.

Zatím jako experiment bez záruk. Až se to sejde s ceníkem, smlouvou a stabilním modelem, bude to patro, které dnes chybí. A je lepší ho mít změřené dřív, než přijde.

Co z celé série plyne

Devět dílů. Taalas, paměť, procesor, kód, rychlost, agenti, velké modely, obrana proti manipulaci, mezipatro. V každém dílu byla první hypotéza rozumná — a v každém ji měření opravilo.

V posledním, desátém dílu to shrneme do jedné tabulky: co na takový stroj nasadit, pro jakou úlohu a co k tomu musí být v kódu. Plus sedm vět, které si z celého měření odnášíme.

Celý díl ve zkratce — 42 sekund:

Chcete AI, která nepustí data z firmy?

Otevřené modely na vlastním serveru stavíme klientům nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Kde to dává smysl, kombinujeme víc pater — a vždy víme, kde která data leží. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.

Souvisí: V osmém dílu jsme agenta připravovali na provoz — kalkulačka, schéma a osm pokusů o manipulaci. A ve druhém, proč je u lokální AI důležitější paměť než procesor.

Držíme vás na první pozici. Teď i s AI. 💚

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet