AI model vypálený přímo do čipu? Taalas ukazuje, proč může inference zrychlit o řád
Běžné AI modely jsou software běžící na univerzálním hardwaru. Startup Taalas zkouší opačný přístup: konkrétní model přenést přímo do struktury čipu. Výsledkem je Llama 3.1 8B generující přibližně 17 000 tokenů za sekundu pro jednoho uživatele. Cena za tuto rychlost je ale zásadní — ztráta univerzálnosti.
Proč jsou dnešní AI modely vlastně pomalé
Při provozu velkého jazykového modelu není problém jen v množství matematických operací. Obrovské množství času a energie se spotřebuje na přesouvání vah modelu mezi pamětí a výpočetními jednotkami.
Typická GPU proto používají extrémně rychlou paměť HBM a stále širší paměťové sběrnice. Přesto zůstávají univerzálními procesory: dnes na nich spustíme Llamu, za minutu Qwen a následně model pro generování obrázků.
Taalas se rozhodl tuto univerzálnost obětovat.
Jeho první čip HC1 je podle výrobce hardwarově svázaný přímo s modelem Llama 3.1 8B. Taalas uvádí rychlost přibližně 17 000 tokenů za sekundu na jednoho uživatele při testu s 1 000 vstupními a 1 000 výstupními tokeny.
To je výkon, při kterém se tisícitokenová odpověď z hlediska samotného generování objeví prakticky okamžitě.
Model se už nenahrává. Model je počítač.
Taalas svůj koncept shrnuje větou „The Model is The Computer".
Nejde tedy o alternativu ke grafické kartě, na kterou bychom libovolně nahrávali různé modely. Konkrétní model je do značné míry součástí samotného návrhu křemíku.
První HC1 proto není „AI karta pro Llamu, Qwen a Mistral". Je to v podstatě počítač postavený kolem jediné konkrétní Llamy.
Určitá flexibilita zůstává. Taalas podporuje změnu velikosti kontextového okna a LoRA adaptéry pro fine-tuning. Základní model však zůstává pevně svázaný s hardwarem.
To zároveň vysvětluje extrémní rychlost. Pokud přesně víme, jaké operace a jaké váhy bude zařízení po celý svůj život používat, můžeme odstranit obrovské množství režie, kterou univerzální hardware potřebuje.
Háček: 17 000 tokenů za sekundu není zadarmo
HC1 používá velmi agresivní kvantizaci kombinující 3bitové a 6bitové parametry. Samotný Taalas připouští určitou degradaci kvality proti GPU benchmarkům. Druhá generace má přejít na standardnější 4bitové formáty.
To je důležitý detail.
Taalas zatím neukazuje, že vytvořil univerzální procesor, který je desetkrát rychlejší než NVIDIA. Ukazuje něco možná ještě zajímavějšího: pokud obětujeme univerzálnost, inference konkrétního AI modelu může být dramaticky levnější a rychlejší.
Proč to může změnit ekonomiku AI
Dnešní AI infrastruktura je postavená převážně na drahých univerzálních akcelerátorech. To je logické v době, kdy se modely rychle mění a nikdo neví, který model bude používat za půl roku.
Ale představme si jinou situaci. Firma provozuje miliony požadavků denně nad jedním stabilním modelem. Model se zásadně nemění. Veškerý hardware je využíván pouze pro něj.
V takovém případě už univerzálnost GPU přestává být výhodou. Stává se nákladem.
Podobný princip známe z jiných oblastí výpočetní techniky: specializovaný čip často dokáže jednu konkrétní operaci provádět mnohem efektivněji než univerzální procesor. AI možná právě vstupuje do stejné fáze.
Znamená to konec GPU?
Ne.
Pro vývoj, experimentování, fine-tuning a rychlé střídání modelů zůstávají univerzální GPU zásadní.
Specializovaný AI křemík dává smysl hlavně tam, kde se spojí tři věci:
- velmi vysoký objem inference,
- relativně stabilní model,
- potřeba minimalizovat cenu a spotřebu každého tokenu.
Cloud budoucnosti proto nemusí být tvořen jedním typem AI serveru. Vedle univerzálních GPU mohou vzniknout celé farmy specializovaných čipů pro několik nejpoužívanějších modelů.
A co menší firmy?
Pro běžnou českou firmu dnes samozřejmě nedává smysl nechávat vyrábět vlastní AI čip.
Technologie Taalasu je ale zajímavá z jiného důvodu: ukazuje, jak zásadní roli v AI inference hraje pohyb dat a paměť.
A právě při hledání levného lokálního AI serveru jsme narazili na stejnou otázku: je skutečně nejdůležitější mít co nejvýkonnější GPU? Nebo může být někdy důležitější mít jednoduše hodně rychlé paměti?
V druhém dílu proto porovnáme Mac mini, Mac Studio, AMD Ryzen AI Max a klasické PC.
Celý díl ve zkratce — 34 sekund:
Chcete AI, která nepustí data z firmy?
Otevřené modely na vlastním serveru stavíme klientům běžně — nejčastěji tam, kde je citlivé know-how a cloud nepřipadá v úvahu. Jak takové AI aplikace a agenti vypadají v praxi, ukazujeme na samostatné stránce. Ozvěte se nám a projdeme, co by dávalo smysl u vás.
Souvisí: Proč je právě teď dobrý čas začít, ukazují data ČSÚ v článku 82 % českých firem zatím AI nepoužívá.
Držíme vás na první pozici. Teď i s AI. 💚