Co se stalo
Zatímco od roku 2020 dominovalo AI scéně trénování stále větších modelů, v roce 2026 se pozornost přesunula k inferenci — tedy k samotnému používání natrénovaných modelů. Klíčovým důvodem je rozšíření tzv. reasoning modelů, které na jeden dotaz spouštějí inference opakovaně metodou chain of thought a generují až 20× více textu než starší modely. K tomu přibývá agentic AI, která běží nepřetržitě bez přímé interakce s uživatelem.
Výsledkem je tlak na hardware, který GPU zvládají jen částečně. Inference se skládá ze dvou fází: prefill (zpracování kontextu, přirozeně paralelní, GPU zde fungují dobře) a decode (generování tokenů jeden po druhém, úzce svázané s pamětí). Výzkumy ukázaly, že Nvidia H100 GPU při inferenci stojí nečinně 50–80 % času — čeká na data z paměti.
Přední firmy na to reagují různě. Nvidia koupila technologie a tým startupu Groq za 20 miliard dolarů a na konferenci GTC 2026 představila Groq 3 LPU — čip se 500 MB on-chip SRAM a sedminásobnou paměťovou propustností oproti GPU. Amazon Web Services spojil vlastní Trainium čipy s Cerebras WSE-3 — wafer-scale čipem velikosti talíře se 44 GB SRAM. Cerebras pohání i nasazení GPT-5.3-Codex-Spark od OpenAI, které dosahuje přes 1 000 tokenů za sekundu oproti 50–125 u standardního GPT-5.4.
Mimo velké hráče pracují startupy na alternativních přístupech. D-Matrix skládá výpočetní čip přímo na DRAM, čímž zkracuje vzdálenost přenosu dat na mikrometry. Majestic Labs naopak prodlužuje paměťové rozhraní až na metr a umožňuje rack s až 128 TB běžné DRAM. Tensordyne využívá logaritmický číselný systém, který nahrazuje násobení sčítáním a slibuje desetinovou spotřebu energie. Etched zapéká architekturu transformer přímo do křemíku.
Paralelně pokračuje kvantizace modelů: Nvidia přeformátovala DeepSeek-R1 z FP8 do vlastního formátu NVFP4, výkon vzrostl třikrát, kvalita klesla o méně než jedno procento.
Proč je to důležité
Každý, kdo dnes plánuje nasazení LLM v produkci — ať jde o interní nástroje, zákaznické aplikace nebo autonomní agenty — by měl sledovat, jak se mění cenový a výkonnostní poměr inference hardwaru. GPU zůstávají silné pro prefill, ale decode fáze vyžaduje jiné architektury. Firmy, které nakupují nebo pronajímají výpočetní kapacitu, by měly zjistit, jaký hardware stojí za jejich inference službou — rozdíly v rychlosti a ceně na token jsou řádové. Startupový ekosystém je zatím roztříštěný a mnohé produkty (Tensordyne, Etched) ještě nejsou v produkci. Bezpečnou volbou pro rok 2026 zůstávají kombinace Nvidia Rubin + Groq 3 LPU nebo AWS Trainium + Cerebras.