Ještě před dvěma lety znamenala „vlastní AI“ pro většinu firem jediné: předplatné ChatGPT nebo Copilota. Dnes stále více organizací dospívá do bodu, kdy cloud přestává stačit. Důvody jsou obvykle tři: náklady rostoucí s počtem dotazů, data, která nesmějí opustit firmu, a potřeba, aby AI pracovala s vlastními dokumenty, databázemi a procesy, nikoli s obecnými znalostmi z internetu.

    V tuto chvíli vyvstává otázka: jaký AI server vlastně koupit a kolik stojí?

    Odpověď je zajímavější, než by se mohlo zdát, protože cenové rozpětí je obrovské. Od zařízení velikosti knihy za více než 100 tisíc Kč až po stroj za více než 11 milionů Kč. A důležité je, že každé z těchto řešení dává smysl, jen pro někoho jiného. Níže popisuji tři úrovně investice, výpočet, který se vyplatí provést před rozhodnutím, a pět otázek, jež pomohou vybrat hardware bez zbytečného předimenzování i bez nedostatečné kapacity.

    Čím se AI server liší od běžného serveru

    Běžný server je postavený kolem procesoru. AI server je postavený kolem GPU – právě ty vykonávají veškerou práci s modely a zbytek hardwaru slouží k jejich obsluze. Z toho vyplývají tři praktické rozdíly.

    • GPU a jejich paměť. V takovém systému pracují čtyři až osm akcelerátorů – v rackových serverech nejčastěji ve formě karet PCIe, v nejvýkonnějších platformách jako moduly připájené na společné desce. Jejich celková paměť je nejdůležitějším parametrem celé investice – více o tom za chvíli.
    • Napájení. Osm karet při zátěži odebírá 5–6 kW, tedy tolik jako několik desítek kancelářských počítačů. Vyžaduje to rack s odpovídajícím napájením a účinný odvod tepla ze serverovny.
    • Síť. Pro jeden systém stačí standardní rychlá síť. Při propojení několika serverů do jednoho systému jsou potřeba podstatně rychlejší spoje, protože GPU v různých šasi si musí vyměňovat data s latencí srovnatelnou s provozem v jednom šasi.

    Nejde tedy jen o „výkonnější server“. Je to jiná kategorie hardwaru, která se vybírá podle jiných kritérií.

    Paměť GPU: jediné číslo, které usnadní celý výběr

    Existuje jeden parametr důležitější než cena: kolik paměti mají GPU v serveru dohromady.

    Proč? Model se musí do této paměti vejít celý, podobně jako soubor, který je nutné načíst do programu, aby s ním bylo možné pracovat. Pokud se nevejde, jednoduše se nespustí.

    Samotný model je však jen začátek výpočtu. Každý přihlášený uživatel a každý analyzovaný dokument zabírá další paměť pro probíhající konverzaci. Stejný model proto pro sto lidí potřebuje výrazně více prostoru než pro jednoho – a právě počet uživatelů, nikoli samotná velikost modelu, nejčastěji rozhoduje o tom, jaká úroveň hardwaru je potřeba.

    Základní nároky modelů na paměť popisuje průvodce Jaký počítač pro AI vybrat. Následující tabulka ukazuje druhou osu tohoto výpočtu, tedy jak se nároky mění se škálou nasazení. Hodnoty jsou orientační a vztahují se k typické produkční konfiguraci.

    Velikost modelu5 uživatelů50 uživatelů200 uživatelůÚroveň hardwaru
    malý (třída 8B)cca 8 GBcca 20 GBcca 50 GBDGX Spark
    střední (třída 70B)cca 45 GBcca 70 GBcca 130 GBrackový server, 1–2 karet
    velký (třída 200B+)cca 130 GBcca 200 GBcca 350 GBserver s osmi kartami
    trénování vlastního modeluněkolikanásobně více než samotné spuštěníplatforma HGX B200

    Označení jako 8B nebo 70B udávají, z kolika miliard parametrů se model skládá – 8B znamená osm miliard. Čím více parametrů, tím lepší kvalita odpovědí a tím více paměti GPU model zabírá.

    Ještě jedna věc, na kterou lze snadno zapomenout.

    Rezerva. Uvedená čísla odpovídají běžnému provozu. Pro špičkové zatížení je vhodné připočítat rezervu 20–30 %, jinak systém při vyšším provozu začne odmítat dotazy.

    Úroveň 1: NVIDIA DGX Spark jako výchozí bod

    NVIDIA DGX Spark je stolní zařízení velikosti knihy s 128 GB unifikované paměti a výpočetním výkonem přibližně 1 petaFLOP pro AI úlohy. Umožňuje lokálně provozovat modely ve třídě těch, které pohánějí populární asistenty, aniž by jediný dokument opustil firmu a odešel do cloudu. K dispozici je několik variant, které se liší především kapacitou disku (1, 2 nebo 4 TB) a balíčkem podpory. Kompletní nabídku hardwaru této třídy včetně modelů od osmi výrobců najdete v kategorii počítače a pracovní stanice pro AI.

    Pro koho? Pro firmu, která si chce nejprve ověřit, zda AI zefektivní zákaznickou podporu, analýzu smluv nebo přípravu nabídek, než kdokoli schválí velký rozpočet. Investice se pohybuje kolem 134 228,19 Kč bez DPH, tedy méně než roční předplatné AI nástrojů pro tým o několika desítkách členů. Dvě zařízení lze propojit do jednoho systému.

    Omezení. Jde o hardware pro jeden tým, nikoli pro celou organizaci. Nelze jej instalovat do racku, nemá redundantní napájení a nelze jej zahrnout do servisní politiky platné v serverovně. Když má AI současně využívat sto lidí, je nutné přejít na vyšší úroveň.

    Úroveň 2: rackový GPU server pro produkční AI ve firmě

    Podle mého názoru jde o úroveň, která je dnes nejčastěji přehlížena, přestože pro firmu s reálným využitím AI představuje nejrozumnější volbu.

    Jde o dedikovanou rackovou GPU platformu (5U), navrženou pro osm dvouslotových karet. Není vázána na jeden konkrétní model akcelerátoru – výběr karet závisí na použití. Základem jsou dva procesory AMD EPYC, až 6 TB paměti DDR5 v 24 slotech a šest redundantně pracujících napájecích zdrojů 2700 W.

    Klíčový je počet karet, protože určuje velikost paměti GPU. Dvě karty RTX PRO 6000 s 96 GB každá poskytují 192 GB a obslouží interního asistenta pro několik desítek lidí. Plná konfigurace s osmi kartami nabízí 768 GB, což stačí pro několik stovek uživatelů nebo velmi velké modely. Další karty lze přidat do stejného šasi bez výměny serveru – a to je největší výhoda této úrovně: není nutné začínat s plnou konfigurací.

    Konkrétní model: Supermicro AS-5126GS-TNRT Gold Series

    Prodává se jako kompletní nakonfigurovaný systém. Orientační investice do základní konfigurace se dvěma kartami: přibližně 2 796 420,58 Kč bez DPH. Přesnou konfiguraci a aktuální cenu najdete na produktové kartě.

    Co to znamená v praxi? Takový server lokálně spustí velké jazykové modely, zvládne analýzu firemního archivu dokumentů, automatizaci zákaznické podpory, generování obsahu ve více jazycích i analýzu obrazů z výrobní linky. Karty RTX PRO jsou navíc univerzální – stejný server lze využít pro rendering, inženýrské simulace nebo virtualizaci pracovních stanic. To je argument, který často rozhoduje: hardware nezůstává mezi AI projekty nevyužitý.

    Pro koho? V základní konfiguraci je určen pro firmy s několika desítkami zaměstnanců, které již mají za sebou fázi testování a chtějí týmům zpřístupnit interního asistenta obeznámeného s firemními postupy. V plné konfiguraci je vhodný pro velké organizace, stovky souběžných uživatelů a regulovaná odvětví, jako jsou finance, zdravotnictví nebo veřejný sektor, kde data musí zůstat v budově.

    Na co pamatovat. Spotřeba energie roste s počtem karet: přibližně od 2 kW se dvěma kartami až po 5–6 kW s osmi. Rack to musí zvládnout napájet a chlazení odvést. Pokud plánujete rozšíření, dimenzujte napájení a klimatizaci rovnou pro cílovou, nikoli výchozí konfiguraci.

    Úroveň 3: NVIDIA HGX B200 – infrastruktura pro trénování modelů

    Na samotném vrcholu stojí hardware, o kterém se píše ve zprávách o technologickém závodě mezi největšími světovými společnostmi. Server s platformou NVIDIA HGX B200 obsahuje osm čipů Blackwell, v současnosti nejvýkonnějších AI akcelerátorů na trhu, s celkem 1,44 TB paměti HBM3e – nejrychlejší, kterou lze dnes koupit.

    Zařízení zabírá v racku 10U a má osm síťových rozhraní 400 Gb/s, protože je navrženo pro propojení do clusteru s dalšími stejnými servery. Napájení zajišťuje šest redundantně pracujících zdrojů o výkonu přibližně 5 kW v zapojení 3+3 – skutečná spotřeba zařízení při zátěži se pohybuje kolem 10 kW, zbytek představuje rezervu a ochranu pro případ poruchy. Součástí je procesor BlueField-3, který odlehčuje hlavnímu systému od síťových a bezpečnostních úloh, a tříletá podpora se servisem u zákazníka následující pracovní den.

    Konkrétní model: Supermicro AS-A126GS-TNBR

    Určen pro vědecké výpočty, AI, průmyslovou automatizaci a analýzu dat. Orientační investice: přibližně 11 185 682,33 Kč bez DPH za jeden server; aktuální cenu najdete na produktové kartě.

    Rozdíl oproti GPU serveru druhé úrovně nespočívá v tom, že B200 „dělá totéž, jen rychleji“. Jde o to, že zvládá úlohy, které druhý server nedokáže provést v rozumném čase: trénování vlastních modelů od základu, dolaďování modelů se stovkami miliard parametrů, obsluhu stovek uživatelů současně, vědecký výzkum a simulace v průmyslovém měřítku.

    Pro koho? Pro společnosti, které vyvíjejí produkty založené na AI a nepoužívají hotové modely, ale vytvářejí vlastní. Pro výzkumné instituce a vysoké školy. Pro telekomunikační operátory, banky, velké průmyslové skupiny a farmaceutické společnosti.

    V praxi se takový stroj zřídka pořizuje jen jeden. Je nutné doplnit síťovou infrastrukturu, napájení a chlazení serverovny – při 10 kW na šasi se obvykle zvažuje kapalinové chlazení. Nejde o nákup hardwaru, ale o strategické rozhodnutí.

    Jak vybrat server pro AI? Pět otázek, které si položit

    Víte už, co má AI ve vaší firmě dělat?

    Pokud ne, zvolte první úroveň. Za cenu jednoho prémiového notebooku získáte prostředí, ve kterém během dvou týdnů ověříte několik nápadů a rozhodnete se na základě faktů, nikoli prezentací.

    Kolik lidí jej bude používat a jak často?

    Pokud odpověď zní „celá firma, každý den“, stolní zařízení nestačí a vhodnou volbou bude GPU server do racku. Vyplatí se spočítat, kolik nyní vynakládáte na cloudová API a předplatná. Ve velkém měřítku je vlastní hardware levnější v horizontu dvou až tří let.

    Vyvíjíte vlastní modely, nebo používáte hotové?

    Používání hotových, i velmi velkých modelů spadá do druhé úrovně. Vývoj vlastních modelů už vyžaduje B200. Hranice je zde zřetelná a jen zřídka vyvolává pochybnosti, na které straně se firma nachází.

    Jak velký model potřebujete spustit a pro kolik lidí?

    Vraťte se k tabulce paměti. Pokud vybraný model zabírá 60 GB a má jej současně používat padesát lidí, jedna karta s pamětí 96 GB je naprosté minimum, zatímco dvě poskytují komfort a prostor pro růst.

    Co zvládne vaše serverovna?

    Nejčastější překvapení u AI projektů se netýká hardwaru, ale budovy: kolik elektrické energie lze přivést, zda klimatizace odvede dodatečné teplo a zda je v racku místo. Je lepší to ověřit před objednáním než po dodání.

    Co dalšího patří do rozpočtu na implementaci

    Cena serveru obvykle představuje 70–85 % rozpočtu projektu. Ostatní položky je vhodné zohlednit již ve fázi plánování.

    • Napájení a rack – PDU s odpovídajícím výkonem, rozdělení fází, záložní napájení a u některých instalací také nová přípojka.
    • Chlazení – do přibližně 5–6 kW na rack obvykle postačuje přesná klimatizace. Nad 10 kW se používá kapalinové chlazení, které vyžaduje úpravu prostoru a samostatný servisní postup. Pokud na to serverovna nebyla navržena, vyplatí se tento náklad zahrnout již do kalkulace.
    • Paměť RAM – konfigurace pro AI začínají na několika stovkách gigabajtů a ceny serverových modulů v roce 2026 výrazně vzrostly. Rozdíl mezi 512 GB a 1 TB může představovat významnou položku v rozpočtu.
    • Síť – přepínač s odpovídající propustností, transceivery a kabeláž. V clusterových konfiguracích je navíc potřeba samostatná síť pro GPU.
    • Úložiště – modely a soubory dokumentů zabírají terabajty a propustnost pro čtení by měla odpovídat výkonu karet.
    • Implementace – instalace softwaru, spuštění modelu, integrace s firemním přihlašováním a systémy, které používáte.
    • Podpora a záruka – pro produkční prostředí je standardem servis on-site následující pracovní den.

    Kde začít

    Nejčastější chybou při takových nákupech je začít katalogem. Správné pořadí je opačné: nejprve jedno použití, potom počet uživatelů, následně srovnání se současnými náklady na cloud a teprve nakonec konfigurace.

    Pokud ještě přesně nevíte, k čemu má AI sloužit, první úroveň postačí na několik měsíců testování a stojí tolik co jeden notebook. Jestli už máte testy za sebou a asistent má sloužit celé firmě, druhá úroveň je v současnosti nejrozumnější volbou pro většinu organizací. Třetí úroveň se volí při budování vlastních modelů – a tehdy rozhodnutí obvykle nevzbuzuje pochybnosti.

    Pokud konfigurace vyžaduje přizpůsobení vaší serverovně – počtu karet, paměti, sítě nebo chlazení – náš tým připraví návrh pro konkrétní použití.

    FAQ

    Kolik stojí server pro AI?

    Rozpětí je široké: od přibližně 134 228,19 Kč bez DPH za stolní zařízení třídy DGX Spark, přes přibližně 2 796 420,58 Kč za GPU server do racku v základní konfiguraci až po přibližně 11 185 682,33 Kč za platformu HGX B200. K ceně hardwaru je nutné připočítat 15–30 % na napájení, chlazení, síť a implementaci.

    Vyplatí se server pro AI více než cloud?

    Záleží na rozsahu. Náklady na cloud rostou s počtem dotazů, zatímco náklady na vlastní server jsou fixní – po nákupu neplatíte za každé volání. Proto se vyplatí porovnat současné účty za API a předplatné se splátkou hardwaru rozloženou do tří let a náklady na energii. Při intenzivním využití vítězí vlastní infrastruktura, při příležitostném využití zůstává levnější cloud.

    Kolik GPU paměti potřebuje jazykový model?

    Model se musí celý vejít do paměti karet. Orientačně: model třídy 8B vyžaduje několik desítek gigabajtů, třída 70B od 70 do 140 GB v závislosti na přesnosti uložení modelu a modely s více než 200 miliardami parametrů začínají na několika stovkách gigabajtů. K tomu se přidává paměť pro probíhající konverzace, která roste s počtem uživatelů.

    Stačí pro AI běžný server s grafickou kartou?

    Pro testování a jednotlivá použití ano. Pro produkční provoz obvykle ne, protože limitem je celková paměť karet a také napájení a chlazení skříně, která nebyla navržena pro osm akcelerátorů.

    Jaký server pro AI zvolit pro firmu do 50 osob?

    Pokud má AI produkčně sloužit všem, nejrozumnější volbou je GPU server do racku v konfiguraci se dvěma kartami s možností doplnění dalších. Pokud je stále ve fázi testování nebo jej využívá jeden tým, postačí stolní zařízení třídy DGX Spark, případně dva kusy propojené do jednoho systému.

    Kolik elektřiny spotřebuje server pro AI?

    Stolní zařízení přibližně 240 W. GPU server do racku od přibližně 2 kW se dvěma kartami do 5–6 kW s osmi kartami a platforma HGX B200 přibližně 10 kW. Náklady vypočítejte podle vlastní sazby za kWh a plánované doby provozu – při nepřetržitém provozu je rozdíl mezi úrovněmi několikanásobný.

    Sdílet.
    łukasz bojar

    Vice President Sales & MarketingVe společnosti Senetic působí od roku 2014 a zodpovídá za tvorbu vize a obchodní strategie firmy. Jeho profesní ambicí je pronikat na nové trhy po celém světě. Má více než 10 let zkušeností v oblasti managementu, rozvoje podnikání a prodeje, které získal nejen v IT odvětví. O své znalosti se dělí jako řečník na odborných konferencích. Ve volném čase odbourává stres v posilovně nebo při běhání v parku a zároveň objevuje nové hudební žánry.

    Zanechat komentář