Když firma poprvé narazí na limit výpočetního výkonu, první instinkt bývá podívat se na velké GPU servery s osmi kartami. Pro většinu firem je to špatná odpověď na správnou otázku. Následující text vás provede tím, jaká je ta správná, a upozorní na napájení, kde se dělají nejdražší chyby.
| 01 | Dvě různé práce, dva různé stroje |
Firmy, které počítají na grafických kartách, se v praxi dělí na dva světy, a ty se skoro nepotkávají.
V prvním světě je karta nástroj konkrétního člověka. Střih, grading, 3D, práce s obrazem. Tam patří výkonná karta do pracovní stanice u stolu a centralizace přináší hlavně komplikace, protože člověk potřebuje okamžitou odezvu, ne frontu.
Ve druhém světě běží dlouhé dávkové úlohy: trénování modelů, simulace, hromadné zpracování dat. Úloha se spustí a běží hodiny nebo dny. Tam platí jednoduché pravidlo: čím víc karet stroj má, tím dřív je hotovo. A právě tady se rozhoduje, jaký stroj koupit.
| 02 | Proč velká GPU šasi nejspíš nepotřebujete |
Server na osm karet není chytřejší stroj než server na dvě. Je to čtyři až šest běžných GPU serverů zhuštěných do jednoho šasi. Důvod, proč existuje, je místo v racku: velké datacentrum potřebuje narvat do omezeného prostoru maximum výkonu a za tu hustotu platí příplatek, v pořizovací ceně i v nárocích na napájení a chlazení.
Pokud neprovozujete datacentrum a místo v racku není vaše nejvzácnější komodita, ten příplatek platíte zbytečně. Běžná firma s dávkovými úlohami vyjde nejlépe se serverem, do kterého lze osadit jednu až dvě výkonné karty. Když výkon přestane stačit, přidá se druhý stejný server, úlohy se rozdělí a nic dalšího se řešit nemusí.
Konkrétní příklad z naší nabídky: Supermicro AS-2015CS-TNR1, kompaktní dvouunitový server s procesorem AMD EPYC řady 9000, dvanácti sloty na paměti DDR5 a dvanácti pozicemi na disky, do kterého lze osadit až dvě dvouslotové grafické karty. Máme jej skladem.
| 03 | Jaké karty do serveru patří |
Nejvhodnější jsou serverové karty s pasivním chlazením, které počítají s tím, že vzduch přes ně žene šasi. Jsou stavěné na trvalou plnou zátěž a na provoz v racku.
Provozovat lze i běžné karty s vlastními ventilátory, některé serverové platformy je dnes oficiálně podporují, včetně nejvyšších herních modelů. Je ale potřeba ověřit dvě věci: že se karta do konkrétního šasi fyzicky vejde, dnešní chladiče jsou obří a umí kolidovat s komponentami na desce, a že šasi zvládne odvést její teplo při dlouhé zátěži. Pokud si nejste jisti, ptejte se před nákupem, ne po něm.
| 04 | Výchozí zapojení není konečné zapojení |
Tohle je věc, která v katalogových listech není vidět a rozhoduje o výkonu celé sestavy.
Serverová deska má omezený počet linek PCI Express a výrobce je mezi sloty a disky rozděluje nějakým výchozím způsobem. U zmíněného modelu jsou GPU sloty ve výchozím stavu zapojené jako PCIe 5.0 x8, tedy na polovinu šířky sběrnice, protože zbytek linek jde na NVMe disky.
Není to ale dané. Přesunem kabeláže uvnitř šasi se dají oba sloty pro grafické karty osadit na plných x16 výměnou za část linek určených diskům. Když skládáme konfiguraci, ve které mají běžet grafické karty, děláme to takhle vždy: karty dostanou plnou propustnost sběrnice a ubere se tam, kde to zákazníka nebolí.
Proto se GPU server nekupuje z katalogu. Stejné šasi se stejným označením může být zapojené dvěma způsoby a rozdíl na výkonu úlohy je znát.
| 05 | Napájení: kde se dělají nejdražší chyby |
U GPU serveru se napájení řeší na čtyřech úrovních a selhat umí každá z nich.
| Zdroje v šasi Cena chyby: zastavený výpočet |
Tady se nejčastěji plete výkon s jistotou. Zmíněný model má dva zdroje po 1200 W a umí si zátěž mezi ně rozdělit, takže reálně utáhne až 2400 W odběru. Jenže v tu chvíli už není redundantní a výpadek jednoho zdroje výpočet zastaví. Pokud chcete mít jistotu redundance, celkový odběr sestavy nesmí překročit kapacitu jednoho zdroje. Rozpětí je přitom široké: plně osazený stroj může mít podle konfigurace odběr 660 W stejně jako 1500 W. Číslo, které vás zajímá, tedy není maximum šasi, ale odběr vaší konkrétní sestavy. |
| Kabeláž ke kartám Cena chyby: stroj nenastartuje v plné sestavě |
Univerzální napájecí kabeláž pro grafické karty neexistuje. Řeší se vždy podle konkrétního modelu karty, která do stroje půjde, a je součástí nacenění konfigurace. Proto se ptáme na přesný typ karty dřív, než pošleme cenu. |
| Okruh v budově Cena chyby: odstávka a elektrikář |
Zásuvkový okruh sdílený s půlkou kanceláře nemusí na plně osazený GPU server stačit. Než se objedná hardware, vyplatí se zjistit, kolik proudu je v místě, kam stroj půjde, k dispozici. |
| Záložní zdroj Cena chyby: ztráta dat při výpadku |
Nejpodceňovanější položka ze všech. UPS musí mít kapacitu na skutečný odběr při výpočtu, ne na kancelářské počítače, jinak při výpadku spadne během vteřin. A hlavně: UPS není zařízení na věčnost. Po zhruba pěti letech je na výměnu, minimálně baterie, často celá. Firma, která to neřeší, se to dozví při prvním skutečném výpadku, tedy přesně ve chvíli, kdy záloha měla fungovat. |
| 06 | Kdy vám server na karty nepomůže |
- Práce je interaktivní. Střih, grading a práce s obrazem patří na pracovní stanice u lidí, ne na sdílený stroj.
- Nikdo nemá v popisu práce se o stroj starat. Sdílený server bez správce je horší než samostatné počítače.
- Máte přístup do výpočetního centra nebo do cloudu a řešíte spíš frontu a rozpočet než vlastní železo.
| 07 | Co si připravit, než budete poptávat |
- Typickou úlohu: jak dlouho běží, kolik potřebuje paměti na kartě a jestli umí využít víc karet najednou.
- Jaké karty máte nebo plánujete, včetně přesného typu. Podle něj se řeší napájecí kabeláž i zapojení slotů.
- Kam stroj půjde a co je na tom místě za napájení a zálohu.
- Kdo se o stroj bude starat.
COMPOS DISTRIBUTION je autorizovaný distributor a dovozce značky Supermicro s vlastním servisním střediskem v Praze. Pošlete nám odpovědi na čtyři body výše a vrátíme vám konkrétní návrh včetně dostupnosti, nebo doporučení, ať do toho nejdete. Obojí je legitimní výsledek.
E-mail: obchod@compos.cz
Mobil: +420 725 307 607