Acceleratoarele AMD Instinct

AMD Instinct pe o mașină pe care nimeni altcineva nu o folosește

Două acceleratoare AMD sunt integrate în serverele noastre dedicate: Instinct MI210 și Instinct MI50. Placa este transmisă către propriul sistem de operare — versiunea ROCm, kernelul, procesele și niciun hypervisor între acestea.

MI210: 104 unități de calcul CDNA 2, 64 GB HBM2e. MI50: 60 unități de calcul GCN 5.1, 16 GB. Un singur chiriaș per mașină. Nu este împărțit în segmente, nu este partajat în timp.

Fiecare placă grafică pe care o instalăm — AMD și NVIDIA, fie ea curentă sau scoasă din producție de mult timp — este listată cu propriul preț lunar în catalogul GPU-urilor .

Transformă-ți GPU-urile în venituri lunare pasive

Ai configurații GPU pentru servere sau desktopuri inactive? Listează-le astăzi pe piața Primcast și câștigă venituri lunare constante de la echipe de inteligență artificială, dezvoltatori și companii care au nevoie de procesare la nivel de producție.

Accesați Marketplace

Ce este de fapt un server AMD Instinct aici

Un server fizic închiriat pentru un singur cont, cu un accelerator AMD într-un slot PCIe și root pe sistemul de operare de deasupra. Placa este o linie pe factură, nu un nivel de produs, deci mașina de dedesubt nu devine mai scumpă din cauza a ceea ce este conectat la ea.

Cardul este al tău

Fără partiție, fără vGPU, fără planificator care să decidă când îți vine rândul. Acceleratorul este transmis direct kernelului, așa că îți poți fixa propria versiune ROCm și îți poți încărca propriile module fără să ne întrebi.

ROCm, HIP și cadrele obișnuite

Ambele părți sunt ținte ROCm suportate — gfx90a pentru MI210, gfx906 pentru MI50 — pe baza cărora PyTorch, TensorFlow, JAX și ONNX Runtime se bazează pe AMD. HIP portează codul sursă CUDA în loc să necesite o rescriere.

Preț separat de mașină

Acceleratorul are propria cifră lunară, iar serverul are o alta, iar tu le aduni pe cele două. Schimbă placa fără a schimba serverele. Ambele cifre, pentru fiecare placă din catalog, se află pe pagina GPU .

Cele două acceleratoare AMD Instinct pe care le-am montat

Ambele pot fi comandate astăzi din același configurator, pe linii de servere diferite. Cifrele de mai jos sunt cele publicate de AMD.

Acceleratorul AMD Instinct MI210

AMD Instinct MI210

Generația CDNA 2 într-o placă PCIe standard de înălțime completă și lungime completă, cu două sloturi — 104 unități de calcul, 64 GB de HBM2e la o viteză de până la 1,6 TB/s și până la trei legături Infinity Fabric pentru trafic direct de la placă la placă. Răcire pasivă la 300 W printr-o legătură gazdă PCIe Gen 4. Aceasta este soluția ideală atunci când se pune întrebarea dacă modelul se potrivește în memorie.

AMD Instinct MI50

Partea din generația mai veche Vega: siliciu GCN 5.1, 60 de unități de calcul și 16 GB de memorie încorporată. Nimeni nu mai închiriază această placă, ceea ce o face imposibil de obținut în altă parte, în loc să fie doar ieftină aici — și este încă o țintă ROCm acceptată, așa că rulează același cod HIP și PyTorch ca MI210 pentru o fracțiune din cifra lunară. Este modalitatea sensibilă de a pune în funcțiune un lanț de instrumente ROCm înainte de a te dedica plăcii mari.

Debitul matriceal pe MI210

AMD publică performanțe de vârf de 181,0 TFLOPS pentru FP16 și matricea BF16 pentru MI210 la o frecvență de vârf de 1.700 MHz pentru motorul său cu boost, alături de performanțe de vârf de 22,6 TFLOPS pentru FP64 și vectorul FP32.

Memoria este constrângerea

64 GB conțin ponderile unui model cu 30 de miliarde de parametri la 8 biți sau ale unuia cu 13 miliarde la 16 biți, rămânând spațiu pentru memoria cache KV. Pagina GPU prelucrează aceste calcule aritmetice pentru fiecare dimensiune a modelului.

Ce oferă gazda cardului

Generarea benzilor de rulare gazdă este un lucru pe care aproape nimeni nu îl publică și este cea care decide dacă o placă video rulează la lățimea de bandă proiectată. Noi o publicăm lângă fiecare placă video, pe pagina GPU .

Nimic nu numără octeții

Ponderări, puncte de control excluse, seturi de date introduse. Portul este necontorizat, deci o rulare de antrenament care transmite un corpus nu ajunge ca o factură de lățime de bandă la sfârșitul lunii.

Servere dedicate HPE de nivel enterprise, cu tehnologie AMD Instinct™

HPE Enterprise

Serverul dumneavoastră dedicat cu GPU AMD INSTINCT™ este alimentat de servere HPE Enterprise, asigurând performanțe stabile pentru cele mai solicitante sarcini de lucru.

Actualizări hardware

Adăugați cu ușurință resurse sau servere suplimentare la infrastructura serverelor dvs. Majoritatea actualizărilor sunt procesate în termen de 24 de ore.

Asistență 24/7

Experții în servere dedicate sunt disponibili pentru asistență 24/7 prin chat live și e-mail.

MI210 împotriva plăcilor NVIDIA pe care le folosim și noi

Patru acceleratoare din același catalog de comenzi, deci compară piesele pe care le poți pune efectiv în același coș. Cifrele lunare din ultimul rând sunt citite din acel catalog atunci când se încarcă pagina.

MI210L40SA100H100
Arhitectura GPUADNc 2Ada LovelaceNVIDIA AmperePâlnie
Memorie GPU64 GB HBM2e48 GB GDDR6 cu ECC80 GB HBM2e80 GB HBM3
Lățime de bandă a memoriei GPUPână la 1,6 TB/s864 GB/s1935 GB/s3352 GB/s
FP3222,6 TFLOPS91,6 TFLOPS19,5 TFLOPS51 TFLOPS
Nucleu tensor TF32366 TFLOPS312 TFLOPS756 TFLOPS
Matricea FP16/BF16181 TFLOPS733 TFLOPS624 TFLOPS1513 TFLOPS
PuterePână la 300WPână la 350WPână la 400WPână la 350W
Încărcare...Încărcare...Încărcare...Încărcare...

TF32 este un format NVIDIA tensor-core. CDNA 2 nu îl implementează și AMD nu publică nicio cifră pentru acesta, așa că coloana MI210 nu arată nimic acolo, ci doar un număr împrumutat de la un alt furnizor. Rândurile NVIDIA tensor-core sunt cifrele publicate cu raritate. Toate celelalte plăci pe care le instalăm, inclusiv MI50, au prețul în catalogul GPU .

Întrebări frecvente despre serverele GPU AMD Instinct

Întrebări frecvente despre implementarea și gestionarea acceleratoarelor AMD Instinct pe servere bare metal pentru sarcini de lucru bazate pe inteligență artificială, HPC și învățare automată.

Ce acceleratoare AMD Instinct pot comanda de fapt?

Două: Instinct MI210 și Instinct MI50. Acestea sunt acceleratoarele AMD din catalogul nostru de comenzi, iar configuratorul nu vă va oferi nimic altceva din linia Instinct. MI210 merge pe trei dintre liniile noastre de servere, iar MI50 pe două. Nu integrăm MI250, MI250X sau MI300A și nu am făcut-o niciodată.

Care este diferența dintre MI210 și MI50?

Generație și memorie. MI210 este arhitectura CDNA 2 de la AMD cu 104 unități de calcul și 64 GB de HBM2e la o viteză de până la 1,6 TB/s, într-o placă PCIe cu două sloturi, consumând până la 300 W printr-o legătură gazdă PCIe Gen 4, cu până la trei legături Infinity Fabric pentru traficul de la placă la placă. MI50 este generația anterioară GCN 5.1 cu 60 de unități de calcul și 16 GB. Ambele sunt ținte ROCm acceptate, deci același cod HIP și PyTorch rulează pe oricare dintre ele - MI210 conține pur și simplu de patru ori mai mult dintr-un model.

Câtă memorie pe card are nevoie modelul pe care vreau să-l rulez?

Numai ponderile sunt parametri înmulțiți cu octeți per parametru: aproximativ 16 GB pentru un model de 7-8 miliarde de parametri la 16 biți, 28 GB pentru 13-14 miliarde, 68 GB pentru 30-34 miliarde. Memoria cache KV și timpul de execuție se adaugă la acestea, motiv pentru care o placă de 16 GB nu este suficientă pentru un model cu ponderi de 16 GB. Cei 64 GB ai MI210 acoperă un model de 30 de miliarde cuantizat la 8 biți, cu spațiu de lucru. Pagina GPU are întregul tabel.

Cât durează implementarea unui server GPU AMD Instinct?

Dacă mașina este deja instalată în rack, aceasta este de obicei activată la aproximativ 30 de minute după efectuarea plății. Dacă nu este instalată, este construită la comandă, iar timpul de livrare depinde de componente. Întrebați înainte de a plăti dacă data contează - funcția „Servere instantanee” este pagina cu informațiile care se află în rack în acest moment. Fiecare server include o reîncărcare instantanee a sistemului de operare, astfel încât puteți itera fără a redeschide un tichet.

Ce software și framework-uri rulează pe aceste plăci?

ROCm, platforma de calcul GPU open-source de la AMD. Ambele părți sunt ținte ROCm suportate — gfx90a pe MI210, gfx906 pe MI50 — care acoperă PyTorch, TensorFlow, JAX și ONNX Runtime, împreună cu bibliotecile primitive BLAS, FFT, RNG și deep-learning. HIP portează codul sursă CUDA existent, fără a necesita o rescriere. Deoarece aveți root pe bare metal, puteți alege singur versiunile ROCm și kernel și puteți rula totul în Docker sau sub Kubernetes.