Akceleratory AMD Instinct

AMD Instinct na maszynie, na której nie ma nikogo innego

W naszych serwerach dedykowanych znajdują się dwa akceleratory AMD: Instinct MI210 i Instinct MI50. Karta jest przekazywana do Twojego własnego systemu operacyjnego — Twojej kompilacji ROCm, Twojego jądra, Twoich procesów i bez hiperwizora pomiędzy.

MI210: 104 jednostki obliczeniowe CDNA 2, 64 GB HBM2e. MI50: 60 jednostek obliczeniowych GCN 5.1, 16 GB. Jeden najemca na maszynę. Nie podzielony, nie współdzielony czasowo.

Każda karta, którą montujemy — AMD i NVIDIA, zarówno aktualna, jak i od dawna nieprodukowana — ma swoją miesięczną cenę w katalogu GPU .

Zmień swoje GPU w pasywny, miesięczny dochód

Masz nieużywane serwery lub konfiguracje GPU na komputerach stacjonarnych? Wystaw je już dziś na rynku Primcast i zarabiaj stałe miesięczne czynsze od zespołów AI, programistów i przedsiębiorstw potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace'u

Czym właściwie jest serwer AMD Instinct?

Serwer fizyczny wynajmowany jednemu użytkownikowi, z akceleratorem AMD w slocie PCIe i rootem w systemie operacyjnym nad nim. Karta jest pozycją na fakturze, a nie warstwą produktu, więc maszyna pod spodem nie staje się droższa z powodu tego, co jest do niej podłączone.

Karta jest twoja

Bez partycji, bez vGPU, bez harmonogramu decydującego o Twojej kolejce. Akcelerator jest przekazywany bezpośrednio do jądra, więc przypinasz własną wersję ROCm i ładujesz własne moduły bez pytania nas o zgodę.

ROCm, HIP i typowe ramy

Obie części obsługują cele ROCm – gfx90a dla MI210, gfx906 dla MI50 – na których bazują PyTorch, TensorFlow, JAX i ONNX Runtime na platformie AMD. HIP przenosi kod źródłowy CUDA, nie wymagając przepisywania kodu.

Cena nie obejmuje maszyny

Akcelerator ma swoją własną miesięczną wartość, a serwer inną, a Ty dodajesz te dwie. Wymień kartę bez zmiany serwerów. Obie wartości, dla każdej karty w katalogu, znajdują się na stronie GPU .

Dwa akceleratory AMD Instinct, które montujemy

Oba modele można już dziś zamówić w tym samym konfiguratorze, ale na różnych liniach serwerów. Poniższe dane pochodzą z własnych publikacji AMD.

Akcelerator AMD Instinct MI210

AMD Instinct MI210

Generacja CDNA 2 w standardowej, dwugniazdowej karcie PCIe o pełnej wysokości i długości — 104 jednostki obliczeniowe, 64 GB pamięci HBM2e z prędkością do 1,6 TB/s oraz maksymalnie trzy łącza Infinity Fabric do bezpośredniego przesyłu danych między kartami. Chłodzenie pasywne 300 W przez łącze hosta PCIe Gen 4. To właśnie o to pytać, gdy pytanie dotyczy tego, czy model zmieści się w pamięci.

AMD Instinct MI50

Starsza część generacji Vega: krzem GCN 5.1, 60 jednostek obliczeniowych i 16 GB pamięci wbudowanej. Nikt już nie wynajmuje tej karty, przez co jest ona niedostępna nigdzie indziej, a nie tylko tania – a do tego nadal jest wspieranym celem ROCm, więc uruchamia ten sam kod HIP i PyTorch co MI210 za ułamek miesięcznej opłaty. To rozsądny sposób na uruchomienie zestawu narzędzi ROCm przed zakupem większej karty.

Przepustowość matrycy w MI210

AMD podaje, że szczytowa wydajność matrycy FP16 i BF16 procesora MI210 wynosi 181,0 TFLOPS przy szczytowym taktowaniu silnika Boost 1700 MHz, a szczytowa wydajność wektorowa FP64 i FP32 wynosi 22,6 TFLOPS.

Pamięć jest ograniczeniem

64 GB mieści wagi modelu 8-bitowego z 30 miliardami parametrów, a 13 miliardami z 16-bitowym, z miejscem na pamięć podręczną KV. Strona GPU oblicza tę arytmetykę dla każdego rozmiaru modelu.

Co gospodarz daje kartce

Generowanie pasma hosta to fakt, którego prawie nikt nie publikuje, a który decyduje, czy karta działa z projektowaną przepustowością. Publikujemy nasze dane przy każdej karcie, na stronie poświęconej GPU .

Nic nie liczy bajtów

Wagi wchodzą, punkty kontrolne wychodzą, zestawy danych wchodzą. Port nie jest mierzony, więc przebieg treningowy przesyłający strumieniowo korpus nie jest wystawiany jako rachunek za przepustowość na koniec miesiąca.

Dedykowane serwery klasy korporacyjnej HPE z technologią AMD Instinct™

Przedsiębiorstwo HPE

Twój dedykowany serwer z procesorem graficznym AMD INSTINCT™ jest oparty na serwerach HPE Enterprise, co gwarantuje stabilną wydajność nawet przy najbardziej wymagających obciążeniach.

Ulepszenia sprzętu

Z łatwością dodawaj zasoby lub dodatkowe serwery do swojej infrastruktury serwerowej. Większość aktualizacji jest realizowana w ciągu 24 godzin.

Wsparcie 24/7

Eksperci od dedykowanych serwerów są dostępni 24 godziny na dobę, 7 dni w tygodniu, aby udzielić pomocy za pośrednictwem czatu na żywo i poczty e-mail.

MI210 w zestawieniu z kartami NVIDIA również pasuje

Cztery akceleratory z tego samego katalogu zamówień, co pozwala na porównanie części, które można faktycznie umieścić w tym samym koszyku. Miesięczne dane w ostatnim wierszu są odczytywane z tego katalogu po załadowaniu strony.

MI210L40SA100H100
Architektura GPUCDNA 2Ada LovelaceNVIDIA AmpereZbiornik
Pamięć GPU64 GB HBM2e48 GB pamięci GDDR6 z funkcją ECC80 GB HBM2e80 GB HBM3
Przepustowość pamięci GPUDo 1,6 TB/s864 GB/s1935 GB/s3352 GB/s
FP3222,6 teraflopów91,6 teraflopów19,5 teraflopów51 teraflopów
Rdzeń tensorowy TF32366 teraflopów312 teraflopów756 teraflopów
Matryca FP16/BF16181 teraflopów733 teraflopów624 teraflopów1513 teraflopów
MocDo 300 WDo 350 WDo 400 WDo 350 W
Załadunek...Załadunek...Załadunek...Załadunek...

TF32 to format rdzeni tensorowych NVIDIA. CDNA 2 go nie implementuje, a AMD nie publikuje żadnych danych na jego temat, więc kolumna MI210 nic tam nie zawiera, a jedynie liczbę zapożyczoną od innego dostawcy. Wiersze dotyczące rdzeni tensorowych NVIDIA to opublikowane dane z niewielką różnicą. Każda inna karta, którą montujemy, w tym MI50, jest wyceniona w katalogu GPU .

Najczęściej zadawane pytania dotyczące serwerów GPU AMD Instinct

Często zadawane pytania dotyczące wdrażania i zarządzania akceleratorami AMD Instinct na komputerach fizycznych w przypadku obciążeń związanych ze sztuczną inteligencją, wydajnością obliczeniową (HPC) i uczeniem maszynowym.

Które akceleratory AMD Instinct mogę zamówić?

Dwa: Instinct MI210 i Instinct MI50. To akceleratory AMD z naszego katalogu zamówień, a konfigurator nie zaoferuje żadnych innych produktów z linii Instinct. MI210 jest montowany w trzech naszych liniach serwerów, a MI50 w dwóch. Nie montujemy i nigdy nie montowaliśmy modeli MI250, MI250X ani MI300A.

Jaka jest różnica pomiędzy MI210 a MI50?

Generacja i pamięć. MI210 to architektura AMD CDNA 2 ze 104 jednostkami obliczeniowymi i 64 GB pamięci HBM2e o przepustowości do 1,6 TB/s, umieszczona na dwuslotowej karcie PCIe, pobierającej do 300 W przez łącze hosta PCIe Gen 4, z maksymalnie trzema łączami Infinity Fabric do obsługi ruchu między kartami. MI50 to wcześniejsza generacja GCN 5.1 z 60 jednostkami obliczeniowymi i 16 GB pamięci. Oba modele obsługują cele ROCm, więc na obu z nich działa ten sam kod HIP i PyTorch — MI210 po prostu mieści cztery razy więcej danych.

Ile pamięci karty potrzebuje model, który chcę uruchomić?

Same wagi to parametry pomnożone przez liczbę bajtów na parametr: około 16 GB dla modelu 16-bitowego z 7-8 miliardami parametrów, 28 GB dla 13-14 miliardów i 68 GB dla 30-34 miliardów. Pamięć podręczna KV i środowisko wykonawcze są na to nakładane, dlatego karta 16 GB nie obsługuje komfortowo modelu o wadze 16 GB. 64 GB w MI210 pokrywa model 30-miliardowy skwantyzowany do 8 bitów, dając jeszcze miejsce na działanie. Strona GPU zawiera całą tabelę.

Ile czasu zajmuje wdrożenie serwera z procesorem graficznym AMD Instinct?

Jeśli maszyna jest już zamontowana w szafie rack, jest zazwyczaj aktywowana około 30 minut po zaksięgowaniu płatności. W przeciwnym razie jest budowana na zamówienie, a czas realizacji zależy od części. Zapytaj przed zapłatą, jeśli data ma znaczenie — serwery instant to strona z informacjami o tym, co aktualnie znajduje się w szafie rack. Każdy serwer oferuje natychmiastowe przeładowanie systemu operacyjnego, dzięki czemu możesz iterować bez ponownego otwierania zgłoszenia.

Jakie oprogramowanie i struktury działają na tych kartach?

ROCm, platforma obliczeniowa GPU AMD o otwartym kodzie źródłowym. Obie części obsługują cele ROCm – gfx90a na MI210, gfx906 na MI50 – które obejmują PyTorch, TensorFlow, JAX i środowisko uruchomieniowe ONNX, a także biblioteki BLAS, FFT, RNG i prymitywne biblioteki głębokiego uczenia. HIP portuje istniejące źródła CUDA, zamiast wymagać przepisywania. Ponieważ masz root na gołym komputerze, możesz samodzielnie wybrać wersje ROCm i jądra, a całość możesz uruchomić w Dockerze lub w Kubernetesie.