Acceleratori AMD Instinct

AMD Instinct su una macchina su cui nessun altro è

Nei nostri server dedicati sono installati due acceleratori AMD: l'Instinct MI210 e l'Instinct MI50. La scheda è dedicata direttamente al sistema operativo dell'utente, comprensivo di build ROCm, kernel, processi e nessun hypervisor intermedio.

MI210: 104 unità di calcolo CDNA 2, 64 GB HBM2e. MI50: 60 unità di calcolo GCN 5.1, 16 GB. Un solo utente per macchina. Nessuna suddivisione in più postazioni, nessuna condivisione a tempo.

Ogni scheda video che installiamo, sia AMD che NVIDIA, sia attuali che fuori produzione da tempo, è elencata con il proprio prezzo mensile nel catalogo GPU .

Trasforma le tue GPU in entrate passive mensili

Possiedi server o configurazioni GPU desktop inutilizzate? Mettile in vendita oggi stesso sul marketplace di Primcast e guadagna un reddito mensile fisso da team di intelligenza artificiale, sviluppatori e aziende che necessitano di potenza di calcolo di livello professionale.

Vai al Marketplace

Ecco cos'è in realtà un server AMD Instinct.

Un server fisico noleggiato a un singolo cliente, con un acceleratore AMD in uno slot PCIe e i privilegi di root sul sistema operativo sovrastante. La scheda rappresenta una voce nella fattura anziché un livello di prodotto, quindi il costo della macchina sottostante non aumenta in base ai componenti collegati.

La carta è tua

Nessuna partizione, nessuna vGPU, nessuno scheduler che decide quando è il tuo turno. L'acceleratore viene fornito direttamente al kernel, quindi puoi impostare la tua versione di ROCm e caricare i tuoi moduli senza doverci chiedere nulla.

ROCm, HIP e i framework usuali

Entrambe le parti supportano i target ROCm — gfx90a per MI210, gfx906 per MI50 — che sono i target di PyTorch, TensorFlow, JAX e ONNX Runtime su AMD. HIP trasferisce il codice sorgente CUDA senza richiedere una riscrittura.

Prezzo separato dalla macchina

L'acceleratore ha un proprio costo mensile e il server ne ha un altro, e i due vanno sommati. È possibile sostituire la scheda senza cambiare server. Entrambi i costi, per ogni scheda presente nel catalogo, sono indicati nella pagina dedicata alla GPU .

I due acceleratori AMD Instinct che abbiamo installato

Entrambi sono ordinabili oggi dallo stesso configuratore, su linee server diverse. I dati riportati di seguito sono quelli pubblicati da AMD.

Acceleratore AMD Instinct MI210

AMD Instinct MI210

La generazione CDNA 2 in una scheda PCIe standard a doppio slot, altezza e lunghezza complete: 104 unità di calcolo, 64 GB di HBM2e fino a 1,6 TB/s e fino a tre collegamenti Infinity Fabric per il traffico diretto tra schede. Raffreddamento passivo a 300 W tramite un collegamento host PCIe Gen 4. Questa è la soluzione ideale quando la domanda principale è se il modello è compatibile con lo spazio di memoria.

AMD Instinct MI50

La versione più vecchia, di generazione Vega: chip GCN 5.1, 60 unità di calcolo e 16 GB di memoria integrata. Nessuno noleggia più questa scheda, il che la rende introvabile altrove, oltre che economica qui. Inoltre, è ancora un target ROCm supportato, quindi esegue lo stesso codice HIP e PyTorch della MI210 a una frazione del costo mensile. È la soluzione più sensata per far funzionare una toolchain ROCm prima di investire nella scheda più potente.

Velocità di elaborazione della matrice sul MI210

AMD pubblica prestazioni di picco di 181,0 TFLOPS in matrici FP16 e BF16 per il MI210 alla sua frequenza di boost massima di 1.700 MHz, insieme a prestazioni di picco di 22,6 TFLOPS in vettori FP64 e FP32.

La memoria è il vincolo

64 GB possono contenere i pesi di un modello con 30 miliardi di parametri a 8 bit, oppure quelli di un modello con 13 miliardi di parametri a 16 bit, con spazio rimanente per la cache KV. La pagina relativa alla GPU esegue questo calcolo per ciascuna dimensione del modello.

Ciò che l'ospite dà sulla carta

La generazione della banda host è un dato che quasi nessuno pubblica ed è quello che determina se una scheda funziona alla sua larghezza di banda di progetto. Noi pubblichiamo il nostro dato accanto a ogni scheda, nella pagina della GPU .

Niente conta i byte

Pesi in ingresso, checkpoint in uscita, dataset in ingresso. La porta non ha limiti di traffico, quindi un'esecuzione di training che trasmette in streaming un corpus non si traduce in una fattura per la larghezza di banda a fine mese.

Server dedicati di livello enterprise HPE basati su AMD Instinct™

HPE Enterprise

Il tuo server dedicato con GPU AMD INSTINCT™ è basato su server HPE Enterprise, garantendo prestazioni stabili anche per i carichi di lavoro più impegnativi.

Aggiornamenti hardware

Aggiungi facilmente risorse o server aggiuntivi alla tua infrastruttura server. La maggior parte degli aggiornamenti viene elaborata entro 24 ore.

Assistenza 24 ore su 24, 7 giorni su 7

Esperti di server dedicati sono disponibili per fornire assistenza 24 ore su 24, 7 giorni su 7, tramite chat live ed e-mail.

Il MI210 contro le schede NVIDIA che abbiamo montato

Quattro acceleratori dello stesso catalogo, quindi questo confronto mette a confronto componenti che è possibile inserire nello stesso carrello. I dati mensili nell'ultima riga vengono letti da quel catalogo al caricamento della pagina.

MI210L40SA100H100
Architettura GPUCDNA 2Ada LovelaceNVIDIA AmpereTramoggia
Memoria GPU64 GB HBM2e48 GB GDDR6 con ECC80 GB HBM2e80 GB HBM3
Larghezza di banda della memoria GPUFino a 1,6 TB/s864 GB/s1935 GB/s3352 GB/s
FP3222,6 TFLOPS91,6 TFLOPS19,5 TFLOPS51 TFLOPS
TF32 Tensor Core366 TFLOPS312 TFLOPS756 TFLOPS
Matrice FP16/BF16181 TFLOPS733 TFLOPS624 TFLOPS1513 TFLOPS
EnergiaFino a 300 WFino a 350 WFino a 400 WFino a 350 W
Caricamento...Caricamento...Caricamento...Caricamento...

TF32 è un formato per tensor-core di NVIDIA. CDNA 2 non lo implementa e AMD non pubblica alcun dato a riguardo, quindi la colonna MI210 non mostra alcun valore, bensì un numero preso in prestito da un altro produttore. Le righe relative ai tensor-core di NVIDIA riportano i dati pubblicati con la funzione sparsità. Tutte le altre schede che abbiamo testato, inclusa la MI50, hanno il prezzo indicato nel catalogo GPU .

Domande frequenti sui server GPU AMD Instinct

Domande frequenti sull'implementazione e la gestione degli acceleratori AMD Instinct su hardware fisico per carichi di lavoro di intelligenza artificiale, calcolo ad alte prestazioni (HPC) e apprendimento automatico.

Quali acceleratori AMD Instinct posso effettivamente ordinare?

Due: l'Instinct MI210 e l'Instinct MI50. Questi sono gli acceleratori AMD presenti nel nostro catalogo e il configuratore non vi proporrà altri modelli della linea Instinct. L'MI210 viene installato su tre delle nostre linee di server e l'MI50 su due. Non installiamo, e non abbiamo mai installato, l'MI250, l'MI250X o l'MI300A.

Qual è la differenza tra il MI210 e il MI50?

Generazione e memoria. La MI210 è basata sull'architettura CDNA 2 di AMD, con 104 unità di calcolo e 64 GB di HBM2e fino a 1,6 TB/s, su una scheda PCIe a doppio slot che assorbe fino a 300 W tramite un collegamento host PCIe Gen 4, con un massimo di tre collegamenti Infinity Fabric per il traffico tra schede. La MI50 è basata sulla precedente generazione GCN 5.1, con 60 unità di calcolo e 16 GB. Entrambe sono target ROCm supportati, quindi lo stesso codice HIP e PyTorch funziona su entrambe: la MI210 può semplicemente contenere quattro volte più dati di un modello.

Di quanta memoria su scheda ha bisogno il modello che voglio eseguire?

I soli pesi sono parametri moltiplicati per byte per parametro: circa 16 GB per un modello con 7-8 miliardi di parametri a 16 bit, 28 GB per 13-14 miliardi, 68 GB per 30-34 miliardi. La cache KV e il runtime si aggiungono a questo, motivo per cui una scheda da 16 GB non è sufficiente per un modello i cui pesi occupano 16 GB. I 64 GB della MI210 coprono un modello da 30 miliardi di parametri quantizzato a 8 bit con ampio margine di manovra. La pagina relativa alla GPU contiene la tabella completa.

Quanto tempo occorre per implementare un server GPU AMD Instinct?

Se la macchina è già installata in un rack, l'attivazione avviene in genere circa 30 minuti dopo la conferma del pagamento. Se non lo è, viene assemblata su ordinazione e i tempi di consegna dipendono dai componenti. Se la data di consegna è importante, chiedi informazioni prima di pagare: la pagina "Instant Servers" mostra i server attualmente disponibili in un rack. Ogni server include il ripristino istantaneo del sistema operativo, che consente di effettuare iterazioni senza dover riaprire un ticket.

Quali software e framework vengono eseguiti su queste schede?

ROCm, la piattaforma di calcolo GPU open-source di AMD. Entrambe le parti supportano i target ROCm — gfx90a sulla MI210, gfx906 sulla MI50 — che includono PyTorch, TensorFlow, JAX e ONNX Runtime, insieme alle librerie primitive BLAS, FFT, RNG e deep learning. HIP porta il codice sorgente CUDA esistente senza richiederne la riscrittura. Avendo i privilegi di root sull'hardware, è possibile scegliere autonomamente le versioni di ROCm e del kernel ed eseguire l'intero sistema in Docker o su Kubernetes.