H100 80 GB · A100 80 GB · A100 40 GB

Gli acceleratori e ciò che non faranno

Tre schede progettate per un unico scopo: memorizzare un modello ed eseguire operazioni aritmetiche su di esso, più velocemente di qualsiasi altra soluzione presente in questa pagina. Sono dotate di memoria impilata, correzione degli errori e capacità di aggregazione di dati. Non dispongono di uscita video né di un encoder video (non lento, ovviamente), e saperlo prima di ordinarle vale più di qualsiasi benchmark presente in questa pagina.

40 e 80 GB Memoria impilata, ECC Nessun codificatore video

Due cose che sorprendono le persone

Non sono in grado di codificare i video. Assolutamente no.

La matrice di supporto per la codifica e la decodifica di NVIDIA non riporta alcun motore NVENC sulla A100 e nessuno sulla H100. Entrambe le schede supportano la decodifica (cinque motori sulla A100 e sette sulla H100), ma non dispongono di un encoder integrato, quindi ogni frame prodotto da queste schede deve essere codificato dal processore. Se la vostra pipeline prevede l'uscita video, questa scheda non è adatta al vostro caso; la L40S, con i suoi tre encoder AV1, è quella giusta. La trovate nella pagina successiva, /l40s .

Queste schede non dispongono di uscite video. Sono unità di elaborazione senza interfaccia grafica. Nessun programma che richieda un framebuffer, come un desktop virtuale, una workstation remota o un server di gioco, può essere eseguito su di esse.

L'A100 non è obsoleto e la scheda da 40 GB non è un errore.

La A100 è la generazione precedente e legge i suoi pesi a 1.555 GB/s con 40 GB e a 1.935 GB/s con 80 GB. Per un modello compatibile, questa velocità di lettura determina quanti token al secondo si ottengono e rimane di gran lunga superiore a qualsiasi altra scheda non impilabile presente nel catalogo. La scheda da 40 GB può contenere comodamente un modello con trenta miliardi di parametri a otto bit di precisione, che è la maggior parte di ciò che viene effettivamente utilizzato, a una frazione del costo mensile della H100.

Acquistate l'H100 quando il modello necessita effettivamente di Hopper (ad esempio, il motore Transformer, FP8 o le unità Tensor più recenti) o quando la stampa deve essere completata prima del previsto. Acquistate un A100 quando la domanda più frequente è se la stampante è compatibile e quanto è veloce nella lettura.

Le specifiche, come pubblicate

I dati provengono dalle schede tecniche di NVIDIA e dalle tabelle delle specifiche di Tesla, citate nella fonte di questa pagina. Laddove non sia stato possibile reperire un dato specifico per il componente utilizzato, questa pagina non riporta alcun valore, ma solo una stima.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

La scheda H100 non riporta né il numero di core né la larghezza di banda, e questo è voluto. Il nostro componente è registrato nel catalogo con un numero di core corrispondente al modulo SXM, una scheda che si fissa alla scheda madre anziché a uno slot; la memoria HBM2e da ​​80 GB anch'essa registrata appartiene alla scheda PCIe, che è quella effettivamente installata in questi computer. Invece di selezionarne una e stamparla con certezza, la pagina riporta la memoria su cui entrambe le fonti concordano, omettendo le altre. Contattateci e vi diremo esattamente quale scheda verrà installata nel vostro computer.

In cosa sono bravi

Un lavoro, svolto meglio di qualsiasi altra cosa su questo sito.

Leggere rapidamente i pesi

La memoria impilata è ciò che distingue questo scaffale da tutti gli altri. Una volta che un modello è residente, la velocità di generazione è determinata dalla velocità con cui la scheda può leggere i propri pesi, e queste schede leggono da una volta e mezza a due volte più velocemente rispetto alla scheda non impilata più veloce che abbiamo installato.

Raggruppamento in un unico spazio di indirizzi

Queste schede supportano NVLink, quindi due di esse in una singola macchina possono essere configurate per funzionare come un unico pool più grande anziché come due pool separati. Le schede per workstation e utenti consumer presenti nel catalogo non offrono questa funzionalità. Si tratta di una configurazione che viene preventivata, non di un'opzione disponibile all'acquisto.

In funzione da settimane senza supervisione

Correzione degli errori continua e hardware progettato per un carico costante piuttosto che per picchi di utilizzo. Per un percorso di formazione che si misura in settimane e in cui si investe denaro reale, questa non è una caratteristica di lusso.

Essere solo tuo

Un tenant per macchina fisica e la scheda passa direttamente: nessuna partizione MIG, nessun profilo vGPU, nessuno scheduler di time-slicing e nessun altro job su di essa. Altrove, un'"istanza A100" è spesso una porzione di una sola istanza.

I tre fianco a fianco, e ciò che sta sopra

Dai nostri scaffali. Tutti questi modelli sono ordinabili oggi, nello stesso chassis, quindi la domanda è: quale vale la pena di spendere la differenza?

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

L'ultima riga è presente perché rappresenta un confronto onesto, che la maggior parte delle schede video nasconde: la RTX PRO 6000 Blackwell ha 96 GB di memoria, più di qualsiasi altro acceleratore presente in questa pagina. Confrontate la sua memoria e il suo prezzo con quelli dell'H100 nella tabella sopra, invece di fidarvi ciecamente delle nostre affermazioni. Ciò che perde è la velocità di lettura e NVLink; ciò che guadagna sono quattro encoder video e il ray tracing. Se vi state chiedendo se ci starà , leggete /rtx60 prima di decidere per questo chassis.

In quale macchina entrano e quale collegamento ottengono lì

La A100 è una scheda PCIe di quarta generazione (Gen 4) e la H100 è di quinta generazione (Gen 5), mentre le nostre piattaforme sono di terza e quarta generazione (Gen 3 e Gen 4). Pertanto, la H100 non raggiunge mai la piena velocità del bus per cui è stata progettata su nessuna delle macchine che utilizziamo, e questa pagina lo specifica chiaramente, senza lasciare che sia l'utente a scoprirlo da solo.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Che questo comporti un costo dipende interamente dalla tipologia di lavoro. Un endpoint di inferenza i cui pesi sono residenti incide a malapena sullo slot e non se ne accorgerà. Un ciclo di training che carica un nuovo batch dalla memoria host a ogni passo, invece, se ne accorgerà a ogni passo. Se non sei sicuro di quale sia la tua situazione, comunicaci di cosa si tratta prima di ordinare: è questo che determina la macchina, non la scheda.

Cosa entra davvero in 80 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La A100 da 40 GB mantiene la stessa tabella un gradino più in basso: un modello da trenta a trentaquattro miliardi di parametri con precisione a otto bit ci sta, lo stesso modello a sedici bit no. Un modello da settanta miliardi a sedici bit non entra in nessuna delle schede che vendiamo: si tratta di una configurazione a due schede, ed è per questo che la linea NVLink menzionata sopra è importante.

Quanto costano, con le macchine in cui entrano

La scheda tecnica è riportata su una riga della fattura, mentre la macchina su un'altra. Entrambe le parti sottostanti derivano da una singola lettura del catalogo ordini, pertanto il prezzo e le specifiche che lo accompagnano si riferiscono sempre l'uno all'altro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

La larghezza di banda è illimitata in entrambe le direzioni e non prevede costi di uscita, che in genere rappresentano il costo nascosto maggiore in altri contesti: un'esecuzione di training che carica un dataset e invia checkpoint trasferisce un gran numero di byte, e per ognuno di essi viene addebitato un costo di uscita per gigabyte. È incluso un indirizzo IPv4, non è previsto alcun contratto e la durata predefinita è di un mese. Per tutte le altre schede che installiamo, con lo stesso prezzo, consultare il catalogo completo . Per le macchine installate e pronte oggi stesso, /instant .

Domande che le persone si pongono realmente su queste carte

Posso transcodificare un video su un A100 o un H100?

Non a livello hardware. Nessuna delle due schede ha un encoder — la matrice di supporto NVIDIA non registra alcun motore NVENC su entrambe — quindi la codifica è affidata al processore e viene eseguita alla velocità del processore. Decodificano, quindi una pipeline che legge il video e produce qualcosa di diverso dal video va bene. Se hai bisogno di frame in uscita, la L40S ha tre encoder AV1 ed è molto più economica: /l40s .

La scheda è suddivisa in istanze MIG?

Non da parte nostra. Riceverete l'intera scheda fisica collegata al vostro sistema operativo, su una macchina senza altri dispositivi installati. Queste schede supportano il MIG, quindi potete partizionarle a vostro piacimento; questa è una vostra decisione e viene presa sulla vostra macchina, non è qualcosa che viene fatto prima che vi arrivi. Vale la pena verificare questo aspetto ovunque facciate acquisti: molte offerte "A100" sono in realtà una singola partizione.

A100 40 GB o 80 GB?

Prima la capacità, poi la velocità di lettura. Se il modello e il suo contesto rientrano in 40 gigabyte con un quinto di spazio libero, la scheda più piccola è l'acquisto migliore e la scala qui sopra mostra la differenza. La scheda da 80 GB è anche più veloce in lettura (1.935 GB/s contro 1.555), quindi se siete vicini al limite di capacità o di velocità di trasferimento, scegliete quella più grande.

Quale driver e quale versione di CUDA devo utilizzare?

Qualunque cosa tu scelga di installare. La macchina arriva con un sistema operativo e un root puliti, e tu devi bloccare il driver, la versione di CUDA e la build del framework a quelle con cui è stato testato il tuo codice. Nulla viene aggiornato automaticamente. Se preferisci che il driver venga installato prima della consegna, specificalo nell'ordine e indica la versione.

Quando potrò averne uno?

Questi sono i componenti che con maggiore probabilità verranno acquistati anziché installati a magazzino, e vi verrà comunicato quali prima del pagamento, non dopo. Un acceleratore di ultima generazione in fase di assegnazione ha il tempo di consegna più lungo che possiamo indicare. /instant elenca le macchine installate e pronte all'uso in questo momento.