H100 80 GB · A100 80 GB · A100 40 GB

Gli acceleratori — e cosa non faranno

Tre schede costruite per un unico compito: ospitare un modello ed eseguirvi calcoli, più velocemente di qualsiasi altra cosa qui. Hanno memoria impilata, correzione degli errori e la capacità di aggregarsi tra loro. Non hanno uscita video né encoder video — non uno lento, nessuno — e saperlo prima di ordinare vale più di qualsiasi benchmark su questa pagina.

40 e 80 GB Memoria impilata, ECC Nessun encoder video

Trasforma le tue GPU in entrate mensili passive

Hai configurazioni GPU server o desktop inattive? Pubblicarle oggi sul marketplace Primcast e guadagna affitti mensili costanti da team AI, sviluppatori e aziende che necessitano di calcolo di livello produttivo.

Vai al Marketplace

Due cose che sorprendono le persone

Non possono codificare video. Per niente.

La matrice di supporto di codifica e decodifica di NVIDIA registra zero motori NVENC sull'A100 e zero sull'H100. Decodificano — cinque motori sull'A100, sette sull'H100 — ma non c'è alcun encoder sulla scheda, quindi ogni fotogramma prodotto da queste schede deve essere codificato dal processore. Se la tua pipeline produce video, questo è lo scaffale sbagliato, e l'L40S con i suoi tre encoder AV1 è quello giusto. È una pagina più in là su /l40s.

Queste schede non hanno nemmeno uscite display. Sono componenti di calcolo headless. Nulla che si aspetti un framebuffer — un desktop virtuale, una workstation remota, un server di gioco — appartiene a loro.

L'A100 non è obsoleto, e la scheda da 40 GB non è un errore

L'A100 è la generazione precedente, e legge i suoi pesi a 1.555 GB/s con 40 GB e 1.935 GB/s con 80 GB. Per un modello che ci sta, quella velocità di lettura è ciò che decide quanti token al secondo ottieni, e rimane di gran lunga superiore a ogni scheda non impilata del catalogo. La scheda da 40 GB ospita comodamente un modello da trenta miliardi di parametri a precisione a otto bit, che è la maggior parte di ciò che le persone effettivamente servono, a una frazione di quanto costa l'H100 ogni mese.

Compra l'H100 quando il modello ha davvero bisogno di Hopper — il transformer engine, FP8, le unità tensor più recenti — o quando l'esecuzione deve finire prima anziché semplicemente finire. Compra un A100 quando la domanda è se ci sta e quanto velocemente legge, che è la domanda più comune.

Le specifiche, come pubblicate

Dati dai datasheet di NVIDIA e dalle tabelle delle specifiche Tesla, citati nel sorgente di questa pagina. Dove un dato non è stato verificabile rispetto all'esatta parte che installiamo, questa pagina non stampa nulla invece di un'ipotesi.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

L'H100 non mostra sopra né numero di core né larghezza di banda, ed è voluto. La nostra parte è registrata nello store con un numero di core appartenente al modulo SXM, che è una scheda che si fissa a una scheda madre anziché in uno slot; la memoria HBM2e da 80 GB che registra appartiene alla scheda PCIe, che è ciò che va effettivamente in queste macchine. Invece di sceglierne uno e stamparlo con sicurezza, la pagina stampa la memoria su cui entrambe le fonti concordano e omette il resto. Chiedici e ti diremo esattamente quale scheda andrà nella tua.

In cosa sono brave

Un compito, svolto meglio di qualsiasi altra cosa su questo sito.

Leggere i pesi rapidamente

La memoria impilata è la differenza tra questo scaffale e tutti gli altri. Una volta che un modello è residente, la velocità di generazione è governata da quanto velocemente la scheda può leggere i propri pesi, e queste leggono da una volta e mezza a due volte più velocemente della più rapida scheda non impilata che installiamo.

Aggregarsi in un unico spazio di indirizzamento

Queste parti dispongono di NVLink, quindi due di esse in una macchina possono comportarsi come un unico pool più grande anziché due separati. Le schede workstation e consumer del catalogo non possono farlo affatto. È una configurazione che quotiamo piuttosto che un'opzione di checkout.

Funzionare per settimane senza supervisione

Correzione degli errori ovunque, e hardware costruito per carico continuo anziché per picchi. Per un addestramento misurato in settimane con denaro reale dietro, non è una caratteristica di lusso.

Essere solo tue

Un solo tenant per macchina fisica e la scheda passata direttamente — nessuna partizione MIG, nessun profilo vGPU, nessuno scheduler a time-slicing e nessun lavoro di altri su di essa. Altrove un'“istanza A100” è spesso una fetta di una.

Le tre fianco a fianco, e cosa sta sopra

Dai nostri scaffali. Tutte queste sono ordinabili oggi, nello stesso chassis, quindi la domanda è quale valga la differenza.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

L'ultima riga è lì perché è il confronto onesto e la maggior parte degli annunci lo nasconde: la RTX PRO 6000 Blackwell ha 96 GB, più di qualsiasi acceleratore su questa pagina. Leggi la sua memoria e il suo costo rispetto a quelli dell'H100 nella tabella sopra anziché fidarti della nostra parola per entrambi. Ciò a cui rinuncia è la velocità di lettura e NVLink; ciò che guadagna sono quattro encoder video e il ray tracing. Se la tua domanda è ci starà, leggi /rtx60 prima di impegnarti su questo scaffale.

In quale macchina vanno, e quale collegamento ottengono lì

L'A100 è una scheda PCIe Gen 4 e l'H100 è Gen 5, mentre le nostre piattaforme sono Gen 3 e Gen 4. L'H100 quindi non ottiene mai il bus completo per cui è stato progettato su nessuna macchina che gestiamo, e questa pagina lo dice invece di lasciartelo scoprire.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Se questo ti costa qualcosa dipende interamente dalla forma del lavoro. Un endpoint di inferenza con pesi residenti tocca appena lo slot e non se ne accorgerà. Un ciclo di addestramento che trasmette un nuovo batch dalla memoria host a ogni passo se ne accorgerà a ogni passo. Se non sei sicuro di quale sei, dicci qual è il lavoro prima di ordinare — decide la macchina, non la scheda.

Cosa sta davvero in 80 GB

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

L'A100 da 40 GB contiene la stessa tabella un gradino più in basso: un modello da trenta a trentaquattro miliardi di parametri ci sta con margine solo a quattro bit, e a otto bit i suoi 34 GB di pesi non superano nemmeno la soglia più stretta. Un modello da settanta miliardi a sedici bit non sta in nessuna singola scheda che vendiamo — è una configurazione a due schede, e il motivo per cui la riga NVLink sopra conta.

Quella tabella risponde a “cosa sta in questa scheda”. La domanda al contrario — quanta memoria serve a un modello, e quale scheda la supera — è una pagina a sé.

Quanto costano, con le macchine in cui vanno

La scheda è una riga sulla fattura e la macchina un'altra. Entrambe le metà qui sotto provengono da un'unica lettura del catalogo ordini, quindi il prezzo e la specifica accanto appartengono sempre l'uno all'altra.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

La larghezza di banda è senza limiti in entrambe le direzioni senza costi di uscita, che su questo scaffale è di solito il costo nascosto più grande altrove — un addestramento che scarica un dataset e carica checkpoint sposta moltissimi byte, e l'uscita per gigabyte viene addebitata su ognuno di essi. Un indirizzo IPv4 è incluso, non c'è contratto e un mese è il termine predefinito. Per ogni altra scheda che installiamo, prezzata allo stesso modo, leggi l'intero catalogo, prezzato. Per macchine montate e pronte oggi, /instant.

Domande che le persone fanno davvero su queste schede

Posso transcodificare video su un A100 o un H100?

Non in hardware. Nessuna delle due schede ha un encoder — la matrice di supporto di NVIDIA registra zero motori NVENC su entrambe — quindi la codifica ricade sul processore e va alla velocità del processore. Decodificano, quindi una pipeline che legge video e produce qualcosa di diverso dal video va bene. Se ti servono fotogrammi in uscita, l'L40S ha tre encoder AV1 ed è molto più economico: /l40s. Quanti canali live porta una scheda, e la macchina in cui va: /transcoding.

La scheda è suddivisa in istanze MIG?

Non da noi. Ottieni l'intera scheda fisica passata al tuo sistema operativo, su una macchina senza nessun altro. Queste parti supportano MIG, quindi puoi partizionare la tua scheda se vuoi; è una tua decisione sulla tua macchina, non qualcosa fatto ad essa prima che ti arrivi. Vale la pena verificarlo ovunque altro tu acquisti — moltissime offerte “A100” sono una fetta di una.

A100 40 GB o 80 GB?

Prima la capacità, poi la velocità di lettura. Se il modello e il suo contesto stanno in quaranta gigabyte con un quinto di margine, la scheda più piccola è l'acquisto migliore e la scala sopra mostra il divario. La scheda da 80 GB legge anche più velocemente — 1.935 GB/s contro 1.555 — quindi se sei vicino al limite su capacità o throughput, prendi quella più grande.

Quale driver e versione CUDA ottengo?

Quello che installi tu. La macchina arriva con un sistema operativo pulito e root, e blocchi il driver, la release CUDA e la build del framework a ciò contro cui il tuo codice è stato testato. Nulla si aggiorna sotto di te. Se preferisci che il driver sia installato prima della consegna, dillo nell'ordine e indica la versione.

Quanto presto posso averne una?

Queste sono le parti più probabili da acquistare su ordinazione piuttosto che installate da stock, e ti viene detto quale prima di pagare anziché dopo. Un acceleratore di generazione attuale in allocazione è il tempo di consegna più lungo che quotiamo. /instant elenca macchine montate e pronte adesso.