H100 80 GB · A100 80 GB · A100 40 GB

Acceleratoarele — și ce nu vor face

Trei plăci video construite pentru o singură sarcină: să țină un model și să facă calcule matematice pe el, mai rapid decât orice altceva de aici. Au memorie suprapusă, corecție de erori și capacitatea de a se combina între ele. Nu au ieșire de afișare și nici encoder video — nici unul lent, nicidecum — iar a ști asta înainte de a comanda valorează mai mult decât orice test de pe această pagină.

40 și 80 GB Memorie stivuită, ECC Fără codificator video

Două lucruri care surprind oamenii

Nu pot codifica videoclipuri. Deloc.

Matricea proprie de suport pentru codare și decodare NVIDIA înregistrează zero motoare NVENC pe A100 și zero pe H100. Acestea decodează - cinci motoare pe A100, șapte pe H100 - dar nu există niciun encoder pe placă, așa că fiecare cadru produs de aceste plăci trebuie să fie codificat de procesor. Dacă pipeline-ul dvs. are ieșire video, acesta este raftul greșit, iar L40S cu cele trei encodere AV1 ale sale este cel corect. Aceasta este o pagină la /l40s .

Aceste plăci nu au nici ieșiri de afișare. Sunt componente de calcul fără headphones. Nimic din ceea ce se așteaptă la un framebuffer - un desktop virtual, o stație de lucru la distanță, un server de jocuri - nu își are locul pe ele.

A100 nu este învechit, iar cardul de 40 GB nu este o greșeală.

A100 este generația anterioară și are o rată de citire de 1.555 GB/s cu 40 GB și 1.935 GB/s cu 80 GB. Pentru un model compatibil, rata de citire decide câte jetoane pe secundă primești și rămâne mult peste orice card ne-stivuit din catalog. Cardul de 40 GB poate stoca confortabil un model de treizeci de miliarde de parametri la o precizie de opt biți, ceea ce reprezintă cea mai mare parte din costul real al utilizatorilor, la o fracțiune din prețul lunar al H100.

Cumpărați H100 atunci când modelul are nevoie cu adevărat de Hopper — motorul transformator, FP8, noile unități tensoriale — sau când rularea trebuie să se termine mai devreme, în loc să se termine pur și simplu. Cumpărați un A100 atunci când întrebarea este dacă se potrivește și cât de repede citește, aceasta fiind întrebarea mai frecventă.

Specificațiile, așa cum sunt publicate

Cifre din fișele tehnice proprii ale NVIDIA și tabelele cu specificațiile Tesla, citate în sursa acestei pagini. În cazul în care nu s-a putut obține o cifră pentru piesa exactă pe care am potrivit-o, această pagină nu afișează nimic, ci doar o estimare.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

H100 nu afișează niciun număr de nuclee și nicio lățime de bandă mai sus, iar acest lucru este intenționat. Partea noastră este înregistrată în stoc sub un număr de nuclee aparținând modulului SXM, care este o placă care se fixează pe o placă de bază în loc să fie într-un slot; memoria HBM2e de 80 GB pe care o înregistrează aparține plăcii PCIe, care este cea care intră de fapt în aceste mașini. În loc să aleagă una și să o imprime cu încredere, pagina imprimă memoria asupra căreia ambele surse sunt de acord și omite restul. Întrebați-ne și vă vom spune exact ce placă va fi montată în a dvs.

La ce sunt buni

O treabă, făcută mai bine decât orice altceva de pe acest site.

Citirea rapidă a greutăților

Memoria stivuită este diferența dintre acest raft și toate celelalte. Odată ce un model este rezident, viteza de generare este guvernată de cât de repede poate cardul să-și citească propriile ponderi, iar acestea sunt citite de o dată și jumătate până la două ori mai repede decât cel mai rapid card nestivuit pe care l-am instalat.

Gruparea într-un singur spațiu de adrese

Aceste componente au NVLink, așadar două dintre ele dintr-o singură mașină pot fi configurate să se comporte ca un singur pool mai mare, în loc de două pool-uri separate. Plăcile pentru stațiile de lucru și cele pentru consumatori din catalog nu pot face acest lucru deloc. Este o versiune pe care o cotăm, nu o opțiune de finalizare a comenzii.

Alergând săptămâni întregi nesupravegheat

Corecție de erori pe tot parcursul procesului și hardware construit pentru încărcare continuă, mai degrabă decât pentru rafale. Pentru o perioadă de antrenament măsurată în săptămâni cu investiții reale, aceasta nu este o caracteristică de lux.

Fiind doar al tău

Un singur chiriaș per mașină fizică, iar placa trecea direct prin ea — fără partiție MIG, fără profil vGPU, fără planificator de time-slicing și nimeni altcineva nu avea sarcina de a o gestiona. În alte locuri, o „instanță A100” este adesea o porțiune dintr-o instanță.

Cei trei unul lângă altul, și ce stă deasupra

De pe rafturile noastre. Toate acestea pot fi comandate astăzi, în aceeași carcasă, așa că întrebarea este care merită diferența.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Ultimul rând este acolo deoarece este o comparație sinceră, iar majoritatea listărilor o ascund: RTX PRO 6000 Blackwell are 96 GB, mai mult decât orice accelerator de pe această pagină. Citiți memoria și valoarea sa în raport cu H100 în tabelul de mai sus, în loc să ne credeți pe cuvânt. Ceea ce renunță este rata de citire și NVLink; ceea ce câștigă sunt patru encodere video și ray tracing. Dacă întrebarea dvs. este dacă se potrivește , citiți /rtx60 înainte de a vă angaja pentru acest raft.

În ce mașină intră și ce legătură ajung acolo

A100 este o placă PCIe Gen 4, iar H100 este Gen 5, în timp ce platformele noastre sunt Gen 3 și Gen 4. Prin urmare, H100 nu primește niciodată magistrala completă pentru care a fost proiectată pe niciun computer pe care îl folosim, iar această pagină spune acest lucru, în loc să vă lase pe voi să aflați.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Costul acestui lucru depinde în întregime de forma lucrării. Un punct final de inferență ale cărui ponderi sunt rezidente abia atinge slotul și nu va observa. O buclă de antrenament care transmite un lot nou din memoria gazdă la fiecare pas va observa la fiecare pas. Dacă nu sunteți sigur care dintre ele sunteți, spuneți-ne ce este lucrarea înainte de a comanda - aceasta decide mașina, nu cardul.

Ce încape de fapt în 80 GB

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

A100 de 40 GB are aceeași tabelă cu o treaptă mai jos: un model cu treizeci până la treizeci și patru de miliarde de parametri la o precizie de opt biți, același model la șaisprezece biți nu se potrivește. Un model de șaptezeci de miliarde la șaisprezece biți nu se potrivește cu nicio placă pe care o vindem - aceasta este o configurație cu două plăci și motivul pentru care linia NVLink de mai sus contează.

Cât costă, cu mașinile în care intră

Cartela este pe o linie de pe factură, iar aparatul pe alta. Ambele jumătăți de mai jos provin dintr-o singură citire a catalogului de comenzi, așadar prețul și specificațiile de lângă acesta aparțin întotdeauna unul celuilalt.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Lățimea de bandă este nelimitată în ambele direcții, fără nicio taxă de ieșire, care pe acest raft este de obicei cel mai mare cost ascuns în alte părți - o rulare de antrenament care extrage un set de date și trimite puncte de control în afara acestuia mută foarte mulți octeți, iar lățimea de bandă este taxată per gigabyte pentru fiecare dintre ele. Este inclusă o adresă IPv4, nu există contract, iar termenul implicit este o lună. Pentru fiecare altă placă pe care o instalăm, la același preț, citiți întregul catalog, la prețul ... Pentru mașinile instalate în rack și gata de utilizare astăzi, /instant ...

Întrebări pe care oamenii le pun de fapt despre aceste cărți

Pot transcoda videoclipuri pe un A100 sau un H100?

Nu în hardware. Niciuna dintre plăci nu are encoder — matricea de suport NVIDIA nu înregistrează niciun motor NVENC pe ambele — deci codarea revine procesorului și rulează la viteza procesorului. Acestea decodează, așa că o pipeline care citește videoclipul și produce altceva decât video este suficientă. Dacă aveți nevoie de cadre pe secundă, L40S are trei encodere AV1 și este mult mai ieftin: /l40s .

Cardul este împărțit în instanțe MIG?

Nu de către noi. Vei primi întreaga placă fizică transmisă propriului sistem de operare, pe o mașină fără altcineva pe ea. Aceste componente sunt compatibile cu MIG, așa că poți partiționa propria placă dacă dorești; aceasta este decizia ta pe propria mașină, nu ceva ce se face înainte de a ajunge la tine. Merită să verifici acest lucru oriunde altundeva cumperi - multe oferte „A100” sunt o porțiune dintr-o singură placă.

A100 40 GB sau 80 GB?

Capacitatea mai întâi, apoi rata de citire. Dacă modelul și contextul său se încadrează în patruzeci de gigaocteți, cu încă un al cincilea rămas, cardul mai mic este o achiziție mai bună, iar scara de mai sus arată diferența. Cardul de 80 GB citește și mai rapid — 1.935 GB/s față de 1.555 — așa că, dacă sunteți aproape de plafonul fie în ceea ce privește capacitatea, fie în ceea ce privește debitul, alegeți-l pe cel mai mare.

Ce driver și versiune de CUDA primesc?

Indiferent ce instalați. Mașina sosește cu un sistem de operare curat și cu dreptul root, iar dumneavoastră conectați driverul, versiunea CUDA și versiunea framework la codul cu care a fost testat. Nimic nu se actualizează sub comanda dumneavoastră. Dacă preferați ca driverul să fie instalat înainte de predare, specificați acest lucru în comandă și denumiți versiunea.

Cât de curând pot avea unul?

Acestea sunt piesele care sunt cel mai probabil cumpărate în stoc, nu montate din stoc, și vi se spune care dintre ele înainte de a plăti, nu după. Un accelerator de generație actuală la alocare reprezintă cel mai lung termen de livrare pe care îl cotăm. /instant listează mașinile instalate și gata chiar acum.