H100 80 GB · A100 80 GB · A100 40 GB

Die Beschleuniger — und was sie nicht tun werden

Drei Karten, gebaut für eine Aufgabe: ein Modell zu halten und darauf zu rechnen, schneller als alles andere hier. Sie haben gestapelten Speicher, Fehlerkorrektur und die Fähigkeit, sich miteinander zu einem Pool zusammenzuschließen. Sie haben keinen Bildschirmausgang und keinen Video-Encoder — keinen langsamen, gar keinen — und das vor der Bestellung zu wissen, ist mehr wert als jeder Benchmark auf dieser Seite.

40 und 80 GB Gestapelter Speicher, ECC Kein Video-Encoder

Verwandeln Sie Ihre GPUs in passives monatliches Einkommen

Haben Sie ungenutzte Server- oder Desktop-GPU-Setups? Listen Sie sie noch heute auf dem Primcast-Marktplatz und erzielen Sie stetige monatliche Mieteinnahmen von KI-Teams, Entwicklern und Unternehmen, die produktionsreife Rechenleistung benötigen.

Zum Marktplatz

Zwei Dinge, die Menschen überraschen

Sie können kein Video encodieren. Überhaupt nicht.

NVIDIAs eigene Encode- und Decode-Unterstützungsmatrix verzeichnet null NVENC-Engines auf der A100 und null auf der H100. Sie decodieren — fünf Engines auf der A100, sieben auf der H100 — aber es gibt keinen Encoder auf der Platine, daher muss jedes Bild, das diese Karten erzeugen, stattdessen vom Prozessor encodiert werden. Wenn aus Ihrer Pipeline Video herauskommt, ist dies das falsche Regal, und die L40S mit ihren drei AV1-Encodern ist das richtige. Das ist eine Seite weiter unter /l40s.

Diese Karten haben auch keine Bildschirmausgänge. Sie sind headless Compute-Teile. Nichts, das einen Framebuffer erwartet — ein virtueller Desktop, eine Remote-Workstation, ein Spieleserver — gehört auf sie.

Die A100 ist nicht veraltet, und die 40-GB-Karte ist kein Fehler

Die A100 ist die vorherige Generation, und sie liest ihre Gewichte mit 1.555 GB/s bei 40 GB und 1.935 GB/s bei 80 GB. Für ein Modell, das hineinpasst, entscheidet diese Leserate, wie viele Tokens pro Sekunde Sie erhalten, und sie bleibt weit vor jeder nicht gestapelten Karte im Katalog. Die 40-GB-Karte hält ein Dreißig-Milliarden-Parameter-Modell bequem in Acht-Bit-Präzision, was das meiste ist, was die Leute tatsächlich bereitstellen, zu einem Bruchteil dessen, was die H100 monatlich kostet.

Kaufen Sie die H100, wenn das Modell wirklich Hopper braucht — die Transformer-Engine, FP8, die neueren Tensor-Einheiten — oder wenn der Lauf eher fertig sein muss als nur fertig. Kaufen Sie eine A100, wenn die Frage ist, ob es hineinpasst und wie schnell es liest, was die häufigere Frage ist.

Die Spezifikationen, wie veröffentlicht

Zahlen aus NVIDIAs eigenen Datenblättern und den Tesla-Spezifikationstabellen, zitiert im Quelltext dieser Seite. Wo eine Zahl nicht gegen das exakte Teil, das wir einbauen, belegt werden konnte, druckt diese Seite nichts statt einer Vermutung.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

Die H100 zeigt oben keine Kernanzahl und keine Bandbreite, und das ist Absicht. Unser Teil ist im Shop unter einer Kernanzahl erfasst, die zum SXM-Modul gehört, das eine Karte ist, die an eine Basisplatine geschraubt wird statt in einen Steckplatz; der 80 GB HBM2e-Speicher, den es ebenfalls erfasst, gehört zur PCIe-Karte, die tatsächlich in diese Maschinen eingebaut wird. Statt eine Zahl zu wählen und sie selbstbewusst zu drucken, druckt die Seite den Speicher, auf den sich beide Quellen einigen, und lässt den Rest weg. Fragen Sie uns, und wir sagen Ihnen genau, welche Platine in Ihre kommt.

Worin sie gut sind

Eine Aufgabe, besser erledigt als von allem anderen auf dieser Seite.

Gewichte schnell lesen

Gestapelter Speicher ist der Unterschied zwischen diesem Regal und jedem anderen. Sobald ein Modell resident ist, wird die Generierungsgeschwindigkeit davon bestimmt, wie schnell die Karte ihre eigenen Gewichte lesen kann, und diese lesen eineinhalb- bis zweimal schneller als die schnellste nicht gestapelte Karte, die wir einbauen.

Zusammenschluss zu einem Adressraum

Diese Teile verfügen über NVLink, sodass zwei davon in einer Maschine so eingerichtet werden können, dass sie sich wie ein größerer Pool verhalten statt wie zwei getrennte. Die Workstation- und Consumer-Karten im Katalog können das überhaupt nicht. Es ist ein Build, den wir anbieten, statt eine Checkout-Option.

Wochenlang unbeaufsichtigt laufen

Durchgehende Fehlerkorrektur und Hardware, die für Dauerlast gebaut ist statt für Spitzen. Für einen Trainingslauf, der in Wochen gemessen wird und hinter dem echtes Geld steht, ist das kein Luxusmerkmal.

Ihnen allein gehören

Ein Mandant pro physischer Maschine und die Karte direkt durchgereicht — keine MIG-Partition, kein vGPU-Profil, kein Time-Slicing-Scheduler und niemand anderes' Job darauf. Anderswo ist eine „A100-Instanz" häufig ein Stück von einer.

Die drei nebeneinander, und was darüber sitzt

Aus unseren eigenen Regalen. Alle diese sind heute bestellbar, im selben Gehäuse, daher ist die Frage, welche den Unterschied wert ist.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Die letzte Zeile steht dort, weil es der ehrliche Vergleich ist und die meisten Angebote ihn verbergen: Die RTX PRO 6000 Blackwell hat 96 GB, mehr als jeder Beschleuniger auf dieser Seite. Lesen Sie ihren Speicher und ihr Geld gegen die der H100 in der Tabelle oben, statt uns bei beidem zu glauben. Was sie aufgibt, ist Leserate und NVLink; was sie gewinnt, sind vier Video-Encoder und Raytracing. Wenn Ihre Frage passt es hinein ist, lesen Sie /rtx60, bevor Sie sich auf dieses Regal festlegen.

In welche Maschine sie kommen und welchen Link sie dort bekommen

Die A100 ist eine PCIe-Gen-4-Karte und die H100 ist Gen 5, während unsere Plattformen Gen 3 und Gen 4 sind. Die H100 bekommt daher auf keiner Maschine, die wir betreiben, jemals den vollen Bus, für den sie entwickelt wurde, und diese Seite sagt das, statt Sie es selbst herausfinden zu lassen.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Ob Sie das etwas kostet, hängt ganz von der Form der Arbeit ab. Ein Inferenz-Endpunkt, dessen Gewichte resident sind, berührt den Steckplatz kaum und wird es nicht bemerken. Eine Trainingsschleife, die bei jedem Schritt einen frischen Batch aus dem Host-Speicher streamt, wird es bei jedem Schritt bemerken. Wenn Sie nicht sicher sind, welcher von beiden Sie sind, sagen Sie uns vor der Bestellung, was der Job ist — das entscheidet die Maschine, nicht die Karte.

Was tatsächlich in 80 GB passt

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Die 40-GB-A100 hält dieselbe Tabelle eine Stufe tiefer: Ein Dreißig-bis-Vierunddreißig-Milliarden-Parameter-Modell passt nur bei Vier-Bit mit Raum, und bei Acht-Bit passen seine 34 GB Gewichte nicht einmal über die knappe Grenze. Ein Siebzig-Milliarden-Modell bei Sechzehn-Bit passt auf keine einzelne Karte, die wir verkaufen — das ist ein Zwei-Karten-Build und der Grund, warum die NVLink-Zeile oben zählt.

Diese Tabelle beantwortet „was passt in diese Karte". Die Frage in die andere Richtung — wie viel Speicher ein Modell braucht und welche Karte ihn freigibt — ist eine eigene Seite.

Was sie kosten, mit den Maschinen, in die sie kommen

Die Karte ist eine Zeile auf der Rechnung und die Maschine eine andere. Beide Hälften unten stammen aus einer Ablesung des Bestellkatalogs, daher gehören der Preis und die Spezifikation daneben immer zueinander.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Bandbreite ist in beide Richtungen ungedrosselt ohne Egress-Gebühr, was in diesem Regal normalerweise der größte versteckte Kostenfaktor anderswo ist — ein Trainingslauf, der einen Datensatz hereinzieht und Checkpoints herausschiebt, bewegt sehr viele Bytes, und Egress pro Gigabyte wird auf jedes einzelne davon berechnet. Eine IPv4-Adresse ist enthalten, es gibt keinen Vertrag und ein Monat ist die Standardlaufzeit. Für jede andere Karte, die wir einbauen, auf dieselbe Weise bepreist, lesen Sie den gesamten Katalog, bepreist. Für Maschinen, die heute gerackt und bereit sind, /instant.

Fragen, die Leute tatsächlich zu diesen Karten stellen

Kann ich Video auf einer A100 oder einer H100 transkodieren?

Nicht in Hardware. Keine der Karten hat einen Encoder — NVIDIAs Unterstützungsmatrix verzeichnet null NVENC-Engines auf beiden — daher fällt das Encodieren dem Prozessor zu und läuft mit Prozessorgeschwindigkeit. Sie decodieren, daher ist eine Pipeline, die Video liest und etwas anderes als Video erzeugt, in Ordnung. Wenn Sie Bilder herausbrauchen, hat die L40S drei AV1-Encoder und ist deutlich günstiger: /l40s. Wie viele Live-Kanäle eine Karte trägt und die Maschine, in die sie kommt: /transcoding.

Wird die Karte in MIG-Instanzen aufgeteilt?

Nicht von uns. Sie erhalten die gesamte physische Karte an Ihr eigenes Betriebssystem durchgereicht, auf einer Maschine mit niemand anderem darauf. Diese Teile unterstützen MIG, daher können Sie Ihre eigene Karte partitionieren, wenn Sie möchten; das ist Ihre Entscheidung auf Ihrer eigenen Maschine, nicht etwas, das ihr angetan wird, bevor sie Sie erreicht. Das ist es wert, überall sonst zu prüfen, wo Sie einkaufen — sehr viele „A100"-Angebote sind ein Stück von einer.

A100 40 GB oder 80 GB?

Zuerst Kapazität, dann Leserate. Wenn das Modell und sein Kontext in vierzig Gigabyte passen, mit einem Fünftel übrig, ist die kleinere Karte der bessere Kauf, und die Leiter oben zeigt die Lücke. Die 80-GB-Karte liest auch schneller — 1.935 GB/s gegenüber 1.555 — wenn Sie also bei Kapazität oder Durchsatz nahe an der Decke sind, nehmen Sie die größere.

Welche Treiber- und CUDA-Version bekomme ich?

Welche auch immer Sie installieren. Die Maschine kommt mit einem sauberen Betriebssystem und Root, und Sie pinnen den Treiber, die CUDA-Version und den Framework-Build auf das, wogegen Ihr Code getestet wurde. Nichts aktualisiert sich unter Ihnen. Wenn Sie möchten, dass der Treiber vor der Übergabe installiert wird, sagen Sie es bei der Bestellung und nennen Sie die Version.

Wie schnell kann ich eine haben?

Dies sind die Teile, die am ehesten zugekauft statt aus dem Lager eingebaut werden, und Sie erfahren, welche, bevor Sie zahlen, statt danach. Ein Beschleuniger der aktuellen Generation auf Zuteilung ist die längste Lieferzeit, die wir angeben. /instant listet Maschinen, die jetzt gerackt und bereit sind.