H100 80 GB · A100 80 GB · A100 40 GB

Die Beschleuniger — und was sie nicht können

Drei Karten, gebaut für eine Aufgabe: ein Modell zu halten und darauf zu rechnen, schneller als alles andere hier. Sie haben gestapelten Speicher, Fehlerkorrektur und die Fähigkeit, sich miteinander zu einem Pool zusammenzuschließen. Sie haben keinen Bildschirmausgang und keinen Video-Encoder — keinen langsamen, gar keinen — und das vor der Bestellung zu wissen, ist mehr wert als jeder Benchmark auf dieser Seite.

40 und 80 GB Gestapelter Speicher, ECC Kein Video-Encoder

Machen Sie aus Ihren GPUs passives monatliches Einkommen

Haben Sie ungenutzte Server- oder Desktop-GPU-Setups? Listen Sie sie noch heute auf dem Primcast-Marktplatz und erzielen Sie stabile monatliche Mieteinnahmen von KI-Teams, Entwicklern und Unternehmen, die produktionsreife Rechenleistung benötigen.

Zum Marktplatz

Zwei Dinge, die Menschen überraschen

Sie können überhaupt kein Video encodieren.

NVIDIAs eigene Encode- und Decode-Unterstützungsmatrix verzeichnet null NVENC-Engines auf der A100 und null auf der H100. Sie decodieren — fünf Engines auf der A100, sieben auf der H100 — aber es gibt keinen Encoder auf der Platine, also muss jedes Bild, das diese Karten erzeugen, stattdessen vom Prozessor encodiert werden. Wenn aus Ihrer Pipeline Video herauskommt, ist dies das falsche Regal, und die L40S mit ihren drei AV1-Encodern ist das richtige. Das ist eine Seite weiter unter /l40s.

Diese Karten haben auch keine Bildschirmausgänge. Sie sind headless Compute-Teile. Nichts, das einen Framebuffer erwartet — ein virtueller Desktop, eine Remote-Workstation, ein Gameserver — gehört auf sie.

Die A100 ist nicht veraltet, und die 40-GB-Karte ist kein Fehler

Die A100 ist die vorherige Generation, und sie liest ihre Gewichte mit 1.555 GB/s bei 40 GB und 1.935 GB/s bei 80 GB. Bei einem Modell, das hineinpasst, entscheidet diese Leserate, wie viele Tokens pro Sekunde Sie bekommen, und sie bleibt weit vor jeder nicht-gestapelten Karte im Katalog. Die 40-GB-Karte hält ein Dreißig-Milliarden-Parameter-Modell bei Acht-Bit-Präzision bequem, was das meiste ist, was tatsächlich bereitgestellt wird, zu einem Bruchteil dessen, was die H100 monatlich kostet.

Kaufen Sie die H100, wenn das Modell wirklich Hopper braucht — die Transformer-Engine, FP8, die neueren Tensor-Einheiten — oder wenn der Lauf eher früher als bloß irgendwann fertig sein muss. Kaufen Sie eine A100, wenn die Frage ist, ob es passt und wie schnell sie liest, was die häufigere Frage ist.

Die Spezifikationen, wie veröffentlicht

Zahlen aus NVIDIAs eigenen Datenblättern und den Tesla-Spezifikationstabellen, zitiert im Quelltext dieser Seite. Wo eine Zahl nicht gegen das exakte Teil, das wir einbauen, belegt werden konnte, druckt diese Seite nichts statt einer Vermutung.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

Die H100 zeigt oben keine Kernanzahl und keine Bandbreite, und das ist Absicht. Unser Teil ist im Shop unter einer Kernanzahl erfasst, die zum SXM-Modul gehört, einer Karte, die an eine Basisplatine geschraubt statt in einen Steckplatz gesteckt wird; der 80 GB HBM2e-Speicher, den es ebenfalls verzeichnet, gehört zur PCIe-Karte, die tatsächlich in diese Maschinen eingebaut wird. Statt eine Zahl auszuwählen und sie selbstbewusst zu drucken, druckt die Seite den Speicher, auf den sich beide Quellen einigen, und lässt den Rest weg. Fragen Sie uns, und wir sagen Ihnen genau, welche Platine in Ihre kommt.

Worin sie gut sind

Eine Aufgabe, besser erledigt als von allem anderen auf dieser Seite.

Gewichte schnell lesen

Gestapelter Speicher ist der Unterschied zwischen diesem Regal und jedem anderen. Sobald ein Modell resident ist, wird die Generierungsgeschwindigkeit davon bestimmt, wie schnell die Karte ihre eigenen Gewichte lesen kann, und diese lesen eineinhalb- bis zweimal schneller als die schnellste nicht-gestapelte Karte, die wir einbauen.

Zusammenschluss zu einem Adressraum

Diese Teile tragen NVLink, sodass zwei davon in einer Maschine so betrieben werden können, dass sie sich wie ein größerer Pool statt wie zwei getrennte verhalten. Die Workstation- und Consumer-Karten im Katalog können das überhaupt nicht. Es ist ein Build, den wir anbieten, keine Checkout-Option.

Wochenlang unbeaufsichtigt laufen

Durchgehende Fehlerkorrektur und Hardware, die für Dauerlast gebaut ist statt für Spitzen. Für einen Trainingslauf, der in Wochen gemessen wird und hinter dem echtes Geld steht, ist das kein Luxusmerkmal.

Ihnen allein gehören

Ein Mandant pro physischer Maschine und die Karte direkt durchgereicht — keine MIG-Partition, kein vGPU-Profil, kein Time-Slicing-Scheduler und niemandes sonst Aufgabe darauf. Anderswo ist eine „A100-Instanz“ häufig ein Stück von einer.

Die drei nebeneinander, und was darüber sitzt

Aus unseren eigenen Regalen. Alle diese sind heute bestellbar, im selben Chassis, also ist die Frage, welche den Unterschied wert ist.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Die letzte Zeile steht dort, weil es der ehrliche Vergleich ist und die meisten Angebote ihn verbergen: Die RTX PRO 6000 Blackwell fasst 96 GB, mehr als jeder Beschleuniger auf dieser Seite. Lesen Sie ihren Speicher und ihr Geld gegen die der H100 in der Tabelle oben, statt uns bei beidem zu glauben. Was sie aufgibt, ist Leserate und NVLink; was sie gewinnt, sind vier Video-Encoder und Raytracing. Wenn Ihre Frage passt es hinein ist, lesen Sie /rtx60, bevor Sie sich auf dieses Regal festlegen.

In welche Maschine sie kommen und welchen Link sie dort bekommen

Die A100 ist eine PCIe-Gen-4-Karte und die H100 ist Gen 5, während unsere Plattformen Gen 3 und Gen 4 sind. Die H100 bekommt daher auf keiner Maschine, die wir betreiben, jemals den vollen Bus, für den sie entwickelt wurde, und diese Seite sagt das, statt Sie es selbst herausfinden zu lassen.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Ob Sie das etwas kostet, hängt ganz von der Form der Arbeit ab. Ein Inferenz-Endpunkt, dessen Gewichte resident sind, berührt den Steckplatz kaum und wird es nicht bemerken. Eine Trainingsschleife, die bei jedem Schritt einen frischen Batch aus dem Host-Speicher streamt, wird es bei jedem Schritt bemerken. Wenn Sie nicht sicher sind, welcher von beiden Sie sind, sagen Sie uns vor der Bestellung, was die Aufgabe ist — sie entscheidet über die Maschine, nicht die Karte.

Was tatsächlich in 80 GB passt

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Die 40-GB-A100 hält dieselbe Tabelle eine Sprosse tiefer: Ein Dreißig-bis-Vierunddreißig-Milliarden-Parameter-Modell passt nur bei Vier-Bit mit Luft, und bei Acht-Bit schaffen seine 34 GB Gewichte nicht einmal die knappe Grenze. Ein Siebzig-Milliarden-Modell bei Sechzehn-Bit passt auf keine einzelne Karte, die wir verkaufen — das ist ein Zwei-Karten-Build und der Grund, warum die NVLink-Zeile oben zählt.

Diese Tabelle beantwortet „was passt in diese Karte“. Die Frage in die andere Richtung — wie viel Speicher ein Modell braucht und welche Karte ihn schafft — ist eine eigene Seite.

Was sie kosten, mit den Maschinen, in die sie kommen

Die Karte ist eine Zeile auf der Rechnung und die Maschine eine andere. Beide Hälften unten stammen aus einer Ablesung des Bestellkatalogs, sodass der Preis und die Spezifikation daneben immer zueinander gehören.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Bandbreite ist in beide Richtungen ungedrosselt ohne Egress-Gebühr, was in diesem Regal normalerweise der größte versteckte Kostenfaktor anderswo ist — ein Trainingslauf, der einen Datensatz hereinzieht und Checkpoints herausschiebt, bewegt sehr viele Bytes, und Egress pro Gigabyte wird auf jedes einzelne davon berechnet. Eine IPv4-Adresse ist enthalten, es gibt keinen Vertrag und ein Monat ist die Standardlaufzeit. Für jede andere Karte, die wir einbauen, auf dieselbe Weise bepreist, lesen Sie den gesamten Katalog, bepreist. Für Maschinen, die heute gerackt und bereit sind, /instant.

Fragen, die Leute zu diesen Karten tatsächlich stellen

Kann ich Video auf einer A100 oder einer H100 transcodieren?

Nicht in Hardware. Keine der beiden Karten hat einen Encoder — NVIDIAs Unterstützungsmatrix verzeichnet null NVENC-Engines auf beiden — also fällt das Encodieren dem Prozessor zu und läuft mit Prozessorgeschwindigkeit. Sie decodieren, also ist eine Pipeline, die Video liest und etwas anderes als Video erzeugt, in Ordnung. Wenn Sie Frames herausbekommen müssen, hat die L40S drei AV1-Encoder und ist deutlich günstiger: /l40s. Wie viele Live-Kanäle eine Karte trägt und die Maschine, in die sie kommt: /transcoding.

Wird die Karte in MIG-Instanzen aufgeteilt?

Von uns nicht. Sie bekommen die ganze physische Karte an Ihr eigenes Betriebssystem durchgereicht, auf einer Maschine mit niemandem sonst darauf. Diese Teile unterstützen MIG, Sie können Ihre eigene Karte also partitionieren, wenn Sie möchten; das ist Ihre Entscheidung auf Ihrer eigenen Maschine, nicht etwas, das ihr angetan wird, bevor sie Sie erreicht. Das ist es wert, überall sonst zu prüfen, wo Sie einkaufen — sehr viele „A100“-Angebote sind ein Stück von einer.

A100 40 GB oder 80 GB?

Zuerst Kapazität, dann Leserate. Wenn das Modell und sein Kontext mit einem Fünftel Reserve in vierzig Gigabyte passen, ist die kleinere Karte der bessere Kauf, und die Leiter oben zeigt den Abstand. Die 80-GB-Karte liest außerdem schneller — 1.935 GB/s gegenüber 1.555 — wenn Sie also bei Kapazität oder Durchsatz nahe an der Decke sind, nehmen Sie die größere.

Welche Treiber- und CUDA-Version bekomme ich?

Welche auch immer Sie installieren. Die Maschine kommt mit einem sauberen Betriebssystem und Root, und Sie pinnen den Treiber, die CUDA-Version und den Framework-Build auf das, wogegen Ihr Code getestet wurde. Nichts wird unter Ihnen aktualisiert. Wenn Sie möchten, dass der Treiber vor der Übergabe installiert wird, sagen Sie es bei der Bestellung und nennen Sie die Version.

Wie schnell kann ich eine haben?

Dies sind die Teile, die am ehesten zugekauft statt aus dem Lager eingebaut werden, und Sie erfahren, welcher Fall vorliegt, bevor Sie zahlen, nicht danach. Ein Beschleuniger der aktuellen Generation auf Zuteilung ist die längste Lieferzeit, die wir nennen. /instant listet Maschinen, die jetzt gerackt und bereit sind.