H100 80 GB · A100 80 GB · A100 40 GB

Die Beschleuniger – und was sie nicht tun werden

Drei Grafikkarten, die für eine einzige Aufgabe entwickelt wurden: die Speicherung eines Modells und die Durchführung von Berechnungen – schneller als alle anderen hier. Sie verfügen über gestapelten Speicher, Fehlerkorrektur und die Möglichkeit zur Datenbündelung. Sie besitzen weder einen Display-Ausgang noch einen Video-Encoder – und zwar keinen langsamen. Dieses Wissen ist vor der Bestellung wertvoller als jeder Benchmark auf dieser Seite.

40 und 80 GB Gestapelter Speicher, ECC Kein Video-Encoder

Zwei Dinge, die die Leute überraschen

Sie können kein Video kodieren. Gar keins.

NVIDIAs eigene Matrix zur Unterstützung von Codierung und Decodierung verzeichnet weder auf der A100 noch auf der H100 NVENC-Engines. Die Decodierung funktioniert mit fünf Engines auf der A100 und sieben auf der H100, jedoch ist kein Encoder auf der Karte integriert. Daher muss jedes von diesen Karten erzeugte Frame vom Prozessor codiert werden. Falls Ihre Pipeline Videosignale ausgibt, ist diese Karte nicht die richtige Wahl. Die L40S mit ihren drei AV1-Encodern ist die passende Lösung. Weitere Informationen finden Sie auf der nächsten Seite unter /l40s .

Diese Karten besitzen auch keine Display-Ausgänge. Es handelt sich um Headless-Compute-Komponenten. Anwendungen, die einen Framebuffer benötigen – wie virtuelle Desktops, Remote-Workstations oder Spielserver – sind darauf nicht angebracht.

Das A100 ist nicht veraltet, und die 40-GB-Karte ist kein Fehler.

Die A100 ist die Vorgängergeneration und liest ihre Gewichte mit 1.555 GB/s (40 GB) bzw. 1.935 GB/s (80 GB) aus. Bei einem passenden Modell bestimmt diese Lesegeschwindigkeit die Anzahl der Token pro Sekunde, und sie liegt damit deutlich vor allen anderen nicht gestapelten Karten im Sortiment. Die 40-GB-Karte speichert problemlos ein Modell mit 30 Milliarden Parametern bei 8-Bit-Präzision – was den meisten Anwendern entspricht – und das zu einem Bruchteil der monatlichen Kosten der H100.

Kaufen Sie den H100, wenn das Modell Hopper – also die Transformer-Engine, FP8 oder die neueren Tensor-Einheiten – unbedingt benötigt oder wenn der Lauf schneller abgeschlossen sein muss. Kaufen Sie einen A100, wenn es um die Kompatibilität und die Lesegeschwindigkeit geht, was die häufigere Frage ist.

Die Spezifikationen, wie veröffentlicht

Die Daten stammen aus den Datenblättern von NVIDIA und den Spezifikationstabellen von Tesla (siehe Quellenangabe auf dieser Seite). Wo für das jeweilige Bauteil keine Daten verfügbar waren, wird anstelle eines Schätzwerts kein Wert angezeigt.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

Die H100 zeigt weder Kernanzahl noch Bandbreite an – und das ist beabsichtigt. Unser Bauteil ist im Shop unter der Kernanzahl des SXM-Moduls geführt, einer Karte, die auf ein Mainboard geschraubt und nicht in einen Steckplatz gesteckt wird. Die ebenfalls aufgeführten 80 GB HBM2e-Speicher gehören zur PCIe-Karte, die tatsächlich in diesen Geräten verbaut wird. Anstatt eine der beiden Optionen auszuwählen und diese Angabe zu veröffentlichen, zeigt die Seite den Speicher an, auf den sich beide Quellen einigen, und lässt die übrigen weg. Fragen Sie uns, und wir teilen Ihnen genau mit, welche Karte in Ihrem System verbaut wird.

Wo sie gut sind

Eine Aufgabe, die besser erledigt wurde als alles andere auf dieser Seite.

Gewichte schnell ablesen

Der gestapelte Speicher ist der entscheidende Unterschied zwischen diesem Regal und allen anderen. Sobald ein Modell geladen ist, wird die Generierungsgeschwindigkeit davon bestimmt, wie schnell die Karte ihre eigenen Gewichte lesen kann, und diese werden eineinhalb- bis zweimal schneller gelesen als die schnellste nicht gestapelte Karte, die wir verwenden.

Zusammenführung in einem Adressraum

Diese Komponenten unterstützen NVLink, sodass zwei davon in einem Gerät als ein größerer Pool anstatt als zwei separate fungieren können. Die Workstation- und Consumer-Karten im Katalog unterstützen dies nicht. Es handelt sich um eine Konfiguration, die wir individuell zusammenstellen und nicht als Option im Warenkorb anbieten.

Läuft wochenlang unbeaufsichtigt

Fehlerkorrektur ist durchgängig integriert, und die Hardware ist für Dauerlast und nicht für Spitzenlasten ausgelegt. Für ein wochenlanges Trainingsprogramm mit echtem Geldeinsatz ist das kein Luxus.

Nur dir allein

Ein Mandant pro physischer Maschine, und die Grafikkarte wird direkt durchgereicht – keine MIG-Partition, kein vGPU-Profil, kein Time-Slicing-Scheduler und keine weiteren Jobs darauf. Andernorts ist eine „A100-Instanz“ häufig nur ein Ausschnitt einer solchen Instanz.

Die drei nebeneinander und was darüber liegt

Aus unserem eigenen Lager. Alle diese Modelle sind ab heute bestellbar, im gleichen Gehäuse. Die Frage ist also, welches den Aufpreis wert ist.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Die letzte Zeile dient dem ehrlichen Vergleich, den die meisten Angebote verschweigen: Die RTX PRO 6000 Blackwell verfügt über 96 GB RAM – mehr als jeder andere Beschleuniger auf dieser Seite. Vergleichen Sie Speicher und Preis mit denen der H100 in der obigen Tabelle, anstatt sich auf unsere Angaben zu verlassen. Sie bietet weniger Lesegeschwindigkeit und NVLink, dafür aber vier Video-Encoder und Raytracing. Wenn Sie sich fragen, ob sie in Ihr Gehäuse passt , lesen Sie bitte den Artikel unter /rtx60, bevor Sie sich für dieses Modell entscheiden.

In welche Maschine sie gehen und welche Verbindung sie dort herstellen.

Die A100 ist eine PCIe-Gen-4-Karte und die H100 eine Gen-5-Karte, während unsere Plattformen Gen 3 und Gen 4 unterstützen. Daher erhält die H100 auf keinem unserer Systeme die volle Buskapazität, für die sie ausgelegt ist. Diese Seite weist ausdrücklich darauf hin, anstatt Sie selbst recherchieren zu lassen.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Ob Ihnen dadurch Kosten entstehen, hängt ganz von der Art der Arbeit ab. Ein Inferenz-Endpunkt, dessen Gewichte im Arbeitsspeicher gespeichert sind, greift kaum auf den Speicher zu und wird dies nicht bemerken. Eine Trainingsschleife, die in jedem Schritt einen neuen Datenstapel aus dem Arbeitsspeicher des Hosts lädt, wird dies hingegen in jedem Schritt bemerken. Wenn Sie sich nicht sicher sind, welcher Fall auf Sie zutrifft, beschreiben Sie uns bitte vor Ihrer Bestellung die Art der Aufgabe – diese bestimmt die benötigte Maschine, nicht die Grafikkarte.

Was passt tatsächlich in 80 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Die 40-GB-Karte A100 folgt der gleichen Tabelle eine Stufe darunter: Ein Modell mit 30 bis 34 Milliarden Parametern bei 8-Bit-Genauigkeit passt, dasselbe Modell bei 16 Bit nicht. Ein Modell mit 70 Milliarden Parametern bei 16 Bit passt auf keine unserer Einzelkarten – dafür sind zwei Karten erforderlich, und deshalb ist die oben genannte NVLink-Schnittstelle so wichtig.

Was sie kosten, zusammen mit den Maschinen, in die sie eingebaut werden

Die Karte bildet eine Zeile auf der Rechnung, die Maschine eine andere. Beide Hälften stammen aus einem einzigen Durchlauf des Bestellkatalogs, daher gehören Preis und zugehörige Spezifikation immer zusammen.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Die Bandbreite ist in beide Richtungen unbegrenzt, und es fallen keine Gebühren für ausgehende Daten an. Dies ist bei diesem Modell üblicherweise der größte versteckte Kostenfaktor – ein Trainingslauf, der einen Datensatz abruft und Checkpoints sendet, überträgt eine große Menge an Daten, und für jedes einzelne Gigabyte werden die Gebühren für ausgehende Daten berechnet. Eine IPv4-Adresse ist inklusive, es gibt keinen Vertrag, und die Standardlaufzeit beträgt einen Monat. Informationen zu allen anderen von uns verbauten Karten, die zum gleichen Preis angeboten werden, finden Sie in unserem vollständigen Katalog . Für sofort einsatzbereite Geräte: /instant .

Fragen, die Leute tatsächlich zu diesen Karten stellen

Kann ich Videos auf einem A100 oder einem H100 transkodieren?

Nicht hardwareseitig. Beide Karten verfügen über keinen Encoder – NVIDIAs Supportmatrix verzeichnet für beide keine NVENC-Engines – daher übernimmt der Prozessor die Codierung und arbeitet mit dessen Geschwindigkeit. Die Karten decodieren jedoch, sodass eine Pipeline, die Videodaten verarbeitet und etwas anderes als Video erzeugt, problemlos funktioniert. Falls Sie Einzelbilder benötigen, bietet die L40S drei AV1-Encoder und ist deutlich günstiger: /l40s .

Ist die Karte in MIG-Instanzen unterteilt?

Nicht von uns. Sie erhalten die gesamte physische Karte, die an Ihr eigenes Betriebssystem auf einem Rechner ohne weitere Benutzer durchgereicht wird. Diese Komponenten unterstützen MIG, sodass Sie Ihre Karte bei Bedarf partitionieren können. Dies ist Ihre Entscheidung auf Ihrem eigenen Rechner und wird nicht vor der Auslieferung an Sie vorgenommen. Prüfen Sie dies am besten auch bei anderen Anbietern – viele „A100“-Angebote bestehen nur aus einem einzigen Teil einer Karte.

A100 40 GB oder 80 GB?

Zuerst die Speicherkapazität, dann die Lesegeschwindigkeit. Wenn Modell und Anwendungsfall 40 Gigabyte Speicherplatz benötigen und noch ein Fünftel übrig ist, ist die kleinere Karte die bessere Wahl. Die obige Tabelle verdeutlicht den Unterschied. Die 80-GB-Karte liest außerdem schneller – 1.935 GB/s gegenüber 1.555 GB/s. Wenn Sie also bei Speicherkapazität oder Durchsatz an die Grenzen stoßen, sollten Sie die größere Karte wählen.

Welchen Treiber und welche CUDA-Version benötige ich?

Egal, welche Version Sie installieren. Die Maschine wird mit einem sauberen Betriebssystem und Root-Zugriff geliefert. Sie legen den Treiber, die CUDA-Version und den Framework-Build fest, die mit den Versionen übereinstimmen, mit denen Ihr Code getestet wurde. Es werden keine automatischen Updates im Hintergrund durchgeführt. Falls Sie den Treiber vor der Übergabe installiert haben möchten, geben Sie dies bitte bei der Bestellung an und nennen Sie die Version.

Wie schnell kann ich eins bekommen?

Diese Teile werden höchstwahrscheinlich zugekauft und nicht ab Lager eingebaut. Sie erfahren dies vor der Bezahlung. Die längste Lieferzeit für einen Beschleuniger der aktuellen Generation, der zugeteilt wird, geben wir an. /instant listet Maschinen auf, die sofort verfügbar sind.