H100 80 Go · A100 80 Go · A100 40 Go

Les accélérateurs — et ce qu’ils ne feront pas

Trois cartes conçues pour une seule tâche : héberger un modèle et effectuer des calculs dessus, plus vite que tout le reste ici. Elles disposent de mémoire empilée, de correction d’erreurs et de la capacité de se mutualiser entre elles. Elles n’ont ni sortie vidéo ni encodeur vidéo — pas un encodeur lent, aucun — et le savoir avant de commander vaut plus que n’importe quel benchmark sur cette page.

40 et 80 Go Mémoire empilée, ECC Aucun encodeur vidéo

Transformez vos GPU en revenus mensuels passifs

Vous avez des configurations GPU serveur ou de bureau inutilisées ? Mettez-les en ligne sur la place de marché Primcast dès aujourd’hui et percevez des loyers mensuels réguliers de la part d’équipes d’IA, de développeurs et d’entreprises ayant besoin de calcul de qualité production.

Aller à la place de marché

Deux choses qui surprennent les gens

Elles ne peuvent pas encoder de vidéo. Du tout.

La propre matrice de prise en charge de l’encodage et du décodage de NVIDIA indique zéro moteur NVENC sur l’A100 et zéro sur le H100. Elles décodent — cinq moteurs sur l’A100, sept sur le H100 — mais il n’y a aucun encodeur sur la carte, donc chaque image produite par ces cartes doit être encodée par le processeur à la place. Si votre pipeline produit de la vidéo, ce n’est pas le bon rayon, et la L40S avec ses trois encodeurs AV1 est la bonne. C’est à une page d’ici, sur /l40s.

Ces cartes n’ont pas non plus de sorties d’affichage. Ce sont des composants de calcul sans tête. Rien de ce qui attend un framebuffer — un bureau virtuel, un poste de travail distant, un serveur de jeu — n’a sa place dessus.

L’A100 n’est pas obsolète, et la carte de 40 Go n’est pas une erreur

L’A100 est la génération précédente, et elle lit ses poids à 1 555 Go/s avec 40 Go et à 1 935 Go/s avec 80 Go. Pour un modèle qui tient, ce débit de lecture est ce qui détermine le nombre de jetons par seconde que vous obtenez, et il reste très loin devant toutes les cartes non empilées du catalogue. La carte de 40 Go contient confortablement un modèle de trente milliards de paramètres en précision huit bits, ce qui est la plupart de ce que les gens servent réellement, pour une fraction de ce que coûte le H100 chaque mois.

Achetez le H100 quand le modèle a réellement besoin de Hopper — le moteur transformer, le FP8, les unités tensor plus récentes — ou quand l’exécution doit se terminer plus tôt plutôt que simplement se terminer. Achetez une A100 quand la question est de savoir si ça tient et à quelle vitesse ça lit, ce qui est la question la plus courante.

Les spécifications, telles que publiées

Chiffres tirés des propres fiches techniques de NVIDIA et des tableaux de spécifications Tesla, cités dans la source de cette page. Lorsqu’un chiffre n’a pas pu être vérifié par rapport à la pièce exacte que nous installons, cette page n’affiche rien plutôt qu’une supposition.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

Le H100 n’affiche ni nombre de cœurs ni bande passante ci-dessus, et c’est délibéré. Notre pièce est enregistrée dans la boutique sous un nombre de cœurs appartenant au module SXM, qui est une carte qui se boulonne sur une carte de base plutôt que dans un slot ; la mémoire HBM2e de 80 Go qu’elle enregistre également appartient à la carte PCIe, qui est ce qui va réellement dans ces machines. Plutôt que d’en choisir un et de l’afficher avec assurance, la page affiche la mémoire sur laquelle les deux sources s’accordent et omet le reste. Demandez-nous et nous vous dirons exactement quelle carte sera installée dans la vôtre.

Ce dans quoi elles excellent

Une seule tâche, mieux accomplie que par tout le reste sur ce site.

Lire les poids rapidement

La mémoire empilée est la différence entre ce rayon et tous les autres. Une fois qu’un modèle est résident, la vitesse de génération est régie par la rapidité avec laquelle la carte peut lire ses propres poids, et celles-ci lisent une fois et demie à deux fois plus vite que la carte non empilée la plus rapide que nous installons.

Se mutualiser en un seul espace d’adressage

Ces pièces embarquent NVLink, donc deux d’entre elles dans une même machine peuvent se comporter comme un seul pool plus grand plutôt que deux pools séparés. Les cartes workstation et grand public du catalogue ne peuvent pas faire cela du tout. C’est une configuration que nous chiffrons plutôt qu’une option de commande.

Fonctionner pendant des semaines sans surveillance

Correction d’erreurs de bout en bout, et du matériel conçu pour une charge continue plutôt que pour des pics. Pour un entraînement mesuré en semaines avec de l’argent réel derrière, ce n’est pas un luxe.

Être à vous seul

Un seul locataire par machine physique et la carte transmise directement — pas de partition MIG, pas de profil vGPU, pas d’ordonnanceur à tranches de temps et aucun travail d’autrui dessus. Ailleurs, une « instance A100 » est souvent une tranche d’une seule.

Les trois côte à côte, et ce qui se trouve au-dessus

Depuis nos propres rayons. Toutes sont commandables aujourd’hui, dans le même châssis, donc la question est de savoir laquelle vaut la différence.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

La dernière ligne est là parce que c’est la comparaison honnête et que la plupart des fiches la cachent : la RTX PRO 6000 Blackwell contient 96 Go, plus que n’importe quel accélérateur de cette page. Comparez sa mémoire et son prix à ceux du H100 dans le tableau ci-dessus plutôt que de nous croire sur parole pour l’un ou l’autre. Ce à quoi elle renonce, c’est le débit de lecture et NVLink ; ce qu’elle gagne, ce sont quatre encodeurs vidéo et le ray tracing. Si votre question est est-ce que ça tiendra, lisez /rtx60 avant de vous engager sur ce rayon.

Dans quelle machine elles vont, et quelle liaison elles y obtiennent

L’A100 est une carte PCIe Gen 4 et le H100 est Gen 5, tandis que nos plateformes sont Gen 3 et Gen 4. Le H100 n’obtient donc jamais le bus complet pour lequel il a été conçu sur aucune machine que nous exploitons, et cette page le dit plutôt que de vous laisser le découvrir.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Que cela vous coûte quelque chose dépend entièrement de la forme du travail. Un point de terminaison d’inférence dont les poids sont résidents touche à peine le slot et ne s’en apercevra pas. Une boucle d’entraînement qui diffuse un nouveau lot depuis la mémoire hôte à chaque étape s’en apercevra à chaque étape. Si vous n’êtes pas sûr de votre cas, dites-nous quel est le travail avant de commander — c’est cela qui décide de la machine, pas la carte.

Ce qui tient réellement dans 80 Go

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

L’A100 de 40 Go contient le même tableau un cran plus bas : un modèle de trente à trente-quatre milliards de paramètres ne tient avec de la marge qu’en quatre bits, et en huit bits ses 34 Go de poids ne passent même pas la barre la plus stricte. Un modèle de soixante-dix milliards en seize bits ne tient sur aucune carte unique que nous vendons — c’est une configuration à deux cartes, et la raison pour laquelle la ligne NVLink ci-dessus compte.

Ce tableau répond à « qu’est-ce qui tient dans cette carte ». La question dans l’autre sens — combien de mémoire un modèle nécessite, et quelle carte la satisfait — fait l’objet d’une page à part entière.

Ce qu’elles coûtent, avec les machines dans lesquelles elles vont

La carte est une ligne sur la facture et la machine en est une autre. Les deux moitiés ci-dessous proviennent d’une seule lecture du catalogue de commandes, donc le prix et la spécification à côté appartiennent toujours l’un à l’autre.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

La bande passante est non mesurée dans les deux sens sans frais de sortie, ce qui sur ce rayon est généralement le coût caché le plus important ailleurs — un entraînement qui tire un jeu de données en entrée et pousse des points de contrôle en sortie déplace un très grand nombre d’octets, et la sortie par gigaoctet est facturée sur chacun d’eux. Une adresse IPv4 est incluse, il n’y a pas de contrat et un mois est la durée par défaut. Pour toutes les autres cartes que nous installons, au même prix, lisez tout le catalogue, avec les prix. Pour les machines en rack prêtes aujourd’hui, /instant.

Les questions que les gens posent réellement sur ces cartes

Puis-je transcoder de la vidéo sur une A100 ou un H100 ?

Pas en matériel. Aucune des deux cartes n’a d’encodeur — la matrice de prise en charge de NVIDIA indique zéro moteur NVENC sur les deux — donc l’encodage incombe au processeur et s’exécute à la vitesse du processeur. Elles décodent, donc un pipeline qui lit de la vidéo et produit autre chose que de la vidéo convient. Si vous avez besoin d’images en sortie, la L40S a trois encodeurs AV1 et est bien moins chère : /l40s. Combien de chaînes en direct une carte prend en charge, et la machine dans laquelle elle va : /transcoding.

La carte est-elle découpée en instances MIG ?

Pas par nous. Vous recevez la carte physique entière transmise à votre propre système d’exploitation, sur une machine sans personne d’autre dessus. Ces pièces prennent en charge MIG, donc vous pouvez partitionner votre propre carte si vous le souhaitez ; c’est votre décision sur votre propre machine, pas quelque chose qui lui est fait avant qu’elle ne vous parvienne. Cela vaut la peine de vérifier partout ailleurs où vous achetez — un grand nombre d’offres « A100 » sont une tranche d’une seule.

A100 40 Go ou 80 Go ?

La capacité d’abord, puis le débit de lecture. Si le modèle et son contexte tiennent dans quarante gigaoctets avec un cinquième de marge, la plus petite carte est le meilleur achat et l’échelle ci-dessus montre l’écart. La carte de 80 Go lit aussi plus vite — 1 935 Go/s contre 1 555 — donc si vous êtes près du plafond en capacité ou en débit, prenez la plus grande.

Quel pilote et quelle version de CUDA vais-je obtenir ?

Ceux que vous installez. La machine arrive avec un système d’exploitation propre et un accès root, et vous figez le pilote, la version de CUDA et la compilation du framework sur ce contre quoi votre code a été testé. Rien ne se met à jour sous vos pieds. Si vous préférez que le pilote soit installé avant la livraison, dites-le sur la commande et indiquez la version.

Dans combien de temps puis-je en avoir une ?

Ce sont les pièces les plus susceptibles d’être achetées plutôt qu’installées depuis le stock, et vous êtes informé de cela avant de payer plutôt qu’après. Un accélérateur de génération actuelle sur allocation est le délai le plus long que nous annonçons. /instant répertorie les machines en rack prêtes immédiatement.