H100 80 Go · A100 80 Go · A100 40 Go

Les accélérateurs — et ce qu'ils ne feront pas

Trois cartes conçues pour une seule tâche : stocker un modèle et effectuer des calculs dessus, plus rapidement que n’importe quelle autre carte présentée ici. Elles disposent d’une mémoire empilée, d’une correction d’erreurs et de la possibilité de mutualiser leurs ressources. Elles n’ont ni sortie d’affichage ni encodeur vidéo (même pas un encodeur lent), et le savoir avant de commander est plus important que n’importe quel test comparatif présenté sur cette page.

40 et 80 Go Mémoire empilée, ECC Aucun encodeur vidéo

Deux choses qui surprennent les gens

Ils ne peuvent pas encoder de vidéo. Du tout.

La matrice de compatibilité d'encodage et de décodage de NVIDIA indique l'absence de moteurs NVENC sur les puces A100 et H100. Elles prennent en charge le décodage (cinq moteurs sur l'A100, sept sur la H100), mais ne disposent d'aucun encodeur intégré. Par conséquent, chaque image produite par ces cartes doit être encodée par le processeur. Si votre flux de traitement inclut un signal vidéo, ce modèle n'est pas adapté ; le modèle L40S, avec ses trois encodeurs AV1, est le plus approprié. Il est présenté sur la page suivante : /l40s .

Ces cartes ne possèdent pas non plus de sortie vidéo. Ce sont des composants de calcul sans interface graphique. Aucun système nécessitant un tampon d'affichage (bureau virtuel, station de travail distante, serveur de jeu) ne peut y être installé.

Le A100 n'est pas obsolète, et la carte de 40 Go n'est pas une erreur.

L'A100, de la génération précédente, atteint une vitesse de lecture de 1 555 Go/s avec une carte de 40 Go et de 1 935 Go/s avec une carte de 80 Go. Pour un modèle compatible, cette vitesse de lecture détermine le nombre de jetons traités par seconde, et elle reste largement supérieure à celle de toutes les autres cartes non empilables du catalogue. La carte de 40 Go peut contenir sans problème un modèle de trente milliards de paramètres avec une précision de huit bits, ce qui correspond à la plupart des besoins réels, pour un coût mensuel bien inférieur à celui de la H100.

Optez pour le H100 si le modèle nécessite réellement le Hopper (moteur à transformateur, FP8, unités tensorielles plus récentes) ou si l'impression doit se terminer plus rapidement. Choisissez un A100 si la question est de savoir s'il est compatible et quelle est sa vitesse de lecture, ce qui est le cas le plus fréquent.

Les spécifications, telles que publiées

Les données proviennent des fiches techniques de NVIDIA et des tableaux de spécifications de Tesla, cités dans la source de cette page. Lorsqu'une valeur n'a pas pu être trouvée pour la pièce exacte testée, cette page n'affiche rien d'autre qu'une estimation.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

Le H100 n'affiche ni nombre de cœurs ni bande passante, et c'est intentionnel. Notre composant est référencé en magasin avec un nombre de cœurs correspondant au module SXM, une carte qui se fixe directement sur la carte mère et non dans un emplacement PCIe. La mémoire HBM2e de 80 Go mentionnée correspond à la carte PCIe, celle qui équipe réellement ces machines. Plutôt que de choisir une information et de l'imprimer avec certitude, la page affiche la mémoire sur laquelle les deux sources s'accordent et omet le reste. N'hésitez pas à nous contacter pour connaître la carte mère exacte de votre ordinateur.

Ce qu'ils savent faire

Un seul travail, réalisé mieux que tout ce que vous avez pu voir sur ce site.

Lire les poids rapidement

La mémoire empilée est ce qui distingue cette baie de stockage de toutes les autres. Une fois un modèle installé, la vitesse de génération dépend de la rapidité avec laquelle la carte peut lire ses propres poids ; ces derniers lisent une fois et demie à deux fois plus vite que la carte non empilée la plus rapide que nous installons.

Mise en commun dans un seul espace d'adressage

Ces composants sont compatibles NVLink, ce qui permet de faire fonctionner deux d'entre eux dans une même machine comme un seul pool de mémoire plutôt que deux pools distincts. Les cartes pour stations de travail et grand public du catalogue ne le permettent pas. Il s'agit d'une configuration proposée dans un devis, et non d'une option de commande.

Fonctionnant pendant des semaines sans surveillance

Correction d'erreurs continue et matériel conçu pour une charge soutenue plutôt que pour des pics de sollicitation. Pour une session d'entraînement de plusieurs semaines avec un investissement conséquent, ce n'est pas un luxe.

Être à toi seul

Un seul locataire par machine physique et la carte est gérée directement : pas de partition MIG, pas de profil vGPU, pas de planificateur de partage de temps et personne d’autre n’intervient. Ailleurs, une « instance A100 » correspond souvent à une portion d’une instance unique.

Tous les trois côte à côte, et ce qui se trouve au-dessus

Nous les avons en stock. Tous ces modèles sont disponibles dès aujourd'hui, dans le même châssis ; la question est donc de savoir lequel justifie la différence de prix.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

La dernière ligne est présente car elle offre une comparaison objective, souvent omise : la RTX PRO 6000 Blackwell dispose de 96 Go de mémoire, soit plus que n'importe quel autre accélérateur présenté sur cette page. Comparez plutôt ses caractéristiques (mémoire et prix) à celles du H100 dans le tableau ci-dessus. Elle perd en vitesse de lecture et en compatibilité NVLink, mais gagne en performances grâce à quatre encodeurs vidéo et au ray tracing. Si vous vous demandez si elle est compatible avec votre boîtier, consultez la documentation relative à la RTX 60 avant de faire votre choix.

Dans quelle machine entrent-ils et quel lien obtiennent-ils ?

La carte A100 est une carte PCIe Gen 4 et la H100 est de génération 5, tandis que nos plateformes sont de génération 3 et 4. La carte H100 ne bénéficie donc jamais de la pleine capacité du bus pour lequel elle a été conçue sur aucune des machines que nous utilisons, et cette page l'indique plutôt que de vous laisser le découvrir par vous-même.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Le coût de cette opération dépend entièrement de la nature du travail. Un point d'inférence dont les poids sont stockés localement n'interagit quasiment pas avec l'emplacement et ne s'en apercevra pas. En revanche, une boucle d'apprentissage qui traite un nouveau lot depuis la mémoire hôte à chaque étape le remarquera systématiquement. Si vous n'êtes pas certain de votre cas, veuillez nous indiquer la nature du travail avant de passer commande : c'est la machine, et non la carte, qui détermine le type de carte.

Que peut-on réellement contenir dans 80 Go ?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La carte A100 de 40 Go présente le même problème, à un niveau inférieur : un modèle de 30 à 34 milliards de paramètres avec une précision de 8 bits est compatible, mais pas le même modèle avec 16 bits. Un modèle de 70 milliards de paramètres avec 16 bits ne tient sur aucune carte que nous vendons ; il faut donc une configuration à deux cartes, d’où l’importance de la gamme NVLink mentionnée plus haut.

Ce qu'ils coûtent, avec les machines dans lesquelles ils sont installés

La fiche technique figure sur une ligne de la facture, la machine sur une autre. Ces deux parties proviennent d'une même lecture du catalogue de commandes ; le prix et les spécifications qui l'accompagnent sont donc toujours liés.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

La bande passante est illimitée dans les deux sens, sans frais de sortie. Sur ce type de serveur, ces frais représentent généralement le coût caché le plus important : une simulation d'entraînement, par exemple, qui importe un jeu de données et envoie des points de contrôle, déplace un grand nombre d'octets, et chaque gigaoctet de sortie est facturé. Une adresse IPv4 est incluse, sans engagement, avec une durée d'un mois par défaut. Pour toute autre carte installée, le prix est identique ; consultez le catalogue complet . Pour des machines opérationnelles immédiatement, contactez- nous.

Questions que les gens se posent réellement à propos de ces cartes

Puis-je transcoder une vidéo sur un A100 ou un H100 ?

Pas au niveau matériel. Aucune des deux cartes ne possède d'encodeur (la matrice de compatibilité NVIDIA n'indique aucun moteur NVENC sur les deux), l'encodage est donc pris en charge par le processeur et s'effectue à sa vitesse. Elles permettent le décodage ; un pipeline qui lit la vidéo et produit un autre type de signal convient donc parfaitement. Si vous avez besoin d'images par seconde, la L40S dispose de trois encodeurs AV1 et est beaucoup moins chère : /l40s .

La carte est-elle découpée en instances MIG ?

Pas par nous. Vous recevez la carte physique complète, directement intégrée à votre système d'exploitation, sur une machine vierge. Ces composants sont compatibles MIG ; vous pouvez donc partitionner votre carte si vous le souhaitez. Cette décision vous appartient et concerne votre propre machine ; elle n'est pas modifiée avant la livraison. Il est conseillé de vérifier ce point auprès de vos fournisseurs : de nombreuses offres « A100 » ne concernent qu'une partie de la carte.

A100 40 Go ou 80 Go ?

Privilégiez d'abord la capacité, puis la vitesse de lecture. Si votre appareil et son environnement tiennent dans 40 Go avec un cinquième de libre, la carte de plus petite capacité est plus avantageuse, comme le montre le tableau ci-dessus. La carte de 80 Go offre également une vitesse de lecture plus rapide (1 935 Go/s contre 1 555 Go/s). Par conséquent, si vous êtes proche de la limite en termes de capacité ou de débit, optez pour la plus grande.

Quel pilote et quelle version de CUDA dois-je obtenir ?

Quel que soit votre choix, la machine est livrée avec un système d'exploitation et un système racine propres. Vous devez spécifier le pilote, la version de CUDA et la version du framework utilisés pour tester votre code. Aucune mise à jour ne sera effectuée automatiquement. Si vous préférez que le pilote soit installé avant la livraison, veuillez le préciser lors de votre commande et indiquer la version.

Dans combien de temps puis-je en avoir un ?

Il s'agit des pièces les plus susceptibles d'être achetées plutôt que d'être installées à partir du stock, et vous en êtes informé avant le paiement. Un accélérateur de dernière génération en cours d'attribution correspond au délai de livraison le plus long que nous indiquons. La liste des machines installées et prêtes immédiatement est disponible sur /instant .