NVIDIA L40S · 48 Go GDDR6 avec ECC

L40S — la carte qui remplit les trois fonctions

Quarante-huit gigaoctets de mémoire corrigée d'erreurs, trois encodeurs matériels avec AV1 et des cœurs de lancer de rayons, le tout sur une seule carte. C'est la seule carte que nous proposons capable d'entraîner un modèle, de générer une image et de transcoder un flux sans compromis sur aucune de ces trois opérations. Le hic, c'est que cette page l'indique clairement.

48 Go, ECC Trois encodeurs, AV1 Pas de NVLink

Le hic, d'abord

Cette carte ne peut pas faire deux choses, et ce sont les deux raisons pour lesquelles elle est moins chère que les accélérateurs qui la côtoient.

Sa mémoire est rapide, mais non empilée. Le L40S atteint une vitesse de lecture de 864 Go/s. L'A100, placé à côté, atteint 1 555 Go/s avec 40 Go de mémoire et 1 935 Go/s avec 80 Go, soit environ le double. Pour la génération de jetons par lots importants, cette vitesse de lecture représente la limite, contrairement aux calculs. Un A100 traitera donc davantage de requêtes par seconde, même si le L40S affiche une puissance de calcul brute supérieure sur le papier. Si le débit est votre seul critère, l'accélérateur est le choix idéal.

Ce composant ne prend pas en charge NVLink. Deux cartes L40S dans une même machine constituent deux pools de 48 Go distincts communiquant via le slot, et non un seul pool de 96 Go. Les cartes A100 et H100 peuvent gérer le pooling ; ce n'est pas le cas de celle-ci. Si vous avez réellement besoin d'un espace d'adressage supérieur à 48 Go, cette carte n'est pas la solution ; le schéma ci-dessous indique les alternatives.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

La spécification, telle que publiée par NVIDIA

Ada Lovelace, cœurs Tensor de quatrième génération, cœurs de ray tracing de troisième génération. Données issues de la page produit L40S de NVIDIA, citée dans la source de cette page.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA annonce également 91,6 téraFLOPS en FP32, 212 téraFLOPS en ray tracing et 1 466 téraFLOPS en FP8 pour le traitement des tenseurs avec sparsité, grâce à 142 cœurs RT et 568 cœurs Tensor. Il s'agit de performances maximales dans des conditions idéales ; la bande passante mémoire mentionnée ci-dessus est généralement le facteur déterminant des performances réelles.

Ce qu'il fait bien

Ceci étant dit, voici le type de travail pour lequel cette carte est véritablement la solution idéale.

Un pipeline avec de la vidéo dedans

Trois encodeurs et trois décodeurs avec interface AV1 bidirectionnelle. Acquisition, transcodage et diffusion sur la même carte qui exécute le modèle déterminant le traitement des images. Ni l'A100 ni la H100 ne peuvent encoder une seule image en matériel ; sur ces cartes, le traitement vidéo est assuré par le processeur.

Le rendu doit être correct.

Mémoire à correction d'erreurs et cœurs de ray tracing de troisième génération. Une ferme de rendu sur cartes grand public coûte moins cher par image et produit parfois une image avec un bit inversé ; sur une tâche longue et sans surveillance, cela entraîne une nouvelle exécution. Cette carte offre quarante-huit gigaoctets de mémoire avec correction d'erreurs, ce qui est largement suffisant pour une tâche ne nécessitant pas de surveillance constante.

bureaux et sièges virtuels

La L40S prend en charge le vGPU et dispose de quatre sorties DisplayPort, ce qui en fait une carte utilisable entre plusieurs stations de travail virtuelles plutôt qu'un accélérateur sans écran. Les cartes A100 et H100, quant à elles, ne possèdent aucune sortie vidéo.

Inférence où le modèle tient dans 48 Go

La carte prend en charge les tenseurs FP8 et offre une capacité suffisante pour un modèle de trente milliards de paramètres avec une précision de huit bits, avec une marge confortable. Pour un terminal traitant un trafic réel avec une taille de lot modeste, la limite de bande passante mentionnée ci-dessus est rarement atteinte ; elle l'est uniquement lorsque la carte est utilisée à pleine capacité.

Ce qu'il a remplacé, et ce qui se trouve de part et d'autre.

Nous les proposons directement depuis nos stocks, sans passer par un fournisseur. Tous ces produits sont disponibles à la commande dès aujourd'hui.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

L'A40 est la carte Ampere qui a succédé à la L40S : mêmes 48 Go de mémoire, une architecture plus ancienne, sans AV1 ni FP8. La RTX 6000 Ada est la carte pour stations de travail offrant les mêmes capacités et appartenant à la même génération. Les cartes A100 sont à privilégier lorsque la bande passante ou le partage de mémoire sont les principaux facteurs limitants, plutôt que la capacité ; la page dédiée aux accélérateurs les décrit en détail.

Dans quelle machine cela se branche-t-il, et quel lien cela établit-il ?

La L40S est une carte PCIe Gen 4. Elle est compatible avec deux plateformes : l’une fonctionne en Gen 3, l’autre en Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Pour un point d'inférence ou un transcodeur, la génération des slots est quasiment négligeable : les poids sont stockés localement et les trames sont petites. En revanche, elle est cruciale pour une boucle d'entraînement qui reçoit en continu de nouveaux lots de données de l'hôte à chaque étape, et dans ce cas, la plateforme de 4e génération justifie pleinement son prix.

Que peut-on réellement stocker dans 48 Go ?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La carte consomme jusqu'à 350 W, ce qui est modeste pour sa catégorie et explique en partie pourquoi elle peut être installée dans des châssis où une carte graphique plus imposante ne le pourrait pas.

Ce que ça coûte, avec la machine dans laquelle ça entre

La fiche technique figure sur une ligne de la facture, la machine sur une autre. Ces deux parties proviennent d'une même lecture du catalogue de commandes ; le prix et les spécifications qui l'accompagnent sont donc toujours liés.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

La bande passante est illimitée dans les deux sens, sans frais de sortie. Une adresse IPv4 est incluse. Il n'y a pas d'engagement et la durée par défaut est d'un mois. Pour toute autre carte installée, le prix est le même. Consultez le catalogue complet pour connaître les prix . Pour les machines installées et prêtes immédiatement, /instantané .

Questions que les gens se posent réellement à propos de cette carte

L40S ou A100, pour servir un modèle ?

Si le modèle tient dans une carte de 48 Go et que le trafic est modéré, la L40S est plus économique et plus performante. En cas de forte sollicitation de la carte avec des lots importants, l'A100 effectue des calculs environ deux fois plus rapidement et traitera davantage de requêtes par seconde malgré une puissance de calcul théoriquement inférieure. Enfin, si le modèle dépasse les 48 Go, l'A100 80 Go est la solution, contrairement à la L40S.

Puis-je en combiner deux pour obtenir 96 Go ?

Non. Ce composant ne dispose pas de NVLink ; les deux cartes constituent donc deux pools de 48 Go distincts communiquant via le slot. Un modèle de plus de 48 Go doit être divisé manuellement entre ces deux pools par votre framework, le slot servant de lien. Si vous souhaitez un espace d'adressage supérieur à 48 Go, veuillez vous référer aux cartes de 80 Go et 96 Go mentionnées précédemment.

La carte est-elle partagée, découpée ou virtualisée ?

Pas par nous. Un seul locataire par machine physique et la carte est directement gérée par votre système d'exploitation : pas d'hyperviseur, pas de partition MIG, pas de profil vGPU, pas de partage de temps. La carte prend en charge le vGPU ; vous pouvez donc la répartir entre vos bureaux virtuels si vous le souhaitez. C'est à vous de décider sur votre machine, nous n'intervenons pas au préalable.

Est-ce que ça prend vraiment en charge l'AV1 ?

Oui, elle encode et décode, sur ses trois encodeurs et décodeurs matériels. C'est précisément ce que la série RTX 30 et ses accélérateurs ne peuvent pas faire, et c'est souvent la raison pour laquelle cette carte figure parmi les meilleures.

Dans combien de temps puis-je en avoir un ?

Cela dépend si la carte est déjà installée, déjà en stock, ou si elle doit être commandée ; vous en serez informé avant de payer, pas après. /instant liste les machines disponibles et prêtes à l'emploi.