NVIDIA L40S · 48 Go GDDR6 avec ECC

L40S — la carte qui fait les trois tâches

Quarante-huit gigaoctets de mémoire à correction d’erreurs, trois encodeurs matériels avec AV1 et des cœurs de ray tracing, sur une seule carte. C’est la seule carte que nous installons qui entraîne un modèle, rend une image et transcode un flux sans compromis sur aucun des trois. Le piège est réel et cette page l’énonce.

48 Go, ECC Trois encodeurs, AV1 Pas de NVLink

Transformez vos GPU en revenu mensuel passif

Vous avez des configurations GPU serveur ou de bureau inutilisées ? Mettez-les en ligne sur le marketplace Primcast dès aujourd’hui et percevez des loyers mensuels réguliers de la part d’équipes IA, de développeurs et d’entreprises ayant besoin de calcul de qualité production.

Aller au Marketplace

Le piège, d’abord

Deux choses que cette carte ne peut pas faire, et toutes deux expliquent pourquoi elle est moins chère que les accélérateurs à côté desquels elle se trouve.

Sa mémoire est rapide, pas empilée. La L40S lit à 864 Go/s. L’A100 à côté d’elle lit à 1 555 Go/s avec 40 Go et 1 935 Go/s avec 80 Go — environ le double du débit. Pour la génération de jetons à grande taille de lot, ce débit de lecture est le plafond et l’arithmétique ne l’est pas, donc une A100 servira plus de requêtes par seconde sur le même modèle même si la L40S a plus de calcul brut sur le papier. Si le débit de service est tout votre problème, l’accélérateur est le bon achat.

Il n’y a pas de NVLink sur cette carte. Deux L40S dans une même machine sont deux pools séparés de 48 Go qui communiquent via le slot, pas un pool unique de 96 Go. L’A100 et la H100 peuvent mutualiser ; celle-ci ne le peut pas. Lorsque vous avez réellement besoin d’un espace d’adressage supérieur à 48 Go, ce n’est pas cette carte qui vous y mène — l’échelle ci-dessous montre ce qui le fait.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

La spécification, telle que NVIDIA la publie

Ada Lovelace, cœurs tensor de quatrième génération, cœurs de ray tracing de troisième génération. Chiffres issus de la page produit L40S de NVIDIA, cités dans la source de cette page.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA publie également 91,6 téraFLOPS de FP32, 212 téraFLOPS de performances de ray tracing et 1 466 téraFLOPS de débit tensoriel FP8 avec sparsité, à partir de 142 cœurs RT et 568 cœurs tensor. Ce sont des chiffres de pointe dans des conditions idéales ; la bande passante mémoire ci-dessus est celle qui décide habituellement de ce que vous obtenez réellement.

Ce dans quoi elle excelle

Après avoir énoncé le piège : voici le travail pour lequel cette carte est réellement la bonne réponse.

Un pipeline avec de la vidéo

Trois encodeurs et trois décodeurs avec AV1 dans les deux sens. Ingérez, transcodez et diffusez sur la même carte qui exécute le modèle décidant quoi faire des images. Ni l’A100 ni la H100 ne peuvent encoder une seule image en matériel — sur ces cartes, la vidéo est une tâche CPU. Combien de chaînes en direct cela permet, et la machine complète dans laquelle elle s’insère : serveurs de transcodage vidéo en direct.

Un rendu qui doit être juste

Mémoire à correction d’erreurs et cœurs de ray tracing de troisième génération. Une ferme de rendu sur cartes grand public coûte moins cher par image et produit occasionnellement une image avec un bit inversé ; sur un long travail sans surveillance, c’est une nouvelle exécution. Cette carte vous donne quarante-huit gigaoctets avec ECC derrière chacun d’eux, ce dont un travail que vous ne pouvez pas surveiller a réellement besoin.

Bureaux virtuels et postes

La L40S prend en charge vGPU et pilote quatre sorties DisplayPort, ce qui en fait une carte que vous pouvez découper entre des postes de travail virtuels plutôt qu’un accélérateur sans tête. L’A100 et la H100 n’ont aucune sortie d’affichage.

Inférence quand le modèle tient dans 48 Go

Support tensoriel FP8 et capacité suffisante pour un modèle de trente milliards de paramètres en précision huit bits avec de la marge. Pour un point de terminaison répondant à un trafic réel à taille de lot modeste, le plafond de bande passante ci-dessus est rarement contraignant — il le devient quand vous poussez la carte à fond.

Ce qu’elle a remplacé, et ce qui se trouve de part et d’autre

De nos propres étagères plutôt que d’une feuille de route de fournisseur. Tous ces éléments sont commandables aujourd’hui.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

L’A40 est la carte Ampere à laquelle la L40S a succédé — les mêmes 48 Go, une architecture plus ancienne, pas d’AV1 et pas de FP8. La RTX 6000 Ada est la carte de station de travail avec la même capacité et la même génération. Les A100 sont ce vers quoi vous vous tournez lorsque la bande passante ou la mutualisation est la contrainte déterminante plutôt que la capacité, et la page de l’accélérateur les couvre en détail.

Dans quelle machine elle s’insère, et quelle liaison elle y obtient

La L40S est une carte PCIe Gen 4. L’une des deux plateformes qui l’acceptent est Gen 3, et l’une est Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Pour un point de terminaison d’inférence ou un transcodeur, la génération du slot est presque sans importance — les poids sont résidents et les images sont petites. Cela compte pour une boucle d’entraînement qui diffuse de nouveaux lots depuis l’hôte à chaque étape, et dans ce cas la plateforme Gen 4 vaut la différence.

Ce qui tient réellement dans 48 Go

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

La carte consomme jusqu’à 350 W, ce qui est modeste pour sa catégorie et explique en partie pourquoi elle tient dans des châssis qu’un accélérateur plus grand ne peut pas intégrer.

Ce tableau répond à « ce qui tient dans cette carte ». La question inverse — combien de mémoire un modèle nécessite, et quelle carte la satisfait — est une page à part entière.

Ce qu’elle coûte, avec la machine dans laquelle elle s’insère

La carte est une ligne sur la facture et la machine en est une autre. Les deux moitiés ci-dessous proviennent d’une seule lecture du catalogue de commandes, de sorte que le prix et la spécification à côté appartiennent toujours l’un à l’autre.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

La bande passante est non mesurée dans les deux sens sans frais de sortie, une adresse IPv4 est incluse, il n’y a pas de contrat et un mois est la durée par défaut. Pour toutes les autres cartes que nous installons, tarifées de la même manière, lisez le catalogue complet, avec prix. Pour les machines en rack prêtes aujourd’hui, /instant.

Questions que les gens posent réellement sur cette carte

L40S ou A100, pour servir un modèle ?

Si le modèle tient dans 48 Go et que le trafic est modéré, la L40S est moins chère et fait plus. Si vous poussez la carte à fond à grande taille de lot, l’A100 lit ses poids environ deux fois plus vite et servira plus de requêtes par seconde malgré moins de calcul sur le papier. Et si le modèle ne tient pas dans 48 Go, l’A100 80 Go est la réponse et la L40S ne l’est pas.

Puis-je mutualiser deux d’entre elles pour obtenir 96 Go ?

Non. Cette carte n’a pas de NVLink, donc deux cartes sont deux pools séparés de 48 Go communiquant via le slot. Un modèle de plus de 48 Go doit être réparti entre elles délibérément par votre framework, avec le slot comme liaison. Si vous voulez un espace d’adressage supérieur à 48 Go, regardez plutôt les cartes 80 Go et 96 Go dans l’échelle ci-dessus.

La carte est-elle partagée, découpée ou virtualisée ?

Pas par nous. Un locataire par machine physique et la carte transmise directement à votre propre système d’exploitation — pas d’hyperviseur, pas de partition MIG, pas de profil vGPU, pas de découpage temporel. La carte prend en charge vGPU, donc si vous voulez la découper entre vos propres bureaux virtuels, vous le pouvez ; c’est votre décision à prendre sur votre propre machine, pas quelque chose que nous lui faisons au préalable.

Fait-elle vraiment de l’AV1 ?

Oui, encodage et décodage, sur ses trois encodeurs et décodeurs matériels. C’est la chose précise que la série RTX 30 ne peut pas faire du tout et que les accélérateurs ne peuvent pas faire du tout, et c’est souvent la raison pour laquelle cette carte figure sur la liste restreinte.

Dans combien de temps puis-je en avoir une ?

Cela dépend si la carte est déjà installée, déjà sur notre étagère, ou doit être achetée — et vous êtes informé avant de payer, pas après. /instant liste les machines en rack prêtes immédiatement.