NVIDIA L40S · 48 GB GDDR6 mit ECC

L40S — die Karte, die alle drei Aufgaben erledigt

Achtundvierzig Gigabyte fehlerkorrigierender Speicher, drei Hardware-Encoder mit AV1 und Raytracing-Kerne, alles auf einer Platine. Es ist die einzige Karte, die wir einbauen und die ein Modell trainiert, ein Bild rendert und einen Stream transkodiert, ohne bei einem der drei Kompromisse einzugehen. Der Haken ist real, und diese Seite benennt ihn.

48 GB, ECC Drei Encoder, AV1 Kein NVLink

Machen Sie aus Ihren GPUs passives monatliches Einkommen

Haben Sie ungenutzte Server- oder Desktop-GPU-Setups? Listen Sie sie noch heute auf dem Primcast-Marktplatz und erzielen Sie stabile monatliche Mieteinnahmen von KI-Teams, Entwicklern und Unternehmen, die Compute in Produktionsqualität benötigen.

Zum Marktplatz

Zuerst der Haken

Zwei Dinge, die diese Karte nicht kann, und beide sind der Grund, warum sie günstiger ist als die Beschleuniger, neben denen sie steht.

Ihr Speicher ist schnell, nicht gestapelt. Die L40S liest mit 864 GB/s. Die A100 daneben liest mit 1.555 GB/s bei 40 GB und 1.935 GB/s bei 80 GB — ungefähr die doppelte Rate. Für die Token-Erzeugung bei großer Batch-Größe ist diese Leserate die Obergrenze und nicht die Rechenleistung, daher bedient eine A100 mehr Anfragen pro Sekunde vom selben Modell, obwohl die L40S auf dem Papier mehr rohe Rechenleistung hat. Wenn der Serving-Durchsatz Ihr gesamtes Problem ist, ist der Beschleuniger der richtige Kauf.

Dieses Teil hat kein NVLink. Zwei L40S-Karten in einer Maschine sind zwei getrennte 48 GB-Pools, die über den Slot kommunizieren, nicht ein 96 GB-Pool. Die A100 und die H100 können bündeln; diese hier nicht. Wenn Sie wirklich einen Adressraum größer als 48 GB benötigen, ist dies nicht die Karte, die Sie dorthin bringt — die Leiter unten zeigt, was es tut.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Die Spezifikation, wie NVIDIA sie veröffentlicht

Ada Lovelace, Tensor-Kerne der vierten Generation, Raytracing-Kerne der dritten Generation. Zahlen von NVIDIAs eigener L40S-Produktseite, zitiert im Quelltext dieser Seite.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA veröffentlicht außerdem 91,6 TeraFLOPS FP32, 212 TeraFLOPS Raytracing-Leistung und 1.466 TeraFLOPS FP8-Tensor-Durchsatz mit Sparsity, aus 142 RT-Kernen und 568 Tensor-Kernen. Das sind Spitzenwerte unter idealen Bedingungen; die Speicherbandbreite oben ist diejenige, die normalerweise entscheidet, was Sie tatsächlich bekommen.

Worin sie gut ist

Nachdem der Haken benannt ist: Hier ist die Arbeit, für die diese Karte wirklich die richtige Antwort ist.

Eine Pipeline mit Video darin

Drei Encoder und drei Decoder mit AV1 in beide Richtungen. Aufnahme, Transkodierung und Auslieferung auf derselben Platine, auf der das Modell läuft, das entscheidet, was mit den Frames geschieht. Weder die A100 noch die H100 kann auch nur ein einziges Bild in Hardware encodieren — auf diesen Karten ist Video eine CPU-Aufgabe. Wie viele Live-Kanäle das bringt und die komplette Maschine, in die sie gehört: Live-Video-Transkodierungs-Server.

Rendering, das stimmen muss

Fehlerkorrigierender Speicher und Raytracing-Kerne der dritten Generation. Eine Renderfarm auf Consumer-Karten kostet weniger pro Bild und produziert gelegentlich ein Bild mit einem gekippten Bit darin; bei einem langen unbeaufsichtigten Auftrag bedeutet das einen erneuten Durchlauf. Diese Karte gibt Ihnen achtundvierzig Gigabyte mit ECC hinter jedem einzelnen, und genau das braucht ein Auftrag, den Sie nicht überwachen können.

Virtuelle Desktops und Arbeitsplätze

Die L40S unterstützt vGPU und treibt vier DisplayPort-Ausgänge an, was sie zu einer Karte macht, die Sie zwischen virtuellen Workstations aufteilen können, statt zu einem kopflosen Beschleuniger. Die A100 und die H100 haben überhaupt keine Display-Ausgänge.

Inferenz, wenn das Modell in 48 GB passt

FP8-Tensor-Unterstützung und genug Kapazität für ein Modell mit dreißig Milliarden Parametern bei Acht-Bit-Präzision, mit Luft nach oben. Für einen Endpunkt, der echten Traffic bei moderater Batch-Größe beantwortet, bindet die Bandbreiten-Obergrenze oben selten — sie bindet, wenn Sie die Karte mit voller Last fahren.

Was sie ersetzt hat und was auf beiden Seiten davon steht

Aus unseren eigenen Regalen statt aus einer Hersteller-Roadmap. Alle diese sind heute bestellbar.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

Die A40 ist die Ampere-Karte, auf die die L40S folgte — dieselben 48 GB, eine ältere Architektur, kein AV1 und kein FP8. Die RTX 6000 Ada ist die Workstation-Karte mit derselben Kapazität und derselben Generation. Die A100s sind das, wozu Sie wechseln, wenn Bandbreite oder Bündelung die bindende Einschränkung ist statt der Kapazität, und die Beschleuniger-Seite behandelt diese im Detail.

In welche Maschine sie gehört und welche Anbindung sie dort bekommt

Die L40S ist eine PCIe-Gen-4-Karte. Eine der beiden Plattformen, die sie aufnehmen, ist Gen 3, und eine ist Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Für einen Inferenz-Endpunkt oder einen Transkodierer ist die Slot-Generation nahezu irrelevant — die Gewichte sind resident und die Frames sind klein. Sie ist wichtig für eine Trainingsschleife, die bei jedem Schritt frische Batches vom Host streamt, und für diesen Fall ist die Gen-4-Plattform den Unterschied wert.

Was tatsächlich in 48 GB passt

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

Die Karte zieht bis zu 350 W, was für ihre Klasse bescheiden ist und mit ein Grund dafür, dass sie in Gehäuse passt, in die ein größerer Beschleuniger nicht passt.

Diese Tabelle beantwortet „was passt in diese Karte“. Die Frage in die andere Richtung — wie viel Speicher ein Modell braucht und welche Karte das schafft — ist eine eigene Seite.

Was sie kostet, mit der Maschine, in die sie gehört

Die Karte ist eine Zeile auf der Rechnung und die Maschine eine andere. Beide Hälften unten stammen aus einer einzigen Ablesung des Bestellkatalogs, daher gehören der Preis und die Spezifikation daneben immer zusammen.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Die Bandbreite ist in beide Richtungen ungedrosselt ohne Egress-Gebühr, eine IPv4-Adresse ist enthalten, es gibt keinen Vertrag und ein Monat ist die Standardlaufzeit. Für jede andere Karte, die wir einbauen, auf dieselbe Weise bepreist, lesen Sie den gesamten Katalog, bepreist. Für Maschinen, die heute gerackt und bereit sind, /instant.

Fragen, die Leute zu dieser Karte tatsächlich stellen

L40S oder A100, um ein Modell zu serven?

Wenn das Modell in 48 GB passt und der Traffic moderat ist, ist die L40S günstiger und kann mehr. Wenn Sie die Karte bei großer Batch-Größe mit voller Last fahren, liest die A100 ihre Gewichte etwa doppelt so schnell und bedient mehr Anfragen pro Sekunde, obwohl sie auf dem Papier weniger Rechenleistung hat. Und wenn das Modell nicht in 48 GB passt, ist die A100 80 GB die Antwort und die L40S nicht.

Kann ich zwei davon bündeln, um 96 GB zu bekommen?

Nein. Dieses Teil hat kein NVLink, daher sind zwei Karten zwei getrennte 48 GB-Pools, die über den Slot kommunizieren. Ein Modell größer als 48 GB muss von Ihrem Framework bewusst auf sie aufgeteilt werden, mit dem Slot als Verbindung. Wenn Sie einen Adressraum größer als 48 GB möchten, schauen Sie sich stattdessen die 80 GB- und 96 GB-Karten in der Leiter oben an.

Ist die Karte geteilt, geslicet oder virtualisiert?

Von uns nicht. Ein Mandant pro physischer Maschine und die Karte direkt an Ihr eigenes Betriebssystem durchgereicht — kein Hypervisor, keine MIG-Partition, kein vGPU-Profil, kein Time-Slicing. Die Karte unterstützt vGPU, wenn Sie sie also zwischen Ihren eigenen virtuellen Desktops aufteilen möchten, können Sie das; das ist Ihre Entscheidung auf Ihrer eigenen Maschine, nicht etwas, das wir ihr vorher antun.

Kann sie wirklich AV1?

Ja, Encodieren und Decodieren, auf allen drei ihrer Hardware-Encoder und -Decoder. Das ist genau das, was die RTX-30-Serie überhaupt nicht kann und die Beschleuniger überhaupt nicht können, und oft der Grund, warum diese Karte auf der Shortlist steht.

Wie schnell kann ich eine haben?

Das hängt davon ab, ob die Karte bereits eingebaut ist, bereits in unserem Regal liegt oder erst beschafft werden muss — und das erfahren Sie, bevor Sie bezahlen, nicht danach. /instant listet Maschinen, die jetzt gerackt und bereit sind.