NVIDIA L40S · 48 GB GDDR6 mit ECC

L40S – die Karte, die alle drei Aufgaben erfüllt

48 Gigabyte fehlerkorrigierter Speicher, drei Hardware-Encoder mit AV1 und Raytracing-Kerne – alles auf einer einzigen Karte. Sie ist die einzige Karte, die wir verbauen, die ein Modell trainieren, ein Frame rendern und einen Stream transkodieren kann, ohne Kompromisse bei einem der drei Schritte einzugehen. Der Haken ist real und wird auf dieser Seite erläutert.

48 GB, ECC Drei Encoder, AV1 Kein NVLink

Der Haken an der Sache ist zunächst

Zwei Dinge kann diese Karte nicht, und beides ist der Grund, warum sie günstiger ist als die Beschleuniger, neben denen sie sich befindet.

Der Speicher des L40S ist schnell, aber nicht gestapelt. Er liest mit 864 GB/s. Der parallel laufende A100 erreicht 1.555 GB/s mit 40 GB und 1.935 GB/s mit 80 GB – also etwa die doppelte Geschwindigkeit. Bei der Token-Generierung mit großen Batchgrößen ist diese Lesegeschwindigkeit das Maximum, die Rechenleistung jedoch nicht. Daher kann ein A100 mit demselben Modell mehr Anfragen pro Sekunde bearbeiten, obwohl der L40S auf dem Papier über mehr Rechenleistung verfügt. Wenn der Durchsatz Ihr Hauptproblem ist, ist der Beschleuniger die richtige Wahl.

Dieses Bauteil verfügt über kein NVLink. Zwei L40S-Karten in einem Gerät bilden zwei separate 48-GB-Adressräume, die über den Steckplatz kommunizieren, nicht einen einzigen 96-GB-Adressraum. Die A100 und H100 können einen Adressraum bilden; diese Karte hingegen nicht. Wenn Sie tatsächlich einen Adressraum mit mehr als 48 GB benötigen, ist diese Karte nicht die richtige Wahl – die folgende Übersicht zeigt, welche Alternativen funktionieren.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Die Spezifikation, wie sie von NVIDIA veröffentlicht wird

Ada Lovelace, Tensor-Kerne der vierten Generation, Raytracing-Kerne der dritten Generation. Die Daten stammen von der Produktseite des NVIDIA L40S und sind in der Quelle dieser Seite angegeben.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA gibt außerdem 91,6 TeraFLOPS FP32-Leistung, 212 TeraFLOPS Raytracing-Leistung und 1.466 TeraFLOPS FP8-Tensor-Durchsatz mit Sparsity an, basierend auf 142 RT-Kernen und 568 Tensor-Kernen. Dies sind Spitzenwerte unter Idealbedingungen; die tatsächlich erzielbare Leistung hängt in der Regel von der Speicherbandbreite ab.

Wofür es gut ist

Nachdem wir den Haken genannt haben: Hier ist die Arbeit, für die diese Karte tatsächlich die richtige Lösung ist.

Eine Pipeline mit Video

Drei Encoder und drei Decoder mit AV1 in beide Richtungen. Aufnahme, Transkodierung und Bereitstellung erfolgen auf derselben Karte, die auch das Modell ausführt, das die Verarbeitung der Frames steuert. Weder die A100 noch die H100 können einzelne Frames in Hardware kodieren – bei diesen Karten wird die Videoverarbeitung vom Prozessor übernommen.

Das Rendering muss korrekt sein.

Fehlerkorrigierender Speicher und Raytracing-Kerne der dritten Generation. Eine Renderfarm mit Consumer-Grafikkarten ist pro Frame günstiger und erzeugt gelegentlich einen Frame mit einem gekippten Bit; bei einem langen, unbeaufsichtigten Renderprozess wird dieser wiederholt. Diese Karte bietet 48 Gigabyte Speicher mit ECC-Unterstützung für jedes einzelne Bit – genau das, was ein Renderprozess benötigt, der nicht permanent überwacht werden kann.

Virtuelle Desktops und Sitzplätze

Die L40S unterstützt vGPU und verfügt über vier DisplayPort-Ausgänge. Dadurch eignet sie sich als Karte für den Einsatz in virtuellen Workstations und nicht als Headless-Beschleuniger. Die Modelle A100 und H100 besitzen hingegen keine Display-Ausgänge.

Inferenz, bei der das Modell in 48 GB passt

FP8-Tensorunterstützung und ausreichend Kapazität für ein Modell mit dreißig Milliarden Parametern bei acht Bit Genauigkeit mit noch vorhandenen Reserven. Bei einem Endpunkt, der realen Datenverkehr mit moderater Batchgröße verarbeitet, stößt die Bandbreitenbegrenzung selten an ihre Grenzen – sie tritt erst bei maximaler Auslastung der Karte ein.

Was es ersetzte und was sich zu beiden Seiten davon befindet.

Aus unserem eigenen Sortiment, nicht von einem Lieferanten. Alle Artikel sind ab heute bestellbar.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

Die A40 ist die Ampere-Karte, die die L40S abgelöst hat – ebenfalls 48 GB, ältere Architektur, kein AV1 und kein FP8. Die RTX 6000 Ada ist die Workstation-Karte mit derselben Kapazität und Generation. Die A100-Karten kommen zum Einsatz, wenn Bandbreite oder Pooling wichtiger sind als die Speicherkapazität. Detaillierte Informationen dazu finden Sie auf der Seite zu Beschleunigern .

In welche Maschine es eingeht und welche Verbindung es dorthin herstellt.

Die L40S ist eine PCIe-Gen-4-Karte. Sie ist auf zwei Plattformen kompatibel: einer Gen-3- und einer Gen-4-Plattform.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Für einen Inferenz-Endpunkt oder einen Transcoder ist die Slot-Generierung nahezu irrelevant – die Gewichte sind resident und die Frames klein. Sie ist jedoch relevant für eine Trainingsschleife, die in jedem Schritt neue Batches vom Host streamt, und in diesem Fall lohnt sich der Unterschied der Gen-4-Plattform.

Was passt tatsächlich in 48 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Die Karte benötigt bis zu 350 W, was für ihre Klasse moderat ist und unter anderem der Grund dafür ist, dass sie in Gehäuse passt, in die ein größerer Beschleuniger nicht passt.

Was es kostet, inklusive der Maschine, in die es gehört

Die Karte bildet eine Zeile auf der Rechnung, die Maschine eine andere. Beide Hälften stammen aus einem einzigen Durchlauf des Bestellkatalogs, daher gehören Preis und zugehörige Spezifikation immer zusammen.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Die Bandbreite ist in beide Richtungen unbegrenzt, es fallen keine Gebühren für ausgehende Verbindungen an, eine IPv4-Adresse ist inklusive, es gibt keine Vertragsbindung und die Standardlaufzeit beträgt einen Monat. Alle anderen von uns verbauten Karten werden zum gleichen Preis angeboten. Den vollständigen Katalog finden Sie hier. Für sofort einsatzbereite Geräte: /instant .

Fragen, die Leute tatsächlich zu dieser Karte stellen

L40S oder A100, zum Servieren eines Models?

Passt das Modell in den 48-GB-Speicher und ist das Datenaufkommen moderat, ist die L40S günstiger und leistungsstärker. Bei hoher Auslastung der Karte und großen Datenmengen liest die A100 die Datengewichte etwa doppelt so schnell und kann trotz geringerer Rechenleistung auf dem Papier mehr Anfragen pro Sekunde bearbeiten. Passt das Modell nicht in den 48-GB-Speicher, ist die A100 mit 80 GB die richtige Wahl, die L40S hingegen nicht.

Kann ich zwei davon zusammenfassen, um 96 GB zu erhalten?

Nein. Dieser Teil verfügt über kein NVLink, daher kommunizieren die beiden Karten über den Steckplatz und bilden zwei separate 48-GB-Speicherbereiche. Bei einem Modell mit mehr als 48 GB Speicherkapazität muss dies von Ihrem System explizit auf die beiden Speicherbereiche aufgeteilt werden, wobei der Steckplatz als Verbindung dient. Wenn Sie einen Adressraum von mehr als 48 GB benötigen, sehen Sie sich stattdessen die 80-GB- und 96-GB-Karten in der obigen Übersicht an.

Wird die Karte gemeinsam genutzt, aufgeteilt oder virtualisiert?

Nicht von uns. Ein Mandant pro physischer Maschine, und die Grafikkarte wird direkt an Ihr Betriebssystem durchgeschleift – kein Hypervisor, keine MIG-Partition, kein vGPU-Profil, kein Time-Slicing. Die Karte unterstützt vGPU, daher können Sie die Leistung bei Bedarf auf Ihre virtuellen Desktops aufteilen; dies ist Ihre Entscheidung, die Sie auf Ihrer eigenen Maschine treffen müssen, nicht etwas, das wir im Vorfeld vornehmen.

Unterstützt es wirklich AV1?

Ja, sowohl Kodierung als auch Dekodierung, und zwar mit allen drei Hardware-Encodern und -Decodern. Genau das können weder die RTX-30-Serie noch die Beschleuniger, und deshalb steht diese Karte oft auf der Auswahlliste.

Wie schnell kann ich eins bekommen?

Das hängt davon ab, ob die Karte bereits installiert, vorrätig oder erst bestellt werden muss – und das wird Ihnen vor der Bezahlung mitgeteilt, nicht danach. /instant listet die aktuell verfügbaren und einsatzbereiten Geräte auf.