NVIDIA L40S · 48 GB GDDR6 con ECC

L40S — la scheda che fa tutti e tre i lavori

Quarantotto gigabyte di memoria con correzione degli errori, tre encoder hardware con AV1 e core ray-tracing, su un'unica scheda. È l'unica scheda che montiamo in grado di addestrare un modello, renderizzare un fotogramma e transcodificare uno stream senza compromessi su nessuno dei tre fronti. Il limite è reale e questa pagina lo dichiara.

48 GB, ECC Tre encoder, AV1 Nessun NVLink

Trasforma le tue GPU in entrate mensili passive

Hai configurazioni GPU server o desktop inattive? Pubblicarle oggi sul marketplace Primcast e guadagna affitti mensili costanti da team AI, sviluppatori e aziende che necessitano di potenza di calcolo di livello produttivo.

Vai al Marketplace

Prima i limiti

Due cose che questa scheda non può fare, ed entrambe sono il motivo per cui costa meno degli acceleratori accanto ai quali si trova.

La sua memoria è veloce, non impilata. L'L40S legge a 864 GB/s. L'A100 accanto legge a 1.555 GB/s con 40 GB e 1.935 GB/s con 80 GB — circa il doppio della velocità. Per la generazione di token con un batch di grandi dimensioni, quella velocità di lettura è il tetto e non l'aritmetica, quindi un A100 servirà più richieste al secondo dallo stesso modello anche se l'L40S ha più potenza di calcolo grezza sulla carta. Se la throughput di serving è l'intero tuo problema, l'acceleratore è l'acquisto corretto.

Non c'è NVLink su questa scheda. Due L40S in una macchina sono due pool separati da 48 GB che comunicano attraverso lo slot, non un unico pool da 96 GB. L'A100 e l'H100 possono aggregare; questa no. Quando hai davvero bisogno di uno spazio di indirizzamento più grande di 48 GB, questa non è la scheda che ti ci porta — la scala qui sotto mostra cosa lo fa.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Le specifiche, come le pubblica NVIDIA

Ada Lovelace, tensor core di quarta generazione, core ray-tracing di terza generazione. Dati dalla pagina prodotto L40S di NVIDIA stessa, citati nel sorgente di questa pagina.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA pubblica anche 91,6 teraFLOPS di FP32, 212 teraFLOPS di prestazioni ray-tracing e 1.466 teraFLOPS di throughput tensor FP8 con sparsità, da 142 RT core e 568 tensor core. Sono cifre di picco in condizioni ideali; la larghezza di banda della memoria sopra è quella che di solito decide cosa ottieni davvero.

In cosa è brava

Dopo aver dichiarato i limiti: ecco il lavoro per cui questa scheda è davvero la risposta giusta.

Una pipeline con video dentro

Tre encoder e tre decoder con AV1 in entrambe le direzioni. Acquisisci, transcodifica e servi sulla stessa scheda che esegue il modello che decide cosa fare con i fotogrammi. Né l'A100 né l'H100 possono codificare un singolo fotogramma in hardware — su quelle schede, il video è un lavoro della CPU. Quanti canali live questo consente, e la macchina completa in cui va: server di transcodifica video live.

Rendering che deve essere corretto

Memoria con correzione degli errori e core ray-tracing di terza generazione. Una render farm su schede consumer costa meno per fotogramma e occasionalmente produce un fotogramma con un bit invertito; in un lavoro lungo non presidiato significa rieseguirlo. Questa scheda ti dà quarantotto gigabyte con ECC dietro ognuno di essi, che è ciò di cui ha davvero bisogno un lavoro che non puoi sorvegliare.

Desktop virtuali e postazioni

L'L40S supporta vGPU e pilota quattro uscite DisplayPort, il che la rende una scheda che puoi suddividere tra workstation virtuali invece di un acceleratore headless. L'A100 e l'H100 non hanno alcuna uscita display.

Inferenza dove il modello sta in 48 GB

Supporto tensor FP8 e capacità sufficiente per un modello da trenta miliardi di parametri a precisione a otto bit con margine. Per un endpoint che risponde a traffico reale con un batch di dimensioni modeste, il tetto di larghezza di banda sopra raramente vincola — vincola quando spingi la scheda al massimo.

Cosa ha sostituito, e cosa le sta ai due lati

Dai nostri scaffali piuttosto che da una roadmap di un fornitore. Tutte queste sono ordinabili oggi.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

L'A40 è la scheda Ampere a cui l'L40S è succeduta — gli stessi 48 GB, un'architettura più vecchia, niente AV1 e niente FP8. La RTX 6000 Ada è la scheda workstation con la stessa capacità e la stessa generazione. Gli A100 sono ciò a cui passi quando la larghezza di banda o l'aggregazione sono il vincolo determinante invece della capacità, e la pagina dell'acceleratore li tratta in dettaglio.

In quale macchina va, e che collegamento riceve lì

L'L40S è una scheda PCIe Gen 4. Una delle due piattaforme che la ospitano è Gen 3, e una è Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Per un endpoint di inferenza o un transcoder, la generazione dello slot è quasi irrilevante — i pesi sono residenti e i fotogrammi sono piccoli. Conta per un ciclo di addestramento che trasferisce nuovi batch dall'host a ogni passo, e in quel caso la piattaforma Gen 4 vale la differenza.

Cosa sta davvero in 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

La scheda assorbe fino a 350 W, un valore modesto per la sua classe e parte del motivo per cui entra in chassis in cui un acceleratore più grande non entra.

Quella tabella risponde a “cosa sta in questa scheda”. La domanda al contrario — quanta memoria serve a un modello, e quale scheda la soddisfa — è una pagina a sé.

Quanto costa, con la macchina in cui va

La scheda è una riga sulla fattura e la macchina è un'altra. Entrambe le metà qui sotto provengono da un'unica lettura del catalogo ordini, quindi il prezzo e le specifiche accanto appartengono sempre l'uno all'altra.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

La larghezza di banda non è misurata in entrambe le direzioni senza costi di uscita, un indirizzo IPv4 è incluso, non c'è contratto e un mese è la durata predefinita. Per ogni altra scheda che montiamo, prezzata allo stesso modo, leggi l'intero catalogo, con i prezzi. Per macchine già montate in rack e pronte oggi, /instant.

Domande che le persone fanno davvero su questa scheda

L40S o A100, per servire un modello?

Se il modello sta in 48 GB e il traffico è moderato, l'L40S costa meno e fa di più. Se spingi la scheda al massimo con un batch di grandi dimensioni, l'A100 legge i suoi pesi circa il doppio più velocemente e servirà più richieste al secondo pur avendo meno potenza di calcolo sulla carta. E se il modello non sta in 48 GB, l'A100 da 80 GB è la risposta e l'L40S no.

Posso aggregarne due per ottenere 96 GB?

No. Questa scheda non ha NVLink, quindi due schede sono due pool separati da 48 GB che comunicano attraverso lo slot. Un modello più grande di 48 GB deve essere diviso tra loro deliberatamente dal tuo framework, con lo slot come collegamento. Se vuoi uno spazio di indirizzamento più grande di 48 GB, guarda invece le schede da 80 GB e 96 GB nella scala sopra.

La scheda è condivisa, suddivisa o virtualizzata?

Non da noi. Un tenant per macchina fisica e la scheda passata direttamente al tuo sistema operativo — nessun hypervisor, nessuna partizione MIG, nessun profilo vGPU, nessun time-slicing. La scheda supporta vGPU, quindi se vuoi suddividerla tra i tuoi desktop virtuali puoi farlo; è una tua decisione da prendere sulla tua macchina, non qualcosa che facciamo noi in anticipo.

Fa davvero AV1?

Sì, codifica e decodifica, su tutti e tre i suoi encoder e decoder hardware. È la cosa specifica che la serie RTX 30 non può fare affatto e che gli acceleratori non possono fare affatto, ed è spesso il motivo per cui questa scheda è nella shortlist.

Quanto presto posso averne una?

Dipende se la scheda è già montata, già sul nostro scaffale o deve essere acquistata — e ti viene detto prima di pagare, non dopo. /instant elenca le macchine montate in rack e pronte adesso.