NVIDIA L40S · 48 GB GDDR6 con ECC

L40S : la scheda che svolge tutte e tre le funzioni.

Quarantotto gigabyte di memoria con correzione degli errori, tre encoder hardware con AV1 e core per il ray tracing, tutto su un'unica scheda. È l'unica scheda che abbiamo testato in grado di addestrare un modello, renderizzare un frame e transcodificare uno stream senza compromettere nessuna di queste tre operazioni. C'è però un aspetto da considerare, e questa pagina lo spiega chiaramente.

48 GB, ECC Tre encoder, AV1 Nessun collegamento NVLink

Il trucco, prima

Questa scheda non può fare due cose, ed entrambe sono il motivo per cui costa meno degli acceleratori che ha accanto.

La sua memoria è veloce, non impilata. L'L40S legge a 864 GB/s. L'A100, a confronto, legge a 1.555 GB/s con 40 GB e a 1.935 GB/s con 80 GB, circa il doppio. Per la generazione di token con batch di grandi dimensioni, quella velocità di lettura rappresenta il limite massimo, mentre le operazioni aritmetiche non lo sono; pertanto, un A100 gestirà più richieste al secondo rispetto allo stesso modello, anche se l'L40S ha una maggiore potenza di calcolo sulla carta. Se il throughput di gestione è il vostro unico problema, l'acceleratore è l'acquisto corretto.

Questa scheda non supporta NVLink. Due schede L40S in una macchina costituiscono due pool separati da 48 GB che comunicano tramite lo slot, non un unico pool da 96 GB. Le schede A100 e H100 supportano il pooling; questa no. Se hai effettivamente bisogno di uno spazio di indirizzamento superiore a 48 GB, questa non è la scheda adatta: la tabella sottostante mostra la soluzione ideale.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

La specifica, così come pubblicata da NVIDIA

Ada Lovelace, core tensoriali di quarta generazione, core per ray tracing di terza generazione. Dati tratti dalla pagina del prodotto L40S di NVIDIA, citata nella fonte di questa pagina.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA pubblica anche 91,6 teraFLOPS di FP32, 212 teraFLOPS di prestazioni di ray-tracing e 1.466 teraFLOPS di throughput tensoriale FP8 con sparsità, da 142 core RT e 568 core tensoriali. Questi sono i valori massimi in condizioni ideali; la larghezza di banda della memoria sopra menzionata è quella che solitamente determina le prestazioni effettive.

In cosa eccelle

Detto questo, ecco il lavoro per cui questa carta è davvero la soluzione giusta.

Una pipeline con video al suo interno

Tre encoder e tre decoder con AV1 in entrambe le direzioni. Acquisizione, transcodifica e distribuzione avvengono sulla stessa scheda che esegue il modello che decide come elaborare i fotogrammi. Né l'A100 né l'H100 sono in grado di codificare un singolo fotogramma in hardware: su queste schede, l'elaborazione video è gestita dalla CPU.

Rendering che deve essere corretto

Memoria con correzione degli errori e core di ray tracing di terza generazione. Una render farm su schede consumer costa meno per fotogramma e occasionalmente produce un fotogramma con un bit invertito; in un lavoro lungo e non supervisionato, questo si traduce in una ripetizione. Questa scheda offre quarantotto gigabyte con ECC per ognuno di essi, che è esattamente ciò di cui ha bisogno un lavoro che non può essere supervisionato costantemente.

Desktop e postazioni virtuali

La L40S supporta vGPU e gestisce quattro uscite DisplayPort, il che la rende una scheda utilizzabile in modalità split-in tra workstation virtuali anziché un acceleratore headless. Le schede A100 e H100 non dispongono di uscite video.

Deduzione di dove il modello si adatta in 48 GB

Supporto per tensori FP8 e capacità sufficiente per un modello da trenta miliardi di parametri con precisione a otto bit, con margine di sicurezza. Per un endpoint che gestisce traffico reale con una dimensione del batch modesta, il limite di larghezza di banda indicato raramente rappresenta un problema, ma si verifica solo quando la scheda viene sfruttata al massimo.

Ciò che ha sostituito e ciò che si trova ai suoi lati.

Dai nostri magazzini, non da una roadmap di un fornitore. Tutti questi articoli sono ordinabili da oggi.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

La A40 è la scheda Ampere che ha sostituito la L40S: stessa capacità di 48 GB, architettura precedente, assenza di AV1 e FP8. La RTX 6000 Ada è la scheda per workstation con la stessa capacità e della stessa generazione. Le A100 sono la scelta ideale quando il fattore limitante, anziché la capacità, è la larghezza di banda o il pooling, e la pagina dedicata agli acceleratori le illustra in dettaglio.

In quale macchina va inserito e a quale collegamento arriva.

La L40S è una scheda PCIe di quarta generazione. Una delle due piattaforme compatibili è di terza generazione, l'altra di quarta generazione.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Per un endpoint di inferenza o un transcodificatore, la generazione dello slot è pressoché irrilevante: i pesi sono residenti e i frame sono di piccole dimensioni. Diventa invece importante per un ciclo di addestramento che trasmette in streaming batch aggiornati dall'host a ogni passaggio, e in tal caso la piattaforma Gen 4 giustifica la differenza di prezzo.

Cosa entra davvero in 48 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La scheda assorbe fino a 350 W, un valore modesto per la sua categoria e uno dei motivi per cui è compatibile con chassis in cui un acceleratore più potente non lo sarebbe.

Quanto costa, con la macchina in cui entra

La scheda tecnica è riportata su una riga della fattura, mentre la macchina su un'altra. Entrambe le parti sottostanti derivano da una singola lettura del catalogo ordini, pertanto il prezzo e le specifiche che lo accompagnano si riferiscono sempre l'uno all'altro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

La larghezza di banda è illimitata in entrambe le direzioni senza costi in uscita, è incluso un indirizzo IPv4, non c'è contratto e la durata predefinita è di un mese. Per ogni altra scheda che installiamo, allo stesso prezzo, consulta il catalogo completo, prezzo . Per macchine installate e pronte oggi stesso, /instant .

Domande che le persone si pongono realmente su questa carta

L40S o A100, per la manutenzione di un modello?

Se il modello rientra in 48 GB e il traffico è moderato, la L40S è più economica e offre prestazioni migliori. Se invece la scheda viene sfruttata al massimo con batch di grandi dimensioni, la A100 legge i suoi pesi circa due volte più velocemente e gestisce più richieste al secondo, pur avendo una potenza di calcolo inferiore sulla carta. Infine, se il modello non rientra in 48 GB, la A100 da 80 GB è la soluzione ideale, mentre la L40S non lo è.

Posso unire due di questi dispositivi per ottenere 96 GB?

No. Questa parte non ha NVLink, quindi le due schede sono due pool separati da 48 GB che comunicano tramite lo slot. Un modello più grande di 48 GB deve essere suddiviso intenzionalmente tra le due schede dal tuo framework, con lo slot come collegamento. Se hai bisogno di uno spazio di indirizzamento più grande di 48 GB, considera invece le schede da 80 GB e 96 GB nella tabella sopra.

La scheda è condivisa, suddivisa in più parti o virtualizzata?

Non da parte nostra. Un tenant per macchina fisica e la scheda passa direttamente al tuo sistema operativo: nessun hypervisor, nessuna partizione MIG, nessun profilo vGPU, nessun time-slicing. La scheda supporta vGPU, quindi se vuoi suddividerla tra i tuoi desktop virtuali puoi farlo; questa è una tua decisione da prendere sulla tua macchina, non qualcosa che facciamo noi in anticipo.

Supporta davvero AV1?

Sì, codifica e decodifica, su tutti e tre i suoi encoder e decoder hardware. Questa è proprio la funzionalità che la serie RTX 30 e gli acceleratori non sono in grado di offrire, ed è spesso il motivo per cui questa scheda è tra le candidate.

Quando potrò averne uno?

Dipende se la scheda è già installata, già disponibile a magazzino, oppure se deve essere acquistata separatamente; in tal caso, la risposta viene comunicata prima del pagamento, non dopo. /Instant elenca le macchine installate e pronte all'uso in questo momento.