NVIDIA L40S · 48 GB GDDR6 cu ECC

L40S — placa care face toate cele trei treburi

Patruzeci și opt de gigaocteți de memorie cu corecție de erori, trei encodere hardware cu AV1 și nuclee de ray tracing, pe o singură placă. Este singura placă pe care o montăm și care antrenează un model, randează un cadru și transcodifică un flux fără niciun compromis la vreuna dintre cele trei. Limitarea este reală, iar această pagină o spune clar.

48 GB, ECC Trei encodere, AV1 Fără NVLink

Întâi, limitarea

Două lucruri pe care această placă nu le poate face, iar ambele sunt motivul pentru care este mai ieftină decât acceleratoarele de lângă ea.

Memoria ei este rapidă, nu stivuită. L40S citește la 864 GB/s. A100 de lângă ea citește la 1.555 GB/s cu 40 GB și la 1.935 GB/s cu 80 GB — aproximativ dublu. Pentru generarea de tokenuri la o dimensiune mare a lotului, această viteză de citire este plafonul, nu aritmetica, așa că un A100 va servi mai multe cereri pe secundă de pe același model, chiar dacă L40S are mai multă putere brută de calcul pe hârtie. Dacă debitul de servire este întreaga ta problemă, acceleratorul este achiziția corectă.

Nu există NVLink pe această piesă. Două plăci L40S într-o mașină sunt două bazine separate de 48 GB care comunică prin slot, nu un singur bazin de 96 GB. A100 și H100 pot partaja; aceasta nu poate. Când ai nevoie cu adevărat de un spațiu de adrese mai mare de 48 GB, aceasta nu este placa care te duce acolo — scara de mai jos arată ce te duce.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specificația, așa cum o publică NVIDIA

Ada Lovelace, nuclee tensor de a patra generație, nuclee de ray tracing de a treia generație. Cifre din pagina de produs L40S a NVIDIA, citate în sursa acestei pagini.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA publică, de asemenea, 91,6 teraFLOPS de FP32, 212 teraFLOPS de performanță ray tracing și 1.466 teraFLOPS de randament tensor FP8 cu sparsitate, de la 142 de nuclee RT și 568 de nuclee tensor. Acestea sunt cifre de vârf în condiții ideale; lățimea de bandă a memoriei de mai sus este cea care decide de obicei ce obții cu adevărat.

La ce este bună

După ce am spus limitarea: iată munca pentru care această placă este cu adevărat răspunsul potrivit.

O conductă cu video în ea

Trei encodere și trei decodere cu AV1 în ambele direcții. Ingestie, transcodificare și servire pe aceeași placă care rulează modelul ce decide ce să facă cu cadrele. Nici A100, nici H100 nu pot encoda un singur cadru în hardware — pe acele plăci, video este o sarcină de CPU. Câte canale live îți oferă acest lucru și mașina completă în care intră: servere de transcodificare video live.

Randare care trebuie să fie corectă

Memorie cu corecție de erori și nuclee de ray tracing de a treia generație. O fermă de randare pe plăci de consum costă mai puțin pe cadru și produce ocazional un cadru cu un bit inversat; la o sarcină lungă nesupravegheată, asta înseamnă o reluare. Această placă îți oferă patruzeci și opt de gigaocteți cu ECC în spatele fiecăruia, ceea ce are nevoie cu adevărat o sarcină pe care nu o poți supraveghea.

Desktopuri virtuale și locuri de muncă

L40S suportă vGPU și are patru ieșiri DisplayPort, ceea ce o face o placă pe care o poți împărți între stații de lucru virtuale, nu un accelerator fără ieșiri video. A100 și H100 nu au deloc ieșiri de afișare.

Inferență unde modelul încape în 48 GB

Suport tensor FP8 și capacitate suficientă pentru un model de treizeci de miliarde de parametri la precizie de opt biți, cu spațiu de rezervă. Pentru un endpoint care răspunde la trafic real la o dimensiune modestă a lotului, plafonul de lățime de bandă de mai sus rareori contează — contează când împingi placa la maximum.

Ce a înlocuit și ce se află de o parte și de alta a ei

De pe rafturile noastre, nu dintr-o foaie de parcurs a unui furnizor. Toate acestea pot fi comandate astăzi.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 este placa Ampere pe care L40S a succedat-o — aceiași 48 GB, o arhitectură mai veche, fără AV1 și fără FP8. RTX 6000 Ada este placa de stație de lucru cu aceeași capacitate și aceeași generație. A100-urile sunt cele la care treci când lățimea de bandă sau partajarea este constrângerea determinantă, nu capacitatea, iar pagina acceleratorului le acoperă în detaliu.

În ce mașină intră și ce legătură primește acolo

L40S este o placă PCIe Gen 4. Una dintre cele două platforme care o acceptă este Gen 3, iar una este Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Pentru un endpoint de inferență sau un transcodor, generația slotului este aproape irelevantă — ponderile sunt rezidente, iar cadrele sunt mici. Contează pentru o buclă de antrenare care aduce loturi noi de pe gazdă la fiecare pas, iar în acest caz platforma Gen 4 merită diferența.

Ce încape de fapt în 48 GB

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Placa consumă până la 350 W, ceea ce este modest pentru clasa ei și face parte din motivul pentru care încape în șasiuri în care un accelerator mai mare nu încape.

Cât costă, împreună cu mașina în care intră

Placa este o linie pe factură, iar mașina este alta. Ambele jumătăți de mai jos provin dintr-o singură citire a catalogului de comenzi, astfel încât prețul și specificația de lângă el aparțin întotdeauna unul altuia.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Lățimea de bandă este nemăsurată în ambele direcții, fără taxă de ieșire, este inclusă o adresă IPv4, nu există contract, iar o lună este termenul implicit. Pentru fiecare altă placă pe care o montăm, la același preț, citește întregul catalog, cu prețuri. Pentru mașini deja montate în rack și gata astăzi, /instant.

Întrebări pe care oamenii le pun cu adevărat despre această placă

L40S sau A100, pentru servirea unui model?

Dacă modelul încape în 48 GB și traficul este moderat, L40S este mai ieftină și face mai multe. Dacă împingi placa la maximum la o dimensiune mare a lotului, A100 își citește ponderile aproximativ de două ori mai repede și va servi mai multe cereri pe secundă, deși are mai puțină putere de calcul pe hârtie. Iar dacă modelul nu încape în 48 GB, A100 de 80 GB este răspunsul, nu L40S.

Pot partaja două dintre ele pentru a obține 96 GB?

Nu. Această piesă nu are NVLink, deci două plăci sunt două bazine separate de 48 GB care comunică prin slot. Un model mai mare de 48 GB trebuie împărțit deliberat între ele de către framework-ul tău, cu slotul drept legătură. Dacă vrei un spațiu de adrese mai mare de 48 GB, uită-te în schimb la plăcile de 80 GB și 96 GB din scara de mai sus.

Este placa partajată, împărțită sau virtualizată?

Nu de către noi. Un singur chiriaș pe mașină fizică, iar placa este pasată direct către propriul tău sistem de operare — fără hypervisor, fără partiție MIG, fără profil vGPU, fără time-slicing. Placa suportă vGPU, deci dacă vrei să o împarți între propriile tale desktopuri virtuale, poți; aceasta este decizia ta pe propria mașină, nu ceva ce facem noi în prealabil.

Chiar face AV1?

Da, codificare și decodificare, pe toate cele trei encodere și decodere hardware ale sale. Acesta este lucrul specific pe care seria RTX 30 nu îl poate face deloc și acceleratoarele nu îl pot face deloc și este adesea motivul pentru care această placă se află pe lista scurtă.

Cât de repede pot avea una?

Depinde dacă placa este deja montată, deja pe raftul nostru sau trebuie cumpărată — și ți se spune înainte să plătești, nu după. /instant listează mașinile montate în rack și gata chiar acum.