NVIDIA L40S · 48 GB GDDR6 cu ECC

L40S — placa care face toate cele trei treburi

Patruzeci și opt de gigaocteți de memorie cu corecție de erori, trei encodere hardware cu AV1 și nuclee de ray tracing, pe o singură placă. Este singura placă pe care o montăm și care va antrena un model, va randa un cadru și va transcoda un flux fără niciun compromis la vreuna dintre cele trei. Limita este reală, iar această pagină o spune clar.

48 GB, ECC Trei encodere, AV1 Fără NVLink

Transformă-ți GPU-urile în venit lunar pasiv

Ai configurații de server sau desktop cu GPU-uri nefolosite? Publică-le astăzi pe piața Primcast și câștigă chirii lunare constante de la echipe de AI, dezvoltatori și întreprinderi care au nevoie de putere de calcul de nivel de producție.

Mergi la Marketplace

Mai întâi, limita

Două lucruri pe care această placă nu le poate face, iar ambele sunt motivul pentru care este mai ieftină decât acceleratoarele de lângă care stă.

Memoria ei este rapidă, nu stivuită. L40S citește la 864 GB/s. A100 de lângă ea citește la 1.555 GB/s cu 40 GB și la 1.935 GB/s cu 80 GB — aproximativ dublu. Pentru generarea de tokenuri la o dimensiune mare de lot, acea viteză de citire este plafonul, nu aritmetica, așa că un A100 va servi mai multe cereri pe secundă de pe același model, chiar dacă L40S are mai multă putere brută de calcul pe hârtie. Dacă debitul de servire este întreaga ta problemă, acceleratorul este achiziția corectă.

Nu există NVLink pe această placă. Două plăci L40S într-o mașină sunt două grupuri separate de 48 GB care comunică prin slot, nu un singur grup de 96 GB. A100 și H100 pot forma un grup comun; aceasta nu poate. Când ai nevoie cu adevărat de un spațiu de adrese mai mare de 48 GB, aceasta nu este placa care te duce acolo — scara de mai jos arată ce te duce.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specificația, așa cum o publică NVIDIA

Ada Lovelace, nuclee tensor de a patra generație, nuclee de ray tracing de a treia generație. Cifre de pe pagina de produs L40S a NVIDIA, citate în sursa acestei pagini.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA publică, de asemenea, 91,6 teraFLOPS de FP32, 212 teraFLOPS de performanță ray tracing și 1.466 teraFLOPS de randament tensor FP8 cu sparsitate, de la 142 de nuclee RT și 568 de nuclee tensor. Acestea sunt cifre de vârf în condiții ideale; lățimea de bandă a memoriei de mai sus este cea care decide de obicei ce obții cu adevărat.

La ce este bună

După ce am spus limita: iată munca pentru care această placă este cu adevărat răspunsul potrivit.

O conductă cu video în ea

Trei encodere și trei decodere cu AV1 în ambele direcții. Ingestie, transcodare și servire pe aceeași placă care rulează modelul ce decide ce să facă cu cadrele. Nici A100, nici H100 nu pot encoda un singur cadru în hardware — pe acele plăci, video este o sarcină de CPU. Câte canale live îți oferă acest lucru și mașina completă în care intră: servere de transcodare video live.

Randare care trebuie să fie corectă

Memorie cu corecție de erori și nuclee de ray tracing de a treia generație. O fermă de randare pe plăci de consum costă mai puțin pe cadru și produce ocazional un cadru cu un bit inversat în el; la o sarcină lungă nesupravegheată, asta înseamnă o reluare. Această placă îți oferă patruzeci și opt de gigaocteți cu ECC în spatele fiecăruia, ceea ce are nevoie cu adevărat o sarcină pe care nu o poți supraveghea.

Desktopuri virtuale și locuri de muncă

L40S acceptă vGPU și are patru ieșiri DisplayPort, ceea ce o face o placă pe care o poți împărți între stații de lucru virtuale, nu un accelerator fără ieșiri video. A100 și H100 nu au deloc ieșiri de afișare.

Inferență unde modelul încape în 48 GB

Suport tensor FP8 și capacitate suficientă pentru un model de treizeci de miliarde de parametri la precizie de opt biți, cu spațiu de rezervă. Pentru un endpoint care răspunde la trafic real la o dimensiune modestă de lot, plafonul de lățime de bandă de mai sus rareori contează — contează când împingi placa la maximum.

Ce a înlocuit și ce stă de o parte și de alta a ei

De pe rafturile noastre, nu dintr-o foaie de parcurs a unui furnizor. Toate acestea pot fi comandate astăzi.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 este placa Ampere pe care L40S a succedat-o — aceiași 48 GB, o arhitectură mai veche, fără AV1 și fără FP8. RTX 6000 Ada este placa de stație de lucru cu aceeași capacitate și aceeași generație. A100-urile sunt ceea ce alegi când lățimea de bandă sau gruparea este constrângerea determinantă, nu capacitatea, iar pagina acceleratorului le acoperă în detaliu.

În ce mașină intră și ce legătură primește acolo

L40S este o placă PCIe Gen 4. Una dintre cele două platforme care o acceptă este Gen 3, iar una este Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Pentru un endpoint de inferență sau un transcoder, generația slotului este aproape irelevantă — ponderile sunt rezidente, iar cadrele sunt mici. Contează pentru o buclă de antrenare care aduce loturi proaspete de pe gazdă la fiecare pas, iar pentru acel caz platforma Gen 4 merită diferența.

Ce încape cu adevărat în 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

Placa consumă până la 350 W, ceea ce este modest pentru clasa ei și parte din motivul pentru care încape în șasiuri în care un accelerator mai mare nu încape.

Acel tabel răspunde la „ce încape pe această placă”. Întrebarea pusă invers — de câtă memorie are nevoie un model și ce placă o acoperă — are o pagină proprie.

Cât costă, împreună cu mașina în care intră

Placa este o linie pe factură, iar mașina este alta. Ambele jumătăți de mai jos provin dintr-o singură citire a catalogului de comenzi, astfel încât prețul și specificația de lângă el aparțin întotdeauna unul altuia.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Lățimea de bandă este nemăsurată în ambele direcții, fără taxă de ieșire, este inclusă o adresă IPv4, nu există contract, iar o lună este termenul implicit. Pentru fiecare altă placă pe care o montăm, la preț în același mod, citește întregul catalog, cu prețuri. Pentru mașini deja montate în rack și gata astăzi, /instant.

Întrebări pe care oamenii le pun cu adevărat despre această placă

L40S sau A100, pentru servirea unui model?

Dacă modelul încape în 48 GB și traficul este moderat, L40S este mai ieftină și face mai multe. Dacă împingi placa la maximum la o dimensiune mare de lot, A100 își citește ponderile de aproximativ două ori mai repede și va servi mai multe cereri pe secundă, deși are mai puțină putere de calcul pe hârtie. Iar dacă modelul nu încape în 48 GB, A100 de 80 GB este răspunsul, nu L40S.

Pot grupa două pentru a obține 96 GB?

Nu. Această placă nu are NVLink, deci două plăci sunt două grupuri separate de 48 GB care comunică prin slot. Un model mai mare de 48 GB trebuie împărțit între ele în mod deliberat de framework-ul tău, cu slotul drept legătură. Dacă vrei un spațiu de adrese mai mare de 48 GB, uită-te în schimb la plăcile de 80 GB și 96 GB din scara de mai sus.

Este placa partajată, împărțită sau virtualizată?

Nu de către noi. Un singur chiriaș pe mașină fizică, iar placa este pasată direct către propriul tău sistem de operare — fără hypervisor, fără partiție MIG, fără profil vGPU, fără time-slicing. Placa acceptă vGPU, așa că, dacă vrei să o împarți între propriile tale desktopuri virtuale, poți; aceasta este decizia ta pe propria mașină, nu ceva ce facem noi în prealabil.

Chiar face AV1?

Da, encodare și decodare, pe toate cele trei encodere și decodere hardware ale sale. Acesta este lucrul specific pe care seria RTX 30 nu îl poate face deloc și pe care acceleratoarele nu îl pot face deloc și este adesea motivul pentru care această placă se află pe lista scurtă.

Cât de repede pot avea una?

Depinde dacă placa este deja montată, deja pe raftul nostru sau trebuie cumpărată — și ți se spune înainte să plătești, nu după. /instant listează mașinile montate în rack și gata chiar acum.