NVIDIA L40S · 48 GB GDDR6 cu ECC

L40S — placa care îndeplinește toate cele trei funcții

Patruzeci și opt de gigaocteți de memorie corectată cu erori, trei encodere hardware cu AV1 și nuclee de ray-tracing, pe o singură placă. Este singura placă pe care am instalat-o care va antrena un model, va randa un cadru și va transcoda un flux fără a compromite niciunul dintre cele trei. Capcana este reală și această pagină o menționează.

48 GB, ECC Trei encodere, AV1 Fără NVLink

Captura, mai întâi

Două lucruri pe care această placă nu le poate face, și ambele sunt motivul pentru care este mai ieftină decât acceleratoarele lângă care se află.

Memoria sa este rapidă, nu suprapusă. L40S citește la 864 GB/s. A100 alături de el citește la 1.555 GB/s cu 40 GB și 1.935 GB/s cu 80 GB - aproximativ dublul ratei. Pentru generarea de token-uri la o dimensiune mare a lotului, acea rată de citire este plafonul, iar aritmetica nu, așa că un A100 va servi mai multe cereri pe secundă de la același model, chiar dacă L40S are mai multă putere de calcul brută pe hârtie. Dacă debitul de servire este întreaga problemă, acceleratorul este achiziția corectă.

Nu există NVLink în această parte. Două plăci L40S dintr-o singură mașină sunt două pool-uri separate de 48 GB care comunică prin slot, nu un pool de 96 GB. A100 și H100 pot face pool-uri; acest lucru nu. Când ai nevoie cu adevărat de un spațiu de adrese mai mare de 48 GB, aceasta nu este placa care te va ajuta să ajungi acolo - scala de mai jos arată ce face.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specificațiile, așa cum le publică NVIDIA

Ada Lovelace, nuclee tensor de a patra generație, nuclee ray-tracing de a treia generație. Cifre de pe pagina produsului L40S de la NVIDIA, citate în sursa acestei pagini.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA publică, de asemenea, 91,6 teraFLOPS de performanță FP32, 212 teraFLOPS de performanță de ray-tracing și 1.466 teraFLOPS de debit tensorial FP8 cu sparsitate, de la 142 de nuclee RT și 568 de nuclee tensorial. Acestea sunt cifre maxime în condiții ideale; lățimea de bandă a memoriei de mai sus este cea care decide de obicei ce obțineți de fapt.

La ce este bun

După ce am spus problema: iată pentru ce lucrare este cu adevărat răspunsul potrivit această carte.

O conductă cu videoclip în ea

Trei codificatoare și trei decodificatoare cu AV1 în ambele direcții. Ingerarea, transcodarea și servirea datelor se fac pe aceeași placă care rulează modelul și decide ce să facă cu cadrele. Nici A100, nici H100 nu pot codifica niciun cadru în hardware - pe aceste plăci, conținutul video este o sarcină a procesorului.

Randare care trebuie să fie corectă

Memorie corectoare de erori și nuclee de ray-tracing de a treia generație. O fermă de randare pe plăci video pentru consumatori costă mai puțin pe cadru și produce ocazional un cadru cu un bit inversat; într-o sarcină lungă nesupravegheată care este o reluare. Această placă video îți oferă patruzeci și opt de gigaocteți cu ECC în spatele fiecăruia dintre ei, ceea ce are nevoie de fapt o sarcină pe care nu o poți supraveghea.

Desktopuri și posturi virtuale

L40S este compatibilă cu vGPU și are patru ieșiri DisplayPort, ceea ce o face o placă pe care o poți distribui între stații de lucru virtuale, nu un accelerator headless. A100 și H100 nu au deloc ieșiri de afișare.

Deducția în care modelul se încadrează în 48 GB

Suport tensorial FP8 și capacitate suficientă pentru un model de treizeci de miliarde de parametri la o precizie de opt biți, cu spațiu suplimentar. Pentru un terminal care răspunde la trafic real la o dimensiune modestă a lotului, plafonul de lățime de bandă de mai sus se blochează rareori - se blochează atunci când forțați placa la maximum.

Ce a înlocuit și ce se află de o parte și de alta a acestuia

De pe rafturile noastre, nu dintr-o foaie de parcurs a furnizorului. Toate acestea pot fi comandate astăzi.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 este placa Ampere pe care a succedat-o L40S — aceeași memorie de 48 GB, o arhitectură mai veche, fără AV1 și fără FP8. RTX 6000 Ada este placa pentru stații de lucru cu aceeași capacitate și aceeași generație. A100 este cea la care te îndrepți atunci când lățimea de bandă sau pooling-ul este constrângerea de legare, mai degrabă decât capacitatea, iar pagina acceleratorului le tratează în detaliu.

În ce mașină intră și ce legătură ajunge acolo

L40S este o placă PCIe Gen 4. Una dintre cele două platforme care o acceptă este Gen 3, iar cealaltă este Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Pentru un punct final de inferență sau un transcoder, generarea sloturilor este aproape irelevantă - ponderile sunt rezidente, iar cadrele sunt mici. Este importantă pentru o buclă de antrenament care transmite în flux loturi noi de pe gazdă la fiecare pas, iar în acest caz platforma Gen 4 merită diferența.

Ce încape de fapt în 48 GB

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Placa de bază consumă până la 350 W, ceea ce este modest pentru clasa sa și explică, parțial, de ce se potrivește cu un șasiu, lucru pe care un accelerator mai mare nu îl poate face.

Cât costă, cu mașina în care intră

Cartela este pe o linie de pe factură, iar aparatul pe alta. Ambele jumătăți de mai jos provin dintr-o singură citire a catalogului de comenzi, așadar prețul și specificațiile de lângă acesta aparțin întotdeauna unul celuilalt.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Lățimea de bandă este nelimitată în ambele direcții, fără taxă de ieșire, este inclusă o adresă IPv4, nu există contract, iar termenul implicit este o lună. Pentru fiecare altă placă pe care o instalăm, cu același preț, citiți întregul catalog, preț ... Pentru mașinile instalate în rack și gata de utilizare astăzi, /instant ...

Întrebări pe care oamenii le pun despre acest card

L40S sau A100, pentru deservirea unui model?

Dacă modelul încape în 48 GB și traficul este moderat, L40S este mai ieftin și face mai multe. Dacă folosești placa la capacitate maximă pentru loturi mari, A100 citește ponderile de aproximativ două ori mai repede și va servi mai multe cereri pe secundă, chiar dacă are mai puțină capacitate de calcul pe hârtie. Iar dacă modelul nu încape în 48 GB, A100 de 80 GB este soluția, iar L40S nu.

Pot să le combin două pentru a obține 96 GB?

Nu. Această parte nu are NVLink, deci două plăci sunt două pool-uri separate de 48 GB care comunică prin slot. Un model mai mare de 48 GB trebuie împărțit în mod deliberat între ele de către framework-ul dvs., slotul fiind linkul. Dacă doriți un spațiu de adrese mai mare de 48 GB, uitați-vă la plăcile de 80 GB și 96 GB din clasa de mai sus.

Cardul este partajat, segmentat sau virtualizat?

Nu de către noi. Un singur utilizator per mașină fizică, iar placa este transmisă direct către propriul sistem de operare — fără hypervisor, fără partiție MIG, fără profil vGPU, fără time-slicing. Placa este compatibilă cu vGPU, așa că, dacă doriți să o împărțiți între propriile desktopuri virtuale, puteți face acest lucru; aceasta este decizia dumneavoastră pe propria mașină, nu este ceva ce facem noi în prealabil.

Chiar face AV1?

Da, codează și decodează, pe toate cele trei encodere și decodoare hardware. Acesta este lucrul specific pe care seria RTX 30 nu îl poate face deloc și acceleratoarele nu îl pot face deloc și este adesea motivul pentru care această placă se află pe lista scurtă.

Cât de curând pot avea unul?

Depinde dacă cardul este deja montat, deja pe raftul nostru sau trebuie cumpărat direct — și ți se spune care dintre acestea înainte de a plăti, nu după. /instant listează mașinile instalate și gata chiar acum.