NVIDIA L40S · 48 GB GDDR6 z ECC

L40S — karta, która robi wszystkie trzy rzeczy

Czterdzieści osiem gigabajtów pamięci z korekcją błędów, trzy sprzętowe enkodery z AV1 i rdzenie ray tracingu na jednej płycie. To jedyna karta, którą montujemy, a która wytrenuje model, wyrenderuje klatkę i transkoduje strumień bez kompromisów w żadnej z tych trzech rzeczy. Haczyk jest prawdziwy i ta strona go opisuje.

48 GB, ECC Trzy enkodery, AV1 Bez NVLink

Zamień swoje GPU w pasywny miesięczny przychód

Masz nieużywane serwerowe lub desktopowe zestawy GPU? Wystaw je już dziś na marketplace Primcast i zarabiaj stały miesięczny czynsz od zespołów AI, deweloperów i przedsiębiorstw potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace

Najpierw haczyk

Dwie rzeczy, których ta karta nie potrafi, i obie są powodem, dla którego jest tańsza niż akceleratory, obok których stoi.

Jej pamięć jest szybka, ale nie warstwowa. L40S czyta z prędkością 864 GB/s. A100 obok niej czyta z prędkością 1 555 GB/s przy 40 GB i 1 935 GB/s przy 80 GB — mniej więcej dwa razy szybciej. Przy generowaniu tokenów w dużym batchu ta prędkość odczytu jest sufitem, a nie arytmetyka, więc A100 obsłuży więcej żądań na sekundę z tego samego modelu, mimo że L40S ma więcej surowej mocy obliczeniowej na papierze. Jeśli przepustowość serwowania to cały twój problem, akcelerator jest właściwym zakupem.

Ten model nie ma NVLink. Dwie karty L40S w jednej maszynie to dwie oddzielne pule 48 GB, które komunikują się przez slot, a nie jedna pula 96 GB. A100 i H100 potrafią łączyć pule; ta nie potrafi. Kiedy naprawdę potrzebujesz jednej przestrzeni adresowej większej niż 48 GB, to nie jest karta, która cię tam zaprowadzi — drabinka poniżej pokazuje, co to zrobi.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specyfikacja, tak jak publikuje ją NVIDIA

Ada Lovelace, rdzenie tensorowe czwartej generacji, rdzenie ray tracingu trzeciej generacji. Dane ze strony produktu L40S firmy NVIDIA, zacytowane w źródle tej strony.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA publikuje również 91,6 teraFLOPSów FP32, 212 teraFLOPSów wydajności ray tracingu i 1 466 teraFLOPSów przepustowości tensorowej FP8 z rzadkością, z 142 rdzeni RT i 568 rdzeni tensorowych. To wartości szczytowe w idealnych warunkach; przepustowość pamięci powyżej to ta, która zwykle decyduje o tym, co faktycznie otrzymujesz.

W czym jest dobra

Skoro haczyk został opisany: oto praca, do której ta karta jest naprawdę właściwą odpowiedzią.

Potok z wideo w środku

Trzy enkodery i trzy dekodery z AV1 w obu kierunkach. Przechwytuj, transkoduj i serwuj na tej samej płycie, na której działa model decydujący, co zrobić z klatkami. Ani A100, ani H100 nie potrafią zakodować ani jednej klatki sprzętowo — na tych kartach wideo to zadanie CPU. Ile kanałów na żywo to daje i w jakiej kompletnej maszynie to zamontować: serwery do transkodowania wideo na żywo.

Renderowanie, które musi być poprawne

Pamięć z korekcją błędów i rdzenie ray tracingu trzeciej generacji. Farma renderująca na kartach konsumenckich kosztuje mniej za klatkę i od czasu do czasu wyprodukuje klatkę z przekłamanym bitem; przy długim zadaniu bez nadzoru to powtórka. Ta karta daje czterdzieści osiem gigabajtów z ECC za każdym z nich, a tego właśnie potrzebuje zadanie, którego nie możesz pilnować.

Wirtualne pulpity i stanowiska

L40S obsługuje vGPU i napędza cztery wyjścia DisplayPort, co czyni ją kartą, którą można dzielić między wirtualne stacje robocze, a nie bezgłowym akceleratorem. A100 i H100 nie mają żadnych wyjść wideo.

Inferencja, gdy model mieści się w 48 GB

Obsługa tensorów FP8 i wystarczająca pojemność dla modelu o trzydziestu miliardach parametrów przy ośmiobitowej precyzji z zapasem. Dla endpointu obsługującego realny ruch przy umiarkowanym batchu sufit przepustowości powyżej rzadko wiąże — wiąże, gdy wyciskasz kartę do granic możliwości.

Co zastąpiła i co stoi po obu jej stronach

Z naszych własnych półek, a nie z mapy drogowej producenta. Wszystkie są dostępne do zamówienia już dziś.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 to karta Ampere, którą L40S zastąpiła — te same 48 GB, starsza architektura, brak AV1 i brak FP8. RTX 6000 Ada to karta stacji roboczej o tej samej pojemności i tej samej generacji. A100 to karty, na które przechodzisz, gdy przepustowość lub łączenie pul staje się wiążącym ograniczeniem, a nie pojemność, a strona akceleratora opisuje je szczegółowo.

Do jakiej maszyny trafia i jakie łącze tam dostaje

L40S to karta PCIe Gen 4. Jedna z dwóch platform, które ją przyjmują, to Gen 3, a druga to Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Dla endpointu inferencji lub transkodera generacja slotu jest niemal bez znaczenia — wagi są rezydentne, a klatki są małe. Ma znaczenie dla pętli treningowej przesyłającej świeże batche z hosta w każdym kroku, a w tym przypadku platforma Gen 4 jest warta różnicy.

Co faktycznie mieści się w 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

Karta pobiera do 350 W, co jest skromne jak na swoją klasę i częściowo dlatego mieści się w obudowach, w których większy akcelerator się nie mieści.

Ta tabela odpowiada na pytanie „co mieści się w tej karcie”. Pytanie w drugą stronę — ile pamięci potrzebuje model i która karta to obsłuży — ma własną stronę.

Ile kosztuje, razem z maszyną, do której trafia

Karta to jedna pozycja na fakturze, a maszyna to druga. Obie połowy poniżej pochodzą z jednego odczytu katalogu zamówień, więc cena i specyfikacja obok niej zawsze do siebie pasują.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Przepustowość jest nielimitowana w obu kierunkach bez opłat za ruch wychodzący, jeden adres IPv4 jest wliczony, nie ma umowy, a domyślny okres to jeden miesiąc. O każdej innej karcie, którą montujemy, wycenionej w ten sam sposób, przeczytasz w całym katalogu z cenami. O maszynach gotowych do montażu w szafie już dziś: /instant.

Pytania, które ludzie naprawdę zadają o tę kartę

L40S czy A100, do serwowania modelu?

Jeśli model mieści się w 48 GB, a ruch jest umiarkowany, L40S jest tańsza i robi więcej. Jeśli wyciskasz kartę do granic możliwości przy dużym batchu, A100 czyta swoje wagi około dwa razy szybciej i obsłuży więcej żądań na sekundę, mimo że ma mniej mocy obliczeniowej na papierze. A jeśli model nie mieści się w 48 GB, odpowiedzią jest A100 80 GB, a nie L40S.

Czy mogę połączyć dwie z nich, aby uzyskać 96 GB?

Nie. Ten model nie ma NVLink, więc dwie karty to dwie oddzielne pule 48 GB komunikujące się przez slot. Model większy niż 48 GB musi zostać celowo podzielony między nie przez twój framework, ze slotem jako łączem. Jeśli chcesz jedną przestrzeń adresową większą niż 48 GB, spójrz zamiast tego na karty 80 GB i 96 GB w drabince powyżej.

Czy karta jest współdzielona, dzielona na plasterki czy wirtualizowana?

Nie przez nas. Jeden najemca na maszynę fizyczną, a karta jest przekazywana bezpośrednio do twojego własnego systemu operacyjnego — bez hypervisora, bez partycji MIG, bez profilu vGPU, bez dzielenia czasu. Karta obsługuje vGPU, więc jeśli chcesz podzielić ją między własne wirtualne pulpity, możesz; to twoja decyzja na twojej własnej maszynie, a nie coś, co my robimy z nią wcześniej.

Czy naprawdę robi AV1?

Tak, kodowanie i dekodowanie, na wszystkich trzech sprzętowych enkoderach i dekoderach. To konkretna rzecz, której seria RTX 30 nie potrafi w ogóle i akceleratory nie potrafią w ogóle, i często jest powodem, dla którego ta karta trafia na krótką listę.

Jak szybko mogę ją mieć?

To zależy od tego, czy karta jest już zamontowana, już na naszej półce, czy trzeba ją dokupić — a dowiadujesz się tego przed zapłatą, nie po. /instant pokazuje maszyny gotowe do montażu w szafie już teraz.