NVIDIA L40S · 48 GB GDDR6 z ECC

L40S — karta, która robi wszystkie trzy zadania

Czterdzieści osiem gigabajtów pamięci z korekcją błędów, trzy sprzętowe enkodery z AV1 i rdzenie ray tracingu na jednej płycie. To jedyna karta, którą montujemy, która wytrenuje model, wyrenderuje klatkę i transkoduje strumień bez kompromisów w żadnym z tych trzech zadań. Haczyk jest prawdziwy i ta strona go przedstawia.

48 GB, ECC Trzy enkodery, AV1 Bez NVLink

Zamień swoje GPU w pasywny miesięczny przychód

Masz nieużywane serwerowe lub desktopowe zestawy GPU? Wystaw je już dziś na marketplace Primcast i zarabiaj stały miesięczny czynsz od zespołów AI, deweloperów i przedsiębiorstw potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace

Najpierw haczyk

Dwie rzeczy, których ta karta nie potrafi, i obie są powodem, dla którego jest tańsza od akceleratorów, obok których stoi.

Jej pamięć jest szybka, ale nie warstwowa. L40S czyta z prędkością 864 GB/s. A100 obok czyta z prędkością 1 555 GB/s przy 40 GB i 1 935 GB/s przy 80 GB — mniej więcej dwukrotnie szybciej. Przy generowaniu tokenów w dużym batchu ta prędkość odczytu jest sufitem, a nie arytmetyka, więc A100 obsłuży więcej żądań na sekundę z tego samego modelu, mimo że L40S ma na papierze więcej surowej mocy obliczeniowej. Jeśli przepustowość serwowania to cały twój problem, akcelerator jest właściwym zakupem.

Ten model nie ma NVLink. Dwie karty L40S w jednej maszynie to dwie oddzielne pule 48 GB, które komunikują się przez slot, a nie jedna pula 96 GB. A100 i H100 potrafią łączyć pule; ta nie. Kiedy naprawdę potrzebujesz jednej przestrzeni adresowej większej niż 48 GB, to nie jest karta, która cię tam zaprowadzi — drabinka poniżej pokazuje, co to zrobi.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specyfikacja, tak jak publikuje ją NVIDIA

Ada Lovelace, rdzenie tensorowe czwartej generacji, rdzenie ray tracingu trzeciej generacji. Dane ze strony produktu L40S firmy NVIDIA, zacytowane w źródle tej strony.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA podaje również 91,6 teraFLOPS dla FP32, 212 teraFLOPS wydajności ray tracingu i 1 466 teraFLOPS przepustowości tensorowej FP8 z rzadkością, z 142 rdzeni RT i 568 rdzeni tensorowych. To wartości szczytowe w idealnych warunkach; przepustowość pamięci powyżej to ta, która zwykle decyduje o tym, co faktycznie otrzymujesz.

W czym jest dobra

Po przedstawieniu haczyka: oto praca, do której ta karta jest naprawdę właściwą odpowiedzią.

Potok z wideo w środku

Trzy enkodery i trzy dekodery z AV1 w obu kierunkach. Przechwytuj, transkoduj i serwuj na tej samej płycie, na której działa model decydujący, co zrobić z klatkami. Ani A100, ani H100 nie potrafią sprzętowo zakodować ani jednej klatki — na tych kartach wideo to zadanie CPU. Ile kanałów na żywo to daje i w jakiej kompletnej maszynie to zamontować: serwery do transkodowania wideo na żywo.

Renderowanie, które musi być poprawne

Pamięć z korekcją błędów i rdzenie ray tracingu trzeciej generacji. Farma renderująca na kartach konsumenckich kosztuje mniej za klatkę i czasami produkuje klatkę z przekłamanym bitem; przy długim, nienadzorowanym zadaniu oznacza to ponowne uruchomienie. Ta karta daje czterdzieści osiem gigabajtów z ECC za każdym z nich, a tego właśnie potrzebuje zadanie, którego nie możesz pilnować.

Wirtualne pulpity i stanowiska

L40S obsługuje vGPU i napędza cztery wyjścia DisplayPort, co czyni ją kartą, którą można dzielić między wirtualne stacje robocze, a nie akceleratorem bez wyjść wideo. A100 i H100 nie mają żadnych wyjść display.

Inferencja, gdy model mieści się w 48 GB

Obsługa tensorów FP8 i wystarczająca pojemność dla modelu o trzydziestu miliardach parametrów przy ośmiobitowej precyzji z zapasem. Dla endpointu obsługującego realny ruch przy umiarkowanym batchu limit przepustowości powyżej rzadko wiąże — wiąże, gdy wyciskasz z karty maksimum.

Co zastąpiła i co znajduje się po obu jej stronach

Z naszych własnych półek, a nie z mapy drogowej producenta. Wszystkie są dostępne do zamówienia już dziś.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 to karta Ampere, którą L40S zastąpiła — te same 48 GB, starsza architektura, brak AV1 i brak FP8. RTX 6000 Ada to karta stacji roboczej o tej samej pojemności i tej samej generacji. A100 to karty, na które przechodzisz, gdy przepustowość lub łączenie pul staje się wiążącym ograniczeniem, a nie pojemność, a strona akceleratora omawia je szczegółowo.

Do jakiej maszyny trafia i jakie łącze tam otrzymuje

L40S to karta PCIe Gen 4. Jedna z dwóch platform, które ją przyjmują, to Gen 3, a druga to Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Dla endpointu inferencji lub transkodera generacja slotu jest niemal bez znaczenia — wagi są rezydentne, a klatki są małe. Ma znaczenie dla pętli treningowej strumieniującej świeże batche z hosta w każdym kroku, a w tym przypadku platforma Gen 4 jest warta różnicy.

Co faktycznie mieści się w 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

Karta pobiera do 350 W, co jest skromną wartością jak na swoją klasę i częściowo dlatego mieści się w obudowach, do których większy akcelerator nie pasuje.

Ta tabela odpowiada na pytanie „co mieści się w tej karcie”. Pytanie odwrotne — ile pamięci potrzebuje model i która karta je spełnia — ma własną stronę.

Ile kosztuje, razem z maszyną, do której trafia

Karta to jedna pozycja na fakturze, a maszyna to druga. Obie poniższe części pochodzą z jednego odczytu katalogu zamówień, więc cena i specyfikacja obok niej zawsze do siebie pasują.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Przepustowość jest nielimitowana w obu kierunkach bez opłat za ruch wychodzący, jeden adres IPv4 jest wliczony, nie ma umowy, a domyślny okres to jeden miesiąc. Dla każdej innej karty, którą montujemy, wycenionej w ten sam sposób, przeczytaj cały katalog z cenami. Dla maszyn już zamontowanych i gotowych od zaraz, /instant.

Pytania, które ludzie naprawdę zadają o tę kartę

L40S czy A100, do serwowania modelu?

Jeśli model mieści się w 48 GB, a ruch jest umiarkowany, L40S jest tańsza i robi więcej. Jeśli wyciskasz z karty maksimum przy dużym batchu, A100 czyta swoje wagi około dwa razy szybciej i obsłuży więcej żądań na sekundę, mimo że ma na papierze mniej mocy obliczeniowej. A jeśli model nie mieści się w 48 GB, odpowiedzią jest A100 80 GB, a nie L40S.

Czy mogę połączyć dwie, aby uzyskać 96 GB?

Nie. Ten model nie ma NVLink, więc dwie karty to dwie oddzielne pule 48 GB komunikujące się przez slot. Model większy niż 48 GB musi zostać celowo podzielony między nie przez twój framework, ze slotem jako łączem. Jeśli chcesz jedną przestrzeń adresową większą niż 48 GB, spójrz zamiast tego na karty 80 GB i 96 GB w drabince powyżej.

Czy karta jest współdzielona, dzielona lub wirtualizowana?

Nie przez nas. Jeden najemca na maszynę fizyczną, a karta przekazana bezpośrednio do twojego własnego systemu operacyjnego — bez hipernadzorcy, bez partycji MIG, bez profilu vGPU, bez dzielenia czasu. Karta obsługuje vGPU, więc jeśli chcesz podzielić ją między własne wirtualne pulpity, możesz; to twoja decyzja na twojej własnej maszynie, a nie coś, co my robimy z nią wcześniej.

Czy naprawdę obsługuje AV1?

Tak, kodowanie i dekodowanie, na wszystkich trzech sprzętowych enkoderach i dekoderach. To konkretna rzecz, której seria RTX 30 nie potrafi w ogóle i akceleratory nie potrafią w ogóle, i często jest powodem, dla którego ta karta znajduje się na krótkiej liście.

Jak szybko mogę ją mieć?

To zależy od tego, czy karta jest już zamontowana, już na naszej półce, czy musi zostać dokupiona — a dowiadujesz się tego przed zapłatą, nie po. /instant pokazuje maszyny zamontowane i gotowe od zaraz.