NVIDIA L40S · 48 GB GDDR6 z ECC

L40S — karta, która spełnia wszystkie trzy zadania

Czterdzieści osiem gigabajtów pamięci z korekcją błędów, trzy sprzętowe enkodery z AV1 i rdzenie ray tracingu na jednej płycie. To jedyna karta, którą montujemy, która trenuje model, renderuje klatkę i transkoduje strumień bez kompromisów w żadnym z tych trzech parametrów. Haczyk jest prawdziwy i ta strona go ujawnia.

48 GB, ECC Trzy enkodery, AV1 Brak łącza NV

Najpierw haczyk

Ta karta nie potrafi dwóch rzeczy i obie są powodem, dla którego jest tańsza od akceleratorów, z którymi jest porównywana.

Jego pamięć jest szybka, a nie warstwowa. L40S odczytuje dane z prędkością 864 GB/s. A100, podobnie jak on, odczytuje dane z prędkością 1555 GB/s przy 40 GB i 1935 GB/s przy 80 GB — mniej więcej dwukrotnie szybciej. W przypadku generowania tokenów o dużej wielkości partii, ta prędkość odczytu jest maksymalna, a obliczenia nie, więc A100 obsłuży więcej żądań na sekundę niż ten sam model, mimo że L40S teoretycznie ma większą moc obliczeniową. Jeśli przepustowość jest głównym problemem, akcelerator jest właściwym zakupem.

W tej części nie ma NVLink. Dwie karty L40S w jednym komputerze to dwie oddzielne pule 48 GB komunikujące się przez slot, a nie jedna pula 96 GB. Karty A100 i H100 mogą łączyć się w pule, ta nie. Jeśli naprawdę potrzebujesz przestrzeni adresowej większej niż 48 GB, ta karta Ci w tym pomoże — poniższa tabela pokazuje, co jest lepsze.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

Specyfikacja, tak jak publikuje ją NVIDIA

Ada Lovelace, rdzenie tensorowe czwartej generacji, rdzenie ray tracingowe trzeciej generacji. Dane pochodzą ze strony produktu L40S firmy NVIDIA, podanej w źródle tej strony.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA podaje również 91,6 teraFLOPS wydajności FP32, 212 teraFLOPS wydajności ray tracingu i 1466 teraFLOPS przepustowości tensora FP8 przy rozrzedzeniu, z 142 rdzeni RT i 568 rdzeni tensora. Są to wartości szczytowe w idealnych warunkach; o faktycznym efekcie zazwyczaj decyduje powyższa przepustowość pamięci.

W czym jest dobry

Mówiąc w skrócie: oto zadanie, do którego ta karta jest rzeczywiście właściwym rozwiązaniem.

Rurociąg z wideo w środku

Trzy enkodery i trzy dekodery z wejściem AV1 w obu kierunkach. Pobieranie, transkodowanie i obsługa na tej samej płytce, na której działa model decydujący o losie klatek. Ani A100, ani H100 nie mogą kodować sprzętowo pojedynczej klatki — w przypadku tych kart wideo jest zadaniem procesora.

Renderowanie, które musi być poprawne

Pamięć z korekcją błędów i rdzenie ray tracingu trzeciej generacji. Farma renderująca na kartach konsumenckich kosztuje mniej za klatkę i czasami generuje klatkę z przekręconym bitem; w przypadku długiego, nienadzorowanego zadania jest to ponowna próba. Ta karta oferuje czterdzieści osiem gigabajtów z korekcją błędów (ECC) w każdym z nich, czyli dokładnie tyle, ile wymaga zadanie, którego nie da się nadzorować.

Wirtualne pulpity i miejsca

Karta L40S obsługuje vGPU i obsługuje cztery wyjścia DisplayPort, co czyni ją kartą, którą można dzielić między wirtualne stacje robocze, a nie akceleratorem headless. Modele A100 i H100 nie mają żadnych wyjść display.

Wnioskowanie, gdzie model mieści się w 48 GB

Obsługa tensora FP8 i wystarczająca pojemność dla modelu trzydziestomiliardowego parametru o ośmiobitowej precyzji, z zapasem. W przypadku punktu końcowego obsługującego rzeczywisty ruch przy umiarkowanym rozmiarze partii, powyższy limit przepustowości rzadko jest wiążący — jest wiążący, gdy karta jest obciążana na maksa.

Co zastąpiło i co znajduje się po obu jego stronach

Z naszych własnych półek, a nie z planu dostaw. Wszystkie te produkty można zamówić już dziś.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

Karta A40 to następca karty Ampere, którą zastąpił L40S — ta sama pamięć 48 GB, starsza architektura, brak AV1 i FP8. RTX 6000 Ada to karta do stacji roboczych o tej samej pojemności i tej samej generacji. Karty A100 to rozwiązanie, na które warto się zdecydować, gdy ograniczeniem jest przepustowość lub pulowanie, a nie pojemność. Strona akceleratora szczegółowo opisuje te kwestie.

Do której maszyny trafi i jakim łączem tam dotrze

Karta L40S jest kartą PCIe Gen 4. Obsługuje jedną z dwóch platform: Gen 3 i Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

W przypadku punktu końcowego wnioskowania lub transkodera generowanie slotów jest praktycznie nieistotne — wagi są rezydentne, a ramki małe. Ma to znaczenie w przypadku pętli szkoleniowej przesyłającej strumieniowo nowe partie z hosta na każdym kroku, a w takim przypadku platforma Gen 4 jest warta swojej ceny.

Co tak naprawdę mieści się w 48 GB

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

Karta pobiera do 350 W, co jest niewielką wartością jak na tę klasę i między innymi dlatego pasuje do obudów, w których nie zmieściłyby się większe akceleratory.

Ile to kosztuje, z maszyną wchodzi w to

Karta to jedna linia na fakturze, a maszyna to druga. Obie połówki poniżej pochodzą z jednego odczytu katalogu zamówień, więc cena i specyfikacja obok zawsze są ze sobą powiązane.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

Przepustowość jest nielimitowana w obu kierunkach, bez opłat za wyjście, w cenie jest jeden adres IPv4, nie ma umowy, a domyślny okres wynosi jeden miesiąc. Za każdą inną kartę, którą montujemy, obowiązuje ta sama cena, zapoznaj się z całym katalogiem, ceny . Dla maszyn gotowych do użycia już dziś, /instant .

Pytania, które ludzie faktycznie zadają na temat tej karty

L40S czy A100 do obsługi modelu?

Jeśli model mieści się w 48 GB, a ruch jest umiarkowany, L40S jest tańszy i oferuje więcej możliwości. Jeśli wykorzystujesz kartę na maksa przy dużej liczbie wsadów, A100 odczytuje dane około dwa razy szybciej i obsługuje więcej żądań na sekundę, mimo że teoretycznie ma mniej mocy obliczeniowej. A jeśli model nie mieści się w 48 GB, rozwiązaniem jest A100 80 GB, a L40S nie.

Czy mogę połączyć dwa, aby uzyskać 96 GB?

Nie. Ta część nie ma NVLink, więc dwie karty to dwie oddzielne pule 48 GB komunikujące się przez slot. Model o pojemności większej niż 48 GB musi zostać celowo podzielony przez platformę, a slot będzie pełnił funkcję łącza. Jeśli potrzebujesz jednej przestrzeni adresowej większej niż 48 GB, rozważ karty 80 GB i 96 GB z powyższego zestawienia.

Czy karta jest współdzielona, ​​podzielona czy wirtualizowana?

Nie przez nas. Jeden użytkownik na maszynę fizyczną, a karta jest przesyłana bezpośrednio do Twojego systemu operacyjnego — bez hypervisora, partycji MIG, profilu vGPU i podziału czasu. Karta obsługuje vGPU, więc jeśli chcesz ją podzielić między własne wirtualne pulpity, możesz to zrobić; to Twoja decyzja, którą podejmujesz na swojej maszynie, a nie coś, co my robimy z nią z wyprzedzeniem.

Czy naprawdę obsługuje AV1?

Tak, koduje i dekoduje na wszystkich trzech sprzętowych enkoderach i dekoderach. To jest właśnie to, czego seria RTX 30 w ogóle nie potrafi, a akceleratory w ogóle nie potrafią, i to często jest powodem, dla którego ta karta znajduje się na krótkiej liście.

Jak szybko mogę go otrzymać?

Zależy to od tego, czy karta jest już zamontowana, czy znajduje się na naszej półce, czy trzeba ją kupić — a informujemy o tym przed zapłatą, a nie po niej. /instant wyświetla listę maszyn ustawionych w stojakach i gotowych do użycia od zaraz.