NVIDIA L40S · 48 GB GDDR6 com ECC

L40S — a placa que faz os três trabalhos

Quarenta e oito gigabytes de memória com correção de erros, três codificadores de hardware com AV1 e núcleos de ray tracing, tudo em uma única placa. É a única placa que testamos capaz de treinar um modelo, renderizar um frame e transcodificar um fluxo sem comprometer nenhuma das três funções. A pegadinha é real e está explicada nesta página.

48 GB, ECC Três codificadores, AV1 Sem NVLink

A pegadinha, primeiro.

Há duas coisas que esta placa não consegue fazer, e ambas são a razão pela qual ela é mais barata do que as placas aceleradoras que estão ao lado dela.

Sua memória é rápida e não empilhada. O L40S lê a 864 GB/s. O A100, em conjunto, lê a 1.555 GB/s com 40 GB e a 1.935 GB/s com 80 GB — aproximadamente o dobro da taxa. Para geração de tokens em lotes grandes, essa taxa de leitura é o limite máximo, e o cálculo aritmético não, portanto, um A100 atenderá mais solicitações por segundo com o mesmo modelo, mesmo que o L40S tenha mais poder computacional bruto no papel. Se a taxa de transferência for o seu principal problema, o acelerador é a compra correta.

Não há NVLink nesta placa. Duas placas L40S em uma mesma máquina formam dois pools separados de 48 GB que se comunicam pelo slot, e não um único pool de 96 GB. As placas A100 e H100 podem formar pools; esta não. Quando você realmente precisa de um espaço de endereçamento maior que 48 GB, esta não é a placa ideal — a tabela abaixo mostra o que funciona.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

A especificação, conforme publicada pela NVIDIA.

Ada Lovelace, núcleos tensores de quarta geração, núcleos de ray tracing de terceira geração. Dados da página do produto L40S da NVIDIA, citada na fonte desta página.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

A NVIDIA também divulga 91,6 teraFLOPS de FP32, 212 teraFLOPS de desempenho em ray tracing e 1.466 teraFLOPS de throughput de tensores FP8 com esparsidade, provenientes de 142 núcleos RT e 568 núcleos tensores. Esses são valores máximos em condições ideais; a largura de banda da memória acima é o fator que geralmente determina o desempenho real.

Em que é bom

Dito isto, a questão é: eis a tarefa para a qual este cartão é realmente a resposta certa.

Um oleoduto com vídeo dentro dele.

Três codificadores e três decodificadores com AV1 em ambas as direções. Ingestão, transcodificação e distribuição na mesma placa que executa o modelo que decide o que fazer com os quadros. Nem a A100 nem a H100 conseguem codificar um único quadro por hardware — nessas placas, o processamento de vídeo é feito pela CPU.

Renderização que precisa estar correta

Memória com correção de erros e núcleos de ray tracing de terceira geração. Um cluster de renderização em placas de vídeo para consumidores custa menos por frame e, ocasionalmente, produz um frame com um bit invertido; isso ocorre em trabalhos longos e não supervisionados que precisam ser refeitos. Esta placa oferece 48 gigabytes com ECC em cada um deles, que é exatamente o que um trabalho que não pode ser monitorado constantemente precisa.

Áreas de trabalho e assentos virtuais

A L40S suporta vGPU e oferece quatro saídas DisplayPort, o que a torna uma placa que pode ser usada em diferentes estações de trabalho virtuais, em vez de um acelerador sem monitor. As placas A100 e H100 não possuem saídas de vídeo.

Inferência onde o modelo cabe em 48 GB

Suporte a tensores FP8 e capacidade suficiente para um modelo de trinta bilhões de parâmetros com precisão de oito bits, com folga de sobra. Para um endpoint que lida com tráfego real em lotes de tamanho moderado, o limite de largura de banda raramente é atingido — ele só se torna um problema quando a placa está sendo utilizada ao máximo.

O que substituiu e o que está ao seu lado.

Diretamente do nosso estoque, e não de um cronograma de fornecedores. Todos esses itens podem ser encomendados hoje mesmo.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A A40 é a placa Ampere que sucedeu a L40S — os mesmos 48 GB, uma arquitetura mais antiga, sem AV1 e sem FP8. A RTX 6000 Ada é a placa para estações de trabalho com a mesma capacidade e da mesma geração. As placas A100 são a escolha ideal quando a largura de banda ou o agrupamento de memória são a limitação, e não a capacidade. A página sobre aceleradores aborda esses modelos em detalhes.

Em qual máquina ele será inserido e qual link ele receberá?

A L40S é uma placa PCIe Gen 4. Uma das duas plataformas que a utilizam é ​​a Gen 3, e a outra é a Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Para um endpoint de inferência ou um transcodificador, a geração de slots é quase irrelevante — os pesos são residentes e os frames são pequenos. Ela importa para um loop de treinamento que transmite novos lotes do host a cada passo, e nesse caso a plataforma Gen 4 justifica a diferença.

O que realmente cabe em 48 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

A placa consome até 350 W, o que é modesto para sua categoria e, em parte, explica por que ela cabe em chassis onde uma aceleradora maior não caberia.

Quanto custa, incluindo a máquina em que é instalado?

O cartão é uma linha na fatura e a máquina é outra. Ambas as metades abaixo provêm de uma única leitura do catálogo de pedidos, portanto o preço e a especificação ao lado sempre pertencem um ao outro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

A largura de banda é ilimitada em ambas as direções, sem cobrança de saída, um endereço IPv4 está incluído, não há contrato e o prazo padrão é de um mês. Para todas as outras placas que instalamos, o preço é o mesmo, consulte o catálogo completo . Para máquinas instaladas e prontas para uso hoje, /instant .

Perguntas que as pessoas realmente fazem sobre este cartão.

L40S ou A100, para atender um modelo?

Se o modelo couber em 48 GB e o tráfego for moderado, o L40S é mais barato e oferece melhor desempenho. Se você estiver utilizando a placa ao máximo com um grande volume de processamento em lote, o A100 lê seus pesos cerca de duas vezes mais rápido e atenderá mais solicitações por segundo, apesar de ter menos capacidade de processamento em teoria. E se o modelo não couber em 48 GB, o A100 de 80 GB é a solução, e o L40S não.

Posso juntar duas delas para obter 96 GB?

Não. Esta peça não possui NVLink, portanto, dois cartões são dois pools separados de 48 GB comunicando-se através do slot. Um modelo com capacidade superior a 48 GB precisa ser dividido entre eles deliberadamente pela sua plataforma, com o slot servindo como elo de ligação. Se você deseja um espaço de endereçamento maior que 48 GB, considere os cartões de 80 GB e 96 GB na lista acima.

O cartão é compartilhado, fatiado ou virtualizado?

Não por nossa conta. Um único usuário por máquina física, e a placa é repassada diretamente para o seu sistema operacional — sem hipervisor, sem partição MIG, sem perfil vGPU, sem divisão de tempo. A placa suporta vGPU, então, se você quiser dividi-la entre suas próprias áreas de trabalho virtuais, poderá fazê-lo; essa é uma decisão sua, que deve ser tomada em sua própria máquina, e não algo que fazemos nela antecipadamente.

Será que realmente funciona com AV1?

Sim, codifica e decodifica, em todos os três codificadores e decodificadores de hardware. Essa é exatamente a função que a série RTX 30 e os aceleradores não conseguem executar, e é frequentemente o motivo pelo qual esta placa está na lista de opções.

Em quanto tempo posso receber um?

Depende se o cartão já está instalado, se já está em estoque ou se precisa ser comprado — e você é informado disso antes de pagar, não depois. /instant lista as máquinas instaladas e prontas para uso no momento.