NVIDIA L40S · 48 GB GDDR6 com ECC

L40S — a placa que faz os três trabalhos

Quarenta e oito gigabytes de memória com correção de erros, três codificadores de hardware com AV1 e núcleos de ray tracing, tudo em uma única placa. É a única placa que instalamos capaz de treinar um modelo, renderizar um quadro e transcodificar um stream sem comprometer nenhum dos três. A ressalva é real e esta página a declara.

48 GB, ECC Três codificadores, AV1 Sem NVLink

Transforme suas GPUs em receita mensal passiva

Tem servidores ou desktops com GPU parados? Anuncie-os hoje no marketplace da Primcast e ganhe aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação de nível de produção.

Ir para o Marketplace

A ressalva, primeiro

Duas coisas que esta placa não consegue fazer, e ambas são a razão de ela ser mais barata que os aceleradores ao lado dos quais ela fica.

Sua memória é rápida, não empilhada. A L40S lê a 864 GB/s. A A100 ao lado lê a 1.555 GB/s com 40 GB e 1.935 GB/s com 80 GB — aproximadamente o dobro da taxa. Para geração de tokens em um tamanho de lote grande, essa taxa de leitura é o teto e a aritmética não é, então uma A100 servirá mais requisições por segundo do mesmo modelo, mesmo que a L40S tenha mais computação bruta no papel. Se a vazão de serviço é todo o seu problema, o acelerador é a compra correta.

Não há NVLink nesta peça. Duas placas L40S em uma máquina são dois pools separados de 48 GB que se comunicam pelo slot, não um pool de 96 GB. A A100 e a H100 podem agrupar; esta não pode. Quando você realmente precisa de um espaço de endereçamento maior que 48 GB, esta não é a placa que o leva até lá — a escada abaixo mostra o que leva.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

A especificação, como a NVIDIA a publica

Ada Lovelace, núcleos tensores de quarta geração, núcleos de ray tracing de terceira geração. Números da própria página de produto da L40S da NVIDIA, citados no código-fonte desta página.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

A NVIDIA também publica 91,6 teraFLOPS de FP32, 212 teraFLOPS de desempenho de ray tracing e 1.466 teraFLOPS de vazão tensorial FP8 com esparsidade, de 142 núcleos RT e 568 núcleos tensores. Esses são números de pico em condições ideais; a largura de banda de memória acima é a que geralmente decide o que você realmente obtém.

No que ela é boa

Tendo declarado a ressalva: aqui está o trabalho para o qual esta placa é genuinamente a resposta certa.

Um pipeline com vídeo

Três codificadores e três decodificadores com AV1 em ambas as direções. Ingira, transcodifique e sirva na mesma placa que executa o modelo que decide o que fazer com os quadros. Nem a A100 nem a H100 conseguem codificar um único quadro em hardware — nessas placas, vídeo é trabalho de CPU. Quantos canais ao vivo isso compra, e a máquina completa em que ela vai: servidores de transcodificação de vídeo ao vivo.

Renderização que precisa estar certa

Memória com correção de erros e núcleos de ray tracing de terceira geração. Um farm de renderização em placas de consumo custa menos por quadro e ocasionalmente produz um quadro com um bit invertido; em um trabalho longo sem supervisão, isso é uma reexecução. Esta placa oferece quarenta e oito gigabytes com ECC por trás de cada um deles, que é o que um trabalho que você não pode vigiar realmente precisa.

Desktops virtuais e assentos

A L40S suporta vGPU e aciona quatro saídas DisplayPort, o que a torna uma placa que você pode fatiar entre estações de trabalho virtuais em vez de um acelerador sem cabeça. A A100 e a H100 não têm nenhuma saída de vídeo.

Inferência onde o modelo cabe em 48 GB

Suporte a tensor FP8 e capacidade suficiente para um modelo de trinta bilhões de parâmetros em precisão de oito bits com folga. Para um endpoint respondendo a tráfego real em um tamanho de lote modesto, o teto de largura de banda acima raramente limita — ele limita quando você está levando a placa ao máximo.

O que ela substituiu, e o que fica de cada lado dela

Das nossas próprias prateleiras, não de um roteiro de fornecedor. Todas estas podem ser encomendadas hoje.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A A40 é a placa Ampere que a L40S sucedeu — os mesmos 48 GB, uma arquitetura mais antiga, sem AV1 e sem FP8. A RTX 6000 Ada é a placa de estação de trabalho com a mesma capacidade e a mesma geração. As A100 são para onde você migra quando largura de banda ou agrupamento é a restrição limitante em vez de capacidade, e a página do acelerador cobre essas em detalhes.

Em qual máquina ela vai, e qual link ela recebe lá

A L40S é uma placa PCIe Gen 4. Uma das duas plataformas que a aceitam é Gen 3, e uma é Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Para um endpoint de inferência ou um transcodificador, a geração do slot é quase irrelevante — os pesos são residentes e os quadros são pequenos. Ela importa para um loop de treinamento transmitindo lotes novos do host a cada passo, e para esse caso a plataforma Gen 4 vale a diferença.

O que realmente cabe em 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

A placa consome até 350 W, o que é modesto para sua classe e parte do motivo de ela caber em chassis que um acelerador maior não cabe.

Essa tabela responde “o que cabe nesta placa”. A pergunta no sentido inverso — quanta memória um modelo precisa, e qual placa a atende — é uma página própria.

Quanto custa, com a máquina em que ela vai

A placa é uma linha na fatura e a máquina é outra. Ambas as metades abaixo vêm de uma leitura do catálogo de pedidos, então o preço e a especificação ao lado sempre pertencem um ao outro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

A largura de banda é ilimitada em ambas as direções sem cobrança de egresso, um endereço IPv4 está incluído, não há contrato e um mês é o prazo padrão. Para todas as outras placas que instalamos, com preços da mesma forma, leia o catálogo completo, com preços. Para máquinas em rack prontas hoje, /instant.

Perguntas que as pessoas realmente fazem sobre esta placa

L40S ou A100, para servir um modelo?

Se o modelo cabe em 48 GB e o tráfego é moderado, a L40S é mais barata e faz mais. Se você está levando a placa ao máximo em um tamanho de lote grande, a A100 lê seus pesos cerca de duas vezes mais rápido e servirá mais requisições por segundo, apesar de ter menos computação no papel. E se o modelo não cabe em 48 GB, a A100 de 80 GB é a resposta e a L40S não é.

Posso agrupar duas delas para obter 96 GB?

Não. Esta peça não tem NVLink, então duas placas são dois pools separados de 48 GB se comunicando pelo slot. Um modelo maior que 48 GB precisa ser dividido entre elas deliberadamente pelo seu framework, com o slot como o link. Se você quer um espaço de endereçamento maior que 48 GB, veja as placas de 80 GB e 96 GB na escada acima.

A placa é compartilhada, fatiada ou virtualizada?

Não por nós. Um inquilino por máquina física e a placa passada diretamente para o seu próprio sistema operacional — sem hipervisor, sem partição MIG, sem perfil vGPU, sem fatiamento de tempo. A placa suporta vGPU, então se você quiser fatiá-la entre seus próprios desktops virtuais, pode; essa é uma decisão sua na sua própria máquina, não algo que fazemos com ela de antemão.

Ela realmente faz AV1?

Sim, codificação e decodificação, em todos os três codificadores e decodificadores de hardware. Essa é a coisa específica que a série RTX 30 não consegue fazer de forma alguma e que os aceleradores não conseguem fazer de forma alguma, e muitas vezes é a razão de esta placa estar na lista curta.

Em quanto tempo posso ter uma?

Depende de a placa já estar instalada, já estar na nossa prateleira ou precisar ser comprada — e você é informado disso antes de pagar, não depois. /instant lista máquinas em rack prontas agora.