NVIDIA L40S · 48 GB GDDR6 con ECC

L40S — la tarjeta que hace los tres trabajos

Cuarenta y ocho gigabytes de memoria con corrección de errores, tres codificadores de hardware con AV1 y núcleos de trazado de rayos, todo en una sola placa. Es la única tarjeta que instalamos capaz de entrenar un modelo, renderizar un fotograma y transcodificar una transmisión sin comprometer ninguno de los tres. La letra pequeña es real y esta página la expone.

48 GB, ECC Tres codificadores, AV1 Sin NVLink

Convierte tus GPUs en ingresos mensuales pasivos

¿Tienes servidores o equipos de escritorio con GPU sin usar? Publícalos hoy en el marketplace de Primcast y obtén rentas mensuales estables de equipos de IA, desarrolladores y empresas que necesitan cómputo de nivel de producción.

Ir al Marketplace

La letra pequeña, primero

Dos cosas que esta tarjeta no puede hacer, y ambas son la razón por la que es más barata que los aceleradores junto a los que se encuentra.

Su memoria es rápida, no apilada. La L40S lee a 864 GB/s. La A100 que está a su lado lee a 1.555 GB/s con 40 GB y a 1.935 GB/s con 80 GB — aproximadamente el doble de velocidad. Para la generación de tokens con un tamaño de lote grande, esa velocidad de lectura es el techo y la aritmética no lo es, así que una A100 servirá más solicitudes por segundo del mismo modelo aunque la L40S tenga más cómputo bruto sobre el papel. Si el rendimiento de servicio es todo tu problema, el acelerador es la compra correcta.

Esta pieza no tiene NVLink. Dos tarjetas L40S en una máquina son dos grupos separados de 48 GB que se comunican por la ranura, no un grupo de 96 GB. La A100 y la H100 pueden agrupar; esta no. Cuando de verdad necesitas un espacio de direcciones mayor de 48 GB, esta no es la tarjeta que te lleva ahí — la escalera de abajo muestra cuál sí lo hace.

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

La especificación, tal como la publica NVIDIA

Ada Lovelace, núcleos tensoriales de cuarta generación, núcleos de trazado de rayos de tercera generación. Cifras de la propia página de producto de la L40S de NVIDIA, citadas en el código fuente de esta página.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA también publica 91,6 teraFLOPS de FP32, 212 teraFLOPS de rendimiento de trazado de rayos y 1.466 teraFLOPS de rendimiento tensorial FP8 con dispersión, a partir de 142 núcleos RT y 568 núcleos tensoriales. Son cifras pico en condiciones ideales; el ancho de banda de memoria de arriba es el que normalmente decide lo que realmente obtienes.

Para qué es buena

Habiendo expuesto la letra pequeña: este es el trabajo para el que esta tarjeta es realmente la respuesta correcta.

Un flujo con vídeo dentro

Tres codificadores y tres decodificadores con AV1 en ambas direcciones. Ingiere, transcodifica y sirve en la misma placa que ejecuta el modelo que decide qué hacer con los fotogramas. Ni la A100 ni la H100 pueden codificar un solo fotograma por hardware — en esas tarjetas, el vídeo es trabajo de la CPU. Cuántos canales en vivo te da esto, y la máquina completa en la que va: servidores de transcodificación de vídeo en vivo.

Renderizado que tiene que salir bien

Memoria con corrección de errores y núcleos de trazado de rayos de tercera generación. Un granja de render con tarjetas de consumo cuesta menos por fotograma y de vez en cuando produce un fotograma con un bit invertido; en un trabajo largo sin supervisión eso es repetir la ejecución. Esta tarjeta te da cuarenta y ocho gigabytes con ECC detrás de cada uno, que es lo que de verdad necesita un trabajo que no puedes vigilar.

Escritorios virtuales y puestos

La L40S admite vGPU y controla cuatro salidas DisplayPort, que es lo que la convierte en una tarjeta que puedes repartir entre estaciones de trabajo virtuales en lugar de un acelerador sin salida de vídeo. La A100 y la H100 no tienen ninguna salida de pantalla.

Inferencia cuando el modelo cabe en 48 GB

Soporte tensorial FP8 y capacidad suficiente para un modelo de treinta mil millones de parámetros con precisión de ocho bits y margen de sobra. Para un endpoint que atiende tráfico real con un tamaño de lote modesto, el techo de ancho de banda de arriba rara vez limita — limita cuando estás exprimiendo la tarjeta a tope.

A qué sustituyó, y qué hay a cada lado

De nuestros propios estantes, no de la hoja de ruta de un fabricante. Todo esto se puede pedir hoy.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

La A40 es la tarjeta Ampere a la que sucedió la L40S — los mismos 48 GB, una arquitectura más antigua, sin AV1 y sin FP8. La RTX 6000 Ada es la tarjeta de estación de trabajo con la misma capacidad y la misma generación. Las A100 son a las que pasas cuando el ancho de banda o la agrupación son la limitación determinante en lugar de la capacidad, y la página del acelerador las cubre en detalle.

En qué máquina va, y qué enlace recibe allí

La L40S es una tarjeta PCIe Gen 4. Una de las dos plataformas que la aceptan es Gen 3, y una es Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Para un endpoint de inferencia o un transcodificador, la generación de la ranura es casi irrelevante — los pesos están residentes y los fotogramas son pequeños. Importa para un bucle de entrenamiento que transmite lotes nuevos desde el host en cada paso, y para ese caso la plataforma Gen 4 vale la diferencia.

Qué cabe realmente en 48 GB

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

La tarjeta consume hasta 350 W, que es modesto para su clase y parte de la razón por la que cabe en chasis donde un acelerador más grande no entra.

Esa tabla responde a “qué cabe en esta tarjeta”. La pregunta al revés — cuánta memoria necesita un modelo, y qué tarjeta la cubre — es una página propia.

Cuánto cuesta, con la máquina en la que va

La tarjeta es una línea de la factura y la máquina es otra. Las dos mitades de abajo provienen de una sola lectura del catálogo de pedidos, así que el precio y la especificación que está a su lado siempre se corresponden.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

El ancho de banda no está medido en ninguna de las dos direcciones y no hay cargo por salida, se incluye una dirección IPv4, no hay contrato y un mes es el plazo por defecto. Para todas las demás tarjetas que instalamos, con el mismo sistema de precios, lee el catálogo completo, con precios. Para máquinas en rack listas hoy mismo, /instant.

Preguntas que la gente hace de verdad sobre esta tarjeta

¿L40S o A100, para servir un modelo?

Si el modelo cabe en 48 GB y el tráfico es moderado, la L40S es más barata y hace más. Si estás exprimiendo la tarjeta a tope con un tamaño de lote grande, la A100 lee sus pesos aproximadamente el doble de rápido y servirá más solicitudes por segundo a pesar de tener menos cómputo sobre el papel. Y si el modelo no cabe en 48 GB, la A100 de 80 GB es la respuesta y la L40S no lo es.

¿Puedo agrupar dos para obtener 96 GB?

No. Esta pieza no tiene NVLink, así que dos tarjetas son dos grupos separados de 48 GB que se comunican por la ranura. Un modelo mayor de 48 GB tiene que dividirse entre ellas deliberadamente desde tu framework, con la ranura como enlace. Si quieres un espacio de direcciones mayor de 48 GB, mira en su lugar las tarjetas de 80 GB y 96 GB de la escalera de arriba.

¿La tarjeta se comparte, se divide o se virtualiza?

Nosotros no lo hacemos. Un inquilino por máquina física y la tarjeta pasada directamente a tu propio sistema operativo — sin hipervisor, sin partición MIG, sin perfil vGPU, sin reparto de tiempo. La tarjeta admite vGPU, así que si quieres dividirla entre tus propios escritorios virtuales puedes hacerlo; es una decisión que tomas tú en tu propia máquina, no algo que le hagamos nosotros de antemano.

¿De verdad hace AV1?

Sí, codificación y decodificación, en sus tres codificadores y decodificadores de hardware. Eso es lo específico que la serie RTX 30 no puede hacer en absoluto y que los aceleradores no pueden hacer en absoluto, y a menudo es la razón por la que esta tarjeta está en la lista corta.

¿Cuánto tardaré en tener una?

Depende de si la tarjeta ya está instalada, ya está en nuestro estante o hay que comprarla — y se te dice cuál es antes de pagar, no después. /instant lista máquinas en rack listas ahora mismo.