NVIDIA L40S · 48 GB GDDR6 con ECC

L40S : la tarjeta que cumple las tres funciones.

Cuarenta y ocho gigabytes de memoria con corrección de errores, tres codificadores de hardware con AV1 y núcleos de trazado de rayos, todo en una sola tarjeta. Es la única tarjeta que hemos instalado capaz de entrenar un modelo, renderizar un fotograma y transcodificar una transmisión sin comprometer ninguna de las tres funciones. El truco está ahí, y esta página lo explica.

48 GB, ECC Tres codificadores, AV1 No NVLink

El primer problema es el siguiente:

Hay dos cosas que esta tarjeta no puede hacer, y ambas son la razón por la que es más barata que los aceleradores con los que se compara.

Su memoria es rápida, no apilada. El L40S lee a 864 GB/s. El A100, junto con él, lee a 1555 GB/s con 40 GB y a 1935 GB/s con 80 GB, aproximadamente el doble. Para la generación de tokens en lotes grandes, esa velocidad de lectura es el límite y la aritmética no lo es, por lo que un A100 atenderá más solicitudes por segundo con el mismo modelo, aunque el L40S tenga mayor capacidad de procesamiento en teoría. Si el rendimiento es el único problema, el acelerador es la compra correcta.

Esta parte no cuenta con NVLink. Dos tarjetas L40S en una misma máquina forman dos grupos de direcciones de 48 GB independientes que se comunican a través de la ranura, no un único grupo de 96 GB. Las tarjetas A100 y H100 sí admiten la función de grupo; esta no. Si realmente necesita un espacio de direcciones superior a 48 GB, esta no es la tarjeta adecuada; la tabla que se muestra a continuación ilustra cuál sí lo permite.

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

La especificación, tal como la publica NVIDIA

Ada Lovelace, núcleos tensoriales de cuarta generación, núcleos de trazado de rayos de tercera generación. Las cifras provienen de la página del producto L40S de NVIDIA, citada en la fuente de esta página.

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA también publica 91,6 teraFLOPS de FP32, 212 teraFLOPS de rendimiento de trazado de rayos y 1466 teraFLOPS de rendimiento de tensores FP8 con dispersión, provenientes de 142 núcleos RT y 568 núcleos tensoriales. Estas son cifras máximas en condiciones ideales; el ancho de banda de la memoria mencionado anteriormente es el que suele determinar el rendimiento real.

En qué es bueno

Una vez aclarado el inconveniente: aquí está el trabajo para el que esta tarjeta es realmente la solución adecuada.

Una tubería con vídeo en su interior

Tres codificadores y tres decodificadores con AV1 en ambas direcciones. La ingesta, la transcodificación y la distribución se realizan en la misma placa que ejecuta el modelo que decide qué hacer con los fotogramas. Ni la A100 ni la H100 pueden codificar un solo fotograma por hardware; en esas tarjetas, el procesamiento de vídeo lo realiza la CPU.

Renderizar eso tiene que ser correcto

Memoria con corrección de errores y núcleos de trazado de rayos de tercera generación. Una granja de renderizado con tarjetas gráficas de consumo cuesta menos por fotograma y, ocasionalmente, produce un fotograma con un bit invertido; en un trabajo prolongado sin supervisión, esto implica una repetición. Esta tarjeta ofrece cuarenta y ocho gigabytes con ECC en cada uno de ellos, justo lo que necesita un trabajo que no requiere supervisión constante.

Escritorios y asientos virtuales

La L40S admite vGPU y ofrece cuatro salidas DisplayPort, lo que la convierte en una tarjeta que se puede dividir entre estaciones de trabajo virtuales en lugar de un acelerador sin interfaz gráfica. Las tarjetas A100 y H100 no tienen salidas de vídeo.

Inferencia donde el modelo se ajusta en 48 GB

Compatibilidad con tensores FP8 y capacidad suficiente para un modelo de treinta mil millones de parámetros con precisión de ocho bits, con margen de sobra. Para un dispositivo que gestiona tráfico real con un tamaño de lote moderado, el límite de ancho de banda rara vez se ve afectado; solo se produce cuando se exige al máximo la tarjeta.

Lo que reemplazó y lo que se encuentra a ambos lados de él.

Disponibles directamente en nuestro almacén, sin depender de un proveedor externo. Todos estos productos se pueden encargar hoy mismo.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

La A40 es la tarjeta Ampere a la que sucedió la L40S: la misma memoria de 48 GB, una arquitectura más antigua, sin AV1 ni FP8. La RTX 6000 Ada es la tarjeta para estaciones de trabajo con la misma capacidad y de la misma generación. Las A100 son la opción a la que se recurre cuando el ancho de banda o la agrupación de memoria son la limitación principal, en lugar de la capacidad, y la página del acelerador las describe en detalle.

¿En qué máquina va y por qué enlace llega allí?

La L40S es una tarjeta PCIe Gen 4. Una de las dos plataformas que la admiten es Gen 3, y la otra es Gen 4.

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Para un punto final de inferencia o un transcodificador, la generación de ranuras es prácticamente irrelevante: los pesos son residentes y los fotogramas son pequeños. Sí importa para un bucle de entrenamiento que transmite lotes nuevos desde el host en cada paso, y en ese caso la plataforma Gen 4 justifica la diferencia.

¿Qué cabe realmente en 48 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La tarjeta consume hasta 350 W, lo cual es modesto para su categoría y una de las razones por las que cabe en chasis en los que un acelerador más potente no cabría.

Lo que cuesta, con la máquina en la que entra

La tarjeta aparece en una línea de la factura y la máquina en otra. Ambas partes provienen de una misma lectura del catálogo de pedidos, por lo que el precio y la especificación que aparece a su lado siempre están relacionados.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

El ancho de banda es ilimitado en ambas direcciones sin cargo de salida, se incluye una dirección IPv4, no hay contrato y el plazo predeterminado es de un mes. Para cualquier otra tarjeta que instalemos, con el mismo precio, consulte el catálogo completo, precios . Para máquinas en rack y listas hoy, /instant .

Preguntas que la gente suele hacer sobre esta tarjeta.

¿L40S o A100, para servir a un modelo?

Si el modelo cabe en 48 GB y el tráfico es moderado, la L40S es más económica y ofrece un mejor rendimiento. Si se le exige al máximo a la tarjeta con un gran volumen de datos, la A100 lee los pesos aproximadamente el doble de rápido y atiende más solicitudes por segundo, a pesar de tener una capacidad de procesamiento teórica inferior. Y si el modelo no cabe en 48 GB, la A100 de 80 GB es la solución, mientras que la L40S no.

¿Puedo combinar dos de ellos para obtener 96 GB?

No. Esta parte no tiene NVLink, por lo que las dos tarjetas forman dos grupos de 48 GB independientes que se comunican a través de la ranura. Un modelo con capacidad superior a 48 GB debe dividirse deliberadamente entre ellas mediante su framework, utilizando la ranura como enlace. Si necesita un espacio de direcciones superior a 48 GB, consulte las tarjetas de 80 GB y 96 GB de la lista anterior.

¿La tarjeta es compartida, segmentada o virtualizada?

No por nuestra parte. Un inquilino por máquina física y la tarjeta se asigna directamente a su propio sistema operativo: sin hipervisor, sin partición MIG, sin perfil vGPU, sin división de tiempo. La tarjeta es compatible con vGPU, así que si desea distribuirla entre sus propios escritorios virtuales, puede hacerlo; es una decisión que usted toma en su propia máquina, no algo que nosotros hagamos previamente.

¿Realmente tiene AV1?

Sí, codifica y decodifica, en sus tres codificadores y decodificadores de hardware. Eso es precisamente lo que la serie RTX 30 no puede hacer, y es a menudo la razón por la que esta tarjeta está entre las opciones preseleccionadas.

¿Cuándo puedo conseguir uno?

Depende de si la tarjeta ya está instalada, ya está en nuestro almacén, o si hay que comprarla; se le informará antes de pagar, no después. /Instant muestra las máquinas preparadas y listas para usar en este momento.