H100 80 GB · A100 80 GB · A100 40 GB

Los aceleradores y lo que no harán

Tres tarjetas diseñadas para una sola función: almacenar un modelo y realizar cálculos aritméticos sobre él, más rápido que cualquier otra opción. Cuentan con memoria apilada, corrección de errores y capacidad de compartir recursos entre sí. No tienen salida de vídeo ni codificador de vídeo (no uno lento, en absoluto), y saber esto antes de realizar el pedido es más valioso que cualquier prueba de rendimiento en esta página.

40 y 80 GB Memoria apilada, ECC Sin codificador de vídeo

Dos cosas que sorprenden a la gente

No pueden codificar vídeo. En absoluto.

La matriz de soporte de codificación y decodificación de NVIDIA registra cero motores NVENC en la A100 y cero en la H100. Decodifican (cinco motores en la A100, siete en la H100), pero no hay codificador en la placa, por lo que cada fotograma que producen estas tarjetas debe ser codificado por el procesador. Si su canal de procesamiento tiene salida de vídeo, esta no es la placa adecuada, y la L40S con sus tres codificadores AV1 es la correcta. Esto se encuentra en la página siguiente en /l40s .

Estas tarjetas tampoco tienen salidas de vídeo. Son componentes de computación sin interfaz gráfica. Ningún programa que requiera un búfer de fotogramas (un escritorio virtual, una estación de trabajo remota, un servidor de juegos) debería estar instalado en ellas.

El A100 no está obsoleto y la tarjeta de 40 GB no es un error.

La A100 es de la generación anterior y lee sus pesos a 1555 GB/s con 40 GB y a 1935 GB/s con 80 GB. Para un modelo compatible, esta velocidad de lectura determina la cantidad de tokens por segundo que se obtienen, y sigue estando muy por delante de todas las tarjetas no apiladas del catálogo. La tarjeta de 40 GB almacena cómodamente un modelo de treinta mil millones de parámetros con una precisión de ocho bits, que es lo que la mayoría de los usuarios realmente utilizan, a una fracción del costo mensual de la H100.

Compra el H100 cuando el modelo realmente necesite Hopper (el motor transformador, el FP8, las unidades tensoriales más recientes) o cuando la ejecución deba finalizar antes de lo previsto. Compra un A100 cuando la pregunta más común sea si cabe y qué tan rápido lee.

Las especificaciones, tal como se publicaron

Las cifras provienen de las hojas de datos de NVIDIA y de las tablas de especificaciones de Tesla, citadas en la fuente de esta página. Cuando no se pudo encontrar una cifra que coincidiera exactamente con la pieza que instalamos, esta página no muestra nada, solo una estimación.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

El H100 no muestra el número de núcleos ni el ancho de banda, y esto es intencional. Nuestra pieza está registrada en la tienda con un número de núcleos correspondiente al módulo SXM, que es una tarjeta que se atornilla a la placa base en lugar de insertarse en una ranura; la memoria HBM2e de 80 GB que también registra pertenece a la tarjeta PCIe, que es la que realmente se instala en estas máquinas. En lugar de seleccionar una y mostrarla con seguridad, la página muestra la memoria en la que coinciden ambas fuentes y omite el resto. Consúltenos y le diremos exactamente qué tarjeta se instalará en su equipo.

En qué son buenos

Un solo trabajo, realizado mejor que cualquier otra cosa en este sitio.

Leer pesos rápidamente

La memoria apilada es la diferencia entre este estante y todos los demás. Una vez que un modelo está instalado, la velocidad de generación viene determinada por la rapidez con la que la tarjeta puede leer sus propios pesos, y estos se leen entre una vez y media y dos veces más rápido que la tarjeta no apilada más rápida que instalamos.

Agrupación en un único espacio de direcciones

Estas piezas incorporan NVLink, por lo que dos de ellas en una misma máquina pueden funcionar como un único grupo de almacenamiento en lugar de dos grupos separados. Las tarjetas para estaciones de trabajo y de consumo del catálogo no permiten esta funcionalidad. Se trata de una configuración que ofrecemos en un presupuesto, no de una opción de compra.

Funcionando durante semanas sin supervisión

Corrección de errores en todo el sistema y hardware diseñado para carga continua en lugar de picos de carga. Para un programa de entrenamiento que dura semanas y en el que se invierte dinero real, esto no es un lujo.

Siendo solo tuya

Un inquilino por máquina física y la tarjeta se asigna directamente, sin partición MIG, sin perfil vGPU, sin planificador de división de tiempo y sin que ningún otro trabajo la utilice. En otros lugares, una "instancia A100" suele ser una sola instancia.

Los tres uno al lado del otro, y lo que se sienta arriba

Disponibles en nuestro catálogo. Todos estos modelos se pueden encargar hoy mismo, con el mismo chasis, así que la pregunta es cuál merece la pena la diferencia.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

La última fila está ahí porque es la comparación honesta y la mayoría de las listas la ocultan: la RTX PRO 6000 Blackwell tiene 96 GB, más que cualquier acelerador en esta página. Consulta su memoria y su precio en comparación con la H100 en la tabla anterior en lugar de fiarte de nuestra palabra. Lo que sacrifica es velocidad de lectura y NVLink; lo que gana son cuatro codificadores de vídeo y trazado de rayos. Si te preguntas si cabe en tu estante, lee /rtx60 antes de decidirte por este.

¿En qué máquina entran y a qué enlace llegan?

La A100 es una tarjeta PCIe Gen 4 y la H100 es Gen 5, mientras que nuestras plataformas son Gen 3 y Gen 4. Por lo tanto, la H100 nunca recibe el bus completo para el que fue diseñada en ninguna de las máquinas que utilizamos, y esta página lo indica en lugar de dejar que usted lo averigüe.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Si esto le costará algo depende completamente del tipo de trabajo. Un punto final de inferencia cuyos pesos son residentes apenas interactúa con la ranura y no lo notará. Un bucle de entrenamiento que transmite un nuevo lote desde la memoria del host en cada paso sí lo notará en cada paso. Si no está seguro de cuál es su caso, díganos en qué consiste el trabajo antes de realizar el pedido; esto determinará la máquina, no la tarjeta.

¿Qué cabe realmente en 80 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

La A100 de 40 GB mantiene la misma tabla, un nivel por debajo: un modelo de entre treinta y treinta y cuatro mil millones de parámetros con precisión de ocho bits encaja, pero el mismo modelo con dieciséis bits no. Un modelo de setenta mil millones con dieciséis bits no cabe en ninguna de las tarjetas que vendemos; se trata de una configuración de dos tarjetas, y por eso la línea NVLink mencionada anteriormente es importante.

Lo que cuestan, con las máquinas en las que van

La tarjeta aparece en una línea de la factura y la máquina en otra. Ambas partes provienen de una misma lectura del catálogo de pedidos, por lo que el precio y la especificación que aparece a su lado siempre están relacionados.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

El ancho de banda es ilimitado en ambas direcciones sin cargo de salida, que en este estante suele ser el mayor costo oculto en otros lugares: una ejecución de entrenamiento que descarga un conjunto de datos y envía puntos de control mueve una gran cantidad de bytes, y se cobra por gigabyte de salida en cada uno de ellos. Se incluye una dirección IPv4, no hay contrato y el plazo predeterminado es de un mes. Para cualquier otra tarjeta que instalemos, con el mismo precio, consulte el catálogo completo, precio . Para máquinas en rack y listas hoy, /instant .

Preguntas que la gente suele hacer sobre estas tarjetas.

¿Puedo transcodificar vídeo en una A100 o una H100?

No en hardware. Ninguna de las tarjetas tiene un codificador (la matriz de soporte de NVIDIA registra cero motores NVENC en ambas), por lo que la codificación recae en el procesador y se ejecuta a la velocidad del procesador. Sí decodifican, por lo que una canalización que lea vídeo y produzca algo distinto al vídeo funciona bien. Si necesitas fotogramas de salida, la L40S tiene tres codificadores AV1 y es mucho más barata: /l40s .

¿La tarjeta está dividida en instancias MIG?

Nosotros no. Recibirás la tarjeta física completa integrada en tu sistema operativo, en un equipo sin ningún otro usuario. Estas piezas son compatibles con MIG, por lo que puedes particionar tu tarjeta si lo deseas; es tu decisión y se realiza en tu propio equipo, no antes de que la recibas. Conviene comprobarlo en cualquier otro sitio donde compres, ya que muchas ofertas de "A100" son solo una parte de una tarjeta.

¿A100 de 40 GB u 80 GB?

Primero la capacidad, luego la velocidad de lectura. Si el modelo y su contexto se ajustan a cuarenta gigabytes con un quinto de espacio libre, la tarjeta más pequeña es la mejor opción, y la tabla anterior muestra la diferencia. La tarjeta de 80 GB también lee más rápido (1935 GB/s frente a 1555), así que si estás cerca del límite de capacidad o velocidad de transferencia, elige la de mayor capacidad.

¿Qué controlador y versión de CUDA debo obtener?

Independientemente de la versión que instale, la máquina llega con un sistema operativo y un root limpios. Usted fija el controlador, la versión de CUDA y la compilación del framework a la versión con la que se probó su código. No se realizan actualizaciones automáticas. Si prefiere que el controlador se instale antes de la entrega, indíquelo en el pedido y especifique la versión.

¿Cuándo puedo conseguir uno?

Estas son las piezas que probablemente se compren en lugar de instalarse desde el almacén, y se le informa cuáles son antes de pagar, no después. El plazo de entrega más largo que ofrecemos para un acelerador de última generación bajo pedido es /instant muestra las máquinas listas para usar.