H100 80 GB · A100 80 GB · A100 40 GB

Os aceleradores — e o que eles não farão

Três placas construídas para um único trabalho: manter um modelo e fazer aritmética nele, mais rápido do que qualquer outra coisa aqui. Elas têm memória empilhada, correção de erros e a capacidade de se agrupar entre si. Não têm saída de vídeo nem codificador de vídeo — não um lento, nenhum — e saber disso antes de encomendar vale mais do que qualquer benchmark nesta página.

40 e 80 GB Memória empilhada, ECC Sem codificador de vídeo

Transforme suas GPUs em receita mensal passiva

Tem configurações de GPU ociosas em servidores ou desktops? Anuncie-as hoje no marketplace da Primcast e ganhe aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação de nível de produção.

Ir para o Marketplace

Duas coisas que surpreendem as pessoas

Elas não codificam vídeo. De forma alguma.

A própria matriz de suporte de codificação e decodificação da NVIDIA registra zero motores NVENC na A100 e zero na H100. Elas decodificam — cinco motores na A100, sete na H100 — mas não há codificador na placa, então cada quadro que essas placas produzem precisa ser codificado pelo processador. Se o seu pipeline gera vídeo, esta é a prateleira errada, e a L40S com seus três codificadores AV1 é a certa. Isso está a uma página de distância em /l40s.

Essas placas também não têm saídas de vídeo. São peças de computação headless. Nada que espere um framebuffer — um desktop virtual, uma estação de trabalho remota, um servidor de jogos — pertence a elas.

A A100 não está obsoleta, e a placa de 40 GB não é um erro

A A100 é a geração anterior, e lê seus pesos a 1.555 GB/s com 40 GB e 1.935 GB/s com 80 GB. Para um modelo que cabe, essa taxa de leitura é o que decide quantos tokens por segundo você obtém, e continua muito à frente de todas as placas sem memória empilhada do catálogo. A placa de 40 GB comporta confortavelmente um modelo de trinta bilhões de parâmetros em precisão de oito bits, que é a maior parte do que as pessoas realmente servem, por uma fração do que a H100 custa por mês.

Compre a H100 quando o modelo realmente precisar de Hopper — o transformer engine, FP8, as unidades tensor mais novas — ou quando a execução tiver que terminar mais cedo em vez de apenas terminar. Compre uma A100 quando a questão for se cabe e quão rápido lê, que é a pergunta mais comum.

As especificações, como publicadas

Números das próprias fichas técnicas da NVIDIA e das tabelas de especificação Tesla, citados no código-fonte desta página. Quando um número não pôde ser verificado em relação à peça exata que instalamos, esta página não imprime nada em vez de um palpite.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A H100 não mostra contagem de núcleos nem largura de banda acima, e isso é deliberado. Nossa peça está registrada na loja com uma contagem de núcleos pertencente ao módulo SXM, que é uma placa que se aparafusa a uma base em vez de um slot; a memória HBM2e de 80 GB que ela também registra pertence à placa PCIe, que é o que realmente vai nessas máquinas. Em vez de escolher um e imprimi-lo com confiança, a página imprime a memória com a qual ambas as fontes concordam e omite o resto. Pergunte-nos e diremos exatamente qual placa vai na sua.

No que elas são boas

Um trabalho, feito melhor do que qualquer outra coisa neste site.

Ler pesos rapidamente

Memória empilhada é a diferença entre esta prateleira e todas as outras. Uma vez que um modelo está residente, a velocidade de geração é governada por quão rápido a placa pode ler seus próprios pesos, e estas leem uma vez e meia a duas vezes mais rápido do que a placa sem memória empilhada mais rápida que instalamos.

Agrupar-se em um único espaço de endereço

Essas peças têm NVLink, então duas delas em uma máquina podem se comportar como um pool maior em vez de dois separados. As placas de workstation e de consumo do catálogo não conseguem fazer isso de forma alguma. É uma configuração que orçamos em vez de uma opção de checkout.

Funcionar por semanas sem supervisão

Correção de erros em todo o hardware, construído para carga contínua em vez de picos. Para uma execução de treinamento medida em semanas com dinheiro real por trás, isso não é um recurso de luxo.

Ser somente sua

Um locatário por máquina física e a placa passada diretamente — sem partição MIG, sem perfil vGPU, sem escalonador de fatias de tempo e sem o trabalho de mais ninguém nela. Em outros lugares, uma “instância A100” é frequentemente uma fatia de uma.

As três lado a lado, e o que está acima

Das nossas próprias prateleiras. Todas podem ser encomendadas hoje, no mesmo chassi, então a questão é qual vale a diferença.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

A última linha está lá porque é a comparação honesta e a maioria das listagens a esconde: a RTX PRO 6000 Blackwell tem 96 GB, mais do que qualquer acelerador nesta página. Leia sua memória e seu preço contra os da H100 na tabela acima em vez de aceitar nossa palavra sobre qualquer um dos dois. O que ela cede é taxa de leitura e NVLink; o que ganha são quatro codificadores de vídeo e ray tracing. Se a sua pergunta é vai caber, leia /rtx60 antes de se comprometer com esta prateleira.

Em qual máquina elas vão, e qual link recebem lá

A A100 é uma placa PCIe Gen 4 e a H100 é Gen 5, enquanto nossas plataformas são Gen 3 e Gen 4. A H100, portanto, nunca recebe o barramento completo para o qual foi projetada em nenhuma máquina que operamos, e esta página diz isso em vez de deixar você descobrir.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Se isso custa algo a você depende inteiramente do formato do trabalho. Um endpoint de inferência cujos pesos estão residentes mal toca o slot e não notará. Um loop de treinamento transmitindo um lote novo da memória do host a cada passo notará a cada passo. Se não tiver certeza de qual é o seu caso, diga-nos qual é o trabalho antes de encomendar — é isso que decide a máquina, não a placa.

O que realmente cabe em 80 GB

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

A A100 de 40 GB comporta a mesma tabela um degrau abaixo: um modelo de trinta a trinta e quatro bilhões de parâmetros cabe com folga apenas em quatro bits, e em oito bits seus 34 GB de pesos não passam nem pela barra mais apertada. Um modelo de setenta bilhões em dezesseis bits não cabe em nenhuma placa única que vendemos — isso é uma configuração de duas placas, e a razão pela qual a linha NVLink acima importa.

Essa tabela responde “o que cabe nesta placa”. A pergunta no sentido inverso — quanta memória um modelo precisa, e qual placa a comporta — é uma página própria.

Quanto custam, com as máquinas em que vão

A placa é uma linha na fatura e a máquina é outra. Ambas as metades abaixo vêm de uma única leitura do catálogo de pedidos, então o preço e a especificação ao lado sempre pertencem um ao outro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

A largura de banda é ilimitada em ambas as direções sem cobrança de egresso, que nesta prateleira costuma ser o maior custo oculto em outros lugares — uma execução de treinamento puxando um conjunto de dados e enviando checkpoints move muitos bytes, e o egresso por gigabyte é cobrado em cada um deles. Um endereço IPv4 está incluído, não há contrato e um mês é o prazo padrão. Para todas as outras placas que instalamos, com preços da mesma forma, leia o catálogo completo, com preços. Para máquinas em rack prontas hoje, /instant.

Perguntas que as pessoas realmente fazem sobre essas placas

Posso transcodificar vídeo em uma A100 ou H100?

Não em hardware. Nenhuma das placas tem codificador — a matriz de suporte da NVIDIA registra zero motores NVENC em ambas — então a codificação recai sobre o processador e roda na velocidade do processador. Elas decodificam, então um pipeline que lê vídeo e produz algo diferente de vídeo está bem. Se você precisa de quadros de saída, a L40S tem três codificadores AV1 e é muito mais barata: /l40s. Quantos canais ao vivo uma placa suporta, e a máquina em que vai: /transcoding.

A placa é fatiada em instâncias MIG?

Não por nós. Você recebe a placa física inteira passada diretamente para o seu próprio sistema operacional, em uma máquina sem mais ninguém. Essas peças suportam MIG, então você pode particionar sua própria placa se quiser; essa é uma decisão sua na sua própria máquina, não algo feito nela antes de chegar a você. Vale a pena verificar isso em qualquer outro lugar onde você compre — muitas ofertas de “A100” são uma fatia de uma.

A100 40 GB ou 80 GB?

Capacidade primeiro, depois taxa de leitura. Se o modelo e seu contexto cabem em quarenta gigabytes com um quinto de sobra, a placa menor é a melhor compra e a tabela acima mostra a diferença. A placa de 80 GB também lê mais rápido — 1.935 GB/s contra 1.555 — então se você está perto do teto em capacidade ou throughput, leve a maior.

Qual versão de driver e CUDA eu recebo?

A que você instalar. A máquina chega com um sistema operacional limpo e root, e você fixa o driver, a versão do CUDA e o build do framework no que seu código foi testado. Nada é atualizado por baixo de você. Se preferir que o driver seja instalado antes da entrega, diga isso no pedido e informe a versão.

Em quanto tempo posso ter uma?

Essas são as peças com maior probabilidade de serem compradas sob encomenda em vez de instaladas do estoque, e você é informado disso antes de pagar, não depois. Um acelerador de geração atual sob alocação é o maior prazo de entrega que cotamos. /instant lista máquinas em rack prontas agora.