H100 80 GB · A100 80 GB · A100 40 GB

Os aceleradores — e o que eles não farão

Três placas projetadas para uma única tarefa: armazenar um modelo e realizar cálculos aritméticos com ele, mais rápido do que qualquer outra coisa aqui. Elas possuem memória empilhada, correção de erros e a capacidade de compartilhar recursos entre si. Não possuem saída de vídeo nem codificador de vídeo — pelo menos não um lento — e saber disso antes de comprar vale mais do que qualquer benchmark nesta página.

40 e 80 GB Memória empilhada, ECC Sem codificador de vídeo

Duas coisas que surpreendem as pessoas

Eles não conseguem codificar vídeo. De jeito nenhum.

A matriz de suporte de codificação e decodificação da própria NVIDIA registra zero mecanismos NVENC no A100 e zero no H100. Eles decodificam — cinco mecanismos no A100, sete no H100 — mas não há codificador na placa, então cada quadro produzido por essas placas precisa ser codificado pelo processador. Se o seu fluxo de trabalho envolve vídeo, este não é o modelo ideal, e o L40S, com seus três codificadores AV1, é o correto. Isso está na página /l40s .

Essas placas também não possuem saídas de vídeo. São componentes de computação sem monitor. Nada que dependa de um framebuffer — uma área de trabalho virtual, uma estação de trabalho remota, um servidor de jogos — deve ser executado nelas.

O A100 não está obsoleto e o cartão de 40 GB não é um erro.

O A100 é da geração anterior e lê seus dados a 1.555 GB/s com 40 GB e 1.935 GB/s com 80 GB. Para um modelo adequado, essa taxa de leitura é o que determina quantos tokens por segundo você obtém, e continua muito à frente de qualquer outro cartão não-empilhado no catálogo. O cartão de 40 GB suporta confortavelmente um modelo de trinta bilhões de parâmetros com precisão de oito bits, que é o que a maioria dos servidores realmente utiliza, por uma fração do custo mensal do H100.

Compre a H100 quando o modelo realmente precisar do Hopper — o mecanismo Transformer, FP8, as unidades Tensor mais recentes — ou quando a impressão precisar terminar mais rápido, em vez de apenas concluir a impressão. Compre uma A100 quando a questão for se ela cabe no seu dispositivo e qual a velocidade de leitura, que é a pergunta mais comum.

As especificações, conforme publicadas

Os dados são provenientes das fichas técnicas da NVIDIA e das tabelas de especificações da Tesla, citadas na fonte desta página. Quando não foi possível encontrar um valor específico para a peça que utilizamos, esta página não exibe nenhum dado, em vez de uma estimativa.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

O H100 não mostra contagem de núcleos nem largura de banda acima, e isso é intencional. Nossa peça está registrada na loja com uma contagem de núcleos pertencente ao módulo SXM, que é uma placa parafusada à placa-mãe em vez de encaixada em um slot; a memória HBM2e de 80 GB também registrada pertence à placa PCIe, que é o que de fato vai nesses computadores. Em vez de escolher uma e imprimir com certeza, a página imprime a memória com a qual ambas as fontes concordam e omite o restante. Pergunte-nos e diremos exatamente qual placa vai no seu computador.

Em que eles são bons

Um trabalho, executado melhor do que qualquer outro neste site.

Leitura rápida de pesos

A memória empilhada é o diferencial entre este chassi e todos os outros. Uma vez que um modelo está instalado, a velocidade de geração é determinada pela rapidez com que o cartão consegue ler seus próprios pesos, e estes leem de uma vez e meia a duas vezes mais rápido do que o cartão não empilhado mais rápido que instalamos.

Agrupando em um único espaço de endereçamento

Essas peças possuem NVLink, então duas delas em uma mesma máquina podem funcionar como um único pool maior, em vez de dois separados. As placas para estações de trabalho e para consumidores disponíveis no catálogo não oferecem essa funcionalidade. Trata-se de uma configuração que orçamos, e não de uma opção de compra avulsa.

Funcionando por semanas sem supervisão

Correção de erros em todo o sistema e hardware projetado para carga contínua, em vez de picos de uso. Para um treinamento que dura semanas e envolve investimento financeiro real, isso não é um luxo.

Sendo só sua

Um único inquilino por máquina física e a placa de vídeo é passada diretamente — sem partição MIG, sem perfil vGPU, sem agendador de fatiamento de tempo e sem nenhuma outra tarefa nela. Em outros lugares, uma "instância A100" geralmente é uma fatia de uma única instância.

Os três lado a lado, e o que está acima deles

Diretamente das nossas prateleiras. Todos esses modelos podem ser encomendados hoje, no mesmo chassi, então a questão é qual deles vale a diferença.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

A última linha está lá porque representa a comparação honesta, e a maioria das listas a esconde: a RTX PRO 6000 Blackwell possui 96 GB de memória, mais do que qualquer acelerador nesta página. Compare a memória e o preço dela com os da H100 na tabela acima, em vez de confiar apenas na nossa palavra. Ela perde em velocidade de leitura e NVLink; ganha em quatro codificadores de vídeo e ray tracing. Se a sua dúvida é se ela cabe no seu gabinete , leia /rtx60 antes de decidir por esta placa.

Em qual máquina eles entram e qual link eles acessam?

A placa A100 é PCIe Gen 4 e a H100 é Gen 5, enquanto nossas plataformas são Gen 3 e Gen 4. Portanto, a H100 nunca utiliza todo o barramento para o qual foi projetada em nenhuma máquina que utilizamos, e esta página informa isso em vez de deixar você descobrir por conta própria.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

Se isso lhe custará algo depende inteiramente do tipo de trabalho. Um endpoint de inferência cujos pesos estão residentes mal utiliza o slot e não será afetado. Um loop de treinamento que transmite um novo lote da memória do host a cada passo será afetado em cada passo. Se você não tiver certeza de qual é o seu caso, informe-nos qual é o trabalho antes de fazer o pedido — isso determina a máquina, não a placa.

O que realmente cabe em 80 GB?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

O A100 de 40 GB comporta a mesma tabela um nível abaixo: um modelo de trinta a trinta e quatro bilhões de parâmetros com precisão de oito bits cabe, o mesmo modelo com dezesseis bits não. Um modelo de setenta bilhões com dezesseis bits não cabe em nenhuma placa individual que vendemos — isso requer uma configuração com duas placas, e é por isso que a linha NVLink acima é importante.

O custo deles, incluindo as máquinas em que são instalados.

O cartão é uma linha na fatura e a máquina é outra. Ambas as metades abaixo provêm de uma única leitura do catálogo de pedidos, portanto o preço e a especificação ao lado sempre pertencem um ao outro.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

A largura de banda é ilimitada em ambas as direções, sem cobrança de saída, que geralmente é o maior custo oculto em outros lugares — uma execução de treinamento que baixa um conjunto de dados e envia checkpoints transfere muitos bytes, e a saída é cobrada por gigabyte. Um endereço IPv4 está incluído, não há contrato e o prazo padrão é de um mês. Para todos os outros cartões que instalamos, com preços semelhantes, consulte o catálogo completo . Para máquinas prontas para instalação hoje, /instant .

Perguntas que as pessoas realmente fazem sobre esses cartões.

Posso transcodificar vídeo em uma A100 ou em uma H100?

Não em termos de hardware. Nenhuma das placas possui um codificador — a matriz de suporte da NVIDIA registra zero mecanismos NVENC em ambas — então a codificação fica a cargo do processador e é executada na velocidade do processador. Elas decodificam, então um pipeline que lê vídeo e produz algo diferente de vídeo funciona bem. Se você precisar de frames de saída, a L40S possui três codificadores AV1 e é muito mais barata: /l40s .

O cartão foi dividido em instâncias MIG?

Não por nossa conta. Você recebe a placa física completa, que é transferida para o seu próprio sistema operacional, em uma máquina sem nenhum outro dispositivo conectado. Essas placas suportam MIG, então você pode particioná-las se quiser; essa é uma decisão sua, tomada em sua própria máquina, e não algo que é feito antes de o produto chegar até você. Vale a pena verificar isso em outros lugares onde você for comprar — muitas ofertas de "A100" são apenas uma parte da placa.

A100 40 GB ou 80 GB?

Primeiro a capacidade, depois a velocidade de leitura. Se o modelo e o contexto permitirem 40 gigabytes com um quinto de sobra, o cartão menor é a melhor compra, e a tabela acima mostra a diferença. O cartão de 80 GB também lê mais rápido — 1.935 GB/s contra 1.555 GB/s — então, se você estiver perto do limite de capacidade ou de velocidade de leitura, escolha o maior.

Qual driver e versão do CUDA devo usar?

Qualquer que seja a versão que você instalar. A máquina chega com um sistema operacional e root limpos, e você define o driver, a versão do CUDA e a compilação do framework para a mesma versão com a qual seu código foi testado. Nada será atualizado automaticamente. Se preferir que o driver seja instalado antes da entrega, especifique isso no pedido e informe a versão desejada.

Em quanto tempo posso receber um?

Essas são as peças com maior probabilidade de serem compradas em vez de instaladas a partir do estoque, e você é informado quais serão antes do pagamento, e não depois. Um acelerador de última geração sob encomenda é o item com o maior prazo de entrega que informamos. /instant lista as máquinas disponíveis e prontas para uso imediato.