Aceleradores AMD Instinct

AMD Instinct em uma máquina que ninguém mais tem

Dois aceleradores AMD entram em nossos servidores dedicados: o Instinct MI210 e o Instinct MI50. A placa é passada diretamente para o seu próprio sistema operacional — sua compilação ROCm, seu kernel, seus processos, e nenhum hypervisor no meio.

MI210: 104 unidades de computação CDNA 2, 64 GB HBM2e. MI50: 60 unidades de computação GCN 5.1, 16 GB. Um locatário por máquina. Sem fatiamento, sem compartilhamento de tempo.

Cada placa que instalamos — AMD e NVIDIA, atuais e há muito fora de produção — está listada com seu próprio preço mensal no catálogo de GPUs.

Transforme suas GPUs em receita mensal passiva

Tem configurações de GPU de servidor ou desktop ociosas? Anuncie-as hoje no marketplace da Primcast e ganhe aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação de nível de produção.

Ir para o Marketplace

O que um servidor AMD Instinct aqui realmente é

Um servidor físico alugado para uma conta, com um acelerador AMD em um slot PCIe e root no sistema operacional acima dele. A placa é uma linha na fatura, não um nível de produto, então a máquina por baixo não fica mais cara por causa do que está conectado a ela.

A placa é sua

Sem partição, sem vGPU, sem agendador decidindo quando é a sua vez. O acelerador é entregue diretamente ao seu kernel, então você fixa sua própria versão do ROCm e carrega seus próprios módulos sem nos perguntar.

ROCm, HIP e os frameworks usuais

Ambas as peças são alvos ROCm suportados — gfx90a para o MI210, gfx906 para o MI50 — que é o que PyTorch, TensorFlow, JAX e ONNX Runtime usam como base na AMD. O HIP porta o código-fonte CUDA em vez de exigir uma reescrita.

Preço separado da máquina

O acelerador tem seu próprio valor mensal e o servidor tem outro, e você soma os dois. Troque a placa sem trocar de servidor. Ambos os valores, para cada placa do catálogo, estão na página de GPUs.

Os dois aceleradores AMD Instinct que instalamos

Ambos podem ser encomendados hoje no mesmo configurador, em linhas de servidor diferentes. Os números abaixo são os publicados pela própria AMD.

Acelerador AMD Instinct MI210

AMD Instinct MI210

A geração CDNA 2 em uma placa PCIe padrão de altura total, comprimento total e slot duplo — 104 unidades de computação, 64 GB de HBM2e a até 1,6 TB/s e até três links Infinity Fabric para tráfego direto placa a placa. Resfriamento passivo a 300 W em um link de host PCIe Gen 4. É esta que você deve pedir quando a questão toda é se o modelo cabe na memória.

AMD Instinct MI50

A peça mais antiga da geração Vega: silício GCN 5.1, 60 unidades de computação e 16 GB de memória no pacote. Ninguém mais aluga esta placa, o que a torna inacessível em outros lugares em vez de meramente barata aqui — e ela ainda é um alvo ROCm suportado, então roda o mesmo código HIP e PyTorch do MI210 por uma fração do valor mensal. É a maneira sensata de fazer uma cadeia de ferramentas ROCm funcionar antes de se comprometer com a placa grande.

Throughput de matriz no MI210

A AMD publica 181,0 TFLOPS de pico de desempenho de matriz FP16 e BF16 para o MI210 em seu clock de boost de pico de 1.700 MHz, junto com 22,6 TFLOPS de pico de vetor FP64 e FP32.

A memória é a restrição

64 GB comportam os pesos de um modelo de 30 bilhões de parâmetros em 8 bits, ou de 13 bilhões em 16 bits, com espaço sobrando para o cache KV. Dimensionar um modelo é uma questão à parte, e a página de LLM faz essa aritmética em cada precisão.

O que o host dá à placa

A geração da pista do host é o fato que quase ninguém publica e o que decide se uma placa roda em sua largura de banda de projeto. Publicamos a nossa ao lado de cada placa, na página de GPUs.

Nada conta os bytes

Pesos entram, checkpoints saem, conjuntos de dados entram. A porta não é medida, então uma execução de treinamento que transmite um corpus não chega como uma conta de largura de banda no fim do mês.

Servidores dedicados de nível empresarial para placas AMD Instinct™

HPE, Dell ou Supermicro

Sua placa AMD Instinct™ entra em um servidor HPE, Dell ou Supermicro, dependendo da linha em que você a encomendar. O MI210 também pode ser instalado em um servidor AMD EPYC montado sob encomenda, e os servidores dedicados AMD têm o preço de cada um desses processadores definido por núcleo.

Upgrades de hardware

Adicione facilmente recursos ou servidores adicionais à sua infraestrutura de servidores. A maioria dos upgrades é processada em até 24 horas.

Suporte 24/7

Especialistas em servidores dedicados estão disponíveis para ajudar 24/7 via chat ao vivo e e-mail.

O MI210 contra as placas NVIDIA que também instalamos

Quatro aceleradores do mesmo catálogo de pedidos, então isto compara peças que você pode de fato colocar no mesmo carrinho. Sem valores mensais aqui de propósito: o catálogo de GPUs os lê do catálogo de pedidos no momento da solicitação, e um valor digitado nesta tabela pode ficar desatualizado.

MI210 L40S A100 H100
Arquitetura da GPU CDNA 2 Ada Lovelace NVIDIA Ampere Hopper
Memória da GPU 64GB HBM2e 48GB GDDR6 com ECC 80GB HBM2e 80GB HBM2e
Largura de banda da memória da GPU Até 1,6 TB/s 864 GB/s 1935 GB/s 2039 GB/s
FP32 22,6 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
Núcleo Tensor TF32 — 366 TFLOPS 312 TFLOPS 756 TFLOPS
Matriz FP16/BF16 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Potência Até 300W Até 350W Até 300W Até 350W

TF32 é um formato de núcleo tensor da NVIDIA. O CDNA 2 não o implementa e a AMD não publica nenhum número para ele, então a coluna do MI210 não mostra nada ali em vez de um número emprestado de outro fornecedor. As linhas de núcleo tensor da NVIDIA são os números publicados com esparsidade. Todas as outras placas que instalamos, incluindo o MI50, têm preço no catálogo de GPUs.

Perguntas frequentes sobre servidores GPU AMD Instinct

Perguntas comuns sobre implantação e gerenciamento de aceleradores AMD Instinct em bare metal para cargas de trabalho de IA, HPC e aprendizado de máquina.

Quais aceleradores AMD Instinct posso realmente encomendar?

Dois: o Instinct MI210 e o Instinct MI50. Esses são os aceleradores AMD em nosso catálogo de pedidos, e o configurador não oferecerá mais nada da linha Instinct. O MI210 vai em três de nossas linhas de servidor e o MI50 em duas. Não instalamos o MI250, o MI250X ou o MI300A, e nunca instalamos.

Qual é a diferença entre o MI210 e o MI50?

Geração e memória. O MI210 é a arquitetura CDNA 2 da AMD com 104 unidades de computação e 64 GB de HBM2e a até 1,6 TB/s, em uma placa PCIe de slot duplo que consome até 300 W em um link de host PCIe Gen 4, com até três links Infinity Fabric para tráfego placa a placa. O MI50 é a geração anterior GCN 5.1 com 60 unidades de computação e 16 GB. Ambos são alvos ROCm suportados, então o mesmo código HIP e PyTorch roda em qualquer um — o MI210 simplesmente comporta quatro vezes mais de um modelo.

Quanta memória de placa o modelo que quero executar precisa?

Só os pesos são parâmetros multiplicados por bytes por parâmetro: cerca de 16 GB para um modelo de 7 a 8 bilhões de parâmetros em 16 bits, 28 GB para 13 a 14 bilhões, 68 GB para 30 a 34 bilhões. O cache KV e o runtime vão por cima disso, e é por isso que uma placa de 16 GB não serve confortavelmente um modelo cujos pesos são de 16 GB. Os 64 GB do MI210 cobrem um modelo de 30 bilhões quantizado para 8 bits com espaço para trabalhar. A página de dimensionamento de LLM tem a tabela completa — quanta memória cada tamanho de modelo precisa e qual placa a atende.

Quanto tempo leva para implantar um servidor GPU AMD Instinct?

Onde a máquina já está montada no rack, ela normalmente é ativada cerca de 30 minutos após o pagamento ser compensado. Onde não está, ela é montada sob encomenda e o prazo depende das peças. Pergunte antes de pagar se a data importa — servidores instantâneos é a página do que está em um rack agora. Todo servidor inclui recarga instantânea do SO, para você iterar sem reabrir um ticket.

Quais softwares e frameworks rodam nessas placas?

ROCm, a plataforma de computação GPU de código aberto da AMD. Ambas as peças são alvos ROCm suportados — gfx90a no MI210, gfx906 no MI50 — o que cobre PyTorch, TensorFlow, JAX e ONNX Runtime, junto com as bibliotecas primitivas BLAS, FFT, RNG e de aprendizado profundo. O HIP porta o código-fonte CUDA existente em vez de exigir uma reescrita. Como você tem root no bare metal, escolhe você mesmo as versões do ROCm e do kernel, e pode rodar tudo em Docker ou sob Kubernetes.