Aceleradores AMD Instinct

AMD Instinct em uma máquina que ninguém mais tem

Dois aceleradores AMD equipam nossos servidores dedicados: o Instinct MI210 e o Instinct MI50. A placa é repassada diretamente ao seu próprio sistema operacional — sua compilação ROCm, seu kernel, seus processos, sem nenhum hypervisor no meio.

MI210: 104 unidades de computação CDNA 2, 64 GB HBM2e. MI50: 60 unidades de computação GCN 5.1, 16 GB. Um locatário por máquina. Sem fatiamento, sem compartilhamento de tempo.

Cada placa que instalamos — AMD e NVIDIA, atuais e há muito fora de produção — está listada com seu próprio preço mensal no catálogo de GPUs.

Transforme suas GPUs em receita mensal passiva

Tem servidores ou desktops com GPUs ociosas? Anuncie-os hoje no marketplace da Primcast e receba aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação de nível de produção.

Ir para o Marketplace

O que um servidor AMD Instinct aqui realmente é

Um servidor físico alugado para uma única conta, com um acelerador AMD em um slot PCIe e acesso root ao sistema operacional acima dele. A placa é uma linha na fatura, não um nível de produto, então a máquina por baixo não fica mais cara por causa do que está conectado a ela.

A placa é sua

Sem partição, sem vGPU, sem agendador decidindo quando é a sua vez. O acelerador é entregue diretamente ao seu kernel, então você fixa sua própria versão do ROCm e carrega seus próprios módulos sem nos perguntar.

ROCm, HIP e os frameworks usuais

Ambas as peças são alvos ROCm suportados — gfx90a para o MI210, gfx906 para o MI50 — que é o que PyTorch, TensorFlow, JAX e ONNX Runtime usam como base na AMD. O HIP porta código-fonte CUDA sem exigir uma reescrita.

Preço separado da máquina

O acelerador tem seu próprio valor mensal e o servidor tem outro, e você soma os dois. Troque a placa sem trocar de servidor. Ambos os valores, para cada placa do catálogo, estão na página de GPUs.

Os dois aceleradores AMD Instinct que instalamos

Ambos podem ser encomendados hoje no mesmo configurador, em linhas de servidor diferentes. Os números abaixo são os publicados pela própria AMD.

Acelerador AMD Instinct MI210

AMD Instinct MI210

A geração CDNA 2 em uma placa PCIe padrão de altura total, comprimento total e slot duplo — 104 unidades de computação, 64 GB de HBM2e a até 1,6 TB/s e até três links Infinity Fabric para tráfego direto entre placas. Resfriamento passivo a 300 W em um link de host PCIe Gen 4. É esta que você deve pedir quando a questão toda é se o modelo cabe na memória.

AMD Instinct MI50

A peça mais antiga da geração Vega: silício GCN 5.1, 60 unidades de computação e 16 GB de memória no pacote. Ninguém mais aluga esta placa, o que a torna inacessível em outros lugares em vez de meramente barata aqui — e ela ainda é um alvo ROCm suportado, então roda o mesmo código HIP e PyTorch que o MI210 por uma fração do valor mensal. É a maneira sensata de colocar uma cadeia de ferramentas ROCm funcionando antes de se comprometer com a placa grande.

Throughput de matriz no MI210

A AMD publica 181,0 TFLOPS de pico de desempenho de matriz FP16 e BF16 para o MI210 em seu clock de boost máximo de 1.700 MHz, juntamente com 22,6 TFLOPS de pico de vetor FP64 e FP32.

A memória é a restrição

64 GB comportam os pesos de um modelo de 30 bilhões de parâmetros em 8 bits, ou de 13 bilhões em 16 bits, com espaço restante para o cache KV. Dimensionar um modelo é uma questão à parte, e a página de LLM faz essa aritmética em cada precisão.

O que o host dá à placa

A geração da pista do host é o fato que quase ninguém publica e o que decide se uma placa opera em sua largura de banda de projeto. Publicamos a nossa ao lado de cada placa, na página de GPUs.

Nada conta os bytes

Pesos entrando, checkpoints saindo, conjuntos de dados entrando. A porta não é medida, então uma execução de treinamento que transmite um corpus não chega como uma conta de largura de banda no fim do mês.

Servidores dedicados de nível empresarial HPE com AMD Instinct™

Empresarial HPE

Seu servidor dedicado com GPU AMD INSTINCT™ é alimentado por servidores empresariais HPE, garantindo desempenho estável para as cargas de trabalho mais exigentes.

Upgrades de hardware

Adicione facilmente recursos ou servidores adicionais à sua infraestrutura. A maioria dos upgrades é processada em até 24 horas.

Suporte 24/7

Especialistas em servidores dedicados estão disponíveis 24/7 por chat ao vivo e e-mail.

O MI210 contra as placas NVIDIA que também instalamos

Quatro aceleradores do mesmo catálogo de pedidos, então isto compara peças que você pode de fato colocar no mesmo carrinho. Sem valores mensais aqui de propósito: o catálogo de GPUs os lê do catálogo de pedidos no momento da solicitação, e um valor digitado nesta tabela pode ficar desatualizado.

MI210 L40S A100 H100
Arquitetura da GPU CDNA 2 Ada Lovelace NVIDIA Ampere Hopper
Memória da GPU 64GB HBM2e 48GB GDDR6 com ECC 80GB HBM2e 80GB HBM3
Largura de banda da memória da GPU Até 1,6 TB/s 864 GB/s 1935 GB/s 3352 GB/s
FP32 22,6 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
Núcleo Tensor TF32 366 TFLOPS 312 TFLOPS 756 TFLOPS
Matriz FP16/BF16 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Potência Até 300W Até 350W Até 400W Até 350W

TF32 é um formato de núcleo tensor da NVIDIA. O CDNA 2 não o implementa e a AMD não publica nenhum número para ele, então a coluna do MI210 não mostra nada ali em vez de um número emprestado de outro fornecedor. As linhas de núcleo tensor da NVIDIA são os números publicados com esparsidade. Todas as outras placas que instalamos, incluindo o MI50, têm preço no catálogo de GPUs.

Perguntas frequentes sobre servidores com GPU AMD Instinct

Perguntas comuns sobre implantação e gerenciamento de aceleradores AMD Instinct em bare metal para cargas de trabalho de IA, HPC e aprendizado de máquina.

Quais aceleradores AMD Instinct posso realmente encomendar?

Dois: o Instinct MI210 e o Instinct MI50. Esses são os aceleradores AMD em nosso catálogo de pedidos, e o configurador não oferecerá mais nada da linha Instinct. O MI210 está disponível em três de nossas linhas de servidor e o MI50 em duas. Não instalamos o MI250, o MI250X ou o MI300A, e nunca instalamos.

Qual é a diferença entre o MI210 e o MI50?

Geração e memória. O MI210 é a arquitetura CDNA 2 da AMD com 104 unidades de computação e 64 GB de HBM2e a até 1,6 TB/s, em uma placa PCIe de slot duplo que consome até 300 W em um link de host PCIe Gen 4, com até três links Infinity Fabric para tráfego entre placas. O MI50 é a geração anterior GCN 5.1 com 60 unidades de computação e 16 GB. Ambos são alvos ROCm suportados, então o mesmo código HIP e PyTorch roda em qualquer um — o MI210 simplesmente comporta quatro vezes mais de um modelo.

Quanta memória de placa o modelo que quero executar precisa?

Só os pesos são parâmetros multiplicados por bytes por parâmetro: cerca de 16 GB para um modelo de 7 a 8 bilhões de parâmetros em 16 bits, 28 GB para 13 a 14 bilhões, 68 GB para 30 a 34 bilhões. O cache KV e o runtime vão por cima disso, e é por isso que uma placa de 16 GB não serve confortavelmente um modelo cujos pesos são 16 GB. Os 64 GB do MI210 cobrem um modelo de 30 bilhões quantizado para 8 bits com espaço para trabalhar. A página de dimensionamento de LLM tem a tabela completa — quanta memória cada tamanho de modelo precisa e qual placa dá conta.

Quanto tempo leva para implantar um servidor com GPU AMD Instinct?

Quando a máquina já está no rack, ela normalmente é ativada cerca de 30 minutos após a confirmação do pagamento. Quando não está, ela é montada sob encomenda e o prazo depende das peças. Pergunte antes de pagar se a data for importante — servidores instantâneos é a página do que está em um rack agora. Todo servidor inclui recarga instantânea do sistema operacional, para você iterar sem reabrir um chamado.

Quais softwares e frameworks rodam nessas placas?

ROCm, a plataforma de computação de GPU de código aberto da AMD. Ambas as peças são alvos ROCm suportados — gfx90a no MI210, gfx906 no MI50 — o que cobre PyTorch, TensorFlow, JAX e ONNX Runtime, juntamente com as bibliotecas primitivas BLAS, FFT, RNG e de aprendizado profundo. O HIP porta código-fonte CUDA existente sem exigir uma reescrita. Como você tem root no bare metal, escolhe as versões do ROCm e do kernel por conta própria e pode rodar tudo em Docker ou sob Kubernetes.