Aceleradores AMD Instinct

AMD Instinct em uma máquina que ninguém mais está usando.

Nossos servidores dedicados contam com dois aceleradores AMD: o Instinct MI210 e o Instinct MI50. A placa é totalmente integrada ao seu sistema operacional — sua compilação ROCm, seu kernel, seus processos, sem nenhum hipervisor intermediário.

MI210: 104 unidades de computação CDNA 2, 64 GB HBM2e. MI50: 60 unidades de computação GCN 5.1, 16 GB. Um inquilino por máquina. Sem divisão de espaço, sem compartilhamento de tempo.

Cada placa que instalamos — AMD e NVIDIA, atuais e antigas — está listada com seu próprio preço mensal no catálogo de GPUs .

Transforme suas GPUs em renda passiva mensal.

Tem servidores ou desktops com GPUs ociosas? Anuncie-os hoje mesmo no marketplace da Primcast e ganhe aluguéis mensais fixos de equipes de IA, desenvolvedores e empresas que precisam de computação de nível profissional.

Acesse o Marketplace

O que é, de fato, um servidor AMD Instinct?

Um servidor físico alugado para uma conta, com um acelerador AMD em um slot PCIe e o sistema operacional instalado via raiz. A placa é um item na fatura, e não um nível de produto, portanto o custo total da máquina não aumenta devido aos componentes conectados a ela.

O cartão é seu.

Sem partições, sem vGPU, sem agendador decidindo quando é a sua vez. O acelerador é entregue diretamente ao seu kernel, então você define sua própria versão do ROCm e carrega seus próprios módulos sem precisar nos consultar.

ROCm, HIP e as estruturas usuais

Ambas as partes são compatíveis com os alvos ROCm — gfx90a para o MI210, gfx906 para o MI50 — que são os alvos utilizados pelo PyTorch, TensorFlow, JAX e ONNX Runtime em placas AMD. O HIP utiliza o código-fonte CUDA em vez de exigir uma reescrita.

Preço à parte da máquina

O acelerador tem seu próprio valor mensal e o servidor tem outro, e você soma os dois. Troque a placa sem precisar trocar de servidor. Ambos os valores, para cada placa no catálogo, estão na página da GPU .

Os dois aceleradores AMD Instinct que instalamos

Ambos podem ser encomendados hoje mesmo através do mesmo configurador, em linhas de servidores diferentes. Os valores abaixo são os divulgados pela própria AMD.

Acelerador AMD Instinct MI210

AMD Instinct MI210

A segunda geração do CDNA em uma placa PCIe padrão de altura e comprimento totais, com dois slots — 104 unidades de computação, 64 GB de HBM2e com velocidade de até 1,6 TB/s e até três links Infinity Fabric para tráfego direto entre placas. Resfriamento passivo de 300 W por meio de um link de host PCIe Gen 4. Esta é a placa ideal quando a questão principal é se o modelo cabe na memória.

AMD Instinct MI50

A versão mais antiga da geração Vega: silício GCN 5.1, 60 unidades de computação e 16 GB de memória integrada. Ninguém mais aluga essa placa, o que a torna inatingível em outros lugares, e não apenas barata aqui — e ela ainda é um alvo ROCm suportado, então executa o mesmo código HIP e PyTorch que a MI210 por uma fração do valor mensal. É a maneira sensata de configurar um conjunto de ferramentas ROCm antes de investir na placa maior.

Taxa de transferência matricial no MI210

A AMD divulgou um desempenho máximo de 181,0 TFLOPS em matrizes FP16 e BF16 para o MI210, com um clock de boost máximo de 1.700 MHz, além de 22,6 TFLOPS em vetores FP64 e FP32.

A memória é a restrição.

64 GB armazenam os pesos de um modelo com 30 bilhões de parâmetros em 8 bits, ou de um modelo com 13 bilhões em 16 bits, com espaço restante para o cache KV. A página da GPU realiza esse cálculo para cada tamanho de modelo.

O que o anfitrião entrega no cartão

A geração de lanes do host é um fato que quase ninguém divulga e que determina se uma placa de vídeo opera em sua largura de banda projetada. Publicamos a nossa informação ao lado de cada placa, na página da GPU .

Nada conta os bytes

Pesos inseridos, pontos de verificação enviados, conjuntos de dados recebidos. A conexão é ilimitada, portanto, uma execução de treinamento que transmite um conjunto de dados não gera uma fatura de banda larga no final do mês.

Servidores dedicados de nível empresarial da HPE equipados com AMD Instinct™

Empresa HPE

Seu servidor dedicado com GPU AMD INSTINCT™ é equipado com a tecnologia dos servidores HPE Enterprise, garantindo desempenho estável mesmo para as cargas de trabalho mais exigentes.

Atualizações de hardware

Adicione recursos ou servidores adicionais à sua infraestrutura de servidores com facilidade. A maioria das atualizações é processada em até 24 horas.

Suporte 24 horas por dia, 7 dias por semana

Especialistas em servidores dedicados estão disponíveis para ajudar 24 horas por dia, 7 dias por semana, via chat ao vivo e e-mail.

O MI210 também é compatível com as placas NVIDIA que instalamos.

Quatro aceleradores do mesmo catálogo de pedidos, portanto, esta comparação inclui peças que você pode adicionar ao mesmo carrinho. Os valores mensais na última linha são lidos desse catálogo quando a página carrega.

MI210L40SA100H100
Arquitetura de GPUCDNA 2Ada LovelaceNVIDIA AmpereFunil
Memória da GPU64 GB HBM2e48 GB GDDR6 com ECC80 GB HBM2e80 GB HBM3
Largura de banda da memória da GPUAté 1,6 TB/s864 GB/s1935 GB/s3352 GB/s
FP3222,6 TFLOPS91,6 TFLOPS19,5 TFLOPS51 TFLOPS
Núcleo Tensor TF32366 TFLOPS312 TFLOPS756 TFLOPS
Matriz FP16/BF16181 TFLOPS733 TFLOPS624 TFLOPS1513 TFLOPS
PoderAté 300WAté 350WAté 400WAté 350W
Carregando...Carregando...Carregando...Carregando...

TF32 é um formato de núcleo tensor da NVIDIA. O CDNA 2 não o implementa e a AMD não publica nenhum valor para ele, portanto, a coluna MI210 não mostra nada, em vez de um número emprestado de outro fornecedor. As linhas de núcleo tensor da NVIDIA são os valores publicados com informações esparsas. Todas as outras placas que incluímos, incluindo a MI50, têm seus preços listados no catálogo de GPUs .

Perguntas frequentes sobre servidores com GPU AMD Instinct

Perguntas frequentes sobre a implementação e o gerenciamento de aceleradores AMD Instinct em servidores físicos para cargas de trabalho de IA, HPC e aprendizado de máquina.

Quais aceleradores AMD Instinct eu posso encomendar?

Duas opções: o Instinct MI210 e o Instinct MI50. Esses são os aceleradores AMD disponíveis em nosso catálogo de pedidos, e o configurador não oferece nenhuma outra opção da linha Instinct. O MI210 é compatível com três de nossas linhas de servidores e o MI50 com duas. Não oferecemos suporte para o MI250, o MI250X ou o MI300A, e nunca oferecemos.

Qual a diferença entre o MI210 e o MI50?

Geração e memória. O MI210 utiliza a arquitetura CDNA 2 da AMD com 104 unidades de computação e 64 GB de HBM2e, com velocidade de até 1,6 TB/s, em uma placa PCIe de dois slots que consome até 300 W através de um link PCIe Gen 4, com até três links Infinity Fabric para tráfego entre placas. O MI50 pertence à geração anterior, GCN 5.1, com 60 unidades de computação e 16 GB. Ambos são compatíveis com o ROCm, portanto, o mesmo código HIP e PyTorch funciona em qualquer um deles — o MI210 simplesmente comporta quatro vezes mais modelos.

De quanta memória de cartão o modelo que eu quero usar precisa?

Os pesos, por si só, são parâmetros multiplicados pelo número de bytes por parâmetro: aproximadamente 16 GB para um modelo de 7 a 8 bilhões de parâmetros em 16 bits, 28 GB para 13 a 14 bilhões e 68 GB para 30 a 34 bilhões. O cache KV e o tempo de execução são adicionados a essa quantidade, razão pela qual uma placa de 16 GB não é suficiente para um modelo cujos pesos ocupam 16 GB. Os 64 GB da MI210 são suficientes para um modelo de 30 bilhões de parâmetros quantizado em 8 bits, com folga para expansão. A página da GPU contém a tabela completa.

Quanto tempo leva para implantar um servidor com GPU AMD Instinct?

Quando a máquina já está instalada no rack, ela geralmente é ativada cerca de 30 minutos após a confirmação do pagamento. Caso contrário, ela é fabricada sob encomenda e o prazo de entrega depende das peças. Consulte a disponibilidade antes de efetuar o pagamento se a data for importante — a página "Servidores instantâneos" mostra os servidores que estão disponíveis no momento. Todos os servidores incluem reinstalação instantânea do sistema operacional, permitindo que você faça alterações sem precisar abrir um novo chamado.

Que softwares e frameworks são executados nessas placas?

ROCm, a plataforma de computação de GPU de código aberto da AMD. Ambas as partes são compatíveis com alvos ROCm — gfx90a no MI210, gfx906 no MI50 — que abrangem PyTorch, TensorFlow, JAX e ONNX Runtime, juntamente com as bibliotecas primitivas BLAS, FFT, RNG e de aprendizado profundo. O HIP porta o código-fonte CUDA existente em vez de exigir uma reescrita. Como você tem acesso root no hardware, você escolhe as versões do ROCm e do kernel e pode executar tudo em um contêiner Docker ou no Kubernetes.