Aceleradores AMD Instinct

AMD Instinct en una máquina en la que nadie más está

Dos aceleradores AMD van en nuestros servidores dedicados: el Instinct MI210 y el Instinct MI50. La tarjeta se pasa directamente a tu propio sistema operativo — tu compilación de ROCm, tu kernel, tus procesos, y sin hipervisor de por medio.

MI210: 104 unidades de cómputo CDNA 2, 64 GB HBM2e. MI50: 60 unidades de cómputo GCN 5.1, 16 GB. Un solo inquilino por máquina. Sin particiones, sin tiempo compartido.

Cada tarjeta que instalamos — AMD y NVIDIA, actuales y fuera de producción desde hace tiempo — aparece con su propio precio mensual en el catálogo de GPU.

Convierte tus GPU en ingresos mensuales pasivos

¿Tienes configuraciones de GPU de servidor o de escritorio sin usar? Anúncialas hoy en el marketplace de Primcast y obtén rentas mensuales estables de equipos de IA, desarrolladores y empresas que necesitan cómputo de nivel de producción.

Ir al Marketplace

Qué es realmente un servidor AMD Instinct aquí

Un servidor físico alquilado a una sola cuenta, con un acelerador AMD en una ranura PCIe y acceso root al sistema operativo que corre encima. La tarjeta es una línea en la factura y no un nivel de producto, así que la máquina subyacente no se encarece por lo que tenga enchufado.

La tarjeta es tuya

Sin particiones, sin vGPU, sin un planificador que decida cuándo te toca. El acelerador se entrega directamente a tu kernel, así que fijas tu propia versión de ROCm y cargas tus propios módulos sin pedirnos permiso.

ROCm, HIP y los frameworks habituales

Ambas piezas son objetivos ROCm compatibles — gfx90a para la MI210, gfx906 para la MI50 — que es contra lo que PyTorch, TensorFlow, JAX y ONNX Runtime compilan en AMD. HIP porta el código fuente CUDA sin exigir una reescritura.

Precio aparte de la máquina

El acelerador tiene su propia cifra mensual y el servidor otra, y sumas las dos. Cambia la tarjeta sin cambiar de servidor. Ambas cifras, para cada tarjeta del catálogo, están en la página de GPU.

Los dos aceleradores AMD Instinct que instalamos

Ambos se pueden pedir hoy desde el mismo configurador, en líneas de servidor distintas. Las cifras de abajo son las publicadas por la propia AMD.

Acelerador AMD Instinct MI210

AMD Instinct MI210

La generación CDNA 2 en una tarjeta PCIe estándar de altura completa, longitud completa y doble ranura — 104 unidades de cómputo, 64 GB de HBM2e a hasta 1,6 TB/s y hasta tres enlaces Infinity Fabric para tráfico directo entre tarjetas. Refrigeración pasiva a 300 W sobre un enlace de host PCIe Gen 4. Esta es la que hay que pedir cuando la única pregunta es si el modelo cabe en memoria.

AMD Instinct MI50

La pieza más antigua de la generación Vega: silicio GCN 5.1, 60 unidades de cómputo y 16 GB de memoria integrada en el paquete. Ya nadie alquila esta tarjeta, lo que la hace inencontrable en otros sitios en lugar de simplemente barata aquí — y sigue siendo un objetivo ROCm compatible, así que ejecuta el mismo código HIP y PyTorch que la MI210 por una fracción de la cifra mensual. Es la forma sensata de poner en marcha una cadena de herramientas ROCm antes de comprometerse con la tarjeta grande.

Rendimiento de matriz en la MI210

AMD publica 181,0 TFLOPS de pico en FP16 y BF16 para la MI210 a su reloj de impulso máximo de 1.700 MHz, junto con 22,6 TFLOPS de pico en FP64 y FP32 vectorial.

La memoria es la limitación

64 GB albergan los pesos de un modelo de 30 mil millones de parámetros a 8 bits, o de 13 mil millones a 16 bits, con espacio de sobra para la caché KV. La página de GPU desarrolla esa aritmética para cada tamaño de modelo.

Lo que el host le da a la tarjeta

La generación del carril del host es el dato que casi nadie publica y el que decide si una tarjeta funciona a su ancho de banda de diseño. Nosotros publicamos el nuestro junto a cada tarjeta, en la página de GPU.

Nada cuenta los bytes

Pesos que entran, checkpoints que salen, conjuntos de datos que entran. El puerto no está medido, así que un entrenamiento que transmite un corpus no llega como factura de ancho de banda a fin de mes.

Servidores dedicados de nivel empresarial HPE impulsados por AMD Instinct™

HPE enterprise

Tu servidor dedicado con GPU AMD INSTINCT™ está impulsado por servidores HPE Enterprise, lo que garantiza un rendimiento estable para las cargas de trabajo más exigentes.

Actualizaciones de hardware

Añade fácilmente recursos o servidores adicionales a tu infraestructura. La mayoría de las actualizaciones se procesan en un plazo de 24 horas.

Soporte 24/7

Expertos en servidores dedicados están disponibles para ayudarte 24/7 por chat en vivo y correo electrónico.

La MI210 frente a las tarjetas NVIDIA que también instalamos

Cuatro aceleradores del mismo catálogo de pedidos, así que esto compara piezas que realmente puedes poner en la misma cesta. Las cifras mensuales de la última fila se leen de ese catálogo cuando se carga la página.

MI210 L40S A100 H100
Arquitectura de GPU CDNA 2 Ada Lovelace NVIDIA Ampere Hopper
Memoria de GPU 64 GB HBM2e 48 GB GDDR6 con ECC 80 GB HBM2e 80 GB HBM3
Ancho de banda de memoria de GPU Hasta 1,6 TB/s 864 GB/s 1935 GB/s 3352 GB/s
FP32 22,6 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
Núcleo tensorial TF32 366 TFLOPS 312 TFLOPS 756 TFLOPS
Matriz FP16/BF16 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Potencia Hasta 300 W Hasta 350 W Hasta 400 W Hasta 350 W
Cargando... Cargando... Cargando... Cargando...

TF32 es un formato de núcleo tensorial de NVIDIA. CDNA 2 no lo implementa y AMD no publica ninguna cifra al respecto, así que la columna de la MI210 no muestra nada ahí en lugar de un número tomado de otro fabricante. Las filas de núcleos tensoriales de NVIDIA son las cifras publicadas con dispersión. Todas las demás tarjetas que instalamos, incluida la MI50, tienen precio en el catálogo de GPU.

Preguntas frecuentes sobre servidores GPU AMD Instinct

Preguntas habituales sobre el despliegue y la gestión de aceleradores AMD Instinct en bare metal para cargas de trabajo de IA, HPC y aprendizaje automático.

¿Qué aceleradores AMD Instinct puedo pedir realmente?

Dos: el Instinct MI210 y el Instinct MI50. Esos son los aceleradores AMD de nuestro catálogo de pedidos, y el configurador no te ofrecerá nada más de la línea Instinct. La MI210 va en tres de nuestras líneas de servidor y la MI50 en dos. No instalamos la MI250, la MI250X ni la MI300A, y nunca lo hemos hecho.

¿Cuál es la diferencia entre la MI210 y la MI50?

Generación y memoria. La MI210 es la arquitectura CDNA 2 de AMD con 104 unidades de cómputo y 64 GB de HBM2e a hasta 1,6 TB/s, en una tarjeta PCIe de doble ranura que consume hasta 300 W sobre un enlace de host PCIe Gen 4, con hasta tres enlaces Infinity Fabric para tráfico entre tarjetas. La MI50 es la generación anterior GCN 5.1 con 60 unidades de cómputo y 16 GB. Ambas son objetivos ROCm compatibles, así que el mismo código HIP y PyTorch corre en cualquiera de las dos — la MI210 simplemente alberga cuatro veces más de un modelo.

¿Cuánta memoria de tarjeta necesita el modelo que quiero ejecutar?

Solo los pesos son parámetros multiplicados por bytes por parámetro: aproximadamente 16 GB para un modelo de 7-8 mil millones de parámetros a 16 bits, 28 GB para 13-14 mil millones, 68 GB para 30-34 mil millones. La caché KV y el tiempo de ejecución van encima de eso, por lo que una tarjeta de 16 GB no sirve cómodamente un modelo cuyos pesos son de 16 GB. Los 64 GB de la MI210 cubren un modelo de 30 mil millones cuantizado a 8 bits con espacio para trabajar. La página de GPU tiene la tabla completa.

¿Cuánto tarda en desplegarse un servidor GPU AMD Instinct?

Cuando la máquina ya está en el rack, normalmente se activa unos 30 minutos después de que se confirme el pago. Cuando no lo está, se construye bajo pedido y el plazo depende de las piezas. Pregunta antes de pagar si la fecha importa — servidores instantáneos es la página de lo que está en un rack ahora mismo. Todos los servidores incluyen recarga instantánea del sistema operativo, para que puedas iterar sin volver a abrir un ticket.

¿Qué software y frameworks funcionan en estas tarjetas?

ROCm, la plataforma de cómputo GPU de código abierto de AMD. Ambas piezas son objetivos ROCm compatibles — gfx90a en la MI210, gfx906 en la MI50 — lo que cubre PyTorch, TensorFlow, JAX y ONNX Runtime, junto con las bibliotecas primitivas BLAS, FFT, RNG y de aprendizaje profundo. HIP porta el código fuente CUDA existente sin exigir una reescritura. Como tienes root en bare metal, eliges tú mismo las versiones de ROCm y del kernel, y puedes ejecutarlo todo en Docker o bajo Kubernetes.