Servidores dedicados Ryzen AI • Inferencia sin tarjeta gráfica

Los modelos pequeños funcionan bien en una máquina Ryzen AI. Ese es el punto.

No toda carga de trabajo merece una tarjeta gráfica. Un modelo cuantizado de tamaño modesto responde desde la memoria del sistema en una máquina entera para usted solo — su runtime, sus versiones, root en el metal — sin pagar por silicio que el trabajo dejaría inactivo.

Convierta sus GPU en ingresos mensuales pasivos.

¿Tiene configuraciones de GPU de servidor o de escritorio inactivas? Publíquelas hoy en el marketplace de Primcast y obtenga rentas mensuales constantes de equipos de IA, desarrolladores y empresas que necesitan cómputo de grado producción.

Ir al Marketplace

Cuándo omitir la tarjeta es la decisión correcta

El mismo patrón cada vez: el modelo es pequeño, el tráfico es modesto y los datos deben permanecer en una máquina que no es de nadie más.

Asistente privado sobre documentos internos
Un ayudante privado sobre datos privados

Un modelo cuantizado pequeño que lee sus propios documentos para un puñado de colegas. El corpus nunca toca un endpoint compartido, y el costo mensual es una máquina, no un contador.

Redacción y resumen por lotes
Borradores, resúmenes, ejecuciones por lotes

Resúmenes nocturnos, etiquetado, reescritura — trabajo que se encola. Lo que importa allí es el costo por trabajo, no los milisegundos por token, y esa es la carga de trabajo en la que más se desperdicia una tarjeta gráfica.

Herramientas internas que llaman a un modelo
Herramientas que llaman a un modelo en silencio

Enrutamiento de tickets, clasificación de registros, extracción a una base de datos: un modelo pequeño detrás de un endpoint interno, encendido todo el día, a una tarifa plana que la hoja financiera puede leer.

Evaluación de la cadena de herramientas de la NPU
Probando las ruedas de la NPU

Ejecutar la cadena de herramientas XDNA de AMD contra silicio real, alquilado por mes, antes de que alguien firme por una flota de ellos. Lo que se niega a portar aparece aquí primero, y a bajo costo.

La compensación, expuesta con claridad

Estas máquinas son valor honesto para la carga de trabajo correcta y la compra equivocada para la incorrecta. Aquí está la línea entre ambas.

La memoria es la parte amplia

El modelo vive en la memoria propia de la máquina, medida en decenas de gigabytes en lugar de la asignación de una tarjeta. Lo que cabe rara vez es el problema en esta página.

El ancho de banda es la parte estrecha

Cada token generado vuelve a leer los pesos, y la memoria del sistema lee más lento que la memoria de la tarjeta. Un usuario con un modelo pequeño no lo notará; una cola de usuarios sí. No publicamos ninguna cifra de velocidad — ni aquí ni en ningún lado — y decimos esto en su lugar.

Preguntas antes de pedir una

Cuatro respuestas honestas — las mismas que dan nuestros ingenieros en el chat.

¿Puede un servidor realmente ejecutar un modelo de lenguaje sin tarjeta gráfica?

Sí, dentro de límites que vale la pena exponer desde el principio: un modelo cuantizado pequeño genera desde la memoria del sistema a ritmo de lectura, lo que conviene a un usuario, una herramienta interna o una cola de lotes — y no conviene a una multitud. Cuánta memoria necesita un modelo dado, y por qué uno que cabe puede aun así fallar al servir, es exactamente lo que nuestra página de LLM resuelve.

¿La NPU ejecuta mi modelo?

Puede hacerlo, a través de la cadena de herramientas Ryzen AI propia de AMD — pero la mayoría de los runtimes de modelos abiertos que la gente realmente implementa usan el procesador y la Radeon integrada en su lugar, y preferimos decirlo aquí antes que dejar que una hoja de especificaciones insinúe lo contrario. La NPU está en el chip de cualquier manera, y nada le impide apuntar a ella.

¿Cuándo vale la pena una GPU dedicada en su lugar?

Cuando el modelo crece más que la memoria, cuando varias personas necesitan respuestas a la vez, o cuando está ajustando finamente en lugar de servir. Ryzen AI o una GPU dedicada recorre esa decisión, y la página de GPU pone precio a cada tarjeta contra la máquina exacta en la que va.

¿Algo de esto se comparte con otros clientes?

No. Usted alquila la máquina completa: procesador, gráficos, NPU, memoria, disco y puerto pertenecen a un cliente a la vez, sin hipervisor debajo. Eso es gran parte de lo que compra la cifra mensual.