Tomadas de lo que la gente nos pregunta realmente en el chat y en los tickets, aproximadamente en el orden en que lo preguntan. Las tres primeras son las que deciden si una compra funciona.
- ¿Cuánta memoria de GPU necesita un modelo de lenguaje grande?
- Los pesos son el número de parámetros multiplicado por los bytes por parámetro: dos bytes cada uno a 16 bits, uno a 8 bits, medio a 4 bits. Un modelo de 7–8 mil millones de parámetros son 16 GB de pesos a 16 bits, 8 GB a 8 bits y 5 GB a 4 bits; un modelo de 70 mil millones de parámetros son 140 GB, 70 GB y 38 GB. Esas cifras son solo los pesos y son un mínimo más que un requisito — reserve entre un cuarto y la mitad más para el tiempo de ejecución, las activaciones y la caché clave-valor.
- ¿Qué necesito para ejecutar un modelo de 70B como Llama 3.3?
- A 4 bits los pesos son unos 38 GB, así que con margen para servir la respuesta es una tarjeta de 64 GB o más — una tarjeta, una máquina. A 8 bits los pesos son 70 GB y una tarjeta de 80 GB supera el listón. A precisión completa de 16 bits ninguna tarjeta individual de las que instalamos lo soporta, y se convierte en una configuración de varias tarjetas que cotizamos. La Fig. 3 de arriba nombra las tarjetas exactas; los precios están en servidores dedicados con GPU.
- ¿Por qué mi modelo carga pero no llega a servir?
- Porque los pesos no son lo único en la memoria de la tarjeta. El tiempo de ejecución y sus búferes están residentes, y cada token de una conversación deja una entrada en la caché clave-valor para que no haya que recalcularlo. Esa caché crece con la longitud del contexto y de nuevo con cada solicitud servida simultáneamente, de modo que un modelo cuyos pesos apenas caben mantendrá aproximadamente una conversación corta. Dimensiona la tarjeta entre una vez y cuarto y una vez y media los pesos.
- ¿Qué tiempo de ejecución de inferencia puedo instalar?
- Cualquiera. La máquina llega con un sistema operativo limpio y root, y no hay ningún servicio de inferencia del proveedor por delante. vLLM es la respuesta habitual para servir tráfico real porque el procesamiento por lotes continuo permite que una tarjeta responda a muchas solicitudes a la vez. llama.cpp es la respuesta habitual cuando la memoria es escasa o la tarjeta es más antigua. TGI y SGLang se ejecutan sin cambios. Ollama es el camino más corto desde una máquina vacía hasta un modelo que responde en un puerto — y tanto vLLM como Ollama responden en un endpoint compatible con OpenAI, de modo que el código de cliente existente apunta a tu propia máquina cambiando una única URL base. Tú fijas el controlador, la versión de CUDA o ROCm y el framework a las versiones contra las que se probó tu código.
- ¿Alojar un LLM uno mismo es más barato que una API por token?
- Depende por completo del volumen, y el punto de cruce es real: una API factura por token y no cuesta nada en reposo; una máquina dedicada es una cifra mensual fija y no cuesta nada más cuando está ocupada. El tráfico constante, los agentes que funcionan todo el día, los pipelines por lotes y cualquier cosa con un requisito de privacidad suelen salir ganando con hardware propio; una carga de trabajo que se dispara diez veces al día no. Las cifras mensuales para hacer esa aritmética están en servidores dedicados con GPU — esta ficha deliberadamente no pone precio a nada.
- ¿Cuántos tokens por segundo obtendré?
- No publicamos una cifra de tokens por segundo, porque cada número de ese tipo depende del modelo, la cuantización, el tiempo de ejecución y su versión, el tamaño del lote, la longitud del prompt, la longitud de la respuesta y la concurrencia, y cambiar cualquiera de ellos lo mueve por un múltiplo. Lo que lo gobierna: leer el prompt está limitado por cómputo y ocurre una vez por solicitud; generar la respuesta está limitado por el ancho de banda de memoria porque cada token requiere leer los pesos; y el procesamiento por lotes amortiza esa lectura entre solicitudes concurrentes, que es lo que hace que servir sea económico hasta que la caché clave-valor se queda sin espacio. Pregunta con el modelo, la cuantización y la concurrencia esperada para obtener una respuesta basada en lo que realmente hemos observado.
- ¿La GPU se comparte con alguien más?
- No. Un inquilino por máquina física, y la tarjeta se pasa directamente a tu propio sistema operativo. No hay hipervisor, ni partición MIG, ni perfil vGPU, ni planificador de división de tiempo, de modo que nada más se ejecuta en la tarjeta y la latencia de inferencia no se mueve por el trabajo por lotes de otra persona.
- ¿Qué pasa si el modelo no cabe en una sola tarjeta?
- Entonces es una configuración de varias tarjetas, que se cotiza en lugar de pedirse desde un carrito: cuántas tarjetas caben depende del ancho físico de la tarjeta específica y del presupuesto de energía del chasis. Dos tarjetas te dan la suma de su memoria solo si el tiempo de ejecución puede dividir el modelo entre ambas, algo que todo tiempo de ejecución serio admite con cierto coste en rendimiento. Más de una tarjeta o máquina cubre cómo es esa configuración.
- ¿El ajuste fino necesita más memoria que servir?
- Bastante más. Servir necesita los pesos; entrenar necesita los pesos, los gradientes y el estado del optimizador de cada parámetro que se actualiza, todo residente a la vez, más las activaciones guardadas para el paso hacia atrás. Un modelo que sirve cómodamente en una tarjeta puede ser varias veces demasiado grande para ajustarlo por completo en ella. Los métodos eficientes en parámetros actualizan una fracción pequeña de los parámetros y necesitan una fracción correspondientemente pequeña de la memoria adicional, que es la razón por la que la mayoría del ajuste fino aquí usa uno.
- ¿Puedo usar una tarjeta AMD y funciona ROCm?
- Sí. Las piezas AMD Instinct están entre las tarjetas de mayor memoria que instalamos y con frecuencia son el mejor valor por gigabyte, pero tu stack tiene que admitir ROCm en lugar de CUDA. La mayoría de los tiempos de ejecución de inferencia actuales lo hacen; algunas herramientas circundantes todavía no. Pregunta antes de pedir y lo comprobaremos contra tu tiempo de ejecución específico en lugar de responder en general.