Modelos de lenguaje en hardware físico · Primcast LLC · desde 2004

El modelo decide la memoria. Ningún otro elemento del formulario de pedido influye en ello.

La gente llega a esta página creyendo que la decisión se reduce a qué acelerador es el más rápido. No es así. Los pesos caben en la memoria de la tarjeta o no; una tarjeta con dos gigabytes menos no funciona más lento, simplemente no se carga. Por lo tanto, esta página sigue el orden en que se toma la decisión: qué tamaño tiene el modelo, con qué precisión se ejecutará, cuánto espacio necesita la conversación y solo entonces se determina qué tarjeta cumple con los requisitos. Los precios se encuentran en la página siguiente, deliberadamente.

¿Qué tarjeta gráfica utiliza mi modelo? Lo que le instalo

Un inquilino por máquina. La tarjeta se transfiere a su sistema operativo, y usted puede elegir y fijar las versiones del entorno de ejecución, el controlador y el marco de trabajo.

Paso uno

Lo que pesan realmente las pesas.

Los parámetros se multiplican por los bytes que ocupa cada parámetro, y ese es todo el cálculo. Los pesos de dieciséis bits ocupan dos bytes cada uno, los de ocho bits uno, y los de cuatro bits medio. Un modelo de siete mil millones de parámetros a dieciséis bits ocupa catorce gigabytes de pesos; el mismo modelo a cuatro bits ocupa entre tres y cuatro.

La cuantización transforma una máquina que no puede procesar un modelo en una que sí puede. Requiere calidad, y la magnitud de esta pérdida depende mucho más del modelo y del método empleado que del número de bits en sí. Un modelo de cuatro bits bien cuantizado suele estar más cerca de su versión de precisión completa de lo que se espera, mientras que uno de ocho bits mal cuantizado puede ser aún peor. Si la precisión es el objetivo principal, conviene probar ambos antes de comprometerse con el hardware; es más económico descubrir la diferencia ahora que después de la entrega.

Estas cifras son los pesos y nada más. Son el mínimo, no el requisito. La siguiente sección es la que suele causar confusión.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Paso dos

Por qué un modelo que encaja aún así no servirá.

Esta es la forma más común en que una compra de GPU sale mal, y siempre sale mal de la misma manera: alguien lee que su modelo es de treinta y ocho gigabytes, compra una tarjeta de cuarenta gigabytes, la instala correctamente y luego descubre que solo puede soportar una conversación corta.

  • El entorno de ejecución también está ahí.

    La carga de un modelo no es lo único que ocupa la tarjeta. El entorno de ejecución, sus búferes y las activaciones de lo que se esté calculando residen en la misma memoria que los pesos.

  • La conversación está ahí, y crece.

    Cada token presente en una conversación deja información en la caché de clave-valor para evitar tener que recalcularla. Esta caché crece con la duración del contexto y, de nuevo, con cada solicitud que se procesa simultáneamente. Un contexto extenso o un punto final con mucha actividad pueden requerir tanta memoria como un modelo pequeño.

  • Entonces: un cuarto a la mitad otra vez

    Presupuesta al menos un cuarto más de memoria de tarjeta que los pesos, y la mitad más si el contexto es largo o el punto final está ocupado. Esa es la regla que aplica la tabla de la siguiente sección: cada tarjeta que menciona almacena los pesos una vez y media.

  • Y si está cerca, avísalo antes de comprar.

    Indíquenos el modelo, la cuantización, la longitud del contexto que necesita y aproximadamente cuántas solicitudes simultáneas. Preferimos convencerle de que adquiera una tarjeta de mayor capacidad ahora, o un modelo más pequeño, a aceptar un pedido que le decepcione en la primera semana y que luego solicite un reembolso.

Paso tres

¿Qué tarjeta funciona con qué modelo?

Lea la información hasta encontrar el tamaño de su modelo y la precisión deseada. Cada celda indica la tarjeta más pequeña compatible que admite esos pesos con espacio suficiente, y enlaza con la máquina en la que se instala. Si el catálogo no incluye ninguna tarjeta que cumpla esta función por sí sola, la celda lo indica en lugar de dejarla en blanco.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights

Tres cosas que la mesa no puede decirte

  • La tarjeta más pequeña que cabe no siempre es la que necesitas. La memoria determina si un modelo funciona; el resto de las características de la tarjeta determinan su velocidad y la cantidad de usuarios que puede atender simultáneamente. La tabla optimiza el rendimiento, ya que la memoria es un requisito indispensable y el rendimiento es una preferencia personal. Si el rendimiento es más importante que el presupuesto, consulta una tarjeta de la lista a continuación.
  • Las tarjetas antiguas no son compatibles con los formatos numéricos más recientes. Varias piezas de nuestro catálogo son anteriores a FP8 y bfloat16, por lo que un entorno de ejecución que las requiera utilizará formatos más lentos o simplemente las rechazará. Es importante que nos pregunte sobre esto antes de realizar su pedido, y le daremos una respuesta específica para cada tarjeta y entorno de ejecución, no general.
  • Una tarjeta AMD ejecuta ROCm, no CUDA. Los componentes Instinct ofrecen una excelente relación calidad-precio por gigabyte y son la solución a varios problemas mencionados anteriormente, pero su sistema debe ser compatible con ROCm. La mayoría de los entornos de ejecución actuales lo son; sin embargo, algunas herramientas aún no lo son. Verifique el suyo o consúltenos y lo revisaremos con usted.

Cuando la respuesta es "más de una tarjeta", se trata de una configuración que ofrecemos como presupuesto, no como una opción de compra. La página sobre configuraciones multi-GPU y multi-nodo explica cómo se ve y qué limitaciones presenta. El costo mensual de cada una de estas tarjetas, así como el costo de la máquina que las soporta, corresponde a servidores dedicados con GPU . Cada cifra se asocia a la máquina específica a la que pertenece, por lo que esta página no repite ninguna.

De memoria, el más grande primero

Cada tarjeta que instalamos publica una cifra de memoria.

El mismo catálogo que muestra los precios de las GPU, ordenados en orden inverso: esa página comienza con el equipo completo más económico porque responde a la pregunta "¿cuánto cuesta?", y esta comienza con la tarjeta más potente porque responde a la pregunta "¿cuál es el equipo más potente que puedo ejecutar?". Una tarjeta cuya memoria el fabricante no publica se omite aquí en lugar de mostrarse con un espacio en blanco, porque una fila que no se puede comparar no sirve para una comparación.

Varias de estas tarjetas aparecen en más de un chasis, a veces a precios diferentes, y la generación del bus de la máquina subyacente cambia lo que una tarjeta moderna puede hacer realmente; ambos aspectos se aplican a servidores dedicados a GPU . Lo que está instalado y listo en este preciso instante es otra cuestión, respondida por los servidores instantáneos .

Lo que instales en él

El entorno de ejecución es tuyo, y esa es la esencia del hardware sin protección.

La máquina viene con un sistema operativo y un directorio raíz limpios. No hay ningún servicio de inferencia del proveedor que deba utilizar, ningún entorno de ejecución gestionado que se actualice automáticamente la semana antes de una fecha límite, ni ninguna API que se interponga entre usted y su propio modelo. Usted instala lo que necesita y lo vincula a la versión con la que se probó su código.

vLLM

La respuesta habitual para ofrecer un modelo a tráfico real. El procesamiento por lotes continuo y la atención paginada permiten que una tarjeta responda a muchas solicitudes a la vez en lugar de una por una, lo que suele ser la diferencia entre una demo y un servicio. Se requiere una tarjeta relativamente moderna.

llama.cpp

La respuesta habitual cuando la memoria es escasa o la tarjeta es antigua. Sus formatos cuantizados son la razón por la que un modelo grande cabe en una tarjeta pequeña, y puede usar el procesador y la tarjeta juntos sin problemas cuando los pesos no coinciden del todo. Más lento por solicitud, mucho más tolerante.

TGI y SGLang

Servidores de producción de la misma familia que vLLM, con diferentes ventajas en cuanto a salida estructurada, reutilización de prefijos y servicio multimodelo. Si ya dispone de uno en su infraestructura, funcionará aquí sin modificaciones.

Ollama

La ruta más corta desde una máquina vacía hasta un modelo que responde en un puerto. Vale la pena empezar por ahí aunque termines en otro sitio, porque te dirá en unos diez minutos si el dimensionamiento fue el correcto.

Elijas la opción que elijas, el controlador, la versión de CUDA o ROCm y la compilación del framework son responsabilidad tuya y no se realizarán actualizaciones automáticas. Si prefieres que el controlador se instale antes de la entrega, indícalo en el pedido y especifica la versión.

¿Qué tan rápido será?

No publicamos la cifra de tokens por segundo, y esta es la razón.

Cada cifra depende del modelo, la cuantización, el tiempo de ejecución y su versión, el tamaño del lote, la longitud de la solicitud, la longitud de la respuesta y la cantidad de solicitudes en curso. Si se modifica cualquiera de estos factores, la cifra varía considerablemente. Una cifra principal que no incluya todos estos elementos es una cifra elegida para dar una buena imagen, y seríamos citados con ella.

Lo que te diremos es qué lo rige, para que puedas razonar sobre tu propio caso:

  • La lectura del mensaje depende en gran medida de la capacidad de procesamiento. Se realiza una vez por solicitud, en paralelo a lo largo de todo el mensaje, y es ahí donde se evidencia el rendimiento aritmético de la tarjeta y su compatibilidad con los formatos numéricos más recientes.
  • La generación de la respuesta está limitada por el ancho de banda de la memoria. Cada token requiere la lectura de los pesos, por lo que, para una sola solicitud, el límite es aproximadamente la velocidad a la que la tarjeta puede transmitir su propia memoria. Por eso, una tarjeta con memoria más lenta y de mayor capacidad puede sufrir una latencia mayor que una más pequeña y rápida, aunque sí puede lograr que el modelo se ajuste correctamente.
  • El procesamiento por lotes es lo que lo hace económico. Atender varias solicitudes simultáneamente amortiza el costo de lectura entre todas ellas, razón por la cual el rendimiento total aumenta drásticamente con la concurrencia, mientras que la latencia por solicitud apenas varía, hasta que la caché de clave-valor se queda sin espacio, momento en el que todo se degrada a la vez. De nuevo, la capacidad de procesamiento.

Pide una respuesta real en su lugar.

Indíquenos el modelo, la cuantización que pretende, la longitud del contexto y aproximadamente cuántas solicitudes concurrentes espera. Si hemos realizado pruebas similares, le indicaremos los resultados y en qué contexto. Si no, también lo mencionaremos.

Es una base mejor para realizar una compra que un gráfico de referencia, y solo lleva un minuto.

El horario habitual de atención al cliente incluye todas las opciones: teléfono, chat y sistema de tickets, todos los días del año. El equipo de soporte dispone de los tiempos de respuesta por escrito.

Más allá de servir

El ajuste fino requiere mucho más espacio que el servicio.

Todo lo anterior dimensiona un modelo para la inferencia: pesos de entrada, tokens de salida. Entrenar o ajustar el mismo modelo supone un problema de memoria diferente, y la diferencia no es pequeña.

Por qué cuesta más memoria

Para el funcionamiento se necesitan los pesos. Para el entrenamiento se necesitan los pesos, los gradientes y el estado propio del optimizador para cada parámetro que actualiza, todo almacenado simultáneamente, además de las activaciones que debe conservar para retroceder a través de la red. Un modelo que funciona correctamente en una tarjeta puede ser varias veces demasiado grande para ajustarlo completamente en la misma tarjeta.

Por eso la mayoría de la gente no lo hace completamente.

Los métodos eficientes en parámetros —adaptadores, actualizaciones de bajo rango y sus variantes cuantificadas— actualizan una pequeña fracción de los parámetros y requieren una fracción igualmente pequeña de la memoria adicional. Para la mayoría de las tareas que se denominan ajuste fino, esta es la opción más práctica y la que se adapta al hardware que uno puede permitirse conservar.

¿Qué decirnos?

El modelo, el método, la longitud de la secuencia y el tamaño del conjunto de datos. No publicaremos un multiplicador aquí, ya que el valor real depende de los cuatro, y una cifra inventada que subestime la capacidad de tu máquina es peor para ambos que una conversación. Si la respuesta es más de una tarjeta, la configuración multi-GPU y multinodo explica cómo se ve esa configuración.

El autobús importa aquí de una manera que no importa para servir

Un bucle de entrenamiento transmite lotes continuamente a través del enlace entre el procesador y la tarjeta, por lo que la generación PCIe de la máquina subyacente es una restricción real más que una especificación. La inferencia en un modelo residente apenas la afecta. Qué plataforma proporciona a una tarjeta qué enlace se publica en servidores dedicados a GPU y se compara entre plataformas en entornos multi-GPU y multi-nodo .

Preguntado anteriormente

Las ocho preguntas a las que esta página pretende responder.

Recopilado de las preguntas que nos hacen los usuarios en el chat y en los tickets, aproximadamente en el orden en que las formulan. Las dos primeras son las que determinan si una compra se realiza correctamente.

¿Cuánta memoria de GPU necesita un modelo de lenguaje grande?
Los pesos se calculan multiplicando el número de parámetros por los bytes que ocupan: dos bytes a 16 bits, uno a 8 bits y la mitad a 4 bits. Un modelo con entre 7 y 8 mil millones de parámetros requiere 16 GB de pesos a 16 bits, 8 GB a 8 bits y 5 GB a 4 bits; un modelo con 70 mil millones de parámetros requiere 140 GB, 70 GB y 38 GB, respectivamente. Estas cifras corresponden únicamente a los pesos y representan un mínimo, no un requisito. Se debe añadir entre un cuarto y la mitad más para el tiempo de ejecución, las activaciones y la caché de clave-valor.
¿Por qué mi modelo se carga pero no funciona?
Porque los pesos no son lo único que se almacena en la memoria de la tarjeta. El entorno de ejecución y sus búferes son residentes, y cada token en una conversación deja una entrada en la caché de clave-valor para que no tenga que recalcularse. Esa caché crece con la longitud del contexto y de nuevo con cada solicitud atendida simultáneamente, por lo que un modelo cuyos pesos apenas caben almacenará aproximadamente una conversación corta. El tamaño de la tarjeta debe ser entre una vez y cuarto y una vez y media el de los pesos.
¿Qué entorno de ejecución de inferencia puedo instalar?
Cualquiera de ellos. La máquina llega con un sistema operativo y raíz limpios, y no hay ningún servicio de inferencia del proveedor delante de ella. vLLM es la respuesta habitual para servir tráfico real porque el procesamiento por lotes continuo permite que una tarjeta responda a muchas solicitudes a la vez. llama.cpp es la respuesta habitual cuando la memoria es limitada o la tarjeta es antigua. TGI y SGLang se ejecutan sin cambios. Ollama es la ruta más corta desde una máquina vacía a un modelo que responde en un puerto. Debes fijar el controlador, la versión de CUDA o ROCm y el framework a las versiones con las que se probó tu código.
¿Cuántos tokens por segundo recibiré?
No publicamos una cifra de tokens por segundo, ya que cada número depende del modelo, la cuantización, el entorno de ejecución y su versión, el tamaño del lote, la longitud de la solicitud, la longitud de la respuesta y la concurrencia, y cualquier cambio en estos parámetros la incrementa considerablemente. Lo que lo rige es lo siguiente: la lectura de la solicitud está limitada por la capacidad de procesamiento y se realiza una vez por solicitud; la generación de la respuesta está limitada por el ancho de banda de la memoria, ya que cada token requiere la lectura de los pesos; y el procesamiento por lotes amortiza esa lectura entre las solicitudes concurrentes, lo que hace que el servicio sea económico hasta que se agote el espacio en la caché de clave-valor. Consulte con el modelo, la cuantización y la concurrencia esperada para obtener una respuesta basada en lo que hemos observado.
¿La GPU se comparte con alguien más?
No. Un inquilino por máquina física, y la tarjeta se asigna a su propio sistema operativo. No hay hipervisor, ni partición MIG, ni perfil vGPU, ni planificador de división de tiempo, por lo que no se ejecuta nada más en la tarjeta y la latencia de inferencia no varía debido a las tareas por lotes de otros usuarios.
¿Qué ocurre si el modelo no cabe en una sola tarjeta?
Se trata de una configuración con varias tarjetas gráficas, cuyo precio se presupuesta en lugar de solicitarse en línea: la cantidad de tarjetas compatibles depende del ancho físico de cada tarjeta y del consumo energético del chasis. Dos tarjetas ofrecen la suma de su memoria solo si el entorno de ejecución puede distribuir el modelo entre ambas, algo que cualquier entorno de ejecución serio admite, aunque con una pérdida de rendimiento. Más de una tarjeta o máquina define cómo sería esa configuración.
¿La optimización requiere más memoria que el servicio?
Mucho más. Para servir se necesitan los pesos; para entrenar se necesitan los pesos, los gradientes y el estado del optimizador para cada parámetro que se actualiza, todo almacenado simultáneamente, además de las activaciones que se conservan para la pasada hacia atrás. Un modelo que funciona cómodamente en una tarjeta puede ser varias veces demasiado grande para ajustarlo completamente en ella. Los métodos eficientes en parámetros actualizan una pequeña fracción de los parámetros y necesitan una fracción correspondientemente pequeña de la memoria adicional, razón por la cual la mayoría de los ajustes finos aquí utilizan una sola tarjeta.
¿Puedo usar una tarjeta AMD y funciona ROCm?
Sí. Las tarjetas AMD Instinct se encuentran entre las de mayor capacidad de memoria que instalamos y suelen ofrecer la mejor relación calidad-precio por gigabyte, pero su sistema debe ser compatible con ROCm en lugar de CUDA. La mayoría de los entornos de ejecución de inferencia actuales lo son; algunas herramientas relacionadas aún no lo son. Consulte antes de realizar su pedido y lo comprobaremos con su entorno de ejecución específico en lugar de darle una respuesta general.

For the record

Everything on this page, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.