El modelo superó la memoria
Los pesos que ya no caben no se ejecutan con lentitud — no se cargan. Más allá de lo que contiene la memoria del sistema, la respuesta es una tarjeta elegida primero por su memoria, y cuánta necesita un modelo se analiza en la página de LLM.
Los usuarios se multiplicaron
Servir a muchas personas a la vez es para lo que sirven el ancho de banda de memoria y el procesamiento por lotes de una tarjeta. Ese es el punto en el que una cola en una máquina pequeña se convierte en un argumento a favor de una tarjeta dedicada.
Empezó a hacer ajuste fino
El entrenamiento mantiene los pesos, los gradientes y el estado del optimizador en memoria a la vez — varias veces lo que necesita el servicio. Eso es territorio de tarjeta, y a veces más de una tarjeta.
Los milisegundos se convirtieron en el producto
Cuando el ritmo de respuesta es lo que experimenta su cliente, la memoria más rápida de la tarjeta es la solución honesta. Una máquina pequeña es para trabajos que piensan en segundos.