Il modello ha superato la memoria
I pesi che non entrano più non girano lentamente — non si caricano proprio. Oltre ciò che la memoria di sistema contiene, la risposta è una scheda scelta prima per la memoria, e quanta ne serve a un modello è spiegato nella pagina LLM.
Gli utenti si sono moltiplicati
Servire molte persone contemporaneamente è ciò per cui servono la larghezza di banda della memoria e il batching di una scheda. È il punto in cui una coda su una macchina piccola diventa un motivo per una scheda dedicata.
Hai iniziato il fine-tuning
L’addestramento tiene in memoria insieme pesi, gradienti e stato dell’ottimizzatore — diverse volte ciò che serve per l’inferenza. È territorio da scheda, e a volte più di una scheda.
I millisecondi sono diventati il prodotto
Quando la velocità di risposta è ciò che sperimenta il tuo cliente, la memoria più veloce della scheda è la soluzione onesta. Una macchina piccola è per lavori che ragionano in secondi.