O modelo cresceu além da memória
Pesos que não cabem mais não ficam lentos — eles não carregam. Passado o que a memória do sistema comporta, a resposta é uma placa escolhida primeiro pela memória, e quanto um modelo precisa é detalhado na página de LLM.
Os usuários se multiplicaram
Servir muitas pessoas ao mesmo tempo é para o que servem a largura de banda de memória e o batching de uma placa. É nesse ponto que uma fila em uma máquina pequena vira um caso para uma placa dedicada.
Você começou a fazer fine-tuning
O treinamento mantém os pesos, os gradientes e o estado do otimizador na memória ao mesmo tempo — várias vezes o que o serving precisa. Isso é território de placa e, às vezes, mais de uma placa.
Os milissegundos viraram o produto
Quando o ritmo da resposta é o que seu cliente experimenta, a memória mais rápida da placa é a correção honesta. Uma máquina pequena é para trabalhos que pensam em segundos.