Tirées de ce que les gens nous demandent réellement par chat et par ticket, à peu près dans l’ordre où ils le demandent. Les trois premières sont celles qui déterminent si un achat fonctionne.
- De quelle quantité de mémoire GPU un grand modèle de langage a-t-il besoin ?
- Les poids correspondent au nombre de paramètres multiplié par les octets par paramètre : deux octets chacun en 16 bits, un en 8 bits, la moitié en 4 bits. Un modèle de 7–8 milliards de paramètres représente 16 Go de poids en 16 bits, 8 Go en 8 bits et 5 Go en 4 bits ; un modèle de 70 milliards de paramètres représente 140 Go, 70 Go et 38 Go. Ces chiffres concernent uniquement les poids et constituent un plancher plutôt qu’une exigence — prévoyez un quart à la moitié en plus pour l’exécution, les activations et le cache clé-valeur.
- De quoi ai-je besoin pour exécuter un modèle 70B comme Llama 3.3 ?
- En 4 bits, les poids font environ 38 Go, donc avec la marge de service, la réponse est une carte de 64 Go ou plus — une carte, une machine. En 8 bits, les poids font 70 Go et une carte de 80 Go franchit la barre. En pleine précision 16 bits, aucune carte unique que nous installons ne peut le contenir, et cela devient une configuration multi-cartes que nous chiffrons. La Fig. 3 ci-dessus nomme les cartes exactes ; les prix sont sur Serveurs dédiés GPU.
- Pourquoi mon modèle se charge mais ne parvient pas à servir ?
- Parce que les poids ne sont pas la seule chose dans la mémoire de la carte. L’exécution et ses tampons sont résidents, et chaque jeton d’une conversation laisse une entrée dans le cache clé-valeur afin de ne pas avoir à être recalculé. Ce cache croît avec la longueur du contexte et encore avec chaque requête servie simultanément, donc un modèle dont les poids tiennent tout juste ne tiendra qu’environ une courte conversation. Dimensionnez la carte à une fois et quart à une fois et demie les poids.
- Quel moteur d’inférence puis-je installer ?
- N’importe lequel. La machine arrive avec un système d’exploitation propre et un accès root, et aucun service d’inférence de fournisseur ne se trouve devant elle. vLLM est la réponse habituelle pour servir un trafic réel car le traitement par lots continu permet à une carte de répondre à plusieurs requêtes à la fois. llama.cpp est la réponse habituelle lorsque la mémoire est limitée ou que la carte est plus ancienne. TGI et SGLang fonctionnent sans modification. Ollama est le chemin le plus court d’une machine vide à un modèle répondant sur un port — et vLLM comme Ollama répondent tous deux sur un point de terminaison compatible OpenAI, donc le code client existant pointe vers votre propre machine en changeant une seule URL de base. Vous figez le pilote, la version CUDA ou ROCm et le framework aux versions contre lesquelles votre code a été testé.
- L’auto-hébergement d’un LLM est-il moins cher qu’une API par jeton ?
- Cela dépend entièrement du volume, et le point de bascule est réel : une API facture par jeton et ne coûte rien au repos ; une machine dédiée est un montant mensuel fixe et ne coûte rien de plus lorsqu’elle est occupée. Un trafic régulier, des agents qui tournent toute la journée, des pipelines par lots et tout ce qui a une exigence de confidentialité ont tendance à être plus avantageux sur leur propre matériel ; une charge de travail qui se déclenche dix fois par jour ne l’est pas. Les chiffres mensuels pour faire ce calcul se trouvent sur Serveurs dédiés GPU — cette fiche ne fixe délibérément aucun prix.
- Combien de jetons par seconde vais-je obtenir ?
- Nous ne publions pas de chiffre de jetons par seconde, car chaque nombre de ce type dépend du modèle, de la quantification, du moteur d’exécution et de sa version, de la taille du lot, de la longueur de l’invite, de la longueur de la réponse et de la concurrence, et changer l’un d’eux le déplace d’un multiple. Ce qui le gouverne : la lecture de l’invite est limitée par le calcul et se produit une fois par requête ; la génération de la réponse est limitée par la bande passante mémoire car chaque jeton nécessite la lecture des poids ; et le traitement par lots amortit cette lecture sur les requêtes simultanées, ce qui rend le service économique jusqu’à ce que le cache clé-valeur soit plein. Demandez avec le modèle, la quantification et la concurrence attendue pour une réponse basée sur ce que nous avons réellement observé.
- Le GPU est-il partagé avec quelqu’un d’autre ?
- Non. Un locataire par machine physique, et la carte est transmise à votre propre système d’exploitation. Il n’y a ni hyperviseur, ni partition MIG, ni profil vGPU, ni ordonnanceur à découpage temporel, donc rien d’autre ne s’exécute sur la carte et la latence d’inférence ne bouge pas à cause du travail par lots de quelqu’un d’autre.
- Que se passe-t-il si le modèle ne tient pas sur une seule carte ?
- Il s’agit alors d’une configuration multi-cartes, qui est chiffrée plutôt que commandée depuis un panier : le nombre de cartes qui tiennent dépend de la largeur physique de la carte spécifique et du budget énergétique du châssis. Deux cartes ne donnent la somme de leur mémoire que si le moteur d’exécution peut répartir le modèle entre les deux, ce que tout moteur sérieux prend en charge avec un certain coût en débit. Plus d’une carte ou machine explique à quoi ressemble cette configuration.
- Le réglage fin nécessite-t-il plus de mémoire que le service ?
- Considérablement plus. Le service nécessite les poids ; l’entraînement nécessite les poids, les gradients et l’état de l’optimiseur pour chaque paramètre mis à jour, tous résidents en même temps, plus les activations conservées pour la passe arrière. Un modèle qui tient confortablement sur une carte peut être plusieurs fois trop grand pour y être entièrement affiné. Les méthodes à efficacité paramétrique mettent à jour une petite fraction des paramètres et nécessitent une fraction correspondante de la mémoire supplémentaire, c’est pourquoi la plupart des réglages fins ici en utilisent une.
- Puis-je utiliser une carte AMD, et ROCm fonctionne-t-il ?
- Oui. Les pièces AMD Instinct comptent parmi les cartes à plus grande mémoire que nous installons et offrent souvent le meilleur rapport qualité-prix par gigaoctet, mais votre pile doit prendre en charge ROCm plutôt que CUDA. La plupart des moteurs d’inférence actuels le font ; certains outils périphériques ne le font toujours pas. Demandez avant de commander et nous vérifierons par rapport à votre moteur d’exécution spécifique plutôt que de répondre en général.