Scheda di dimensionamento · modelli linguistici su bare metal · dal 2004

Cosa serve per eseguire un modello linguistico su bare metal.

Compilata dall’alto, come procede la decisione: il modello fissa i pesi, la precisione li scala, il margine di sicurezza copre il runtime e la conversazione, e il totale indica la scheda. Nient’altro nel modulo d’ordine cambia la risposta — una scheda con due gigabyte in meno non gira più lentamente, non si carica proprio.

Redatto da
Primcast LLC, fondata nel 2004
Verificato con
Il catalogo ordini, al momento della pubblicazione
Schede a catalogo · più grande
56 · 96 GB GDDR7 ECC
Prezzi su questa scheda
Nessuno — vedi /gpu

Compila la scheda Perché una soluzione può comunque fallire Cosa installo sulla macchina

Trasforma le tue GPU in entrate mensili passive

Hai configurazioni GPU inattive su server o desktop? Pubblicarle oggi sul marketplace Primcast e guadagna affitti mensili costanti da team AI, sviluppatori e aziende che necessitano di capacità di calcolo di livello produttivo.

Vai al Marketplace

Scheda di lavoro

Quattro righe, un verdetto.

Il modello
La precisione
Il carico

70B: 38 GB × 1.5 = 57 GB

Smallest card on the schedule that clears it (3 larger ones also do):

Instinct MI21064 GB HBM2e

The link opens the machine it goes in. What it costs is on /gpu — not on this sheet.

Riga 1 × riga 2 sono i pesi; la riga 3 è la regola pubblicata dal sito, da un quarto a metà di margine, espressa in aritmetica — un quarto in più per un utente alla volta su llama.cpp o Ollama, metà in più per servire traffico con batching continuo su vLLM o TGI. Il verdetto indica la scheda più piccola del catalogo ordini che supera il totale e collega alla macchina in cui va installata. Quanto costa quella macchina è volutamente assente da questa scheda: ogni cifra è su /gpu, accanto alla macchina esatta a cui appartiene.

Fig. 1

Quanto pesano i pesi.

Parametri moltiplicati per i byte per parametro, ed è tutto il calcolo. I pesi a sedici bit occupano due byte ciascuno, a otto bit uno, a quattro bit mezzo. La quantizzazione è ciò che trasforma una macchina che non può contenere un modello in una che può; costa qualità, e quanto dipende dal modello e dal metodo molto più che dal solo numero di bit. Se la precisione è lo scopo dell’esercizio, provate entrambi prima di impegnarvi con l’hardware — la differenza è più economica da scoprire adesso che dopo la consegna.

Queste cifre sono i pesi e nient’altro. Sono il minimo, non il requisito — la Fig. 2 è la parte che coglie di sorpresa.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Fig. 2 · interattiva

La memoria di una scheda, disegnata in pianta — e perché un modello che entra può comunque rifiutarsi di servire.

Il modo più comune in cui un acquisto di GPU va storto, ogni volta allo stesso modo: il modello è di trentotto gigabyte, la scheda di quaranta, si carica — e regge all’incirca una conversazione breve. I pesi non sono soli lì dentro. Muovi il carico e osserva cosa fa la conversazione.

pesi · fissi
runtime
cache chiave-valore · cresce
libera
memoria di una scheda, 100 %

Un utente, contesto breve: il moltiplicatore stretto (×1,25) copre questo caso.

  • Ogni token in una conversazione lascia una voce nella cache chiave-valore per non essere ricalcolato. La cache cresce con la lunghezza del contesto, e ancora con ogni richiesta servita simultaneamente.
  • Prevedi un quarto in più oltre i pesi per un utente alla volta, metà in più per servire traffico — i due moltiplicatori della scheda di lavoro, e la regola pubblicata dal sito.
  • Se il margine è stretto, chiedi prima di acquistare: modello, quantizzazione, contesto, concorrenza. Preferiamo dimensionarti una scheda adesso piuttosto che ricevere un ordine che torna come richiesta di rimborso nella prima settimana.

Fig. 3

La matrice di compatibilità: quale scheda regge quale modello.

Leggi in basso fino al tuo modello, poi in orizzontale fino alla precisione. Ogni cella indica la scheda più piccola della distinta parti che contiene quei pesi con spazio sufficiente per servire, e collega alla macchina in cui va installata. Dove nessuna scheda li regge da sola, la cella lo dice invece di lasciare un vuoto.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights
  • La scheda più piccola che basta non è sempre la scheda che vuoi. La memoria decide se un modello gira; tutto il resto della scheda decide quanto velocemente, e per quante persone alla volta. Se la produttività conta più del budget, sali di un gradino nella distinta.
  • Le schede più vecchie non parlano i formati numerici più recenti. Diverse parti della distinta precedono FP8 e bfloat16, quindi un runtime che li richiede ripiegherà su qualcosa di più lento o si rifiuterà. Vale la pena chiedere di una scheda specifica e di un runtime specifico prima di ordinare.
  • Una scheda AMD esegue ROCm, non CUDA. Le parti Instinct hanno un ottimo rapporto valore per gigabyte e sono la risposta in più di una cella, ma il tuo stack deve supportare ROCm. La maggior parte dei runtime attuali lo fa; parte della strumentazione attorno ancora no. Controlla il tuo, oppure chiedi e lo verificheremo con te.
  • “Più di una scheda” è una configurazione che quotiamo, non un’opzione di checkout — quante schede entrano dipende dalla larghezza della scheda specifica e dal budget energetico dello chassis. Multi-GPU e multi-nodo è quella scheda. L’altra risposta a quella dimensione sono 128 GB di memoria condivisa tra processore e GPU, in una sola macchina: noleggiare un NVIDIA DGX Spark.

Distinta A

Distinta parti: ogni scheda che montiamo con un dato di memoria pubblicato.

Dalla più grande in giù — questa scheda risponde a “qual è la cosa più grande che posso eseguire”, l’inverso di server dedicati GPU, che ordina lo stesso catalogo per la macchina completa più economica perché risponde a “quanto costa”. Una scheda la cui memoria non è pubblicata dal produttore viene esclusa anziché stimata.

Diverse parti compaiono su più di uno chassis, a volte a prezzi diversi, e la generazione del bus della macchina sottostante cambia ciò che una scheda moderna può effettivamente fare — entrambi sono su server dedicati GPU. Cosa è montato in rack e pronto in questo momento è un’altra domanda ancora, a cui rispondono i server istantanei.

Riferimento

Modelli noti, mappati sulle righe.

Le famiglie a pesi aperti che le persone portano qui, con il numero di parametri pubblicato che indica quale riga della Fig. 1 si applica. I conteggi dei parametri sono quelli degli editori; nient’altro di un modello conta per la questione della compatibilità. Un modello non in questa lista si dimensiona esattamente allo stesso modo — parametri × byte per parametro, più il margine. Nuove famiglie escono ogni mese; l’aritmetica non si muove.

Nota 1 · mistura di esperti

Un modello “30B con 3B attivi” richiede la memoria di un modello da 30B e gira più vicino alla velocità di uno da 3B: ogni esperto deve essere residente, perché token diversi attivano esperti diversi. Dimensiona sempre dal numero totale di parametri.

FamigliaDimensioniRiga
Llama 3.1 / 3.3 Meta8B · 70B7–8B, e 70B per la versione 3.3
Qwen3 Alibaba8B · 14B · 32BLe prime tre righe
DeepSeek-R1 distillati7B – 70BUno per riga — scegli il distillato che la tua scheda contiene
Mistral Small 3 Mistral AI24BTra le righe 2 e 3; dimensionalo dall’aritmetica, non dall’etichetta
Gemma 3 Google12B · 27BRiga 2, e appena sotto la riga 3
Phi-4 Microsoft14BRiga 2
gpt-oss OpenAI20B · 120BPubblicato nativamente a 4 bit: una scheda da 16 GB e una da 80 GB

Note di installazione

Il runtime è tuo. È questo il punto del bare metal.

La macchina arriva con un sistema operativo pulito e accesso root. Nessun servizio di inferenza del fornitore davanti al tuo modello, nessun runtime gestito che si aggiorna da solo la settimana prima di una scadenza. vLLM e Ollama rispondono entrambi su un endpoint compatibile con OpenAI — il codice scritto per un provider API punta alla tua macchina cambiando un solo URL di base. Fissa il driver, la versione CUDA o ROCm e il framework alle versioni con cui il tuo codice è stato testato; nulla si muove sotto di te. Se preferisci che il driver sia installato prima della consegna, dillo nell’ordine e indica la versione.

  1. vLLM — servire traffico reale. Il batching continuo e l’attenzione paginata permettono a una scheda di rispondere a molte richieste alla volta: la differenza tra una demo e un servizio. Richiede una scheda ragionevolmente moderna.
  2. llama.cpp — memoria limitata, o scheda più vecchia. I suoi formati quantizzati sono il motivo per cui un modello grande entra in una scheda piccola; userà processore e scheda insieme quando i pesi non entrano del tutto.
  3. TGI · SGLang — server di produzione della stessa famiglia, con punti di forza diversi su output strutturato, riuso dei prefissi e servizio multi-modello. Girano qui senza modifiche.
  4. Ollama — il percorso più breve da una macchina vuota a un modello che risponde su una porta. Dieci minuti ti dicono se il tuo dimensionamento era giusto.

Condizioni del sito

Cosa fa la tua macchina che un’API non può fare.

I prompt non lasciano mai l’edificio

Pesi, prompt, documenti recuperati e ogni token generato restano su hardware a cui solo tu puoi accedere. Amsterdam o Bucarest e i dati restano nell’UE; New York, Miami o San Francisco e restano negli Stati Uniti. Per carichi di lavoro che rispondono a un responsabile della privacy, quella frase è l’intero business case.

Il contatore non gira mai

Un’API per token fattura ogni token, e un agente o una pipeline batch genera token tutto il giorno. Una macchina dedicata è la stessa cifra ogni mese a qualsiasi volume, con banda senza limiti sotto — pesi in entrata e token in uscita non costano nulla oltre la porta. Quale sia la cifra, è la riga da compilare di /gpu, non di questa scheda.

Nessuno ti impone limiti di velocità, depreca o sostituisce il modello sotto di te

Il modello che fissi risponde invariato tra sei mesi. Nessun tetto di richieste al minuto, nessuna coda nell’ora di punta di qualcun altro, nessun avviso di dismissione. Lo scambio è onesto: gli aggiornamenti sono tuoi, secondo i tuoi tempi.

Il lavoro accanto al modello ha una casa

Il retrieval richiede un modello di embedding, un archivio vettoriale e dischi veloci; gli agenti richiedono spazio per eseguire strumenti. NVMe per l’archivio, core del processore per la pipeline, la scheda per i token — una sola macchina porta tutto.

Nota 2 · prestazioni

Su questa scheda non compare alcuna cifra di token al secondo.

Deliberatamente. Ogni numero del genere dipende dal modello, dalla quantizzazione, dal runtime e dalla sua versione, dalla dimensione del batch, dalla lunghezza del prompt, dalla lunghezza della risposta e dalla concorrenza — cambiane uno qualsiasi e si sposta di un multiplo. Un numero di punta che non riporta tutto questo è un numero scelto per fare bella figura, e verremmo citati su di esso. Cosa lo governa: leggere il prompt è limitato dal calcolo e avviene una volta per richiesta; generare la risposta è limitato dalla larghezza di banda della memoria, perché ogni token richiede la lettura dei pesi; il batching ammortizza quella lettura tra richieste concorrenti, finché la cache chiave-valore non esaurisce lo spazio. Ancora margine di sicurezza.

Chiedi invece una risposta reale

Dicci il modello, la quantizzazione che intendi usare, la lunghezza del contesto e all’incirca quante richieste concorrenti. Se abbiamo eseguito qualcosa di paragonabile diremo cosa abbiamo visto e su cosa. Se non l’abbiamo fatto, diremo anche questo.

Ogni ora di ogni giorno — telefono, chat e ticket. L’assistenza ha i tempi di risposta per iscritto.

Nota 3 · fine-tuning

L’addestramento richiede molto più spazio del servizio.

Servire richiede i pesi. Addestrare richiede i pesi, i gradienti e lo stato dell’ottimizzatore per ogni parametro aggiornato, tutti residenti contemporaneamente, più le attivazioni conservate per il passaggio all’indietro — un modello che serve comodamente su una scheda può essere diverse volte troppo grande per essere completamente rifinito su di essa. I metodi parameter-efficient aggiornano una piccola frazione dei parametri e richiedono una frazione corrispondentemente piccola della memoria extra, ed è per questo che la maggior parte del fine-tuning qui ne usa uno. Il ciclo di addestramento inoltre trasmette batch in continuo attraverso il collegamento processore-scheda, quindi la generazione PCIe della macchina sottostante è un vincolo reale in quel caso, come non lo è per il servizio — quale piattaforma dà a una scheda quale collegamento è su server dedicati GPU. Dicci il modello, il metodo, la lunghezza della sequenza e la dimensione del dataset e lo dimensioneremo noi invece di fartelo scoprire dopo la consegna; più di una scheda è la scheda di multi-GPU e multi-nodo.

Domande frequenti

Domande poste sulle revisioni precedenti di questa scheda.

Tratte da ciò che le persone ci chiedono realmente in chat e nei ticket, più o meno nell'ordine in cui le pongono. Le prime tre sono quelle che determinano se un acquisto funziona.

Quanta memoria GPU richiede un modello linguistico di grandi dimensioni?
I pesi sono il numero di parametri moltiplicato per i byte per parametro: due byte ciascuno a 16 bit, uno a 8 bit, mezzo a 4 bit. Un modello da 7–8 miliardi di parametri occupa 16 GB di pesi a 16 bit, 8 GB a 8 bit e 5 GB a 4 bit; un modello da 70 miliardi di parametri occupa 140 GB, 70 GB e 38 GB. Queste cifre si riferiscono ai soli pesi e rappresentano un minimo piuttosto che un requisito — prevedete da un quarto alla metà in più per il runtime, le attivazioni e la cache chiave-valore.
Cosa mi serve per eseguire un modello da 70B come Llama 3.3?
A 4 bit i pesi sono circa 38 GB, quindi con margine per il serving la risposta è una scheda da 64 GB o più — una scheda, una macchina. A 8 bit i pesi sono 70 GB e una scheda da 80 GB supera la soglia. A piena precisione a 16 bit nessuna singola scheda che installiamo può contenerlo, e diventa una configurazione multi-scheda che quotiamo su richiesta. La Fig. 3 sopra indica le schede esatte; i prezzi sono su Server dedicati GPU.
Perché il mio modello si carica ma non riesce a servire?
Perché i pesi non sono l'unica cosa nella memoria della scheda. Il runtime e i suoi buffer sono residenti, e ogni token in una conversazione lascia una voce nella cache chiave-valore per non dover essere ricalcolato. Questa cache cresce con la lunghezza del contesto e ancora di più con ogni richiesta servita in concorrenza, quindi un modello i cui pesi entrano a malapena sosterrà all'incirca una sola conversazione breve. Dimensionate la scheda da una volta e un quarto a una volta e mezza i pesi.
Quale runtime di inferenza posso installare?
Qualsiasi. La macchina arriva con un sistema operativo pulito e accesso root, e non c'è alcun servizio di inferenza del fornitore davanti. vLLM è la risposta abituale per servire traffico reale perché il batching continuo consente a una scheda di rispondere a molte richieste contemporaneamente. llama.cpp è la risposta abituale quando la memoria è limitata o la scheda è più vecchia. TGI e SGLang funzionano senza modifiche. Ollama è il percorso più breve da una macchina vuota a un modello che risponde su una porta — e sia vLLM che Ollama rispondono su un endpoint compatibile con OpenAI, quindi il codice client esistente punta alla vostra macchina cambiando un solo URL di base. Fissate il driver, la versione di CUDA o ROCm e il framework alle versioni con cui il vostro codice è stato testato.
Self-hosting di un LLM è più economico di un'API a consumo per token?
Dipende interamente dal volume, e il punto di pareggio è reale: un'API fattura per token e non costa nulla quando è inattiva; una macchina dedicata ha un costo mensile fisso e non costa nulla in più quando è occupata. Traffico costante, agenti che girano tutto il giorno, pipeline batch e qualsiasi cosa con un requisito di privacy tendono a risultare più convenienti su hardware proprio; un carico di lavoro che si attiva dieci volte al giorno no. Le cifre mensili per fare questi calcoli sono su Server dedicati GPU — questa scheda deliberatamente non indica prezzi.
Quanti token al secondo otterrò?
Non pubblichiamo una cifra di token al secondo, perché ogni numero del genere dipende dal modello, dalla quantizzazione, dal runtime e dalla sua versione, dalla dimensione del batch, dalla lunghezza del prompt, dalla lunghezza della risposta e dalla concorrenza, e cambiare uno qualsiasi di questi lo sposta di un multiplo. Ciò che lo governa: leggere il prompt è limitato dal calcolo e avviene una volta per richiesta; generare la risposta è limitato dalla larghezza di banda della memoria perché ogni token richiede la lettura dei pesi; e il batching ammortizza questa lettura tra richieste concorrenti, il che è ciò che rende il serving economico finché la cache chiave-valore non esaurisce lo spazio. Chiedete indicando modello, quantizzazione e concorrenza prevista per una risposta basata su ciò che abbiamo effettivamente osservato.
La GPU è condivisa con qualcun altro?
No. Un solo tenant per macchina fisica, e la scheda è passata direttamente al vostro sistema operativo. Non c'è hypervisor, nessuna partizione MIG, nessun profilo vGPU e nessuno scheduler a time-slicing, quindi nient'altro gira sulla scheda e la latenza di inferenza non cambia a causa del job batch di qualcun altro.
Cosa succede se il modello non entra in una sola scheda?
Allora è una configurazione multi-scheda, che viene quotata su richiesta anziché ordinata da un checkout: quante schede entrano dipende dalla larghezza fisica della scheda specifica e dal budget di potenza del telaio. Due schede danno la somma della loro memoria solo se il runtime può dividere il modello tra entrambe, cosa che ogni runtime serio supporta con un certo costo in termini di throughput. Più di una scheda o macchina illustra come si presenta quella configurazione.
Il fine-tuning richiede più memoria del serving?
Considerevolmente di più. Il serving richiede i pesi; l'addestramento richiede i pesi, i gradienti e lo stato dell'ottimizzatore per ogni parametro aggiornato, tutti residenti contemporaneamente, più le attivazioni conservate per il passaggio all'indietro. Un modello che serve comodamente su una scheda può essere diverse volte troppo grande per essere completamente rifinito su di essa. I metodi parameter-efficient aggiornano una piccola frazione dei parametri e richiedono una frazione corrispondentemente piccola della memoria extra, motivo per cui la maggior parte del fine-tuning qui ne utilizza uno.
Posso usare una scheda AMD, e ROCm funziona?
Sì. Le parti AMD Instinct sono tra le schede con più memoria che installiamo e spesso offrono il miglior valore per gigabyte, ma il vostro stack deve supportare ROCm anziché CUDA. La maggior parte dei runtime di inferenza attuali lo fa; alcuni strumenti circostanti ancora no. Chiedete prima di ordinare e lo verificheremo rispetto al vostro runtime specifico anziché rispondere in generale.

For the record

Everything on this sheet, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.