Fișă de dimensionare · modele de limbaj pe metal gol · din 2004

Ce presupune rularea unui model de limbaj pe metal gol.

Se completează de sus, în ordinea deciziei: modelul stabilește ponderile, precizia le scalează, marja de siguranță acoperă runtime-ul și conversația, iar totalul indică placa. Nimic altceva din formularul de comandă nu schimbă răspunsul — o placă cu doi gigaocteți mai puțin nu rulează mai lent, ci nu se încarcă deloc.

Întocmit de
Primcast LLC, fondată în 2004
Verificat cu
Catalogul de comenzi, la momentul servirii
Plăci înregistrate · cea mai mare
56 · 96 GB GDDR7 ECC
Prețuri pe această fișă
Niciunul — vezi /gpu

Completează fișa De ce o potrivire poate eșua totuși Ce instalez pe ea

Transformă-ți GPU-urile în venit lunar pasiv

Ai configurații GPU de server sau desktop nefolosite? Listează-le astăzi pe piața Primcast și câștigă chirii lunare constante de la echipe AI, dezvoltatori și întreprinderi care au nevoie de putere de calcul de nivel de producție.

Mergi la Marketplace

Fișă de lucru

Patru rânduri, un verdict.

Modelul
Precizia
Sarcina

70B: 38 GB × 1.5 = 57 GB

Smallest card on the schedule that clears it (3 larger ones also do):

Instinct MI21064 GB HBM2e

The link opens the machine it goes in. What it costs is on /gpu — not on this sheet.

Rândul 1 × rândul 2 reprezintă ponderile; rândul 3 este regula publicată a site-ului, de la un sfert la jumătate de marjă, exprimată aritmetic — un sfert în plus pentru un utilizator la un moment dat pe llama.cpp sau Ollama, jumătate în plus pentru servirea traficului cu procesare continuă în loturi pe vLLM sau TGI. Verdictul indică cea mai mică placă din catalogul de comenzi care depășește totalul și trimite către mașina în care se montează. Cât costă acea mașină nu apare în mod deliberat pe această fișă: toate cifrele sunt pe /gpu, lângă mașina exactă căreia îi aparțin.

Fig. 1

Cât cântăresc ponderile.

Parametri înmulțiți cu octeți per parametru, iar acesta este întregul calcul. Ponderile pe șaisprezece biți au câte doi octeți fiecare, cele pe opt biți au unul, cele pe patru biți au jumătate. Cuantizarea este cea care transformă o mașină ce nu poate găzdui un model într-una care poate; costă calitate, iar cât de mult depinde de model și de metodă mult mai mult decât de numărul de biți în sine. Dacă acuratețea este scopul exercițiului, testează ambele variante înainte de a te angaja la hardware — diferența este mai ieftin de descoperit acum decât după livrare.

Aceste cifre reprezintă ponderile și nimic altceva. Sunt pragul minim, nu cerința — Fig. 2 este partea care îi prinde pe oameni pe nepregătite.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Fig. 2 · interactivă

Memoria unei plăci, desenată la scară — și de ce un model care încape poate totuși refuza să servească.

Cel mai frecvent mod în care o achiziție de GPU merge prost, de fiecare dată la fel: modelul are treizeci și opt de gigaocteți, placa are patruzeci, se încarcă — și susține aproximativ o conversație scurtă. Ponderile nu sunt singure acolo. Glisează sarcina de lucru și urmărește ce face conversația.

ponderi · fixe
runtime
cache cheie-valoare · crește
liber
memoria unei plăci, 100 %

Un utilizator, context scurt: multiplicatorul strict (×1,25) acoperă acest caz.

  • Fiecare token dintr-o conversație lasă o intrare în cache-ul cheie-valoare, ca să nu fie recalculat. Cache-ul crește odată cu lungimea contextului și din nou cu fiecare cerere servită simultan.
  • Bugetează un sfert în plus peste ponderi pentru un utilizator la un moment dat, jumătate în plus pentru servirea traficului — cei doi multiplicatori de pe fișa de lucru și regula publicată a site-ului.
  • Dacă este la limită, întreabă înainte să cumperi: model, cuantizare, context, concurență. Preferăm să îți dimensionăm acum o placă decât să primim o comandă care revine ca cerere de rambursare în prima săptămână.

Fig. 3

Matricea de potrivire: ce placă acoperă ce model.

Citește în jos până la modelul tău, apoi în lateral până la precizie. Fiecare celulă indică cea mai mică placă din lista de componente care găzduiește acele ponderi cu spațiu rămas pentru servire și trimite către mașina în care se montează. Acolo unde nimic nu o acoperă singură, celula spune acest lucru în loc să lase un spațiu gol.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights
  • Cea mai mică placă care încape nu este întotdeauna placa pe care o vrei. Memoria decide dacă un model rulează; tot restul plăcii decide cât de repede și pentru câți oameni simultan. Dacă debitul contează mai mult decât bugetul, urcă o treaptă în listă.
  • Plăcile mai vechi nu cunosc formatele numerice mai noi. Mai multe componente din listă sunt anterioare FP8 și bfloat16, așa că un runtime care le așteaptă va reveni la ceva mai lent sau va refuza. Merită să întrebi despre o anumită placă și un anumit runtime înainte de a comanda.
  • O placă AMD rulează ROCm, nu CUDA. Componentele Instinct au un raport excelent valoare per gigaoctet și sunt răspunsul în mai mult de o celulă, dar stiva ta trebuie să suporte ROCm. Majoritatea runtime-urilor actuale o fac; unele instrumente din jurul lor încă nu. Verifică-le pe ale tale sau întreabă, iar noi le verificăm împreună cu tine.
  • „Mai mult de o placă” este o configurație pe care o cotăm, nu o opțiune de checkout — câte plăci încap depinde de lățimea plăcii specifice și de bugetul de putere al șasiului. Multi-GPU și multi-nod este acea fișă. Cealaltă soluție la acea dimensiune sunt 128 GB de memorie partajată între procesor și GPU, într-o singură mașină: închirierea unui NVIDIA DGX Spark.

Lista A

Lista de componente: fiecare placă pe care o montăm, cu o cifră de memorie publicată.

Cele mai mari întâi — această fișă răspunde la „care este cel mai mare lucru pe care îl pot rula”, invers față de servere dedicate GPU, care sortează același catalog după cea mai ieftină mașină completă, pentru că răspunde la „cât costă aceasta”. O placă a cărei memorie producătorul nu o publică este omisă, nu estimată.

Mai multe componente apar pe mai mult de un șasiu, uneori la prețuri diferite, iar generația de magistrală a mașinii de dedesubt schimbă ce poate face efectiv o placă modernă — ambele sunt pe servere dedicate GPU. Ce este montat în rack și gata chiar acum este o altă întrebare, la care răspund serverele instant.

Referință

Modele cunoscute, mapate pe rânduri.

Familiile cu ponderi deschise pe care oamenii le aduc aici, cu numărul de parametri publicat care indică ce rând din Fig. 1 se aplică. Numărul de parametri este cel al editorilor; nimic altceva despre un model nu contează pentru problema potrivirii. Un model care nu este pe această listă se dimensionează exact la fel — parametri × octeți per parametru, plus marja de siguranță. Familii noi apar lunar; aritmetica nu se schimbă.

Nota 1 · mixture-of-experts

Un model „30B cu 3B activi” are nevoie de memoria unui model de 30B și rulează mai aproape de viteza unui model de 3B: fiecare expert trebuie să fie rezident, pentru că tokenuri diferite activează experți diferiți. Dimensionează întotdeauna după numărul total de parametri.

FamilieDimensiuniRând
Llama 3.1 / 3.3 Meta8B · 70B7–8B, și 70B pentru versiunea 3.3
Qwen3 Alibaba8B · 14B · 32BPrimele trei rânduri
DeepSeek-R1 distilate7B – 70BUnul per rând — alege distilatul pe care îl susține placa ta
Mistral Small 3 Mistral AI24BÎntre rândurile 2 și 3; dimensionează-l după aritmetică, nu după etichetă
Gemma 3 Google12B · 27BRândul 2, și chiar sub rândul 3
Phi-4 Microsoft14BRândul 2
gpt-oss OpenAI20B · 120BPublicat nativ pe 4 biți: o placă de 16 GB și o placă de 80 GB

Note de instalare

Runtime-ul este al tău. Acesta este rostul metalului gol.

Mașina ajunge cu un sistem de operare curat și acces root. Fără serviciu de inferență al furnizorului în fața modelului tău, fără runtime gestionat care se actualizează singur cu o săptămână înainte de un termen limită. vLLM și Ollama răspund ambele pe un endpoint compatibil OpenAI — codul scris pentru un furnizor de API indică spre propria ta mașină schimbând un singur URL de bază. Fixează driverul, versiunea CUDA sau ROCm și framework-ul la versiunile pe care a fost testat codul tău; nimic nu se mișcă sub tine. Dacă preferi ca driverul să fie instalat înainte de predare, menționează acest lucru în comandă și specifică versiunea.

  1. vLLM — pentru servirea traficului real. Procesarea continuă în loturi și atenția paginată permit unei plăci să răspundă la multe cereri simultan: diferența dintre un demo și un serviciu. Necesită o placă relativ modernă.
  2. llama.cpp — memorie limitată sau placă mai veche. Formatele sale cuantizate sunt motivul pentru care un model mare încape pe o placă mică; va folosi procesorul și placa împreună atunci când ponderile nu încap chiar complet.
  3. TGI · SGLang — servere de producție din aceeași familie, cu puncte forte diferite în privința ieșirii structurate, reutilizării prefixelor și servirii mai multor modele. Rulează aici neschimbate.
  4. Ollama — cea mai scurtă cale de la o mașină goală la un model care răspunde pe un port. Zece minute îți spun dacă dimensionarea a fost corectă.

Condiții de amplasament

Ce face propria ta mașină și un API nu poate.

Prompturile nu părăsesc niciodată clădirea

Ponderile, prompturile, documentele recuperate și fiecare token generat rămân pe hardware la care doar tu te poți autentifica. Amsterdam sau București, iar datele stau în UE; New York, Miami sau San Francisco, iar datele stau în SUA. Pentru sarcinile de lucru care răspund în fața unui responsabil cu confidențialitatea, această frază este întregul argument de afaceri.

Contorul nu pornește niciodată

Un API per token facturează fiecare token, iar un agent sau o conductă de procesare în lot generează tokenuri toată ziua. O mașină dedicată înseamnă aceeași sumă în fiecare lună, la orice volum, cu lățime de bandă nemăsurată dedesubt — ponderile care intră și tokenurile care ies nu costă nimic dincolo de port. Care este acea sumă este rândul pe care îl completează /gpu, nu această fișă.

Nimeni nu îți limitează rata, nu depreciază și nu schimbă modelul pe sub tine

Modelul pe care îl fixezi răspunde neschimbat peste șase luni. Fără plafon de cereri pe minut, fără coadă la ora aglomerată a altcuiva, fără notificare de retragere. Schimbul este onest: upgrade-urile sunt ale tale, după programul tău.

Munca de lângă model are un cămin

Recuperarea informațiilor cere un model de embedding, un depozit vectorial și disc rapid; agenții au nevoie de spațiu pentru a rula instrumente. NVMe pentru depozit, nuclee de procesor pentru conductă, placa pentru tokenuri — o singură mașină le duce pe toate.

Nota 2 · evaluări

Pe această fișă nu apare nicio cifră de tokenuri pe secundă.

În mod deliberat. Fiecare astfel de număr depinde de model, de cuantizare, de runtime și de versiunea sa, de dimensiunea lotului, de lungimea promptului, de lungimea răspunsului și de concurență — schimbă oricare dintre ele și se modifică de mai multe ori. Un număr de titlu care nu poartă toate acestea este un număr ales ca să arate bine, iar noi am fi citați cu el. Ce îl guvernează: citirea promptului este limitată de calcul și are loc o dată per cerere; generarea răspunsului este limitată de lățimea de bandă a memoriei, pentru că fiecare token necesită citirea ponderilor; procesarea în loturi amortizează acea citire pe cereri concurente, până când cache-ul cheie-valoare rămâne fără spațiu. Din nou marja de siguranță.

Cere în schimb un răspuns real

Spune-ne modelul, cuantizarea pe care intenționezi să o folosești, lungimea contextului și aproximativ câte cereri concurente. Dacă am rulat ceva comparabil, îți spunem ce am observat și pe ce. Dacă nu, îți spunem și asta.

În fiecare oră din fiecare zi — telefon, chat și tichete. Suportul are timpii de răspuns în scris.

Nota 3 · fine-tuning

Antrenarea are nevoie de considerabil mai mult spațiu decât servirea.

Servirea are nevoie de ponderi. Antrenarea are nevoie de ponderi, de gradienți și de starea optimizatorului pentru fiecare parametru actualizat, toate rezidente simultan, plus activările păstrate pentru pasul înapoi — un model care servește confortabil pe o placă poate fi de câteva ori prea mare pentru a fi complet ajustat fin pe ea. Metodele eficiente în parametri actualizează o fracțiune mică din parametri și au nevoie de o fracțiune corespunzător de mică din memoria suplimentară, motiv pentru care majoritatea fine-tuning-ului de aici folosește una dintre ele. Bucla de antrenare transmite, de asemenea, loturi continuu prin legătura procesor-placă, așa că generația PCIe a mașinii de dedesubt este o constrângere reală acolo, într-un mod în care nu este pentru servire — ce platformă oferă unei plăci ce legătură este pe servere dedicate GPU. Spune-ne modelul, metoda, lungimea secvenței și dimensiunea setului de date, iar noi o dimensionăm în loc să descoperi după livrare; mai mult de o placă este fișa multi-GPU și multi-nod.

Întrebări ridicate

Adresate la revizuirile anterioare ale acestei fișe.

Preluate din ceea ce ne întreabă oamenii efectiv pe chat și în tichete, aproximativ în ordinea în care le adresează. Primele trei sunt cele care decid dacă o achiziție funcționează.

Câtă memorie GPU necesită un model de limbaj de mari dimensiuni?
Greutățile reprezintă numărul de parametri înmulțit cu octeții per parametru: doi octeți fiecare la 16 biți, unul la 8 biți, jumătate la 4 biți. Un model de 7–8 miliarde de parametri înseamnă 16 GB de greutăți la 16 biți, 8 GB la 8 biți și 5 GB la 4 biți; un model de 70 de miliarde de parametri înseamnă 140 GB, 70 GB și 38 GB. Aceste cifre reprezintă doar greutățile și sunt un prag minim, nu o cerință — bugetați în plus un sfert până la jumătate pentru runtime, activări și cache-ul cheie-valoare.
Ce îmi trebuie pentru a rula un model de 70B precum Llama 3.3?
La 4 biți greutățile sunt de aproximativ 38 GB, deci cu spațiu de manevră pentru servire răspunsul este o placă de 64 GB sau mai mult — o singură placă, o singură mașină. La 8 biți greutățile sunt de 70 GB, iar o placă de 80 GB depășește pragul. La precizie completă de 16 biți nicio placă pe care o instalăm nu îl poate susține, devenind o configurație multi-placă pe care o cotăm. Fig. 3 de mai sus numește plăcile exacte; prețurile sunt pe servere dedicate GPU.
De ce modelul meu se încarcă, dar nu reușește să servească?
Pentru că greutățile nu sunt singurul lucru din memoria plăcii. Runtime-ul și bufferele sale sunt rezidente, iar fiecare token dintr-o conversație lasă o intrare în cache-ul cheie-valoare, astfel încât să nu fie nevoie să fie recalculat. Acel cache crește odată cu lungimea contextului și din nou cu fiecare cerere servită simultan, deci un model ale cărui greutăți abia încap va susține aproximativ o singură conversație scurtă. Dimensionați placa la o dată și un sfert până la o dată și jumătate din greutăți.
Ce runtime de inferență pot instala?
Oricare dintre ele. Mașina sosește cu un sistem de operare curat și acces root, iar în fața sa nu există niciun serviciu de inferență al furnizorului. vLLM este răspunsul obișnuit pentru servirea traficului real, deoarece procesarea în loturi continue permite unei singure plăci să răspundă la mai multe cereri simultan. llama.cpp este răspunsul obișnuit când memoria este limitată sau placa este mai veche. TGI și SGLang rulează nemodificate. Ollama este cea mai scurtă cale de la o mașină goală la un model care răspunde pe un port — iar vLLM și Ollama răspund ambele pe un endpoint compatibil OpenAI, astfel încât codul client existent indică spre propria mașină prin schimbarea unui singur URL de bază. Fixați driverul, versiunea CUDA sau ROCm și framework-ul la versiunile pe care a fost testat codul dumneavoastră.
Este auto-găzduirea unui LLM mai ieftină decât un API per token?
Depinde în întregime de volum, iar punctul de intersecție este real: un API facturează per token și nu costă nimic când este inactiv; o mașină dedicată are o sumă lunară fixă și nu costă nimic în plus când este ocupată. Traficul constant, agenții care rulează toată ziua, pipeline-urile batch și orice cu cerințe de confidențialitate tind să iasă în avantaj pe hardware propriu; o sarcină de lucru care se declanșează de zece ori pe zi nu. Cifrele lunare pentru a face acest calcul sunt pe servere dedicate GPU — această fișă în mod deliberat nu afișează prețuri.
Câți tokeni pe secundă voi obține?
Nu publicăm o cifră de tokeni pe secundă, deoarece fiecare astfel de număr depinde de model, cuantizare, runtime și versiunea sa, dimensiunea lotului, lungimea promptului, lungimea răspunsului și concurență, iar schimbarea oricăruia îl modifică de un multiplu. Ce îl guvernează: citirea promptului este limitată de calcul și are loc o dată per cerere; generarea răspunsului este limitată de lățimea de bandă a memoriei, deoarece fiecare token necesită citirea greutăților; iar procesarea în loturi amortizează acea citire pe cererile concurente, ceea ce face servirea economică până când cache-ul cheie-valoare rămâne fără spațiu. Întrebați cu modelul, cuantizarea și concurența așteptată pentru un răspuns bazat pe ceea ce am observat efectiv.
Este GPU-ul partajat cu altcineva?
Nu. Un singur chiriaș per mașină fizică, iar placa este pasată direct către propriul sistem de operare. Nu există hypervisor, partiție MIG, profil vGPU sau planificator de time-slicing, deci nimic altceva nu rulează pe placă, iar latența de inferență nu se modifică din cauza jobului batch al altcuiva.
Ce se întâmplă dacă modelul nu încape pe o singură placă?
Atunci este o configurație multi-placă, care se cotează, nu se comandă dintr-un checkout: câte plăci încap depinde de lățimea fizică a plăcii specifice și de bugetul de putere al șasiului. Două plăci oferă suma memoriei lor doar dacă runtime-ul poate împărți modelul pe ambele, ceea ce orice runtime serios suportă cu un anumit cost de debit. Mai mult de o placă sau mașină acoperă cum arată acea configurație.
Fine-tuning-ul necesită mai multă memorie decât servirea?
Considerabil mai multă. Servirea necesită greutățile; antrenarea necesită greutățile, gradienții și starea optimizatorului pentru fiecare parametru actualizat, toate rezidente simultan, plus activările păstrate pentru pasul înapoi. Un model care se servește confortabil pe o singură placă poate fi de câteva ori prea mare pentru a fi complet fine-tuned pe aceasta. Metodele eficiente în parametri actualizează o fracțiune mică din parametri și necesită o fracțiune corespunzător de mică din memoria suplimentară, motiv pentru care majoritatea fine-tuning-ului de aici folosește una.
Pot rula o placă AMD și funcționează ROCm?
Da. Componentele AMD Instinct sunt printre plăcile cu cea mai mare memorie pe care le instalăm și sunt frecvent cea mai bună valoare per gigabyte, dar stiva dumneavoastră trebuie să suporte ROCm, nu CUDA. Majoritatea runtime-urilor actuale de inferență o fac; unele instrumente adiacente încă nu. Întrebați înainte de a comanda și vom verifica în raport cu runtime-ul dumneavoastră specific, nu vom răspunde în general.

For the record

Everything on this sheet, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.