Boyutlandırma çalışma kağıdı · çıplak metal üzerinde dil modelleri · 2004'ten beri

Bir dil modelini çıplak metal üzerinde çalıştırmak için gerekenler.

Kararın akışına göre yukarıdan aşağıya doldurulur: model ağırlıkları belirler, hassasiyet onları ölçeklendirir, güvenlik payı çalışma zamanını ve konuşmayı karşılar ve toplam kartı adlandırır. Sipariş formundaki başka hiçbir şey yanıtı değiştirmez — iki gigabayt eksik bir kart daha yavaş çalışmaz, yüklenemez.

Çizen
Primcast LLC, kuruluş 2004
Karşılaştırılan
Sipariş kataloğu, sunum anında
Kayıtlı kartlar · en büyük
56 · 96 GB GDDR7 ECC
Bu kağıttaki fiyatlar
Yok — bkz. /gpu

Çalışma kağıdını doldurun Bir uyum neden yine de başarısız olabilir Üzerine ne kurarım

GPU'larınızı pasif aylık gelire dönüştürün

Atıl sunucu veya masaüstü GPU kurulumlarınız mı var? Bugün Primcast pazar yerinde listeleyin ve üretim düzeyinde işlem gücüne ihtiyaç duyan yapay zeka ekiplerinden, geliştiricilerden ve kuruluşlardan düzenli aylık kira kazanın.

Pazar Yerine Git

Çalışma kağıdı

Dört satır, tek hüküm.

Model
Hassasiyet
Görev

70B: 38 GB × 1.5 = 57 GB

Smallest card on the schedule that clears it (3 larger ones also do):

Instinct MI21064 GB HBM2e

The link opens the machine it goes in. What it costs is on /gpu — not on this sheet.

Satır 1 × satır 2 ağırlıklardır; satır 3, sitenin yayınlanmış çeyrek-ila-yarım güvenlik payı kuralının aritmetik halidir — llama.cpp veya Ollama üzerinde aynı anda tek kullanıcı için bir çeyrek daha, vLLM veya TGI üzerinde sürekli yığınlama ile sunum trafiği için yarım daha. Hüküm, sipariş kataloğundaki toplamı karşılayan en küçük kartı adlandırır ve gireceği makineye bağlantı verir. O makinenin maliyeti bilinçli olarak bu kağıtta yoktur: her rakam /gpu sayfasındadır, tam olarak ait olduğu makinenin karşısında.

Şek. 1

Ağırlıkların ağırlığı.

Parametreler çarpı parametre başına bayt ve hesaplamanın tamamı budur. On altı bitlik ağırlıkların her biri iki bayttır, sekiz bitlikler bir, dört bitlikler yarım bayttır. Niceleme, bir modeli tutamayan bir makineyi tutabilen bir makineye dönüştüren şeydir; kaliteye mal olur ve ne kadara mal olduğu yalnızca bit sayısından çok modele ve yönteme bağlıdır. Amaç doğruluksa, donanıma bağlanmadan önce ikisini de test edin — farkı teslimattan sonra keşfetmektense şimdi keşfetmek daha ucuzdur.

Bu rakamlar ağırlıklardır ve başka hiçbir şey değildir. Gereksinim değil, tabandırlar — insanları yanıltan kısım Şek. 2'dir.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Şek. 2 · etkileşimli

Bir kartın belleği, plana göre çizilmiş — ve sığan bir model neden yine de sunum yapmayı reddedebilir.

Bir GPU satın alımının en yaygın yanlış gitme biçimi, her seferinde aynı şekilde: model otuz sekiz gigabayt, kart kırk, yükleniyor — ve yaklaşık tek bir kısa konuşma tutuyor. Ağırlıklar orada yalnız değildir. İş yükünü kaydırın ve konuşmanın ne yaptığını izleyin.

ağırlıklar · sabit
çalışma zamanı
anahtar-değer önbelleği · büyür
boş
bir kartın belleği, %100

Tek kullanıcı, kısa bağlam: sıkı çarpan (×1,25) bunu karşılar.

  • Bir konuşmadaki her jeton, yeniden hesaplanmaması için anahtar-değer önbelleğinde bir girdi bırakır. Önbellek bağlam uzunluğuyla ve aynı anda sunulan her istekle birlikte büyür.
  • Aynı anda tek kullanıcı için ağırlıkların üzerine bir çeyrek daha, sunum trafiği için yarım daha ayırın — çalışma kağıdındaki iki çarpan ve sitenin kendi yayınlanmış kuralı.
  • Yakınsa, satın almadan önce sorun: model, niceleme, bağlam, eşzamanlılık. İlk haftada iade talebi olarak geri dönen bir sipariş almaktansa şimdi size uygun bir kart belirlemeyi tercih ederiz.

Şek. 3

Uyum matrisi: hangi kart hangi modeli karşılıyor.

Modelinize kadar aşağı, hassasiyete kadar yana okuyun. Her hücre, parça listesindeki o ağırlıkları sunum için yer bırakarak tutan en küçük kartı adlandırır ve gireceği makineye bağlantı verir. Hiçbir kartın tek başına karşılamadığı yerde hücre boş bırakmak yerine bunu söyler.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights
  • Sığan en küçük kart her zaman istediğiniz kart değildir. Bellek bir modelin çalışıp çalışmayacağına karar verir; kartla ilgili diğer her şey ne kadar hızlı ve aynı anda kaç kişi için çalışacağına karar verir. Bütçeden çok verim önemliyse, listede bir adım yukarı çıkın.
  • Eski kartlar yeni sayı biçimlerini konuşmaz. Listedeki birkaç parça FP8 ve bfloat16'dan önceye dayanır, bu yüzden bunları bekleyen bir çalışma zamanı daha yavaş bir şeye geri düşer veya reddeder. Sipariş vermeden önce belirli bir kartı ve belirli bir çalışma zamanını sormaya değer.
  • Bir AMD kart CUDA değil, ROCm çalıştırır. Instinct parçaları gigabayt başına mükemmel değer sunar ve birden fazla hücrede yanıttır, ancak yığınınızın ROCm'u desteklemesi gerekir. Güncel çalışma zamanlarının çoğu destekler; çevrelerindeki bazı araçlar hâlâ desteklemez. Sizinkini kontrol edin ya da sorun, sizinle birlikte kontrol edelim.
  • “Birden fazla kart” fiyatlandırdığımız bir yapıdır, bir ödeme seçeneği değil — kaç kartın sığacağı belirli kartın genişliğine ve kasanın güç bütçesine bağlıdır. Çoklu GPU ve çoklu düğüm o kağıttır. O boyuttaki diğer yanıt, işlemcinin ve GPU'nun tek bir makinede paylaştığı 128 GB bellektir: NVIDIA DGX Spark kiralamak.

Liste A

Parça listesi: yayınlanmış bellek rakamıyla uyduğumuz her kart.

Önce en büyük — bu kağıt “çalıştırabileceğim en büyük şey nedir” sorusunu yanıtlar; aynı kataloğu en ucuz komple makineye göre sıralayan GPU özel sunucuları sayfasının tersidir, çünkü o “bunun maliyeti nedir” sorusunu yanıtlar. Üreticisinin belleğini yayınlamadığı bir kart tahmin edilmek yerine listeden çıkarılır.

Birkaç parça birden fazla kasada, bazen farklı fiyatlarla görünür ve alttaki makinenin veri yolu nesli modern bir kartın gerçekte ne yapabileceğini değiştirir — her ikisi de GPU özel sunucuları sayfasındadır. Şu anda rafta hazır bekleyen şey yine farklı bir sorudur ve anında sunucular tarafından yanıtlanır.

Referans

Adlandırılmış modeller, satırlara eşlenmiş.

İnsanların buraya getirdiği açık ağırlıklı aileler ve Şek. 1'deki hangi satırın geçerli olduğunu söyleyen yayınlanmış parametre sayısıyla birlikte. Parametre sayıları yayıncıların kendilerinindir; uyum sorusu için modelle ilgili başka hiçbir şey önemli değildir. Bu listede olmayan bir model tam olarak aynı şekilde boyutlandırılır — parametreler × parametre başına bayt, artı güvenlik payı. Her ay yeni aileler çıkıyor; aritmetik yerinden oynamıyor.

Not 1 · uzmanların karışımı

“3B etkinli 30B” bir model, 30B'lik bir modelin belleğine ihtiyaç duyar ve 3B'lik bir modelin hızına yakın çalışır: her uzman bellekte yerleşik olmalıdır, çünkü farklı jetonlar farklı uzmanları uyandırır. Her zaman toplam parametre sayısından boyutlandırın.

AileBoyutlarSatır
Llama 3.1 / 3.3 Meta8B · 70B7–8B ve 3.3 sürümü için 70B
Qwen3 Alibaba8B · 14B · 32Bİlk üç satır
DeepSeek-R1 damıtımları7B – 70BSatır başına bir tane — kartınızın tuttuğu damıtımı seçin
Mistral Small 3 Mistral AI24B2. ve 3. satırlar arasında; etiketten değil, aritmetikten boyutlandırın
Gemma 3 Google12B · 27B2. satır ve 3. satırın hemen altı
Phi-4 Microsoft14B2. satır
gpt-oss OpenAI20B · 120BYerel olarak 4-bit yayınlandı: bir 16 GB kart ve bir 80 GB kart

Kurulum notları

Çalışma zamanı sizindir. Çıplak metalin amacı budur.

Makine temiz bir işletim sistemi ve root ile gelir. Modelinizin önünde satıcı çıkarım hizmeti yok, bir teslim tarihinden önceki hafta kendini yükselten yönetilen çalışma zamanı yok. vLLM ve Ollama her ikisi de OpenAI uyumlu bir uç noktada yanıt verir — bir API sağlayıcısına karşı yazılmış kod, tek bir temel URL'yi değiştirerek kendi makinenize işaret eder. Sürücüyü, CUDA veya ROCm sürümünü ve çerçeveyi kodunuzun test edildiği sürümlere sabitleyin; altınızda hiçbir şey hareket etmez. Sürücünün teslimattan önce kurulmasını tercih ederseniz, siparişte belirtin ve sürümü adlandırın.

  1. vLLM — gerçek trafiği sunmak. Sürekli yığınlama ve sayfalı dikkat, bir kartın aynı anda birçok isteği yanıtlamasını sağlar: bir demo ile bir hizmet arasındaki fark. Makul ölçüde modern bir kart ister.
  2. llama.cpp — bellek dar veya kart eski olduğunda. Niceleme biçimleri, büyük bir modelin küçük bir karta sığabilmesinin nedenidir; ağırlıklar tam olarak sığmadığında işlemciyi ve kartı birlikte kullanır.
  3. TGI · SGLang — aynı aileden üretim sunucuları; yapılandırılmış çıktı, önek yeniden kullanımı ve çoklu model sunumu konularında farklı güçlere sahiptir. Burada değiştirilmeden çalışır.
  4. Ollama — boş bir makineden bir bağlantı noktasında yanıt veren bir modele giden en kısa yol. Boyutlandırmanızın doğru olup olmadığını on dakikada söyler.

Saha koşulları

Kendi makinenizin yapıp bir API'nin yapamadığı şeyler.

İstemler binayı asla terk etmez

Ağırlıklar, istemler, getirilen belgeler ve üretilen her jeton yalnızca sizin oturum açabildiğiniz donanımda kalır. Amsterdam veya Bükreş ve veriler AB'de durur; New York, Miami veya San Francisco ve ABD'de durur. Bir gizlilik sorumlusuna hesap veren iş yükleri için bu cümle tüm iş gerekçesidir.

Sayaç asla çalışmaz

Jeton başına faturalandıran bir API her jetonu faturalandırır ve bir ajan veya toplu iş hattı tüm gün jeton üretir. Özel bir makine her hacimde her ay aynı rakamdır ve altında sınırsız bant genişliği bulunur — giren ağırlıklar ve çıkan jetonlar bağlantı noktasının ötesinde hiçbir şeye mal olmaz. Hangi rakam olduğu, bu kağıdın değil /gpu sayfasının dolduracağı satırdır.

Kimse altınızda modeli hız sınırına tabi tutmaz, kullanımdan kaldırmaz veya değiştirmez

Sabitlediğiniz model altı ay sonra değişmeden yanıt verir. Dakika başına istek tavanı yok, başka birinin yoğun saatinde kuyruk yok, kullanımdan kaldırma bildirimi yok. Takas dürüsttür: yükseltmeler sizindir, sizin takviminize göre.

Modelin yanındaki işin bir evi var

Getirme bir gömme modeli, bir vektör deposu ve hızlı disk ister; ajanlar araçları çalıştırmak için alan ister. Depo için NVMe, hat için işlemci çekirdekleri, jetonlar için kart — hepsini tek bir makine taşır.

Not 2 · derecelendirmeler

Bu kağıtta saniye başına jeton rakamı görünmez.

Bilinçli olarak. Böyle her sayı modele, nicelemeye, çalışma zamanına ve sürümüne, yığın boyutuna, istem uzunluğuna, yanıt uzunluğuna ve eşzamanlılığa bağlıdır — herhangi birini değiştirin ve bir kat farkla oynar. Bunların hepsini taşımayan bir manşet rakamı iyi görünmek için seçilmiş bir sayıdır ve biz onunla alıntılanırdık. Onu yöneten şey: istemi okumak hesaplama bağımlıdır ve istek başına bir kez olur; yanıtı üretmek bellek bant genişliği bağımlıdır, çünkü her jeton ağırlıkların okunmasını gerektirir; yığınlama bu okumayı eşzamanlı isteklere yayar, ta ki anahtar-değer önbelleğinde yer kalmayana kadar. Yine güvenlik payı.

Bunun yerine gerçek bir yanıt isteyin

Bize modeli, kullanmayı düşündüğünüz nicelemeyi, bağlam uzunluğunu ve kabaca kaç eşzamanlı istek olacağını söyleyin. Karşılaştırılabilir bir şey çalıştırdıysak ne gördüğümüzü ve ne üzerinde gördüğümüzü söyleriz. Çalıştırmadıysak, onu da söyleriz.

Her günün her saati — telefon, sohbet ve biletler. Destek sayfasında yanıt süreleri yazılıdır.

Not 3 · ince ayar

Eğitim, sunumdan önemli ölçüde daha fazla alan gerektirir.

Sunum ağırlıklara ihtiyaç duyar. Eğitim; ağırlıklara, gradyanlara ve güncellediği her parametre için optimize edicinin durumuna ihtiyaç duyar; hepsi aynı anda bellekte yerleşik olmalıdır, ayrıca geri geçiş için tutulan aktivasyonlar — bir kartta rahatça sunum yapan bir model, üzerinde tam ince ayar yapmak için birkaç kat fazla büyük olabilir. Parametre verimli yöntemler parametrelerin küçük bir kısmını günceller ve buna karşılık gelen küçük bir ek bellek kısmına ihtiyaç duyar; buradaki ince ayarın çoğunun birini kullanmasının nedeni budur. Eğitim döngüsü ayrıca işlemci-kart bağlantısı üzerinden sürekli olarak yığınlar akıtır, bu yüzden alttaki makinenin PCIe nesli orada sunumda olmadığı şekilde gerçek bir kısıttır — hangi platformun bir karta hangi bağlantıyı verdiği GPU özel sunucuları sayfasındadır. Bize modeli, yöntemi, dizi uzunluğunu ve veri kümesi boyutunu söyleyin; teslimattan sonra keşfetmenizi sağlamak yerine boyutlandıralım; birden fazla kart çoklu GPU ve çoklu düğüm sayfasının konusudur.

Sorulan sorular

Bu sayfanın önceki sürümlerinde soruldu.

İnsanların sohbette ve destek taleplerinde bize gerçekten sorduklarından, yaklaşık olarak sorulma sırasına göre derlendi. İlk üçü, bir satın almanın işe yarayıp yaramayacağını belirleyen sorulardır.

Büyük bir dil modelinin ne kadar GPU belleğine ihtiyacı vardır?
Ağırlıklar, parametre sayısının parametre başına bayt sayısıyla çarpımıdır: 16 bitte parametre başına iki bayt, 8 bitte bir bayt, 4 bitte yarım bayt. 7–8 milyar parametreli bir modelin ağırlıkları 16 bitte 16 GB, 8 bitte 8 GB ve 4 bitte 5 GB tutar; 70 milyar parametreli bir modelin ağırlıkları ise 140 GB, 70 GB ve 38 GB tutar. Bu rakamlar yalnızca ağırlıklardır ve bir gereksinimden çok bir alt sınırdır — çalışma zamanı, aktivasyonlar ve anahtar-değer önbelleği için üzerine dörtte bir ila yarım oranında daha pay ayırın.
Llama 3.3 gibi bir 70B modeli çalıştırmak için neye ihtiyacım var?
4 bitte ağırlıklar yaklaşık 38 GB tutar, bu nedenle sunum için gereken boşluk payıyla birlikte cevap 64 GB veya daha fazla belleğe sahip bir karttır — tek kart, tek makine. 8 bitte ağırlıklar 70 GB tutar ve 80 GB'lık bir kart bu çıtayı aşar. Tam 16 bit hassasiyette taktığımız hiçbir tek kart onu taşıyamaz ve bu, fiyat teklifi verdiğimiz çok kartlı bir yapıya dönüşür. Yukarıdaki Şekil 3 tam kartları adlandırır; fiyatlar GPU dedicated servers sayfasındadır.
Modelim neden yükleniyor ama sunum yapamıyor?
Çünkü kart belleğindeki tek şey ağırlıklar değildir. Çalışma zamanı ve arabellekleri bellekte yerleşiktir ve bir konuşmadaki her token, yeniden hesaplanmak zorunda kalmasın diye anahtar-değer önbelleğinde bir girdi bırakır. Bu önbellek bağlam uzunluğuyla ve eşzamanlı olarak sunulan her istekle birlikte büyür; bu nedenle ağırlıkları zar zor sığan bir model yaklaşık olarak tek bir kısa konuşmayı tutabilir. Kartı, ağırlıkların bir buçuk katı ila bir buçuk katı arasında boyutlandırın.
Hangi çıkarım çalışma zamanını kurabilirim?
Hepsini. Makine temiz bir işletim sistemi ve root yetkisiyle gelir ve önünde hiçbir satıcı çıkarım hizmeti yoktur. Gerçek trafiği sunmak için olağan cevap vLLM'dir çünkü sürekli yığınlama, tek bir kartın aynı anda birçok isteği yanıtlamasını sağlar. Bellek sınırlıysa veya kart eskiyse olağan cevap llama.cpp'dir. TGI ve SGLang değiştirilmeden çalışır. Ollama, boş bir makineden bir bağlantı noktasında yanıt veren bir modele giden en kısa yoldur — ve hem vLLM hem de Ollama OpenAI uyumlu bir uç noktada yanıt verir, böylece mevcut istemci kodu tek bir temel URL'yi değiştirerek kendi makinenize işaret eder. Sürücüyü, CUDA veya ROCm sürümünü ve çerçeveyi, kodunuzun test edildiği sürümlere sabitlersiniz.
Bir LLM'yi kendi sunucumda barındırmak token başına API'den daha mı ucuz?
Tamamen hacme bağlıdır ve kesişim noktası gerçektir: bir API token başına faturalandırır ve boştayken hiçbir maliyeti yoktur; adanmış bir makine sabit bir aylık rakamdır ve meşgulken ekstra maliyeti yoktur. Sürekli trafik, tüm gün çalışan ajanlar, toplu iş hatları ve gizlilik gereksinimi olan her şey kendi donanımında öne çıkma eğilimindedir; günde on kez çalışan bir iş yükü ise çıkmaz. Bu hesabı yapmak için gereken aylık rakamlar GPU dedicated servers sayfasındadır — bu sayfa bilinçli olarak hiçbir fiyat vermez.
Saniyede kaç token alırım?
Saniye başına token rakamı yayınlamıyoruz, çünkü bu tür her sayı modele, nicemlemeye, çalışma zamanına ve sürümüne, yığın boyutuna, istem uzunluğuna, yanıt uzunluğuna ve eşzamanlılığa bağlıdır ve herhangi birini değiştirmek sonucu katlarıyla oynatır. Bunu yöneten şey: istemi okumak hesaplama sınırlıdır ve istek başına bir kez gerçekleşir; yanıtı üretmek bellek bant genişliği sınırlıdır çünkü her token ağırlıkların okunmasını gerektirir; ve yığınlama bu okumayı eşzamanlı isteklere yayar, bu da anahtar-değer önbelleği yer kalmayana kadar sunumu ekonomik kılan şeydir. Gerçekte gözlemlediklerimize dayalı bir cevap için model, nicemleme ve beklenen eşzamanlılıkla birlikte sorun.
GPU başka biriyle paylaşılıyor mu?
Hayır. Fiziksel makine başına tek kiracı vardır ve kart kendi işletim sisteminize doğrudan geçirilir. Hipervizör, MIG bölümü, vGPU profili veya zaman dilimleme zamanlayıcısı yoktur; bu nedenle kartta başka hiçbir şey çalışmaz ve çıkarım gecikmesi başka birinin toplu işi yüzünden değişmez.
Model tek karta sığmazsa ne olur?
O zaman bu çok kartlı bir yapıdır ve bir ödeme sayfasından sipariş edilmek yerine fiyat teklifi verilir: kaç kartın sığacağı, belirli kartın fiziksel genişliğine ve kasanın güç bütçesine bağlıdır. İki kart, yalnızca çalışma zamanı modeli ikisine bölebiliyorsa belleklerinin toplamını verir; her ciddi çalışma zamanı bunu bir miktar verim maliyetiyle destekler. Birden fazla kart veya makine bu yapının nasıl göründüğünü anlatır.
İnce ayar, sunumdan daha fazla bellek mi gerektirir?
Çok daha fazlasını. Sunum ağırlıkları gerektirir; eğitim ise ağırlıkları, gradyanları ve güncellenen her parametre için optimize edici durumunu, hepsi aynı anda bellekte, artı geri geçiş için tutulan aktivasyonları gerektirir. Tek kartta rahatça sunulan bir model, o kartta tam ince ayar yapmak için birkaç kat fazla büyük olabilir. Parametre verimli yöntemler parametrelerin küçük bir kısmını günceller ve buna karşılık gelen küçük bir ek bellek payına ihtiyaç duyar; buradaki ince ayarın çoğunun birini kullanmasının nedeni budur.
AMD kart çalıştırabilir miyim ve ROCm çalışır mı?
Evet. AMD Instinct parçaları taktığımız en büyük belleğe sahip kartlar arasındadır ve genellikle gigabayt başına en iyi değeri sunar, ancak yığınınızın CUDA yerine ROCm'u desteklemesi gerekir. Güncel çıkarım çalışma zamanlarının çoğu destekler; çevredeki bazı araçlar hâlâ desteklemez. Sipariş vermeden önce sorun, genel bir cevap vermek yerine belirli çalışma zamanınıza göre kontrol edelim.

For the record

Everything on this sheet, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.