Donanım üzerinde dil modelleri · Primcast LLC · 2004'ten beri

Bellek miktarını model belirler. Sipariş formunda başka hiçbir şey belirlemez.

İnsanlar bu sayfaya hangi hızlandırıcıyı seçeceklerine karar vererek geliyorlar. Ama durum böyle değil. Ağırlıklar ya kart belleğine sığar ya da sığmaz; iki gigabayt eksik bir kart daha yavaş çalışmaz, yüklenemez. Bu nedenle bu sayfa, kararın gerçekte nasıl verildiği sırasına göre düzenlenmiştir: model ne kadar büyük, hangi hassasiyette çalıştıracaksınız, görüşme için ne kadar alana ihtiyaç var ve ancak o zaman hangi kart çıtayı aşar. Fiyatlar kasıtlı olarak bir sayfa ötede yer alıyor.

Hangi kart modelimi çalıştırıyor? Üzerine ne kuruyorum?

Makine başına bir kiracı. Kart, işletim sisteminize aktarılır ve çalışma zamanı, sürücü ve çerçeve sürümlerini seçme ve sabitleme yetkisi size aittir.

Birinci adım

Ağırlıkların gerçek ağırlıkları.

Parametreler, parametre başına bayt sayısı ile çarpılır ve tüm hesaplama bu kadardır. On altı bitlik ağırlıklar iki bayt, sekiz bitlik ağırlıklar bir bayt, dört bitlik ağırlıklar ise yarım bayttır. On altı bitlik yedi milyar parametreli bir model, on dört gigabaytlık ağırlık demektir; aynı model dört bitlik modelde ise üç ila dört gigabayt arasındadır.

Nicelleştirme, bir modeli tutamayan bir makineyi tutabilen bir makineye dönüştüren şeydir. Kaliteye mal olur ve ne kadar olduğu, yalnızca bit sayısından çok modele ve yönteme bağlıdır; iyi nicelleştirilmiş dört bitlik bir model genellikle insanların beklediğinden daha hassas bir şekilde çalışır ve kötü nicelleştirilmiş sekiz bitlik bir model daha da kötü olabilir. Doğruluk amaçlanıyorsa, donanıma karar vermeden önce her ikisini de test edin; farkı teslimattan sonra keşfetmektense şimdi keşfetmek daha ucuzdur.

Bu rakamlar sadece ağırlıkları gösteriyor. Bunlar asgari değerler, zorunluluk değil. Bir sonraki bölüm ise insanları yanıltacak kısım.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

İkinci adım

Uygun bir modelin neden yine de işe yaramayacağı.

Ekran kartı satın alımında en sık karşılaşılan sorun budur ve her seferinde aynı şekilde sonuçlanır: Birisi modelinin otuz sekiz gigabayt olduğunu okur, kırk gigabaytlık bir kart satın alır, başarılı bir şekilde çalıştırır ve ardından bunun yaklaşık bir kısa konuşmayı bile kaldıramayacağını keşfeder.

  • Çalışma süresi de orada yer alıyor.

    Bir modeli yüklemek, hafıza kartını meşgul eden tek şey değil. Çalışma ortamı, tamponları ve hesaplanan her şeyin aktivasyonları, ağırlıklarla aynı bellekte yer alıyor.

  • Konuşma orada ve giderek büyüyor.

    Bir konuşmada zaten bulunan her belirteç, yeniden hesaplanmasına gerek kalmaması için anahtar-değer önbelleğinde bir şeyler bırakır. Bu önbellek, bağlamın uzunluğuyla ve aynı anda hizmet verilen her istekle birlikte büyür. Uzun bir bağlam veya yoğun bir uç nokta, küçük bir model kadar belleğe ihtiyaç duyabilir.

  • Yani: yine çeyrek ila yarım saat arası.

    Ağırlıklardan en az dörtte bir oranında daha fazla kart belleği ayırın ve bağlam uzunsa veya uç nokta meşgulse bunun yarısı kadar daha fazla ayırın. Bu kural, bir sonraki bölümdeki tabloda sizin için geçerlidir; tabloda adı geçen her kart, ağırlıkların bir buçuk katını barındırır.

  • Fiyat yakınsa, satın almadan önce belirtin.

    Bize modeli, niceleme yöntemini, ihtiyacınız olan bağlam uzunluğunu ve yaklaşık olarak aynı anda kaç istekte bulunmak istediğinizi söyleyin. İlk hafta hayal kırıklığı yaratacak ve iade talebi olarak geri dönecek bir sipariş almaktansa, sizi şimdi daha büyük bir karta veya daha küçük bir modele yönlendirmeyi tercih ederiz.

Üçüncü adım

Hangi kart hangi modeli çalıştırır?

Model boyutunuza ve çalıştırmayı düşündüğünüz hassasiyete göre aşağı ve yana doğru okuyun. Her hücre, bu ağırlıkları taşıyabilecek ve yeterli boşluk bırakabilecek en küçük kartın adını ve takılacağı makineye bağlantıyı içerir. Katalogda bunu tek başına yapabilecek bir şey yoksa, hücre boş bırakmak yerine bunu belirtir.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights

Masanın size söyleyemeyeceği üç şey

  • En küçük sığan kart her zaman istediğiniz kart olmayabilir. Bellek, bir modelin çalışıp çalışmayacağını belirler; kartın geri kalan her özelliği ise ne kadar hızlı çalışacağını ve aynı anda kaç kişiye hizmet verebileceğini belirler. Tablo, ilkini optimize eder çünkü ilki kesin bir sınırdır, ikincisi ise bir tercih meselesidir. Eğer bütçeden çok veri aktarım hızı önemliyse, aşağıdaki listede bir üst seviyeye çıkın.
  • Eski kartlar yeni sayı formatlarını desteklemiyor. Kataloğumuzdaki bazı parçalar FP8 ve bfloat16'dan önce üretildiği için, bunları bekleyen bir çalışma ortamı daha yavaş bir şeye geri dönecek veya işlemi reddedecektir. Bu, sipariş vermeden önce sorulması gereken bir sorudur ve biz bu soruyu genel olarak değil, belirli bir kart ve belirli bir çalışma ortamı için yanıtlayacağız.
  • AMD kartlar CUDA değil, ROCm çalıştırır. Instinct parçaları gigabayt başına mükemmel değer sunar ve yukarıdaki birden fazla hücrede çözüm olabilirler, ancak sisteminizin ROCm'yi desteklemesi gerekir. Mevcut çalışma ortamlarının çoğu bunu destekler; ancak bazı araçlar hala desteklemiyor. Sisteminizin durumunu kontrol edin veya bize sorun, biz de sizinle birlikte kontrol edelim.

"Birden fazla kart" cevabı verildiğinde, bu bir ödeme seçeneği değil, fiyat teklifi verdiğimiz bir yapılandırmadır ve çoklu GPU ve çoklu düğüm sayfası bunun nasıl göründüğünü ve sınırlamalarını açıklar. Bu kartların her birinin aylık maliyeti ve altındaki makinenin maliyeti, GPU'ya özel sunucular içindir; buradaki her rakam, ait olduğu makineye bağlıdır, bu nedenle bu sayfada bunların hiçbiri tekrarlanmaz.

Hafızaya göre, en büyükten başlayarak

Her bir kartımızda bir hatıra figürü yayınlıyoruz.

Aynı katalogda, GPU sayfasındaki fiyatlar ters sırada sıralanmıştır: o sayfa en ucuz komple makineden başlar çünkü "bu ne kadara mal oluyor" sorusuna cevap verir, bu sayfa ise en büyük karttan başlar çünkü "çalıştırabileceğim en büyük şey nedir" sorusuna cevap verir. Üreticinin bellek kapasitesini yayınlamadığı bir kart burada boş bırakılmak yerine gösterilmemiştir, çünkü karşılaştırılamayan bir satır karşılaştırmada işe yaramaz.

Bunların birçoğu birden fazla kasada, bazen farklı fiyatlarla karşımıza çıkıyor ve alttaki makinenin veri yolu nesli, modern bir kartın aslında neler yapabileceğini değiştiriyor; bunların her ikisi de GPU'ya özel sunucularda mevcut. Şu anda raflarda hazır halde duran şeyin ne olduğu ise bambaşka bir soru ve bu sorunun cevabı anlık sunucularda bulunuyor.

Üzerine ne kurarsınız?

Çalışma süresi tamamen size ait ve çıplak metalin amacı da bu.

Makine temiz bir işletim sistemi ve root erişimiyle birlikte gelir. Kullanmanız gereken bir satıcı çıkarım hizmeti, son teslim tarihinden bir hafta önce kendini güncelleyen yönetilen bir çalışma zamanı veya kendi modelinizin önünde bir API yoktur. İstediğinizi kurarsınız ve kodunuzun test edildiği sürüme sabitlersiniz.

vLLM

Gerçek trafiğe model sunmanın olağan cevabı. Sürekli gruplandırma ve sayfalama odaklı dikkat, bir kartın tek tek değil, aynı anda birçok isteğe yanıt vermesini sağlar; bu da genellikle bir demo ile bir hizmet arasındaki farkı oluşturur. Makul derecede modern bir kart istiyor.

lama.cpp

Bellek yetersiz olduğunda veya kart eski olduğunda verilen olağan cevap budur. Nicelleştirilmiş formatları, büyük bir modelin küçük bir karta sığmasının nedenidir ve ağırlıklar tam olarak uymadığında işlemciyi ve kartı birlikte kullanmaktan çekinmez. İstek başına daha yavaş, çok daha toleranslıdır.

TGI ve SGLang

vLLM ile aynı aileden olan, ancak yapılandırılmış çıktı, önek yeniden kullanımı ve çok modelli sunum konularında farklı güçlü yönlere sahip üretim sunucuları. Eğer sisteminizde zaten bir tane varsa, burada hiçbir değişiklik yapılmadan çalışır.

Ollama

Boş bir makineden porttan yanıt veren bir modele giden en kısa yol. Başka bir yere varsanız bile, başlamaya değer çünkü yaklaşık on dakika içinde boyutlandırmanızın doğru olup olmadığını size söyleyecektir.

Hangisini seçerseniz seçin, sürücü, CUDA veya ROCm sürümü ve çerçeve yapısı sizin belirlediğiniz şekilde sabitlenir ve arkanızda hiçbir şey yükseltilmez. Sürücünün teslimattan önce yüklenmesini tercih ediyorsanız, siparişte belirtin ve sürümü adlandırın.

Ne kadar hızlı olacak?

Saniyede işlenen token sayısını yayınlamıyoruz ve bunun nedeni şu.

Bu tür her sayı, modele, nicelemeye, çalışma zamanına ve sürümüne, toplu işlem boyutuna, istemin uzunluğuna, yanıtın uzunluğuna ve işlemde olan istek sayısına bağlıdır. Bunlardan herhangi birini değiştirirseniz, rakam katlanarak değişir. Tüm bunları içermeyen bir başlık rakamı, iyi görünmek için seçilmiş bir rakamdır ve biz de bu rakam üzerinden alıntılanırız.

Size bunun kurallarını anlatacağız, böylece kendi durumunuzu değerlendirebilirsiniz:

  • Komut istemini okuma işlemi, işlem gücüne bağlıdır. Bu işlem, her istek için bir kez, tüm komut istemi boyunca paralel olarak gerçekleşir ve bir kartın aritmetik işlem gücü ve yeni sayı biçimlerine desteği burada ortaya çıkar.
  • Yanıt oluşturma işlemi bellek bant genişliğine bağlıdır. Her bir belirteç, ağırlıkların okunmasını gerektirir; bu nedenle tek bir istek için tavan, kartın kendi belleğini ne kadar hızlı aktarabileceğiyle yaklaşık olarak aynıdır. Bu nedenle, daha yavaş ve daha fazla belleğe sahip bir kart, daha küçük ve daha hızlı bir karta göre gecikme süresinde kaybedebilirken, modelin uyup uymadığı konusunda kazanabilir.
  • Toplu işlem, onu ekonomik kılan şeydir. Birkaç isteği birlikte işlemek, tüm istekler arasında okuma yükünü azaltır; bu nedenle toplam verim eşzamanlılıkla birlikte hızla artarken, istek başına gecikme neredeyse hiç değişmez - ta ki anahtar-değer önbelleği dolana kadar, o noktada her şey birden bozulur. Yine de yeterli kapasite söz konusu.

Bunun yerine gerçek bir cevap isteyin.

Bize modeli, kullanmayı düşündüğünüz niceleme yöntemini, bağlam uzunluğunu ve yaklaşık olarak kaç eş zamanlı istek beklediğinizi söyleyin. Eğer benzer bir şey üzerinde çalıştıysak, ne gördüğümüzü ve hangi veriler üzerinde olduğunu söyleyeceğiz. Eğer çalışmadıysak, bunu da belirteceğiz.

Bu, bir referans grafiğinden daha iyi bir satın alma temelidir ve yaklaşık bir dakika sürer.

Normal destek saatleri, yılın her günü telefon, sohbet ve destek talepleri dahil olmak üzere tüm hizmetleri kapsar. Destek ekibinin yanıt süreleri yazılı olarak belirtilmiştir.

Hizmet etmenin ötesinde

İnce ayar yapmak, servis yapmaya kıyasla çok daha fazla alan gerektirir.

Yukarıda belirtilen her şey, çıkarım için bir modelin boyutlandırılmasını sağlar: ağırlıklar girer, belirteçler çıkar. Aynı modeli eğitmek veya ince ayar yapmak farklı bir bellek problemidir ve aradaki fark küçümsenemez.

Neden daha fazla bellek tüketiyor?

Sunucu tarafı ağırlıklara ihtiyaç duyar. Eğitim tarafı ise ağırlıklara, gradyanlara ve optimize edicinin güncellediği her parametre için kendi durumuna, bunların hepsine aynı anda ihtiyaç duyar; ayrıca ağda geriye doğru çalışabilmek için saklaması gereken aktivasyonlara da ihtiyaç duyar. Bir kart üzerinde rahatça sunucu tarafı olarak çalışan bir model, aynı kart üzerinde tam olarak ince ayar yapmak için birkaç kat daha büyük olabilir.

Bu yüzden çoğu insan bunu tam olarak yapmıyor.

Parametre açısından verimli yöntemler (adaptörler, düşük dereceli güncellemeler ve bunların nicelleştirilmiş varyantları) parametrelerin küçük bir bölümünü günceller ve buna bağlı olarak ek belleğin de küçük bir bölümüne ihtiyaç duyar. İnsanların ince ayar olarak adlandırdığı çoğu görev için bu hem pratik bir seçimdir hem de elinizde tutabileceğiniz donanıma uygun olanıdır.

Bize ne anlatacaksınız?

Model, yöntem, dizi uzunluğu ve veri seti boyutu. Burada bir çarpan yayınlamayacağız çünkü dürüst olan bu dört faktöre de bağlıdır ve makinenizi olduğundan küçük gösteren uydurma bir rakam, ikimiz için de bir konuşmadan daha kötüdür. Cevap birden fazla kart ise, çoklu GPU ve çoklu düğüm, bu yapının nasıl göründüğünü açıklar.

Otobüsün burada önemi, hizmet verme açısından sahip olduğu önemden farklıdır.

Bir eğitim döngüsü, işlemci ve kart arasındaki bağlantı üzerinden sürekli olarak veri kümeleri aktarır; bu nedenle, alttaki makinenin PCIe nesli bir özellikten ziyade gerçek bir kısıtlamadır. Yerleşik bir model üzerinde yapılan çıkarım bunu neredeyse hiç etkilemez. Hangi platformun hangi karta hangi bağlantıyı verdiği, GPU'ya özel sunucularda yayınlanır ve çoklu GPU ve çoklu düğümde platformlar arasında karşılaştırılır.

Daha önce soruldu

Bu sayfa, sekiz soruyu yanıtlamak için oluşturulmuştur.

İnsanların sohbet ve destek taleplerinde bize gerçekten sordukları sorulardan, yaklaşık olarak sorulma sırasına göre derlenmiştir. İlk iki soru, satın alma işleminin gerçekleşip gerçekleşmeyeceğine karar veren sorulardır.

Büyük bir dil modeli ne kadar GPU belleğine ihtiyaç duyar?
Ağırlıklar, parametre sayısının parametre başına bayt sayısıyla çarpılmasıyla elde edilir: 16 bit için iki bayt, 8 bit için bir bayt, 4 bit için yarım bayt. 7-8 milyar parametreli bir model, 16 bit için 16 GB, 8 bit için 8 GB ve 4 bit için 5 GB ağırlık gerektirir; 70 milyar parametreli bir model ise 140 GB, 70 GB ve 38 GB ağırlık gerektirir. Bu rakamlar yalnızca ağırlıkları gösterir ve bir gereklilikten ziyade bir taban değerdir; çalışma süresi, aktivasyonlar ve anahtar-değer önbelleği için bunun üzerine çeyrek ila yarım kat daha fazla bütçe ayırın.
Modelim yükleniyor ama neden çalışmıyor?
Çünkü kart belleğinde yalnızca ağırlıklar bulunmuyor. Çalışma zamanı ve tamponları da bellekte yer alıyor ve bir konuşmadaki her belirteç, yeniden hesaplanmasına gerek kalmaması için anahtar-değer önbelleğinde bir giriş bırakıyor. Bu önbellek, bağlam uzunluğuyla ve eş zamanlı olarak sunulan her istekle birlikte büyüyor; bu nedenle, ağırlıkları ancak tam olarak sığan bir model, yaklaşık bir kısa konuşmayı tutabilir. Kartın boyutunu, ağırlıkların bir buçuk katı ile bir buçuk katı arasında ayarlayın.
Hangi çıkarım çalışma ortamını kurabilirim?
Bunlardan herhangi biri. Makine temiz bir işletim sistemi ve root ile gelir ve önünde satıcıya ait bir çıkarım hizmeti yoktur. Sürekli gruplama, bir kartın aynı anda birçok isteğe cevap vermesini sağladığı için, gerçek trafiğe hizmet etmek için genellikle vLLM kullanılır. Bellek kısıtlı olduğunda veya kart eski olduğunda llama.cpp kullanılır. TGI ve SGLang değişmeden çalışır. Ollama, boş bir makineden bir portta cevap veren bir modele giden en kısa yoldur. Sürücüyü, CUDA veya ROCm sürümünü ve çerçeveyi, kodunuzun test edildiği sürümlere sabitlersiniz.
Saniyede kaç jeton alacağım?
Saniye başına token sayısını yayınlamıyoruz çünkü bu tür her sayı modele, nicelemeye, çalışma zamanına ve sürümüne, toplu işlem boyutuna, istem uzunluğuna, yanıt uzunluğuna ve eşzamanlılığa bağlıdır ve bunlardan herhangi birinin değiştirilmesi onu kat kat etkiler. Bunu belirleyen şey şudur: istemi okumak hesaplamaya bağlıdır ve istek başına bir kez gerçekleşir; yanıt oluşturmak bellek bant genişliğine bağlıdır çünkü her token ağırlıkların okunmasını gerektirir; ve toplu işlem, bu okumayı eşzamanlı istekler arasında dağıtır, bu da anahtar-değer önbelleği dolana kadar sunmayı ekonomik hale getirir. Gerçekte gözlemlediğimiz verilere dayanarak bir yanıt almak için model, niceleme ve beklenen eşzamanlılık bilgilerini isteyin.
GPU başka biriyle paylaşılıyor mu?
Hayır. Fiziksel makine başına bir kiracı bulunur ve kart kendi işletim sisteminize aktarılır. Hipervizör, MIG bölümü, vGPU profili ve zaman dilimleme zamanlayıcısı yoktur, bu nedenle kart üzerinde başka hiçbir şey çalışmaz ve çıkarım gecikmesi başkasının toplu işi nedeniyle değişmez.
Model tek bir karta sığmazsa ne olacak?
O zaman bu, sipariş vermek yerine fiyatlandırılan çoklu kartlı bir yapılandırmadır: kaç kartın sığacağı, belirli kartın fiziksel genişliğine ve kasanın güç bütçesine bağlıdır. İki kart, ancak çalışma zamanı modeli her iki karta da bölebiliyorsa, belleklerinin toplamını verir; bu da her ciddi çalışma zamanı için bir miktar verim kaybı pahasına desteklenir. Birden fazla kart veya makine, bu yapılandırmanın nasıl görüneceğini karşılar.
İnce ayar yapmak, sunuculuk yapmaktan daha fazla belleğe mi ihtiyaç duyar?
Çok daha fazla. Sunucu, ağırlıklara ihtiyaç duyar; eğitim ise, güncellenen her parametre için ağırlıklara, gradyanlara ve optimizasyon durumuna, bunların hepsine aynı anda ihtiyaç duyar; ayrıca geri besleme için saklanan aktivasyonlara da ihtiyaç vardır. Tek bir kartta rahatça çalışan bir model, üzerinde tam olarak ince ayar yapmak için birkaç kat daha büyük olabilir. Parametre açısından verimli yöntemler, parametrelerin küçük bir bölümünü günceller ve buna karşılık gelen ek belleğin küçük bir bölümüne ihtiyaç duyar; bu nedenle burada ince ayarın çoğu tek bir kart kullanılarak yapılır.
AMD ekran kartı kullanabilir miyim ve ROCm çalışır mı?
Evet. AMD Instinct işlemciler, taktığımız en büyük bellekli kartlar arasında yer alıyor ve genellikle gigabayt başına en iyi değeri sunuyor, ancak sisteminizin CUDA yerine ROCm'yi desteklemesi gerekiyor. Mevcut çıkarım çalışma ortamlarının çoğu bunu destekliyor; ancak bazı çevre araçları hala desteklemiyor. Sipariş vermeden önce sorun, böylece genel bir cevap vermek yerine, özel çalışma ortamınıza göre kontrol edelim.

For the record

Everything on this page, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.