Arkusz doboru · modele językowe na gołym sprzęcie · od 2004

Czego potrzeba, aby uruchomić model językowy na gołym sprzęcie.

Wypełnia się od góry, tak jak przebiega decyzja: model wyznacza wagi, precyzja je skaluje, zapas pokrywa środowisko uruchomieniowe i konwersację, a suma wskazuje kartę. Nic innego w formularzu zamówienia nie zmienia wyniku — karta o dwa gigabajty za mała nie działa wolniej, tylko w ogóle się nie ładuje.

Opracowanie
Primcast LLC, zał. 2004
Zweryfikowano z
Katalogiem zamówień, w momencie realizacji
Karty w ofercie · największa
56 · 96 GB GDDR7 ECC
Ceny na tym arkuszu
Brak — zob. /gpu

Wypełnij arkusz Dlaczego dopasowanie może mimo to zawieść Co na nim instaluję

Zamień swoje GPU w pasywny miesięczny przychód

Masz nieużywane konfiguracje GPU serwerowe lub desktopowe? Wystaw je już dziś w marketplace Primcast i zarabiaj stały miesięczny czynsz od zespołów AI, deweloperów i firm potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace

Arkusz

Cztery wiersze, jeden werdykt.

Model
Precyzja
Obciążenie

70B: 38 GB × 1.5 = 57 GB

Smallest card on the schedule that clears it (3 larger ones also do):

Instinct MI21064 GB HBM2e

The link opens the machine it goes in. What it costs is on /gpu — not on this sheet.

Wiersz 1 × wiersz 2 to wagi; wiersz 3 to opublikowana na stronie zasada zapasu od ćwierci do połowy zapisana jako arytmetyka — ćwierć ponownie dla jednego użytkownika naraz na llama.cpp lub Ollama, połowa ponownie dla ruchu serwowanego z ciągłym batchowaniem na vLLM lub TGI. Werdykt wskazuje najmniejszą kartę w katalogu zamówień, która przekracza sumę, i linkuje do maszyny, do której trafia. Ile ta maszyna kosztuje, celowo nie znajduje się na tym arkuszu: każda liczba jest na /gpu, przy dokładnie tej maszynie, do której należy.

Rys. 1

Ile ważą wagi.

Parametry pomnożone przez bajty na parametr — i to całe obliczenie. Wagi szesnastobitowe to po dwa bajty każda, ośmiobitowe po jednym, czterobitowe po pół. Kwantyzacja zamienia maszynę, która nie pomieści modelu, w taką, która go pomieści; kosztuje jakość, a ile — zależy od modelu i metody znacznie bardziej niż od samej liczby bitów. Jeśli dokładność jest celem ćwiczenia, przetestuj obie wersje, zanim zdecydujesz się na sprzęt — różnicę taniej odkryć teraz niż po dostawie.

Te liczby to wagi i nic więcej. Są podłogą, nie wymaganiem — Rys. 2 to część, na której ludzie się potykają.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Rys. 2 · interaktywny

Pamięć jednej karty w rzucie — i dlaczego model, który się mieści, może mimo to odmówić serwowania.

Najczęstszy sposób, w jaki zakup GPU idzie źle, za każdym razem tak samo: model ma trzydzieści osiem gigabajtów, karta czterdzieści, ładuje się — i mieści mniej więcej jedną krótką rozmowę. Wagi nie są tam same. Przesuń obciążenie i zobacz, co dzieje się z rozmową.

wagi · stałe
środowisko uruchomieniowe
pamięć podręczna klucz-wartość · rośnie
wolne
pamięć jednej karty, 100 %

Jeden użytkownik, krótki kontekst: mnożnik oszczędny (×1,25) to pokrywa.

  • Każdy token w rozmowie zostawia wpis w pamięci podręcznej klucz-wartość, żeby nie był przeliczany ponownie. Pamięć podręczna rośnie wraz z długością kontekstu i ponownie z każdym żądaniem obsługiwanym jednocześnie.
  • Zaplanuj ćwierć ponownie ponad wagi dla jednego użytkownika naraz, połowę ponownie dla ruchu serwowanego — to dwa mnożniki z arkusza i opublikowana zasada samej strony.
  • Jeśli jest na styk, zapytaj przed zakupem: model, kwantyzacja, kontekst, współbieżność. Wolimy dobrać ci kartę teraz, niż przyjąć zamówienie, które wróci jako prośba o zwrot w pierwszym tygodniu.

Rys. 3

Macierz dopasowania: która karta obsłuży który model.

Czytaj w dół do swojego modelu, w poprzek do precyzji. Każda komórka wskazuje najmniejszą kartę z wykazu części, która pomieści te wagi z zapasem na serwowanie, i linkuje do maszyny, do której trafia. Gdzie nic nie obsłuży tego samodzielnie, komórka mówi to wprost, zamiast zostawiać puste pole.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights
  • Najmniejsza karta, która się mieści, nie zawsze jest kartą, której chcesz. Pamięć decyduje o tym, czy model działa; wszystko inne w karcie decyduje o tym, jak szybko i dla ilu osób naraz. Jeśli przepustowość znaczy więcej niż budżet, weź stopień wyżej w wykazie.
  • Starsze karty nie znają nowszych formatów liczbowych. Kilka pozycji w wykazie poprzedza FP8 i bfloat16, więc środowisko uruchomieniowe, które ich oczekuje, przełączy się na coś wolniejszego albo odmówi. Warto zapytać o konkretną kartę i konkretne środowisko przed zamówieniem.
  • Karta AMD działa na ROCm, nie na CUDA. Części Instinct mają doskonały stosunek wartości do gigabajta i są odpowiedzią w niejednej komórce, ale twój stos musi obsługiwać ROCm. Większość obecnych środowisk to robi; część narzędzi wokół nich wciąż nie. Sprawdź swoje albo zapytaj, a sprawdzimy to razem z tobą.
  • „Więcej niż jedna karta” to konfiguracja, którą wyceniamy, a nie opcja w koszyku — ile kart się zmieści, zależy od szerokości konkretnej karty i budżetu mocy obudowy. Multi-GPU i multi-node to ten arkusz. Drugą odpowiedzią w tym rozmiarze jest 128 GB pamięci współdzielonej przez procesor i GPU w jednej maszynie: wynajem NVIDIA DGX Spark.

Wykaz A

Wykaz części: każda karta, którą montujemy, z opublikowaną wartością pamięci.

Najpierw największe — ten arkusz odpowiada na pytanie „jaka jest największa rzecz, którą mogę uruchomić”, odwrotnie niż dedykowane serwery GPU, które sortują ten sam katalog po najtańszej kompletnej maszynie, bo odpowiadają na pytanie „ile to kosztuje”. Karta, której pamięci producent nie publikuje, zostaje pominięta, zamiast być zgadywana.

Kilka części występuje na więcej niż jednej obudowie, czasem w różnych cenach, a generacja magistrali maszyny pod spodem zmienia to, co nowoczesna karta faktycznie potrafi — obie rzeczy są na dedykowanych serwerach GPU. Co stoi w szafie i jest gotowe w tej chwili, to znów inne pytanie, na które odpowiadają serwery natychmiastowe.

Materiał referencyjny

Nazwane modele przyporządkowane do wierszy.

Rodziny modeli o otwartych wagach, które ludzie tu przynoszą, z opublikowaną liczbą parametrów mówiącą, który wiersz Rys. 1 ma zastosowanie. Liczby parametrów pochodzą od samych wydawców; nic innego w modelu nie ma znaczenia dla kwestii dopasowania. Model spoza tej listy dobiera się dokładnie tak samo — parametry × bajty na parametr plus zapas. Nowe rodziny pojawiają się co miesiąc; arytmetyka się nie zmienia.

Uwaga 1 · mieszanka ekspertów

Model „30B z 3B aktywnymi” potrzebuje pamięci modelu 30B, a działa bliżej szybkości modelu 3B: każdy ekspert musi być rezydentny, bo różne tokeny budzą różnych. Zawsze dobieraj według całkowitej liczby parametrów.

RodzinaRozmiaryWiersz
Llama 3.1 / 3.3 Meta8B · 70B7–8B oraz 70B dla wydania 3.3
Qwen3 Alibaba8B · 14B · 32BPierwsze trzy wiersze
DeepSeek-R1 destylaty7B – 70BPo jednym na wiersz — wybierz destylat, który pomieści twoja karta
Mistral Small 3 Mistral AI24BMiędzy wierszami 2 i 3; dobierz z arytmetyki, nie z etykiety
Gemma 3 Google12B · 27BWiersz 2 i tuż poniżej wiersza 3
Phi-4 Microsoft14BWiersz 2
gpt-oss OpenAI20B · 120BOpublikowane natywnie 4-bitowo: karta 16 GB i jedna karta 80 GB

Uwagi instalacyjne

Środowisko uruchomieniowe należy do ciebie. Na tym polega goły sprzęt.

Maszyna przyjeżdża z czystym systemem operacyjnym i kontem root. Żadnej usługi inferencyjnej dostawcy przed twoim modelem, żadnego zarządzanego środowiska, które samo się aktualizuje na tydzień przed terminem. vLLM i Ollama odpowiadają na końcówce zgodnej z OpenAI — kod napisany pod dostawcę API wskazuje na twoją własną maszynę po zmianie jednego bazowego adresu URL. Przypnij sterownik, wydanie CUDA lub ROCm i framework do wersji, na których twój kod był testowany; nic nie rusza się pod tobą. Jeśli wolisz, żeby sterownik był zainstalowany przed przekazaniem, napisz to w zamówieniu i podaj wersję.

  1. vLLM — serwowanie prawdziwego ruchu. Ciągłe batchowanie i uwaga stronicowana pozwalają jednej karcie odpowiadać na wiele żądań naraz: to różnica między demem a usługą. Wymaga w miarę nowoczesnej karty.
  2. llama.cpp — pamięć na styk albo starsza karta. Jego formaty skwantyzowane sprawiają, że duży model w ogóle mieści się na małej karcie; użyje procesora i karty razem, gdy wagi nie do końca się mieszczą.
  3. TGI · SGLang — serwery produkcyjne z tej samej rodziny, o różnych mocnych stronach wokół wyjścia strukturalnego, ponownego użycia prefiksów i serwowania wielu modeli. Działają tu bez zmian.
  4. Ollama — najkrótsza droga od pustej maszyny do modelu odpowiadającego na porcie. Dziesięć minut mówi ci, czy dobór był właściwy.

Warunki lokalne

Co robi twoja własna maszyna, czego nie potrafi API.

Prompty nigdy nie opuszczają budynku

Wagi, prompty, pobrane dokumenty i każdy wygenerowany token pozostają na sprzęcie, do którego tylko ty masz login. Amsterdam lub Bukareszt i dane są w UE; Nowy Jork, Miami lub San Francisco i są w USA. Dla obciążeń podlegających inspektorowi ochrony danych to zdanie jest całym uzasadnieniem biznesowym.

Licznik nigdy nie bije

API rozliczane za token nalicza każdy token, a agent lub potok wsadowy generuje tokeny przez cały dzień. Dedykowana maszyna to ta sama kwota co miesiąc przy dowolnym wolumenie, z nielimitowaną przepustowością pod spodem — wagi wchodzące i tokeny wychodzące nie kosztują nic poza portem. Jaka to kwota, to wiersz do wypełnienia na /gpu, nie na tym arkuszu.

Nikt nie ogranicza limitu, nie wycofuje ani nie podmienia modelu pod tobą

Model, który przypniesz, odpowiada bez zmian za sześć miesięcy. Żadnego pułapu żądań na minutę, żadnej kolejki w godzinach szczytu u kogoś innego, żadnego powiadomienia o wycofaniu. Wymiana jest uczciwa: aktualizacje należą do ciebie, w twoim harmonogramie.

Praca obok modelu ma swój dom

Wyszukiwanie chce modelu osadzającego, magazynu wektorowego i szybkiego dysku; agenci chcą miejsca na uruchamianie narzędzi. NVMe na magazyn, rdzenie procesora na potok, karta na tokeny — jedna maszyna niesie to wszystko.

Uwaga 2 · parametry wydajności

Na tym arkuszu nie pojawia się żadna liczba tokenów na sekundę.

Celowo. Każda taka liczba zależy od modelu, kwantyzacji, środowiska uruchomieniowego i jego wersji, wielkości batcha, długości promptu, długości odpowiedzi i współbieżności — zmień którąkolwiek, a przesunie się wielokrotnie. Liczba nagłówkowa, która nie niesie tego wszystkiego, to liczba dobrana, żeby dobrze wyglądała, i bylibyśmy z niej cytowani. Co nią rządzi: czytanie promptu jest ograniczone mocą obliczeniową i odbywa się raz na żądanie; generowanie odpowiedzi jest ograniczone przepustowością pamięci, bo każdy token wymaga odczytania wag; batchowanie amortyzuje ten odczyt na współbieżne żądania, dopóki pamięć podręczna klucz-wartość nie wyczerpie miejsca. Znów zapas.

Zamiast tego poproś o prawdziwą odpowiedź

Podaj model, planowaną kwantyzację, długość kontekstu i mniej więcej liczbę współbieżnych żądań. Jeśli uruchamialiśmy coś porównywalnego, powiemy, co widzieliśmy i na czym. Jeśli nie, też to powiemy.

O każdej porze każdego dnia — telefon, czat i zgłoszenia. Wsparcie ma czasy odpowiedzi na piśmie.

Uwaga 3 · dostrajanie

Trenowanie potrzebuje znacznie więcej miejsca niż serwowanie.

Serwowanie potrzebuje wag. Trenowanie potrzebuje wag, gradientów i stanu optymalizatora dla każdego aktualizowanego parametru, wszystkiego rezydentnego naraz, plus aktywacji trzymanych na przebieg wsteczny — model, który wygodnie serwuje się na jednej karcie, może być kilkukrotnie za duży, żeby w pełni go na niej dotrenować. Metody parametrycznie efektywne aktualizują mały ułamek parametrów i potrzebują odpowiednio małego ułamka dodatkowej pamięci, dlatego większość dostrajania tutaj używa którejś z nich. Pętla treningowa dodatkowo nieprzerwanie przesyła batche przez łącze procesor-karta, więc generacja PCIe maszyny pod spodem jest tam realnym ograniczeniem w sposób, w jaki nie jest nim przy serwowaniu — która platforma daje karcie które łącze, jest na dedykowanych serwerach GPU. Podaj model, metodę, długość sekwencji i rozmiar zbioru danych, a dobierzemy to, zamiast żebyś odkrywał po dostawie; więcej niż jedna karta to arkusz multi-GPU i multi-node.

Zapytania zgłoszone

Zadane przy poprzednich wersjach tego arkusza.

Wzięte z tego, o co ludzie faktycznie pytają nas na czacie i w zgłoszeniach, mniej więcej w kolejności, w jakiej padają. Pierwsze trzy decydują o tym, czy zakup ma sens.

Ile pamięci GPU potrzebuje duży model językowy?
Wagi to liczba parametrów pomnożona przez bajty na parametr: dwa bajty każda przy 16-bitach, jeden przy 8-bitach, pół przy 4-bitach. Model o 7–8 miliardach parametrów to 16 GB wag przy 16-bitach, 8 GB przy 8-bitach i 5 GB przy 4-bitach; model o 70 miliardach parametrów to 140 GB, 70 GB i 38 GB. Te liczby dotyczą samych wag i są raczej dolną granicą niż wymogiem — dolicz od ćwierci do połowy więcej na środowisko uruchomieniowe, aktywacje i pamięć podręczną klucz-wartość.
Czego potrzebuję, aby uruchomić model 70B taki jak Llama 3.3?
Przy 4-bitach wagi zajmują około 38 GB, więc z zapasem na obsługę odpowiedzią jest karta o pojemności 64 GB lub większej — jedna karta, jedna maszyna. Przy 8-bitach wagi to 70 GB i karta 80 GB przekracza próg. Przy pełnej precyzji 16-bitów żadna pojedyncza karta, którą montujemy, tego nie pomieści, więc staje się to budową wielokartową, którą wyceniamy. Rys. 3 powyżej wymienia dokładne karty; ceny są na serwerach dedykowanych GPU.
Dlaczego mój model ładuje się, ale nie odpowiada na żądania?
Ponieważ wagi nie są jedyną rzeczą w pamięci karty. Środowisko uruchomieniowe i jego bufory są rezydentne, a każdy token w rozmowie zostawia wpis w pamięci podręcznej klucz-wartość, aby nie trzeba było go ponownie obliczać. Ta pamięć podręczna rośnie wraz z długością kontekstu i ponownie z każdym żądaniem obsługiwanym równolegle, więc model, którego wagi ledwo się mieszczą, utrzyma mniej więcej jedną krótką rozmowę. Dobierz kartę o wielkości od jednej i ćwierci do półtora raza wag.
Które środowisko uruchomieniowe do inferencji mogę zainstalować?
Każde. Maszyna przyjeżdża z czystym systemem operacyjnym i uprawnieniami root, a przed nią nie ma żadnej usługi inferencyjnej dostawcy. vLLM to zwykła odpowiedź do obsługi prawdziwego ruchu, ponieważ ciągłe grupowanie pozwala jednej karcie odpowiadać na wiele żądań naraz. llama.cpp to zwykła odpowiedź, gdy pamięci jest mało lub karta jest starsza. TGI i SGLang działają bez zmian. Ollama to najkrótsza droga od pustej maszyny do modelu odpowiadającego na porcie — a vLLM i Ollama odpowiadają na punkcie końcowym zgodnym z OpenAI, więc istniejący kod klienta wskazuje na twoją własną maszynę po zmianie jednego bazowego adresu URL. Przypinasz sterownik, wydanie CUDA lub ROCm i framework do wersji, na których testowano twój kod.
Czy samodzielne hostowanie LLM jest tańsze niż API rozliczane za token?
Zależy to całkowicie od wolumenu, a punkt przecięcia jest realny: API rozlicza za token i nic nie kosztuje w stanie bezczynności; maszyna dedykowana to stała miesięczna kwota i nic więcej nie kosztuje, gdy jest obciążona. Stały ruch, agenci działający cały dzień, potoki wsadowe i wszystko, co ma wymóg prywatności, zwykle wychodzi korzystniej na własnym sprzęcie; obciążenie uruchamiane dziesięć razy dziennie nie. Miesięczne kwoty do tych obliczeń są na serwerach dedykowanych GPU — ten arkusz celowo niczego nie wycenia.
Ile tokenów na sekundę uzyskam?
Nie publikujemy wartości tokenów na sekundę, ponieważ każda taka liczba zależy od modelu, kwantyzacji, środowiska uruchomieniowego i jego wersji, wielkości partii, długości promptu, długości odpowiedzi i współbieżności, a zmiana któregokolwiek z nich przesuwa ją wielokrotnie. Co nią rządzi: odczyt promptu jest ograniczony mocą obliczeniową i odbywa się raz na żądanie; generowanie odpowiedzi jest ograniczone przepustowością pamięci, ponieważ każdy token wymaga odczytania wag; a grupowanie amortyzuje ten odczyt na żądania współbieżne, co sprawia, że obsługa jest ekonomiczna, dopóki pamięć podręczna klucz-wartość nie wyczerpie miejsca. Zapytaj, podając model, kwantyzację i oczekiwaną współbieżność, aby uzyskać odpowiedź opartą na tym, co faktycznie zaobserwowaliśmy.
Czy GPU jest współdzielone z kimkolwiek innym?
Nie. Jeden najemca na maszynę fizyczną, a karta jest przekazywana do twojego własnego systemu operacyjnego. Nie ma hipernadzorcy, partycji MIG, profilu vGPU ani harmonogramu z podziałem czasu, więc nic innego nie działa na karcie, a opóźnienie inferencji nie zmienia się z powodu czyjegoś zadania wsadowego.
Co jeśli model nie mieści się na jednej karcie?
Wtedy jest to budowa wielokartowa, która jest wyceniana, a nie zamawiana z koszyka: ile kart się zmieści, zależy od fizycznej szerokości konkretnej karty i budżetu mocy obudowy. Dwie karty dają sumę ich pamięci tylko wtedy, gdy środowisko uruchomieniowe potrafi podzielić model między obie, co każde poważne środowisko obsługuje przy pewnym koszcie przepustowości. Więcej niż jedna karta lub maszyna opisuje, jak taka budowa wygląda.
Czy dostrajanie wymaga więcej pamięci niż obsługa?
Znacznie więcej. Obsługa wymaga wag; trenowanie wymaga wag, gradientów i stanu optymalizatora dla każdego aktualizowanego parametru, wszystko rezydentne naraz, plus aktywacje zachowane na przebieg wsteczny. Model, który wygodnie obsługuje się na jednej karcie, może być kilkakrotnie za duży, aby w pełni go na niej dostroić. Metody parametrycznie efektywne aktualizują małą część parametrów i potrzebują odpowiednio małej części dodatkowej pamięci, dlatego większość dostrajania tutaj używa jednej z nich.
Czy mogę uruchomić kartę AMD i czy ROCm działa?
Tak. Części AMD Instinct należą do kart o największej pamięci, jakie montujemy, i często oferują najlepszą wartość za gigabajt, ale twój stos musi obsługiwać ROCm zamiast CUDA. Większość obecnych środowisk inferencyjnych to robi; niektóre otaczające narzędzia wciąż nie. Zapytaj przed zamówieniem, a sprawdzimy to pod kątem twojego konkretnego środowiska uruchomieniowego, zamiast odpowiadać ogólnie.

For the record

Everything on this sheet, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.