Φύλλο υπολογισμού · γλωσσικά μοντέλα σε γυμνό μέταλλο · από το 2004

Τι χρειάζεται για να τρέξει ένα γλωσσικό μοντέλο σε γυμνό μέταλλο.

Συμπληρώνεται από πάνω, όπως πάει η απόφαση: το μοντέλο ορίζει τα βάρη, η ακρίβεια τα κλιμακώνει, το περιθώριο ασφαλείας καλύπτει τον χρόνο εκτέλεσης και τη συνομιλία, και το σύνολο ονομάζει την κάρτα. Τίποτε άλλο στη φόρμα παραγγελίας δεν αλλάζει την απάντηση — μια κάρτα δύο gigabyte πιο μικρή δεν τρέχει πιο αργά, αποτυγχάνει να φορτώσει.

Σχεδιάστηκε από
Primcast LLC, από το 2004
Ελέγχθηκε με
Τον κατάλογο παραγγελιών, τη στιγμή της εξυπηρέτησης
Κάρτες στο αρχείο · μεγαλύτερη
56 · 96 GB GDDR7 ECC
Τιμές σε αυτό το φύλλο
Καμία — δείτε /gpu

Συμπληρώστε το φύλλο υπολογισμού Γιατί μια εφαρμογή μπορεί ακόμα να αποτύχει Τι εγκαθιστώ σε αυτό

Μετατρέψτε τις GPU σας σε παθητικό μηνιαίο εισόδημα

Έχετε αδρανείς διατάξεις GPU σε server ή desktop; Καταχωρίστε τις σήμερα στην αγορά Primcast και κερδίστε σταθερά μηνιαία ενοίκια από ομάδες τεχνητής νοημοσύνης, προγραμματιστές και επιχειρήσεις που χρειάζονται υπολογιστική ισχύ επιπέδου παραγωγής.

Μετάβαση στην Αγορά

Φύλλο υπολογισμού

Τέσσερις γραμμές, μία ετυμηγορία.

Το μοντέλο
Η ακρίβεια
Το καθήκον

70B: 38 GB × 1.5 = 57 GB

Smallest card on the schedule that clears it (3 larger ones also do):

Instinct MI21064 GB HBM2e

The link opens the machine it goes in. What it costs is on /gpu — not on this sheet.

Γραμμή 1 × γραμμή 2 είναι τα βάρη· η γραμμή 3 είναι ο δημοσιευμένος κανόνας περιθωρίου ενός τετάρτου έως μισού του ιστότοπου ως αριθμητική — ένα τέταρτο επιπλέον για έναν χρήστη τη φορά σε llama.cpp ή Ollama, μισό επιπλέον για εξυπηρέτηση κίνησης με συνεχή ομαδοποίηση σε vLLM ή TGI. Η ετυμηγορία ονομάζει τη μικρότερη κάρτα στον κατάλογο παραγγελιών που ξεπερνά το σύνολο, και συνδέει με το μηχάνημα στο οποίο μπαίνει. Το πόσο κοστίζει αυτό το μηχάνημα σκόπιμα δεν βρίσκεται σε αυτό το φύλλο: κάθε αριθμός είναι στο /gpu, δίπλα στο ακριβές μηχάνημα στο οποίο ανήκει.

Εικ. 1

Πόσο ζυγίζουν τα βάρη.

Παράμετροι πολλαπλασιασμένες με bytes ανά παράμετρο, και αυτός είναι όλος ο υπολογισμός. Τα βάρη δεκαέξι bit είναι δύο bytes το καθένα, των οκτώ bit είναι ένα, των τεσσάρων bit είναι μισό. Η κβαντοποίηση είναι αυτό που μετατρέπει ένα μηχάνημα που δεν χωρά ένα μοντέλο σε ένα που μπορεί· κοστίζει σε ποιότητα, και το πόσο εξαρτάται από το μοντέλο και τη μέθοδο πολύ περισσότερο από ό,τι μόνο από τον αριθμό των bit. Αν η ακρίβεια είναι το ζητούμενο, δοκιμάστε και τα δύο πριν δεσμευτείτε σε υλικό — η διαφορά είναι φθηνότερο να ανακαλυφθεί τώρα παρά μετά την παράδοση.

Αυτά τα νούμερα είναι τα βάρη και τίποτε άλλο. Είναι το κατώτατο όριο, όχι η απαίτηση — η Εικ. 2 είναι το κομμάτι που πιάνει τον κόσμο απροετοίμαστο.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Εικ. 2 · διαδραστικό

Η μνήμη μιας κάρτας, σχεδιασμένη σε κάτοψη — και γιατί ένα μοντέλο που χωρά μπορεί ακόμα να αρνηθεί να εξυπηρετήσει.

Ο πιο συνηθισμένος τρόπος που πάει στραβά μια αγορά GPU, κάθε φορά με τον ίδιο τρόπο: το μοντέλο είναι τριάντα οκτώ gigabyte, η κάρτα είναι σαράντα, φορτώνει — και κρατά περίπου μία σύντομη συνομιλία. Τα βάρη δεν είναι μόνα τους εκεί μέσα. Σύρετε τον φόρτο εργασίας και δείτε τι κάνει η συνομιλία.

βάρη · σταθερά
χρόνος εκτέλεσης
κρυφή μνήμη κλειδιού-τιμής · μεγαλώνει
ελεύθερο
η μνήμη μιας κάρτας, 100 %

Ένας χρήστης, σύντομο πλαίσιο: ο σφιχτός πολλαπλασιαστής (×1.25) το καλύπτει.

  • Κάθε token σε μια συνομιλία αφήνει μια καταχώριση στην κρυφή μνήμη κλειδιού-τιμής ώστε να μην υπολογιστεί ξανά. Η κρυφή μνήμη μεγαλώνει με το μήκος πλαισίου, και πάλι με κάθε αίτημα που εξυπηρετείται ταυτόχρονα.
  • Υπολογίστε ένα τέταρτο επιπλέον πάνω από τα βάρη για έναν χρήστη τη φορά, μισό επιπλέον για εξυπηρέτηση κίνησης — οι δύο πολλαπλασιαστές στο φύλλο υπολογισμού, και ο δημοσιευμένος κανόνας του ίδιου του ιστότοπου.
  • Αν είναι οριακά, ρωτήστε πριν αγοράσετε: μοντέλο, κβαντοποίηση, πλαίσιο, ταυτοχρονισμός. Προτιμούμε να σας υπολογίσουμε σωστά μια κάρτα τώρα παρά να πάρουμε μια παραγγελία που επιστρέφει ως αίτημα επιστροφής χρημάτων την πρώτη εβδομάδα.

Εικ. 3

Ο πίνακας εφαρμογής: ποια κάρτα ξεπερνά ποιο μοντέλο.

Διαβάστε προς τα κάτω μέχρι το μοντέλο σας, οριζόντια μέχρι την ακρίβεια. Κάθε κελί ονομάζει τη μικρότερη κάρτα στο πρόγραμμα εξαρτημάτων που χωρά αυτά τα βάρη με χώρο να απομείνει για εξυπηρέτηση, και συνδέει με το μηχάνημα στο οποίο μπαίνει. Όπου τίποτε δεν το ξεπερνά μόνο του, το κελί το λέει αντί να αφήνει κενό.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights
  • Η μικρότερη κάρτα που χωρά δεν είναι πάντα η κάρτα που θέλετε. Η μνήμη αποφασίζει αν τρέχει ένα μοντέλο· όλα τα άλλα χαρακτηριστικά της κάρτας αποφασίζουν πόσο γρήγορα, και για πόσα άτομα ταυτόχρονα. Αν η απόδοση μετρά περισσότερο από τον προϋπολογισμό, ανεβείτε ένα σκαλί στο πρόγραμμα.
  • Οι παλαιότερες κάρτες δεν μιλούν τις νεότερες μορφές αριθμών. Αρκετά εξαρτήματα στο πρόγραμμα προηγούνται των FP8 και bfloat16, οπότε ένας χρόνος εκτέλεσης που τα περιμένει θα υποχωρήσει σε κάτι πιο αργό ή θα αρνηθεί. Αξίζει να ρωτήσετε για μια συγκεκριμένη κάρτα και έναν συγκεκριμένο χρόνο εκτέλεσης πριν την παραγγελία.
  • Μια κάρτα AMD τρέχει ROCm, όχι CUDA. Τα εξαρτήματα Instinct είναι εξαιρετική αξία ανά gigabyte και είναι η απάντηση σε περισσότερα από ένα κελιά, αλλά η στοίβα σας πρέπει να υποστηρίζει ROCm. Οι περισσότεροι τρέχοντες χρόνοι εκτέλεσης το υποστηρίζουν· κάποια εργαλεία γύρω τους ακόμα όχι. Ελέγξτε τα δικά σας, ή ρωτήστε και θα το ελέγξουμε μαζί σας.
  • “Περισσότερες από μία κάρτες” είναι μια κατασκευή που κοστολογούμε, όχι επιλογή ταμείου — πόσες κάρτες χωρούν εξαρτάται από το πλάτος της συγκεκριμένης κάρτας και τον προϋπολογισμό ισχύος του πλαισίου. Πολλαπλές GPU και πολλαπλοί κόμβοι είναι εκείνο το φύλλο. Η άλλη απάντηση σε αυτό το μέγεθος είναι 128 GB μνήμης που μοιράζονται ο επεξεργαστής και η GPU, σε ένα μηχάνημα: ενοικίαση ενός NVIDIA DGX Spark.

Πρόγραμμα A

Πρόγραμμα εξαρτημάτων: κάθε κάρτα που τοποθετούμε με δημοσιευμένο αριθμό μνήμης.

Πρώτα οι μεγαλύτερες — αυτό το φύλλο απαντά στο “ποιο είναι το μεγαλύτερο πράγμα που μπορώ να τρέξω”, το αντίστροφο των αποκλειστικών διακομιστών GPU, που ταξινομεί τον ίδιο κατάλογο κατά το φθηνότερο πλήρες μηχάνημα επειδή απαντά στο “πόσο κοστίζει αυτό”. Μια κάρτα της οποίας τη μνήμη ο κατασκευαστής δεν δημοσιεύει παραλείπεται αντί να μαντευτεί.

Αρκετά εξαρτήματα εμφανίζονται σε περισσότερα από ένα πλαίσια, μερικές φορές σε διαφορετικές τιμές, και η γενιά διαύλου του μηχανήματος από κάτω αλλάζει τι μπορεί πραγματικά να κάνει μια σύγχρονη κάρτα — και τα δύο βρίσκονται στους αποκλειστικούς διακομιστές GPU. Το τι είναι τοποθετημένο σε rack και έτοιμο αυτή τη στιγμή είναι πάλι μια διαφορετική ερώτηση, που απαντάται από τους άμεσους διακομιστές.

Αναφορά

Ονομασμένα μοντέλα, αντιστοιχισμένα στις γραμμές.

Οι οικογένειες ανοιχτών βαρών που φέρνει ο κόσμος εδώ, με τον δημοσιευμένο αριθμό παραμέτρων που λέει ποια γραμμή της Εικ. 1 ισχύει. Οι αριθμοί παραμέτρων είναι των ίδιων των εκδοτών· τίποτε άλλο σε ένα μοντέλο δεν έχει σημασία για το ερώτημα εφαρμογής. Ένα μοντέλο που δεν βρίσκεται σε αυτή τη λίστα υπολογίζεται ακριβώς με τον ίδιο τρόπο — παράμετροι × bytes ανά παράμετρο, συν περιθώριο ασφαλείας. Νέες οικογένειες κυκλοφορούν κάθε μήνα· η αριθμητική δεν κουνιέται.

Σημείωση 1 · μείγμα ειδικών

Ένα μοντέλο “30B με 3B ενεργά” χρειάζεται τη μνήμη ενός μοντέλου 30B και τρέχει πιο κοντά στην ταχύτητα ενός μοντέλου 3B: κάθε ειδικός πρέπει να είναι μόνιμα παρών, επειδή διαφορετικά tokens ξυπνούν διαφορετικούς. Υπολογίστε πάντα από τον συνολικό αριθμό παραμέτρων.

ΟικογένειαΜεγέθηΓραμμή
Llama 3.1 / 3.3 Meta8B · 70B7–8B, και 70B για την έκδοση 3.3
Qwen3 Alibaba8B · 14B · 32BΟι τρεις πρώτες γραμμές
DeepSeek-R1 αποστάγματα7B – 70BΈνα ανά γραμμή — διαλέξτε το απόσταγμα που χωρά η κάρτα σας
Mistral Small 3 Mistral AI24BΜεταξύ γραμμών 2 και 3· υπολογίστε το από την αριθμητική, όχι από την ετικέτα
Gemma 3 Google12B · 27BΓραμμή 2, και λίγο κάτω από τη γραμμή 3
Phi-4 Microsoft14BΓραμμή 2
gpt-oss OpenAI20B · 120BΔημοσιευμένο εγγενώς σε 4-bit: μια κάρτα 16 GB, και μία κάρτα 80 GB

Σημειώσεις εγκατάστασης

Ο χρόνος εκτέλεσης είναι δικός σας. Αυτό είναι το νόημα του γυμνού μετάλλου.

Το μηχάνημα φτάνει με καθαρό λειτουργικό σύστημα και root. Καμία υπηρεσία συμπερασμού προμηθευτή μπροστά από το μοντέλο σας, κανένας διαχειριζόμενος χρόνος εκτέλεσης που αναβαθμίζεται μόνος του την εβδομάδα πριν από μια προθεσμία. Τα vLLM και Ollama απαντούν και τα δύο σε ένα τελικό σημείο συμβατό με OpenAI — κώδικας γραμμένος για έναν πάροχο API δείχνει στο δικό σας μηχάνημα αλλάζοντας ένα βασικό URL. Κλειδώστε τον οδηγό, την έκδοση CUDA ή ROCm και το πλαίσιο στις εκδόσεις με τις οποίες δοκιμάστηκε ο κώδικάς σας· τίποτε δεν κινείται κάτω από τα πόδια σας. Αν προτιμάτε να εγκατασταθεί ο οδηγός πριν την παράδοση, πείτε το στην παραγγελία και ονομάστε την έκδοση.

  1. vLLM — εξυπηρέτηση πραγματικής κίνησης. Η συνεχής ομαδοποίηση και η σελιδοποιημένη προσοχή επιτρέπουν σε μία κάρτα να απαντά σε πολλά αιτήματα ταυτόχρονα: η διαφορά μεταξύ μιας επίδειξης και μιας υπηρεσίας. Θέλει μια σχετικά σύγχρονη κάρτα.
  2. llama.cpp — στενή μνήμη, ή παλαιότερη κάρτα. Οι κβαντοποιημένες μορφές του είναι ο λόγος που ένα μεγάλο μοντέλο χωρά σε μια μικρή κάρτα καθόλου· θα χρησιμοποιήσει επεξεργαστή και κάρτα μαζί όταν τα βάρη δεν χωρούν ακριβώς.
  3. TGI · SGLang — διακομιστές παραγωγής στην ίδια οικογένεια, με διαφορετικά πλεονεκτήματα γύρω από δομημένη έξοδο, επαναχρησιμοποίηση προθέματος και εξυπηρέτηση πολλαπλών μοντέλων. Τρέχουν εδώ αμετάβλητα.
  4. Ollama — ο συντομότερος δρόμος από ένα άδειο μηχάνημα σε ένα μοντέλο που απαντά σε μια θύρα. Δέκα λεπτά σας λένε αν ο υπολογισμός σας ήταν σωστός.

Συνθήκες τοποθεσίας

Τι κάνει το δικό σας μηχάνημα που δεν μπορεί ένα API.

Τα prompts δεν φεύγουν ποτέ από το κτίριο

Βάρη, prompts, ανακτημένα έγγραφα και κάθε παραγόμενο token μένουν σε υλικό στο οποίο μόνο εσείς μπορείτε να συνδεθείτε. Άμστερνταμ ή Βουκουρέστι και τα δεδομένα βρίσκονται στην ΕΕ· Νέα Υόρκη, Μαϊάμι ή Σαν Φρανσίσκο και βρίσκονται στις ΗΠΑ. Για φόρτους εργασίας που λογοδοτούν σε υπεύθυνο απορρήτου, αυτή η πρόταση είναι ολόκληρη η επιχειρηματική αιτιολόγηση.

Ο μετρητής δεν τρέχει ποτέ

Ένα API ανά token χρεώνει κάθε token, και ένας πράκτορας ή μια διοχέτευση παρτίδας παράγει tokens όλη μέρα. Ένα αποκλειστικό μηχάνημα είναι το ίδιο ποσό κάθε μήνα σε οποιονδήποτε όγκο, με αμέτρητο εύρος ζώνης από κάτω — βάρη μέσα και tokens έξω δεν κοστίζουν τίποτε πέρα από τη θύρα. Ποιο είναι αυτό το ποσό, είναι η γραμμή του /gpu να συμπληρώσει, όχι αυτού του φύλλου.

Κανείς δεν περιορίζει τον ρυθμό, δεν αποσύρει ούτε αλλάζει το μοντέλο κάτω από τα πόδια σας

Το μοντέλο που κλειδώσατε απαντά αμετάβλητο σε έξι μήνες. Κανένα ανώτατο όριο αιτημάτων ανά λεπτό, καμία ουρά στην ώρα αιχμής κάποιου άλλου, καμία ειδοποίηση απόσυρσης. Η ανταλλαγή είναι τίμια: οι αναβαθμίσεις είναι δικές σας, στο δικό σας πρόγραμμα.

Η εργασία δίπλα στο μοντέλο έχει σπίτι

Η ανάκτηση θέλει ένα μοντέλο ενσωμάτωσης, μια διανυσματική αποθήκη και γρήγορο δίσκο· οι πράκτορες θέλουν χώρο για να τρέχουν εργαλεία. NVMe για την αποθήκη, πυρήνες επεξεργαστή για τη διοχέτευση, η κάρτα για τα tokens — ένα μηχάνημα τα κουβαλά όλα.

Σημείωση 2 · αξιολογήσεις

Κανένας αριθμός tokens ανά δευτερόλεπτο δεν εμφανίζεται σε αυτό το φύλλο.

Σκόπιμα. Κάθε τέτοιος αριθμός εξαρτάται από το μοντέλο, την κβαντοποίηση, τον χρόνο εκτέλεσης και την έκδοσή του, το μέγεθος παρτίδας, το μήκος prompt, το μήκος απάντησης και τον ταυτοχρονισμό — αλλάξτε οποιοδήποτε ένα και κινείται κατά πολλαπλάσιο. Ένας αριθμός τίτλου που δεν κουβαλά όλα αυτά είναι ένας αριθμός επιλεγμένος για να φαίνεται καλός, και θα μας τον χρέωναν. Τι τον διέπει: η ανάγνωση του prompt είναι δεσμευμένη από υπολογισμό και συμβαίνει μία φορά ανά αίτημα· η παραγωγή της απάντησης είναι δεσμευμένη από εύρος ζώνης μνήμης, επειδή κάθε token απαιτεί ανάγνωση των βαρών· η ομαδοποίηση αποσβένει αυτή την ανάγνωση σε ταυτόχρονα αιτήματα, μέχρι να ξεμείνει από χώρο η κρυφή μνήμη κλειδιού-τιμής. Περιθώριο ασφαλείας πάλι.

Ζητήστε μια πραγματική απάντηση αντ’ αυτού

Πείτε μας το μοντέλο, την κβαντοποίηση που σκοπεύετε, το μήκος πλαισίου και περίπου πόσα ταυτόχρονα αιτήματα. Αν έχουμε τρέξει κάτι συγκρίσιμο θα πούμε τι είδαμε και σε τι. Αν όχι, θα το πούμε κι αυτό.

Κάθε ώρα κάθε μέρας — τηλέφωνο, συνομιλία και δελτία. Η Υποστήριξη έχει τους χρόνους απόκρισης γραπτώς.

Σημείωση 3 · λεπτομερής ρύθμιση

Η εκπαίδευση χρειάζεται σημαντικά περισσότερο χώρο από την εξυπηρέτηση.

Η εξυπηρέτηση χρειάζεται τα βάρη. Η εκπαίδευση χρειάζεται τα βάρη, τις κλίσεις και την κατάσταση του βελτιστοποιητή για κάθε παράμετρο που ενημερώνει, όλα μόνιμα παρόντα ταυτόχρονα, συν τις ενεργοποιήσεις που κρατούνται για το πέρασμα προς τα πίσω — ένα μοντέλο που εξυπηρετεί άνετα σε μία κάρτα μπορεί να είναι αρκετές φορές πολύ μεγάλο για πλήρη λεπτομερή ρύθμιση σε αυτήν. Οι μέθοδοι αποδοτικές ως προς τις παραμέτρους ενημερώνουν ένα μικρό κλάσμα των παραμέτρων και χρειάζονται αντίστοιχα μικρό κλάσμα της επιπλέον μνήμης, γι’ αυτό οι περισσότερες λεπτομερείς ρυθμίσεις εδώ χρησιμοποιούν μία. Ο βρόχος εκπαίδευσης επίσης στέλνει συνεχώς παρτίδες μέσω της σύνδεσης επεξεργαστή-κάρτας, οπότε η γενιά PCIe του μηχανήματος από κάτω είναι πραγματικός περιορισμός εκεί με τρόπο που δεν είναι για την εξυπηρέτηση — ποια πλατφόρμα δίνει σε ποια κάρτα ποια σύνδεση βρίσκεται στους αποκλειστικούς διακομιστές GPU. Πείτε μας το μοντέλο, τη μέθοδο, το μήκος ακολουθίας και το μέγεθος του συνόλου δεδομένων και θα το υπολογίσουμε αντί να το ανακαλύψετε μετά την παράδοση· περισσότερες από μία κάρτες είναι το φύλλο των πολλαπλών GPU και πολλαπλών κόμβων.

Παρακείμενα φύλλα

Οι σελίδες εκατέρωθεν αυτής.

Αυτό το φύλλο κατέχει μία ερώτηση: τι χρειάζεται για να τρέξει ένα μοντέλο. Ό,τι είναι παρακείμενο έχει τη δική του σελίδα, και αυτές είναι όλες.

Ερωτήματα που τέθηκαν

Ερωτήσεις από προηγούμενες αναθεωρήσεις αυτού του εγγράφου.

Από όσα πραγματικά μας ρωτούν στη συνομιλία και στα δελτία, περίπου με τη σειρά που τα ρωτούν. Τα τρία πρώτα είναι αυτά που καθορίζουν αν μια αγορά λειτουργεί.

Πόση μνήμη GPU χρειάζεται ένα μεγάλο γλωσσικό μοντέλο;
Τα βάρη είναι ο αριθμός παραμέτρων πολλαπλασιασμένος με τα byte ανά παράμετρο: δύο byte το καθένα στα 16-bit, ένα στα 8-bit, μισό στα 4-bit. Ένα μοντέλο 7–8 δισεκατομμυρίων παραμέτρων είναι 16 GB βάρη στα 16-bit, 8 GB στα 8-bit και 5 GB στα 4-bit· ένα μοντέλο 70 δισεκατομμυρίων παραμέτρων είναι 140 GB, 70 GB και 38 GB. Αυτά τα νούμερα αφορούν μόνο τα βάρη και αποτελούν κατώτατο όριο παρά απαίτηση — υπολογίστε ένα τέταρτο έως μισό επιπλέον για τον χρόνο εκτέλεσης, τις ενεργοποιήσεις και την προσωρινή μνήμη κλειδιού-τιμής.
Τι χρειάζομαι για να τρέξω ένα μοντέλο 70B όπως το Llama 3.3;
Στα 4-bit τα βάρη είναι περίπου 38 GB, οπότε με περιθώριο εξυπηρέτησης η απάντηση είναι μια κάρτα 64 GB ή περισσότερο — μία κάρτα, ένα μηχάνημα. Στα 8-bit τα βάρη είναι 70 GB και μια κάρτα 80 GB ξεπερνά το όριο. Σε πλήρη ακρίβεια 16-bit καμία μεμονωμένη κάρτα που τοποθετούμε δεν το χωρά, και γίνεται μια κατασκευή πολλαπλών καρτών που κοστολογούμε. Το Σχ. 3 παραπάνω ονομάζει τις ακριβείς κάρτες· οι τιμές είναι στους αποκλειστικούς διακομιστές GPU.
Γιατί το μοντέλο μου φορτώνει αλλά αποτυγχάνει να εξυπηρετήσει;
Επειδή τα βάρη δεν είναι το μόνο πράγμα στη μνήμη της κάρτας. Ο χρόνος εκτέλεσης και οι προσωρινές μνήμες του είναι μόνιμα φορτωμένα, και κάθε token σε μια συνομιλία αφήνει μια καταχώριση στην προσωρινή μνήμη κλειδιού-τιμής ώστε να μην χρειάζεται να υπολογιστεί ξανά. Αυτή η προσωρινή μνήμη μεγαλώνει με το μήκος πλαισίου και ξανά με κάθε αίτημα που εξυπηρετείται ταυτόχρονα, οπότε ένα μοντέλο του οποίου τα βάρη μόλις χωρούν θα κρατήσει περίπου μία σύντομη συνομιλία. Διαστασιολογήστε την κάρτα στο ενάμισι έως μιάμιση φορά τα βάρη.
Ποιον χρόνο εκτέλεσης συμπερασμού μπορώ να εγκαταστήσω;
Οποιονδήποτε. Το μηχάνημα φτάνει με καθαρό λειτουργικό σύστημα και root, και δεν υπάρχει υπηρεσία συμπερασμού προμηθευτή μπροστά του. Το vLLM είναι η συνηθισμένη απάντηση για εξυπηρέτηση πραγματικής κίνησης επειδή η συνεχής ομαδοποίηση επιτρέπει σε μία κάρτα να απαντά σε πολλά αιτήματα ταυτόχρονα. Το llama.cpp είναι η συνηθισμένη απάντηση όταν η μνήμη είναι περιορισμένη ή η κάρτα παλαιότερη. Τα TGI και SGLang τρέχουν αμετάβλητα. Το Ollama είναι ο συντομότερος δρόμος από ένα άδειο μηχάνημα σε ένα μοντέλο που απαντά σε μια θύρα — και τα vLLM και Ollama απαντούν και τα δύο σε ένα τελικό σημείο συμβατό με OpenAI, οπότε ο υπάρχων κώδικας πελάτη δείχνει στο δικό σας μηχάνημα αλλάζοντας ένα βασικό URL. Κλειδώνετε τον οδηγό, την έκδοση CUDA ή ROCm και το πλαίσιο στις εκδόσεις με τις οποίες δοκιμάστηκε ο κώδικάς σας.
Είναι η αυτο-φιλοξενία ενός LLM φθηνότερη από ένα API ανά token;
Εξαρτάται αποκλειστικά από τον όγκο, και το σημείο διασταύρωσης είναι πραγματικό: ένα API χρεώνει ανά token και δεν κοστίζει τίποτα όταν είναι αδρανές· ένα αποκλειστικό μηχάνημα είναι ένα σταθερό μηνιαίο ποσό και δεν κοστίζει τίποτα επιπλέον όταν είναι απασχολημένο. Σταθερή κίνηση, πράκτορες που τρέχουν όλη μέρα, ομαδικές διοχετεύσεις και οτιδήποτε με απαίτηση απορρήτου τείνουν να βγαίνουν μπροστά στο δικό τους υλικό· ένας φόρτος εργασίας που ενεργοποιείται δέκα φορές την ημέρα όχι. Τα μηνιαία νούμερα για να κάνετε αυτόν τον υπολογισμό είναι στους αποκλειστικούς διακομιστές GPU — αυτό το έγγραφο σκόπιμα δεν κοστολογεί τίποτα.
Πόσα token ανά δευτερόλεπτο θα πάρω;
Δεν δημοσιεύουμε αριθμό token ανά δευτερόλεπτο, επειδή κάθε τέτοιος αριθμός εξαρτάται από το μοντέλο, την κβαντοποίηση, τον χρόνο εκτέλεσης και την έκδοσή του, το μέγεθος παρτίδας, το μήκος προτροπής, το μήκος απάντησης και την ταυτοχρονία, και η αλλαγή οποιουδήποτε τον μετακινεί κατά πολλαπλάσιο. Τι το διέπει: η ανάγνωση της προτροπής είναι δεσμευμένη από υπολογισμό και συμβαίνει μία φορά ανά αίτημα· η δημιουργία της απάντησης είναι δεσμευμένη από εύρος ζώνης μνήμης επειδή κάθε token απαιτεί ανάγνωση των βαρών· και η ομαδοποίηση κατανέμει αυτή την ανάγνωση σε ταυτόχρονα αιτήματα, που είναι αυτό που κάνει την εξυπηρέτηση οικονομική μέχρι να εξαντληθεί ο χώρος της προσωρινής μνήμης κλειδιού-τιμής. Ρωτήστε με το μοντέλο, την κβαντοποίηση και την αναμενόμενη ταυτοχρονία για μια απάντηση βασισμένη σε όσα έχουμε πραγματικά παρατηρήσει.
Μοιράζεται η GPU με κάποιον άλλο;
Όχι. Ένας μισθωτής ανά φυσικό μηχάνημα, και η κάρτα περνά απευθείας στο δικό σας λειτουργικό σύστημα. Δεν υπάρχει hypervisor, διαμέρισμα MIG, προφίλ vGPU ή χρονοπρογραμματιστής κατανομής χρόνου, οπότε τίποτα άλλο δεν τρέχει στην κάρτα και η καθυστέρηση συμπερασμού δεν μεταβάλλεται εξαιτίας της ομαδικής εργασίας κάποιου άλλου.
Τι γίνεται αν το μοντέλο δεν χωρά σε μία κάρτα;
Τότε είναι μια κατασκευή πολλαπλών καρτών, η οποία κοστολογείται αντί να παραγγέλλεται από ταμείο: πόσες κάρτες χωρούν εξαρτάται από το φυσικό πλάτος της συγκεκριμένης κάρτας και τον προϋπολογισμό ισχύος του πλαισίου. Δύο κάρτες δίνουν το άθροισμα της μνήμης τους μόνο αν ο χρόνος εκτέλεσης μπορεί να χωρίσει το μοντέλο και στις δύο, κάτι που κάθε σοβαρός χρόνος εκτέλεσης υποστηρίζει με κάποιο κόστος στην απόδοση. Περισσότερες από μία κάρτες ή μηχανήματα καλύπτει πώς μοιάζει αυτή η κατασκευή.
Χρειάζεται η λεπτομερής ρύθμιση περισσότερη μνήμη από την εξυπηρέτηση;
Σημαντικά περισσότερη. Η εξυπηρέτηση χρειάζεται τα βάρη· η εκπαίδευση χρειάζεται τα βάρη, τις κλίσεις και την κατάσταση βελτιστοποιητή για κάθε παράμετρο που ενημερώνεται, όλα μόνιμα φορτωμένα ταυτόχρονα, συν τις ενεργοποιήσεις που διατηρούνται για το πέρασμα προς τα πίσω. Ένα μοντέλο που εξυπηρετεί άνετα σε μία κάρτα μπορεί να είναι αρκετές φορές πολύ μεγάλο για πλήρη λεπτομερή ρύθμιση σε αυτήν. Οι μέθοδοι αποδοτικές ως προς τις παραμέτρους ενημερώνουν ένα μικρό κλάσμα των παραμέτρων και χρειάζονται αντίστοιχα μικρό κλάσμα της επιπλέον μνήμης, γι' αυτό οι περισσότερες λεπτομερείς ρυθμίσεις εδώ χρησιμοποιούν μία.
Μπορώ να τρέξω μια κάρτα AMD, και λειτουργεί το ROCm;
Ναι. Τα εξαρτήματα AMD Instinct είναι από τις κάρτες με τη μεγαλύτερη μνήμη που τοποθετούμε και είναι συχνά η καλύτερη αξία ανά gigabyte, αλλά η στοίβα σας πρέπει να υποστηρίζει ROCm αντί για CUDA. Οι περισσότεροι τρέχοντες χρόνοι εκτέλεσης συμπερασμού το κάνουν· κάποια περιβάλλοντα εργαλεία ακόμα όχι. Ρωτήστε πριν παραγγείλετε και θα το ελέγξουμε σε σχέση με τον συγκεκριμένο χρόνο εκτέλεσής σας αντί να απαντήσουμε γενικά.

For the record

Everything on this sheet, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.