Γλωσσικά μοντέλα σε γυμνό μέταλλο · Primcast LLC · από το 2004

Το μοντέλο αποφασίζει για τη μνήμη. Τίποτα άλλο στη φόρμα παραγγελίας δεν το κάνει.

Οι άνθρωποι φτάνουν σε αυτήν τη σελίδα πιστεύοντας ότι η απόφαση είναι ποιος επιταχυντής είναι ο ταχύτερος. Δεν είναι. Τα βάρη είτε χωράνε στη μνήμη της κάρτας είτε όχι — μια κάρτα με δύο gigabyte λιγότερο δεν τρέχει πιο αργά, δεν φορτώνει. Έτσι, αυτή η σελίδα πηγαίνει με τη σειρά που πηγαίνει στην πραγματικότητα η απόφαση: πόσο μεγάλο είναι το μοντέλο, με ποια ακρίβεια θα το εκτελέσετε, πόσο χώρο χρειάζεται η συνομιλία και μόνο τότε ποια κάρτα ξεπερνά τον πήχη. Οι τιμές είναι μία σελίδα πιο πέρα, σκόπιμα.

Ποια κάρτα λειτουργεί με το μοντέλο μου; Τι εγκαθιστώ σε αυτό

Ένας ένοικος ανά υπολογιστή. Η κάρτα διαβιβάζεται στο λειτουργικό σας σύστημα και οι εκδόσεις του χρόνου εκτέλεσης, του προγράμματος οδήγησης και του πλαισίου είναι δικές σας για να επιλέξετε και να καρφιτσώσετε.

Βήμα πρώτο

Τι ζυγίζουν στην πραγματικότητα τα βάρη.

Οι παράμετροι πολλαπλασιάζονται με bytes ανά παράμετρο, και αυτός είναι ολόκληρος ο υπολογισμός. Τα βάρη των δεκαέξι bit είναι δύο bytes το καθένα, τα οκτώ bit είναι ένα, τα τέσσερα bit είναι μισό. Ένα μοντέλο επτά δισεκατομμυρίων παραμέτρων στα δεκαέξι bit είναι δεκατέσσερα gigabytes βαρών. Το ίδιο μοντέλο στα τέσσερα bit είναι μεταξύ τριών και τεσσάρων.

Η κβαντοποίηση είναι αυτό που μετατρέπει μια μηχανή που δεν μπορεί να κρατήσει ένα μοντέλο σε μια που μπορεί. Κοστίζει ποιότητα, και το πόσο εξαρτάται από το μοντέλο και τη μέθοδο πολύ περισσότερο από τον αριθμό των bit μόνο — ένα καλά κβαντισμένο μοντέλο τεσσάρων bit είναι συνήθως πιο κοντά στον πλήρη εαυτό του από ό,τι περιμένουν οι άνθρωποι, και ένα κακώς κβαντισμένο μοντέλο οκτώ bit μπορεί να είναι χειρότερο. Εάν η ακρίβεια είναι το ζητούμενο της άσκησης, δοκιμάστε και τα δύο πριν δεσμευτείτε για υλικό. Η διαφορά είναι φθηνότερη στην ανακάλυψη τώρα παρά μετά την παράδοση.

Αυτά τα στοιχεία είναι τα βάρη και τίποτα άλλο. Είναι το κατώτατο όριο, όχι η απαίτηση. Το επόμενο τμήμα είναι αυτό που ξεχωρίζει τους ανθρώπους.

Weights only — the runtime, the activations and the conversation are extra, and are the subject of the next section.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB8 GB5 GB
13-14 billion parameters28 GB14 GB8 GB
30-34 billion parameters68 GB34 GB19 GB
70 billion parameters140 GB70 GB38 GB

Βήμα δεύτερο

Γιατί ένα μοντέλο που ταιριάζει ακόμα δεν θα εξυπηρετήσει.

Αυτός είναι ο πιο συνηθισμένος τρόπος με τον οποίο μια αγορά GPU πάει στραβά, και πάει στραβά με τον ίδιο τρόπο κάθε φορά: κάποιος διαβάζει ότι το μοντέλο του είναι τριάντα οκτώ gigabyte, αγοράζει μια κάρτα σαράντα gigabyte, την φορτώνει με επιτυχία και στη συνέχεια ανακαλύπτει ότι μπορεί να χωρέσει περίπου μία σύντομη συνομιλία.

  • Ο χρόνος εκτέλεσης είναι επίσης εκεί μέσα

    Η φόρτωση ενός μοντέλου δεν είναι το μόνο πράγμα που καταλαμβάνει την κάρτα. Ο ίδιος ο χρόνος εκτέλεσης, οι προσωρινές μνήμες του και οι ενεργοποιήσεις ό,τι υπολογίζεται βρίσκονται όλα στην ίδια μνήμη με τα βάρη.

  • Η συζήτηση είναι εκεί μέσα και μεγαλώνει

    Κάθε διακριτικό που βρίσκεται ήδη σε μια συνομιλία αφήνει κάτι πίσω στην προσωρινή μνήμη κλειδιού-τιμής, επομένως δεν χρειάζεται να υπολογιστεί ξανά. Αυτή η προσωρινή μνήμη μεγαλώνει με το μήκος του περιβάλλοντος και ξανά με κάθε αίτημα που εξυπηρετείται ταυτόχρονα. Ένα μεγάλο περιβάλλον ή ένα πολυάσχολο τελικό σημείο μπορεί να χρειάζεται τόση μνήμη όσο ένα μικρό μοντέλο.

  • Λοιπόν: πάλι μισό παρά τέταρτο

    Υπολογίστε τουλάχιστον το ένα τέταρτο περισσότερη μνήμη κάρτας από τα βάρη και πάλι το μισό εάν το περιεχόμενο είναι μεγάλο ή το τελικό σημείο είναι απασχολημένο. Αυτός είναι ο κανόνας που ισχύει για εσάς ο πίνακας στην επόμενη ενότητα — κάθε κάρτα που κατονομάζει περιέχει τα βάρη μιάμιση φορά.

  • Και αν είναι κοντά, πες το πριν αγοράσεις

    Πείτε μας το μοντέλο, την κβαντοποίηση, το μήκος πλαισίου που χρειάζεστε και περίπου πόσα αιτήματα ταυτόχρονα. Θα προτιμούσαμε να σας πείσουμε να αγοράσετε μια μεγαλύτερη κάρτα τώρα ή ένα μικρότερο μοντέλο, παρά να δεχτούμε μια παραγγελία που θα σας απογοητεύσει την πρώτη εβδομάδα και θα σας επιστρέψει ως αίτημα επιστροφής χρημάτων.

Βήμα τρίτο

Ποια κάρτα λειτουργεί με ποιο μοντέλο.

Διαβάστε προς τα κάτω μέχρι το μέγεθος του μοντέλου σας και καταγράψτε την ακρίβεια με την οποία σκοπεύετε να εκτελέσετε. Κάθε κελί ονομάζει τη μικρότερη κάρτα που τοποθετούμε και η οποία περιέχει αυτά τα βάρη με χώρο για να εξυπηρετήσει και συνδέεται με το μηχάνημα στο οποίο τοποθετείται. Όπου ο κατάλογος δεν περιέχει τίποτα που να το κάνει από μόνο του, το κελί το αναφέρει αντί να αφήνει ένα κενό.

The smallest card we fit that holds the weights with room left to serve — that is 1.5× the weights, the generous end of the quarter-to-a-half head-room rule below. No prices here on purpose: GPU dedicated servers holds every one.
If you want to runat 16-bitat 8-bitat 4-bit
7-8 billion parametersTESLA P40 / QUADRO P600024 GB16 GB of weightsTITAN V12 GB HBM28 GB of weightsTESLA P48 GB GDDR55 GB of weights
13-14 billion parametersRTX A600048 GB GDDR6 ECC28 GB of weightsTESLA P40 / QUADRO P600024 GB14 GB of weightsTITAN V12 GB HBM28 GB of weights
30-34 billion parametersMore than one cardNothing we fit holds it alone68 GB of weightsInstinct MI21064 GB HBM2e34 GB of weightsTesla V100 32GB32 GB HBM219 GB of weights
70 billion parametersMore than one cardNothing we fit holds it alone140 GB of weightsMore than one cardNothing we fit holds it alone70 GB of weightsInstinct MI21064 GB HBM2e38 GB of weights

Τρία πράγματα που δεν μπορεί να σου πει το τραπέζι

  • Η μικρότερη κάρτα που ταιριάζει δεν είναι πάντα η κάρτα που θέλετε. Η μνήμη αποφασίζει αν ένα μοντέλο θα τρέξει. Όλα τα άλλα σχετικά με την κάρτα καθορίζουν πόσο γρήγορα θα τρέξει και πόσα άτομα μπορεί να εξυπηρετήσει ταυτόχρονα. Ο πίνακας βελτιστοποιεί το πρώτο, επειδή το πρώτο είναι ένα σκληρό τοίχωμα και το δεύτερο είναι μια προτίμηση. Αν η απόδοση έχει μεγαλύτερη σημασία από τον προϋπολογισμό, προχωρήστε ένα βήμα παραπάνω στην παρακάτω λίστα.
  • Οι παλαιότερες κάρτες δεν χρησιμοποιούν τις νεότερες μορφές αριθμών. Αρκετά μέρη στον κατάλογό μας χρονολογούνται πριν από τα FP8 και bfloat16, επομένως ένα runtime που τις αναμένει θα επιστρέψει σε κάτι πιο αργό ή θα αρνηθεί. Αυτή είναι μια ερώτηση που αξίζει να τεθεί πριν από την παραγγελία και στην οποία θα απαντήσουμε για μια συγκεκριμένη κάρτα και ένα συγκεκριμένο runtime και όχι γενικά.
  • Μια κάρτα AMD τρέχει ROCm, όχι CUDA. Τα εξαρτήματα του Instinct έχουν εξαιρετική αξία ανά gigabyte και αποτελούν την απάντηση σε περισσότερα από ένα κελί παραπάνω, αλλά η στοίβα σας πρέπει να υποστηρίζει ROCm. Τα περισσότερα τρέχοντα runtimes το κάνουν. Κάποια εργαλεία γύρω από αυτά εξακολουθούν να μην το κάνουν. Ελέγξτε τη δική σας ή ρωτήστε και θα το ελέγξουμε μαζί σας.

Όταν η απάντηση είναι «περισσότερες από μία κάρτες», αυτή είναι μια έκδοση που αναφέρουμε και όχι μια επιλογή ολοκλήρωσης αγοράς, και η σελίδα με πολλαπλές GPU και πολλαπλούς κόμβους εξηγεί πώς μοιάζει και τι την περιορίζει. Το μηνιαίο κόστος καθεμίας από αυτές τις κάρτες και το κόστος του μηχανήματος που βρίσκεται κάτω από αυτήν είναι οι αποκλειστικοί διακομιστές GPU — κάθε αριθμός εκεί είναι συνδεδεμένος με το ακριβές μηχάνημα στο οποίο ανήκει, γι' αυτό και αυτή η σελίδα δεν επαναλαμβάνει κανέναν από αυτούς.

Από μνήμης, το μεγαλύτερο πρώτο

Κάθε κάρτα που προσαρμόζουμε και δημοσιεύει μια φιγούρα μνήμης.

Στον ίδιο κατάλογο, οι τιμές της σελίδας GPU, ταξινομημένες αντίστροφα: αυτή η σελίδα ξεκινά με το φθηνότερο ολοκληρωμένο μηχάνημα επειδή απαντά «πόσο κοστίζει αυτό» και αυτή ξεκινά με τη μεγαλύτερη κάρτα επειδή απαντά «ποιο είναι το μεγαλύτερο πράγμα που μπορώ να τρέξω». Μια κάρτα της οποίας τη μνήμη δεν δημοσιεύει ο κατασκευαστής παραλείπεται εδώ αντί να εμφανίζεται με κενό, επειδή μια γραμμή που δεν μπορεί να συγκριθεί δεν χρησιμεύει σε μια σύγκριση.

Αρκετά από αυτά εμφανίζονται σε περισσότερα από ένα πλαίσια, μερικές φορές σε διαφορετικές τιμές, και η γενιά διαύλου του μηχανήματος από κάτω αλλάζει αυτό που μπορεί στην πραγματικότητα να κάνει μια σύγχρονη κάρτα — και τα δύο βρίσκονται σε αποκλειστικούς διακομιστές GPU . Το τι στέκεται έτοιμο αυτή τη στιγμή είναι και πάλι ένα διαφορετικό ερώτημα, που απαντάται από άμεσους διακομιστές .

Τι εγκαθιστάτε σε αυτό

Ο χρόνος εκτέλεσης είναι δικός σας, και αυτό είναι το νόημα του bare metal.

Το μηχάνημα συνοδεύεται από ένα καθαρό λειτουργικό σύστημα και root. Δεν υπάρχει υπηρεσία εξαγωγής συμπερασμάτων από τον προμηθευτή που πρέπει να χρησιμοποιήσετε, δεν υπάρχει διαχειριζόμενο runtime που να αναβαθμίζεται μόνο του την εβδομάδα πριν από μια προθεσμία και δεν υπάρχει API μπροστά από το δικό σας μοντέλο. Εγκαθιστάτε αυτό που θέλετε και το καρφιτσώνετε στην έκδοση στην οποία δοκιμάστηκε ο κώδικά σας.

vLLM

Η συνήθης απάντηση για την προβολή ενός μοντέλου σε πραγματική επισκεψιμότητα. Η συνεχής ομαδοποίηση και η σελιδοποιημένη προσοχή είναι αυτά που επιτρέπουν σε μια κάρτα να απαντά σε πολλά αιτήματα ταυτόχρονα αντί για ένα κάθε φορά, κάτι που συνήθως αποτελεί τη διαφορά μεταξύ μιας επίδειξης και μιας υπηρεσίας. Θέλει μια αρκετά σύγχρονη κάρτα.

llama.cpp

Η συνήθης απάντηση όταν η μνήμη είναι περιορισμένη ή η κάρτα είναι παλαιότερη. Οι κβαντισμένες μορφές της είναι ο λόγος που ένα μεγάλο μοντέλο χωράει σε μια μικρή κάρτα και θα χρησιμοποιήσει ευχαρίστως τον επεξεργαστή και την κάρτα μαζί όταν τα βάρη δεν ταιριάζουν απόλυτα. Πιο αργή ανά αίτημα, πολύ πιο επιεικής.

TGI και SGLang

Διακομιστές παραγωγής στην ίδια οικογένεια με το vLLM, με διαφορετικά πλεονεκτήματα όσον αφορά τη δομημένη έξοδο, την επαναχρησιμοποίηση προθέματος και την εξυπηρέτηση πολλαπλών μοντέλων. Εάν έχετε ήδη έναν στη στοίβα σας, εκτελείται εδώ αμετάβλητος.

Ολάμα

Η συντομότερη διαδρομή από ένα άδειο μηχάνημα σε ένα μοντέλο που απαντά σε μια θύρα. Αξίζει να ξεκινήσετε ακόμα κι αν καταλήξετε κάπου αλλού, επειδή θα σας πει σε περίπου δέκα λεπτά αν το μέγεθός σας ήταν σωστό.

Όποιο κι αν επιλέξετε, ο οδηγός, η έκδοση CUDA ή ROCm και η έκδοση του framework είναι δικά σας για να τα καρφιτσώσετε και τίποτα δεν αναβαθμίζεται κάτω από εσάς. Εάν προτιμάτε ο οδηγός να έχει εγκατασταθεί πριν από την παράδοση, αναφέρετέ το στην παραγγελία και ονομάστε την έκδοση.

Πόσο γρήγορα θα είναι

Δεν δημοσιεύουμε αριθμό tokens ανά δευτερόλεπτο και να γιατί.

Κάθε τέτοιος αριθμός εξαρτάται από το μοντέλο, την κβαντοποίηση, τον χρόνο εκτέλεσης και την έκδοσή του, το μέγεθος της παρτίδας, το μήκος της προτροπής, το μήκος της απάντησης και τον αριθμό των αιτημάτων που βρίσκονται σε εξέλιξη. Αλλάξτε οποιοδήποτε και ο αριθμός θα μετακινηθεί κατά ένα πολλαπλάσιο. Ένας αριθμός τίτλου που δεν τα περιέχει όλα αυτά είναι ένας αριθμός που επιλέγεται για να φαίνεται καλός και θα μας δοθεί εισαγωγικά σε αυτόν.

Αυτό που θα σας πούμε είναι τι το διέπει, ώστε να μπορείτε να συλλογιστείτε τη δική σας περίπτωση:

  • Η ανάγνωση της προτροπής γίνεται με υπολογισμούς. Συμβαίνει μία φορά ανά αίτημα, παράλληλα σε ολόκληρη την προτροπή, και εκεί εμφανίζεται η αριθμητική απόδοση μιας κάρτας και η υποστήριξή της για τις νεότερες μορφές αριθμών.
  • Η δημιουργία της απάντησης εξαρτάται από το εύρος ζώνης της μνήμης. Κάθε διακριτικό απαιτεί την ανάγνωση των βαρών, επομένως για ένα μόνο αίτημα το ανώτατο όριο είναι περίπου η ταχύτητα με την οποία η κάρτα μπορεί να μεταδώσει τη δική της μνήμη. Αυτός είναι ο λόγος για τον οποίο μια κάρτα με πιο αργή μνήμη και περισσότερη μνήμη μπορεί να χάσει από μια μικρότερη, ταχύτερη σε καθυστέρηση, ενώ να κερδίσει στο αν το μοντέλο ταιριάζει καθόλου.
  • Η μαζική επεξεργασία είναι αυτό που την καθιστά οικονομική. Η ταυτόχρονη εξυπηρέτηση πολλών αιτημάτων αποσβένει αυτή την ανάγνωση βάρους σε όλα αυτά, γι' αυτό και η συνολική απόδοση αυξάνεται απότομα με την ταυτόχρονη επεξεργασία, ενώ η καθυστέρηση ανά αίτημα μεταβάλλεται ελάχιστα — μέχρι να εξαντληθεί ο χώρος στην προσωρινή μνήμη κλειδιού-τιμής, οπότε όλα υποβαθμίζονται ταυτόχρονα. Πάλι χώρος.

Ζητήστε μια πραγματική απάντηση αντ' αυτού

Πείτε μας το μοντέλο, την κβαντοποίηση που σκοπεύετε, το μήκος του περιβάλλοντος και περίπου πόσα ταυτόχρονα αιτήματα αναμένετε. Εάν έχουμε εκτελέσει κάτι συγκρίσιμο, θα πούμε τι είδαμε και σε ποιο. Εάν όχι, θα το πούμε κι αυτό.

Είναι μια καλύτερη βάση για μια αγορά από ένα γράφημα αναφοράς και διαρκεί περίπου ένα λεπτό.

Οι συνήθεις ώρες υποστήριξης είναι όλες αυτές — τηλέφωνο, συνομιλία και αιτήματα, κάθε μέρα του χρόνου. Η υποστήριξη έχει γραπτώς τους χρόνους απόκρισης.

Πέρα από την εξυπηρέτηση

Η μικρορύθμιση απαιτεί πολύ περισσότερο χώρο από το σερβίρισμα.

Όλα τα παραπάνω διαστασιολογούν ένα μοντέλο για εξαγωγή συμπερασμάτων: εισάγονται βάρη, εξέρχονται διακριτικά. Η εκπαίδευση ή η βελτιστοποίηση του ίδιου μοντέλου είναι ένα διαφορετικό πρόβλημα μνήμης και η διαφορά δεν είναι μικρή.

Γιατί κοστίζει περισσότερη μνήμη

Η εξυπηρέτηση χρειάζεται τα βάρη. Η εκπαίδευση χρειάζεται τα βάρη, τις διαβαθμίσεις και την κατάσταση του βελτιστοποιητή για κάθε παράμετρο που ενημερώνει, όλα ταυτόχρονα, καθώς και τις ενεργοποιήσεις που πρέπει να διατηρήσει για να λειτουργεί αντίστροφα μέσω του δικτύου. Ένα μοντέλο που εξυπηρετεί άνετα σε μία κάρτα μπορεί να είναι αρκετές φορές πολύ μεγάλο για να βελτιστοποιηθεί πλήρως στην ίδια κάρτα.

Γι' αυτό και οι περισσότεροι άνθρωποι δεν το κάνουν πλήρως

Οι μέθοδοι που είναι αποδοτικές ως προς τις παραμέτρους — προσαρμογείς, ενημερώσεις χαμηλής τάξης και οι κβαντισμένες παραλλαγές τους — ενημερώνουν ένα μικρό κλάσμα των παραμέτρων και χρειάζονται ένα αντίστοιχα μικρό κλάσμα της επιπλέον μνήμης. Για τις περισσότερες εργασίες που οι άνθρωποι αποκαλούν βελτιστοποίηση, αυτή είναι και η πρακτική επιλογή και αυτή που ταιριάζει σε υλικό που μπορείτε να αντέξετε οικονομικά να διατηρήσετε.

Τι να μας πείτε

Το μοντέλο, η μέθοδος, το μήκος της ακολουθίας και το μέγεθος του συνόλου δεδομένων. Δεν θα δημοσιεύσουμε εδώ έναν πολλαπλασιαστή επειδή ο ειλικρινής εξαρτάται και από τα τέσσερα, και ένας επινοημένος αριθμός που υποβαθμίζει το μηχάνημά σας είναι χειρότερος και για τους δύο μας από μια συζήτηση. Εάν η απάντηση είναι περισσότερες από μία κάρτες, η πολλαπλή GPU και ο πολλαπλός κόμβος εξηγούν πώς μοιάζει αυτή η κατασκευή.

Το λεωφορείο έχει σημασία εδώ με έναν τρόπο που δεν έχει για την εξυπηρέτηση

Ένας βρόχος εκπαίδευσης μεταδίδει συνεχώς παρτίδες μέσω της σύνδεσης μεταξύ επεξεργαστή και κάρτας, επομένως η παραγωγή PCIe του μηχανήματος από κάτω αποτελεί πραγματικό περιορισμό και όχι προδιαγραφή. Η εξαγωγή συμπερασμάτων για ένα μοντέλο που βρίσκεται στην ίδια θέση με αυτό το μοντέλο δεν το επηρεάζει σχεδόν καθόλου. Ποια πλατφόρμα δίνει σε μια κάρτα ποιος σύνδεσμος δημοσιεύεται σε αποκλειστικούς διακομιστές GPU και συγκρίνεται μεταξύ πλατφορμών σε πολλαπλές GPU και πολλαπλούς κόμβους .

Πού να πάτε στη συνέχεια

Οι σελίδες εκατέρωθεν αυτού.

Αυτή η σελίδα έχει ένα ερώτημα: τι χρειάζεται για να εκτελέσετε ένα μοντέλο. Όλα τα γειτονικά έχουν τη δική τους σελίδα και αυτά είναι όλα.

Ερωτήθηκε πριν

Οι οκτώ ερωτήσεις στις οποίες υπάρχει αυτή η σελίδα για να απαντήσει.

Με βάση αυτά που μας ρωτούν οι άνθρωποι στη συνομιλία και στα εισιτήρια, περίπου με τη σειρά που τα ρωτούν. Τα δύο πρώτα είναι αυτά που καθορίζουν εάν μια αγορά λειτουργεί.

Πόση μνήμη GPU χρειάζεται ένα μεγάλο γλωσσικό μοντέλο;
Τα βάρη είναι ο αριθμός των παραμέτρων πολλαπλασιασμένος με τα byte ανά παράμετρο: δύο byte για το καθένα στα 16-bit, ένα στα 8-bit, μισό στα 4-bit. Ένα μοντέλο 7–8 δισεκατομμυρίων παραμέτρων έχει 16 GB βαρών στα 16-bit, 8 GB στα 8-bit και 5 GB στα 4-bit. Ένα μοντέλο 70 δισεκατομμυρίων παραμέτρων έχει 140 GB, 70 GB και 38 GB. Αυτά τα στοιχεία είναι από μόνα τους τα βάρη και αποτελούν ένα κατώτατο όριο παρά μια απαίτηση — προϋπολογίστε ξανά ένα τέταρτο έως μισό επιπλέον για τον χρόνο εκτέλεσης, τις ενεργοποιήσεις και την προσωρινή μνήμη κλειδιού-τιμής.
Γιατί φορτώνει το μοντέλο μου αλλά δεν εμφανίζεται;
Επειδή τα βάρη δεν είναι τα μόνα πράγματα στη μνήμη της κάρτας. Ο χρόνος εκτέλεσης και οι προσωρινές μνήμες του είναι μόνιμα αποθηκευμένες και κάθε διακριτικό σε μια συνομιλία αφήνει μια καταχώρηση στην προσωρινή μνήμη κλειδιού-τιμής, επομένως δεν χρειάζεται να υπολογιστεί ξανά. Αυτή η προσωρινή μνήμη αυξάνεται με το μήκος του περιβάλλοντος και ξανά με κάθε αίτημα που εξυπηρετείται ταυτόχρονα, επομένως ένα μοντέλο του οποίου τα βάρη μόλις ταιριάζουν θα διατηρεί περίπου μία σύντομη συνομιλία. Υπολογίστε το μέγεθος της κάρτας στο μιάμιση φορά έως ενάμιση φορά τα βάρη.
Ποιο περιβάλλον εκτέλεσης συμπερασμάτων μπορώ να εγκαταστήσω;
Οποιοδήποτε από αυτά. Το μηχάνημα φτάνει με ένα καθαρό λειτουργικό σύστημα και root, και δεν υπάρχει υπηρεσία συμπερασμάτων προμηθευτή μπροστά του. Το vLLM είναι η συνήθης απάντηση για την εξυπηρέτηση πραγματικής κίνησης, επειδή η συνεχής ομαδοποίηση επιτρέπει σε μία κάρτα να απαντά σε πολλά αιτήματα ταυτόχρονα. Το llama.cpp είναι η συνήθης απάντηση όταν η μνήμη είναι περιορισμένη ή η κάρτα είναι παλαιότερη. Τα TGI και SGLang εκτελούνται αμετάβλητα. Το Ollama είναι η συντομότερη διαδρομή από ένα άδειο μηχάνημα σε ένα μοντέλο που απαντά σε μια θύρα. Καρφιτσώνετε τον οδηγό, την έκδοση CUDA ή ROCm και το framework στις εκδόσεις στις οποίες δοκιμάστηκε ο κώδικά σας.
Πόσα tokens ανά δευτερόλεπτο θα λαμβάνω;
Δεν δημοσιεύουμε έναν αριθμό διακριτικών ανά δευτερόλεπτο, επειδή κάθε τέτοιος αριθμός εξαρτάται από το μοντέλο, την κβαντοποίηση, τον χρόνο εκτέλεσης και την έκδοσή του, το μέγεθος της παρτίδας, το μήκος της προτροπής, το μήκος της απάντησης και την ταυτόχρονη λειτουργία, και η αλλαγή οποιουδήποτε από αυτά το μετακινεί κατά ένα πολλαπλάσιο. Τι το διέπει: η ανάγνωση της προτροπής είναι υπολογιστικά περιορισμένη και συμβαίνει μία φορά ανά αίτημα. η δημιουργία της απάντησης είναι περιορισμένη από το εύρος ζώνης μνήμης επειδή κάθε διακριτικό απαιτεί την ανάγνωση των βαρών. και η μαζική επεξεργασία αποσβένει αυτήν την ανάγνωση σε ταυτόχρονα αιτήματα, κάτι που καθιστά την εξυπηρέτηση οικονομική μέχρι να εξαντληθεί ο χώρος στην προσωρινή μνήμη κλειδιού-τιμής. Ζητήστε μια απάντηση με βάση αυτό που έχουμε πραγματικά παρατηρήσει.
Είναι η GPU κοινόχρηστη με κάποιον άλλο;
Όχι. Ένας μισθωτής ανά φυσικό μηχάνημα και η κάρτα διαβιβάζεται στο δικό σας λειτουργικό σύστημα. Δεν υπάρχει hypervisor, ούτε διαμέρισμα MIG, ούτε προφίλ vGPU ούτε χρονοπρογραμματιστής χρονικού διαχωρισμού, επομένως τίποτα άλλο δεν εκτελείται στην κάρτα και η καθυστέρηση συμπερασμάτων δεν μετακινείται λόγω της μαζικής εργασίας κάποιου άλλου.
Τι γίνεται αν το μοντέλο δεν χωράει σε μία κάρτα;
Στη συνέχεια, πρόκειται για μια έκδοση πολλαπλών καρτών, η οποία είναι προσφορά και όχι παραγγελία από ένα ταμείο: το πόσες κάρτες ταιριάζουν εξαρτάται από το φυσικό πλάτος της συγκεκριμένης κάρτας και τον προϋπολογισμό ισχύος του πλαισίου. Δύο κάρτες σας δίνουν το άθροισμα της μνήμης τους μόνο εάν ο χρόνος εκτέλεσης μπορεί να χωρίσει το μοντέλο και στα δύο, κάτι που κάθε σοβαρός χρόνος εκτέλεσης υποστηρίζει με κάποιο κόστος σε απόδοση. Περισσότερες από μία κάρτες ή μηχανήματα καλύπτουν την εμφάνιση αυτής της έκδοσης.
Χρειάζεται περισσότερη μνήμη η βελτιστοποίηση από την προβολή;
Σημαντικά περισσότερο. Το σερβίρισμα χρειάζεται τα βάρη. Η εκπαίδευση χρειάζεται τα βάρη, τις διαβαθμίσεις και την κατάσταση του βελτιστοποιητή για κάθε παράμετρο που ενημερώνεται, όλα ταυτόχρονα, συν τις ενεργοποιήσεις που διατηρούνται για το πέρασμα προς τα πίσω. Ένα μοντέλο που εξυπηρετεί άνετα σε μία κάρτα μπορεί να είναι αρκετές φορές πολύ μεγάλο για να βελτιστοποιηθεί πλήρως σε αυτήν. Οι μέθοδοι που είναι αποδοτικές ως προς τις παραμέτρους ενημερώνουν ένα μικρό κλάσμα των παραμέτρων και χρειάζονται ένα αντίστοιχα μικρό κλάσμα της επιπλέον μνήμης, γι' αυτό και οι περισσότερες μέθοδοι βελτιστοποίησης εδώ χρησιμοποιούν μία.
Μπορώ να χρησιμοποιήσω μια κάρτα AMD και λειτουργεί το ROCm;
Ναι. Τα εξαρτήματα AMD Instinct είναι από τις μεγαλύτερες κάρτες μνήμης που τοποθετούμε και συχνά έχουν την καλύτερη σχέση ποιότητας-τιμής ανά gigabyte, αλλά η στοίβα σας πρέπει να υποστηρίζει ROCm αντί για CUDA. Οι περισσότεροι τρέχοντες χρόνοι εκτέλεσης Inference το κάνουν. Ορισμένα γύρω εργαλεία εξακολουθούν να μην το κάνουν. Ρωτήστε πριν από την παραγγελία και θα το ελέγξουμε με τον συγκεκριμένο χρόνο εκτέλεσης αντί να απαντήσουμε γενικά.

For the record

Everything on this page, as figures.

Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.

What decides whether a model runs
Card memory, and almost nothing else on the order form. The weights either fit or they do not — a card a couple of gigabytes short does not run slower, it fails to load. Clock speed and core count decide how fast it is once it fits.
How much memory a model needs
Parameters multiplied by bytes per parameter: two bytes each at 16-bit, one at 8-bit, half at 4-bit. That is the WEIGHTS. The runtime, the activations and the key-value cache for the conversation live in the same memory, so budget a quarter to a half again on top before choosing a card.
Largest model on a single card here
70 billion parameters at 4-bit, with room left to serve. Past that the answer is more than one card in one machine, which is a build we quote rather than a checkout option — multi-GPU and multi-node is the page for it.
Biggest card we fit
RTX PRO 6000 Blackwell 96GB, 96 GB GDDR7 ECC. Card memory figures are the manufacturers' published ones; a card whose figure we could not source is left out of the comparison rather than guessed at.
Which runtime
Yours. The machine arrives with a clean operating system and root, and you install vLLM, llama.cpp, TGI, SGLang, Ollama or anything else, pinned to the version your code was tested against. Nothing upgrades underneath you, and there is no vendor runtime you have to go through.
Throughput
We publish no tokens-per-second figure, deliberately, because we have not measured one under conditions we would be willing to have quoted back at us. What governs it is the card's memory bandwidth while generating, its arithmetic while reading the prompt, and how many requests you batch. Ask with the model, the quantisation and the expected concurrency and we will say what we have actually seen.
Fine-tuning and training
Both are ordinary work here, and both need considerably more memory than serving the same model: gradients and optimiser state sit alongside the weights. A parameter-efficient method needs a fraction of what a full fine-tune does. Tell us the method and the model and we will size it rather than have you find out after delivery.
Tenancy
One tenant per physical machine and the card passed straight through to your operating system. No hypervisor, no MIG partition, no vGPU profile, no time-slicing scheduler, and nobody else's workload on the card. What you measure on the first afternoon is what you keep.
Bandwidth
Unmetered in both directions at every port speed, with no transfer allowance and no egress line on any invoice. Pulling weights down and serving tokens back out costs nothing beyond the port.
What this page does not price
Cards, or anything else. Every card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, each figure against the exact machine it belongs to.