Πολλαπλές κάρτες και πολλαπλοί κόμβοι · Primcast LLC · από το 2004

Το να πηγαίνεις πιο πλατιά δεν είναι η ίδια δουλειά με το να πηγαίνεις πιο μεγάλα.

Μία κάρτα σε ένα μηχάνημα είναι λυμένο ζήτημα, και κοστολογείται κάρτα προς κάρτα στη σελίδα GPU. Αυτή εδώ ξεκινά εκεί που εκείνη σταματά: μια δεύτερη κάρτα στο ίδιο σασί, ή ένα δεύτερο μηχάνημα δίπλα στο πρώτο. Ακούγονται σαν την ίδια απόφαση και είναι αντίθετα — η πλατφόρμα εδώ που δίνει σε μια κάρτα τις περισσότερες λωρίδες έχει το χαμηλότερο ταβάνι δικτύου και βρίσκεται στα λιγότερα δωμάτια. Κανείς δεν το δημοσιεύει αυτό για τον δικό του κατάλογο. Είναι ο πρώτος πίνακας παρακάτω.

Σύγκρινε τις πλατφόρμες Τι ενώνει δύο μηχανήματα

Κάθε μηχάνημα είναι ένας ενοικιαστής, κάθε κάρτα περνάει απευθείας στο δικό σου λειτουργικό σύστημα, και τίποτα εδώ δεν μετράει ούτε ένα byte ανάμεσα στους κόμβους σου.

Το μητρώο

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Διαβάστηκε από τον κατάλογο παραγγελιών όταν σερβιρίστηκε αυτή η σελίδα, όχι πληκτρολογημένο. Το τι στέκεται σε ένα rack σήμερα το πρωί είναι διαφορετική ερώτηση, και οι instant servers είναι εκεί που απαντιέται.

Μετέτρεψε τις GPUs σου σε παθητικό μηνιαίο έσοδο

Έχεις αδρανείς server ή desktop GPU διατάξεις; Καταχώρισέ τες στο marketplace της Primcast σήμερα και κέρδισε σταθερά μηνιαία ενοίκια από ομάδες AI, developers και επιχειρήσεις που χρειάζονται υπολογιστική ισχύ επιπέδου παραγωγής.

Πήγαινε στο Marketplace

Δύο διαφορετικές ερωτήσεις

Ποια από τις δύο ρωτάς στην πραγματικότητα;

Οι άνθρωποι φτάνουν εδώ έχοντας αποφασίσει “χρειάζομαι περισσότερα” χωρίς να έχουν αποφασίσει περισσότερα από τι. Οι δύο απαντήσεις κοστίζουν διαφορετικά, παραδίδονται διαφορετικά και περιορίζονται από διαφορετικά πράγματα, οπότε αξίζει να είσαι σαφής πριν διαβάσεις άλλη μία γραμμή.

Περισσότερη κάρτα σε ένα μηχάνημα

Μια δεύτερη κάρτα στο ίδιο σασί

Σου λείπει μνήμη κάρτας, ή σου λείπει throughput, και όλα τα άλλα στο μηχάνημα είναι μια χαρά. Αυτό είναι ένα build που το κοστολογούμε αντί για ένα κουτάκι που τσεκάρεις στο checkout, γιατί το πόσες κάρτες χωράνε εξαρτάται από το φυσικό πλάτος της συγκεκριμένης κάρτας και από τον προϋπολογισμό ισχύος του συγκεκριμένου σασί — δύο γεγονότα που δεν υπάρχουν σε κατάλογο και που δεν πρόκειται να μαντέψουμε.

Τι το αποφασίζει: η κάρτα, όχι η πλατφόρμα. Ρώτησε με το part ονομασμένο και η απάντηση ονομάζει το σασί, τον αριθμό και τον χρόνο παράδοσης.

Αυτό που περιμένουν οι άνθρωποι και δεν παίρνουν: δύο κάρτες δεν είναι μία μεγαλύτερη κάρτα. Η μνήμη τους αθροίζεται μόνο αν αυτό που τρέχεις μπορεί να χωρίσει ένα μοντέλο και στις δύο — tensor ή pipeline parallelism, που κάθε σοβαρό runtime υποστηρίζει και που σου κοστίζει κάποιο throughput στην κίνηση μεταξύ τους. Για δουλειά που είναι ήδη πολλές ανεξάρτητες εργασίες, δύο κάρτες είναι απλώς διπλάσιο μηχάνημα και τίποτα δεν χρειάζεται να αλλάξει.

Περισσότερα μηχανήματα δίπλα του

Ένα δεύτερο μηχάνημα δίπλα στο πρώτο

Έχεις ξεμείνει από μηχάνημα παρά από κάρτα: από sockets, από μνήμη, από κάπου να βάλεις την επόμενη εργασία. Στην καλύτερη από τις πλατφόρμες παρακάτω, αυτό το ταβάνι είναι 2 sockets and 1 TB, και πέρα από οποιοδήποτε από αυτά η απάντηση είναι άλλος server παρά μεγαλύτερος.

Τι το αποφασίζει: το δωμάτιο και η θύρα. Δύο μηχανήματα που πρέπει να μιλήσουν μεταξύ τους πρέπει να είναι στο ίδιο κτίριο, και αυτό που τα ενώνει είναι η θύρα στο καθένα — αγορασμένη ανά μηχάνημα, οπότε το fabric κάτω από τέσσερις κόμβους είναι τέσσερις θύρες.

Αυτό που περιμένουν οι άνθρωποι και δεν παίρνουν: δεν υπάρχει προϊόν cluster εδώ και κανένας ελάχιστος αριθμός κόμβων. Κάθε μηχάνημα παραγγέλνεται, χρεώνεται, αναβαθμίζεται και αντικαθίσταται μόνο του, γι' αυτό και τίποτα σε αυτή τη σελίδα δεν αναφέρει τιμή cluster — ένα cluster είναι n τιμολόγια.

Το trade

Η πλατφόρμα που είναι καλύτερη στο ένα από αυτά είναι χειρότερη στο άλλο.

Κάθε πλατφόρμα στην οποία τοποθετούμε μια κάρτα, στους άξονες που αποφασίζουν ένα cluster αντί για ένα μόνο μηχάνημα. Διάβασε τις δύο μεσαίες στήλες μαζί και όλο το επιχείρημα αυτής της σελίδας είναι μέσα τους: κινούνται σε αντίθετες κατευθύνσεις. Η γενιά του bus είναι το ίδιο νούμερο που δημοσιεύει η σελίδα GPU, από τον ίδιο πίνακα, οπότε οι δύο σελίδες δεν μπορούν να διαφωνήσουν για μια σύνδεση.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Πώς διαβάζεται αυτός ο πίνακας

  • Λωρίδες προς την κάρτα αποφασίζουν πόσο γρήγορα περνάει δεδομένα μεταξύ του επεξεργαστή και του accelerator. Έχει συνεχώς σημασία για ένα training loop που στέλνει batches, για ένα render που τροφοδοτεί scene data κάθε frame, και για οτιδήποτε ξεχειλίζει από τη μνήμη της κάρτας. Σταματά να έχει σχεδόν καθόλου σημασία μόλις ένα μοντέλο είναι resident και μένει εκεί.
  • Ταβάνι δικτύου αποφασίζει πόσο γρήγορα μπορεί ένα μηχάνημα να μιλήσει στο επόμενο. Είναι άσχετο για έναν μόνο server που κάνει τη δουλειά του και είναι ολόκληρη η ερώτηση για μια εργασία χωρισμένη σε πολλά.
  • Δωμάτια αποφασίζει αν η επιλογή είναι διαθέσιμη εκεί που τη χρειάζεσαι καν, και είναι η στήλη που οι άνθρωποι διαβάζουν τελευταία και θα έπρεπε να διαβάζουν πρώτη — δες παρακάτω.
  • Οπότε: μια εργασία που χωράει μέσα σε ένα μηχάνημα και χτυπάει το bus θέλει τις πιο πλατιές λωρίδες και δεν νοιάζεται για τη θύρα. Μια εργασία απλωμένη σε πολλά μηχανήματα θέλει τη θύρα και μπορεί να ζήσει με παλιότερο bus. Το να θέλεις και τα δύο ταυτόχρονα είναι ο ένας συνδυασμός που ο κατάλογός μας δεν έχει, και προτιμάμε να το πούμε εδώ παρά αφού έχεις πληρώσει.

Ποια κάρτα μπαίνει σε οποιοδήποτε από αυτά, και τι προσθέτει η καθεμία ανά μήνα, είναι GPU dedicated servers — κάθε κάρτα που τοποθετούμε, κοστολογημένη απέναντι στο ακριβές μηχάνημα στο οποίο ανήκει το νούμερό της. Αυτή η σελίδα δεν κοστολογεί καμία κάρτα, επίτηδες: μία σελίδα κατέχει αυτά τα χρήματα.

Τι τα ενώνει

Το interconnect αγοράζεται ανά μηχάνημα, και αυτή είναι η αριθμητική που οι άνθρωποι κάνουν λάθος.

Μια θύρα είναι ιδιότητα ενός server. Τέσσερα μηχανήματα σε μια δεδομένη ταχύτητα είναι αυτή η ταχύτητα τέσσερις φορές, κάθε μήνα, και είναι το line item που μετατρέπει έναν άνετο προϋπολογισμό cluster σε άβολο. Παρακάτω είναι η σκάλα με τον πολλαπλασιασμό ήδη γινόμενο, γιατί μια σελίδα για περισσότερα από ένα μηχανήματα που σε αφήνει να τον κάνεις μόνος σου δεν κάνει τη δουλειά της.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Δύο πράγματα που αξίζει να προσέξεις πριν διαλέξεις σκαλοπάτι

  • Η σκάλα δεν είναι γραμμική, οπότε ένα πιο πλατύ cluster μπορεί να είναι φθηνότερο από ένα πιο γρήγορο. Σύγκρινε τα σκαλοπάτια μεταξύ τους αντί για με το τίποτα: σε πολλά σημεία αυτού του πίνακα, δύο μηχανήματα ένα σκαλοπάτι χαμηλότερα κοστίζουν λιγότερο από ένα μηχάνημα ένα σκαλοπάτι ψηλότερα, και σου δίνουν δύο μηχανήματα. Το αν αυτό είναι καλό trade εξαρτάται εξ ολοκλήρου από το αν η δουλειά σου χωρίζεται.
  • Η κορυφή της σκάλας δεν είναι σε κάθε πλατφόρμα. Η δεξιά στήλη λέει πόσες από αυτές φτάνουν κάθε ταχύτητα, και τα πιο γρήγορα σκαλοπάτια στενεύουν σε μια πλατφόρμα που δίνει σε μια κάρτα παλιότερο bus. Αυτό είναι το ίδιο trade με τον πίνακα παραπάνω, που φτάνει από την άλλη κατεύθυνση.

Τι δεν έχουμε, ειπωμένο καθαρά

Τίποτα πέρα από μια θύρα Ethernet μεταξύ μηχανημάτων δεν υπάρχει στον κατάλογό μας. Δεν υπάρχει καταχωρημένο InfiniBand fabric και καμία καταχωρημένη γέφυρα card-to-card, και αυτή η σελίδα δεν πρόκειται να υπονοήσει κάτι τέτοιο γράφοντας γύρω του. Αν ένα build χρειάζεται οποιοδήποτε από τα δύο, ρώτησε πριν παραγγείλεις παρά μετά: η απάντηση είναι μια προσφορά, και η απάντηση μπορεί να είναι όχι. Αυτό αξίζει περισσότερο για σένα από μια σελίδα που αφήνει την εντύπωση ότι μπορεί να είναι ναι.

Κάθε ταχύτητα παραπάνω είναι unmetered και προς τις δύο κατευθύνσεις, χωρίς transfer allowance και χωρίς γραμμή egress σε κανένα τιμολόγιο — οπότε ό,τι στέλνουν οι κόμβοι σου μεταξύ τους είναι δωρεάν σε οποιονδήποτε όγκο, που είναι το κομμάτι που συνήθως μετριέται αλλού. Unmetered bandwidth είναι η σελίδα για μια θύρα εξετασμένη μόνη της, σε ένα μηχάνημα.

Πού μπορεί να υπάρξει

Για ένα μηχάνημα διαλέγεις πρώτα την πλατφόρμα. Για πολλά, διάλεξε πρώτα το δωμάτιο.

Μηχανήματα που πρέπει να μιλήσουν μεταξύ τους ανήκουν στο ίδιο κτίριο, και τα δωμάτιά μας δεν έχουν όλα τις ίδιες πλατφόρμες. Διάλεξε πρώτα την πλατφόρμα και μπορεί να ανακαλύψεις ότι το δωμάτιο στο οποίο τη χρειάζεσαι δεν την έχει. Αυτό προέρχεται από τον ίδιο κατάλογο με όλα τα άλλα, οπότε μια γραμμή που φτάνει σε μια νέα πόλη εμφανίζεται εδώ μόνη της.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Πού βρίσκεται στην πραγματικότητα το κτίριο, με τι είναι συνδεδεμένο και ποιος άλλος είναι μέσα — data centres περιγράφει και τα πέντε. Το latency μεταξύ δύο πόλεών μας είναι πραγματικός αριθμός παρά marketing, και το support θα το μετρήσει για το ζεύγος σου κατόπιν αιτήματος αντί να μαντέψεις από χάρτη.

Πώς κοστολογείται, και πόσο σύντομα υπάρχει

Η δουλειά πολλαπλών κόμβων χρονολογείται πριν πληρωθεί, όχι μετά.

Ένα build αυτού του είδους είναι πολλά μηχανήματα και συχνά πολλά parts που δεν είναι σε ράφι, οπότε το τίμιο πράγμα να δημοσιεύσεις δεν είναι μια υπόσχεση παράδοσης αλλά η σκάλα από την οποία βγαίνει η ημερομηνία — η ίδια που χρησιμοποιούν το build to order και η σελίδα GPU, με τα ίδια λόγια.

  1. ~30 λεπτά

    Τα μηχανήματα είναι ήδη racked όπως είναι

    Τίποτα δεν τοποθετείται και τίποτα δεν μετακινείται. Instant servers είναι η λίστα του τι στέκεται εκεί αυτή τη στιγμή, και για ένα cluster από συνηθισμένους κόμβους αξίζει να διαβαστεί πρώτα.

  2. 4–24 ώρες

    Τα parts είναι αυτά που έχουμε

    Η συνηθισμένη περίπτωση. Οι τεχνικοί τοποθετούν τις κάρτες, χτίζουν τα arrays και εγκαθιστούν τα λειτουργικά συστήματα — ανά μηχάνημα, παράλληλα, όχι το ένα μετά το άλλο.

  3. 5–10 εργάσιμες ημέρες

    Τα parts πρέπει να αγοραστούν

    Κάτι στην προδιαγραφή δεν είναι stock που έχουμε. Το παραγγέλνουμε, μετά χτίζουμε. Αυτό είναι το πιο συνηθισμένο σκαλοπάτι για ένα σασί πολλαπλών καρτών, γιατί το σασί είναι συνήθως το μακρύ κοντάρι παρά η κάρτα.

  4. 10–15 εργάσιμες ημέρες

    Ένα part είναι σπάνιο

    Οι accelerators τρέχουσας γενιάς λειτουργούν με allocation και η ημερομηνία είναι του διανομέα, όχι δική μας. Ονομάζουμε το μακρύ κοντάρι πριν δεσμευτείς παρά μετά. Όπου hardware αγοράζεται για έναν πελάτη ζητάμε τρεις μήνες προκαταβολικά, γιατί είναι ένα μηχάνημα που δεν μπορούμε να ξανανοικιάσουμε αν ο λογαριασμός κλείσει τη δεύτερη εβδομάδα.

Κάθε σκαλοπάτι ξεκινά όταν η παραγγελία περάσει πληρωμή και έλεγχο απάτης, που είναι το ένα βήμα στο οποίο δεν θα βάλουμε υπόσχεση — τα περισσότερα περνάνε μέσα σε μερικές ώρες, και μια μεγάλη πρώτη παραγγελία από νέο λογαριασμό μπορεί να πάρει περισσότερο. Για ένα build αυτού του μεγέθους ένα wire ή ένα stablecoin συνήθως περνάει πιο γρήγορα από μια κάρτα, που αξίζει να το ξέρεις πριν ένας έλεγχος απάτης καθυστερήσει μια επίσκεψη σε rack.

Το να περιγράψεις ένα build πολλαπλών κόμβων ή πολλαπλών καρτών είναι πιο γρήγορο σε μια πρόταση παρά σε μια φόρμα. — τον αριθμό κόμβων, αν η δουλειά χωρίζεται, και με τι πρέπει να μιλήσει — και κάποιος που έχει κοστολογήσει ένα από αυτά πριν θα απαντήσει, συμπεριλαμβανομένου του πότε η απάντηση είναι ότι ένα μηχάνημα θα έκανε τη δουλειά.

Πού να πας μετά

Οι σελίδες εκατέρωθεν αυτής.

Αυτή η σελίδα κατέχει μία ερώτηση: πώς μοιάζουν περισσότερες από μία κάρτες και περισσότερα από ένα μηχανήματα. Ό,τι είναι δίπλα έχει τη δική του σελίδα, και αυτές είναι όλες.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.