Επιταχυντές AMD Instinct

AMD Instinct σε μηχάνημα που κανείς άλλος δεν έχει

Δύο επιταχυντές AMD μπαίνουν στους dedicated servers μας: ο Instinct MI210 και ο Instinct MI50. Η κάρτα περνάει απευθείας στο δικό σας λειτουργικό σύστημα — το δικό σας ROCm build, ο δικός σας kernel, οι δικές σας διεργασίες, χωρίς hypervisor ανάμεσα.

MI210: 104 υπολογιστικές μονάδες CDNA 2, 64 GB HBM2e. MI50: 60 υπολογιστικές μονάδες GCN 5.1, 16 GB. Ένας ενοικιαστής ανά μηχάνημα. Χωρίς κατακερματισμό, χωρίς χρονομερισμό.

Κάθε κάρτα που τοποθετούμε — AMD και NVIDIA, τρέχουσες και εδώ και καιρό εκτός παραγωγής — αναγράφεται με τη δική της μηνιαία τιμή στον κατάλογο GPU.

Μετατρέψτε τις GPUs σας σε παθητικό μηνιαίο έσοδο

Έχετε αδρανείς server ή desktop GPU διατάξεις; Καταχωρίστε τις στο marketplace της Primcast σήμερα και κερδίστε σταθερά μηνιαία ενοίκια από ομάδες AI, προγραμματιστές και επιχειρήσεις που χρειάζονται υπολογιστική ισχύ επιπέδου παραγωγής.

Μετάβαση στο Marketplace

Τι είναι στην πραγματικότητα ένας AMD Instinct server εδώ

Ένας φυσικός server που ενοικιάζεται σε έναν λογαριασμό, με έναν επιταχυντή AMD σε υποδοχή PCIe και root στο λειτουργικό σύστημα από πάνω του. Η κάρτα είναι μια γραμμή στο τιμολόγιο και όχι μια βαθμίδα προϊόντος, οπότε το μηχάνημα από κάτω δεν γίνεται ακριβότερο εξαιτίας αυτού που είναι συνδεδεμένο σε αυτό.

Η κάρτα είναι δική σας

Χωρίς partition, χωρίς vGPU, χωρίς scheduler που αποφασίζει πότε είναι η σειρά σας. Ο επιταχυντής παραδίδεται απευθείας στον kernel σας, ώστε να καρφιτσώσετε τη δική σας έκδοση ROCm και να φορτώσετε τα δικά σας modules χωρίς να ρωτήσετε εμάς.

ROCm, HIP και τα συνηθισμένα frameworks

Και τα δύο μέρη είναι υποστηριζόμενοι στόχοι ROCm — gfx90a για τον MI210, gfx906 για τον MI50 — πάνω στους οποίους χτίζουν τα PyTorch, TensorFlow, JAX και ONNX Runtime στην AMD. Το HIP μεταφέρει τον πηγαίο κώδικα CUDA αντί να απαιτεί επανεγγραφή.

Τιμολογείται ξεχωριστά από το μηχάνημα

Ο επιταχυντής έχει το δικό του μηνιαίο ποσό και ο server ένα άλλο, και τα προσθέτετε. Αλλάξτε την κάρτα χωρίς να αλλάξετε server. Και τα δύο ποσά, για κάθε κάρτα του καταλόγου, βρίσκονται στη σελίδα GPU.

Οι δύο επιταχυντές AMD Instinct που τοποθετούμε

Και οι δύο είναι παραγγέλσιμοι σήμερα από τον ίδιο configurator, σε διαφορετικές σειρές server. Τα νούμερα παρακάτω είναι τα δημοσιευμένα νούμερα της ίδιας της AMD.

Επιταχυντής AMD Instinct MI210

AMD Instinct MI210

Η γενιά CDNA 2 σε μια τυπική κάρτα PCIe πλήρους ύψους, πλήρους μήκους, διπλής υποδοχής — 104 υπολογιστικές μονάδες, 64 GB HBM2e με ταχύτητα έως 1,6 TB/s και έως τρεις συνδέσεις Infinity Fabric για απευθείας κίνηση κάρτα-προς-κάρτα. Παθητικά ψυχόμενη στα 300 W μέσω σύνδεσης host PCIe Gen 4. Αυτή είναι που πρέπει να ζητήσετε όταν το όλο ερώτημα είναι αν το μοντέλο χωράει στη μνήμη.

AMD Instinct MI50

Το παλαιότερο μέρος γενιάς Vega: πυρίτιο GCN 5.1, 60 υπολογιστικές μονάδες και 16 GB μνήμης on-package. Κανείς δεν ενοικιάζει πια αυτή την κάρτα, γεγονός που την καθιστά μη διαθέσιμη αλλού παρά απλώς φθηνή εδώ — και εξακολουθεί να είναι υποστηριζόμενος στόχος ROCm, οπότε τρέχει τον ίδιο κώδικα HIP και PyTorch με τον MI210 για ένα κλάσμα του μηνιαίου ποσού. Είναι ο λογικός τρόπος να λειτουργήσει μια αλυσίδα εργαλείων ROCm πριν δεσμευτείτε στη μεγάλη κάρτα.

Απόδοση πινάκων στον MI210

Η AMD δημοσιεύει 181,0 TFLOPS μέγιστη απόδοση πινάκων FP16 και BF16 για τον MI210 στο μέγιστο ρολόι ενίσχυσης κινητήρα 1.700 MHz, μαζί με 22,6 TFLOPS μέγιστο FP64 και FP32 vector.

Η μνήμη είναι ο περιορισμός

Τα 64 GB χωρούν τα βάρη ενός μοντέλου 30 δισεκατομμυρίων παραμέτρων στα 8-bit, ή ενός 13 δισεκατομμυρίων στα 16-bit, με χώρο να περισσέψει για την KV cache. Η διαστασιολόγηση ενός μοντέλου είναι δικό της ερώτημα, και η σελίδα LLM επεξεργάζεται αυτή την αριθμητική σε κάθε ακρίβεια.

Τι δίνει ο host στην κάρτα

Η γενιά λωρίδας host είναι το γεγονός που σχεδόν κανείς δεν δημοσιεύει και αυτό που αποφασίζει αν μια κάρτα τρέχει στο σχεδιασμένο εύρος ζώνης της. Εμείς δημοσιεύουμε το δικό μας δίπλα σε κάθε κάρτα, στη σελίδα GPU.

Τίποτα δεν μετράει τα bytes

Βάρη μέσα, checkpoints έξω, σύνολα δεδομένων μέσα. Η θύρα είναι χωρίς μέτρηση, οπότε μια εκπαιδευτική εκτέλεση που κάνει streaming ένα corpus δεν καταλήγει ως λογαριασμός εύρους ζώνης στο τέλος του μήνα.

Dedicated servers επιχειρηματικού επιπέδου HPE με ισχύ AMD Instinct™

HPE enterprise

Ο dedicated server σας με AMD INSTINCT™ GPU τροφοδοτείται από HPE Enterprise servers, εξασφαλίζοντας σταθερή απόδοση για τα πιο απαιτητικά φορτία εργασίας.

Αναβαθμίσεις υλικού

Προσθέστε εύκολα πόρους ή επιπλέον servers στην υποδομή σας. Οι περισσότερες αναβαθμίσεις διεκπεραιώνονται εντός 24 ωρών.

Υποστήριξη 24/7

Ειδικοί σε dedicated servers είναι διαθέσιμοι να βοηθήσουν 24/7 μέσω live chat και email.

Ο MI210 έναντι των καρτών NVIDIA που επίσης τοποθετούμε

Τέσσερις επιταχυντές από τον ίδιο κατάλογο παραγγελιών, οπότε αυτό συγκρίνει μέρη που μπορείτε πραγματικά να βάλετε στο ίδιο καλάθι. Χωρίς μηνιαία ποσά εδώ επίτηδες: ο κατάλογος GPU τα διαβάζει από τον κατάλογο παραγγελιών τη στιγμή του αιτήματος, και ένα ποσό πληκτρολογημένο σε αυτόν τον πίνακα μπορεί να ξεφύγει.

MI210 L40S A100 H100
Αρχιτεκτονική GPU CDNA 2 Ada Lovelace NVIDIA Ampere Hopper
Μνήμη GPU 64GB HBM2e 48GB GDDR6 με ECC 80GB HBM2e 80GB HBM3
Εύρος ζώνης μνήμης GPU Έως 1,6 TB/s 864 GB/s 1935 GB/s 3352 GB/s
FP32 22,6 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
TF32 Tensor Core 366 TFLOPS 312 TFLOPS 756 TFLOPS
Πίνακας FP16/BF16 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Ισχύς Έως 300W Έως 350W Έως 400W Έως 350W

Το TF32 είναι μια μορφή tensor-core της NVIDIA. Το CDNA 2 δεν το υλοποιεί και η AMD δεν δημοσιεύει νούμερο για αυτό, οπότε η στήλη MI210 δεν δείχνει τίποτα εκεί αντί για ένα νούμερο δανεισμένο από άλλον κατασκευαστή. Οι σειρές tensor-core της NVIDIA είναι τα δημοσιευμένα νούμερα με sparsity. Κάθε άλλη κάρτα που τοποθετούμε, συμπεριλαμβανομένου του MI50, τιμολογείται στον κατάλογο GPU.

Συχνές ερωτήσεις για AMD Instinct GPU servers

Συνήθεις ερωτήσεις σχετικά με την ανάπτυξη και διαχείριση επιταχυντών AMD Instinct σε bare metal για φορτία εργασίας AI, HPC και μηχανικής μάθησης.

Ποιους επιταχυντές AMD Instinct μπορώ πραγματικά να παραγγείλω;

Δύο: τον Instinct MI210 και τον Instinct MI50. Αυτοί είναι οι επιταχυντές AMD στον κατάλογο παραγγελιών μας, και ο configurator δεν θα σας προσφέρει τίποτα άλλο από τη σειρά Instinct. Ο MI210 μπαίνει σε τρεις από τις σειρές server μας και ο MI50 σε δύο. Δεν τοποθετούμε τον MI250, τον MI250X ή τον MI300A, και ποτέ δεν το κάναμε.

Ποια είναι η διαφορά μεταξύ του MI210 και του MI50;

Γενιά και μνήμη. Ο MI210 είναι η αρχιτεκτονική CDNA 2 της AMD με 104 υπολογιστικές μονάδες και 64 GB HBM2e με ταχύτητα έως 1,6 TB/s, σε κάρτα PCIe διπλής υποδοχής που καταναλώνει έως 300 W μέσω σύνδεσης host PCIe Gen 4, με έως τρεις συνδέσεις Infinity Fabric για κίνηση κάρτα-προς-κάρτα. Ο MI50 είναι η παλαιότερη γενιά GCN 5.1 με 60 υπολογιστικές μονάδες και 16 GB. Και οι δύο είναι υποστηριζόμενοι στόχοι ROCm, οπότε ο ίδιος κώδικας HIP και PyTorch τρέχει σε οποιονδήποτε από τους δύο — ο MI210 απλώς χωράει τέσσερις φορές περισσότερο από ένα μοντέλο.

Πόση μνήμη κάρτας χρειάζεται το μοντέλο που θέλω να τρέξω;

Μόνο τα βάρη είναι παράμετροι πολλαπλασιασμένες με bytes ανά παράμετρο: περίπου 16 GB για ένα μοντέλο 7-8 δισεκατομμυρίων παραμέτρων στα 16-bit, 28 GB για 13-14 δισεκατομμύρια, 68 GB για 30-34 δισεκατομμύρια. Η KV cache και το runtime προστίθενται πάνω από αυτό, γι' αυτό μια κάρτα 16 GB δεν εξυπηρετεί άνετα ένα μοντέλο του οποίου τα βάρη είναι 16 GB. Τα 64 GB του MI210 καλύπτουν ένα μοντέλο 30 δισεκατομμυρίων κβαντισμένο στα 8-bit με χώρο για δουλειά. Η σελίδα διαστασιολόγησης LLM έχει ολόκληρο τον πίνακα — πόση μνήμη χρειάζεται κάθε μέγεθος μοντέλου και ποια κάρτα το καλύπτει.

Πόσο χρόνο παίρνει η ανάπτυξη ενός AMD Instinct GPU server;

Όπου το μηχάνημα είναι ήδη σε rack, συνήθως ενεργοποιείται περίπου 30 λεπτά μετά την εκκαθάριση της πληρωμής. Όπου δεν είναι, κατασκευάζεται κατά παραγγελία και ο χρόνος παράδοσης εξαρτάται από τα εξαρτήματα. Ρωτήστε πριν πληρώσετε αν η ημερομηνία έχει σημασία — οι instant servers είναι η σελίδα για ό,τι βρίσκεται σε rack αυτή τη στιγμή. Κάθε server περιλαμβάνει άμεση επαναφόρτωση λειτουργικού συστήματος, ώστε να μπορείτε να επαναλαμβάνετε χωρίς να ανοίξετε ξανά ticket.

Ποιο λογισμικό και frameworks τρέχουν σε αυτές τις κάρτες;

Το ROCm, η πλατφόρμα υπολογιστικής GPU ανοιχτού κώδικα της AMD. Και τα δύο μέρη είναι υποστηριζόμενοι στόχοι ROCm — gfx90a στον MI210, gfx906 στον MI50 — που καλύπτει τα PyTorch, TensorFlow, JAX και ONNX Runtime, μαζί με τις βιβλιοθήκες BLAS, FFT, RNG και deep-learning primitive. Το HIP μεταφέρει τον υπάρχοντα πηγαίο κώδικα CUDA αντί να απαιτεί επανεγγραφή. Επειδή έχετε root σε bare metal, επιλέγετε μόνοι σας τις εκδόσεις ROCm και kernel και μπορείτε να τρέξετε το όλο πράγμα σε Docker ή υπό Kubernetes.