Επιταχυντές AMD Instinct

AMD Instinct σε μηχάνημα που κανείς άλλος δεν έχει

Δύο επιταχυντές AMD μπαίνουν στους dedicated servers μας: ο Instinct MI210 και ο Instinct MI50. Η κάρτα περνάει απευθείας στο δικό σας λειτουργικό σύστημα — το δικό σας ROCm build, ο δικός σας kernel, οι δικές σας διεργασίες, χωρίς hypervisor ανάμεσα.

MI210: 104 υπολογιστικές μονάδες CDNA 2, 64 GB HBM2e. MI50: 60 υπολογιστικές μονάδες GCN 5.1, 16 GB. Ένας μισθωτής ανά μηχάνημα. Χωρίς διαμοιρασμό, χωρίς χρονομερισμό.

Κάθε κάρτα που τοποθετούμε — AMD και NVIDIA, τρέχουσες και εδώ και καιρό εκτός παραγωγής — αναγράφεται με τη δική της μηνιαία τιμή στον κατάλογο GPU.

Μετατρέψτε τις GPU σας σε παθητικό μηνιαίο εισόδημα

Έχετε αδρανείς διατάξεις GPU σε server ή desktop; Καταχωρίστε τις σήμερα στην αγορά της Primcast και κερδίστε σταθερά μηνιαία ενοίκια από ομάδες τεχνητής νοημοσύνης, προγραμματιστές και επιχειρήσεις που χρειάζονται υπολογιστική ισχύ επιπέδου παραγωγής.

Μετάβαση στην Αγορά

Τι είναι στην πραγματικότητα ένας server AMD Instinct εδώ

Ένας φυσικός server που νοικιάζεται σε έναν λογαριασμό, με έναν επιταχυντή AMD σε υποδοχή PCIe και root στο λειτουργικό σύστημα από πάνω του. Η κάρτα είναι μια γραμμή στο τιμολόγιο και όχι μια βαθμίδα προϊόντος, οπότε το μηχάνημα από κάτω δεν γίνεται ακριβότερο εξαιτίας αυτού που είναι συνδεδεμένο σε αυτό.

Η κάρτα είναι δική σας

Χωρίς διαμέριση, χωρίς vGPU, χωρίς χρονοπρογραμματιστή που αποφασίζει πότε είναι η σειρά σας. Ο επιταχυντής παραδίδεται απευθείας στον kernel σας, ώστε να καρφιτσώσετε τη δική σας έκδοση ROCm και να φορτώσετε τα δικά σας modules χωρίς να μας ρωτήσετε.

ROCm, HIP και τα συνηθισμένα frameworks

Και τα δύο εξαρτήματα είναι υποστηριζόμενοι στόχοι ROCm — gfx90a για τον MI210, gfx906 για τον MI50 — πάνω στα οποία χτίζουν τα PyTorch, TensorFlow, JAX και ONNX Runtime στην AMD. Το HIP μεταφέρει τον πηγαίο κώδικα CUDA αντί να απαιτεί επανεγγραφή.

Τιμολογείται ξεχωριστά από το μηχάνημα

Ο επιταχυντής έχει το δικό του μηνιαίο ποσό και ο server ένα άλλο, και τα προσθέτετε. Αλλάξτε την κάρτα χωρίς να αλλάξετε server. Και τα δύο ποσά, για κάθε κάρτα του καταλόγου, βρίσκονται στη σελίδα GPU.

Οι δύο επιταχυντές AMD Instinct που τοποθετούμε

Και οι δύο μπορούν να παραγγελθούν σήμερα από τον ίδιο configurator, σε διαφορετικές σειρές server. Τα παρακάτω στοιχεία είναι τα επίσημα δημοσιευμένα της AMD.

Επιταχυντής AMD Instinct MI210

AMD Instinct MI210

Η γενιά CDNA 2 σε μια τυπική κάρτα PCIe πλήρους ύψους, πλήρους μήκους, διπλής υποδοχής — 104 υπολογιστικές μονάδες, 64 GB HBM2e με ταχύτητα έως 1,6 TB/s και έως τρεις σύνδεσμοι Infinity Fabric για απευθείας κίνηση μεταξύ καρτών. Παθητική ψύξη στα 300 W μέσω σύνδεσης host PCIe Gen 4. Αυτή είναι που ζητάτε όταν το μόνο ερώτημα είναι αν το μοντέλο χωράει στη μνήμη.

AMD Instinct MI50

Το παλαιότερο εξάρτημα γενιάς Vega: πυρίτιο GCN 5.1, 60 υπολογιστικές μονάδες και 16 GB μνήμης on-package. Κανείς δεν νοικιάζει πια αυτή την κάρτα, γεγονός που την καθιστά μη διαθέσιμη αλλού παρά απλώς φθηνή εδώ — και εξακολουθεί να είναι υποστηριζόμενος στόχος ROCm, οπότε τρέχει τον ίδιο κώδικα HIP και PyTorch με τον MI210 για ένα κλάσμα του μηνιαίου ποσού. Είναι ο λογικός τρόπος να λειτουργήσει μια αλυσίδα εργαλείων ROCm πριν δεσμευτείτε στη μεγάλη κάρτα.

Απόδοση πινάκων στον MI210

Η AMD δημοσιεύει 181,0 TFLOPS μέγιστης απόδοσης πινάκων FP16 και BF16 για τον MI210 στο μέγιστο ρολόι ενίσχυσης κινητήρα 1.700 MHz, μαζί με 22,6 TFLOPS μέγιστης απόδοσης διανυσμάτων FP64 και FP32.

Η μνήμη είναι ο περιορισμός

Τα 64 GB χωρούν τα βάρη ενός μοντέλου 30 δισεκατομμυρίων παραμέτρων σε 8-bit, ή ενός 13 δισεκατομμυρίων σε 16-bit, με περιθώριο για την κρυφή μνήμη KV. Η διαστασιολόγηση ενός μοντέλου είναι δικό της ερώτημα και η σελίδα LLM επεξεργάζεται αυτή την αριθμητική σε κάθε ακρίβεια.

Τι δίνει ο host στην κάρτα

Η γενιά λωρίδας host είναι το γεγονός που σχεδόν κανείς δεν δημοσιεύει και αυτό που καθορίζει αν μια κάρτα λειτουργεί στο σχεδιασμένο εύρος ζώνης της. Δημοσιεύουμε τα δικά μας δίπλα σε κάθε κάρτα, στη σελίδα GPU.

Τίποτα δεν μετράει τα bytes

Βάρη μέσα, checkpoints έξω, σύνολα δεδομένων μέσα. Η θύρα είναι χωρίς χρέωση όγκου, οπότε μια εκπαίδευση που μεταδίδει ένα corpus δεν φτάνει ως λογαριασμός εύρους ζώνης στο τέλος του μήνα.

Dedicated servers επιχειρηματικού επιπέδου για κάρτες AMD Instinct™

HPE, Dell ή Supermicro

Η κάρτα AMD Instinct™ σας μπαίνει σε server HPE, Dell ή Supermicro, ανάλογα με τη σειρά στην οποία την παραγγέλνετε. Η MI210 μπορεί επίσης να ενσωματωθεί σε έναν AMD EPYC διακομιστή κατασκευασμένο κατά παραγγελία, και οι αποκλειστικοί διακομιστές AMD τιμολογούν κάθε έναν από αυτούς τους επεξεργαστές ανά πυρήνα.

Αναβαθμίσεις υλικού

Προσθέστε εύκολα πόρους ή επιπλέον servers στην υποδομή σας. Οι περισσότερες αναβαθμίσεις διεκπεραιώνονται εντός 24 ωρών.

Υποστήριξη 24/7

Ειδικοί σε dedicated servers είναι διαθέσιμοι για βοήθεια 24/7 μέσω live chat και email.

Ο MI210 έναντι των καρτών NVIDIA που επίσης τοποθετούμε

Τέσσερις επιταχυντές από τον ίδιο κατάλογο παραγγελιών, οπότε εδώ συγκρίνονται εξαρτήματα που μπορείτε πραγματικά να βάλετε στο ίδιο καλάθι. Χωρίς μηνιαία ποσά εδώ επίτηδες: ο κατάλογος GPU τα διαβάζει από τον κατάλογο παραγγελιών τη στιγμή του αιτήματος, και ένα ποσό πληκτρολογημένο σε αυτόν τον πίνακα μπορεί να ξεφύγει.

MI210 L40S A100 H100
Αρχιτεκτονική GPU CDNA 2 Ada Lovelace NVIDIA Ampere Hopper
Μνήμη GPU 64GB HBM2e 48GB GDDR6 με ECC 80GB HBM2e 80GB HBM2e
Εύρος ζώνης μνήμης GPU Έως 1,6 TB/s 864 GB/s 1935 GB/s 2039 GB/s
FP32 22,6 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
TF32 Tensor Core — 366 TFLOPS 312 TFLOPS 756 TFLOPS
Πίνακας FP16/BF16 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Ισχύς Έως 300W Έως 350W Έως 300W Έως 350W

Το TF32 είναι μορφή tensor-core της NVIDIA. Το CDNA 2 δεν το υλοποιεί και η AMD δεν δημοσιεύει κανένα νούμερο για αυτό, οπότε η στήλη MI210 δεν δείχνει τίποτα εκεί αντί για έναν αριθμό δανεισμένο από άλλον κατασκευαστή. Οι σειρές tensor-core της NVIDIA είναι τα δημοσιευμένα νούμερα με sparsity. Κάθε άλλη κάρτα που τοποθετούμε, συμπεριλαμβανομένου του MI50, τιμολογείται στον κατάλογο GPU.

Συχνές ερωτήσεις για servers GPU AMD Instinct

Συνήθεις ερωτήσεις σχετικά με την ανάπτυξη και τη διαχείριση επιταχυντών AMD Instinct σε bare metal για φόρτους εργασίας τεχνητής νοημοσύνης, HPC και μηχανικής μάθησης.

Ποιους επιταχυντές AMD Instinct μπορώ πραγματικά να παραγγείλω;

Δύο: τον Instinct MI210 και τον Instinct MI50. Αυτοί είναι οι επιταχυντές AMD στον κατάλογο παραγγελιών μας και ο configurator δεν θα σας προσφέρει τίποτα άλλο από τη σειρά Instinct. Ο MI210 μπαίνει σε τρεις από τις σειρές server μας και ο MI50 σε δύο. Δεν τοποθετούμε τους MI250, MI250X ή MI300A, και δεν το κάναμε ποτέ.

Ποια είναι η διαφορά μεταξύ MI210 και MI50;

Γενιά και μνήμη. Ο MI210 είναι η αρχιτεκτονική CDNA 2 της AMD με 104 υπολογιστικές μονάδες και 64 GB HBM2e με ταχύτητα έως 1,6 TB/s, σε κάρτα PCIe διπλής υποδοχής που καταναλώνει έως 300 W μέσω σύνδεσης host PCIe Gen 4, με έως τρεις συνδέσμους Infinity Fabric για κίνηση μεταξύ καρτών. Ο MI50 είναι η προγενέστερη γενιά GCN 5.1 με 60 υπολογιστικές μονάδες και 16 GB. Και οι δύο είναι υποστηριζόμενοι στόχοι ROCm, οπότε ο ίδιος κώδικας HIP και PyTorch τρέχει και στους δύο — ο MI210 απλώς χωράει τέσσερις φορές περισσότερο από ένα μοντέλο.

Πόση μνήμη κάρτας χρειάζεται το μοντέλο που θέλω να τρέξω;

Μόνο τα βάρη είναι παράμετροι πολλαπλασιασμένες με bytes ανά παράμετρο: περίπου 16 GB για μοντέλο 7-8 δισεκατομμυρίων παραμέτρων σε 16-bit, 28 GB για 13-14 δισεκατομμύρια, 68 GB για 30-34 δισεκατομμύρια. Η κρυφή μνήμη KV και το runtime προστίθενται από πάνω, γι' αυτό μια κάρτα 16 GB δεν εξυπηρετεί άνετα ένα μοντέλο του οποίου τα βάρη είναι 16 GB. Τα 64 GB του MI210 καλύπτουν ένα μοντέλο 30 δισεκατομμυρίων κβαντισμένο σε 8-bit με περιθώριο εργασίας. Η σελίδα διαστασιολόγησης LLM έχει ολόκληρο τον πίνακα — πόση μνήμη χρειάζεται κάθε μέγεθος μοντέλου και ποια κάρτα την καλύπτει.

Πόσο χρόνο παίρνει η ανάπτυξη ενός server GPU AMD Instinct;

Όπου το μηχάνημα είναι ήδη σε rack, συνήθως ενεργοποιείται περίπου 30 λεπτά αφού εκκαθαριστεί η πληρωμή. Όπου δεν είναι, κατασκευάζεται κατά παραγγελία και ο χρόνος παράδοσης εξαρτάται από τα εξαρτήματα. Ρωτήστε πριν πληρώσετε αν η ημερομηνία έχει σημασία — οι άμεσοι servers είναι η σελίδα για ό,τι βρίσκεται σε rack αυτή τη στιγμή. Κάθε server περιλαμβάνει άμεση επανεγκατάσταση λειτουργικού συστήματος, ώστε να μπορείτε να επαναλαμβάνετε χωρίς να ανοίγετε ξανά ticket.

Ποιο λογισμικό και ποια frameworks τρέχουν σε αυτές τις κάρτες;

Το ROCm, η πλατφόρμα υπολογιστικής GPU ανοιχτού κώδικα της AMD. Και τα δύο εξαρτήματα είναι υποστηριζόμενοι στόχοι ROCm — gfx90a στον MI210, gfx906 στον MI50 — που καλύπτει τα PyTorch, TensorFlow, JAX και ONNX Runtime, μαζί με τις βιβλιοθήκες BLAS, FFT, RNG και βασικών στοιχείων βαθιάς μάθησης. Το HIP μεταφέρει τον υπάρχοντα πηγαίο κώδικα CUDA αντί να απαιτεί επανεγγραφή. Επειδή έχετε root σε bare metal, επιλέγετε μόνοι σας τις εκδόσεις ROCm και kernel και μπορείτε να τρέξετε το σύνολο σε Docker ή υπό Kubernetes.