Επιταχυντές AMD Instinct

AMD Instinct σε έναν υπολογιστή που δεν χρησιμοποιεί κανένας άλλος

Δύο επιταχυντές AMD συνδέονται στους αποκλειστικούς διακομιστές μας: ο Instinct MI210 και ο Instinct MI50. Η κάρτα διαβιβάζεται στο δικό σας λειτουργικό σύστημα — την έκδοση ROCm, τον πυρήνα σας, τις διεργασίες σας και κανέναν ενδιάμεσο υπερεπόπτη.

MI210: 104 υπολογιστικές μονάδες CDNA 2, 64 GB HBM2e. MI50: 60 υπολογιστικές μονάδες GCN 5.1, 16 GB. Ένας ενοικιαστής ανά μηχάνημα. Δεν είναι τεμαχισμένο, δεν είναι χρονομεριζόμενο.

Κάθε κάρτα γραφικών που τοποθετούμε — AMD και NVIDIA, τρέχουσες και ανεξάρτητες από την παραγωγή τους — αναγράφεται με τη δική της μηνιαία τιμή στον κατάλογο GPU .

Μετατρέψτε τις GPU σας σε παθητικό μηνιαίο εισόδημα

Έχετε ρυθμίσεις GPU για αδρανείς διακομιστές ή επιτραπέζιους υπολογιστές; Καταχωρίστε τις στην αγορά της Primcast σήμερα και κερδίστε σταθερά μηνιαία έσοδα από ομάδες τεχνητής νοημοσύνης, προγραμματιστές και επιχειρήσεις που χρειάζονται υπολογιστική ικανότητα παραγωγικού επιπέδου.

Μετάβαση στην Αγορά

Τι είναι στην πραγματικότητα ένας διακομιστής AMD Instinct εδώ;

Ένας φυσικός διακομιστής ενοικιασμένος σε έναν λογαριασμό, με έναν επιταχυντή AMD σε μια υποδοχή PCIe και root στο λειτουργικό σύστημα από πάνω. Η κάρτα είναι μια γραμμή στο τιμολόγιο και όχι ένα επίπεδο προϊόντος, επομένως το μηχάνημα από κάτω δεν γίνεται πιο ακριβό λόγω του τι είναι συνδεδεμένο σε αυτό.

Η κάρτα είναι δική σου

Δεν υπάρχει partition, δεν υπάρχει vGPU, δεν υπάρχει scheduler που να αποφασίζει πότε είναι η σειρά σας. Ο επιταχυντής παραδίδεται απευθείας στον πυρήνα σας, επομένως μπορείτε να καρφιτσώσετε τη δική σας έκδοση ROCm και να φορτώσετε τις δικές σας ενότητες χωρίς να μας ρωτήσετε.

ROCm, HIP και τα συνήθη πλαίσια

Και τα δύο μέρη υποστηρίζονται από στόχους ROCm — gfx90a για το MI210, gfx906 για το MI50 — κάτι που αντικατοπτρίζεται στο PyTorch, το TensorFlow, το JAX και το ONNX Runtime στην AMD. Οι θύρες HIP χρησιμοποιούν πηγαίο κώδικα CUDA αντί να απαιτούν επανεγγραφή.

Τιμή ξεχωριστή από το μηχάνημα

Ο επιταχυντής έχει το δικό του μηνιαίο ποσό και ο διακομιστής έχει ένα άλλο, και εσείς προσθέτετε τα δύο. Αλλάξτε την κάρτα χωρίς να αλλάξετε διακομιστές. Και τα δύο ποσά, για κάθε κάρτα στον κατάλογο, βρίσκονται στη σελίδα GPU .

Οι δύο επιταχυντές AMD Instinct που τοποθετούμε

Και οι δύο είναι διαθέσιμοι για παραγγελία σήμερα από τον ίδιο διαμορφωτή, σε διαφορετικές γραμμές διακομιστών. Τα παρακάτω σχήματα είναι δημοσιευμένα από την AMD.

Επιταχυντής AMD Instinct MI210

AMD Instinct MI210

Η CDNA 2ης γενιάς σε μια τυπική κάρτα PCIe πλήρους ύψους, πλήρους μήκους, διπλής υποδοχής — 104 υπολογιστικές μονάδες, 64 GB HBM2e με ταχύτητα έως και 1,6 TB/s και έως τρεις συνδέσεις Infinity Fabric για άμεση κίνηση από κάρτα σε κάρτα. Ψύχεται παθητικά στα 300 W μέσω σύνδεσης κεντρικού υπολογιστή PCIe Gen 4. Αυτό είναι το ερώτημα που πρέπει να τεθεί όταν το όλο ερώτημα είναι αν το μοντέλο χωράει στη μνήμη.

AMD Instinct MI50

Το παλαιότερο μέρος της γενιάς Vega: GCN 5.1 πυρίτιο, 60 υπολογιστικές μονάδες και 16 GB μνήμης εντός της συσκευασίας. Κανείς δεν νοικιάζει πλέον αυτήν την κάρτα, γεγονός που την καθιστά μη διαθέσιμη αλλού και απλώς φθηνή εδώ — και εξακολουθεί να υποστηρίζεται ως στόχος ROCm, επομένως εκτελεί τον ίδιο κώδικα HIP και PyTorch με την MI210 για ένα κλάσμα του μηνιαίου αριθμού. Είναι ο λογικός τρόπος για να λειτουργήσει μια αλυσίδα εργαλείων ROCm πριν δεσμευτείτε στην μεγάλη κάρτα.

Απόδοση μήτρας στο MI210

Η AMD δημοσιεύει απόδοση 181,0 TFLOPS στις μέγιστες τιμές των FP16 και BF16 για την MI210 στο ρολόγιο κινητήρα peak boost των 1.700 MHz, παράλληλα με 22,6 TFLOPS στις μέγιστες τιμές των FP64 και FP32.

Η μνήμη είναι ο περιορισμός

Τα 64 GB περιέχουν τα βάρη ενός μοντέλου 30 δισεκατομμυρίων παραμέτρων στα 8 bit ή ενός μοντέλου 13 δισεκατομμυρίων παραμέτρων στα 16 bit, με χώρο που απομένει για την προσωρινή μνήμη KV. Η σελίδα της GPU επεξεργάζεται αυτήν την αριθμητική για κάθε μέγεθος μοντέλου.

Τι δίνει ο οικοδεσπότης στην κάρτα

Η δημιουργία λωρίδας κεντρικού υπολογιστή είναι το γεγονός ότι σχεδόν κανείς δεν δημοσιεύει και αυτή είναι που αποφασίζει εάν μια κάρτα θα τρέχει στο εύρος ζώνης σχεδιασμού της. Δημοσιεύουμε τη δική μας δίπλα σε κάθε κάρτα, στη σελίδα της GPU .

Τίποτα δεν μετράει τα byte

Εισάγονται βάρη, εξάγονται σημεία ελέγχου, εισέρχονται σύνολα δεδομένων. Η μεταφορά δεν έχει περιορισμούς, επομένως μια εκτέλεση εκπαίδευσης που μεταδίδει ένα σώμα δεδομένων δεν φτάνει ως λογαριασμός εύρους ζώνης στο τέλος του μήνα.

Αποκλειστικοί διακομιστές HPE εταιρικού επιπέδου με την υποστήριξη του AMD Instinct™

Επιχείρηση HPE

Ο αποκλειστικός διακομιστής GPU AMD INSTINCT™ σας υποστηρίζεται από διακομιστές HPE Enterprise, εξασφαλίζοντας σταθερή απόδοση για τα πιο απαιτητικά φόρτα εργασίας.

Αναβαθμίσεις υλικού

Προσθέστε εύκολα πόρους ή επιπλέον διακομιστές στην υποδομή του διακομιστή σας. Οι περισσότερες αναβαθμίσεις διεκπεραιώνονται εντός 24 ωρών.

24/7 υποστήριξη

Οι ειδικοί σε dedicated servers είναι διαθέσιμοι για να σας βοηθήσουν 24/7 μέσω ζωντανής συνομιλίας και email.

Το MI210 σε σχέση με τις κάρτες NVIDIA που επίσης ταιριάζουμε

Τέσσερις επιταχυντές από τον ίδιο κατάλογο παραγγελιών, επομένως αυτό συγκρίνει ανταλλακτικά που μπορείτε πραγματικά να βάλετε στο ίδιο καλάθι. Τα μηνιαία στοιχεία στην τελευταία σειρά διαβάζονται από αυτόν τον κατάλογο κατά τη φόρτωση της σελίδας.

MI210L40SΑ100H100
Αρχιτεκτονική GPUCDNA 2Άντα ΛάβλεϊςNVIDIA ΑμπέρΧοάνη
Μνήμη GPU64GB HBM2e48GB GDDR6 με ECC80GB HBM2e80GB HBM3
Εύρος ζώνης μνήμης GPUΈως 1,6 TB/δευτ.864 GB/s1935 GB/s3352 GB/s
FP3222,6 TFLOPS91,6 TFLOPS19,5 TFLOPS51 ΤΦΛΟΠΣ
Πυρήνας τενσόρ TF32366 ΤΦΛΟΠΣ312 ΤΦΛΟΠΣ756 ΤΦΛΟΠΣ
Πίνακας FP16/BF16181 ΤΦΛΟΠΣ733 ΤΦΛΟΠΣ624 ΤΦΛΟΠΣ1513 ΤΦΛΟΠΣ
ΕξουσίαΈως 300WΈως 350WΈως 400WΈως 350W
Φόρτωση...Φόρτωση...Φόρτωση...Φόρτωση...

Το TF32 είναι μια μορφή tensor-core της NVIDIA. Το CDNA 2 δεν την εφαρμόζει και η AMD δεν δημοσιεύει κανένα νούμερο για αυτήν, επομένως η στήλη MI210 δεν δείχνει τίποτα εκεί, παρά έναν αριθμό δανεισμένο από άλλον προμηθευτή. Οι γραμμές tensor-core της NVIDIA είναι τα δημοσιευμένα νούμερα με αραιότητα. Κάθε άλλη κάρτα που τοποθετούμε, συμπεριλαμβανομένης της MI50, έχει τιμή στον κατάλογο GPU .

Συχνές ερωτήσεις σχετικά με τους διακομιστές GPU AMD Instinct

Συνήθεις ερωτήσεις σχετικά με την ανάπτυξη και τη διαχείριση επιταχυντών AMD Instinct σε γυμνό μέταλλο για φόρτους εργασίας τεχνητής νοημοσύνης, HPC και μηχανικής μάθησης.

Ποιους επιταχυντές AMD Instinct μπορώ να παραγγείλω;

Δύο: το Instinct MI210 και το Instinct MI50. Αυτοί είναι οι επιταχυντές AMD στον κατάλογο παραγγελιών μας και ο διαμορφωτής δεν θα σας προσφέρει τίποτα άλλο από τη σειρά Instinct. Το MI210 τοποθετείται σε τρεις από τις γραμμές διακομιστών μας και το MI50 σε δύο. Δεν τοποθετούμε το MI250, το MI250X ή το MI300A και ποτέ δεν το έχουμε κάνει.

Ποια είναι η διαφορά μεταξύ του MI210 και του MI50;

Γενιά και μνήμη. Η MI210 είναι η αρχιτεκτονική CDNA 2 της AMD με 104 υπολογιστικές μονάδες και 64 GB HBM2e με ταχύτητα έως και 1,6 TB/s, σε μια κάρτα PCIe διπλής υποδοχής που καταναλώνει έως και 300 W μέσω σύνδεσης κεντρικού υπολογιστή PCIe Gen 4, με έως και τρεις συνδέσεις Infinity Fabric για κίνηση από κάρτα σε κάρτα. Η MI50 είναι η προηγούμενη γενιά GCN 5.1 με 60 υπολογιστικές μονάδες και 16 GB. Και οι δύο υποστηρίζονται ως στόχοι ROCm, επομένως ο ίδιος κώδικας HIP και PyTorch εκτελείται και στις δύο περιπτώσεις — η MI210 απλώς διατηρεί τέσσερις φορές περισσότερο από ένα μοντέλο.

Πόση μνήμη κάρτας χρειάζεται το μοντέλο που θέλω να χρησιμοποιήσω;

Τα βάρη από μόνα τους είναι παράμετροι πολλαπλασιασμένες με bytes ανά παράμετρο: περίπου 16 GB για ένα μοντέλο 7-8 δισεκατομμυρίων παραμέτρων στα 16-bit, 28 GB για 13-14 δισεκατομμύρια, 68 GB για 30-34 δισεκατομμύρια. Η προσωρινή μνήμη KV και ο χρόνος εκτέλεσης προστίθενται σε αυτό, γι' αυτό και μια κάρτα 16 GB δεν εξυπηρετεί άνετα ένα μοντέλο του οποίου τα βάρη είναι 16 GB. Τα 64 GB της MI210 καλύπτουν ένα μοντέλο 30 δισεκατομμυρίων κβαντισμένων σε 8-bit με χώρο για εργασία. Η σελίδα της GPU περιέχει ολόκληρο τον πίνακα.

Πόσος χρόνος χρειάζεται για την ανάπτυξη ενός διακομιστή GPU AMD Instinct;

Όταν το μηχάνημα είναι ήδη τοποθετημένο σε rack, ενεργοποιείται συνήθως περίπου 30 λεπτά μετά την ολοκλήρωση της πληρωμής. Όπου δεν είναι, κατασκευάζεται κατόπιν παραγγελίας και ο χρόνος παράδοσης εξαρτάται από τα εξαρτήματα. Ρωτήστε πριν πληρώσετε αν η ημερομηνία έχει σημασία — οι άμεσοι διακομιστές είναι η σελίδα για το τι υπάρχει σε ένα rack αυτή τη στιγμή. Κάθε διακομιστής περιλαμβάνει άμεση επαναφόρτωση λειτουργικού συστήματος, ώστε να μπορείτε να επαναλάβετε χωρίς να ανοίξετε ξανά ένα αίτημα.

Ποιο λογισμικό και frameworks εκτελούνται σε αυτές τις κάρτες;

ROCm, η πλατφόρμα υπολογισμού GPU ανοιχτού κώδικα της AMD. Και τα δύο μέρη υποστηρίζονται από στόχους ROCm — gfx90a στο MI210, gfx906 στο MI50 — που καλύπτει PyTorch, TensorFlow, JAX και ONNX Runtime, μαζί με τις βιβλιοθήκες BLAS, FFT, RNG και deep-learning primitive. Το HIP μεταφέρει τον υπάρχοντα πηγαίο κώδικα CUDA αντί να απαιτεί επανεγγραφή. Επειδή έχετε root on bare metal, επιλέγετε μόνοι σας τις εκδόσεις ROCm και kernel και μπορείτε να εκτελέσετε ολόκληρο το πρόγραμμα στο Docker ή στο Kubernetes.