Ryzen AI dedicated servers • Συμπερασμός χωρίς κάρτα γραφικών

Τα μικρά μοντέλα τρέχουν μια χαρά σε ένα μηχάνημα Ryzen AI. Αυτό είναι το νόημα.

Δεν αξίζει κάθε φόρτος εργασίας μια κάρτα γραφικών. Ένα κβαντισμένο μοντέλο μετρίου μεγέθους απαντά από τη μνήμη συστήματος σε ένα ολόκληρο δικό του μηχάνημα — δικό σας runtime, δικές σας εκδόσεις, root στο μέταλλο — χωρίς να πληρώνετε για πυρίτιο που η εργασία θα άφηνε αδρανές.

Μετατρέψτε τις GPU σας σε παθητικό μηνιαίο έσοδο.

Έχετε αδρανείς διατάξεις GPU σε server ή desktop; Καταχωρίστε τις σήμερα στην αγορά Primcast και κερδίστε σταθερά μηνιαία ενοίκια από ομάδες τεχνητής νοημοσύνης, προγραμματιστές και επιχειρήσεις που χρειάζονται υπολογιστική ισχύ επιπέδου παραγωγής.

Μετάβαση στην Αγορά

Πότε το να παραλείψετε την κάρτα είναι η σωστή επιλογή

Το ίδιο μοτίβο κάθε φορά: το μοντέλο είναι μικρό, η κίνηση είναι μέτρια και τα δεδομένα πρέπει να παραμείνουν σε ένα μηχάνημα που δεν ανήκει σε κανέναν άλλο.

Ιδιωτικός βοηθός σε εσωτερικά έγγραφα
Ένας ιδιωτικός βοηθός σε ιδιωτικά δεδομένα

Ένα μικρό κβαντισμένο μοντέλο που διαβάζει τα δικά σας έγγραφα για μια χούφτα συναδέλφους. Το corpus δεν αγγίζει ποτέ ένα κοινό endpoint και το μηνιαίο κόστος είναι ένα μηχάνημα, όχι ένας μετρητής.

Ομαδική σύνταξη και σύνοψη
Προσχέδια, συνόψεις, ομαδικές εκτελέσεις

Νυχτερινές συνόψεις, επισήμανση, επανεγγραφή — εργασία που μπαίνει σε ουρά. Αυτό που έχει σημασία εκεί είναι το κόστος ανά εργασία, όχι τα χιλιοστά του δευτερολέπτου ανά token, και αυτός είναι ο φόρτος εργασίας στον οποίο μια κάρτα γραφικών πάει πιο χαμένη.

Εσωτερικά εργαλεία που καλούν ένα μοντέλο
Εργαλεία που καλούν ένα μοντέλο αθόρυβα

Δρομολόγηση αιτημάτων, διαλογή καταγραφών, εξαγωγή σε βάση δεδομένων: ένα μικρό μοντέλο πίσω από ένα εσωτερικό endpoint, ανοιχτό όλη μέρα, με σταθερή τιμή που μπορεί να διαβάσει το λογιστικό φύλλο.

Αξιολόγηση της εργαλειοθήκης NPU
Δοκιμάζοντας τα λάστιχα του NPU

Εκτέλεση της εργαλειοθήκης XDNA της AMD σε πραγματικό πυρίτιο, ενοικιασμένο ανά μήνα, πριν υπογράψει κανείς για έναν στόλο από αυτά. Ό,τι αρνείται να μεταφερθεί φαίνεται εδώ πρώτα, και φθηνά.

Η ανταλλαγή, διατυπωμένη καθαρά

Αυτά τα μηχανήματα είναι τίμια αξία για τον σωστό φόρτο εργασίας και λάθος αγορά για τον λάθος. Εδώ είναι η γραμμή ανάμεσα στα δύο.

Η μνήμη είναι το ευρύχωρο μέρος

Το μοντέλο ζει στη μνήμη του ίδιου του μηχανήματος, μετρημένη σε δεκάδες gigabytes αντί για το μερίδιο μιας κάρτας. Το τι χωράει σπάνια είναι το πρόβλημα σε αυτή τη σελίδα.

Το εύρος ζώνης είναι το στενό μέρος

Κάθε token που παράγεται ξαναδιαβάζει τα βάρη, και η μνήμη συστήματος διαβάζει πιο αργά από τη μνήμη της κάρτας. Ένας χρήστης σε ένα μικρό μοντέλο δεν θα ενοχληθεί· μια ουρά χρηστών θα ενοχληθεί. Δεν δημοσιεύουμε κανένα νούμερο ταχύτητας — εδώ ή οπουδήποτε — και λέμε αυτό αντ' αυτού.

Η κάρτα απέχει μία σελίδα

Ξεπεράστε αυτό και τίποτα δεν χάνεται: πόση μνήμη χρειάζεται το μοντέλο σας αναλύεται στη σελίδα LLM, κάθε κάρτα που τοποθετούμε έχει τιμή σε σχέση με το μηχάνημά της, και το DGX Spark είναι η ίδια ιδέα στην κορυφή, με 128 GB που μπορεί να διευθυνσιοδοτήσει η GPU.

Ερωτήσεις πριν την παραγγελία

Τέσσερις τίμιες απαντήσεις — οι ίδιες που δίνουν οι μηχανικοί μας στο chat.

Μπορεί ένας server να τρέξει πραγματικά ένα γλωσσικό μοντέλο χωρίς κάρτα γραφικών;

Ναι, εντός ορίων που αξίζει να δηλωθούν εξαρχής: ένα μικρό κβαντισμένο μοντέλο παράγει από τη μνήμη συστήματος με ρυθμό ανάγνωσης, που ταιριάζει σε έναν χρήστη, ένα εσωτερικό εργαλείο ή μια ουρά ομαδικών εργασιών — και δεν ταιριάζει σε πλήθος. Πόση μνήμη χρειάζεται ένα δεδομένο μοντέλο, και γιατί ένα που χωράει μπορεί ακόμα να αποτύχει να εξυπηρετήσει, είναι ακριβώς ό,τι αναλύει η σελίδα μας για LLM.

Το NPU τρέχει το μοντέλο μου;

Μπορεί, μέσω της εργαλειοθήκης Ryzen AI της ίδιας της AMD — αλλά τα περισσότερα από τα runtimes ανοιχτών μοντέλων που πραγματικά αναπτύσσουν οι άνθρωποι χρησιμοποιούν τον επεξεργαστή και την ενσωματωμένη Radeon αντ' αυτού, και προτιμούμε να το πούμε εδώ παρά να αφήσουμε ένα φύλλο προδιαγραφών να υπονοήσει το αντίθετο. Το NPU είναι στο die είτε έτσι είτε αλλιώς, και τίποτα δεν σας εμποδίζει να το στοχεύσετε.

Πότε αξίζει αντ' αυτού μια αποκλειστική GPU;

Όταν το μοντέλο γίνεται μεγαλύτερο από τη μνήμη, όταν πολλά άτομα χρειάζονται απαντήσεις ταυτόχρονα ή όταν κάνετε fine-tuning αντί να εξυπηρετείτε. Ryzen AI ή αποκλειστική GPU περπατά αυτή την απόφαση, και η σελίδα GPU κοστολογεί κάθε κάρτα σε σχέση με το ακριβές μηχάνημα στο οποίο μπαίνει.

Μοιράζεται τίποτα από αυτά με άλλους πελάτες;

Όχι. Νοικιάζετε ολόκληρο το μηχάνημα: επεξεργαστής, γραφικά, NPU, μνήμη, δίσκος και θύρα ανήκουν σε έναν πελάτη τη φορά, χωρίς hypervisor από κάτω. Αυτό είναι μεγάλο μέρος από ό,τι αγοράζει το μηνιαίο ποσό.