Server dedicati Ryzen AI • Inferenza senza scheda grafica

I modelli piccoli girano bene su una macchina Ryzen AI. È proprio questo il punto.

Non tutti i carichi di lavoro meritano una scheda grafica. Un modello quantizzato di dimensioni contenute risponde dalla memoria di sistema su un’intera macchina dedicata — il tuo runtime, le tue versioni, root sul metallo — senza pagare per silicio che il lavoro lascerebbe inattivo.

Trasforma le tue GPU in entrate mensili passive.

Hai configurazioni GPU server o desktop inattive? Mettile oggi sul marketplace Primcast e guadagna affitti mensili costanti da team AI, sviluppatori e aziende che necessitano di potenza di calcolo di livello produttivo.

Vai al Marketplace

Quando saltare la scheda è la scelta giusta

Lo stesso schema ogni volta: il modello è piccolo, il traffico è modesto e i dati devono restare su una macchina che non è di nessun altro.

Assistente privato su documenti interni
Un assistente privato su dati privati

Un piccolo modello quantizzato che legge i tuoi documenti per una manciata di colleghi. Il corpus non tocca mai un endpoint condiviso e il costo mensile è una macchina, non un contatore.

Stesura in batch e riassunti
Bozze, riassunti, esecuzioni in batch

Riassunti notturni, etichettatura, riscrittura — lavoro che si mette in coda. Lì ciò che conta è il costo per lavoro, non i millisecondi per token, ed è il carico su cui una scheda grafica è più sprecata.

Strumenti interni che chiamano un modello
Strumenti che chiamano un modello in silenzio

Instradamento dei ticket, triage dei log, estrazione in un database: un piccolo modello dietro un endpoint interno, acceso tutto il giorno, a una tariffa fissa che il foglio finanziario sa leggere.

Valutare la toolchain NPU
Provare la NPU sul campo

Eseguire la toolchain XDNA di AMD su silicio reale, noleggiato a mese, prima che qualcuno firmi per una flotta. Ciò che rifiuta di essere portato emerge qui per primo, e a basso costo.

Il compromesso, detto chiaramente

Queste macchine sono valore onesto per il carico di lavoro giusto e l’acquisto sbagliato per quello sbagliato. Ecco la linea tra i due.

La memoria è la parte spaziosa

Il modello vive nella memoria della macchina, misurata in decine di gigabyte anziché nella dotazione di una scheda. Ciò che entra raramente è il problema in questa pagina.

La larghezza di banda è la parte stretta

Ogni token generato rilegge i pesi, e la memoria di sistema legge più lentamente della memoria della scheda. Un solo utente su un modello piccolo non se ne accorgerà; una coda di utenti sì. Non pubblichiamo alcuna cifra di velocità — né qui né altrove — e diciamo questo invece.

Domande fatte prima di ordinarne uno

Quattro risposte oneste — le stesse che danno i nostri ingegneri in chat.

Un server può davvero eseguire un modello linguistico senza scheda grafica?

Sì, entro limiti che vale la pena dichiarare subito: un piccolo modello quantizzato genera dalla memoria di sistema a velocità di lettura, il che va bene per un utente, uno strumento interno o una coda batch — e non va bene per una folla. Quanta memoria serve a un dato modello, e perché uno che ci sta può comunque non riuscire a servire, è esattamente ciò che la nostra pagina LLM spiega.

La NPU esegue il mio modello?

Può farlo, tramite la toolchain Ryzen AI di AMD — ma la maggior parte dei runtime open-model che le persone effettivamente distribuiscono usa invece il processore e la Radeon integrata, e preferiamo dirlo qui piuttosto che lasciare che una scheda tecnica lasci intendere il contrario. La NPU è comunque sul die, e nulla ti impedisce di puntare a essa.

Quando conviene invece una GPU dedicata?

Quando il modello diventa più grande della memoria, quando più persone hanno bisogno di risposte contemporaneamente, o quando fai fine-tuning invece di servire. Ryzen AI o una GPU dedicata percorre quella decisione, e la pagina GPU prezza ogni scheda rispetto alla macchina esatta in cui va.

Qualcosa di tutto ciò è condiviso con altri clienti?

No. Noleggi l’intera macchina: processore, grafica, NPU, memoria, disco e porta appartengono a un solo cliente alla volta, senza hypervisor sotto. È gran parte di ciò che la cifra mensile compra.