Serveurs dédiés Ryzen AI • Inférence sans carte graphique

Les petits modèles tournent très bien sur une machine Ryzen AI. C’est tout l’intérêt.

Toutes les charges de travail ne méritent pas une carte graphique. Un modèle quantifié de taille modeste répond depuis la mémoire système sur une machine entière qui lui est propre — votre runtime, vos versions, root sur le métal — sans payer pour du silicium que la tâche laisserait inactif.

Transformez vos GPU en revenu mensuel passif.

Vous avez des configurations GPU serveur ou de bureau inutilisées ? Mettez-les en ligne sur la marketplace Primcast dès aujourd’hui et percevez des loyers mensuels réguliers de la part d’équipes IA, de développeurs et d’entreprises ayant besoin de calcul de qualité production.

Aller à la Marketplace

Quand se passer de la carte est le bon choix

Le même schéma à chaque fois : le modèle est petit, le trafic est modeste, et les données doivent rester sur une machine qui n’appartient à personne d’autre.

Assistant privé sur des documents internes
Un assistant privé sur des données privées

Un petit modèle quantifié qui lit vos propres documents pour une poignée de collègues. Le corpus ne touche jamais un point de terminaison partagé, et le coût mensuel est une machine, pas un compteur.

Rédaction par lots et résumés
Brouillons, résumés, traitements par lots

Résumés nocturnes, étiquetage, réécriture — du travail qui se met en file d’attente. Ce qui compte là, c’est le coût par tâche, pas les millisecondes par jeton, et c’est la charge de travail sur laquelle une carte graphique est le plus gaspillée.

Outils internes appelant un modèle
Des outils qui appellent un modèle en silence

Routage de tickets, tri des journaux, extraction vers une base de données : un petit modèle derrière un point de terminaison interne, allumé toute la journée, à un tarif fixe que la feuille de calcul financière peut lire.

Évaluation de la chaîne d’outils NPU
Tester les pneus du NPU

Exécuter la chaîne d’outils XDNA d’AMD sur du vrai silicium, loué au mois, avant que quiconque ne signe pour une flotte entière. Ce qui refuse de se porter apparaît ici en premier, et à moindre coût.

Le compromis, énoncé clairement

Ces machines sont d’un bon rapport qualité-prix pour la bonne charge de travail et un mauvais achat pour la mauvaise. Voici la frontière entre les deux.

La mémoire est la partie spacieuse

Le modèle vit dans la mémoire propre de la machine, mesurée en dizaines de gigaoctets plutôt qu’en allocation d’une carte. Ce qui tient est rarement le problème sur cette page.

La bande passante est la partie étroite

Chaque jeton généré relit les poids, et la mémoire système se lit plus lentement que la mémoire d’une carte. Un seul utilisateur sur un petit modèle ne s’en plaindra pas ; une file d’utilisateurs, si. Nous ne publions aucun chiffre de vitesse — ni ici ni ailleurs — et nous disons ceci à la place.

Questions posées avant d’en commander un

Quatre réponses honnêtes — les mêmes que celles que nos ingénieurs donnent sur le chat.

Un serveur peut-il vraiment faire tourner un modèle de langage sans carte graphique ?

Oui, dans des limites qu’il vaut mieux énoncer d’emblée : un petit modèle quantifié génère depuis la mémoire système au rythme de la lecture, ce qui convient à un utilisateur, à un outil interne ou à une file de traitement par lots — et ne convient pas à une foule. La quantité de mémoire dont un modèle donné a besoin, et la raison pour laquelle un modèle qui tient peut quand même échouer à servir, c’est exactement ce que notre page LLM détaille.

Le NPU fait-il tourner mon modèle ?

Il le peut, via la propre chaîne d’outils Ryzen AI d’AMD — mais la plupart des runtimes de modèles ouverts que les gens déploient réellement utilisent plutôt le processeur et la Radeon intégrée, et nous préférons le dire ici plutôt que de laisser une fiche technique laisser entendre le contraire. Le NPU est sur la puce dans tous les cas, et rien ne vous empêche de le cibler.

Quand un GPU dédié vaut-il plutôt la peine ?

Quand le modèle devient plus gros que la mémoire, quand plusieurs personnes ont besoin de réponses en même temps, ou quand vous faites du fine-tuning plutôt que du service. Ryzen AI ou un GPU dédié parcourt cette décision, et la page GPU tarife chaque carte en fonction de la machine exacte dans laquelle elle va.

Une partie est-elle partagée avec d’autres clients ?

Non. Vous louez la machine entière : processeur, graphismes, NPU, mémoire, disque et port appartiennent à un seul client à la fois, sans hyperviseur en dessous. C’est une grande partie de ce que le montant mensuel achète.