Ryzen AI Dedicated Server • Inferenz ohne Grafikkarte

Kleine Modelle laufen auf einer Ryzen AI-Maschine einwandfrei. Genau darum geht es.

Nicht jede Arbeitslast verdient eine Grafikkarte. Ein quantisiertes Modell bescheidener Größe antwortet aus dem Systemspeicher auf einer eigenen Maschine — Ihre Laufzeitumgebung, Ihre Versionen, Root auf der Hardware — ohne für Silizium zu zahlen, das der Job ungenutzt ließe.

Verwandeln Sie Ihre GPUs in passives monatliches Einkommen.

Haben Sie ungenutzte Server- oder Desktop-GPU-Setups? Listen Sie sie noch heute auf dem Primcast-Marktplatz und erzielen Sie stetige monatliche Mieteinnahmen von KI-Teams, Entwicklern und Unternehmen, die produktionsreife Rechenleistung benötigen.

Zum Marktplatz

Wo der Verzicht auf die Karte die richtige Entscheidung ist

Jedes Mal dasselbe Muster: Das Modell ist klein, der Traffic bescheiden, und die Daten müssen auf einer Maschine bleiben, die niemand anderem gehört.

Privater Assistent für interne Dokumente
Ein privater Helfer für private Daten

Ein kleines quantisiertes Modell, das Ihre eigenen Dokumente für eine Handvoll Kollegen liest. Der Korpus berührt nie einen geteilten Endpunkt, und die monatlichen Kosten sind eine Maschine, kein Zähler.

Stapelweises Entwerfen und Zusammenfassen
Entwürfe, Zusammenfassungen, Stapelläufe

Nächtliche Zusammenfassungen, Tagging, Umschreiben — Arbeit, die sich anstellt. Was dort zählt, sind die Kosten pro Auftrag, nicht die Millisekunden pro Token, und das ist die Arbeitslast, an der eine Grafikkarte am meisten verschwendet ist.

Interne Tools, die ein Modell aufrufen
Tools, die ein Modell leise aufrufen

Ticket-Routing, Log-Triage, Extraktion in eine Datenbank: ein kleines Modell hinter einem internen Endpunkt, den ganzen Tag an, zu einem Pauschalpreis, den das Finanzblatt lesen kann.

Evaluierung der NPU-Toolchain
Die NPU auf Herz und Nieren prüfen

AMDs XDNA-Toolchain gegen echte Hardware laufen lassen, monatsweise gemietet, bevor jemand eine ganze Flotte davon bestellt. Was sich nicht portieren lässt, zeigt sich hier zuerst – und günstig.

Der Kompromiss, klar ausgesprochen

Diese Maschinen sind ehrlicher Wert für die richtige Arbeitslast und der falsche Kauf für die falsche. Hier ist die Grenze zwischen beidem.

Speicher ist der großzügige Teil

Das Modell lebt im eigenen Speicher der Maschine, gemessen in Dutzenden Gigabyte statt im Kontingent einer Karte. Was hineinpasst, ist auf dieser Seite selten das Problem.

Bandbreite ist der enge Teil

Jeder generierte Token liest die Gewichte erneut, und Systemspeicher liest langsamer als Kartenspeicher. Ein Nutzer mit einem kleinen Modell wird es nicht stören; eine Warteschlange von Nutzern schon. Wir veröffentlichen keine Geschwindigkeitsangabe — weder hier noch anderswo — und sagen stattdessen dies.

Gefragt, bevor man eine bestellt

Vier ehrliche Antworten — dieselben, die unsere Ingenieure im Chat geben.

Kann ein Server wirklich ein Sprachmodell ohne Grafikkarte ausführen?

Ja, innerhalb von Grenzen, die man vorab nennen sollte: Ein kleines quantisiertes Modell generiert aus dem Systemspeicher in Lesegeschwindigkeit, was für einen Nutzer, ein internes Tool oder eine Stapelwarteschlange passt — und nicht für eine Menschenmenge. Wie viel Speicher ein bestimmtes Modell braucht und warum eines, das hineinpasst, dennoch beim Ausliefern scheitern kann, ist genau das, was unsere LLM-Seite durcharbeitet.

Führt die NPU mein Modell aus?

Das kann sie, über AMDs eigene Ryzen-AI-Toolchain — aber die meisten Open-Model-Laufzeitumgebungen, die tatsächlich eingesetzt werden, nutzen stattdessen den Prozessor und die integrierte Radeon, und wir sagen das lieber hier, als dass ein Datenblatt etwas anderes impliziert. Die NPU ist so oder so auf dem Die, und nichts hält Sie davon ab, sie anzusteuern.

Wann lohnt sich stattdessen eine dedizierte GPU?

Wenn das Modell größer wird als der Speicher, wenn mehrere Personen gleichzeitig Antworten brauchen oder wenn Sie feinabstimmen statt auszuliefern. Ryzen AI oder eine dedizierte GPU geht diese Entscheidung durch, und die GPU-Seite bepreist jede Karte im Verhältnis zur exakten Maschine, in die sie eingebaut wird.

Wird irgendetwas davon mit anderen Kunden geteilt?

Nein. Sie mieten die ganze Maschine: Prozessor, Grafik, NPU, Speicher, Festplatte und Port gehören jeweils einem Kunden, ohne Hypervisor darunter. Das ist ein großer Teil dessen, was die monatliche Summe kauft.