Ein Chatbot, der nur Ihnen gehört
Betreiben Sie ein offenes Modell wie Llama, Qwen oder Mistral auf einem Server, den sonst niemand nutzt. Prompts, Dokumente und Antworten bleiben auf Ihrer Maschine, statt an die API eines anderen zu gehen.
NVIDIA CMP 170HX · entsperrt, sobald wir ihn einbauen
NVIDIA hat die CMP 170HX fürs Mining gebaut und den Rest weggesperrt: Die Karte zeigte 8 GB Speicher und rechnete Gleitkomma-Mathematik im Schneckentempo. Die Sperre erwies sich als Software. Wir installieren einen Treiber, der sie aufhebt, sodass Ihr Server mit einer Karte ankommt, die über 64 GB sehr schnellen Speicher verfügt und KI-Modelle so ausführt, wie ihr Chip es eigentlich sollte.
Dieselbe Karte, derselbe Chip. Der graue Teil ist das, was NVIDIA aktiviert ließ; der Rest ist das, was der Treiber einschaltet.
Worin sie jetzt gut ist
Betreiben Sie ein offenes Modell wie Llama, Qwen oder Mistral auf einem Server, den sonst niemand nutzt. Prompts, Dokumente und Antworten bleiben auf Ihrer Maschine, statt an die API eines anderen zu gehen.
Ein Modell mit 70 Milliarden Parametern passt mit 4-Bit auf eine entsperrte Karte. Auf einer nicht entsperrten Karte liegt die Grenze bei etwa 8 Milliarden.
Was das Modell nicht nutzt, geht an seinen Kontext, sodass lange Dokumente und lange Chats weiterlaufen, statt mittendrin keinen Platz mehr zu haben.
Ein Chat-Modell, ein Embedding-Modell für die Suche und ein kleines Modell, das Anfragen weiterleitet, können alle zusammen geladen bleiben, statt sich abzuwechseln.
Ein fester Monatspreis und kein Zähler, weder bei der Karte noch bei der Bandbreite. Lassen Sie einen Batch über das Wochenende laufen, und die Rechnung bewegt sich nicht.
Nur Gewichte, mit einem Viertel bis zur Hälfte zusätzlich freigehalten für das Gespräch selbst. Die vollständige Größenanleitung finden Sie auf unserer LLM-Seite.
Dieselbe Karte, vorher und nachher
LTT Labs hat im September 2026 eine CMP 170HX freigeschaltet und dieselben Modelle auf beide Arten darauf ausgeführt. Das sind ihre Ergebnisse, nicht unsere. Die Geschwindigkeiten ändern sich je nach Modell und Software, also betrachten Sie sie als Größenordnung des Sprungs und nicht als Zahl, an der Sie uns festnageln können.
Diese Zahlen stammen aus dem LTT-Labs-Bericht vom September 2026, der llama.cpp auf ihrem eigenen Testsystem ausgeführt hat. Die Freischaltung selbst ist cmpunlocker, ein Open-Source-Projekt von Amogh Munikote.
Was nach Ihrer Bestellung passiert
Wählen Sie im Konfigurator Ubuntu 22.04, 24.04 oder 26.04. Der Unlock ist ein Linux-Treiber, daher ist dies die eine Entscheidung, auf die es ankommt.
Die Karte wird eingesetzt, Ubuntu wird aufgespielt und der entsperrte Treiber wird für genau den Kernel einkompiliert, mit dem Ihr Server laufen wird.
Der Server wird vollständig aus- und wieder eingeschaltet, was der Unlock benötigt, und jede Karte wird vor der Übergabe auf ihren vollen Speicher geprüft.
Wenn Ubuntu einen neuen Kernel installiert, baut sich der Treiber passend dazu selbst neu. Geben Sie cmp-unlock status ein, wann immer Sie sehen möchten, wie es jeder Karte geht.
Wissenswertes vor dem Kauf
Was es kostet
Die Karte steht als eigene Position auf der Rechnung und der Server als weitere, damit Sie sehen, was jedes einzelne kostet. Der angezeigte Betrag gilt für eine Karte im kleinsten Server, der sie aufnimmt. Fügen Sie im Konfigurator Arbeitsspeicher, größere Festplatten oder weitere Karten hinzu, und die neue Summe wird laufend angezeigt.
Es fällt eine einmalige Einrichtungsgebühr an, weil die Karte für Ihre Bestellung eingebaut wird. Die Bandbreite ist unlimitiert, die US-Umsatzsteuer wird an der Kasse erhoben, sofern sie anfällt, und der monatliche Preis bleibt bei einer Verlängerung gleich.
$272.67/month
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Fragen
NVIDIA verkaufte die CMP 170HX als Mining-Karte und schaltete das meiste davon per Software ab: Sie zeigte 8 GB Speicher und rechnete Gleitkomma-Mathematik sehr langsam. Ein Community-Treiber namens cmpunlocker schaltet diese Teile wieder ein. Eine freigeschaltete Karte hat 64 GB Speicher und läuft mit der Geschwindigkeit des Chips in ihrem Inneren – derselbe Chip wie in einer A100.
64 GB bei der 8-GB-Version der Karte, das sehen Sie auch in nvidia-smi. Die 10-GB-Version wird auf 40 GB freigeschaltet, weil mehr darauf nicht zuverlässig läuft. Ohne den freigeschalteten Treiber zeigen beide den Speicher, mit dem sie ausgeliefert wurden.
Nein. Bestellen Sie den Server mit Ubuntu 22.04, 24.04 oder 26.04, und er kommt freigeschaltet an. Wir installieren den Treiber, bauen den Unlock für Ihren Kernel und prüfen jede Karte, bevor wir den Server übergeben.
Ja. Der freigeschaltete Treiber lädt bei jedem Serverstart, und wenn Ubuntu einen neuen Kernel installiert, baut sich der Unlock dafür selbst neu. Sollte eine Karte jemals 8 GB anzeigen, schalten Sie den Server über das Control Panel aus und wieder ein, und melden Sie sich bei uns, falls das nicht hilft.
Alles, was für NVIDIA-Karten gemacht ist: PyTorch, llama.cpp, Ollama, vLLM und der Rest. Installieren Sie das CUDA-Toolkit mit apt install cuda-toolkit. Meiden Sie die Pakete namens cuda und cuda-drivers, die einen zweiten Treiber hinzufügen würden; wir stellen den Server so ein, dass er sie ablehnt.
Das können Sie, aber der Unlock existiert nur für Linux, daher bleibt die Karte unter Windows bei 8 GB mit ihren ursprünglichen Einschränkungen. Für alles, was den Speicher braucht, wählen Sie Ubuntu.
Bis zu vier. Zwei freigeschaltete Karten fassen zusammen 128 GB – genug für ein Modell mit 70 Milliarden Parametern bei 8 Bit.
Ja, das Freischalten nimmt nichts weg. Wenn Mining aber der Hauptplan ist, finden Sie auf unserer Mining-Seite die Karten und die Kosten dafür.
Die Karte wird für Ihre Bestellung eingebaut, womit der Server eine Sonderanfertigung ist, und Sonderanfertigungen haben eine einmalige Einrichtungsgebühr. Sie wird nur einmal berechnet, und der Monatspreis steigt bei Verlängerung nicht.