Un chatbot doar al tău
Rulează un model deschis precum Llama, Qwen sau Mistral pe un server pe care nu îl folosește nimeni altcineva. Solicitările, documentele și răspunsurile rămân pe mașina ta, în loc să ajungă la API-ul altcuiva.
NVIDIA CMP 170HX · deblocat când îl instalăm noi
NVIDIA a construit CMP 170HX pentru mining și a blocat restul: placa afișa 8 GB de memorie și rula calculele în virgulă mobilă extrem de lent. Blocajul s-a dovedit a fi software. Instalăm un driver care îl elimină, astfel încât serverul tău ajunge cu o placă ce are 64 GB de memorie foarte rapidă și rulează modele AI așa cum a fost proiectat cipul său.
Aceeași placă, același cip. Partea gri este ceea ce a lăsat NVIDIA activ; restul este ceea ce activează driverul.
La ce este bună acum
Rulează un model deschis precum Llama, Qwen sau Mistral pe un server pe care nu îl folosește nimeni altcineva. Solicitările, documentele și răspunsurile rămân pe mașina ta, în loc să ajungă la API-ul altcuiva.
Un model de 70 de miliarde de parametri încape pe o placă deblocată la 4 biți. Pe o placă care nu a fost deblocată, limita este un model de aproximativ 8 miliarde.
Ce nu folosește modelul se duce către contextul său, astfel încât documentele lungi și discuțiile lungi continuă în loc să rămână fără spațiu la jumătate.
Un model de chat, un model de embedding pentru căutare și un model mic care direcționează cererile pot rămâne toate încărcate împreună, în loc să facă cu rândul.
Un preț lunar fix și fără contor, pe placă sau pe lățime de bandă. Lasă un lot să ruleze peste weekend și factura nu se mișcă.
Doar ponderile, cu un sfert până la jumătate păstrat liber pentru conversația în sine. Ghidul complet de dimensionare este pe pagina noastră LLM.
Aceeași placă, înainte și după
LTT Labs a deblocat un CMP 170HX în septembrie 2026 și a rulat aceleași modele pe el în ambele moduri. Acestea sunt rezultatele lor, nu ale noastre. Vitezele variază în funcție de model și de software, așa că tratați-le ca pe dimensiunea saltului, nu ca pe un număr de care să ne legați.
Aceste cifre provin din articolul LTT Labs din septembrie 2026, care a rulat llama.cpp pe propria lor mașină de test. Deblocarea în sine este cmpunlocker, un proiect open-source al lui Amogh Munikote.
Ce se întâmplă după ce comanzi
Alege Ubuntu 22.04, 24.04 sau 26.04 în configurator. Deblocarea este un driver Linux, așa că aceasta este singura alegere care contează.
Placa este introdusă, Ubuntu este instalat, iar driverul deblocat este integrat pentru nucleul exact pe care îl va rula serverul tău.
Serverul este oprit complet și repornit, lucru de care are nevoie deblocarea, iar fiecare placă este verificată pentru întreaga memorie înainte ca serverul să fie predat.
Când Ubuntu instalează un nucleu nou, driverul se reconstruiește automat pentru a se potrivi. Tastează cmp-unlock status oricând vrei să vezi cum se comportă fiecare placă.
Merită știut înainte să cumperi
Cât costă
Cardul are propria linie pe factură, iar serverul alta, ca să vezi cât costă fiecare. Suma afișată reprezintă un card în cel mai mic server care îl acceptă. Adaugă memorie, discuri mai mari sau mai multe carduri în configurator și totalul se actualizează pe măsură ce modifici.
Există o taxă unică de instalare, deoarece cardul este montat conform comenzii tale. Lățimea de bandă este nelimitată, taxa de vânzare din SUA se adaugă la finalizarea comenzii acolo unde se aplică, iar prețul lunar rămâne același la reînnoire.
$272.67/month
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Întrebări
NVIDIA a vândut CMP 170HX ca placă de minat și a dezactivat cea mai mare parte a ei prin software: afișa 8 GB de memorie și făcea calcule în virgulă mobilă foarte lent. Un driver comunitar numit cmpunlocker reactivează acele componente. O placă deblocată are 64 GB de memorie și rulează la viteza cipului din interior, care este același cip ca la A100.
64 GB pe versiunea de 8 GB a plăcii, adică ceea ce vei vedea în nvidia-smi. Versiunea de 10 GB se deblochează la 40 GB, pentru că mai mult de atât nu este fiabil pe ea. Fără driverul deblocat, ambele afișează memoria cu care au fost livrate.
Nu. Comanzi serverul cu Ubuntu 22.04, 24.04 sau 26.04 și ajunge deblocat. Instalăm driverul, compilăm deblocarea pentru kernelul tău și verificăm fiecare placă înainte de a preda serverul.
Da. Driverul deblocat se încarcă de fiecare dată când pornește serverul, iar când Ubuntu instalează un kernel nou, deblocarea se reconstruiește singură pentru el. Dacă o placă afișează vreodată 8 GB, oprește și pornește serverul din panoul de control și spune-ne dacă asta nu rezolvă problema.
Orice creat pentru plăcile NVIDIA: PyTorch, llama.cpp, Ollama, vLLM și restul. Instalează setul de instrumente CUDA cu apt install cuda-toolkit. Evită pachetele numite cuda și cuda-drivers, care ar adăuga un al doilea driver; am configurat serverul să le refuze.
Poți, dar deblocarea există doar pentru Linux, așa că pe Windows placa rămâne la 8 GB cu limitele ei originale. Pentru orice necesită memoria, alege Ubuntu.
Până la patru. Două plăci deblocate au împreună 128 GB, suficient pentru un model de 70 de miliarde de parametri la 8 biți.
Da, deblocarea nu elimină nimic. Dacă minatul este totuși planul principal, pagina noastră de minat acoperă plăcile și costurile pentru asta.
Placa este montată conform comenzii tale, ceea ce face serverul o construcție personalizată, iar construcțiile personalizate au o taxă unică de configurare. Se percepe o singură dată, iar prețul lunar nu crește la reînnoire.