Servere dedicate Ryzen AI • Inferență fără placă grafică

Modelele mici rulează bine pe un aparat Ryzen AI. Ăsta e și scopul.

Nu orice volum de lucru merită o placă grafică. Un model cuantizat de dimensiuni modeste răspunde din memoria de sistem pe un aparat întreg doar al tău — runtime-ul tău, versiunile tale, root pe metal — fără să plătești pentru siliciu pe care sarcina l-ar lăsa nefolosit.

Transformă-ți GPU-urile în venit lunar pasiv.

Ai configurații de server sau desktop cu GPU nefolosite? Listează-le azi pe piața Primcast și câștigă chirii lunare constante de la echipe AI, dezvoltatori și întreprinderi care au nevoie de putere de calcul de nivel de producție.

Mergi la Marketplace

Unde e decizia corectă să sari peste placă

Același tipar de fiecare dată: modelul e mic, traficul e modest, iar datele trebuie să rămână pe un aparat care nu e al nimănui altcuiva.

Asistent privat pe documente interne
Un ajutor privat pe date private

Un model cuantizat mic care îți citește propriile documente pentru câțiva colegi. Corpusul nu atinge niciodată un endpoint partajat, iar costul lunar e un aparat, nu un contor.

Redactare în lot și rezumare
Ciorne, rezumate, rulări în lot

Rezumate nocturne, etichetare, rescriere — muncă ce stă la coadă. Acolo contează costul pe sarcină, nu milisecundele pe token, iar asta e sarcina pe care o placă grafică e cel mai mult irosită.

Unelte interne care apelează un model
Unelte care apelează un model în liniște

Rutare de tichete, triere de loguri, extragere într-o bază de date: un model mic în spatele unui endpoint intern, pornit toată ziua, la o rată fixă pe care foaia de finanțe o poate citi.

Evaluarea lanțului de unelte NPU
Testând roțile NPU-ului

Rulezi lanțul de unelte XDNA de la AMD pe siliciu real, închiriat lunar, înainte ca cineva să semneze pentru o flotă întreagă. Ce refuză să fie portat iese la iveală aici primul, și ieftin.

Compromisul, spus pe șleau

Aceste aparate sunt valoare cinstită pentru sarcina potrivită și achiziția greșită pentru cea nepotrivită. Iată linia dintre cele două.

Memoria e partea încăpătoare

Modelul trăiește în memoria proprie a aparatului, măsurată în zeci de gigaocteți, nu în alocarea unei plăci. Ce încape e rareori problema pe această pagină.

Lățimea de bandă e partea îngustă

Fiecare token generat recitește ponderile, iar memoria de sistem citește mai lent decât memoria plăcii. Un singur utilizator pe un model mic nu va deranja; o coadă de utilizatori va deranja. Nu publicăm nicio cifră de viteză — nici aici, nici altundeva — și spunem asta în schimb.

Întrebat înainte de a comanda unul

Patru răspunsuri cinstite — aceleași pe care le dau inginerii noștri pe chat.

Poate un server să ruleze cu adevărat un model de limbaj fără placă grafică?

Da, în limite care merită spuse de la început: un model cuantizat mic generează din memoria de sistem în ritmul citirii, ceea ce convine unui singur utilizator, unei unelte interne sau unei cozi de lot — și nu convine unei mulțimi. Câtă memorie are nevoie un anumit model și de ce unul care încape poate totuși să nu facă față e exact ce pagina noastră LLM calculează.

Rulează NPU-ul modelul meu?

Poate, prin lanțul de unelte Ryzen AI propriu al AMD — dar majoritatea runtime-urilor open-model pe care oamenii le implementează efectiv folosesc procesorul și Radeon-ul integrat în schimb, și preferăm să spunem asta aici decât să lăsăm o fișă de specificații să sugereze altceva. NPU-ul e pe cip oricum, și nimic nu te oprește să-l țintești.

Când merită în schimb un GPU dedicat?

Când modelul devine mai mare decât memoria, când mai multe persoane au nevoie de răspunsuri simultan sau când faci fine-tuning în loc să servești. Ryzen AI sau un GPU dedicat parcurge acea decizie, iar pagina GPU pune preț pe fiecare placă față de aparatul exact în care intră.

Se împarte ceva cu alți clienți?

Nu. Închiriezi întregul aparat: procesorul, grafica, NPU-ul, memoria, discul și portul aparțin unui singur client la un moment dat, fără hypervisor dedesubt. Asta e mare parte din ce cumpără suma lunară.