Serwery dedykowane Ryzen AI • Wnioskowanie bez karty graficznej

Małe modele działają dobrze na maszynie Ryzen AI. I o to chodzi.

Nie każde obciążenie zasługuje na kartę graficzną. Skwantowany model o skromnych rozmiarach odpowiada z pamięci systemowej na całej maszynie tylko dla Ciebie — Twoje środowisko uruchomieniowe, Twoje wersje, root na sprzęcie — bez płacenia za krzem, który zadanie pozostawiłoby bezczynnym.

Zamień swoje GPU w pasywny miesięczny przychód.

Masz nieużywane serwerowe lub desktopowe zestawy GPU? Wystaw je już dziś na marketplace Primcast i zarabiaj stały miesięczny czynsz od zespołów AI, deweloperów i przedsiębiorstw potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace

Kiedy pominięcie karty to właściwa decyzja

Za każdym razem ten sam wzorzec: model jest mały, ruch skromny, a dane muszą pozostać na maszynie, która nie należy do nikogo innego.

Prywatny asystent na dokumentach wewnętrznych
Prywatny pomocnik na prywatnych danych

Mały skwantowany model czytający Twoje własne dokumenty dla garstki współpracowników. Korpus nigdy nie trafia na współdzielony endpoint, a miesięczny koszt to maszyna, nie licznik.

Wsadowe szkicowanie i streszczanie
Szkice, streszczenia, przebiegi wsadowe

Nocne streszczenia, tagowanie, przepisywanie — praca, która czeka w kolejce. Liczy się tam koszt zadania, nie milisekundy na token, a to obciążenie, na którym karta graficzna marnuje się najbardziej.

Narzędzia wewnętrzne wywołujące model
Narzędzia, które cicho wywołują model

Kierowanie zgłoszeń, segregacja logów, ekstrakcja do bazy danych: mały model za wewnętrznym endpointem, włączony cały dzień, za stałą stawkę, którą dział finansów może przeczytać.

Testowanie łańcucha narzędzi NPU
Sprawdzanie NPU w praktyce

Uruchamianie łańcucha narzędzi XDNA AMD na prawdziwym krzemie, wynajmowanym miesięcznie, zanim ktokolwiek podpisze zamówienie na całą flotę. To, co nie daje się przenieść, wychodzi na jaw tutaj, i to tanio.

Kompromis, powiedziany wprost

Te maszyny to uczciwa wartość dla właściwego obciążenia i zły zakup dla niewłaściwego. Oto granica między jednym a drugim.

Pamięć to przestronna część

Model żyje w pamięci własnej maszyny, mierzonej w dziesiątkach gigabajtów, a nie w przydziale karty. To, co się mieści, rzadko bywa problemem na tej stronie.

Przepustowość to wąska część

Każdy wygenerowany token ponownie odczytuje wagi, a pamięć systemowa czyta wolniej niż pamięć karty. Jednemu użytkownikowi na małym modelu to nie przeszkodzi; kolejce użytkowników owszem. Nie publikujemy żadnej liczby prędkości — ani tutaj, ani nigdzie — i zamiast tego mówimy to.

Pytania przed zamówieniem

Cztery szczere odpowiedzi — te same, których nasi inżynierowie udzielają na czacie.

Czy serwer naprawdę może uruchomić model językowy bez karty graficznej?

Tak, w granicach, które warto podać od razu: mały skwantowany model generuje z pamięci systemowej w tempie odczytu, co pasuje do jednego użytkownika, wewnętrznego narzędzia lub kolejki wsadowej — i nie pasuje do tłumu. Ile pamięci potrzebuje dany model i dlaczego ten, który się mieści, wciąż może nie obsłużyć ruchu, dokładnie rozpracowuje nasza strona LLM.

Czy NPU uruchomi mój model?

Może, przez własny łańcuch narzędzi Ryzen AI AMD — ale większość środowisk uruchomieniowych dla modeli otwartych, które ludzie faktycznie wdrażają, używa zamiast tego procesora i zintegrowanego Radeona, i wolimy powiedzieć to tutaj, niż pozwolić, by specyfikacja sugerowała co innego. NPU i tak jest w układzie i nic nie stoi na przeszkodzie, by go wykorzystać.

Kiedy zamiast tego opłaca się dedykowane GPU?

Gdy model robi się większy niż pamięć, gdy kilka osób potrzebuje odpowiedzi naraz albo gdy dostrajasz, zamiast serwować. Ryzen AI czy dedykowane GPU przeprowadza przez tę decyzję, a strona GPU wycenia każdą kartę przy dokładnej maszynie, do której trafia.

Czy cokolwiek jest współdzielone z innymi klientami?

Nie. Wynajmujesz całą maszynę: procesor, grafika, NPU, pamięć, dysk i port należą w danym momencie do jednego klienta, bez hipernadzorcy pod spodem. To duża część tego, za co płaci miesięczna kwota.