Ryzen AI dedicated sunucular • Ekran kartı olmadan çıkarım

Küçük modeller bir Ryzen AI makinede gayet iyi çalışır. Mesele de bu.

Her iş yükü bir ekran kartını hak etmez. Mütevazı boyutta nicemlenmiş bir model, kendine ait bütün bir makinede sistem belleğinden yanıt verir — sizin çalışma zamanınız, sizin sürümleriniz, metal üzerinde root — işin boşta bırakacağı silikona para ödemeden.

GPU'larınızı pasif aylık gelire dönüştürün.

Atıl sunucu veya masaüstü GPU kurulumlarınız mı var? Bugün Primcast pazarında listeleyin ve yapay zeka ekiplerinden, geliştiricilerden ve üretim düzeyinde işlem gücüne ihtiyaç duyan kuruluşlardan düzenli aylık kira kazanın.

Pazara Git

Kartı atlamanın doğru karar olduğu yerler

Her seferinde aynı örüntü: model küçük, trafik mütevazı ve veriler başka kimsenin olmayan bir makinede kalmak zorunda.

Dahili belgeler üzerinde özel asistan
Özel veriler üzerinde özel bir yardımcı

Bir avuç meslektaş için kendi belgelerinizi okuyan küçük nicemlenmiş bir model. Derlem asla paylaşılan bir uç noktaya dokunmaz ve aylık maliyet bir makinedir, bir sayaç değil.

Toplu taslak yazma ve özetleme
Taslaklar, özetler, toplu çalıştırmalar

Gece özetleri, etiketleme, yeniden yazma — kuyruğa giren işler. Orada önemli olan iş başına maliyettir, token başına milisaniye değil ve bu, bir ekran kartının en çok israf edildiği iş yüküdür.

Bir modeli çağıran dahili araçlar
Sessizce bir modeli çağıran araçlar

Bilet yönlendirme, günlük ayıklama, veritabanına çıkarım: dahili bir uç noktanın arkasında, tüm gün açık, finans tablosunun okuyabileceği sabit bir ücretle çalışan küçük bir model.

NPU araç zincirini değerlendirme
NPU'nun lastiklerini tekmelemek

AMD'nin XDNA araç zincirini gerçek silikon üzerinde, aylık kiralayarak, kimse bir filo için imza atmadan önce çalıştırmak. Taşınmayı reddeden şey ilk burada ve ucuza ortaya çıkar.

Takas, açıkça ifade edildi

Bu makineler doğru iş yükü için dürüst bir değer, yanlış iş yükü için yanlış bir satın alımdır. İşte ikisi arasındaki çizgi.

Bellek geniş olan kısımdır

Model, makinenin kendi belleğinde yaşar; bir kartın payından ziyade düzinelerce gigabaytla ölçülür. Bu sayfada sığmayan şey nadiren sorundur.

Bant genişliği dar olan kısımdır

Üretilen her token ağırlıkları yeniden okur ve sistem belleği kart belleğinden daha yavaş okur. Küçük bir modelde tek bir kullanıcı bunu umursamaz; bir kullanıcı kuyruğu umursar. Hiçbir hız rakamı yayınlamıyoruz — ne burada ne başka yerde — ve onun yerine şunu söylüyoruz.

Sipariş vermeden önce sorulanlar

Dört dürüst yanıt — mühendislerimizin sohbette verdiği yanıtların aynısı.

Bir sunucu gerçekten ekran kartı olmadan bir dil modeli çalıştırabilir mi?

Evet, baştan belirtmeye değer sınırlar dahilinde: küçük nicemlenmiş bir model sistem belleğinden okuma hızında üretir; bu tek bir kullanıcıya, dahili bir araca veya toplu bir kuyruğa uyar — ve bir kalabalığa uymaz. Belirli bir modelin ne kadar belleğe ihtiyaç duyduğu ve sığan bir modelin neden yine de hizmet veremeyebileceği tam olarak LLM sayfamızın işlediği konudur.

NPU modelimi çalıştırır mı?

Çalıştırabilir, AMD'nin kendi Ryzen AI araç zinciri aracılığıyla — ancak insanların gerçekte dağıttığı açık model çalışma zamanlarının çoğu bunun yerine işlemciyi ve tümleşik Radeon'u kullanır ve bir teknik özellik tablosunun aksini ima etmesine izin vermektense bunu burada söylemeyi tercih ederiz. NPU her iki durumda da çip üzerindedir ve onu hedeflemenizi engelleyen hiçbir şey yoktur.

Bunun yerine özel bir GPU ne zaman değer?

Model bellekten büyüdüğünde, birkaç kişi aynı anda yanıt istediğinde veya hizmet vermek yerine ince ayar yaptığınızda. Ryzen AI mı yoksa özel bir GPU mu bu kararı yürütür ve GPU sayfası her kartı tam olarak girdiği makineye göre fiyatlandırır.

Bunların herhangi biri diğer müşterilerle paylaşılıyor mu?

Hayır. Bütün makineyi kiralarsınız: işlemci, grafik, NPU, bellek, disk ve bağlantı noktası aynı anda tek bir müşteriye aittir, altında hipervizör olmadan. Aylık rakamın satın aldığı şeyin büyük kısmı budur.