Modelul a depășit memoria
Greutățile care nu mai încap nu rulează lent — nu se încarcă deloc. Dincolo de ce ține memoria de sistem, răspunsul este o placă aleasă întâi după memorie, iar câtă memorie are nevoie un model este explicat pe pagina LLM.
O mașină Ryzen AI servește un model mic din propria memorie de sistem. Un GPU dedicat își justifică prețul în câteva momente bine definite. Această pagină este linia de demarcație dintre cele două, expusă clar.
Înainte de a pune preț pe o placă, merită să fie clar ce face o întreagă mașină Ryzen AI fără una — pentru că, pentru multă inferență, această listă este întreaga treabă.
Greutățile care nu mai încap nu rulează lent — nu se încarcă deloc. Dincolo de ce ține memoria de sistem, răspunsul este o placă aleasă întâi după memorie, iar câtă memorie are nevoie un model este explicat pe pagina LLM.
Servirea multor oameni deodată este scopul pentru care există lățimea de bandă a memoriei și batching-ul unei plăci. Acesta este punctul în care o coadă pe o mașină mică devine un argument pentru o placă dedicată.
Antrenarea ține greutățile, gradienții și starea optimizatorului în memorie deodată — de câteva ori mai mult decât are nevoie servirea. Acesta este teritoriul plăcilor și, uneori, mai mult de o placă.
Când ritmul răspunsului este ceea ce experimentează clientul tău, memoria mai rapidă a plăcii este soluția cinstită. O mașină mică este pentru sarcini care gândesc în secunde.