Multi-card și multi-node · Primcast LLC · din 2004

A merge pe lățime nu este același lucru cu a merge pe înălțime.

Un card într-o singură mașină este o întrebare rezolvată, iar prețul este stabilit card cu card pe pagina GPU. Aceasta începe acolo unde cealaltă se oprește: un al doilea card în același șasiu sau o a doua mașină lângă prima. Sună ca aceeași decizie, dar sunt opuse — platforma de aici care oferă unui card cele mai multe benzi are cel mai scăzut plafon de rețea și se află în cele mai puține camere. Nimeni nu publică asta despre propriul catalog. Este primul tabel de mai jos.

Compară platformele Ce leagă două mașini

Fiecare mașină este un singur chiriaș, fiecare card este pasat către propriul tău sistem de operare, iar nimic de aici nu numără un singur octet între nodurile tale.

Registrul

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Citit din catalogul de comenzi în momentul servirii acestei pagini, nu tastat manual. Ce se află într-un rack în această dimineață este o altă întrebare, iar serverele instant este locul unde primește răspuns.

Transformă-ți GPU-urile în venit lunar pasiv

Ai configurații de GPU-uri de server sau desktop nefolosite? Listează-le astăzi pe marketplace-ul Primcast și câștigă chirii lunare constante de la echipe de AI, dezvoltatori și întreprinderi care au nevoie de putere de calcul de nivel de producție.

Mergi la Marketplace

Două întrebări diferite

Pe care o pui de fapt?

Oamenii ajung aici după ce au decis “am nevoie de mai mult” fără să fi decis mai mult din ce. Cele două răspunsuri costă diferit, sunt livrate diferit și sunt limitate de lucruri diferite, așa că merită să fii explicit înainte de a citi un alt rând.

Mai mult card într-o singură mașină

Un al doilea card în același șasiu

Duc lipsă de memorie de card sau de debit, iar restul mașinii este în regulă. Aceasta este o configurație pe care o cotăm, nu o bifă pe care o bifezi la checkout, pentru că numărul de carduri care încap depinde de lățimea fizică a cardului specific și de bugetul de putere al șasiului specific — două fapte care nu se află într-un catalog și pe care nu le vom ghici.

Ce decide: cardul, nu platforma. Întreabă cu piesa numită, iar răspunsul numește șasiul, numărul și termenul de livrare.

Lucrul pe care oamenii îl așteaptă și nu îl primesc: două carduri nu sunt un card mai mare. Memoria lor se adună doar dacă ceea ce rulezi poate împărți un model pe ambele — paralelism tensor sau pipeline, pe care orice runtime serios îl suportă și care te costă ceva debit pentru traficul dintre ele. Pentru lucrări care sunt deja multe joburi independente, două carduri sunt pur și simplu de două ori mașina și nimic nu trebuie să se schimbe.

Mai multe mașini lângă ea

O a doua mașină lângă prima

Ai rămas fără mașină, nu fără card: fără socluri, fără memorie, fără un loc unde să pui următorul job. Pe cea mai bună dintre platformele de mai jos, acel plafon este 2 sockets and 1 TB, iar dincolo de oricare dintre acestea răspunsul este un alt server, nu unul mai mare.

Ce decide: camera și portul. Două mașini care trebuie să comunice între ele trebuie să fie în aceeași clădire, iar ceea ce le leagă este portul de pe fiecare dintre ele — cumpărat per mașină, deci fabricul de sub patru noduri înseamnă patru porturi.

Lucrul pe care oamenii îl așteaptă și nu îl primesc: nu există niciun produs de cluster aici și niciun număr minim de noduri. Fiecare mașină este comandată, facturată, actualizată și înlocuită individual, motiv pentru care nimic de pe această pagină nu cotează un preț de cluster — un cluster înseamnă n facturi.

Compromisul

Platforma cea mai bună la una dintre acestea este cea mai slabă la cealaltă.

Fiecare platformă pe care montăm un card, pe axele care decid un cluster, nu o singură mașină. Citește cele două coloane din mijloc împreună și întregul argument al acestei pagini este în ele: se mișcă în direcții opuse. Generația de magistrală este aceeași cifră pe care o publică pagina GPU, din același tabel, astfel încât cele două pagini nu pot să se contrazică în privința unei legături.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Cum citești acel tabel

  • Benzile către card decid cât de repede traversează datele între procesor și accelerator. Contează continuu pentru o buclă de antrenament care transmite loturi în flux, pentru un randare care alimentează date de scenă la fiecare cadru și pentru orice se revarsă din memoria cardului. Aproape că nu mai contează deloc odată ce un model este rezident și rămâne acolo.
  • Plafonul de rețea decide cât de repede poate comunica o mașină cu următoarea. Este irelevant pentru un singur server care își face propria treabă și este întreaga întrebare pentru un job împărțit pe mai multe.
  • Camerele decid dacă opțiunea este disponibilă acolo unde ai nevoie de ea, și este coloana pe care oamenii o citesc ultima și ar trebui să o citească prima — vezi mai jos.
  • Așadar: un job care încape într-o singură mașină și solicită magistrala vrea cele mai late benzi și nu îi pasă de port. Un job distribuit pe mai multe mașini vrea portul și poate trăi cu o magistrală mai veche. A le dori pe amândouă simultan este singura combinație pe care catalogul nostru nu o conține, și preferăm să o spunem aici decât după ce ai plătit.

Ce card intră în oricare dintre acestea și cât adaugă fiecare pe lună este servere dedicate GPU — fiecare card pe care îl montăm, cu prețul raportat la mașina exactă căreia îi aparține cifra. Această pagină nu cotează niciun card, în mod deliberat: o singură pagină deține acei bani.

Ce le leagă

Interconectarea se cumpără per mașină, iar aceasta este aritmetica pe care oamenii o greșesc.

Un port este o proprietate a unui singur server. Patru mașini la o viteză dată înseamnă acea viteză de patru ori, în fiecare lună, și este elementul de linie care transformă un buget confortabil de cluster într-unul inconfortabil. Mai jos este scara cu înmulțirea deja făcută, pentru că o pagină despre mai mult de o mașină care te lasă să o faci singur nu își face treaba.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Două lucruri care merită observate înainte de a alege o treaptă

  • Scara nu este liniară, deci un cluster mai lat poate fi mai ieftin decât unul mai rapid. Compară treptele între ele, nu cu nimic: în mai multe puncte de pe acel tabel, două mașini cu o treaptă mai jos costă mai puțin decât o mașină cu o treaptă mai sus și îți oferă două mașini. Dacă acesta este un compromis bun depinde în întregime de faptul dacă lucrarea ta se împarte.
  • Vârful scării nu este pe fiecare platformă. Coloana din dreapta spune câte dintre ele ating fiecare viteză, iar treptele cele mai rapide se îngustează către o platformă care oferă unui card o magistrală mai veche. Acesta este același compromis ca tabelul de mai sus, sosind din cealaltă direcție.

Ce nu avem, spus pe șleau

Nimic dincolo de un port Ethernet între mașini nu se află în catalogul nostru. Nu există niciun fabric InfiniBand listat și nicio punte card-la-card listată, iar această pagină nu va sugera una scriind în jurul ei. Dacă o configurație are nevoie de oricare dintre ele, întreabă înainte de a comanda, nu după: răspunsul este o ofertă, iar răspunsul poate fi nu. Asta valorează mai mult pentru tine decât o pagină care lasă impresia că ar putea fi da.

Fiecare viteză de mai sus este nemăsurată în ambele direcții, fără nicio limită de transfer și fără nicio linie de ieșire pe nicio factură — deci ceea ce nodurile tale își trimit între ele este gratuit la orice volum, ceea ce este partea care de obicei este măsurată în altă parte. Lățime de bandă nemăsurată este pagina pentru un port considerat de sine stătător, pe o singură mașină.

Unde poate exista

Pentru o singură mașină alegi mai întâi platforma. Pentru mai multe, alege mai întâi camera.

Mașinile care trebuie să comunice între ele aparțin aceleiași clădiri, iar camerele noastre nu conțin toate aceleași platforme. Alege mai întâi platforma și poți descoperi că camera în care ai nevoie de ea nu o are. Aceasta este derivată din același catalog ca orice altceva, deci o linie care sosește într-un oraș nou apare aici de la sine.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Unde se află de fapt clădirea, la ce este conectată și cine mai este în ea — centrele de date descriu toate cele cinci. Latența dintre două dintre orașele noastre este un număr real, nu unul de marketing, iar suportul o va măsura pentru perechea ta la cerere, în loc să te lase să ghicești de pe o hartă.

Cum se cotează și cât de curând există

Lucrarea multi-node este datată înainte de a fi plătită, nu după.

O configurație de acest fel înseamnă mai multe mașini și adesea mai multe piese care nu sunt pe un raft, deci lucrul cinstit de publicat nu este o promisiune de livrare, ci scara de pe care coboară data — aceeași pe care o folosesc construirea la comandă și pagina GPU, în aceleași cuvinte.

  1. ~30 de minute

    Mașinile sunt deja în rack așa cum sunt

    Nimic nu este montat și nimic nu este mutat. Servere instant este lista cu ceea ce se află acolo chiar acum, iar pentru un cluster de noduri obișnuite merită citită mai întâi.

  2. 4–24 de ore

    Piesele sunt unele pe care le deținem

    Cazul obișnuit. Tehnicienii montează cardurile, construiesc array-urile și instalează sistemele de operare — per mașină, în paralel, nu una după alta.

  3. 5–10 zile lucrătoare

    Piesele trebuie cumpărate

    Ceva din specificație nu este stoc pe care îl deținem. Îl comandăm, apoi construim. Aceasta este treapta cea mai frecventă pentru un șasiu multi-card, pentru că șasiul este de obicei elementul critic, nu cardul.

  4. 10–15 zile lucrătoare

    O piesă este rară

    Acceleratoarele din generația curentă funcționează pe alocare, iar data este a distribuitorului, nu a noastră. Numim elementul critic înainte să te angajezi, nu după. Acolo unde hardware-ul este cumpărat pentru un singur client, cerem trei luni în avans, pentru că este o mașină pe care nu o putem reînchiria dacă contul se închide în a doua săptămână.

Fiecare treaptă începe când comanda trece de plată și de verificarea antifraudă, care este singurul pas pentru care nu vom face o promisiune — majoritatea se validează în câteva ore, iar o primă comandă mare de la un cont nou poate dura mai mult. Pentru o configurație de această dimensiune, un transfer bancar sau un stablecoin se validează de obicei mai repede decât un card, ceea ce merită știut înainte ca o verificare antifraudă să întârzie o vizită la rack.

Descrierea unei configurații multi-node sau multi-card este mai rapidă într-o propoziție decât într-un formular. — numărul de noduri, dacă lucrarea se împarte și cu ce trebuie să comunice — și cineva care a cotat deja una dintre acestea va răspunde, inclusiv atunci când răspunsul este că o singură mașină ar fi suficientă.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.