Multi-scheda e multi-nodo · Primcast LLC · dal 2004

Andare in largo non è lo stesso mestiere che andare in grande.

Una scheda in una macchina è una questione risolta, e ha un prezzo scheda per scheda sulla pagina GPU. Questa comincia dove quella finisce: una seconda scheda nello stesso chassis, o una seconda macchina accanto alla prima. Sembrano la stessa decisione e sono opposti — la piattaforma qui che dà a una scheda il maggior numero di corsie ha il tetto di rete più basso e sta nel minor numero di sale. Nessuno lo pubblica sul proprio catalogo. È la prima tabella qui sotto.

Confronta le piattaforme Cosa unisce due macchine

Ogni macchina è un solo tenant, ogni scheda è passata direttamente al tuo sistema operativo, e niente qui conta un byte tra i tuoi nodi.

Il registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Letto dal catalogo ordini quando questa pagina è stata servita, non digitato a mano. Cosa c'è in un rack stamattina è una domanda diversa, e server istantanei è dove trova risposta.

Trasforma le tue GPU in entrate mensili passive

Hai configurazioni GPU server o desktop inattive? Mettile oggi sul marketplace Primcast e guadagna affitti mensili costanti da team AI, sviluppatori e aziende che necessitano di calcolo di livello produttivo.

Vai al Marketplace

Due domande diverse

Quale stai davvero facendo?

Le persone arrivano qui avendo deciso “mi serve di più” senza aver deciso di più di cosa. Le due risposte costano in modo diverso, vengono consegnate in modo diverso e sono limitate da cose diverse, quindi vale la pena essere espliciti prima di leggere un'altra riga.

Più scheda in una macchina

Una seconda scheda nello stesso chassis

Ti manca memoria della scheda, o ti manca throughput, e tutto il resto della macchina va bene. Questa è una build che quotiamo piuttosto che una casella da spuntare nel checkout, perché quante schede ci stanno dipende dalla larghezza fisica della scheda specifica e dal budget di potenza dello chassis specifico — due fatti che non sono in un catalogo e su cui non tireremo a indovinare.

Cosa lo decide: la scheda, non la piattaforma. Chiedi indicando il componente e la risposta indica lo chassis, il numero e i tempi di consegna.

La cosa che la gente si aspetta e non ottiene: due schede non sono una scheda più grande. La loro memoria si somma solo se ciò che esegui può dividere un modello su entrambe — parallelismo tensoriale o a pipeline, che ogni runtime serio supporta e che ti costa un po' di throughput per il traffico tra loro. Per lavoro che è già molti job indipendenti, due schede sono semplicemente il doppio della macchina e non deve cambiare nulla.

Più macchine accanto

Una seconda macchina accanto alla prima

Hai esaurito la macchina piuttosto che la scheda: niente più socket, niente più memoria, niente più posto per il prossimo job. Sulle migliori piattaforme qui sotto, quel tetto è 2 sockets and 1 TB, e oltre uno di quelli la risposta è un altro server piuttosto che uno più grande.

Cosa lo decide: la sala e la porta. Due macchine che devono parlarsi devono essere nello stesso edificio, e ciò che le unisce è la porta su ciascuna di esse — comprata per macchina, quindi il fabric sotto quattro nodi sono quattro porte.

La cosa che la gente si aspetta e non ottiene: qui non c'è un prodotto cluster e nessun numero minimo di nodi. Ogni macchina è ordinata, fatturata, aggiornata e sostituita per conto proprio, ed è per questo che niente su questa pagina quota un prezzo di cluster — un cluster è n fatture.

Il compromesso

La piattaforma migliore per una di quelle è la peggiore per l'altra.

Ogni piattaforma a cui montiamo una scheda, sugli assi che decidono un cluster piuttosto che una singola macchina. Leggi insieme le due colonne centrali e l'intero argomento di questa pagina è in esse: si muovono in direzioni opposte. La generazione del bus è la stessa cifra che pubblica la pagina GPU, dalla stessa tabella, così le due pagine non possono contraddirsi su un collegamento.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Leggere quella tabella

  • Corsie verso la scheda decidono quanto velocemente i dati attraversano tra il processore e l'acceleratore. Conta in continuazione per un ciclo di addestramento che trasmette batch in streaming, per un render che alimenta dati di scena a ogni frame, e per qualsiasi cosa che trabocca dalla memoria della scheda. Smette di contare quasi del tutto una volta che un modello è residente e ci resta.
  • Tetto di rete decide quanto velocemente una macchina può parlare con la successiva. È irrilevante per un singolo server che fa il proprio lavoro ed è l'intera questione per un job diviso su più macchine.
  • Sale decide se la scelta è disponibile dove ti serve, ed è la colonna che la gente legge per ultima e dovrebbe leggere per prima — vedi sotto.
  • Quindi: un job che sta dentro una macchina e martella il bus vuole le corsie più larghe e non si cura della porta. Un job distribuito su più macchine vuole la porta e può convivere con un bus più vecchio. Volere entrambi insieme è l'unica combinazione che il nostro catalogo non contiene, e preferiamo dirlo qui piuttosto che dopo che hai pagato.

Quale scheda va in una di queste, e quanto aggiunge ciascuna al mese, è server dedicati GPU — ogni scheda che montiamo, prezzata contro la macchina esatta a cui appartiene la sua cifra. Questa pagina non prezza nessuna scheda, deliberatamente: una pagina possiede quei soldi.

Cosa le unisce

L'interconnessione si compra per macchina, ed è l'aritmetica che la gente sbaglia.

Una porta è una proprietà di un server. Quattro macchine a una data velocità sono quella velocità quattro volte, ogni mese, ed è la voce che trasforma un budget cluster comodo in uno scomodo. Qui sotto c'è la scala con la moltiplicazione già fatta, perché una pagina su più di una macchina che ti lascia fare da solo non sta facendo il suo lavoro.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Due cose che vale la pena notare prima di scegliere un piolo

  • La scala non è lineare, quindi un cluster più largo può costare meno di uno più veloce. Confronta i pioli tra loro piuttosto che contro niente: in diversi punti di quella tabella, due macchine un piolo più in basso costano meno di una macchina un piolo più in alto, e ti danno due macchine. Se sia un buon compromesso dipende interamente dal fatto che il tuo lavoro si divida.
  • La cima della scala non è su ogni piattaforma. La colonna di destra dice quante di esse raggiungono ciascuna velocità, e i pioli più veloci si restringono a una piattaforma che dà a una scheda un bus più vecchio. È lo stesso compromesso della tabella sopra, che arriva dall'altra direzione.

Cosa non abbiamo, detto chiaramente

Niente oltre una porta Ethernet tra macchine è nel nostro catalogo. Non c'è un fabric InfiniBand elencato e nessun ponte scheda-a-scheda elencato, e questa pagina non intende implicarne uno girandoci intorno. Se una build richiede uno dei due, chiedi prima di ordinare piuttosto che dopo: la risposta è un preventivo, e la risposta potrebbe essere no. Questo vale per te più di una pagina che lascia l'impressione che potrebbe essere sì.

Ogni velocità sopra è senza limiti in entrambe le direzioni, senza franchigia di trasferimento e senza voce di uscita su alcuna fattura — quindi ciò che i tuoi nodi si inviano è gratuito a qualsiasi volume, che è la parte che di solito è misurata altrove. Larghezza di banda senza limiti è la pagina per una porta considerata da sola, su una macchina.

Dove può esistere

Per una macchina scegli prima la piattaforma. Per diverse, scegli prima la sala.

Le macchine che devono parlarsi appartengono allo stesso edificio, e le nostre sale non contengono tutte le stesse piattaforme. Scegli prima la piattaforma e puoi scoprire che la sala in cui ti serve non la ospita. Questo è derivato dallo stesso catalogo di tutto il resto, quindi una linea che arriva in una nuova città appare qui da sola.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Dove si trova davvero l'edificio, a cosa è collegato e chi altro c'è dentro — data centre descrive tutti e cinque. La latenza tra due delle nostre città è un numero reale piuttosto che uno di marketing, e il supporto la misurerà per la tua coppia su richiesta invece di farti indovinare da una mappa.

Come viene quotato, e quanto presto esiste

Il lavoro multi-nodo viene datato prima di essere pagato, non dopo.

Una build di questo tipo è diverse macchine e spesso diverse parti che non sono su uno scaffale, quindi la cosa onesta da pubblicare non è una promessa di consegna ma la scala da cui esce la data — la stessa che usano build su ordinazione e la pagina GPU, con le stesse parole.

  1. ~30 minuti

    Le macchine sono già in rack così come sono

    Niente viene montato e niente viene spostato. Server istantanei è l'elenco di ciò che è lì in questo momento, e per un cluster di nodi ordinari vale la pena leggerlo prima.

  2. 4–24 ore

    Le parti sono quelle che teniamo

    Il caso ordinario. I tecnici montano le schede, costruiscono gli array e installano i sistemi operativi — per macchina, in parallelo, non una dopo l'altra.

  3. 5–10 giorni lavorativi

    Le parti devono essere acquistate

    Qualcosa nella specifica non è stock che teniamo. Lo ordiniamo, poi costruiamo. Questo è il piolo più comune per uno chassis multi-scheda, perché lo chassis di solito è il palo lungo piuttosto che la scheda.

  4. 10–15 giorni lavorativi

    Una parte è scarsa

    Gli acceleratori di generazione attuale funzionano su allocazione e la data è del distributore, non nostra. Indichiamo il palo lungo prima che ti impegni piuttosto che dopo. Dove l'hardware viene acquistato per un cliente chiediamo tre mesi in anticipo, perché è una macchina che non possiamo riaffittare se l'account chiude nella seconda settimana.

Ogni piolo parte quando l'ordine supera pagamento e revisione antifrode, che è l'unico passo su cui non metteremo una promessa — la maggior parte si sblocca entro un paio d'ore, e un primo ordine grande da un nuovo account può richiedere di più. Per una build di queste dimensioni un bonifico o una stablecoin di solito si sblocca più velocemente di una carta, il che è utile sapere prima che un controllo antifrode ritardi una visita al rack.

Descrivere una build multi-nodo o multi-scheda è più veloce in una frase che in un modulo. — il numero di nodi, se il lavoro si divide, e con cosa deve parlare — e qualcuno che ha già quotato una di queste risponderà, incluso quando la risposta è che basterebbe una macchina.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.