Multi-scheda e multi-nodo · Primcast LLC · dal 2004

Ampliare le dimensioni non è la stessa cosa che ingrandirle.

Una scheda video in una singola macchina è una questione ormai risolta, e il prezzo di ciascuna scheda è indicato nella pagina dedicata alle GPU. In questo caso, la situazione si pone dove finisce la questione: una seconda scheda nello stesso chassis, oppure una seconda macchina accanto alla prima. Sembrano la stessa decisione, ma in realtà sono l'opposto: la piattaforma che offre il maggior numero di linee di rete ha il limite di capacità di rete più basso e occupa meno spazio. Nessuno pubblica queste informazioni sul proprio catalogo. Sono riportate nella prima tabella qui sotto.

Confronta le piattaforme Cosa unisce due macchine?

Ogni macchina è un inquilino, ogni scheda passa attraverso il tuo sistema operativo e qui non c'è traccia di byte tra i tuoi nodi.

Il registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Leggete il catalogo degli ordini al momento della visualizzazione di questa pagina, non digitatelo. Cosa si trova in uno scaffale stamattina è un'altra questione, e i server di istantanea sono il luogo in cui trovare la risposta.

Due domande diverse

Quale stai chiedendo esattamente?

Le persone arrivano qui avendo deciso "Ho bisogno di di più", senza però aver deciso di cosa si tratti. Le due risposte hanno costi diversi, vengono fornite in modi diversi e sono limitate da fattori diversi, quindi è opportuno essere espliciti prima di proseguire.

Più schede in un unico dispositivo

Una seconda scheda nello stesso chassis

La memoria RAM è insufficiente o la velocità di trasferimento dati è inadeguata, mentre per il resto il computer funziona correttamente. Questa configurazione viene preventivata come opzione, non come scelta da effettuare al momento dell'acquisto, poiché il numero di schede compatibili dipende dalla larghezza fisica della scheda specifica e dal consumo energetico del case: due fattori non presenti in catalogo e che non ci permettiamo di stimare.

Ciò che lo determina è la scheda, non la piattaforma. Chiedi specificando il componente e la risposta indicherà lo chassis, la quantità e i tempi di consegna.

Ciò che le persone si aspettano e non ottengono è che due schede non sono una scheda più grande. La loro memoria si somma solo se il programma in esecuzione può suddividere un modello su entrambe, tramite parallelismo tensoriale o pipeline, supportato da ogni runtime serio, il che comporta una perdita di throughput per il traffico tra le schede. Per un lavoro che consiste già in molti processi indipendenti, due schede significano semplicemente il doppio della potenza di calcolo e non è necessario apportare alcuna modifica.

Altre macchine accanto

Una seconda macchina accanto alla prima

Il problema non è la scheda video, ma la macchina: non ci sono più socket, non c'è più memoria, non c'è più spazio per il prossimo lavoro. Sulle migliori piattaforme elencate di seguito, il limite massimo è 2 sockets and 1 TB , e oltre questi la soluzione è un altro server, non uno più potente.

Ciò che fa la differenza: la stanza e la porta. Due macchine che devono comunicare tra loro devono trovarsi nello stesso edificio, e ciò che le collega è la porta presente su ciascuna di esse, acquistata per ogni macchina, quindi la struttura sotto quattro nodi è composta da quattro porte.

Ciò che le persone si aspettano e non ottengono è che non esiste un prodotto cluster e non c'è un numero minimo di nodi. Ogni macchina viene ordinata, fatturata, aggiornata e sostituita singolarmente, motivo per cui in questa pagina non viene indicato alcun prezzo per cluster: un cluster corrisponde a n fatture.

Il commercio

La piattaforma eccelle in uno di questi aspetti, ma è la peggiore nell'altro.

Ogni piattaforma su cui installiamo una scheda, sugli assi che definiscono un cluster piuttosto che una singola macchina. Leggendo insieme le due colonne centrali, si comprende l'intera argomentazione di questa pagina: si muovono in direzioni opposte. La generazione del bus è la stessa cifra pubblicata nella pagina GPU, dalla stessa tabella, quindi le due pagine non possono essere in disaccordo su un collegamento.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Leggendo quella tabella

  • Le linee di comunicazione con la scheda determinano la velocità con cui i dati vengono trasferiti tra il processore e l'acceleratore. Questo aspetto è fondamentale in modo continuo per un ciclo di addestramento che elabora batch di dati, per un rendering che fornisce dati di scena a ogni fotogramma e per qualsiasi operazione che avvenga al di fuori della memoria della scheda. La sua importanza diminuisce quasi del tutto una volta che un modello è residente nella scheda e vi rimane.
  • La velocità massima di rete determina la velocità con cui una macchina può comunicare con un'altra. È irrilevante per un singolo server che svolge il proprio lavoro, ma rappresenta il fattore determinante per un'attività suddivisa tra più server.
  • La sezione "Camere" decide se la scelta è disponibile dove ne hai bisogno, ed è la colonna che le persone leggono per ultima, ma che dovrebbero leggere per prima (vedi sotto).
  • Quindi: un lavoro che si adatta a una sola macchina e sfrutta al massimo l'autobus richiede le corsie più larghe e non si preoccupa del porto. Un lavoro distribuito su più macchine richiede il porto e può accontentarsi di un autobus più vecchio. Volere entrambe le cose contemporaneamente è l'unica combinazione che il nostro catalogo non prevede, e preferiamo dirlo subito piuttosto che dopo che avrete pagato.

Quale scheda video si adatti a ciascuna di queste configurazioni e quanto ognuna di esse aggiunga al mese, è spiegato nei server dedicati GPU : ogni scheda che installiamo, con il relativo prezzo, viene calcolata in base alla specifica macchina a cui appartiene. Questa pagina non riporta il prezzo di alcuna scheda, volutamente: quel denaro è gestito da un'altra pagina.

Ciò che li unisce

L'interconnessione si acquista per ogni singola macchina, ed è proprio in questo calcolo che molti sbagliano.

Una porta è una proprietà di un singolo server. Quattro macchine su una determinata velocità significano quella velocità quattro volte al mese, ed è la voce di spesa che trasforma un budget per cluster confortevole in uno scomodo. Di seguito è riportata la tabella con la moltiplicazione già eseguita, perché una pagina che parla di più di una macchina e ti lascia il compito di farla tu non sta svolgendo il suo compito.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Due cose da notare prima di scegliere un gradino

  • La progressione non è lineare, quindi un cluster più ampio può risultare più economico di uno più veloce. Confronta i vari livelli tra loro, anziché con niente: in diversi punti di quella tabella, due macchine di un livello inferiore costano meno di una macchina di un livello superiore e ti offrono due macchine. Se si tratti di un buon affare dipende interamente dalla suddivisione del tuo carico di lavoro.
  • La cima della scala non si trova su ogni piattaforma. La colonna di destra indica quante raggiungono ciascuna velocità, e i gradini più veloci si restringono fino a una piattaforma che dà accesso a un autobus più vecchio. Si tratta dello stesso scambio della tabella sopra, arrivando dalla direzione opposta.

Ciò che non abbiamo, detto chiaramente

Nel nostro catalogo non è presente nulla di più di una porta Ethernet tra le macchine. Non è elencata alcuna interfaccia InfiniBand né alcun bridge scheda-scheda, e questa pagina non intende in alcun modo suggerirne l'esistenza. Se la configurazione richiede uno di questi componenti, è consigliabile richiederlo prima di effettuare l'ordine: la risposta richiederà un preventivo, e potrebbe essere negativa. Questo preventivo è più importante di una pagina che lascia intendere una risposta affermativa.

Tutte le velocità sopra indicate non prevedono alcun costo in entrambe le direzioni, né limiti di trasferimento né costi in uscita su alcuna fattura: ciò significa che lo scambio di dati tra i nodi è gratuito a qualsiasi volume, a differenza della parte che solitamente viene misurata altrove. La larghezza di banda illimitata si riferisce a una porta considerata singolarmente, su una singola macchina.

Dove può esistere

Per una singola macchina, si sceglie prima la piattaforma. Per più macchine, si sceglie prima la stanza.

Le macchine che devono comunicare tra loro appartengono allo stesso edificio e le nostre stanze non contengono tutte le stesse piattaforme. Selezionando prima la piattaforma, potresti scoprire che la stanza in cui ti serve non la contiene. Questo deriva dallo stesso catalogo di tutto il resto, quindi una linea in arrivo in una nuova città appare qui da sola.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Dove si trova effettivamente l'edificio, a cosa è collegato e chi altro lo occupa: i data center descrivono tutti e cinque questi aspetti. La latenza tra due delle nostre città è un dato reale, non un semplice dato di marketing, e il supporto la misurerà per la vostra coppia di città su richiesta, anziché lasciarvi fare delle stime basandovi su una mappa.

Come viene citato e quanto presto esiste

Il lavoro multi-nodo viene datato prima del pagamento, non dopo.

Una configurazione di questo tipo richiede diverse macchine e spesso diversi componenti che non sono disponibili a magazzino, quindi la cosa onesta da pubblicare non è una promessa di consegna, ma la data di consegna effettiva: la stessa configurazione "su ordinazione" e la pagina relativa all'utilizzo della GPU, con le stesse parole.

  1. circa 30 minuti

    Le macchine sono già montate su rack così come sono

    Nulla è installato e nulla è stato spostato. Instant Servers è l'elenco di ciò che è presente al momento e, per un cluster di nodi ordinari, vale la pena leggerlo per primo.

  2. 4–24 ore

    Le parti sono quelle che teniamo

    Il caso ordinario. I tecnici montano le schede, assemblano gli array e installano i sistemi operativi, macchina per macchina, in parallelo, non uno dopo l'altro.

  3. 5-10 giorni lavorativi

    I pezzi devono essere acquistati

    Un componente presente nelle specifiche non è disponibile a magazzino. Lo ordiniamo e poi lo assembliamo. Questo è il passaggio più comune per uno chassis multi-scheda, perché lo chassis è solitamente il palo più lungo, non la scheda.

  4. 10-15 giorni lavorativi

    Una parte è scarsa

    Gli acceleratori di ultima generazione funzionano con assegnazione e la data è quella del distributore, non nostra. Definiamo il long pole prima che vi impegniate, non dopo. Quando l'hardware viene acquistato per un singolo cliente, richiediamo un pagamento anticipato di tre mesi, perché si tratta di una macchina che non possiamo riaffittare se il contratto viene chiuso dopo due settimane.

Ogni passaggio inizia quando il pagamento e la verifica antifrode dell'ordine vengono approvati, ed è proprio su questo passaggio che non possiamo dare garanzie: la maggior parte delle transazioni viene elaborata entro un paio d'ore, ma un primo ordine consistente da un nuovo account potrebbe richiedere più tempo. Per un ordine di queste dimensioni, un bonifico bancario o una stablecoin vengono generalmente elaborati più velocemente di una carta di credito, un dettaglio da tenere presente prima che un controllo antifrode ritardi l'accesso al rack.

Descrivere una configurazione multi-nodo o multi-scheda è più veloce in una frase che in un modulo. (il numero di nodi, se il lavoro viene suddiviso e con cosa deve comunicare) e qualcuno che ha già affrontato un progetto simile saprà risponderti, anche quando la soluzione è che una sola macchina sia sufficiente.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.