Multi-Karte und Multi-Node · Primcast LLC · seit 2004

In die Breite zu gehen ist nicht derselbe Handel wie in die Größe zu gehen.

Eine Karte in einer Maschine ist eine geklärte Frage, und sie wird Karte für Karte auf der GPU-Seite bepreist. Diese hier beginnt dort, wo jene aufhört: eine zweite Karte im selben Gehäuse oder eine zweite Maschine neben der ersten. Sie klingen nach derselben Entscheidung und sind Gegensätze — die Plattform hier, die einer Karte die meisten Lanes gibt, hat die niedrigste Netzwerk-Obergrenze und steht in den wenigsten Räumen. Niemand veröffentlicht das über den eigenen Katalog. Es ist die erste Tabelle unten.

Plattformen vergleichen Was zwei Maschinen verbindet

Jede Maschine ist ein einzelner Mieter, jede Karte wird an Ihr eigenes Betriebssystem durchgereicht, und nichts hier zählt ein Byte zwischen Ihren Nodes.

Das Register

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Aus dem Bestellkatalog gelesen, als diese Seite ausgeliefert wurde, nicht eingetippt. Was heute Morgen in einem Rack steht, ist eine andere Frage, und Instant-Server ist der Ort, an dem sie beantwortet wird.

Verwandeln Sie Ihre GPUs in passives monatliches Einkommen

Haben Sie ungenutzte Server- oder Desktop-GPU-Setups? Listen Sie sie noch heute auf dem Primcast-Marktplatz und erzielen Sie stetige monatliche Mieteinnahmen von KI-Teams, Entwicklern und Unternehmen, die Compute in Produktionsqualität benötigen.

Zum Marktplatz

Zwei verschiedene Fragen

Welche stellen Sie eigentlich?

Die Leute kommen hierher, nachdem sie beschlossen haben “Ich brauche mehr”, ohne entschieden zu haben, mehr wovon. Die beiden Antworten kosten unterschiedlich, werden unterschiedlich geliefert und sind durch unterschiedliche Dinge begrenzt, daher lohnt es sich, explizit zu sein, bevor man eine weitere Zeile liest.

Mehr Karte in einer Maschine

Eine zweite Karte im selben Gehäuse

Ihnen fehlt Karten-Speicher oder Durchsatz, und alles andere an der Maschine ist in Ordnung. Dies ist ein Build, den wir anbieten, statt ein Kästchen, das Sie im Checkout ankreuzen, denn wie viele Karten passen, hängt von der physischen Breite der jeweiligen Karte und vom Leistungsbudget des jeweiligen Gehäuses ab — zwei Fakten, die nicht in einem Katalog stehen und die wir nicht erraten werden.

Was darüber entscheidet: die Karte, nicht die Plattform. Fragen Sie mit dem benannten Teil, und die Antwort nennt das Gehäuse, die Anzahl und die Lieferzeit.

Was die Leute erwarten und nicht bekommen: zwei Karten sind nicht eine größere Karte. Ihr Speicher addiert sich nur, wenn das, was Sie ausführen, ein Modell über beide aufteilen kann — Tensor- oder Pipeline-Parallelität, die jede ernsthafte Laufzeit unterstützt und die Sie etwas Durchsatz für den Verkehr zwischen ihnen kostet. Für Arbeit, die bereits viele unabhängige Jobs umfasst, sind zwei Karten schlicht die doppelte Maschine, und nichts muss sich ändern.

Mehr Maschinen daneben

Eine zweite Maschine neben der ersten

Ihnen ist die Maschine ausgegangen, nicht die Karte: keine Sockets mehr, kein Speicher mehr, kein Platz mehr für den nächsten Job. Auf der besten der unten genannten Plattformen liegt diese Obergrenze bei 2 sockets and 1 TB, und jenseits von beidem ist die Antwort ein weiterer Server statt eines größeren.

Was darüber entscheidet: der Raum und der Port. Zwei Maschinen, die miteinander sprechen müssen, müssen im selben Gebäude stehen, und was sie verbindet, ist der Port an jeder von ihnen — pro Maschine gekauft, also ist das Fabric unter vier Nodes vier Ports.

Was die Leute erwarten und nicht bekommen: Es gibt hier kein Cluster-Produkt und keine Mindestanzahl an Nodes. Jede Maschine wird einzeln bestellt, abgerechnet, aufgerüstet und ersetzt, weshalb auf dieser Seite nirgends ein Cluster-Preis genannt wird — ein Cluster ist n Rechnungen.

Der Handel

Die Plattform, die bei dem einen am besten ist, ist beim anderen am schlechtesten.

Jede Plattform, in die wir eine Karte einbauen, auf den Achsen, die über einen Cluster statt über eine einzelne Maschine entscheiden. Lesen Sie die beiden mittleren Spalten zusammen, und das ganze Argument dieser Seite steckt in ihnen: Sie bewegen sich in entgegengesetzte Richtungen. Die Bus-Generation ist dieselbe Zahl, die die GPU-Seite veröffentlicht, aus derselben Tabelle, sodass die beiden Seiten sich über eine Verbindung nicht widersprechen können.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Diese Tabelle lesen

  • Lanes zur Karte entscheiden, wie schnell Daten zwischen Prozessor und Beschleuniger übertragen werden. Das zählt kontinuierlich für eine Trainingsschleife, die Batches streamt, für ein Rendering, das jeden Frame Szenendaten füttert, und für alles, was aus dem Karten-Speicher auslagert. Es hört fast vollständig auf zu zählen, sobald ein Modell resident ist und dort bleibt.
  • Netzwerk-Obergrenze entscheidet, wie schnell eine Maschine mit der nächsten sprechen kann. Sie ist irrelevant für einen einzelnen Server, der seine eigene Arbeit erledigt, und sie ist die gesamte Frage für einen Job, der über mehrere aufgeteilt ist.
  • Räume entscheidet, ob die Wahl überhaupt dort verfügbar ist, wo Sie sie brauchen, und es ist die Spalte, die die Leute zuletzt lesen und zuerst lesen sollten — siehe unten.
  • Also: Ein Job, der in eine Maschine passt und den Bus hämmert, will die breitesten Lanes und kümmert sich nicht um den Port. Ein Job, der über mehrere Maschinen verteilt ist, will den Port und kann mit einem älteren Bus leben. Beides gleichzeitig zu wollen, ist die eine Kombination, die unser Katalog nicht vorhält, und wir sagen das lieber hier als nachdem Sie bezahlt haben.

Welche Karte in eine davon gehört und was jede pro Monat hinzufügt, steht unter GPU dedizierte Server — jede Karte, die wir einbauen, bepreist gegen die exakte Maschine, zu der ihre Zahl gehört. Diese Seite bepreist keine Karte, mit Absicht: Eine Seite besitzt dieses Geld.

Was sie verbindet

Das Interconnect wird pro Maschine gekauft, und das ist die Rechnung, die die Leute falsch machen.

Ein Port ist eine Eigenschaft eines einzelnen Servers. Vier Maschinen mit einer bestimmten Geschwindigkeit sind diese Geschwindigkeit viermal, jeden Monat, und es ist der Posten, der ein komfortables Cluster-Budget in ein unkomfortables verwandelt. Unten ist die Leiter mit der bereits erledigten Multiplikation, denn eine Seite über mehr als eine Maschine, die Sie das selbst machen lässt, erfüllt ihre Aufgabe nicht.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Zwei Dinge, die es zu beachten gilt, bevor Sie eine Sprosse wählen

  • Die Leiter ist nicht linear, daher kann ein breiterer Cluster billiger sein als ein schnellerer. Vergleichen Sie die Sprossen miteinander statt mit nichts: An mehreren Punkten dieser Tabelle kosten zwei Maschinen eine Sprosse tiefer weniger als eine Maschine eine Sprosse höher und geben Ihnen zwei Maschinen. Ob das ein guter Handel ist, hängt ganz davon ab, ob Ihre Arbeit sich aufteilt.
  • Die Spitze der Leiter ist nicht auf jeder Plattform. Die rechte Spalte sagt, wie viele von ihnen jede Geschwindigkeit erreichen, und die schnellsten Sprossen verengen sich auf eine Plattform, die einer Karte einen älteren Bus gibt. Das ist derselbe Handel wie in der Tabelle oben, nur aus der anderen Richtung kommend.

Was wir nicht haben, klar gesagt

Nichts jenseits eines Ethernet-Ports zwischen Maschinen steht in unserem Katalog. Es gibt kein gelistetes InfiniBand-Fabric und keine gelistete Karte-zu-Karte-Brücke, und diese Seite wird keines davon andeuten, indem sie darum herumschreibt. Wenn ein Build eines von beiden braucht, fragen Sie vor der Bestellung statt danach: Die Antwort ist ein Angebot, und die Antwort kann Nein sein. Das ist Ihnen mehr wert als eine Seite, die den Eindruck hinterlässt, es könnte Ja sein.

Jede Geschwindigkeit oben ist in beide Richtungen ungedrosselt, ohne Transfer-Kontingent und ohne Egress-Zeile auf irgendeiner Rechnung — was Ihre Nodes einander senden, ist also in jedem Volumen kostenlos, was der Teil ist, der anderswo normalerweise gemessen wird. Ungedrosselte Bandbreite ist die Seite für einen Port, für sich betrachtet, auf einer Maschine.

Wo es existieren kann

Für eine Maschine wählen Sie zuerst die Plattform. Für mehrere wählen Sie zuerst den Raum.

Maschinen, die miteinander sprechen müssen, gehören in dasselbe Gebäude, und unsere Räume halten nicht alle dieselben Plattformen vor. Wählen Sie zuerst die Plattform, und Sie können feststellen, dass der Raum, in dem Sie sie brauchen, sie nicht führt. Dies stammt aus demselben Katalog wie alles andere, daher erscheint eine Leitung, die in einer neuen Stadt ankommt, hier von selbst.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Wo das Gebäude tatsächlich steht, womit es verbunden ist und wer sonst darin ist — Rechenzentren beschreibt alle fünf. Die Latenz zwischen zwei unserer Städte ist eine echte Zahl statt einer Marketing-Zahl, und der Support misst sie für Ihr Paar auf Anfrage, statt Sie von einer Karte raten zu lassen.

Wie es angeboten wird und wie bald es existiert

Multi-Node-Arbeit wird datiert, bevor sie bezahlt wird, nicht danach.

Ein Build dieser Art besteht aus mehreren Maschinen und oft aus mehreren Teilen, die nicht im Regal stehen, daher ist das Ehrliche, das man veröffentlichen kann, kein Lieferversprechen, sondern die Leiter, von der das Datum abfällt — dieselbe, die Build to Order und die GPU-Seite verwenden, in denselben Worten.

  1. ~30 Minuten

    Die Maschinen sind bereits so gerackt, wie sie sind

    Nichts wird eingebaut und nichts wird bewegt. Instant-Server ist die Liste dessen, was genau jetzt dort steht, und für einen Cluster gewöhnlicher Nodes ist sie zuerst lesenswert.

  2. 4–24 Stunden

    Die Teile sind solche, die wir vorrätig haben

    Der gewöhnliche Fall. Techniker bauen die Karten ein, erstellen die Arrays und installieren die Betriebssysteme — pro Maschine, parallel, nicht eine nach der anderen.

  3. 5–10 Arbeitstage

    Teile müssen eingekauft werden

    Etwas an der Spezifikation ist kein Bestand, den wir führen. Wir bestellen es, dann bauen wir. Dies ist die häufigste Sprosse für ein Multi-Karten-Gehäuse, denn das Gehäuse ist normalerweise der lange Pol statt der Karte.

  4. 10–15 Arbeitstage

    Ein Teil ist knapp

    Beschleuniger der aktuellen Generation laufen auf Zuteilung, und das Datum gehört dem Distributor, nicht uns. Wir nennen den langen Pol, bevor Sie sich festlegen, statt danach. Wo Hardware für einen Kunden eingekauft wird, bitten wir um drei Monate im Voraus, denn es ist eine Maschine, die wir nicht neu vermieten können, wenn das Konto in Woche zwei schließt.

Jede Sprosse beginnt, wenn die Bestellung Zahlung und Betrugsprüfung passiert, was der eine Schritt ist, auf den wir kein Versprechen geben — die meisten passieren innerhalb von ein paar Stunden, und eine große Erstbestellung von einem neuen Konto kann länger dauern. Für einen Build dieser Größe cleart eine Überweisung oder ein Stablecoin normalerweise schneller als eine Karte, was gut zu wissen ist, bevor eine Betrugsprüfung einen Rack-Besuch verzögert.

Einen Multi-Node- oder Multi-Karten-Build zu beschreiben, geht in einem Satz schneller als in einem Formular. — die Node-Anzahl, ob die Arbeit sich aufteilt und womit sie sprechen muss — und jemand, der so etwas schon einmal angeboten hat, wird antworten, auch wenn die Antwort lautet, dass eine Maschine genügen würde.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.