Multi-Card- und Multi-Node-Lösungen · Primcast LLC · seit 2004

Eine breitere Expansion ist nicht dasselbe wie eine Vergrößerung.

Die Frage, ob eine Grafikkarte in einem Rechner verbaut werden kann, ist geklärt, und die Preise für die einzelnen Karten sind auf der GPU-Seite aufgeführt. Hier setzt die Diskussion an: eine zweite Karte im selben Gehäuse oder ein zweiter Rechner neben der ersten. Es klingt nach der gleichen Entscheidung, ist aber in Wirklichkeit gegensätzlich – die Plattform, die einer Karte die meisten Lanes bietet, hat die geringste Netzwerkkapazität und benötigt die wenigsten Räume. Solche Informationen veröffentlicht sonst niemand im eigenen Produktkatalog. Sie finden sie in der ersten Tabelle unten.

Vergleichen Sie die Plattformen Was verbindet zwei Maschinen?

Jede Maschine ist ein einzelner Mandant, jede Karte wird an Ihr eigenes Betriebssystem weitergeleitet, und hier zählt kein Byte zwischen Ihren Knoten.

Das Register

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Diese Seite wurde beim Laden aus dem Bestellkatalog gelesen, nicht abgetippt. Was heute Morgen im Regal steht, ist eine andere Frage, und die Antwort darauf liefern die Instant-Server .

Zwei verschiedene Fragen

Welche Frage meinst du eigentlich?

Die Menschen kommen hierher mit dem Entschluss „Ich brauche mehr“, ohne sich vorher zu entscheiden, was genau. Die beiden Antworten haben unterschiedliche Kosten, werden unterschiedlich vermittelt und sind durch unterschiedliche Faktoren begrenzt. Deshalb ist es wichtig, sich im Klaren darüber zu sein, bevor man eine weitere Zeile liest.

Mehrere Karten in einem Gerät

Eine zweite Karte im selben Gehäuse

Sie haben zu wenig Kartenspeicher oder zu geringe Datenübertragungsrate, ansonsten ist das System aber in Ordnung. Wir erstellen Ihnen ein individuelles Angebot, anstatt einfach ein Kästchen im Warenkorb anzukreuzen. Denn die Anzahl der kompatiblen Karten hängt von der Breite der jeweiligen Karte und der Leistungsaufnahme des Gehäuses ab – zwei Faktoren, die nicht im Katalog stehen und die wir nicht schätzen können.

Entscheidend ist die Karte, nicht die Plattform. Fragen Sie nach dem genannten Bauteil, und die Antwort nennt das Chassis, die Stückzahl und die Lieferzeit.

Was viele erwarten, aber nicht verstehen: Zwei Grafikkarten ergeben nicht eine größere. Ihr Speicher addiert sich nur dann, wenn die Anwendung ein Modell auf beide Karten verteilen kann – sei es durch Tensor- oder Pipeline-Parallelisierung, die von jeder gängigen Laufzeitumgebung unterstützt wird und die den Datenverkehr zwischen den Karten etwas reduziert. Bei Aufgaben, die bereits aus vielen unabhängigen Jobs bestehen, verdoppeln zwei Karten einfach die Rechenleistung, und es müssen keine Änderungen vorgenommen werden.

Daneben stehen weitere Maschinen.

Eine zweite Maschine neben der ersten

Sie sind an die Grenzen des Rechners gestoßen, nicht der Grafikkarte: keine freien Steckplätze, kein Speicherplatz mehr, kein Platz mehr für den nächsten Auftrag. Auf den besten der unten aufgeführten Plattformen liegt diese Grenze bei 2 sockets and 1 TB , und darüber hinaus ist ein anderer Server die Lösung, kein größerer.

Entscheidend sind der Raum und der Port. Zwei Maschinen, die miteinander kommunizieren müssen, müssen sich im selben Gebäude befinden. Die Verbindung zwischen ihnen wird durch den Port jeder Maschine hergestellt – dieser wird pro Maschine erworben, sodass das Netzwerk unter vier Knoten aus vier Ports besteht.

Was viele erwarten, aber nicht bekommen: Es gibt hier kein Cluster-Produkt und keine Mindestanzahl an Knoten. Jede Maschine wird einzeln bestellt, abgerechnet, aktualisiert und ersetzt. Deshalb findet sich auf dieser Seite nirgends ein Clusterpreis – ein Cluster besteht aus mehreren Rechnungen.

Der Handel

Die Plattform, die in einem dieser Bereiche am besten ist, ist im anderen am schlechtesten.

Jede Plattform, auf der wir eine Karte einsetzen, basiert auf den Achsen, die einen Cluster anstelle einer einzelnen Maschine definieren. Betrachtet man die beiden mittleren Spalten zusammen, so liegt die gesamte Argumentation dieser Seite darin: Sie bewegen sich in entgegengesetzte Richtungen. Die Busgeneration entspricht dem Wert, den die GPU-Seite aus derselben Tabelle veröffentlicht; daher können die beiden Seiten hinsichtlich einer Verbindung nicht voneinander abweichen.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Lesen Sie diese Tabelle

  • Die Datenleitungen zur Grafikkarte bestimmen, wie schnell Daten zwischen Prozessor und Beschleuniger übertragen werden. Dies ist kontinuierlich relevant für Trainingsschleifen, die Datenpakete verarbeiten, für Renderings, die Szenendaten in jedem Frame liefern, und für alle Daten, die den Speicher der Grafikkarte verlassen. Sobald ein Modell im Speicher liegt und dort verbleibt, spielt dies nahezu keine Rolle mehr.
  • Die maximale Netzwerkgeschwindigkeit bestimmt, wie schnell ein Rechner mit dem nächsten kommunizieren kann. Für einen einzelnen Server, der seine Aufgaben selbstständig erledigt, ist sie irrelevant, für einen auf mehrere Server verteilten Auftrag hingegen ist sie der entscheidende Faktor.
  • Rooms entscheidet darüber, ob die Auswahl dort überhaupt verfügbar ist, wo Sie sie benötigen, und es ist die Spalte, die die Leute zuletzt lesen und zuerst lesen sollten – siehe unten.
  • Also: Ein Auftrag, der in eine Maschine passt und den Bus optimal nutzt, benötigt die breitesten Fahrspuren und ist für den Hafen unerheblich. Ein Auftrag, der sich auf mehrere Maschinen verteilt, benötigt den Hafen und kann mit einem älteren Bus auskommen. Die Kombination aus beidem gleichzeitig ist die einzige, die unser Katalog nicht bietet, und wir möchten Sie lieber hier darüber informieren, als erst nach Ihrer Bezahlung.

Welche Grafikkarte in welchen Server passt und wie hoch die monatlichen Zusatzkosten sind, erfahren Sie bei dedizierten GPU-Servern – jede von uns verbaute Karte wird anhand des Preises des jeweiligen Servers, zu dem sie gehört, kalkuliert. Auf dieser Seite werden bewusst keine Kartenpreise angegeben: Diese Einnahmen werden von einer anderen Seite generiert.

Was verbindet sie

Die Verbindung wird pro Maschine gekauft, und genau da liegt der Rechenfehler.

Ein Port ist eine Eigenschaft eines einzelnen Servers. Vier Maschinen mit einer bestimmten Geschwindigkeit bedeuten diese Geschwindigkeit viermal pro Monat – und genau dieser Kostenpunkt lässt ein komfortables Cluster-Budget schnell knapp werden. Die folgende Tabelle enthält bereits die Multiplikation, denn eine Seite, die mehrere Maschinen beschreibt und die Berechnung dem Benutzer überlässt, erfüllt ihren Zweck nicht.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Zwei Dinge, die Sie beachten sollten, bevor Sie eine Sprosse auswählen.

  • Die Leiter ist nicht linear, daher kann ein breiteres Cluster günstiger sein als ein schnelleres. Vergleichen Sie die Sprossen miteinander, anstatt mit nichts: An mehreren Punkten dieser Tabelle kosten zwei Maschinen, die eine Stufe niedriger sind, weniger als eine Maschine, die eine Stufe höher ist, und Sie erhalten zwei Maschinen. Ob das ein guter Tausch ist, hängt ganz davon ab, ob Ihre Arbeit aufgeteilt wird.
  • Die oberste Stufe der Leiter befindet sich nicht auf jedem Bahnsteig. Die rechte Spalte gibt an, wie viele von ihnen die jeweilige Geschwindigkeit erreichen, und die schnellsten Stufen verjüngen sich zu einem Bahnsteig, der einem älteren Bus den Zugang ermöglicht. Dies entspricht dem Verkehr in der obigen Tabelle, nur aus der anderen Richtung kommend.

Was wir nicht haben, einfach gesagt

In unserem Katalog finden Sie keine weiteren Komponenten außer einem Ethernet-Anschluss zwischen den Geräten. Wir führen weder InfiniBand-Fabric noch eine Card-to-Card-Bridge auf, und diese Seite soll auch nicht den Eindruck erwecken, dass wir diese anbieten. Falls Sie eine dieser Komponenten benötigen, fragen Sie bitte vor der Bestellung nach: Sie erhalten ein Angebot, und die Antwort kann „Nein“ lauten. Das ist Ihnen wichtiger als eine Seite, die den Eindruck erweckt, es könnte „Ja“ sein.

Alle oben genannten Geschwindigkeiten sind in beide Richtungen unbegrenzt, ohne Transferlimit und ohne Abrechnung von ausgehenden Daten – der Datenverkehr zwischen Ihren Knoten ist also in jeder Menge kostenlos, was üblicherweise andernorts abgerechnet wird. Die unbegrenzte Bandbreite bezieht sich auf einen Port, der isoliert auf einem einzelnen Rechner betrachtet wird.

Wo es existieren kann

Bei einer einzelnen Maschine wählen Sie zuerst die Plattform. Bei mehreren Maschinen wählen Sie zuerst den Raum.

Maschinen, die miteinander kommunizieren müssen, gehören in dasselbe Gebäude, und nicht alle unsere Räume verfügen über dieselben Plattformen. Wählen Sie zuerst die Plattform aus; Sie werden feststellen, dass der benötigte Raum diese nicht enthält. Dies stammt aus demselben Katalog wie alles andere, daher erscheint eine Linie, die in einer neuen Stadt ankommt, hier separat.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Wo sich das Gebäude genau befindet, womit es verbunden ist und wer sich sonst noch darin befindet – all das beschreibt ein Rechenzentrum . Die Latenz zwischen zwei unserer Städte ist eine reale Zahl und keine Marketingaussage. Unser Support misst sie auf Anfrage für Ihr Netzwerk, anstatt Sie anhand einer Karte raten zu lassen.

Wie es zitiert wird und wie schnell es existiert

Bei Arbeiten mit mehreren Knotenpunkten wird das Arbeitsdatum vor der Bezahlung festgelegt, nicht danach.

Ein solcher Aufbau besteht aus mehreren Maschinen und oft auch aus mehreren Teilen, die nicht auf Lager sind. Daher ist es ehrlich, nicht ein Lieferversprechen zu veröffentlichen, sondern die Abfolge der Liefertermine – also den Aufbau auf Bestellung und die GPU-Nutzung, um es gleich auszudrücken.

  1. ca. 30 Minuten

    Die Maschinen sind bereits in den Regalen montiert.

    Nichts ist montiert und nichts wurde bewegt. Die Liste der sofort verfügbaren Server ist eine Übersicht dessen, was sich aktuell dort befindet, und für einen Cluster aus gewöhnlichen Knoten lohnt es sich, diese zuerst zu lesen.

  2. 4–24 Stunden

    Die Teile sind solche, die wir halten

    Der Normalfall. Techniker bestücken die Karten, bauen die Arrays und installieren die Betriebssysteme – pro Maschine, parallel, nicht nacheinander.

  3. 5–10 Werktage

    Teile müssen eingekauft werden

    Ein Teil der Spezifikation ist nicht in unserem Lagerbestand enthalten. Wir bestellen ihn und fertigen ihn anschließend an. Dies ist die gängigste Vorgehensweise bei einem Multi-Card-Chassis, da das Chassis üblicherweise den längeren Teil bildet und nicht die Karten selbst.

  4. 10–15 Werktage

    Ein Teil ist knapp

    Aktuelle Beschleuniger werden zugeteilt, und der Liefertermin wird vom Distributor festgelegt, nicht von uns. Wir legen die langfristige Verfügbarkeit fest, bevor Sie sich festlegen. Wenn Hardware für einen einzelnen Kunden angeschafft wird, bitten wir um eine Vorauszahlung von drei Monaten, da wir die Geräte nicht weitervermieten können, falls der Kunde in der zweiten Woche kündigt.

Jeder Schritt beginnt, sobald die Bestellung die Zahlungs- und Betrugsprüfung abgeschlossen hat. Für diesen Schritt können wir keine Garantie übernehmen – die meisten Bestellungen werden innerhalb weniger Stunden bearbeitet, eine große Erstbestellung eines neuen Kontos kann jedoch länger dauern. Bei einem Projekt dieser Größenordnung ist eine Überweisung oder eine Zahlung mit einem Stablecoin in der Regel schneller als eine Kartenzahlung. Dies sollten Sie wissen, bevor eine Betrugsprüfung Ihren Besuch am Montagetisch verzögert.

Die Beschreibung eines Multi-Node- oder Multi-Card-Systems ist in einem Satz schneller als in einem Formular. – die Anzahl der Nodes, ob die Arbeit aufgeteilt wird und mit welchen Systemen kommuniziert werden muss – und jemand, der bereits Erfahrung mit solchen Systemen hat, wird Ihnen antworten, auch wenn die Antwort lautet: ein einzelner Rechner reicht aus.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.