Multi-cartes et multi-nœuds · Primcast LLC · depuis 2004

Passer à l'échelle horizontale n'est pas le même métier que passer à l'échelle verticale.

Une carte dans une machine est une question réglée, et elle est tarifée carte par carte sur la page GPU. Celle-ci commence là où cela s'arrête : une deuxième carte dans le même châssis, ou une deuxième machine à côté de la première. Elles semblent être la même décision et elles sont opposées — la plateforme ici qui donne à une carte le plus de voies a le plafond réseau le plus bas et se trouve dans le moins de salles. Personne ne publie cela à propos de son propre catalogue. C'est le premier tableau ci-dessous.

Comparer les plateformes Ce qui relie deux machines

Chaque machine est un seul locataire, chaque carte est transmise directement à votre propre système d'exploitation, et rien ici ne compte un octet entre vos nœuds.

Le registre

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Lu depuis le catalogue de commandes au moment où cette page a été servie, pas saisi à la main. Ce qui est en rack ce matin est une autre question, et serveurs instantanés est l'endroit où elle trouve sa réponse.

Transformez vos GPU en revenus mensuels passifs

Vous avez des configurations GPU serveur ou de bureau inutilisées ? Mettez-les en ligne sur la marketplace Primcast dès aujourd'hui et gagnez des loyers mensuels réguliers de la part d'équipes IA, de développeurs et d'entreprises ayant besoin de calcul de qualité production.

Aller à la Marketplace

Deux questions différentes

Laquelle posez-vous réellement ?

Les gens arrivent ici en ayant décidé “j'ai besoin de plus” sans avoir décidé plus de quoi. Les deux réponses coûtent différemment, sont livrées différemment et sont limitées par des choses différentes, il vaut donc la peine d'être explicite avant de lire une ligne de plus.

Plus de carte dans une machine

Une deuxième carte dans le même châssis

Vous manquez de mémoire de carte, ou de débit, et tout le reste de la machine va bien. C'est une configuration que nous chiffrons plutôt qu'une case à cocher dans le panier, car le nombre de cartes qui tiennent dépend de la largeur physique de la carte spécifique et du budget énergétique du châssis spécifique — deux faits qui ne figurent pas dans un catalogue et que nous ne devinerons pas.

Ce qui décide : la carte, pas la plateforme. Demandez en nommant la pièce et la réponse nomme le châssis, le nombre et le délai.

Ce que les gens attendent et n'obtiennent pas : deux cartes ne sont pas une carte plus grande. Leur mémoire ne s'additionne que si ce que vous exécutez peut répartir un modèle sur les deux — parallélisme tensoriel ou pipeline, que tout runtime sérieux prend en charge et qui vous coûte un peu de débit pour le trafic entre elles. Pour un travail qui est déjà constitué de nombreuses tâches indépendantes, deux cartes sont simplement deux fois la machine et rien n'a besoin de changer.

Plus de machines à côté

Une deuxième machine à côté de la première

Vous êtes à court de machine plutôt que de carte : à court de sockets, à court de mémoire, à court d'un endroit où mettre la tâche suivante. Sur la meilleure des plateformes ci-dessous, ce plafond est 2 sockets and 1 TB, et au-delà de l'un ou l'autre, la réponse est un autre serveur plutôt qu'un plus gros.

Ce qui décide : la salle et le port. Deux machines qui doivent se parler doivent être dans le même bâtiment, et ce qui les relie est le port sur chacune d'elles — acheté par machine, donc le tissu sous quatre nœuds représente quatre ports.

Ce que les gens attendent et n'obtiennent pas : il n'y a pas de produit cluster ici et pas de nombre minimum de nœuds. Chaque machine est commandée, facturée, mise à niveau et remplacée individuellement, c'est pourquoi rien sur cette page ne cite un prix de cluster — un cluster, c'est n factures.

Le compromis

La plateforme la meilleure pour l'un de ces aspects est la pire pour l'autre.

Chaque plateforme sur laquelle nous montons une carte, selon les axes qui décident d'un cluster plutôt que d'une machine unique. Lisez les deux colonnes du milieu ensemble et tout l'argument de cette page s'y trouve : elles évoluent en sens opposés. La génération de bus est le même chiffre que celui publié par la page GPU, issu du même tableau, de sorte que les deux pages ne peuvent pas se contredire au sujet d'une liaison.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Lire ce tableau

  • Voies vers la carte déterminent la vitesse à laquelle les données circulent entre le processeur et l'accélérateur. Cela compte en continu pour une boucle d'entraînement qui envoie des lots en continu, pour un rendu qui alimente des données de scène à chaque image, et pour tout ce qui déborde de la mémoire de la carte. Cela cesse presque entièrement de compter une fois qu'un modèle est résident et y reste.
  • Plafond réseau détermine la vitesse à laquelle une machine peut parler à la suivante. C'est sans importance pour un serveur unique qui fait son propre travail et c'est toute la question pour un travail réparti sur plusieurs.
  • Salles détermine si le choix est disponible là où vous en avez besoin, et c'est la colonne que les gens lisent en dernier et devraient lire en premier — voir ci-dessous.
  • Donc : un travail qui tient dans une seule machine et sollicite fortement le bus veut les voies les plus larges et ne se soucie pas du port. Un travail réparti sur plusieurs machines veut le port et peut vivre avec un bus plus ancien. Vouloir les deux à la fois est la seule combinaison que notre catalogue ne propose pas, et nous préférons le dire ici plutôt qu'après que vous ayez payé.

Quelle carte va dans l'une de ces machines, et ce que chacune ajoute par mois, c'est serveurs dédiés GPU — chaque carte que nous montons, tarifée par rapport à la machine exacte à laquelle son chiffre appartient. Cette page ne tarife aucune carte, délibérément : une seule page possède cet argent.

Ce qui les relie

L'interconnexion s'achète par machine, et c'est l'arithmétique que les gens se trompent.

Un port est une propriété d'un serveur. Quatre machines à une vitesse donnée, c'est cette vitesse quatre fois, chaque mois, et c'est la ligne qui transforme un budget de cluster confortable en un budget inconfortable. Voici l'échelle avec la multiplication déjà faite, car une page qui parle de plus d'une machine et vous laisse faire le calcul vous-même ne fait pas son travail.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Deux choses à remarquer avant de choisir un barreau

  • L'échelle n'est pas linéaire, donc un cluster plus large peut être moins cher qu'un plus rapide. Comparez les barreaux entre eux plutôt qu'avec rien : à plusieurs endroits de ce tableau, deux machines un barreau plus bas coûtent moins qu'une machine un barreau plus haut, et vous donnent deux machines. Que ce soit un bon compromis dépend entièrement de la capacité de votre travail à se répartir.
  • Le haut de l'échelle n'est pas sur toutes les plateformes. La colonne de droite indique combien d'entre elles atteignent chaque vitesse, et les barreaux les plus rapides se réduisent à une plateforme qui donne à une carte un bus plus ancien. C'est le même compromis que le tableau ci-dessus, abordé depuis l'autre direction.

Ce que nous n'avons pas, dit clairement

Rien au-delà d'un port Ethernet entre machines ne figure dans notre catalogue. Il n'y a pas de tissu InfiniBand répertorié ni de pont carte-à-carte répertorié, et cette page ne va pas en suggérer un en écrivant autour. Si une configuration a besoin de l'un ou l'autre, demandez avant de commander plutôt qu'après : la réponse est un devis, et la réponse peut être non. Cela vaut plus pour vous qu'une page qui laisse l'impression que cela pourrait être oui.

Chaque vitesse ci-dessus est non mesurée dans les deux sens, sans quota de transfert et sans ligne de sortie sur aucune facture — donc ce que vos nœuds s'envoient mutuellement est gratuit à n'importe quel volume, ce qui est la partie habituellement mesurée ailleurs. Bande passante non mesurée est la page pour un port considéré isolément, sur une machine.

Où cela peut exister

Pour une machine, vous choisissez d'abord la plateforme. Pour plusieurs, choisissez d'abord la salle.

Les machines qui doivent se parler appartiennent au même bâtiment, et nos salles ne contiennent pas toutes les mêmes plateformes. Choisissez d'abord la plateforme et vous pouvez découvrir que la salle où vous en avez besoin ne la propose pas. Ceci est dérivé du même catalogue que tout le reste, donc une ligne arrivant dans une nouvelle ville apparaît ici d'elle-même.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Où se trouve réellement le bâtiment, à quoi il est connecté et qui d'autre s'y trouve — centres de données décrit les cinq. La latence entre deux de nos villes est un chiffre réel plutôt qu'un chiffre marketing, et le support la mesurera pour votre paire sur demande plutôt que de vous laisser deviner à partir d'une carte.

Comment c'est chiffré, et dans quel délai cela existe

Le travail multi-nœuds est daté avant d'être payé, pas après.

Une configuration de ce type est constituée de plusieurs machines et souvent de plusieurs pièces qui ne sont pas en rayon, donc la chose honnête à publier n'est pas une promesse de livraison mais l'échelle d'où provient la date — la même que celle utilisée par construction à la commande et la page GPU, dans les mêmes termes.

  1. ~30 minutes

    Les machines sont déjà en rack telles quelles

    Rien n'est monté et rien n'est déplacé. Serveurs instantanés est la liste de ce qui s'y trouve en ce moment même, et pour un cluster de nœuds ordinaires, cela vaut la peine d'être lu en premier.

  2. 4–24 heures

    Les pièces sont celles que nous détenons

    Le cas ordinaire. Les techniciens montent les cartes, construisent les baies et installent les systèmes d'exploitation — par machine, en parallèle, pas l'une après l'autre.

  3. 5–10 jours ouvrés

    Des pièces doivent être achetées

    Quelque chose dans la spécification n'est pas un stock que nous portons. Nous le commandons, puis nous construisons. C'est le barreau le plus courant pour un châssis multi-cartes, car le châssis est généralement le facteur limitant plutôt que la carte.

  4. 10–15 jours ouvrés

    Une pièce est rare

    Les accélérateurs de génération actuelle fonctionnent sur allocation et la date est celle du distributeur, pas la nôtre. Nous nommons le facteur limitant avant que vous vous engagiez plutôt qu'après. Lorsque du matériel est acheté pour un client, nous demandons trois mois d'avance, car c'est une machine que nous ne pouvons pas relouer si le compte se ferme en deuxième semaine.

Chaque barreau démarre lorsque la commande passe le paiement et l'examen anti-fraude, ce qui est la seule étape sur laquelle nous ne ferons pas de promesse — la plupart passent en quelques heures, et une première commande importante d'un nouveau compte peut prendre plus longtemps. Pour une configuration de cette taille, un virement ou un stablecoin passe généralement plus vite qu'une carte, ce qui est bon à savoir avant qu'un contrôle anti-fraude retarde une visite en rack.

Décrire une configuration multi-nœuds ou multi-cartes est plus rapide en une phrase que dans un formulaire. — le nombre de nœuds, si le travail se répartit, et avec quoi il doit communiquer — et quelqu'un qui a déjà chiffré l'une de ces configurations répondra, y compris lorsque la réponse est qu'une seule machine suffirait.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.