Multi-cartes et multi-nœuds · Primcast LLC · depuis 2004

Élargir n’est pas le même métier qu’agrandir.

Une carte dans une machine est une question réglée, et elle est tarifée carte par carte sur la page GPU. Celle-ci commence là où cela s’arrête : une deuxième carte dans le même châssis, ou une deuxième machine à côté de la première. Elles semblent être la même décision et elles sont opposées — la plateforme ici qui donne à une carte le plus de voies a le plafond réseau le plus bas et se trouve dans le moins de salles. Personne ne publie cela sur son propre catalogue. C’est le premier tableau ci-dessous.

Comparer les plateformes Ce qui relie deux machines

Chaque machine est un seul locataire, chaque carte est transmise à votre propre système d’exploitation, et rien ici ne compte un octet entre vos nœuds.

Le registre

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Lu depuis le catalogue de commandes au moment où cette page a été servie, pas saisi à la main. Ce qui est en rack ce matin est une autre question, et serveurs instantanés est l’endroit où elle trouve sa réponse.

Transformez vos GPU en revenus mensuels passifs

Vous avez des configurations GPU serveur ou de bureau inutilisées ? Mettez-les en ligne sur la marketplace Primcast dès aujourd’hui et gagnez des loyers mensuels réguliers de la part d’équipes IA, de développeurs et d’entreprises ayant besoin de calcul de qualité production.

Aller à la Marketplace

Deux questions différentes

Laquelle posez-vous réellement ?

Les gens arrivent ici en ayant décidé “j’ai besoin de plus” sans avoir décidé plus de quoi. Les deux réponses coûtent différemment, sont livrées différemment et sont limitées par des choses différentes, il vaut donc la peine d’être explicite avant de lire une ligne de plus.

Plus de carte dans une machine

Une deuxième carte dans le même châssis

Vous manquez de mémoire de carte, ou de débit, et tout le reste de la machine va bien. C’est une configuration que nous chiffrons plutôt qu’une case à cocher dans le panier, car le nombre de cartes qui tiennent dépend de la largeur physique de la carte précise et du budget d’alimentation du châssis précis — deux faits qui ne figurent pas dans un catalogue et sur lesquels nous ne ferons pas de supposition.

Ce qui décide : la carte, pas la plateforme. Demandez en nommant la pièce et la réponse nomme le châssis, le nombre et le délai.

Ce que les gens attendent et n’obtiennent pas : deux cartes ne sont pas une carte plus grande. Leur mémoire ne s’additionne que si ce que vous exécutez peut répartir un modèle sur les deux — parallélisme tensoriel ou pipeline, que tout runtime sérieux prend en charge et qui vous coûte un peu de débit pour le trafic entre elles. Pour un travail qui est déjà de nombreux jobs indépendants, deux cartes sont simplement deux fois la machine et rien n’a besoin de changer.

Plus de machines à côté

Une deuxième machine à côté de la première

Vous êtes à court de machine plutôt que de carte : à court de sockets, à court de mémoire, à court d’un endroit où mettre le job suivant. Sur la meilleure des plateformes ci-dessous, ce plafond est 2 sockets and 1 TB, et au-delà de l’un ou l’autre, la réponse est un autre serveur plutôt qu’un plus gros.

Ce qui décide : la salle et le port. Deux machines qui doivent se parler doivent être dans le même bâtiment, et ce qui les relie est le port sur chacune d’elles — acheté par machine, donc le tissu sous quatre nœuds est quatre ports.

Ce que les gens attendent et n’obtiennent pas : il n’y a pas de produit cluster ici et pas de nombre minimal de nœuds. Chaque machine est commandée, facturée, mise à niveau et remplacée individuellement, c’est pourquoi rien sur cette page ne cite un prix de cluster — un cluster est n factures.

Le compromis

La plateforme la meilleure pour l’un est la pire pour l’autre.

Chaque plateforme sur laquelle nous montons une carte, sur les axes qui décident d’un cluster plutôt que d’une machine seule. Lisez les deux colonnes du milieu ensemble et tout l’argument de cette page y est : elles vont dans des directions opposées. La génération de bus est le même chiffre que publie la page GPU, depuis le même tableau, de sorte que les deux pages ne peuvent pas se contredire sur une liaison.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Lire ce tableau

  • Voies vers la carte décident de la vitesse à laquelle les données circulent entre le processeur et l’accélérateur. Cela compte en continu pour une boucle d’entraînement qui envoie des lots, pour un rendu qui alimente des données de scène à chaque image, et pour tout ce qui déborde de la mémoire de la carte. Cela cesse presque entièrement de compter une fois qu’un modèle est résident et y reste.
  • Plafond réseau décide de la vitesse à laquelle une machine peut parler à la suivante. C’est sans importance pour un serveur unique qui fait son propre travail et c’est toute la question pour un job réparti sur plusieurs.
  • Salles décide si le choix est disponible là où vous en avez besoin, et c’est la colonne que les gens lisent en dernier et devraient lire en premier — voir ci-dessous.
  • Donc : un job qui tient dans une machine et martèle le bus veut les voies les plus larges et se moque du port. Un job réparti sur plusieurs machines veut le port et peut vivre avec un bus plus ancien. Vouloir les deux à la fois est la seule combinaison que notre catalogue ne contient pas, et nous préférons le dire ici plutôt qu’après que vous ayez payé.

Quelle carte va dans l’une de ces machines, et ce que chacune ajoute par mois, c’est serveurs dédiés GPU — chaque carte que nous montons, tarifée contre la machine exacte à laquelle son chiffre appartient. Cette page ne tarife aucune carte, délibérément : une seule page possède cet argent.

Ce qui les relie

L’interconnexion s’achète par machine, et c’est l’arithmétique que les gens se trompent.

Un port est une propriété d’un serveur. Quatre machines à une vitesse donnée, c’est cette vitesse quatre fois, chaque mois, et c’est la ligne qui transforme un budget de cluster confortable en un budget inconfortable. Voici l’échelle avec la multiplication déjà faite, car une page sur plus d’une machine qui vous laisse la faire vous-même ne fait pas son travail.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Deux choses à remarquer avant de choisir un barreau

  • L’échelle n’est pas linéaire, donc un cluster plus large peut être moins cher qu’un plus rapide. Comparez les barreaux entre eux plutôt qu’à rien : à plusieurs endroits de ce tableau, deux machines un barreau plus bas coûtent moins qu’une machine un barreau plus haut, et vous donnent deux machines. Que ce soit un bon compromis dépend entièrement de si votre travail se répartit.
  • Le haut de l’échelle n’est pas sur toutes les plateformes. La colonne de droite dit combien d’entre elles atteignent chaque vitesse, et les barreaux les plus rapides se réduisent à une plateforme qui donne à une carte un bus plus ancien. C’est le même compromis que le tableau ci-dessus, arrivant depuis l’autre direction.

Ce que nous n’avons pas, dit clairement

Rien au-delà d’un port Ethernet entre machines ne figure dans notre catalogue. Il n’y a pas de tissu InfiniBand répertorié ni de pont carte-à-carte répertorié, et cette page ne va pas en suggérer un en écrivant autour. Si une configuration a besoin de l’un ou l’autre, demandez avant de commander plutôt qu’après : la réponse est un devis, et la réponse peut être non. Cela vaut plus pour vous qu’une page qui laisse l’impression que ce pourrait être oui.

Chaque vitesse ci-dessus est non mesurée dans les deux directions, sans quota de transfert et sans ligne de sortie sur aucune facture — donc ce que vos nœuds s’envoient est gratuit à tout volume, ce qui est la partie habituellement mesurée ailleurs. Bande passante non mesurée est la page pour un port considéré seul, sur une machine.

Où cela peut exister

Pour une machine, vous choisissez d’abord la plateforme. Pour plusieurs, choisissez d’abord la salle.

Les machines qui doivent se parler appartiennent au même bâtiment, et nos salles ne contiennent pas toutes les mêmes plateformes. Choisissez d’abord la plateforme et vous pouvez découvrir que la salle où vous en avez besoin ne la propose pas. Ceci est dérivé du même catalogue que tout le reste, donc une ligne arrivant dans une nouvelle ville apparaît ici d’elle-même.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Où se trouve réellement le bâtiment, à quoi il est connecté et qui d’autre s’y trouve — centres de données décrit les cinq. La latence entre deux de nos villes est un nombre réel plutôt qu’un nombre marketing, et le support la mesurera pour votre paire sur demande plutôt que de vous laisser deviner depuis une carte.

Comment c’est chiffré, et dans combien de temps cela existe

Le travail multi-nœuds est daté avant d’être payé, pas après.

Une configuration de ce type est plusieurs machines et souvent plusieurs pièces qui ne sont pas en rayon, donc la chose honnête à publier n’est pas une promesse de livraison mais l’échelle d’où sort la date — la même que construction à la commande et la page GPU utilisent, dans les mêmes mots.

  1. ~30 minutes

    Les machines sont déjà en rack telles quelles

    Rien n’est monté et rien n’est déplacé. Serveurs instantanés est la liste de ce qui s’y trouve en ce moment, et pour un cluster de nœuds ordinaires, cela vaut la peine d’être lu en premier.

  2. 4–24 heures

    Les pièces sont celles que nous détenons

    Le cas ordinaire. Les techniciens montent les cartes, construisent les baies et installent les systèmes d’exploitation — par machine, en parallèle, pas l’une après l’autre.

  3. 5–10 jours ouvrés

    Des pièces doivent être achetées

    Quelque chose dans la spécification n’est pas un stock que nous portons. Nous le commandons, puis nous construisons. C’est le barreau le plus courant pour un châssis multi-cartes, car le châssis est généralement le poteau long plutôt que la carte.

  4. 10–15 jours ouvrés

    Une pièce est rare

    Les accélérateurs de génération actuelle fonctionnent sur allocation et la date est celle du distributeur, pas la nôtre. Nous nommons le poteau long avant que vous vous engagiez plutôt qu’après. Lorsque du matériel est acheté pour un client, nous demandons trois mois d’avance, car c’est une machine que nous ne pouvons pas relouer si le compte ferme en deuxième semaine.

Chaque barreau commence lorsque la commande passe le paiement et la vérification anti-fraude, ce qui est la seule étape sur laquelle nous ne ferons pas de promesse — la plupart passent en quelques heures, et une première commande importante d’un nouveau compte peut prendre plus longtemps. Pour une configuration de cette taille, un virement ou un stablecoin passe généralement plus vite qu’une carte, ce qui vaut la peine d’être su avant qu’un contrôle anti-fraude retarde une visite en rack.

Décrire une configuration multi-nœuds ou multi-cartes est plus rapide en une phrase qu’en un formulaire. — le nombre de nœuds, si le travail se répartit, et à quoi il doit parler — et quelqu’un qui a déjà chiffré l’une de ces configurations répondra, y compris lorsque la réponse est qu’une seule machine suffirait.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.