Multitarjeta y multinodo · Primcast LLC · desde 2004

Ampliar el alcance no es lo mismo que ampliarlo.

Una tarjeta en una máquina es una cuestión resuelta, y su precio se indica individualmente en la página de la GPU. Esta situación comienza donde termina la anterior: una segunda tarjeta en el mismo chasis, o una segunda máquina junto a la primera. Aunque parezcan la misma decisión, son opuestas: la plataforma que proporciona a la tarjeta el mayor número de carriles tiene el menor límite de red y ocupa menos espacio. Nadie publica esa información sobre su propio catálogo. Se trata de la primera tabla que aparece a continuación.

Compara las plataformas ¿Qué une a dos máquinas?

Cada máquina es un inquilino, cada tarjeta se transfiere a su propio sistema operativo y aquí nada cuenta un byte entre sus nodos.

El registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Esta página se consultó directamente del catálogo de pedidos, no se introdujo manualmente. Lo que hay en un rack esta mañana es otra cuestión, y la respuesta se encuentra en los servidores instantáneos .

Dos preguntas diferentes

¿A cuál te refieres exactamente?

La gente llega aquí habiendo decidido "Necesito más" sin haber decidido qué. Ambas respuestas tienen precios diferentes, se ofrecen de forma diferente y están limitadas por factores distintos, por lo que conviene ser explícito antes de seguir leyendo.

Más tarjetas en una sola máquina

Una segunda tarjeta en el mismo chasis

Te falta memoria para la tarjeta o velocidad de transferencia, pero el resto del equipo funciona correctamente. Esta es una configuración que te ofrecemos, no una opción que marcas al finalizar la compra, ya que la cantidad de tarjetas que caben depende del ancho físico de cada tarjeta y del consumo energético del chasis; dos datos que no figuran en un catálogo y que no podemos adivinar.

Lo que lo decide: la tarjeta, no la plataforma. Pregunta mencionando la pieza y la respuesta indicará el chasis, la cantidad y el plazo de entrega.

Lo que la gente espera y no entiende: dos tarjetas no son una sola tarjeta más grande. Su memoria se suma solo si el proceso que se ejecuta puede dividir un modelo entre ambas (paralelismo tensorial o de canalización), que todos los entornos de ejecución serios admiten y que reduce el rendimiento debido al tráfico entre ellas. Para tareas que ya constan de muchos procesos independientes, dos tarjetas simplemente duplican la capacidad de la máquina y no es necesario cambiar nada.

Más máquinas a su lado

Una segunda máquina junto a la primera

Te has quedado sin recursos de la máquina, no de la tarjeta: sin zócalos, sin memoria, sin espacio para la siguiente tarea. En las mejores plataformas que se mencionan a continuación, ese límite lo alcanza 2 sockets and 1 TB , y más allá de cualquiera de ellas, la solución es otro servidor en lugar de uno más potente.

Lo que lo determina: la sala y el puerto. Dos máquinas que necesitan comunicarse entre sí deben estar en el mismo edificio, y lo que las une es el puerto de cada una de ellas; se compra por máquina, por lo que la red bajo cuatro nodos tiene cuatro puertos.

Lo que la gente espera y no encuentra: aquí no hay un producto de clúster ni un número mínimo de nodos. Cada máquina se pide, factura, actualiza y reemplaza individualmente, por lo que en esta página no se indica el precio de un clúster; un clúster se compone de n facturas.

El comercio

La plataforma que destaca en una de esas áreas es la peor en la otra.

Cada plataforma a la que adaptamos una tarjeta se basa en los ejes que definen un clúster en lugar de una sola máquina. Si leemos las dos columnas centrales juntas, todo el argumento de esta página se encuentra en ellas: se mueven en direcciones opuestas. La generación del bus es la misma cifra que publica la página de la GPU, de la misma tabla, por lo que ambas páginas no pueden discrepar sobre un enlace.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Leyendo esa tabla

  • Los canales de la tarjeta determinan la velocidad de transferencia de datos entre el procesador y el acelerador. Esto es fundamental para un bucle de entrenamiento que procesa lotes de datos, para un renderizado que alimenta la escena con datos en cada fotograma y para cualquier proceso que supere la capacidad de la memoria de la tarjeta. Deja de ser relevante casi por completo una vez que un modelo reside en la tarjeta y permanece allí.
  • El límite de velocidad de la red determina la rapidez con la que una máquina puede comunicarse con la siguiente. Es irrelevante para un servidor que realiza su propio trabajo, pero es un factor crucial para una tarea que se distribuye entre varios servidores.
  • La sección "Habitaciones" determina si la opción está disponible donde la necesitas, y es la columna que la gente lee al final y que debería leer primero (ver más abajo).
  • Así pues: un trabajo que se realiza en una sola máquina y que requiere mucho esfuerzo físico necesita los carriles más amplios y no le importa el puerto. Un trabajo que se realiza en varias máquinas necesita el puerto y puede funcionar con un autobús más antiguo. Querer ambas cosas a la vez es la única combinación que no ofrece nuestro catálogo, y preferimos decírselo aquí antes que después de que haya pagado.

La tarjeta gráfica que se incluye en cada una de estas máquinas, y el coste mensual de cada una, se encuentran en los servidores dedicados con GPU . Cada tarjeta que instalamos tiene su precio en función de la máquina específica a la que pertenece. Esta página no incluye el precio de ninguna tarjeta, deliberadamente: ese dinero ya está reservado para otra página.

¿Qué los une?

La interconexión se compra por máquina, y ahí es donde la gente se equivoca con los cálculos.

Un puerto es propiedad de un servidor. Cuatro máquinas a una velocidad determinada implican esa velocidad cuatro veces al mes, y es el gasto que convierte un presupuesto de clúster cómodo en uno incómodo. A continuación se muestra la escala con la multiplicación ya realizada, porque una página sobre más de una máquina que te deja a ti la tarea de calcularla no cumple su función.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Dos cosas que vale la pena tener en cuenta antes de elegir un peldaño

  • La escala no es lineal, por lo que un clúster más amplio puede ser más económico que uno más rápido. Compare los peldaños entre sí en lugar de compararlos con nada: en varios puntos de esa tabla, dos máquinas un peldaño más bajas cuestan menos que una máquina un peldaño más alta, y le proporcionan dos máquinas. Si esto es un buen negocio depende completamente de si su trabajo se divide.
  • La parte superior de la escalera no está en todas las plataformas. La columna de la derecha indica cuántas de ellas alcanzan cada velocidad, y los peldaños más rápidos se estrechan hasta una plataforma que asigna un autobús más antiguo. Es el mismo intercambio que en la tabla anterior, pero desde la dirección opuesta.

Lo que no tenemos, dicho claramente

Nuestro catálogo solo incluye un puerto Ethernet entre máquinas. No disponemos de ninguna red InfiniBand ni de puentes de tarjeta a tarjeta, y esta página no pretende dar a entender que los tengamos. Si su configuración requiere alguno de estos componentes, pregunte antes de realizar el pedido, no después: recibirá un presupuesto, y la respuesta podría ser negativa. Esto le resultará más útil que una página que dé la impresión de que la respuesta podría ser afirmativa.

Todas las velocidades mencionadas anteriormente son ilimitadas en ambas direcciones, sin límite de transferencia ni línea de salida en ninguna factura; por lo tanto, lo que sus nodos envían entre sí es gratuito, independientemente del volumen, que es la parte que normalmente se factura en otros lugares. El ancho de banda ilimitado se refiere a un puerto considerado de forma independiente, en una sola máquina.

Donde pueda existir

Para una sola máquina, primero elige la plataforma. Para varias, primero elige la sala.

Las máquinas que necesitan comunicarse entre sí pertenecen al mismo edificio, y nuestras salas no disponen de las mismas plataformas. Si selecciona primero la plataforma, puede que descubra que la sala donde la necesita no la tiene. Esto se deriva del mismo catálogo que todo lo demás, por lo que una línea que llega a una nueva ciudad aparece aquí por separado.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

La ubicación exacta del edificio, sus conexiones y las demás personas que lo ocupan: el término " centro de datos" describe los cinco aspectos. La latencia entre dos de nuestras ciudades es un dato real, no una cifra publicitaria, y el equipo de soporte la medirá para su par de ciudades si lo solicita, en lugar de que usted la calcule a partir de un mapa.

Cómo se cita y cuán pronto existe

El trabajo multinodo se fecha antes de ser pagado, no después.

Un montaje de este tipo implica varias máquinas y, a menudo, varias piezas que no están en stock, por lo que lo honesto que se puede publicar no es una promesa de entrega, sino la fecha aproximada de lanzamiento: el mismo montaje bajo pedido y el uso de la página de la GPU, en otras palabras.

  1. ~30 minutos

    Las máquinas ya están colocadas en los bastidores tal como están.

    No se ha instalado nada ni se ha movido nada. La lista de servidores instantáneos muestra lo que hay actualmente, y para un clúster de nodos ordinarios, conviene leerla primero.

  2. 4–24 horas

    Las piezas son las que tenemos

    El caso habitual. Los técnicos instalan las tarjetas, ensamblan las matrices e instalan los sistemas operativos, máquina por máquina, en paralelo, no uno tras otro.

  3. 5-10 días laborables

    Las piezas deben comprarse en

    Algunos componentes de las especificaciones no están en stock. Los encargamos y luego los ensamblamos. Este es el método más común para chasis multitarjeta, ya que el chasis suele ser el componente más largo, no la tarjeta.

  4. 10-15 días laborables

    Una parte es escasa

    Los aceleradores de última generación funcionan con un sistema de asignación y la fecha la establece el distribuidor, no nosotros. Le indicamos la fecha límite antes de que se comprometa, no después. Cuando se compra hardware para un solo cliente, solicitamos un pago por adelantado de tres meses, ya que es una máquina que no podemos volver a alquilar si la cuenta se cancela en la segunda semana.

Cada etapa comienza cuando se aprueba el pago y la revisión de fraude del pedido, un paso que no podemos garantizar. La mayoría se procesan en un par de horas, y un primer pedido grande de una cuenta nueva puede tardar más. Para una operación de este tamaño, una transferencia bancaria o una stablecoin suelen procesarse más rápido que una tarjeta, lo cual conviene saber antes de que una verificación de fraude retrase la visita al sistema.

Describir una configuración multinodo o multitarjeta es más rápido en una frase que en un formulario. (la cantidad de nodos, si el trabajo se divide y con qué debe comunicarse) y alguien que haya trabajado con este tipo de configuraciones le responderá, incluso si la respuesta es que una sola máquina sería suficiente.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.