Multi-tarjeta y multi-nodo · Primcast LLC · desde 2004

Ir más ancho no es el mismo oficio que ir más grande.

Una tarjeta en una máquina es una cuestión resuelta, y se cotiza tarjeta por tarjeta en la página de GPU. Esta empieza donde aquella termina: una segunda tarjeta en el mismo chasis, o una segunda máquina junto a la primera. Suenan como la misma decisión y son opuestas — la plataforma que aquí da a una tarjeta más carriles tiene el techo de red más bajo y está en la menor cantidad de salas. Nadie publica eso sobre su propio catálogo. Es la primera tabla de abajo.

Compara las plataformas Qué une dos máquinas

Cada máquina es un solo inquilino, cada tarjeta se pasa directamente a tu propio sistema operativo, y nada aquí cuenta un byte entre tus nodos.

El registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Leído del catálogo de pedidos cuando se sirvió esta página, no escrito a mano. Qué está en un rack esta mañana es una pregunta distinta, y servidores instantáneos es donde se responde.

Convierte tus GPUs en ingresos mensuales pasivos

¿Tienes configuraciones de GPU de servidor o de escritorio sin usar? Publícalas hoy en el marketplace de Primcast y obtén rentas mensuales constantes de equipos de IA, desarrolladores y empresas que necesitan cómputo de grado de producción.

Ir al Marketplace

Dos preguntas distintas

¿Cuál estás haciendo en realidad?

La gente llega aquí habiendo decidido “necesito más” sin haber decidido más de qué. Las dos respuestas cuestan distinto, se entregan distinto y están limitadas por cosas distintas, así que vale la pena ser explícito antes de leer otra línea.

Más tarjeta en una máquina

Una segunda tarjeta en el mismo chasis

Te falta memoria de tarjeta, o te falta rendimiento, y todo lo demás de la máquina está bien. Esto es una configuración que cotizamos en lugar de una casilla que marcas en el checkout, porque cuántas tarjetas caben depende del ancho físico de la tarjeta específica y del presupuesto de energía del chasis específico — dos hechos que no están en un catálogo y que no vamos a adivinar.

Qué lo decide: la tarjeta, no la plataforma. Pregunta con la pieza nombrada y la respuesta nombra el chasis, la cantidad y el plazo de entrega.

Lo que la gente espera y no obtiene: dos tarjetas no son una tarjeta más grande. Su memoria solo se suma si lo que ejecutas puede dividir un modelo entre ambas — paralelismo de tensor o de pipeline, que todo runtime serio soporta y que te cuesta algo de rendimiento por el tráfico entre ellas. Para trabajo que ya son muchos trabajos independientes, dos tarjetas son simplemente el doble de máquina y nada tiene que cambiar.

Más máquinas junto a ella

Una segunda máquina junto a la primera

Te has quedado sin máquina más que sin tarjeta: sin sockets, sin memoria, sin dónde poner el siguiente trabajo. En la mejor de las plataformas de abajo, ese techo es 2 sockets and 1 TB, y pasado cualquiera de esos la respuesta es otro servidor en lugar de uno más grande.

Qué lo decide: la sala y el puerto. Dos máquinas que tienen que hablarse tienen que estar en el mismo edificio, y lo que las une es el puerto en cada una de ellas — comprado por máquina, así que la fábrica bajo cuatro nodos son cuatro puertos.

Lo que la gente espera y no obtiene: aquí no hay producto de clúster ni cantidad mínima de nodos. Cada máquina se pide, se factura, se actualiza y se reemplaza por su cuenta, por eso nada en esta página cotiza un precio de clúster — un clúster son n facturas.

El oficio

La plataforma mejor en una de esas es la peor en la otra.

Cada plataforma a la que adaptamos una tarjeta, en los ejes que deciden un clúster en lugar de una sola máquina. Lee las dos columnas del medio juntas y todo el argumento de esta página está en ellas: se mueven en direcciones opuestas. La generación del bus es la misma cifra que publica la página de GPU, de la misma tabla, así que las dos páginas no pueden discrepar sobre un enlace.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Leer esa tabla

  • Carriles hacia la tarjeta deciden qué tan rápido cruzan los datos entre el procesador y el acelerador. Importa continuamente para un bucle de entrenamiento que transmite lotes, para un render que alimenta datos de escena cada fotograma, y para cualquier cosa que se desborde de la memoria de la tarjeta. Deja de importar casi por completo una vez que un modelo está residente y se queda ahí.
  • Techo de red decide qué tan rápido puede hablar una máquina con la siguiente. Es irrelevante para un solo servidor haciendo su propio trabajo y es la cuestión entera para un trabajo dividido entre varios.
  • Salas decide si la opción está disponible donde la necesitas en absoluto, y es la columna que la gente lee al final y debería leer primero — ver abajo.
  • Entonces: un trabajo que cabe dentro de una máquina y martillea el bus quiere los carriles más anchos y no le importa el puerto. Un trabajo repartido entre varias máquinas quiere el puerto y puede vivir con un bus más viejo. Querer ambos a la vez es la única combinación que nuestro catálogo no tiene, y preferimos decirlo aquí antes que después de que hayas pagado.

Qué tarjeta va en cualquiera de estas, y cuánto suma cada una al mes, es servidores dedicados GPU — cada tarjeta que adaptamos, cotizada contra la máquina exacta a la que pertenece su cifra. Esta página no cotiza ninguna tarjeta, deliberadamente: una sola página es dueña de ese dinero.

Qué las une

La interconexión se compra por máquina, y esa es la aritmética que la gente calcula mal.

Un puerto es una propiedad de un servidor. Cuatro máquinas a una velocidad dada son esa velocidad cuatro veces, cada mes, y es la partida que convierte un presupuesto de clúster cómodo en uno incómodo. Abajo está la escalera con la multiplicación ya hecha, porque una página sobre más de una máquina que te deja hacerla tú mismo no está haciendo su trabajo.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Dos cosas que vale la pena notar antes de elegir un peldaño

  • La escalera no es lineal, así que un clúster más ancho puede ser más barato que uno más rápido. Compara los peldaños entre sí en lugar de contra nada: en varios puntos de esa tabla, dos máquinas un peldaño más abajo cuestan menos que una máquina un peldaño más arriba, y te dan dos máquinas. Si eso es un buen trato depende por completo de si tu trabajo se divide.
  • La cima de la escalera no está en todas las plataformas. La columna de la derecha dice cuántas de ellas alcanzan cada velocidad, y los peldaños más rápidos se estrechan a una plataforma que da a una tarjeta un bus más viejo. Ese es el mismo trato que la tabla de arriba, llegando desde la otra dirección.

Lo que no tenemos, dicho con claridad

Nada más allá de un puerto Ethernet entre máquinas está en nuestro catálogo. No hay fábrica InfiniBand listada ni puente tarjeta a tarjeta listado, y esta página no va a insinuar uno escribiendo alrededor de ello. Si una configuración necesita cualquiera de los dos, pregunta antes de pedir en lugar de después: la respuesta es una cotización, y la respuesta puede ser no. Eso vale más para ti que una página que deja la impresión de que podría ser sí.

Cada velocidad de arriba es sin medición en ambas direcciones, sin asignación de transferencia y sin línea de salida en ninguna factura — así que lo que tus nodos se envían entre sí es gratis a cualquier volumen, que es la parte que normalmente se mide en otros lugares. Ancho de banda sin medición es la página para un puerto considerado por sí solo, en una máquina.

Dónde puede existir

Para una máquina eliges la plataforma primero. Para varias, elige la sala primero.

Las máquinas que tienen que hablarse entre sí pertenecen al mismo edificio, y nuestras salas no todas tienen las mismas plataformas. Elige la plataforma primero y puedes descubrir que la sala donde la necesitas no la tiene. Esto se deriva del mismo catálogo que todo lo demás, así que una línea que llega a una ciudad nueva aparece aquí por su cuenta.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Dónde está realmente el edificio, a qué está conectado y quién más está en él — centros de datos describe los cinco. La latencia entre dos de nuestras ciudades es un número real en lugar de uno de marketing, y soporte la medirá para tu par a petición en lugar de que adivines desde un mapa.

Cómo se cotiza, y qué tan pronto existe

El trabajo multi-nodo se fecha antes de pagarse, no después.

Una configuración de este tipo son varias máquinas y a menudo varias piezas que no están en un estante, así que lo honesto de publicar no es una promesa de entrega sino la escalera de la que sale la fecha — la misma que construcción a pedido y la página de GPU usan, con las mismas palabras.

  1. ~30 minutos

    Las máquinas ya están en rack tal como están

    Nada se instala y nada se mueve. Servidores instantáneos es la lista de lo que está ahí ahora mismo, y para un clúster de nodos ordinarios vale la pena leerla primero.

  2. 4–24 horas

    Las piezas son de las que tenemos

    El caso ordinario. Los técnicos instalan las tarjetas, construyen los arreglos e instalan los sistemas operativos — por máquina, en paralelo, no una tras otra.

  3. 5–10 días hábiles

    Hay que comprar piezas

    Algo en la especificación no es stock que llevamos. Lo pedimos, luego construimos. Este es el peldaño más común para un chasis multi-tarjeta, porque el chasis suele ser el palo largo en lugar de la tarjeta.

  4. 10–15 días hábiles

    Una pieza escasea

    Los aceleradores de la generación actual funcionan por asignación y la fecha es del distribuidor, no nuestra. Nombramos el palo largo antes de que te comprometas en lugar de después. Donde el hardware se compra para un cliente pedimos tres meses por adelantado, porque es una máquina que no podemos volver a alquilar si la cuenta se cierra en la semana dos.

Cada peldaño empieza cuando el pedido pasa el pago y la revisión de fraude, que es el único paso al que no le pondremos una promesa — la mayoría pasa en un par de horas, y un primer pedido grande de una cuenta nueva puede tardar más. Para una configuración de este tamaño una transferencia o una stablecoin normalmente pasa más rápido que una tarjeta, lo que vale la pena saber antes de que una verificación de fraude retrase una visita al rack.

Describir una configuración multi-nodo o multi-tarjeta es más rápido en una frase que en un formulario. — la cantidad de nodos, si el trabajo se divide, y con qué tiene que hablar — y alguien que ha cotizado una de estas antes responderá, incluso cuando la respuesta sea que una sola máquina bastaría.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.