Multi-card e multi-node · Primcast LLC · desde 2004

Ir mais largo não é o mesmo negócio que ir maior.

Uma placa em uma máquina é uma questão resolvida, e é precificada placa por placa na página de GPU. Esta começa onde aquela termina: uma segunda placa no mesmo chassi, ou uma segunda máquina ao lado da primeira. Parecem a mesma decisão e são opostas — a plataforma aqui que dá a uma placa o maior número de pistas tem o menor teto de rede e fica no menor número de salas. Ninguém publica isso sobre o próprio catálogo. É a primeira tabela abaixo.

Compare as plataformas O que une duas máquinas

Cada máquina é um inquilino, cada placa é passada diretamente para o seu próprio sistema operacional, e nada aqui conta um byte entre os seus nós.

O registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Lido do catálogo de pedidos quando esta página foi servida, não digitado. O que está em um rack esta manhã é uma pergunta diferente, e servidores instantâneos é onde ela é respondida.

Transforme suas GPUs em receita mensal passiva

Tem configurações de GPU de servidor ou desktop ociosas? Anuncie-as no marketplace da Primcast hoje e ganhe aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação de nível de produção.

Ir para o Marketplace

Duas perguntas diferentes

Qual delas você está realmente fazendo?

As pessoas chegam aqui tendo decidido “preciso de mais” sem ter decidido mais de quê. As duas respostas custam diferente, são entregues de forma diferente e são limitadas por coisas diferentes, então vale a pena ser explícito antes de ler outra linha.

Mais placa em uma máquina

Uma segunda placa no mesmo chassi

Você está com falta de memória de placa, ou falta de vazão, e todo o resto da máquina está bem. Esta é uma configuração que orçamos em vez de uma caixa que você marca no checkout, porque quantas placas cabem depende da largura física da placa específica e do orçamento de energia do chassi específico — dois fatos que não estão em um catálogo e que não vamos adivinhar.

O que decide: a placa, não a plataforma. Pergunte com a peça nomeada e a resposta nomeia o chassi, a quantidade e o prazo de entrega.

A coisa que as pessoas esperam e não recebem: duas placas não são uma placa maior. A memória delas só soma se o que você está executando puder dividir um modelo entre ambas — paralelismo de tensor ou pipeline, que todo runtime sério suporta e que custa alguma vazão pelo tráfego entre elas. Para trabalho que já são muitos jobs independentes, duas placas são simplesmente o dobro da máquina e nada precisa mudar.

Mais máquinas ao lado dela

Uma segunda máquina ao lado da primeira

Você ficou sem a máquina em vez de sem a placa: sem sockets, sem memória, sem lugar para colocar o próximo job. Nas melhores plataformas abaixo, esse teto é 2 sockets and 1 TB, e além de qualquer um desses a resposta é outro servidor em vez de um maior.

O que decide: a sala e a porta. Duas máquinas que precisam conversar entre si têm que estar no mesmo prédio, e o que as une é a porta em cada uma delas — comprada por máquina, então o fabric sob quatro nós são quatro portas.

A coisa que as pessoas esperam e não recebem: não há produto de cluster aqui e não há contagem mínima de nós. Cada máquina é pedida, faturada, atualizada e substituída por conta própria, e é por isso que nada nesta página cota um preço de cluster — um cluster é n faturas.

A troca

A plataforma melhor em uma dessas é a pior na outra.

Cada plataforma em que encaixamos uma placa, nos eixos que decidem um cluster em vez de uma única máquina. Leia as duas colunas do meio juntas e todo o argumento desta página está nelas: elas se movem em direções opostas. A geração do barramento é o mesmo número que a página de GPU publica, da mesma tabela, então as duas páginas não podem discordar sobre um link.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Lendo essa tabela

  • Pistas para a placa decidem a rapidez com que os dados cruzam entre o processador e o acelerador. Importa continuamente para um loop de treinamento transmitindo lotes, para uma renderização alimentando dados de cena a cada quadro e para qualquer coisa que transborde da memória da placa. Deixa de importar quase totalmente quando um modelo está residente e permanece lá.
  • Teto de rede decide a rapidez com que uma máquina pode falar com a próxima. É irrelevante para um único servidor fazendo seu próprio trabalho e é a questão inteira para um job dividido entre vários.
  • Salas decide se a escolha está disponível onde você precisa, e é a coluna que as pessoas leem por último e deveriam ler primeiro — veja abaixo.
  • Então: um job que cabe dentro de uma máquina e martela o barramento quer as pistas mais largas e não se importa com a porta. Um job espalhado por várias máquinas quer a porta e pode viver com um barramento mais antigo. Querer ambos ao mesmo tempo é a única combinação que nosso catálogo não tem, e preferimos dizer isso aqui do que depois que você pagou.

Qual placa vai em qualquer um destes, e o que cada uma adiciona por mês, está em servidores dedicados GPU — cada placa que encaixamos, precificada contra a máquina exata a que seu número pertence. Esta página não precifica nenhuma placa, deliberadamente: uma página é dona desse dinheiro.

O que as une

A interconexão é comprada por máquina, e essa é a aritmética que as pessoas erram.

Uma porta é uma propriedade de um servidor. Quatro máquinas em uma determinada velocidade são essa velocidade quatro vezes, todo mês, e é o item de linha que transforma um orçamento de cluster confortável em um desconfortável. Abaixo está a escada com a multiplicação já feita, porque uma página sobre mais de uma máquina que deixa você fazer isso sozinho não está fazendo seu trabalho.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Duas coisas que vale a pena notar antes de escolher um degrau

  • A escada não é linear, então um cluster mais largo pode ser mais barato que um mais rápido. Compare os degraus entre si em vez de contra nada: em vários pontos dessa tabela, duas máquinas um degrau abaixo custam menos que uma máquina um degrau acima, e dão a você duas máquinas. Se isso é uma boa troca depende inteiramente de o seu trabalho se dividir.
  • O topo da escada não está em todas as plataformas. A coluna da direita diz quantas delas alcançam cada velocidade, e os degraus mais rápidos se estreitam para uma plataforma que dá a uma placa um barramento mais antigo. Essa é a mesma troca da tabela acima, chegando da outra direção.

O que não temos, dito claramente

Nada além de uma porta Ethernet entre máquinas está em nosso catálogo. Não há fabric InfiniBand listado e não há ponte placa-a-placa listada, e esta página não vai insinuar uma escrevendo ao redor dela. Se uma configuração precisa de qualquer um, pergunte antes de pedir em vez de depois: a resposta é um orçamento, e a resposta pode ser não. Isso vale mais para você do que uma página que deixa a impressão de que poderia ser sim.

Cada velocidade acima é sem medição em ambas as direções, sem franquia de transferência e sem linha de egresso em nenhuma fatura — então o que seus nós enviam um ao outro é gratuito em qualquer volume, que é a parte que geralmente é medida em outros lugares. Largura de banda sem medição é a página para uma porta considerada por si só, em uma máquina.

Onde pode existir

Para uma máquina você escolhe a plataforma primeiro. Para várias, escolha a sala primeiro.

Máquinas que precisam conversar entre si pertencem ao mesmo prédio, e nossas salas não têm todas as mesmas plataformas. Escolha a plataforma primeiro e você pode descobrir que a sala em que precisa dela não a tem. Isto é derivado do mesmo catálogo que todo o resto, então uma linha que chega em uma nova cidade aparece aqui por conta própria.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Onde o prédio realmente está, a que está conectado e quem mais está nele — data centers descreve todos os cinco. A latência entre duas de nossas cidades é um número real em vez de um de marketing, e o suporte a medirá para o seu par mediante solicitação em vez de deixar você adivinhar por um mapa.

Como é orçado, e em quanto tempo existe

Trabalho multi-node é datado antes de ser pago, não depois.

Uma configuração desse tipo são várias máquinas e muitas vezes várias peças que não estão em uma prateleira, então o honesto a publicar não é uma promessa de entrega, mas a escada de onde a data sai — a mesma que construção sob encomenda e a página de GPU usam, com as mesmas palavras.

  1. ~30 minutos

    As máquinas já estão em rack como estão

    Nada é encaixado e nada é movido. Servidores instantâneos é a lista do que está lá agora, e para um cluster de nós comuns vale a pena ler primeiro.

  2. 4–24 horas

    As peças são as que temos

    O caso comum. Os técnicos encaixam as placas, montam os arrays e instalam os sistemas operacionais — por máquina, em paralelo, não uma após a outra.

  3. 5–10 dias úteis

    Peças precisam ser compradas

    Algo na especificação não é estoque que carregamos. Nós o pedimos, depois montamos. Este é o degrau mais comum para um chassi multi-placa, porque o chassi geralmente é o item mais demorado em vez da placa.

  4. 10–15 dias úteis

    Uma peça está escassa

    Aceleradores da geração atual funcionam por alocação e a data é do distribuidor, não nossa. Nomeamos o item mais demorado antes de você se comprometer em vez de depois. Onde hardware é comprado para um cliente, pedimos três meses adiantados, porque é uma máquina que não podemos realugar se a conta fechar na segunda semana.

Cada degrau começa quando o pedido passa pelo pagamento e pela revisão de fraude, que é o único passo em que não colocaremos uma promessa — a maioria passa em algumas horas, e um primeiro pedido grande de uma conta nova pode levar mais tempo. Para uma configuração desse tamanho, uma transferência bancária ou uma stablecoin geralmente passa mais rápido que um cartão, o que vale a pena saber antes que uma verificação de fraude atrase uma visita ao rack.

Descrever uma configuração multi-node ou multi-placa é mais rápido em uma frase do que em um formulário. — a contagem de nós, se o trabalho se divide e com o que precisa conversar — e alguém que já orçou um desses antes responderá, inclusive quando a resposta for que uma máquina bastaria.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.