Multicartão e multinó · Primcast LLC · desde 2004

Expandir os horizontes não é o mesmo que expandir os horizontes.

A questão de uma placa de vídeo por máquina é resolvida, e o preço de cada placa é apresentado individualmente na página da GPU. Este ponto começa onde isso termina: uma segunda placa no mesmo gabinete ou uma segunda máquina ao lado da primeira. Parecem decisões semelhantes, mas são opostas — a plataforma que oferece o maior número de pistas para uma placa tem o menor limite de rede e ocupa menos espaço. Ninguém divulga essa informação sobre seu próprio catálogo. Veja a primeira tabela abaixo.

Compare as plataformas O que une duas máquinas?

Cada máquina é um inquilino, cada placa é repassada para o seu próprio sistema operacional e nada aqui contabiliza um byte entre seus nós.

O registro

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

As informações foram lidas do catálogo de pedidos no momento em que esta página foi exibida, não digitadas. O que está armazenado em um rack esta manhã é uma questão diferente, e os servidores instantâneos são onde a resposta é encontrada.

Duas perguntas diferentes

Qual delas você está perguntando exatamente?

As pessoas chegam aqui decididas a "precisar de mais", sem terem decidido mais do quê. As duas soluções têm custos diferentes, são entregues de maneiras diferentes e são limitadas por fatores diferentes, por isso vale a pena ser explícito antes de ler mais alguma coisa.

Mais cartões em uma única máquina.

Uma segunda placa no mesmo chassi.

Você está com falta de memória para cartões ou com baixa taxa de transferência, mas todo o resto da máquina está funcionando perfeitamente. Esta é uma configuração que orçamos, e não uma opção que você marca na finalização da compra, porque a quantidade de cartões que podem ser instalados depende da largura física do cartão específico e da capacidade de energia do chassi — dois fatores que não constam em um catálogo e que não vamos estimar.

O que determina isso: a placa, não a plataforma. Pergunte com o nome da peça e a resposta informará o chassi, a quantidade e o prazo de entrega.

O que as pessoas esperam e não recebem: duas placas de vídeo não são uma placa maior. A memória delas só aumenta se o que você está executando puder dividir um modelo entre as duas — paralelismo de tensores ou de pipeline, que todo ambiente de execução sério suporta e que implica em alguma perda de desempenho devido ao tráfego entre elas. Para trabalhos que já envolvem muitas tarefas independentes, duas placas de vídeo são simplesmente o dobro da capacidade da máquina, e nada precisa ser alterado.

Mais máquinas ao lado.

Uma segunda máquina ao lado da primeira.

Você ficou sem recursos da máquina, e não da placa de vídeo: sem sockets, sem memória, sem espaço para executar a próxima tarefa. Nas melhores plataformas abaixo, esse limite é 2 sockets and 1 TB , e além disso, a solução é outro servidor, e não um maior.

O que determina isso: a sala e a porta. Duas máquinas que precisam se comunicar entre si devem estar no mesmo prédio, e o que as une é a porta em cada uma delas — comprada por máquina, portanto, a rede sob quatro nós possui quatro portas.

O que as pessoas esperam e não encontram: não existe um produto em cluster aqui, nem um número mínimo de nós. Cada máquina é encomendada, faturada, atualizada e substituída individualmente, razão pela qual nada nesta página menciona um preço de cluster — um cluster consiste em n faturas.

O comércio

A plataforma que se destaca em uma dessas áreas é a pior na outra.

Em cada plataforma em que instalamos uma placa, os eixos definem um cluster em vez de uma única máquina. Leia as duas colunas do meio juntas e encontrará nelas todo o argumento desta página: elas se movem em direções opostas. A geração do barramento é o mesmo valor publicado na página da GPU, a partir da mesma tabela, portanto, as duas páginas não podem discordar sobre um link.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Lendo aquela tabela

  • As vias de memória da placa determinam a velocidade com que os dados trafegam entre o processador e o acelerador. Isso é relevante continuamente para um loop de treinamento que envia lotes de dados, para uma renderização que alimenta a cena com dados a cada quadro e para qualquer coisa que transborde da memória da placa. A relevância diminui quase completamente quando um modelo está residente e permanece lá.
  • O limite de rede determina a velocidade com que uma máquina pode se comunicar com outra. É irrelevante para um único servidor executando suas próprias tarefas, mas é crucial para uma tarefa dividida entre várias máquinas.
  • A seção "Rooms" determina se a opção está disponível onde você precisa, e é a coluna que as pessoas leem por último, mas deveriam ler primeiro — veja abaixo.
  • Então: um trabalho que cabe em uma única máquina e que martela o ônibus exige as faixas mais largas e não se importa com o porto. Um trabalho distribuído entre várias máquinas exige o porto e pode funcionar com um ônibus mais antigo. Querer ambos ao mesmo tempo é a única combinação que nosso catálogo não contempla, e preferimos informar isso agora do que depois que você já tiver pago.

Qual placa de vídeo é compatível com cada um desses servidores dedicados a GPUs , e quanto cada uma adiciona por mês? Cada placa que instalamos tem seu preço definido de acordo com a máquina específica à qual ela pertence. Esta página não inclui o preço de nenhuma placa, propositalmente: esse dinheiro é exclusivo desta página.

O que os une

A interconexão é comprada por máquina, e é aí que as pessoas erram na matemática.

Uma porta é uma propriedade de um servidor. Quatro máquinas com uma determinada velocidade representam essa velocidade quatro vezes, todos os meses, e é esse item que transforma um orçamento confortável para um cluster em um orçamento desconfortável. Abaixo está a tabela com a multiplicação já feita, porque uma página sobre mais de uma máquina que deixa você fazer os cálculos por conta própria não está cumprindo sua função.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Duas coisas que vale a pena observar antes de escolher um degrau

  • A hierarquia não é linear, portanto, um conjunto mais amplo de máquinas pode ser mais barato do que um mais rápido. Compare os níveis entre si, em vez de compará-los com nada: em vários pontos dessa tabela, duas máquinas um nível abaixo custam menos do que uma máquina um nível acima, e ainda lhe dão duas máquinas. Se essa troca é vantajosa ou não, depende inteiramente de como seu trabalho é dividido.
  • O topo da escada não está em todas as plataformas. A coluna da direita indica quantas plataformas atingem cada velocidade, e os degraus mais rápidos se estreitam até uma plataforma que dá acesso a um ônibus mais antigo. Trata-se da mesma rota da tabela acima, vinda da direção oposta.

O que não temos, disse claramente.

Nosso catálogo não inclui nada além de uma porta Ethernet entre máquinas. Não há nenhuma estrutura InfiniBand listada, nem nenhuma ponte placa a placa, e esta página não pretende sugerir a existência de nenhuma delas ao omitir esses elementos. Se a sua configuração exigir algum desses itens, pergunte antes de fazer o pedido, e não depois: a resposta será um orçamento, e a resposta pode ser não. Isso vale mais para você do que uma página que dá a impressão de que a resposta pode ser sim.

Todas as velocidades acima são ilimitadas em ambas as direções, sem limite de transferência e sem linha de saída em nenhuma fatura — portanto, o que seus nós enviam uns aos outros é gratuito em qualquer volume, que é a parte que normalmente é cobrada em outros lugares. A largura de banda ilimitada é a página para uma porta considerada isoladamente, em uma única máquina.

Onde isso pode existir

Para uma única máquina, escolha primeiro a plataforma. Para várias máquinas, escolha primeiro a sala.

Máquinas que precisam se comunicar entre si pertencem ao mesmo prédio, e nem todas as nossas salas possuem as mesmas plataformas. Selecione a plataforma primeiro e você poderá descobrir que a sala onde precisa dela não a possui. Isso deriva do mesmo catálogo que tudo o mais, então uma linha que chega a uma nova cidade aparece aqui por conta própria.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

A localização exata do edifício, suas conexões e quem mais o utiliza — os data centers abrangem todos esses cinco aspectos. A latência entre duas de nossas cidades é um número real, não apenas uma estratégia de marketing, e nossa equipe de suporte a medirá para você mediante solicitação, em vez de pedir que você faça uma estimativa com base em um mapa.

Como é citado e quão cedo existe

O trabalho que envolve vários nós é datado antes de ser pago, não depois.

Uma configuração desse tipo envolve várias máquinas e, frequentemente, várias peças que não estão disponíveis em estoque. Portanto, o mais honesto a se publicar não é uma promessa de entrega, mas sim a previsão de quando a configuração será feita — a mesma que é usada na página de especificações da GPU.

  1. Aproximadamente 30 minutos

    As máquinas já estão instaladas nas prateleiras, tal como estão.

    Nada está instalado e nada foi movido. Servidores instantâneos é a lista do que está disponível no momento, e para um cluster de nós comuns, vale a pena lê-la primeiro.

  2. 4–24 horas

    As peças são aquelas que nós seguramos.

    O caso mais comum. Os técnicos encaixam as placas, montam os arrays e instalam os sistemas operacionais — por máquina, em paralelo, não uma após a outra.

  3. 5 a 10 dias úteis

    As peças precisam ser compradas.

    Alguns itens da especificação não estão em nosso estoque. Nós os encomendamos e depois os fabricamos. Este é o modelo mais comum para um chassi com várias placas, pois o chassi geralmente é o componente principal, e não a placa.

  4. 10 a 15 dias úteis

    Uma parte é escassa

    Os aceleradores de última geração funcionam por alocação, e a data é definida pelo distribuidor, não por nós. Informamos o prazo de entrega antes da sua confirmação, e não depois. Quando o hardware é adquirido para um único cliente, solicitamos o pagamento de três meses antecipadamente, pois se trata de uma máquina que não podemos realugar caso a conta seja encerrada na segunda semana.

Cada etapa começa quando o pedido é aprovado, passa pela verificação de pagamento e fraude, que é a única etapa para a qual não podemos garantir um prazo — a maioria dos pedidos é aprovada em algumas horas, e um primeiro pedido grande de uma nova conta pode levar mais tempo. Para uma operação desse porte, uma transferência bancária ou uma stablecoin geralmente são aprovadas mais rapidamente do que um pagamento com cartão, o que é importante saber antes que uma verificação de fraude atrase a visita ao rack.

Descrever uma configuração com vários nós ou placas de vídeo é mais rápido em uma frase do que em um formulário. — a quantidade de nós, se o trabalho é dividido e com o que precisa se comunicar — e alguém que já tenha citado algo parecido antes responderá, inclusive quando a resposta for que uma única máquina seria suficiente.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.