Wiele kart i wiele węzłów · Primcast LLC · od 2004

Poszerzanie to nie to samo co powiększanie.

Jedna karta w jednej maszynie to sprawa zamknięta i wyceniana karta po karcie na stronie GPU. Ta zaczyna się tam, gdzie tamta się kończy: druga karta w tej samej obudowie albo druga maszyna obok pierwszej. Brzmią jak ta sama decyzja, a są przeciwieństwami — platforma, która daje karcie najwięcej linii, ma najniższy pułap sieciowy i stoi w najmniejszej liczbie pomieszczeń. Nikt nie publikuje tego o własnym katalogu. To pierwsza tabela poniżej.

Porównaj platformy Co łączy dwie maszyny

Każda maszyna to jeden najemca, każda karta jest przekazywana do twojego własnego systemu operacyjnego i nic tutaj nie liczy bajta między twoimi węzłami.

Rejestr

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

Odczytany z katalogu zamówień w momencie wyświetlenia tej strony, nie wpisany ręcznie. To, co stoi w szafie dziś rano, to inne pytanie, a serwery natychmiastowe to miejsce, gdzie znajdziesz odpowiedź.

Dwa różne pytania

Które z nich naprawdę zadajesz?

Ludzie trafiają tutaj po podjęciu decyzji „potrzebuję więcej”, nie decydując, czego więcej. Te dwie odpowiedzi kosztują inaczej, są dostarczane inaczej i ograniczają je inne rzeczy, więc warto to sprecyzować, zanim przeczytasz kolejny wiersz.

Więcej karty w jednej maszynie

Druga karta w tej samej obudowie

Brakuje ci pamięci karty albo przepustowości, a cała reszta maszyny jest w porządku. To konfiguracja, którą wyceniamy, a nie pole, które zaznaczasz w koszyku, bo to, ile kart się zmieści, zależy od fizycznej szerokości konkretnej karty i budżetu mocy konkretnej obudowy — dwóch faktów, których nie ma w katalogu i których nie będziemy zgadywać.

Co o tym decyduje: karta, nie platforma. Zapytaj, podając nazwę części, a w odpowiedzi podamy obudowę, liczbę i czas realizacji.

To, czego ludzie oczekują, a czego nie dostają: dwie karty to nie jedna większa karta. Ich pamięć sumuje się tylko wtedy, gdy to, co uruchamiasz, potrafi podzielić model na obie — równoległość tensorowa lub potokowa, którą wspiera każde poważne środowisko uruchomieniowe i która kosztuje cię część przepustowości na ruch między nimi. Dla pracy, która już składa się z wielu niezależnych zadań, dwie karty to po prostu dwa razy większa maszyna i nic nie musi się zmieniać.

Więcej maszyn obok niej

Druga maszyna obok pierwszej

Skończyła ci się maszyna, a nie karta: gniazda, pamięć, miejsce na kolejne zadanie. Na najlepszej z poniższych platform ten pułap to 2 sockets and 1 TB, a po przekroczeniu któregokolwiek z nich odpowiedzią jest kolejny serwer, a nie większy.

Co o tym decyduje: pomieszczenie i port. Dwie maszyny, które muszą ze sobą rozmawiać, muszą być w tym samym budynku, a łączy je port na każdej z nich — kupowany na maszynę, więc sieć pod czterema węzłami to cztery porty.

To, czego ludzie oczekują, a czego nie dostają: nie ma tutaj produktu klastrowego ani minimalnej liczby węzłów. Każda maszyna jest zamawiana, rozliczana, rozbudowywana i wymieniana osobno, dlatego nic na tej stronie nie podaje ceny klastra — klaster to n faktur.

Kompromis

Platforma najlepsza w jednym jest najgorsza w drugim.

Każda platforma, do której montujemy kartę, na osiach decydujących o klastrze, a nie o pojedynczej maszynie. Przeczytaj dwie środkowe kolumny razem, a cały argument tej strony jest w nich: poruszają się w przeciwnych kierunkach. Generacja magistrali to ta sama liczba, którą publikuje strona GPU, z tej samej tabeli, więc obie strony nie mogą się różnić co do łącza.

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Jak czytać tę tabelę

  • Linie do karty decydują o tym, jak szybko dane przepływają między procesorem a akceleratorem. Ma to ciągłe znaczenie dla pętli treningowej przesyłającej partie, dla renderowania podającego dane sceny w każdej klatce i dla wszystkiego, co wylewa się z pamięci karty. Przestaje mieć znaczenie niemal całkowicie, gdy model jest rezydentny i tam pozostaje.
  • Pułap sieciowy decyduje o tym, jak szybko jedna maszyna może rozmawiać z następną. Jest nieistotny dla pojedynczego serwera wykonującego własną pracę i jest całym pytaniem dla zadania podzielonego na kilka.
  • Pomieszczenia decydują o tym, czy wybór jest w ogóle dostępny tam, gdzie go potrzebujesz, i to kolumna, którą ludzie czytają na końcu, a powinni czytać najpierw — patrz poniżej.
  • Więc: zadanie, które mieści się w jednej maszynie i mocno obciąża magistralę, chce najszerszych linii i nie dba o port. Zadanie rozłożone na kilka maszyn chce portu i może żyć ze starszą magistralą. Chęć posiadania obu naraz to jedyna kombinacja, której nie ma w naszym katalogu, i wolimy powiedzieć to tutaj niż po tym, jak zapłacisz.

Która karta pasuje do którejkolwiek z nich i ile każda dodaje miesięcznie, to dedykowane serwery GPU — każda karta, którą montujemy, wyceniona względem dokładnej maszyny, do której należy jej liczba. Ta strona celowo nie wycenia żadnej karty: jedna strona zarządza tymi pieniędzmi.

Co je łączy

Interkonekt kupuje się na maszynę i to jest arytmetyka, którą ludzie mylą.

Port to właściwość jednego serwera. Cztery maszyny przy danej prędkości to ta prędkość cztery razy, co miesiąc, i to pozycja, która zamienia wygodny budżet klastra w niewygodny. Poniżej jest drabina z już wykonanym mnożeniem, bo strona o więcej niż jednej maszynie, która każe ci to robić samemu, nie wykonuje swojej pracy.

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

Dwie rzeczy warte zauważenia, zanim wybierzesz szczebel

  • Drabina nie jest liniowa, więc szerszy klaster może być tańszy niż szybszy. Porównuj szczeble ze sobą, a nie z niczym: w kilku punktach tej tabeli dwie maszyny o szczebel niżej kosztują mniej niż jedna maszyna o szczebel wyżej i dają ci dwie maszyny. Czy to dobry kompromis, zależy wyłącznie od tego, czy twoja praca się dzieli.
  • Szczyt drabiny nie jest na każdej platformie. Prawa kolumna mówi, ile z nich osiąga każdą prędkość, a najszybsze szczeble zawężają się do platformy, która daje karcie starszą magistralę. To ten sam kompromis co w tabeli powyżej, tylko z drugiej strony.

Czego nie mamy, powiedziane wprost

W naszym katalogu nie ma nic poza portem Ethernet między maszynami. Nie ma wymienionej sieci InfiniBand ani wymienionego mostka karta-karta, a ta strona nie zamierza sugerować żadnego z nich, pisząc wokół tematu. Jeśli konfiguracja wymaga któregokolwiek, zapytaj przed zamówieniem, a nie po: odpowiedzią jest wycena, a odpowiedź może brzmieć nie. To warte dla ciebie więcej niż strona, która pozostawia wrażenie, że mogłaby brzmieć tak.

Każda prędkość powyżej jest nielimitowana w obu kierunkach, bez limitu transferu i bez pozycji egress na żadnej fakturze — więc to, co twoje węzły wysyłają do siebie, jest darmowe w dowolnej ilości, a to część, która gdzie indziej zwykle jest limitowana. Nielimitowana przepustowość to strona o porcie rozpatrywanym samodzielnie, na jednej maszynie.

Gdzie to może istnieć

Dla jednej maszyny najpierw wybierasz platformę. Dla kilku najpierw wybierz pomieszczenie.

Maszyny, które muszą ze sobą rozmawiać, należą do tego samego budynku, a nasze pomieszczenia nie wszystkie mają te same platformy. Wybierz najpierw platformę, a może się okazać, że pomieszczenie, w którym jej potrzebujesz, jej nie ma. To pochodzi z tego samego katalogu co wszystko inne, więc linia pojawiająca się w nowym mieście pojawia się tutaj sama.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Gdzie naprawdę jest budynek, do czego jest podłączony i kto jeszcze w nim jest — centra danych opisują wszystkie pięć. Opóźnienie między dwoma naszymi miastami to liczba rzeczywista, a nie marketingowa, a wsparcie zmierzy je dla twojej pary na życzenie, zamiast kazać ci zgadywać z mapy.

Jak to jest wyceniane i jak szybko powstaje

Praca wielowęzłowa ma datę przed zapłatą, nie po.

Taka konfiguracja to kilka maszyn i często kilka części, których nie ma na półce, więc uczciwą rzeczą do opublikowania nie jest obietnica dostawy, ale drabina, z której schodzi data — ta sama, której używają budowa na zamówienie i strona GPU, w tych samych słowach.

  1. ~30 minut

    Maszyny są już w szafie tak, jak są

    Nic nie jest montowane i nic nie jest przenoszone. Serwery natychmiastowe to lista tego, co stoi tam w tej chwili, a dla klastra zwykłych węzłów warto przeczytać ją najpierw.

  2. 4–24 godziny

    Części to te, które mamy

    Zwykły przypadek. Technicy montują karty, budują macierze i instalują systemy operacyjne — na maszynę, równolegle, nie jedna po drugiej.

  3. 5–10 dni roboczych

    Części trzeba dokupić

    Coś w specyfikacji nie jest stanem, który trzymamy. Zamawiamy to, potem budujemy. To najczęstszy szczebel dla obudowy wielokartowej, bo zwykle to obudowa jest wąskim gardłem, a nie karta.

  4. 10–15 dni roboczych

    Część jest deficytowa

    Akceleratory obecnej generacji działają na przydziałach, a data należy do dystrybutora, nie do nas. Wskazujemy wąskie gardło, zanim się zobowiążesz, a nie po. Gdy sprzęt jest kupowany dla jednego klienta, prosimy o trzy miesiące z góry, bo to maszyna, której nie możemy wynająć ponownie, jeśli konto zamknie się w drugim tygodniu.

Każdy szczebel zaczyna się, gdy zamówienie przejdzie płatność i kontrolę antyfraudową, a to jedyny krok, na który nie złożymy obietnicy — większość przechodzi w ciągu kilku godzin, a duże pierwsze zamówienie z nowego konta może potrwać dłużej. Przy konfiguracji tej wielkości przelew lub stablecoin zwykle przechodzi szybciej niż karta, co warto wiedzieć, zanim kontrola antyfraudowa opóźni wizytę w szafie.

Opisanie konfiguracji wielowęzłowej lub wielokartowej jest szybsze w zdaniu niż w formularzu. — liczba węzłów, czy praca się dzieli i z czym ma rozmawiać — a odpowie ktoś, kto już wcześniej wyceniał coś takiego, także wtedy, gdy odpowiedź brzmi, że wystarczy jedna maszyna.

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.