H100 80 GB · A100 80 GB · A100 40 GB

Akceleratory – i czego nie zrobią

Trzy karty stworzone do jednego zadania: przechowywania modelu i wykonywania na nim obliczeń, szybciej niż cokolwiek innego na tej stronie. Posiadają pamięć warstwową, korekcję błędów i możliwość łączenia się ze sobą. Nie mają wyjścia graficznego ani kodera wideo – ani wolnego, ani żadnego – a świadomość tego przed złożeniem zamówienia jest cenniejsza niż jakikolwiek benchmark na tej stronie.

40 i 80 GB Pamięć warstwowa, ECC Brak kodera wideo

Dwie rzeczy, które zaskakują ludzi

Nie potrafią kodować wideo. W ogóle.

Własna macierz obsługi kodowania i dekodowania firmy NVIDIA rejestruje zero silników NVENC na A100 i zero na H100. Dekodują one – pięć silników na A100, siedem na H100 – ale na płycie nie ma enkodera, więc każda klatka generowana przez te karty musi być kodowana przez procesor. Jeśli z Twojego potoku wychodzi wideo, to jest to niewłaściwa półka, a L40S z trzema enkoderami AV1 jest właściwą. To zajmuje jedną stronę w /l40s .

Te karty nie mają również wyjść wyświetlacza. Są to bezgłowe moduły obliczeniowe. Nic, co wymaga bufora ramki — wirtualny pulpit, zdalna stacja robocza, serwer gier — nie powinno się na nich znajdować.

A100 nie jest przestarzały, a karta 40 GB to nie pomyłka

Karta A100 to poprzednia generacja, która odczytuje dane z prędkością 1555 GB/s dla karty 40 GB i 1935 GB/s dla karty 80 GB. W przypadku modelu, który spełnia te wymagania, ta prędkość odczytu decyduje o liczbie tokenów na sekundę, a karta ta znacznie wyprzedza wszystkie karty bez stosu w katalogu. Karta 40 GB wygodnie mieści model z trzydziestoma miliardami parametrów i ośmiobitową precyzją, co stanowi większość rzeczywistych potrzeb użytkowników, a jednocześnie stanowi ułamek miesięcznego kosztu karty H100.

Kup H100, gdy model rzeczywiście potrzebuje Hoppera — silnika transformatorowego, FP8, nowszych jednostek tensorowych — lub gdy przebieg musi zakończyć się szybciej, a nie tylko do końca. Kup A100, gdy pytanie brzmi, czy pasuje i jak szybko odczytuje, co jest częstszym pytaniem.

Specyfikacje, tak jak zostały opublikowane

Dane pochodzą z własnych arkuszy danych firmy NVIDIA oraz tabel specyfikacji Tesli, cytowanych w źródle tej strony. W przypadku braku możliwości odnalezienia danych dotyczących konkretnej części, którą montujemy, strona nie podaje żadnych danych, a jedynie przypuszczenia.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

H100 nie pokazuje liczby rdzeni ani przepustowości powyżej, i to jest celowe. Nasza część jest rejestrowana w magazynie pod liczbą rdzeni należącą do modułu SXM, czyli karty przykręcanej do płyty głównej, a nie do gniazda; 80 GB pamięci HBM2e, którą również rejestruje, należy do karty PCIe, która faktycznie jest instalowana w tych maszynach. Zamiast wybrać jedną i wydrukować ją bez wahania, strona drukuje pamięć, na którą zgadzają się oba źródła, pomijając resztę. Zapytaj nas, a powiemy Ci dokładnie, która płyta trafi do Twojej.

W czym są dobrzy

Jedno zadanie wykonane lepiej niż cokolwiek innego na tej stronie.

Szybkie odczytywanie wagi

Pamięć warstwowa to różnica między tą półką a każdą inną. Po umieszczeniu modelu w pamięci, prędkość generacji zależy od tego, jak szybko karta odczytuje własne wagi, a te odczytują od półtora do dwóch razy szybciej niż najszybsza karta niewarstwowa, jaką montujemy.

Łączenie w jedną przestrzeń adresową

Te części obsługują NVLink, więc dwie z nich w jednej maszynie mogą działać jak jedna większa pula, a nie dwie oddzielne. Karty stacji roboczych i klientów w katalogu w ogóle tego nie umożliwiają. To konstrukcja, którą wyceniamy, a nie opcja zakupu.

Bieganie przez tygodnie bez nadzoru

Korekcja błędów na każdym etapie i sprzęt zaprojektowany do ciągłego obciążenia, a nie do generowania dużych obciążeń. W przypadku treningu mierzonego tygodniami i za prawdziwe pieniądze, nie jest to luksus.

Być tylko twoim

Jeden najemca na maszynę fizyczną, a karta przechodziła bezpośrednio – bez partycji MIG, bez profilu vGPU, bez harmonogramu czasowego i bez niczyjej innej pracy. Gdzie indziej „instancja A100” często jest fragmentem jednej instancji.

Oni trzej obok siebie, a to co siedzi wyżej

Z naszych własnych półek. Wszystkie można zamówić już dziś, w tej samej obudowie, więc pytanie brzmi, który jest warty różnicy.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Ostatni wiersz jest tam, ponieważ jest uczciwym porównaniem, a większość ofert go pomija: RTX PRO 6000 Blackwell ma 96 GB, więcej niż jakikolwiek akcelerator na tej stronie. Przeczytaj jego pamięć i cenę w porównaniu z H100 w tabeli powyżej, zamiast wierzyć nam na słowo. Traci on prędkość odczytu i NVLink; zyskuje natomiast cztery enkodery wideo i ray tracing. Jeśli zastanawiasz się, czy będzie pasować , przeczytaj /rtx60 , zanim zdecydujesz się na ten model.

Do jakiej maszyny wejdą i jakim łączem się tam dostaną

Karta A100 jest kartą PCIe Gen 4, a H100 Gen 5, natomiast nasze platformy to Gen 3 i Gen 4. Z tego powodu karta H100 nigdy nie wykorzystuje w pełni magistrali, dla której została zaprojektowana, na żadnej z maszyn, na których pracujemy, i ta strona informuje o tym, zamiast pozostawiać Cię z dociekliwością.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

To, czy będzie Cię to cokolwiek kosztować, zależy wyłącznie od kształtu pracy. Punkt końcowy wnioskowania, którego wagi są rezydentne, ledwo dotyka slotu i nie zauważy tego. Pętla treningowa przesyłająca strumieniowo nową partię z pamięci hosta na każdym kroku, zauważy to na każdym kroku. Jeśli nie masz pewności, o co chodzi, poinformuj nas o zleceniu przed złożeniem zamówienia — to maszyna, a nie karta, decyduje.

Co tak naprawdę mieści się w 80 GB

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

40-gigabajtowy A100 plasuje się o szczebel niżej w tej samej tabeli: model z trzydziestoma do trzydziestoma czterema miliardami parametrów i ośmiobitową precyzją pasuje, ten sam model z szesnastobitową nie. Model z siedemdziesięcioma miliardami parametrów i szesnastobitową precyzją nie pasuje do żadnej pojedynczej karty, którą sprzedajemy — to konstrukcja dwukartowa i dlatego powyższa linia NVLink ma znaczenie.

Ile kosztują i jakie maszyny wchodzą w ich skład

Karta to jedna linia na fakturze, a maszyna to druga. Obie połówki poniżej pochodzą z jednego odczytu katalogu zamówień, więc cena i specyfikacja obok zawsze są ze sobą powiązane.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Przepustowość jest nielimitowana w obu kierunkach i nie ma opłat za transfer wychodzący, co na tym etapie jest zazwyczaj największym ukrytym kosztem – przebieg treningowy, w którym pobierany jest zbiór danych i wysyłane są punkty kontrolne, przesyła ogromną liczbę bajtów, a opłata za każdy gigabajt transferu wychodzącego jest naliczana za każdy z nich. W cenie jest jeden adres IPv4, nie ma umowy, a domyślny okres wynosi jeden miesiąc. Za każdą inną kartę, którą montujemy, obowiązuje ta sama cena – przeczytaj cały katalog, ceny … Dla maszyn gotowych do użycia już dziś, /instant

Pytania, które ludzie naprawdę zadają na temat tych kart

Czy mogę transkodować wideo na urządzeniu A100 lub H100?

Nie sprzętowo. Żadna z kart nie ma enkodera – matryca wsparcia NVIDIA rejestruje zero silników NVENC na obu – więc kodowanie spada na procesor i działa z prędkością procesora. Dekodują, więc potok, który odczytuje wideo i generuje coś innego niż wideo, jest wystarczający. Jeśli potrzebujesz klatek, karta L40S ma trzy enkodery AV1 i jest znacznie tańsza: /l40s .

Czy karta jest podzielona na instancje MIG?

Nie u nas. Dostajesz całą kartę fizyczną, która jest przekazywana do Twojego własnego systemu operacyjnego, na komputerze, na którym nikt inny nie ma dostępu. Te części obsługują MIG, więc możesz podzielić swoją kartę, jeśli chcesz; to Twoja decyzja na Twoim komputerze, a nie coś, co jest z nią robione, zanim do Ciebie dotrze. Warto to sprawdzić, gdziekolwiek robisz zakupy — wiele ofert „A100” to tylko jeden wycinek jednej karty.

A100 40 GB czy 80 GB?

Najpierw pojemność, potem szybkość odczytu. Jeśli model i jego kontekst mieszczą się w czterdziestu gigabajtach i mają jedną piątą wolnej przestrzeni, mniejsza karta jest lepszym zakupem, a powyższy ranking pokazuje różnicę. Karta 80 GB również odczytuje szybciej – 1935 GB/s w porównaniu z 1555 GB/s – więc jeśli jesteś blisko limitu pojemności lub przepustowości, wybierz większą.

Jakie sterowniki i wersję CUDA mam otrzymać?

Niezależnie od tego, co zainstalujesz. Komputer jest dostarczany z czystym systemem operacyjnym i uprawnieniami roota, a Ty przypinasz sterownik, wersję CUDA i kompilację frameworka do kodu, który został przetestowany. Nic nie zostanie zaktualizowane pod Twoim komputerem. Jeśli wolisz, aby sterownik został zainstalowany przed przekazaniem, zaznacz to w zamówieniu i podaj wersję.

Jak szybko mogę go otrzymać?

Części te najprawdopodobniej zostaną zakupione, a nie zamontowane z magazynu, a Ty dowiesz się, które części będą potrzebne, zanim zapłacisz, a nie dopiero po. Najdłuższy czas realizacji zamówienia, jaki oferujemy, to akcelerator obecnej generacji w ramach alokacji. /instant wyświetla listę maszyn gotowych do natychmiastowego odbioru.