H100 80 GB · A100 80 GB · A100 40 GB

Akceleratory — i czego nie zrobią

Trzy karty zbudowane do jednego zadania: utrzymania modelu i wykonywania na nim obliczeń, szybciej niż cokolwiek innego w tym miejscu. Mają pamięć warstwową, korekcję błędów i możliwość łączenia się ze sobą. Nie mają wyjścia obrazu ani kodera wideo — nie wolnego, żadnego — a wiedza o tym przed złożeniem zamówienia jest warta więcej niż jakikolwiek benchmark na tej stronie.

40 i 80 GB Pamięć warstwowa, ECC Bez kodera wideo

Zamień swoje GPU w pasywny miesięczny przychód

Masz nieużywane konfiguracje GPU w serwerze lub komputerze stacjonarnym? Wystaw je już dziś na rynku Primcast i zarabiaj stały miesięczny czynsz od zespołów AI, deweloperów i przedsiębiorstw potrzebujących mocy obliczeniowej klasy produkcyjnej.

Przejdź do Marketplace

Dwie rzeczy, które zaskakują ludzi

Nie potrafią kodować wideo. W ogóle.

Własna macierz wsparcia kodowania i dekodowania NVIDIA odnotowuje zero silników NVENC na A100 i zero na H100. Dekodują — pięć silników na A100, siedem na H100 — ale na płycie nie ma kodera, więc każda klatka wyprodukowana przez te karty musi zostać zakodowana przez procesor. Jeśli z Twojego potoku wychodzi wideo, to zła półka, a L40S z trzema koderami AV1 jest właściwą. To jedna strona dalej, pod /l40s.

Te karty nie mają też wyjść obrazu. To bezgłowe części obliczeniowe. Nic, co oczekuje bufora ramki — wirtualny pulpit, zdalna stacja robocza, serwer gier — nie powinno na nich działać.

A100 nie jest przestarzała, a karta 40 GB nie jest pomyłką

A100 to poprzednia generacja, a odczytuje swoje wagi z prędkością 1 555 GB/s przy 40 GB i 1 935 GB/s przy 80 GB. Dla modelu, który się mieści, ta prędkość odczytu decyduje o tym, ile tokenów na sekundę otrzymasz, i pozostaje daleko przed każdą kartą bez pamięci warstwowej w katalogu. Karta 40 GB wygodnie pomieści model o trzydziestu miliardach parametrów przy precyzji ośmiobitowej, co stanowi większość tego, co ludzie faktycznie serwują, za ułamek miesięcznego kosztu H100.

Kup H100, gdy model naprawdę potrzebuje Hoppera — silnika transformera, FP8, nowszych jednostek tensorowych — albo gdy zadanie musi się skończyć szybciej, a nie po prostu się skończyć. Kup A100, gdy pytanie brzmi, czy się mieści i jak szybko czyta, a to częstsze pytanie.

Specyfikacje, tak jak zostały opublikowane

Dane z własnych arkuszy danych NVIDIA i tabel specyfikacji Tesla, cytowane w źródle tej strony. Tam, gdzie nie udało się potwierdzić wartości dla dokładnie tej części, którą montujemy, ta strona nie drukuje niczego zamiast zgadywać.

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

H100 powyżej nie pokazuje liczby rdzeni ani przepustowości i jest to celowe. Nasza część jest zapisana w sklepie pod liczbą rdzeni należącą do modułu SXM, czyli karty przykręcanej do płyty bazowej, a nie wkładanej do gniazda; zapisana pamięć 80 GB HBM2e należy natomiast do karty PCIe, która faktycznie trafia do tych maszyn. Zamiast wybrać jedną wartość i wydrukować ją z przekonaniem, strona drukuje pamięć, co do której oba źródła się zgadzają, a resztę pomija. Zapytaj nas, a powiemy Ci dokładnie, która płyta trafi do Twojej maszyny.

W czym są dobre

Jedno zadanie, wykonane lepiej niż cokolwiek innego na tej stronie.

Szybkie odczytywanie wag

Pamięć warstwowa to różnica między tą półką a każdą inną. Gdy model jest już rezydentny, szybkość generowania zależy od tego, jak szybko karta potrafi odczytać własne wagi, a te czytają półtora do dwóch razy szybciej niż najszybsza karta bez pamięci warstwowej, którą montujemy.

Łączenie w jedną przestrzeń adresową

Te części mają NVLink, więc dwie z nich w jednej maszynie można skonfigurować tak, aby zachowywały się jak jedna większa pula, a nie dwie osobne. Karty stacji roboczych i konsumenckie w katalogu w ogóle tego nie potrafią. To konfiguracja, którą wyceniamy, a nie opcja w koszyku.

Praca tygodniami bez nadzoru

Korekcja błędów w całym układzie i sprzęt zbudowany do ciągłego obciążenia, a nie do krótkich zrywów. Dla treningu trwającego tygodnie, za którym stoją prawdziwe pieniądze, to nie jest funkcja luksusowa.

Bycie wyłącznie Twoim

Jeden najemca na fizyczną maszynę i karta przekazana bezpośrednio — bez partycji MIG, bez profilu vGPU, bez harmonogramu dzielącego czas i bez cudzego zadania na niej. Gdzie indziej „instancja A100” to często wycinek jednej.

Cała trójka obok siebie i to, co jest wyżej

Z naszych własnych półek. Wszystkie można zamówić już dziś, w tej samej obudowie, więc pytanie brzmi, która jest warta różnicy.

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

Ostatni wiersz jest tam, bo to uczciwe porównanie, a większość ofert je ukrywa: RTX PRO 6000 Blackwell mieści 96 GB, więcej niż jakikolwiek akcelerator na tej stronie. Porównaj jego pamięć i cenę z H100 w tabeli powyżej, zamiast wierzyć nam na słowo w którejkolwiek sprawie. To, co traci, to prędkość odczytu i NVLink; to, co zyskuje, to cztery kodery wideo i ray tracing. Jeśli Twoje pytanie brzmi czy się zmieści, przeczytaj /rtx60, zanim zdecydujesz się na tę półkę.

Do której maszyny trafiają i jakie łącze tam dostają

A100 to karta PCIe Gen 4, a H100 to Gen 5, podczas gdy nasze platformy to Gen 3 i Gen 4. H100 nigdy więc nie dostaje pełnej magistrali, do której została zaprojektowana, na żadnej maszynie, którą prowadzimy, i ta strona mówi to wprost, zamiast zostawiać Cię z odkryciem tego samemu.

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

To, czy coś Cię to kosztuje, zależy wyłącznie od kształtu pracy. Punkt końcowy inferencji, którego wagi są rezydentne, ledwo dotyka gniazda i nie zauważy różnicy. Pętla treningowa przesyłająca świeżą partię z pamięci hosta w każdym kroku zauważy ją w każdym kroku. Jeśli nie jesteś pewien, którym jesteś, powiedz nam, na czym polega zadanie, zanim zamówisz — to decyduje o maszynie, nie o karcie.

Co faktycznie mieści się w 80 GB

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

A100 40 GB mieści tę samą tabelę o szczebel niżej: model o trzydziestu do trzydziestu czterech miliardach parametrów mieści się z zapasem tylko przy czterech bitach, a przy ośmiu bitach jego 34 GB wag nie przechodzi nawet przez najciaśniejszą poprzeczkę. Model siedemdziesięciomiliardowy przy szesnastu bitach nie mieści się na żadnej pojedynczej karcie, którą sprzedajemy — to konfiguracja dwukartowa i powód, dla którego linia NVLink powyżej ma znaczenie.

Ta tabela odpowiada na pytanie „co mieści się w tej karcie”. Pytanie postawione odwrotnie — ile pamięci potrzebuje model i która karta je pomieści — ma swoją własną stronę.

Ile kosztują, z maszynami, do których trafiają

Karta to jedna pozycja na fakturze, a maszyna to druga. Obie połówki poniżej pochodzą z jednego odczytu katalogu zamówień, więc cena i specyfikacja obok niej zawsze do siebie pasują.

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

Przepustowość jest nielimitowana w obu kierunkach bez opłaty za ruch wychodzący, co na tej półce jest zwykle największym ukrytym kosztem gdzie indziej — trening pobierający zbiór danych i wypychający punkty kontrolne przenosi bardzo wiele bajtów, a opłata za każdy gigabajt ruchu wychodzącego jest naliczana za każdy z nich. Jeden adres IPv4 jest w cenie, nie ma umowy, a jeden miesiąc to domyślny okres. Dla każdej innej karty, którą montujemy, wycenionej w ten sam sposób, przeczytaj cały katalog z cenami. Dla maszyn już w szafie i gotowych od zaraz, /instant.

Pytania, które ludzie faktycznie zadają o te karty

Czy mogę transkodować wideo na A100 lub H100?

Nie sprzętowo. Żadna z tych kart nie ma kodera — macierz wsparcia NVIDIA odnotowuje zero silników NVENC na obu — więc kodowanie spada na procesor i działa z prędkością procesora. Dekodują, więc potok, który czyta wideo i produkuje coś innego niż wideo, jest w porządku. Jeśli potrzebujesz klatek na wyjściu, L40S ma trzy kodery AV1 i jest znacznie tańsza: /l40s. Ile kanałów na żywo obsłuży karta i do jakiej maszyny trafia: /transcoding.

Czy karta jest dzielona na instancje MIG?

Nie przez nas. Otrzymujesz całą fizyczną kartę przekazaną do własnego systemu operacyjnego, na maszynie, na której nie ma nikogo innego. Te części obsługują MIG, więc możesz podzielić własną kartę, jeśli chcesz; to Twoja decyzja na Twojej maszynie, a nie coś, co robi się z nią, zanim do Ciebie dotrze. Warto to sprawdzić wszędzie indziej, gdzie robisz zakupy — bardzo wiele ofert „A100” to jeden wycinek jednej.

A100 40 GB czy 80 GB?

Najpierw pojemność, potem prędkość odczytu. Jeśli model i jego kontekst mieszczą się w czterdziestu gigabajtach z jedną piątą zapasu, mniejsza karta to lepszy zakup, a drabinka powyżej pokazuje różnicę. Karta 80 GB czyta też szybciej — 1 935 GB/s wobec 1 555 — więc jeśli jesteś blisko sufitu pod względem pojemności lub przepustowości, weź większą.

Którą wersję sterownika i CUDA otrzymam?

Tę, którą zainstalujesz. Maszyna przyjeżdża z czystym systemem operacyjnym i uprawnieniami root, a Ty przypinasz sterownik, wydanie CUDA i build frameworka do tego, na czym testowano Twój kod. Nic nie aktualizuje się pod Tobą. Jeśli wolisz, aby sterownik został zainstalowany przed przekazaniem, zaznacz to w zamówieniu i podaj wersję.

Jak szybko mogę ją mieć?

To części, które najczęściej są kupowane na zamówienie, a nie montowane ze stanu, i dowiadujesz się o tym przed zapłatą, a nie po. Akcelerator obecnej generacji na przydziale to najdłuższy czas realizacji, jaki podajemy. /instant zawiera listę maszyn już w szafie i gotowych od zaraz.