H100 80 GB · A100 80 GB · A100 40 GB

这些加速卡 — 以及它们做不到的事

三张卡只为一件事而生:承载模型并对其做算术,速度比这里任何其他硬件都快。它们拥有堆叠式显存、纠错能力,还能彼此组成资源池。它们没有显示输出,也没有视频编码器 — 不是慢,而是完全没有 — 在下单前了解这一点,比本页任何基准测试都更有价值。

40 和 80 GB 堆叠式显存,ECC 无视频编码器

把您的 GPU 变成每月被动收入

有闲置的服务器或台式机 GPU 配置吗?今天就上架到 Primcast 市场,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租收入。

前往市场

两件让人意外的事

它们完全不能编码视频。

NVIDIA’ 自己的编码与解码支持矩阵显示,A100 上的 NVENC 引擎数量为零,H100 上也是零。它们能解码 — A100 有五个引擎,H100 有七个 — 但板卡上没有编码器,所以这些卡产生的每一帧都必须由处理器来编码。如果您的管线会输出视频,那您选错了货架,带三个 AV1 编码器的 L40S 才是正确选择。详情见 /l40s

这些卡也没有显示输出。它们是纯计算的无头部件。任何需要帧缓冲的东西 — 虚拟桌面、远程工作站、游戏服务器 — 都不该放在它们上面。

A100 并未过时,40 GB 版本也不是错误的选择

A100 是上一代产品,40 GB 版本以 1,555 GB/s 的速度读取权重,80 GB 版本则是 1,935 GB/s。对于能装下的模型,这个读取速率决定了您每秒能获得多少 token,而且它仍然远超目录中所有非堆叠式显存的卡。40 GB 的卡能以八位精度轻松容纳一个三百亿参数的模型,这覆盖了大多数人实际部署的场景,而每月成本只是 H100 的零头。

当模型真正需要 Hopper 架构时 — 比如 Transformer 引擎、FP8、更新的张量核心 — 或者当任务必须尽快完成而不只是完成时,买 H100。当问题在于模型能否装下以及读取速度有多快时,买 A100,而后者才是更常见的问题。

官方公布的规格

数据来自 NVIDIA’ 自己的数据表和 Tesla 规格表,本页源代码中已注明出处。凡无法针对我们实际安装的具体部件核实的数据,本页宁可留空也不猜测。

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

上表中 H100 没有显示核心数和带宽,这是有意为之。我们店铺记录中该部件所标的核心数属于 SXM 模块,那是一种固定在基板上的卡,而非插槽式;而它所记录的 80 GB HBM2e 显存则属于 PCIe 卡,那才是真正装进这些机器的部件。与其从中选一个并自信地印出来,本页只印两种来源都一致的显存数据,其余一概省略。问我们,我们会告诉您装进您机器里的究竟是哪块板。

它们擅长什么

一件事,做得比本站任何其他硬件都好。

快速读取权重

堆叠式显存是这一档与其他所有档位的区别所在。一旦模型常驻显存,生成速度就取决于卡读取自身权重的速度,而这些卡的读取速度比我们安装的最快非堆叠式卡快一倍半到两倍。

汇聚成单一地址空间

这些部件带有 NVLink,因此一台机器中的两块卡可以表现为一个更大的资源池,而不是两个独立单元。目录中的工作站和消费级卡完全做不到这一点。这是需要我们报价的定制方案,而非结账选项。

连续数周无人值守运行

全程纠错,硬件专为持续负载而非短时爆发而设计。对于背后有真金白银、以周为单位的训练任务来说,这不是奢侈功能。

完全属于您

每台物理机只租给一位用户,显卡直接直通 — 没有 MIG 分区,没有 vGPU 配置文件,没有时间片调度器,也没有别人的任务在上面。别处的 “A100 实例” 往往只是其中一块切片。

三卡并排对比,以及更高一档的选择

来自我们自己的货架。所有这些今天都可下单,装在相同的机箱里,所以问题在于哪张卡值得那个差价。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

最后一行之所以存在,是因为这才是诚实的对比,而大多数列表都把它藏了起来:RTX PRO 6000 Blackwell 拥有 96 GB 显存,比本页任何加速卡都多。请在上表中对照 H100 的显存和价格来读它的数据,而不是听我们的一面之词。它牺牲的是读取速率和 NVLink;换来的是四个视频编码器和光线追踪。如果您的问题是 模型能否装下,在决定选这一档之前,先读 /rtx60

它们装进哪台机器,以及在那里获得什么链路

A100 是 PCIe Gen 4 卡,H100 是 Gen 5,而我们的平台是 Gen 3 和 Gen 4。因此,在我们运行的任何机器上,H100 都永远无法获得它设计时所面向的完整总线,本页如实说明,而不是让您自己去发现。

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

这是否会让您付出代价,完全取决于工作负载的形态。权重常驻显存的推理端点几乎不碰插槽,根本察觉不到。每一步都从主机内存流式传输新批次的训练循环,则每一步都会察觉。如果您不确定自己属于哪种,下单前告诉我们任务是什么 — 这决定的是机器,而不是卡。

80 GB 实际能装下什么

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

40 GB 的 A100 对应同一张表低一档的情况:三百亿到三百四十亿参数的模型只有在四比特精度下才勉强装得下,而在八比特精度下,其 34 GB 的权重连最紧的及格线都过不了。七百亿参数的模型在十六比特精度下装不进我们出售的任何单卡 — 那需要双卡方案,也正是上面 NVLink 那一行重要的原因。

那张表回答的是 “这张卡能装下什么”。反过来问 — 一个模型需要多少显存,哪张卡能满足 — 则有专门的页面

它们搭配整机的价格

卡是发票上的一行,机器是另一行。下面两半都来自订单目录的同一次读取,因此价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

带宽双向均不限量,且不收取出站流量费,而在这一档产品上,这通常是别处最大的隐性成本 — 一个训练任务拉入数据集并推送检查点,会移动海量字节,而每 GB 的出站流量都要按量计费。包含一个 IPv4 地址,无合约,默认租期一个月。我们安装的其他所有卡都按同样方式定价,请阅读完整目录及价格。如需今天即可上架的机器,请见 /instant

人们真正会问的关于这些卡的问题

我能在 A100 或 H100 上转码视频吗?

硬件上不行。这两张卡都没有编码器 — NVIDIA’ 的支持矩阵显示两者的 NVENC 引擎数量均为零 — 所以编码工作落到处理器上,以处理器速度运行。它们确实能解码,所以读取视频并输出非视频内容的管线没问题。如果您需要输出视频帧,L40S 有三个 AV1 编码器,而且便宜得多:/l40s。一张卡能承载多少路直播频道,以及装进哪台机器:/transcoding

卡会被切成 MIG 实例吗?

我们不会这么做。您拿到的是整张物理卡直通到您自己的操作系统,机器上没有其他人。这些部件支持 MIG,所以如果您愿意,可以给自己的卡分区;那是您在您自己机器上的决定,而不是在交付给您之前就被做好的事。这一点值得在您购物的任何其他地方核实 — 大量 “A100” 产品只是其中一块切片。

A100 40 GB 还是 80 GB?

先看容量,再看读取速率。如果模型及其上下文能装进四十 GB 且还留有五分之一余量,那么较小的卡是更划算的选择,上面的阶梯图显示了差距。80 GB 的卡读取速度也更快 — 1,935 GB/s 对 1,555 — 所以如果您在容量或吞吐量上接近上限,就选大的。

我能拿到哪个驱动和 CUDA 版本?

您装哪个就是哪个。机器交付时带有干净的操作系统和 root 权限,您可以把驱动、CUDA 版本和框架构建固定到您的代码测试过的任何版本。不会有任何东西在您不知情的情况下升级。如果您希望在交付前就装好驱动,请在订单中说明并指定版本。

多久能拿到?

这些部件最可能是采购而来而非从库存安装,而且您会在付款前而非付款后得知情况。处于配额分配中的当前一代加速卡是我们报价中交期最长的。/instant 列出了现在就已上架就绪的机器。