H100 80 GB · A100 80 GB · A100 40 GB

加速器——以及它们不会做什么

这三张显卡专为一项任务而设计:存储模型并对其进行运算,速度远超其他任何显卡。它们采用堆叠式内存、纠错机制,并且能够相互协作。它们没有显示输出,也没有视频编码器——不是那种慢速的,而是完全没有——在订购之前了解这一点,比本页上的任何基准测试都更有价值。

40 和 80 GB堆叠式内存,ECC无视频编码器

两件让人感到惊讶的事

他们根本无法进行视频编码。

NVIDIA 官方的编码解码支持矩阵显示,A100 和 H100 均未配备 NVENC 编码引擎。它们支持解码(A100 配备五个编码引擎,H100 配备七个),但板载没有编码器,因此这些显卡生成的每一帧都必须由处理器进行编码。如果您的流水线需要输出视频,那么 A100 和 H100 都不合适,而配备三个 AV1 编码器的 L40S 才是理想之选。相关信息请参见/l40s页面。

这些显卡也没有显示输出接口。它们是无头计算设备。任何需要帧缓冲区的应用——例如虚拟桌面、远程工作站或游戏服务器——都不应该运行在这些显卡上。

A100 并没有过时,40GB 的存储卡也不是个错误。

A100 是上一代产品,40GB 容量时读取速度为 1555 GB/s,80GB 容量时为 1935 GB/s。对于合适的模型而言,读取速度决定了每秒可处理的令牌数量,而 A100 的速度远超产品目录中所有非堆叠式存储卡。40GB 容量的存储卡可以轻松存储 300 亿参数、8 位精度的模型,这几乎满足了大多数用户的实际需求,而且每月费用仅为 H100 的一小部分。

如果模型确实需要 Hopper 处理器(即 Transformer 引擎、FP8 和新型张量单元),或者运行必须更快完成而非仅仅完成,则购买 H100。如果主要考虑的是它是否适配以及读取速度如何(这才是更常见的问题),则购买 A100。

已公布的规格说明

数据来自NVIDIA官方数据手册和特斯拉规格表,具体引用见本页来源。对于无法找到与我们所使用的部件完全匹配的数据,本页将不显示任何内容,而仅提供估算值。

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

H100 的页面上没有显示核心数和带宽,这是有意为之。我们的产品在库存中被记录为 SXM 模块的核心数,该模块是一块固定在底板上的卡,而不是插槽式的;它记录的 80 GB HBM2e 内存也属于 PCIe 卡,这才是实际安装在这些机器中的内存。页面并没有随意选择并打印出来,而是只打印了两个来源都认可的内存信息,省略了其他信息。如果您需要,我们可以准确地告诉您您的机器将使用哪块主板。

他们擅长什么

一项工作,比本网站上的其他任何工作都做得更好。

快速读取重量

堆叠式内存是这款存储卡与其他存储卡最大的区别。一旦模型驻留,生成速度就取决于存储卡读取自身权重的速度,而这种存储卡的读取速度比我们目前能装下的最快非堆叠式存储卡快一到两倍。

汇入一个地址空间

这些部件支持 NVLink,因此一台机器上的两个此类部件可以作为一个更大的资源池运行,而不是两个独立的资源池。目录中的工作站和消费级卡完全无法实现这一点。这是我们提供的定制配置方案,而不是可直接购买的选项。

无人看管运行数周

全程纠错,硬件设计也更适合持续负载而非突发负载。对于耗时数周、且有真金白银投入的训练计划而言,这并非奢侈品。

只属于你

每台物理机只供一个租户使用,显卡直通——没有 MIG 分区,没有 vGPU 配置,没有时间片调度器,也没有其他租户的作业占用该显卡。而在其他地方,“A100 实例”通常只是一个实例的切片。

它们三者并排而立,以及它们上方的东西

我们自己的库存产品。所有这些产品现在都可以订购,采用相同的机箱,所以问题是哪一款更值得选择。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

最后一行之所以列出,是因为它才是最真实的对比,而大多数产品介绍都隐藏了这一点:RTX PRO 6000 Blackwell 拥有 96GB 显存,比本页上任何其他加速卡都多。与其听信我们的一面之词,不如直接查看上表中它与 H100 系列的显存和价格对比。它的不足之处在于读取速度和 NVLink 功能;而它的优势在于拥有四个视频编码器和光线追踪功能。如果您担心它是否能装进您的电脑,请在购买前阅读/rtx60 的相关内容。

他们进入哪台机器,以及他们通过哪条线路连接到那里。

A100 是 PCIe Gen 4 卡,H100 是 Gen 5 卡,而我们的平台是 Gen 3 和 Gen 4。因此,在我们运行的任何机器上,H100 都无法获得其设计时所用的全部总线带宽,本页面会明确说明这一点,而不是让您自己去发现。

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

这是否会产生任何费用完全取决于工作的具体形式。权重驻留在内存中的推理端点几乎不会占用卡槽,因此不会产生任何影响。而每一步都从主机内存中加载新批次数据的训练循环,每一步都会产生影响。如果您不确定自己属于哪种情况,请在下单前告知我们您的工作内容——决定使用哪种机器的不是卡,而是工作内容本身。

80GB到底能装下什么?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 80 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

40GB A100 的参数表与上述相同,只是精度降低了一级:一个 8 位精度的 300 亿到 340 亿参数模型可以满足要求,但同样的模型在 16 位精度下则不行。一个 16 位精度的 700 亿参数模型无法满足我们销售的任何单张卡的需求——这需要双卡架构,这也是上面提到的 NVLink 系列如此重要的原因。

它们的成本,以及它们所使用的机器。

发票上的卡片是一行,机器是另一行。以下两部分均来自同一订单目录,因此价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

带宽双向不限量,且无出口流量费用。在其他地方,出口流量费用通常是最大的隐性成本——训练运行会拉取数据集并推送检查点,这会传输大量字节,而每个字节的出口流量都会产生费用。包含一个 IPv4 地址,无需签订合同,默认期限为一个月。其他所有适配的网卡,价格相同,请阅读完整产品目录了解详情。如需购买已安装完毕且可立即使用的机器,请访问/instant

人们实际询问的关于这些卡片的问题

我可以在A100或H100上进行视频转码吗?

硬件方面没有。这两张显卡都没有编码器——NVIDIA 的支持矩阵显示它们都没有 NVENC 引擎——所以编码工作由处理器完成,并以处理器速度运行。它们可以解码,因此读取视频并输出除视频之外的其他内容的流水线是可以的。如果您需要输出帧,L40S 有三个 AV1 编码器,而且价格便宜得多: /l40s

该卡是否被分割成 MIG 实例?

不是我们做的。您会收到一张完整的物理卡,并将其直接连接到您自己的操作系统上,这台机器上不会有其他用户。这些部件支持 MIG 焊接,因此您可以根据需要对卡片进行分区;这是您在自己的机器上进行的操作,而不是在卡片交付给您之前就已经被预先处理过的。这一点值得您在其他任何地方购买时都仔细确认——很多所谓的“A100”产品实际上只是其中的一部分。

A100 40GB 还是 80GB?

首先考虑容量,其次是读取速度。如果模型及其应用场景的容量刚好在 40GB 左右,并且还有五分之一的剩余空间,那么容量较小的存储卡更划算,上面的阶梯图就展示了两者之间的差距。80GB 的存储卡读取速度也更快——1935GB/s 对比 1555GB/s——所以如果你对容量或吞吐量的要求接近上限,那就选择容量更大的存储卡。

我应该使用哪个驱动程序和 CUDA 版本?

无论您安装哪个版本,机器都会预装干净的操作系统和 root 权限,您需要将驱动程序、CUDA 版本和框架构建版本固定到您代码测试所用的版本上。不会在您未安装的情况下进行任何升级。如果您希望在交付前安装驱动程序,请在订单中注明并指定版本。

我最快什么时候可以拿到?

这些部件很可能需要外购而非从库存中直接安装,我们会提前告知您具体情况而不是付款后才告知。目前在售的加速器交货周期最长。/instant 列出了已上架并可立即使用的机器。