H100 80 GB · A100 80 GB · A100 40 GB

这些加速卡 — 以及它们做不到的事

三张卡只为一件事而生:承载模型并对其做运算,速度比这里任何其他硬件都快。它们拥有堆叠式显存、纠错能力,还能彼此组成资源池。它们没有显示输出,也没有视频编码器 — 不是慢,而是完全没有 — 在下单前了解这一点,比本页任何基准测试都更有价值。

40 和 80 GB 堆叠式显存,ECC 无视频编码器

把您的 GPU 变成每月被动收入

有闲置的服务器或台式机 GPU 配置吗?今天就上架到 Primcast 市场,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租。

前往市场

两件让人意外的事

它们完全不能编码视频。

NVIDIA’ 自己的编码与解码支持矩阵显示,A100 上的 NVENC 引擎数量为零,H100 上也是零。它们能解码 — A100 有五个引擎,H100 有七个 — 但板上没有编码器,所以这些卡产生的每一帧都必须由处理器来编码。如果您的管线会输出视频,那您选错了货架,带三个 AV1 编码器的 L40S 才是正确选择。详情见 /l40s。

这些卡也没有显示输出。它们是无头计算部件。任何需要帧缓冲的东西 — 虚拟桌面、远程工作站、游戏服务器 — 都不该放在它们上面。

A100 并未过时,40 GB 版本也不是错误的选择

A100 是上一代产品,40 GB 版本的权重读取速度为 1,555 GB/s,80 GB 版本为 1,935 GB/s。对于能装下的模型,这个读取速率决定了每秒能生成多少 token,而且它仍然远超目录中所有非堆叠式显存的卡。40 GB 的卡能轻松容纳一个三百亿参数的八位精度模型,这覆盖了大多数人实际部署的场景,而月租成本只是 H100 的一小部分。

当模型确实需要 Hopper 架构时 — 比如 Transformer 引擎、FP8、更新的张量单元 — 或者任务必须更快完成而不只是完成,就买 H100。当问题只是模型能否装下、读取速度有多快时,就买 A100,而后者是更常见的问题。

官方公布的规格

数据来自 NVIDIA’ 自己的数据表和 Tesla 规格表,本页源代码中已注明出处。如果某项数据无法对应到我们实际安装的具体部件,本页宁可留空也不猜测。

H100 80GB

Architecture

Hopper

Card memory

80 GB HBM2e

Board power

350 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

None. Decode only (7 engines)

Error-correcting memory

Yes

A100 80GB

Architecture

Ampere

Card memory

80 GB HBM2e

CUDA cores

6,912

Memory bandwidth

1,935 GB/s

Board power

300 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

A100 40GB

Architecture

Ampere

Card memory

40 GB HBM2

CUDA cores

6,912

Memory bandwidth

1,555 GB/s

Board power

250 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

None. Decode only (5 engines)

Error-correcting memory

Yes

上面的 H100 没有显示核心数和带宽,这是有意为之。我们商店记录中的核心数属于 SXM 模块,那是一种固定在基板上的卡,而非插槽式;而它记录的 80 GB HBM2e 显存则属于 PCIe 卡,那才是实际装进这些机器的部件。与其选一个数字自信地展示,本页只展示两个来源都一致的显存容量,其余一律省略。问我们,我们会告诉您装进您机器里的具体是哪块板。

它们擅长什么

一件事,做得比本站任何其他硬件都好。

快速读取权重

堆叠式显存是这一档与其他所有硬件的区别所在。模型一旦驻留,生成速度就取决于卡读取自身权重的速度,而这些卡的读取速度比我们安装的最快非堆叠式卡快一倍半到两倍。

汇入同一地址空间

这些部件带有 NVLink,因此一台机器里的两张卡可以表现为一个更大的资源池,而不是两个独立的池。目录中的工作站和消费级卡完全做不到这一点。这是需要报价的定制方案,而非结账选项。

连续运行数周无人值守

全程纠错,硬件专为持续负载而非短时爆发而设计。对于以周为单位、投入真金白银的训练任务来说,这不是奢侈功能。

完全属于您

每台物理机只租给一位用户,显卡直接直通 — 没有 MIG 分区,没有 vGPU 配置文件,没有时间片调度器,也没有别人的任务在上面。别处的“A100 实例”往往只是其中一块切片。

三张卡并排对比,以及更高一档的选择

来自我们自己的货架。所有这些今天都可下单,装在相同的机箱里,所以问题只是哪一张值得多花的钱。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

最后一行之所以存在,是因为这才是诚实的对比,而大多数列表都把它藏起来:RTX PRO 6000 Blackwell 拥有 96 GB 显存,比本页任何加速卡都多。请对照上表中 H100 的显存和价格来读它的数据,而不是听我们的一面之词。它牺牲的是读取速率和 NVLink;换来的是四个视频编码器和光线追踪。如果您的问题是能不能装下,在决定选这一档之前,先看看 /rtx60。

它们装进哪台机器,以及获得什么链路

A100 是 PCIe Gen 4 卡,H100 是 Gen 5,而我们的平台是 Gen 3 和 Gen 4。因此,在我们运行的任何机器上,H100 都永远无法获得它设计时的完整总线带宽,本页如实说明,而不是让您自己去发现。

Intel Xeon Silver / Gold

H100 80GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

H100 80GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon E5-2600 v3/v4

A100 80GB, A100 40GB

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

A100 80GB, A100 40GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

A100 80GB, A100 40GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

这是否会让您付出代价,完全取决于工作负载的形态。权重驻留的推理端点几乎不碰插槽,根本察觉不到。每一步都从主机内存流式传输新批次的训练循环,则每一步都会察觉。如果您不确定自己属于哪种,下单前告诉我们任务是什么 — 这决定的是机器,而不是卡。

80 GB 实际能装下什么

Weights only, rounded up. Fits means the card’s 80 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

40 GB 的 A100 对应同一张表低一档的位置:三百亿到三百四十亿参数的模型只有在四比特精度下才勉强装下,而在八比特精度下,其 34 GB 的权重连最低门槛都过不了。七百亿参数的十六比特模型装不进我们出售的任何单卡 — 那需要双卡方案,也正是上面 NVLink 一行重要的原因。

那张表回答的是“这张卡能装下什么”。反过来问 — 一个模型需要多少显存,哪张卡能满足 — 则有专门的页面。

它们搭配整机的价格

显卡是发票上的一行,整机是另一行。下面两部分都来自订单目录的同一次读取,因此价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
A100 40GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$772.47
Configure this build →
A100 40GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$699$782.67
Configure this build →
A100 40GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$699$916.59
Configure this build →
A100 80GBIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$972.47
Configure this build →
A100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$899$982.67
Configure this build →
A100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$899$1,116.59
Configure this build →
H100 80GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,599$1,682.67
Configure this build →
H100 80GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,599$1,816.59
Configure this build →

带宽双向不限量,无出站流量费,而在这一档产品中,这通常是别处最大的隐藏成本 — 一个训练任务拉入数据集、推出检查点,会移动海量字节,而每 GB 的出站流量都要收费。包含一个 IPv4 地址,无合约,默认租期一个月。其他所有我们安装的卡,按同样方式定价,请阅读完整目录及价格。今天已上架就绪的机器,见 /instant。

人们真正会问的关于这些卡的问题

我能在 A100 或 H100 上转码视频吗?

硬件上不行。这两张卡都没有编码器 — NVIDIA’ 的支持矩阵显示两者的 NVENC 引擎数量均为零 — 所以编码任务落到处理器上,以处理器速度运行。它们确实能解码,所以读取视频并输出非视频内容的管线没问题。如果您需要输出视频帧,L40S 有三个 AV1 编码器,而且便宜得多:/l40s。一张卡能承载多少路实时频道,以及装进哪台机器:/transcoding。

显卡会被切成 MIG 实例吗?

我们不会这么做。您拿到的是整张物理卡直通到您自己的操作系统,机器上没有其他人。这些部件支持 MIG,所以如果您愿意,可以自己分区;那是您在您自己机器上的决定,而不是在交付前就被做好的事。在其他任何地方购物时都值得核实这一点 — 大量“A100”产品只是其中一块切片。

A100 选 40 GB 还是 80 GB?

先看容量,再看读取速率。如果模型及其上下文能装进四十 GB 且还剩五分之一余量,那么小卡是更划算的选择,上面的阶梯图显示了差距。80 GB 的卡读取也更快 — 1,935 GB/s 对 1,555 — 所以如果您在容量或吞吐量上接近上限,就选大的。

我能拿到哪个驱动和 CUDA 版本?

您装哪个就是哪个。机器交付时带有干净的操作系统和 root 权限,您可以把驱动、CUDA 版本和框架构建固定到您代码测试过的版本。不会有任何东西在您不知情的情况下升级。如果您希望在交付前就装好驱动,下单时说明并指定版本。

多久能拿到?

这些部件最可能是采购而非现货安装,而且您会在付款前而非付款后得知。处于配额分配中的当代加速卡是我们报价中交期最长的。/instant 列出了现在就已上架就绪的机器。