RTX PRO 6000 Blackwell · 96 GB GDDR7 内存(带 ECC 纠错)

RTX PRO 6000 显卡,安装在您按月租用的服务器中。

一张独立显卡就配备了 96GB 的纠错 GDDR7 显存,而且是在一台完全独立的物理机上安装的。我们目前安装的所有显卡中,没有哪一款的容量能超过它——即使是加速卡也不例外。为了获得如此大的容量,你需要牺牲内存读取速度和 NVLink 功能,这一点在本页的开头就已明确说明。

96 GB,ECC四个编码器,AV1穿过,而非切片。

这里最重要的一张牌,以及它在发票上的位置

Across the 56 cards in the catalogue: RTX PRO 6000 Blackwell 96GB holds 96 GB, no card we fit holds more, and one costs more per month. Read the whole ladder on the whole catalogue, priced.

H100 是一款加速卡:它的作用是存储模型并进行运算,NVIDIA 也因此定价。RTX PRO 6000 是一款工作站显卡,它的显存恰好比加速卡更大。如果你只想知道它是否能装下,请对比下表中的显存和价格两栏——在这个价位上,它们并不对应,这也是我们创建这个页面的原因。

它与其他大容量存储卡并排摆放的位置,我们把它装在

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 80GB80 GB HBM2e$899$972.47
RTX PRO 6000 Blackwell 96GB96 GB GDDR7 ECC$1,299$1,382.67
H100 80GB80 GB HBM2e$1,599$1,682.67

以上所有数据均取自结账账单所依据的订单目录,数据更新于此页面生成之时。本页所有内容均为实物拍摄,绝非人工录入。

NVIDIA发布的规范

Blackwell架构,第五代Tensor核心,第四代RT核心。数据来自NVIDIA工作站版产品页面,本页面来源已引用。

RTX PRO 6000 Blackwell 96GB

Architecture

Blackwell

Card memory

96 GB GDDR7 ECC

CUDA cores

24,064

Memory bandwidth

1,792 GB/s

Board power

600 W

Card interface

PCIe Gen 5 x16

Hardware video encoders

4 NVENC, 4 NVDEC, AV1

Error-correcting memory

Yes

它擅长什么,以及它不擅长什么。

实话实说。这么贵的牌,选错的概率远大于选对的概率,而下面这四段话正是决定性的因素。

擅长:握住大件物品,整体

96GB 的内存足以容纳一个 700 亿参数的 8 位精度模型,并且还有足够的空间容纳上下文窗口;也足以容纳一个 300 亿参数的 16 位全精度模型。只需一张显卡、一个地址空间,无需分片,也无需第二台机器来同步运行。

擅长:图形和算术相关的工作

它配备四个硬件编码器和四个支持 AV1 的解码器,以及第四代光线追踪核心。渲染、转码和推理都集成在同一块电路板上。而这个架子上的加速器则不具备前两项功能——它们根本没有视频编码器。

不擅长:大规模内存密集型工作

GDDR7 显存速度很快,但它不是堆叠式显存。A100 和 H100 的读取速度比这张卡快,而对于大批量令牌生成来说,读取速度才是瓶颈,而非运算能力。如果你的瓶颈是带宽而不是容量,那么较小的加速器会更胜一筹。

不擅长:使用第二张牌进行牌池操作。

这部分没有NVLink功能。一台机器里装了两块这样的卡,它们是两个独立的96GB内存池,通过插槽通信,而不是一个192GB的内存池。如果您确实需要单个地址空间超过96GB的容量,这张卡无法满足您的需求。

它要装进哪台机器,以及通过哪个接口连接到那里。

这张卡是 PCIe Gen 5 的,而我们用的平台都是 Gen 3 或 Gen 4,所以它始终无法达到设计时的全部带宽。这对某些工作有影响,对另一些工作则无关紧要,但这种差异远比静音更重要。

Intel Xeon Silver / Gold

RTX PRO 6000 Blackwell 96GB

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 5.

A quarter or less of the bus the card was designed for. Worth avoiding when the work crosses the slot every step, and irrelevant once the weights are resident.

AMD EPYC

RTX PRO 6000 Blackwell 96GB

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 5.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

一旦权重数据驻留在存储卡上,该插槽就会闲置,权重生成过程也就不再重要——这包括大部分推理、渲染和所有转码操作。它只对训练循环至关重要,因为训练循环会在每个步骤中将新批次的权重数据流式传输到该插槽。如果您不确定自己属于哪一种情况,请咨询相关人员;答案决定的是机器,而不是存储卡。

96GB到底能装下什么?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 96 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — fits34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — fits38 GB — fits

显卡功耗是另一个限制因素,而且确实存在:这款显卡的工作站版自身功耗高达 600 瓦,而 Max-Q 版虽然采用相同的芯片和 96GB 容量,但功耗仅为 300 瓦。具体机箱支持哪一款取决于机箱本身,因此最好在订购前咨询清楚。

它的成本,连同它所在的机器一起。

发票上,卡片和机器分别单独列一行。以下两部分均来自同一份订单目录,因此价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
RTX PRO 6000 Blackwell 96GBIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$1,299$1,382.67
Configure this build →
RTX PRO 6000 Blackwell 96GBAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$1,299$1,516.59
Configure this build →

带宽双向不限量,无出口费用,包含一个 IPv4 地址,无合约,默认期限为一个月。我们为所有其他类型的卡提供相同的配置,价格也相同,请阅读完整产品目录了解详情。对于已安装完毕、可立即交付的机器(而非定制机器),请访问/instant

人们实际询问的关于这张卡的问题

这张显卡和RTX 6000 Ada是同一款吗?

不,而且名称容易让人混淆。RTX 6000 Ada Generation 是上一代专业旗舰产品:采用 Ada Lovelace 架构,配备 48GB GDDR6 ECC 显存。RTX PRO 6000 Blackwell 则配备 96GB GDDR7 ECC 显存,显存容量翻倍,并且采用更新的芯片。我们同时测试了这两款显卡,它们在上面的图表中并排显示,因此它们之间的差距只是一个数值,而非一个说法。

96 GB 对比 H100 的 80 GB——那么 H100 的用途是什么呢?

您为不同的功能买单。H100 的优势在于堆叠式内存及其带来的读取速度,以及用于将多张显卡整合到一个地址空间的 NVLink 技术。RTX PRO 6000 的优势在于其强大的容量、光线追踪技术和四个视频编码器。如果您想知道这款显卡是否能满足您的需求,那么这款显卡绰绰有余。如果您想知道在大批量处理下每秒能处理多少个令牌,那么这款加速卡在这方面表现更佳,上面的图表也展示了其性能提升的成本。

这张卡是否与其他人共用?

不。每台物理机仅限一个租户,显卡直接传递给您自己的操作系统——没有虚拟机管理程序、MIG 分区、vGPU 配置或时间片轮转。您需要自行安装并锁定驱动程序和 CUDA 版本,底层系统不会进行任何升级。第一天下午的测试结果就是最终结果。

我可以在一台机器里装两个吗?

我们提供的是定制报价,而不是简单的勾选选项,因为最终价格取决于机箱、显卡的物理宽度和功耗预算——单张显卡功耗最高可达 600 瓦,因此功耗预算通常是决定性因素。咨询后,我们会告知您所需的机箱型号、显卡数量和交货周期。请注意,这里的两张显卡代表两个独立的内存池:此款显卡不支持 NVLink。

我最快什么时候可以拿到?

这取决于卡片是否已安装、是否已上架,或者是否需要进货——我们会在您付款前告知具体情况,而不是付款后。/instant 列出是目前已上架并可立即使用的机器。其他情况会标明实际的交货时间。