GeForce RTX 4090 D · 24 GB GDDR6X

RTX 4090D — 以及它为什么不是 RTX 4090

我们安装的显卡是 4090 D,这是 NVIDIA 为中国市场打造的出口合规版本。它不是换标产品,也不是假货:它是一块真正的 AD102 显卡,着色器数量更少,但同样拥有 24 GB 显存。如果你来这里是为了寻找 4090 服务器,本页就是为了在你付款之前告诉你两者的区别。

24 GB GDDR6X 双编码器,AV1 无 ECC

把你的 GPU 变成每月被动收入

有闲置的服务器或台式机 GPU 配置吗?今天就上架到 Primcast 市场,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租收入。

前往市场

D 的含义

2023 年 12 月,美国商务部设定了一个出口门槛,而 RTX 4090 超出了这个门槛。NVIDIA 削减了一个版本来通过它,并在中国销售这个版本:RTX 4090 D。它于 2023 年 12 月 28 日发布,拥有 14,592 个 CUDA 核心,而完整版显卡有 16,384 个 — 大约少了百分之十一的着色器。

其他一切都与完整版相同。384 位总线上的 24 GB GDDR6X,相同的 1,008 GB/s 显存带宽,相同的 2.52 GHz 加速频率,相同的第三代光线追踪核心和第四代张量核心,相同的两个 AV1 编码器。任何依赖显存容量或显存速度的东西都完全不变,这涵盖了租用显卡的大部分用途:能装进 24 GB 的模型依然能装进去,能推流的帧依然能推流。

它真正让你付出代价的地方,是在着色器满载的工作上的原始算术吞吐量 — 一次漫长的渲染、一次批量训练。预算比完整版 4090 少大约十分之一,你就不会感到意外。我们在这里如实说明,而不是在页面上印着“RTX 4090”然后让你自己去发现,而大多数商家正是这么做的。

Across the 57 cards in the catalogue: RTX 4090D holds 24 GB, 13 cards we fit hold more, and 11 cost more per month. Read the whole ladder on the whole catalogue, priced.

官方公布的规格

Ada Lovelace。数据来自 NVIDIA 自己的 RTX 40 系列文档,在本页源代码中引用。

RTX 4090D

Architecture

Ada Lovelace

Card memory

24 GB GDDR6X

CUDA cores

14,592

Memory bandwidth

1,008 GB/s

Board power

425 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

2 NVENC, 1 NVDEC, AV1

Error-correcting memory

No

它擅长什么,不擅长什么

这是一块装在机架里的消费级显卡。这就是它的全部优势,也是它的全部局限,两者都值得直说。

擅长:每英镑的算力

GeForce 芯片是购买这么多算力最便宜的方式。价格里没有专业驱动授权费,也没有数据中心溢价,所以对于那些算错一位意味着重试而不是灾难的工作 — 批量渲染、游戏服务器、业余训练、可以重跑的推理 — 它很难被超越。

擅长:视频,与加速卡不同

两个带 AV1 的硬件编码器和一个解码器。一块 4090 D 可以全天转码。目录中更高端的 A100 和 H100 在硬件上连一帧都编码不了 — 它们根本没有编码器 — 所以对于任何涉及视频的工作,这块显卡不是妥协,而是正确答案。

不擅长:任何需要超过 24 GB 显存的工作

24 GB 是一堵墙,而且它比人们预期的更早到来:一个 130 亿参数的模型在 8 位精度下能装下,同一个模型在 16 位精度下装不下,而一个 700 亿参数的模型在任何精度下都装不下。下面的表格对此有精确说明。

不擅长:无法容忍一个位翻转的工作

没有纠错内存,也没有经过认证的专业驱动。对于一次没有检查点的多周运行,或者对于许可证要求专业显卡的工作负载,答案应该是工作站货架上的显卡。那些都在整个目录里,标好了价格

它取代了什么,什么又取代了它

来自我们自己的货架,而不是供应商的路线图。这三款今天都可以订购,装在同一个机箱里,所以问题不是哪款最新,而是哪款值得那个差价。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
RTX 309024 GB GDDR6X$239$309.93
RTX 4090D24 GB GDDR6X$299$372.47
RTX 509032 GB GDDR7$399$472.47

RTX 3090 拥有同样的 24 GB,是更旧、更慢、更便宜的获得方式 — 如果你买的是容量而不是速度,在花那个差价之前先读一读RTX 30 系列页面。RTX 5090 升级到 32 GB,而且是一块 PCIe Gen 5 显卡,但有些平台是 Gen 3 和 Gen 4,所以在假设更新就是更快之前,先读下面这一节。

它装进哪台机器,以及在那里获得什么链路

4090 D 是一块 PCIe Gen 4 显卡。我们三个支持它的平台中,两个是 Gen 3,一个是 Gen 4。

Intel Xeon E5-2600 v3/v4

RTX 4090D

Slot: PCIe 3.0, 40 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

Intel Xeon Silver / Gold

RTX 4090D

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

RTX 4090D

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

这就是工单 #3347 背后的事实:一位客户在旧平台上换了一块更新的显卡,渲染速度反而比以前更慢。一旦场景或权重驻留在显卡上,插槽就空闲了,它的代际就不再重要。只有当工作每一步都要穿过插槽时,它才重要。

24 GB 里实际能装下什么

Weights only, rounded up. Fits means the card’s 24 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — does not fit14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — does not fit19 GB — tight
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — does not fit

另一个上限是功耗:这块显卡单独就能消耗高达 425 W,这就是为什么在一个机箱里装不止一块时,我们需要单独报价,而不是让你直接勾选。

那张表回答了“这块显卡能装下什么”。反过来问 — 一个模型需要多少显存,哪块显卡能满足 — 有专门的页面

它的价格,连同它装进的机器

显卡是发票上的一行,机器是另一行。下面两部分都来自订单目录的同一次读取,所以价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
RTX 4090DIntel Xeon E5-2600 v3/v4
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps · PCIe 3.0
$299$372.47
Configure this build →
RTX 4090DIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$299$382.67
Configure this build →
RTX 4090DAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$299$516.59
Configure this build →

带宽双向不限量,无出口费用,包含一个 IPv4 地址,无合同,默认期限为一个月。关于我们安装的其他每一块显卡,以同样的方式标价,请阅读整个目录,标好了价格。关于今天就已经上架就绪的机器,请看/instant

人们真正会问的关于这块显卡的问题

如果我要求,能拿到完整的 RTX 4090 吗?

从这个页面拿不到。我们安装的是 4090 D,而且页面如实说明,而不是印着“RTX 4090”然后心存侥幸。如果你的工作确实需要那多出来的百分之十一的着色器,告诉我们是什么工作,我们会说明能否采购到该部件以及交货期,而不是发给你 D 版然后管它叫 4090。

D 版会影响 CUDA、驱动或软件兼容性吗?

不会。它被识别为 Ada Lovelace GeForce 显卡,使用普通的 GeForce 驱动,每一个在 4090 上运行的 CUDA 版本、框架构建和渲染器都能在它上面运行。区别在于着色器数量,而不是架构。

这块显卡会和别人共享吗?

不会。每台物理机一个租户,显卡直接直通给你自己的操作系统 — 没有虚拟机监控程序,没有分区,没有时间切片。你自己安装并固定自己的驱动和 CUDA 版本,底层不会有任何东西在你不知情的情况下升级。

如果我只在乎 24 GB,选 4090 D 还是 RTX 3090?

那么 3090 很可能是更好的选择,上面的阶梯图显示了差距。4090 D 明显更快,而且有 3090 没有的 AV1 编码;3090 拥有同样的容量,但每个月的花费更少。如果模型两者都能装下,而且运行不是背靠背的,那么旧显卡在算术上胜出。

我多久能拿到一块?

这取决于显卡是已经装好、已经在我们的货架上,还是需要采购 — 而且在你付款之前就会告诉你。 /instant 列出了现在就已经上架就绪的机器。