NVIDIA L40S · 48 GB GDDR6 内存(带 ECC 纠错功能)

L40S——一张能完成所有三项任务的显卡

这款显卡集成了48GB纠错内存、三个支持AV1的硬件编码器以及光线追踪核心。它是我们唯一一款能够同时完成模型训练、帧渲染和视频流转码且三者性能均不受影响的显卡。但它的确存在一些问题,本页面对此有所说明。

48 GB,ECC三个编码器,AV1无 NVLink

首先,问题在于……

这张卡有两件事做不到,而这两件事正是它比同级别的加速器便宜的原因。

它的内存速度很快,而且不是堆叠式的。L40S的读取速度为 864 GB/s。与之配套的 A100,使用 40 GB 内存时读取速度为 1,555 GB/s,使用 80 GB 内存时读取速度为 1,935 GB/s——大约是 L40S 的两倍。对于大批量令牌生成而言,读取速度是上限,但运算能力并非极限,因此即使 L40S 的理论计算能力更强,A100 也能在同一型号的机器上每秒处理更多请求。如果服务器吞吐量是您唯一的问题,那么购买加速器是正确的选择。

这部分没有 NVLink 功能。一台机器里装两张 L40S 卡,是两个独立的 48GB 内存池,通过插槽通信,而不是一个 96GB 的内存池。A100 和 H100 可以组成内存池,而这张卡不行。如果您确实需要一个大于 48GB 的​​地址空间,这张卡无法满足您的需求——下面的图表展示了哪些卡可以做到这一点。

Across the 56 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

NVIDIA发布的规范

Ada Lovelace、第四代张量核心、第三代光线追踪核心。数据来自NVIDIA官方L40S产品页面,本页面来源已引用。

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA 还公布了其 142 个光线追踪核心和 568 个张量核心的 FP32 浮点运算性能为 91.6 万亿次浮点运算/秒,光线追踪性能为 212 万亿次浮点运算/秒,稀疏化 FP8 张量吞吐量为 1466 万亿次浮点运算/秒。这些是理想条件下的峰值数据;实际性能通常取决于上述内存带宽。

它擅长什么

说完这个条件:这张卡片真正适合的题目是:

包含视频的管道

三个编码器和三个解码器,支持双向 AV1 编码。采集、转码和分发都在同一块板卡上完成,该板卡运行着决定帧处理方式的模型。A100 和 H100 都无法进行硬件编码——在这些卡上,视频处理由 CPU 完成。

渲染必须正确

纠错内存和第三代光线追踪核心。使用消费级显卡搭建渲染农场,每帧成本较低,但偶尔会出现帧中出现翻转位的情况;长时间无人值守的渲染任务就需要重做。这张显卡提供 48GB 的​​ ECC 内存,这才是真正需要的,即使你无法时刻监控也能高效完成任务。

虚拟桌面和座位

L40S 支持 vGPU 并驱动四个 DisplayPort 输出,因此它是一款可以在虚拟工作站之间切换使用的显卡,而非无头加速器。A100 和 H100 则完全没有显示输出。

模型拟合到 48 GB 的推断

它支持 FP8 张量,并且拥有足够的容量来运行一个 8 位精度、300 亿参数的模型,还有剩余空间。对于处理实际流量且批处理大小适中的终端来说,上述带宽上限很少会达到饱和——只有在您将网卡满负荷运行时才会达到饱和。

它取代了什么,以及它两侧是什么。

所有产品均来自我们自己的货架,而非供应商的路线图。今天即可订购。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 是 L40S 的继任者,它采用的是 Ampere 架构——同样拥有 48GB 显存,但架构较老,不支持 AV1 和 FP8。RTX 6000 Ada 是工作站显卡,容量和架构都与 A40 相同。当带宽或池化成为瓶颈而非容量时,A100 系列显卡才是您的理想选择,加速器页面对此有详细介绍。

它要装进哪台机器,以及通过哪个接口连接到那里。

L40S 是一款 PCIe Gen 4 卡。支持它的两个平台分别是 Gen 3 和 Gen 4。

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

对于推理端点或转码器而言,时隙生成几乎无关紧要——权重驻留在本地,帧也很小。但对于每一步都从主机流式传输新批次数据的训练循环来说,时隙生成就至关重要了,在这种情况下,第四代平台带来的差异就显得物有所值了。

48GB到底能装下什么?

Weights only, rounded up. A row counts as fitting when it leaves a fifth of the card’s 48 GB free for the KV cache, the activations and the runtime — which is head-room, not luxury.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — fits19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — fits

该显卡功耗高达 350 瓦,对于同类产品来说并不算高,这也是为什么它能装进一些更大的加速卡装不下的机箱的原因之一。

它的成本,连同它所在的机器一起。

发票上的卡片是一行,机器是另一行。以下两部分均来自同一订单目录,因此价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

带宽双向不限量,无出口费用,包含一个 IPv4 地址,无合约,默认期限为一个月。其他所有网卡均按相同方式定价,请查阅完整产品目录了解详情。对于已安装完毕且可立即使用的机器,请点击此处/instant

人们实际询问有关这张卡的问题

L40S 还是 A100,哪个型号更合适?

如果模型尺寸在 48GB 容量范围内且流量适中,L40S 更便宜且性能更强。如果以大批量处理数据为目标,A100 读取重量的速度大约是 L40S 的两倍,并且尽管其理论计算能力较低,但每秒可处理的请求数量更多。如果模型尺寸超过 48GB 容量,则 80GB 的 A100 才是最佳选择,L40S 则不适用。

我可以把其中两个合并起来,获得 96 GB 的容量吗?

不。这部分没有 NVLink,所以两张卡是两个独立的 48GB 内存池,通过插槽进行通信。大于 48GB 的​​内存需要你的框架特意将其拆分到两张卡上,并通过插槽进行通信。如果你需要一个大于 48GB 的​​地址空间,请参考上面列表中的 80GB 和 96GB 内存卡。

这张卡是共享的、分片的还是虚拟化的?

并非由我们操作。每台物理机仅限一个租户,显卡直接直通到您自己的操作系统——无需虚拟机管理程序、MIG 分区、vGPU 配置或时间片轮转。该显卡支持 vGPU,因此如果您想在自己的虚拟桌面之间进行时间片轮转,您可以自行操作;这是您在自己的机器上自行决定的,我们不会事先进行任何设置。

它真的支持AV1吗?

是的,它的所有三个硬件编码器和解码器都能进行编码和解码。这正是RTX 30系列显卡和加速器完全无法做到的,也正是这一点常常使这款显卡成为候选名单上的重要因素。

我最快什么时候可以拿到?

这取决于卡片是否已安装、是否已上架,或者是否需要进货——我们会在您付款前告知具体情况,不是付款后。/instant 列出了目前已上架且可用的机器。