NVIDIA L40S · 48 GB GDDR6,带 ECC

L40S — 一卡胜任三项工作

四十八 GB 纠错内存、三个支持 AV1 的硬件编码器,以及光线追踪核心,全部集成在一块板上。这是我们配备的唯一一款能在训练模型、渲染帧和转码流三者之间不妥协任何一项的显卡。它的短板是真实存在的,本页会如实说明。

48 GB,ECC 三个编码器,AV1 无 NVLink

把您的 GPU 变成每月被动收入

有闲置的服务器或台式机 GPU 配置吗?今天就到 Primcast 市场上架,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租收入。

前往市场

先说短板

这块卡有两件事做不到,而这两件事正是它比旁边的加速卡便宜的原因。

它的内存速度快,但不是堆叠式。 L40S 的读取速度为 864 GB/s。旁边的 A100 在 40 GB 版本下读取速度为 1,555 GB/s,80 GB 版本下为 1,935 GB/s——大约是它的两倍。在大批量 token 生成场景下,这个读取速度才是上限,而不是算力,所以即使 L40S 在纸面上拥有更多原始算力,A100 每秒也能从同一模型服务更多请求。如果服务吞吐量就是您的全部问题,那么加速卡才是正确的选择。

这款产品没有 NVLink。 一台机器里的两块 L40S 是两个独立的 48 GB 内存池,通过插槽通信,而不是一个 96 GB 的内存池。A100 和 H100 可以池化;这款不行。当您真正需要大于 48 GB 的单一地址空间时,这块卡无法满足您——下面的阶梯图展示了能满足的选项。

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

NVIDIA 公布的规格

Ada Lovelace 架构,第四代张量核心,第三代光线追踪核心。数据来自 NVIDIA 自己的 L40S 产品页面,并在本页源代码中注明出处。

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA 还公布了 91.6 teraFLOPS 的 FP32 性能、212 teraFLOPS 的光线追踪性能,以及 1,466 teraFLOPS 的 FP8 张量吞吐量(含稀疏性),来自 142 个 RT 核心和 568 个张量核心。这些都是理想条件下的峰值数据;上面的内存带宽才是通常决定您实际能获得什么的关键。

它擅长什么

说完短板之后:以下是这块卡真正适合的工作。

包含视频的管线

三个编码器和三个解码器,双向支持 AV1。在同一块运行模型以决定如何处理帧的板上完成采集、转码和输出。A100 和 H100 都无法在硬件中编码哪怕一帧——在那些卡上,视频是 CPU 的工作。这块卡能支持多少路直播频道,以及它所在的完整机器:直播视频转码服务器。

必须准确无误的渲染

纠错内存和第三代光线追踪核心。在消费级显卡上运行的渲染农场每帧成本更低,但偶尔会产生一帧带有翻转位的画面;在长时间无人值守的任务中,这意味着要重新运行。这块卡提供四十八 GB 内存,每一 GB 都有 ECC 保护,这正是您无法亲自照看的任务真正需要的。

虚拟桌面和席位

L40S 支持 vGPU 并驱动四个 DisplayPort 输出,这使它成为可以在虚拟工作站之间切分的显卡,而不是无显示输出的加速卡。A100 和 H100 完全没有显示输出。

模型能装进 48 GB 的推理

FP8 张量支持,以及足够的容量,可以八位精度容纳三百亿参数的模型,还有富余。对于以适中批量大小响应真实流量的端点,上面的带宽上限很少构成瓶颈——只有当您把卡推到极限时才会。

它取代了什么,以及它两侧是什么

来自我们自己的货架,而不是供应商的路线图。所有这些今天都可以订购。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 是 L40S 所接替的 Ampere 架构显卡——同样的 48 GB,更老的架构,没有 AV1,也没有 FP8。RTX 6000 Ada 是拥有相同容量和相同代际的工作站显卡。当带宽或池化成为比容量更关键的约束时,A100 就是您的升级方向,加速卡页面对此有详细介绍。

它装进哪台机器,以及在那里获得什么链路

L40S 是 PCIe Gen 4 显卡。支持它的两个平台中,一个是 Gen 3,一个是 Gen 4。

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

对于推理端点或转码器,插槽代际几乎无关紧要——权重常驻内存,帧也很小。但对于每一步都从主机流式传输新批次的训练循环来说,这很重要,在这种情况下 Gen 4 平台值得多花这笔钱。

48 GB 实际能装下什么

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

这块卡的功耗最高 350 W,在同级别中算适中的,这也是它能装进更大加速卡装不进的机箱的部分原因。

那张表回答了“这块卡能装下什么”。反过来问——一个模型需要多少内存,哪块卡能满足——则是另一个专门的页面。

它的价格,连同它所在的机器

显卡是发票上的一行,机器是另一行。下面两部分都来自订单目录的同一次读取,所以价格和旁边的规格始终相互对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

带宽双向不限量,无出口费用,包含一个 IPv4 地址,无合同,默认期限为一个月。关于我们配备的其他每一块显卡,以同样的方式定价,请阅读完整目录及价格。关于今天已上架就绪的机器,请访问 /instant。

人们实际会问的关于这块卡的问题

服务模型时,选 L40S 还是 A100?

如果模型能装进 48 GB 且流量适中,L40S 更便宜,功能也更多。如果您在大批量下把卡推到极限,A100 读取权重的速度大约是它的两倍,即使纸面算力更少,每秒也能服务更多请求。如果模型装不进 48 GB,那么 A100 80 GB 才是答案,L40S 不是。

我能把两块池化来获得 96 GB 吗?

不能。这款产品没有 NVLink,所以两块卡是两个独立的 48 GB 内存池,通过插槽通信。大于 48 GB 的模型必须由您的框架刻意拆分到两块卡上,以插槽作为链路。如果您想要大于 48 GB 的单一地址空间,请改看上面阶梯图中的 80 GB 和 96 GB 显卡。

这块卡是共享、切分还是虚拟化的?

我们不做这些。每台物理机一个租户,显卡直通给您自己的操作系统——没有虚拟机监控程序,没有 MIG 分区,没有 vGPU 配置文件,没有时间切片。这块卡支持 vGPU,所以如果您想在自己的虚拟桌面之间切分它,您可以这样做;这是您在您自己的机器上做的决定,而不是我们事先对它做的事。

它真的支持 AV1 吗?

是的,编码和解码都支持,在它的全部三个硬件编码器和解码器上。这正是 RTX 30 系列完全做不到、加速卡也完全做不到的具体功能,也常常是这块卡进入候选名单的原因。

我多久能拿到一块?

这取决于显卡是已经装好、已经在我们的货架上,还是需要采购——而且您会在付款之前而不是之后被告知是哪一种情况。/instant 列出了现在就上架就绪的机器。