NVIDIA L40S · 48 GB GDDR6 带 ECC

L40S — 一块卡,三份工

四十八 GB 纠错内存、三个支持 AV1 的硬件编码器,以及光线追踪核心,全都在一块板上。它是我们装配的唯一一款能在训练模型、渲染帧和转码流三件事上都不打折扣的卡。短板是真实存在的,本页会如实说明。

48 GB,ECC 三个编码器,AV1 无 NVLink

把您的 GPU 变成每月被动收入

有闲置的服务器或台式机 GPU 配置吗?今天就上架到 Primcast 市场,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租收入。

前往市场

先说短板

这块卡有两件事做不到,而这两件事正是它比旁边那些加速卡便宜的原因。

它的内存快,但不是堆叠式。 L40S 的读取速度为 864 GB/s。旁边的 A100 在 40 GB 版本上为 1,555 GB/s,80 GB 版本上为 1,935 GB/s — 大约是它的两倍。在大批量生成 token 时,这个读取速度才是天花板,算力反而不是,所以即使 L40S 在纸面上原始算力更高,A100 每秒也能从同一个模型服务更多请求。如果服务吞吐量就是您问题的全部,那么加速卡才是正确的选择。

这块部件上没有 NVLink。 一台机器里的两块 L40S 是两个独立的 48 GB 池,通过插槽通信,而不是一个 96 GB 的池。A100 和 H100 可以池化;这块不行。当您真正需要大于 48 GB 的单一地址空间时,这块卡带您到不了那里 — 下面的阶梯图展示了哪块可以。

Across the 57 cards in the catalogue: L40S holds 48 GB, 4 cards we fit hold more, and 8 cost more per month. Read the whole ladder on the whole catalogue, priced.

规格,按 NVIDIA 发布为准

Ada Lovelace,第四代张量核心,第三代光线追踪核心。数据来自 NVIDIA 自己的 L40S 产品页,在本页源码中已注明出处。

L40S

Architecture

Ada Lovelace

Card memory

48 GB GDDR6 ECC

CUDA cores

18,176

Memory bandwidth

864 GB/s

Board power

350 W

Card interface

PCIe Gen 4 x16

Hardware video encoders

3 NVENC, 3 NVDEC, AV1

Error-correcting memory

Yes

NVIDIA 还公布了 91.6 teraFLOPS 的 FP32、212 teraFLOPS 的光线追踪性能,以及 1,466 teraFLOPS 的 FP8 张量吞吐量(含稀疏性),来自 142 个 RT 核心和 568 个张量核心。这些都是理想条件下的峰值数据;上面的内存带宽才是通常决定您实际能拿到什么的关键。

它擅长什么

说完短板之后:以下是这块卡真正适合的工作。

带视频的管线

三个编码器和三个解码器,双向都支持 AV1。在同一块运行模型决定如何处理帧的板上完成摄取、转码和服务。A100 和 H100 在硬件上连一帧都编码不了 — 在那些卡上,视频是 CPU 的活。这块卡能支持多少路直播频道,以及它所在的整机配置:直播视频转码服务器

必须正确的渲染

纠错内存和第三代光线追踪核心。用消费级卡搭的渲染农场每帧成本更低,但偶尔会产出一帧带翻转位的画面;在长时间无人值守的任务里,那意味着重跑。这块卡给您四十八 GB 内存,每一 GB 背后都有 ECC,这正是您无法守在旁边的任务真正需要的。

虚拟桌面和席位

L40S 支持 vGPU 并驱动四个 DisplayPort 输出,这让它成为一块可以在虚拟工作站之间切分的卡,而不是一块无头加速卡。A100 和 H100 完全没有显示输出。

模型能装进 48 GB 的推理

FP8 张量支持,加上足以容纳一个三百亿参数模型(八位精度)还有富余的容量。对于以适中批量应答真实流量的端点来说,上面的带宽天花板很少构成瓶颈 — 只有当您把卡推到满负荷时它才会显现。

它取代了什么,以及它两侧是什么

来自我们自己的货架,而非厂商路线图。以下所有产品今天都可以下单。

Cheapest complete machine first. Every figure read from the order catalogue when this page was served.
CardCard memoryThe cardCheapest complete machine
L40S48 GB GDDR6 ECC$449$532.67
A4048 GB GDDR6$499$572.47
RTX 6000 ADA48 GB GDDR6 ECC$625$698.47
A100 40GB40 GB HBM2$699$772.47
A100 80GB80 GB HBM2e$899$972.47

A40 是 L40S 接替的 Ampere 卡 — 同样的 48 GB,更老的架构,没有 AV1,也没有 FP8。RTX 6000 Ada 是容量相同、同代的工作站卡。当带宽或池化成为比容量更关键的约束时,A100 就是您的下一步,加速卡页面有详细介绍。

它装进哪台机器,以及在那里获得什么链路

L40S 是一块 PCIe Gen 4 卡。能装它的两个平台中,一个是 Gen 3,一个是 Gen 4。

Intel Xeon Silver / Gold

L40S

Slot: PCIe 3.0, 48 lanes per socket. Card: PCIe Gen 4.

About half the bus the card was designed for. That costs a training loop streaming batches off the host; it costs an inference server or a transcoder nothing, because the weights are already on the card.

AMD EPYC

L40S

Slot: PCIe 4.0, 128 lanes per socket. Card: PCIe Gen 4.

Full width. The slot is at least the generation the card was designed for, so nothing is left on the table.

对于推理端点或转码器来说,插槽代际几乎无关紧要 — 权重常驻,帧也很小。但对于每一步都要从主机流式拉取新批次的训练循环来说,它就有影响了,那种场景下 Gen 4 平台值得多花这笔钱。

48 GB 里实际能装下什么

Weights only, rounded up. Fits means the card’s 48 GB holds the weights 1.5× over — room for the KV cache, the activations and the runtime, and the only verdict the LLM sizing page recommends a card on. Tight clears 1.25× only: the model loads, and a long context or a second user runs the card out.
Model16-bit8-bit4-bit
7-8 billion parameters16 GB — fits8 GB — fits5 GB — fits
13-14 billion parameters28 GB — fits14 GB — fits8 GB — fits
30-34 billion parameters68 GB — does not fit34 GB — tight19 GB — fits
70 billion parameters140 GB — does not fit70 GB — does not fit38 GB — tight

这块卡的功耗最高 350 W,在同类产品中算克制的,这也是它能装进更大加速卡装不进的机箱的部分原因。

那张表回答了“这块卡能装下什么”。反过来问 — 一个模型需要多少内存,哪块卡能满足 — 则有专门的页面

价格多少,连同它所在的整机

卡是发票上的一行,机器是另一行。下面这两部分都来自订单目录的同一次读取,所以价格和旁边的规格永远彼此对应。

Read from the order catalogue when this page was served. The card is a separate line; the machine does not get dearer because of what is plugged into it.
CardThe machine it goes inThe cardComplete, per month
L40SIntel Xeon Silver / Gold
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps · PCIe 3.0
$449$532.67
Configure this build →
L40SAMD EPYC
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps · PCIe 4.0
$449$666.59
Configure this build →

带宽双向不限量,无出口费用,包含一个 IPv4 地址,无合约,默认期限为一个月。我们装配的其他每一块卡,都以同样的方式定价,请阅读完整目录及价格。已上架、今天即可用的机器,见 /instant

人们真正会问的关于这块卡的问题

服务模型,选 L40S 还是 A100?

如果模型能装进 48 GB 且流量适中,L40S 更便宜,能做的也更多。如果您把卡推到大批量的满负荷状态,A100 读取权重的速度大约是它的两倍,即使纸面算力更低,每秒也能服务更多请求。而如果模型装不进 48 GB,A100 80 GB 才是答案,L40S 不是。

我能把两块池化成 96 GB 吗?

不能。这块部件没有 NVLink,所以两块卡是两个独立的 48 GB 池,通过插槽通信。大于 48 GB 的模型必须由您的框架刻意拆分到两块卡上,以插槽作为链路。如果您想要大于 48 GB 的单一地址空间,请改看上面阶梯图中的 80 GB 和 96 GB 卡。

这块卡是共享、切分还是虚拟化的?

我们不做这些。每台物理机一个租户,卡直通给您自己的操作系统 — 没有 hypervisor,没有 MIG 分区,没有 vGPU 配置文件,没有时间切片。这块卡支持 vGPU,所以如果您想在自己的虚拟桌面之间切分它,您可以这么做;那是您在您自己的机器上做的决定,不是我们事先替您做的。

它真的支持 AV1 吗?

是的,编码和解码都支持,在它全部三个硬件编码器和解码器上。这正是 RTX 30 系列完全做不到、加速卡也完全做不到的具体功能,也常常是这块卡进入候选名单的原因。

我多久能拿到一块?

取决于这块卡是已经装好、已经在我们的货架上,还是需要采购 — 而且您会在付款前被告知,而不是付款后。/instant 列出了现在就已上架、随时可用的机器。