多卡多节点 · Primcast LLC · 自 2004 年起

扩大规模和扩大体型是两回事。

单机单卡配置的问题已成定局,GPU页面上会逐张标价。而这里讨论的是:同一机箱内安装第二张显卡,或者在第一台机器旁边安装第二台机器。这两种情况听起来像是同一个选择,但实际上截然相反——这里提到的平台虽然能为显卡提供最多的通道,但网络带宽上限最低,占用的机箱也最少。没有人会公布自己产品目录中的这类信息。详情请见下表。

比较各个平台是什么将两台机器连接起来?

每台机器都是一个租户,每张卡都传递到你自己的操作系统,节点之间不会有任何字节的传输。

登记册

  • 4Platforms that take a card
  • 100 GbpsFastest port on any of them
  • 2Sockets in one machine, at most
  • 1 TBMemory in one machine, at most
  • 2Rooms holding every platform

本页面内容是从订单目录中读取的,而非手动输入。今天早上货架上摆放的是什么是另一个问题,答案就在即时服务中

两个不同的问题

你到底想问哪个问题?

人们来到这里时,已经决定“我需要更多”,但却没有决定需要更多什么。两种答案的成本不同,提供方式不同,受到的限制也不同,因此在继续阅读下一行之前,明确自己的需求是十分必要的。

一台机器可存入更多卡片

同一机箱内的第二张卡

您的显卡内存或吞吐量不足,而机器的其他方面都正常。这是我们提供的定制配置报价,而不是您在结账时勾选的选项,因为显卡的安装数量取决于显卡的物理宽度和机箱的功率预算——这两个因素并未列在产品目录中,我们也不会妄加猜测。

决定因素是显卡本身,而不是平台。询问时请提供具体部件名称,回复会说明机箱、数量和交货周期。

人们期望却往往忽略的一点是:两张显卡并非一张更大的显卡。只有当你的程序能够将模型拆分到两张显卡上运行时,它们的内存才能真正叠加——例如张量并行或流水线并行,几乎所有主流运行时都支持这种并行处理方式,但这会降低两张显卡之间的数据传输吞吐量。对于已经包含多个独立任务的工作来说,两张显卡仅仅是机器性能翻倍,无需任何额外操作。

旁边还有更多机器

第二台机器就在第一台旁边。

你的机器性能已经达到极限,而不是显卡性能不足:插槽用完了,内存用完了,也没有地方可以运行下一个任务了。在以下列出的最佳平台上,性能极限是2 sockets and 1 TB ,而如果超过了这两个平台,解决办法是换一台服务器,而不是升级到更大的服务器。

决定因素是:房间和端口。两台需要通信的机器必须位于同一栋楼内,连接它们的是每台机器上的端口——每个机器都需要单独购买一个端口,因此四个节点下的网络架构需要四个端口。

人们期望却得不到的是:这里没有集群产品,也没有最低节点数量限制。每台机器都是单独订购、计费、升级和更换的,因此本页面没有列出集群价格——一个集群包含n 张发票。

交易

该平台在其中一项方面表现最佳,而在另一个方面则表现最差。

我们为每个平台都配备了显卡,而这些显卡所依据的维度决定的是集群而非单台机器。请结合中间两列阅读,本页的全部论点都包含在其中:它们朝着相反的方向发展。总线世代与GPU页面发布的数据相同,均来自同一张表格,因此这两个页面在链接方面不存在分歧。

Read from the order catalogue when this page was served. The two middle columns are the trade.
PlatformLanes to the cardNetwork ceilingSocketsMemory ceilingRooms
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

阅读该表格

  • 通往显卡的通道决定了处理器和加速器之间的数据传输速度。这对于流式传输批次数据的训练循环、每帧都向渲染器提供场景数据的渲染过程,以及任何超出显卡内存范围的操作都至关重要。一旦模型驻留在显卡上,通道的重要性就几乎完全消失了。
  • 网络带宽限制决定了机器之间通信的速度。对于单台服务器独立完成的任务来说,网络带宽无关紧要;但对于需要多台服务器协作完成的任务来说,网络带宽限制至关重要。
  • “房间”栏目决定了在你需要的地方是否有相应的选择,它是人们最后阅读的栏目,也是人们应该首先阅读的栏目——见下文。
  • 所以:一项只需一台机器就能完成、对巴士进行高强度作业的任务,需要最宽的作业车道,对港口设施不感兴趣。一项需要多台机器完成的任务,则需要港口设施,但可以接受巴士车龄较旧。同时需要这两项服务,是我们产品目录中唯一不包含的组合,我们宁愿在此提前说明,也不愿在您付款后再告知。

这些服务器分别配备哪款显卡,以及每款显卡每月增加多少成本,这些都是GPU专用服务器——我们为每台服务器配备的显卡都根据其所属的服务器进行定价。本页面特意不列出任何显卡的价格:这部分成本由另一个页面负责。

它们之间的联系是什么?

互连线是按机器购买的,这就是人们在计算中出错的地方。

端口是单个服务器的属性。四台机器以给定的速度运行,每月需要消耗四倍的速度,而这正是让原本预算充足的集群变得捉襟见肘的关键所在。下面是已经计算好的乘法表,因为如果一个关于多台机器的页面却让用户自己计算,那就没有达到预期目的。

Per month, on top of the machine. The port is bought per node, so the right-hand columns are what the same speed costs across a cluster.
PortOne machineTwoFourOffered on
1 Gbpsincludedincludedincludedevery platform
2 Gbps$189$378$756every platform
3 Gbps$299$598$1,196every platform
5 Gbps$459$918$1,836every platform
10 Gbps$529$1,058$2,116every platform
20 Gbps$1,629$3,258$6,516every platform
40 Gbps$2,799$5,598$11,1962 of 4
100 Gbps$3,999$7,998$15,9961 of 4

在你选择梯子之前,有两件事值得注意

  • 这个阶梯并非线性,因此更宽的集群可能比更快的集群更便宜。比较不同等级的机器时,应该将它们彼此比较,而不是与任何机器进行比较:在表格中的某些点上,两台低一级的机器比一台高一级的机器更便宜,而且它们都能提供两台机器。这是否划算完全取决于你的工作是否需要拆分。
  • 梯子的顶端并非每个平台都有。右侧一栏显示了达到每种速度的平台数量,而速度最快的平台会收窄,最终到达一个能让卡片换乘旧巴士的平台。这与上表中的交易相同,只是方向相反。

坦白地说,我们所没有的

我们的产品目录中除了机器间的以太网端口之外,没有其他产品。我们没有列出 InfiniBand 架构,也没有列出卡对卡桥接器,本页面也不会通过含糊其辞的方式暗示有此类产品。如果您的配置需要这些产品,请在下单前咨询,而不是下单后:我们会提供报价,而且答案可能是否定的。这比一个让人误以为可以购买的页面更有价值。

以上所有速度均不限速,双向传输均不设流量限制,且任何账单上均不包含出站流量费用——因此,节点间传输的任何流量都是免费的,而这部分流量通常是需要计费的。不限速带宽是指单个端口在单台机器上的带宽。

它能存在的地方

如果只有一台机器,请先选择平台。如果有多台机器,请先选择房间。

需要相互通信的机器都位于同一栋楼内,而且我们各个房间的平台也不尽相同。先选定平台,你可能会发现你需要的平台所在的房间并没有。这与其他所有设备一样,都来自同一个目录,因此,一条新线路抵达新城市后,会单独出现在这里。

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

数据中心涵盖了建筑物的实际位置、连接方式以及内部其他用户——这五点一应俱全。我们两个城市之间的延迟是一个真实存在的数值,而非营销噱头。我们的技术支持团队会根据您的要求测量您所选城市之间的延迟,而无需您自行从地图上猜测。

它是如何被引用的,以及它出现得有多快。

多节点工作的完成日期是在付款之前,而不是之后。

这种类型的组装需要多台机器,而且通常需要多个非现货部件,因此,诚实地公布的不是交付承诺,而是预计的完成日期——就像按订单组装和 GPU 页面使用的情况一样,用同样的话来说。

  1. 约30分钟

    这些机器已经按原样装架好了。

    所有设备均未安装,也未移动。即时服务器列表列出了当前存在的设备,对于普通节点集群而言,建议首先查看此列表。

  2. 4-24小时

    这些部件是我们持有的。

    通常情况下,技术人员会为每台机器并行安装卡、组装阵列并安装操作系统,而不是一台接一台地进行。

  3. 5-10个工作日

    零件需要从国外购买。

    规格说明中的某些部件我们没有现货。我们需要订购后再进行组装。这是多卡机箱中最常见的一种,因为机箱通常是核心部件,而不是显卡本身。

  4. 10-15个工作日

    零件稀缺

    当前一代加速器采用按需分配模式,具体日期由分销商决定,而非我们。我们会在您确认使用前告知您具体使用期限,而不是事后。如果硬件是为单个客户采购的,我们会要求预付三个月的费用,因为如果客户在第二周就关闭账户,我们将无法再次出租这台机器。

每一阶段的流程都始于订单完成支付和反欺诈审核,这是我们无法保证完成时间的唯一环节——大多数订单会在几个小时内完成审核,但新账户的首笔大额订单可能需要更长时间。对于这种规模的订单,电汇或稳定币通常比信用卡支付更快到账,这一点值得注意,以免反欺诈审核延误机架访问。

用一句话描述多节点或多卡架构比填写表单更快。——节点数量、是否进行任务拆分、需要与哪些组件通信——之前有过类似经验的人就会回答,即使答案是单台机器就能完成。

For the record

Everything on this page, as figures.

Read from the order catalogue when this page was served. Card prices are deliberately not among them — GPU dedicated servers holds every one, against the exact machine each figure belongs to.

Cards in one machine
More than one is a build we quote rather than a checkout option. How many fit depends on the physical width of the card and on the power budget, so the honest answer needs the specific card. Ask, and the reply names the chassis, the count and the lead time.
Machines in one cluster
No limit we impose. Each is a whole physical server rented on its own terms, and they are ordered, billed and replaced independently — there is no cluster product and no minimum node count.
Platforms that take a card
4, and they are not interchangeable. The one with the widest bus to the card (AMD EPYC, PCIe 4.0, 128 lanes per socket) has the lowest network ceiling (20 Gbps) and is in 2 of our 5 rooms. The one that reaches 100 Gbps (Intel Xeon Silver / Gold) gives a card an older bus.
What joins two machines
The port on each of them. Speeds run from the included 1 Gbps on every one of them up to 100 Gbps, priced per machine and per month, so a cluster pays for the speed once per node. There is no NVLink fabric and no InfiniBand here; anything beyond an Ethernet port between two of our machines is quoted rather than listed.
Ceilings in one machine before a second one is needed
2 sockets and 1 TB of memory on the best of these platforms. Past either, the answer is another machine.
Where
5 cities: New York, Miami, San Francisco, Amsterdam, Bucharest. Machines that talk to each other should be in one of them together, and New York and Bucharest hold every platform on this page.
Bandwidth
Unmetered, both directions, at every speed on the ladder. No transfer allowance, no egress line on any invoice — which is what makes moving a dataset between nodes free rather than metered.
Tenancy
One tenant per physical machine, on every node. Cards are passed through to your own operating system: no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
How soon
The same ladder as any build here: about four to twenty-four hours when the parts are ones we hold, five to ten working days when they have to be bought in, and ten to fifteen when a part is scarce. A multi-node build is quoted with its long pole named before you commit.
Term
One month, no contract, on each machine separately. Three, six and twelve-month cycles take up to 15% off. Where hardware is bought in for one customer we ask for three months up front.
What this page does not price
Cards. Every graphics card we fit, what each adds per month and what the machine under it costs are on GPU dedicated servers, priced against the exact machine each figure belongs to.