AMD Instinct 加速器

一台只有我一个人用的机器,搭载AMD Instinct 处理器

我们的专用服务器配备了两块 AMD 加速卡:Instinct MI210 和 Instinct MI50。该卡直接连接到您自己的操作系统——您的 ROCm 版本、内核、进程,中间没有任何虚拟机管理程序。

MI210:104 个 CDNA 2 计算单元,64 GB HBM2e。 MI50:60 个 GCN 5.1 计算单元,16 GB。每台机器仅限一个租户使用。不进行资源分割,也不进行时间共享。

我们安装的每一张显卡——AMD 和 NVIDIA 的,无论是现款还是早已停产的——都在GPU 目录中列出了各自的月度价格。

把你的GPU变成被动月收入

有闲置的服务器或桌面 GPU 配置吗?立即在 Primcast 市场上架,即可从需要生产级计算的 AI 团队、开发人员和企业那里获得稳定的月租金。

前往市场

这里所谓的AMD Instinct服务器究竟是什么?

一台租用给某个账户的物理服务器,其 PCIe 插槽中插有 AMD 加速卡,并且操作系统根目录位于其上。该加速卡在发票上单独列出,而非产品等级,因此底层服务器的价格不会因为其上插的加速卡而增加。

这张卡是你的。

没有分区,没有虚拟GPU,也没有调度器来决定何时轮到你。加速器直接交给你的内核,所以你可以自行锁定ROCm版本并加载自己的模块,无需我们介入。

ROCm、HIP 和常用框架

这两个部件都支持 ROCm 目标——MI210 为 gfx90a,MI50 为 gfx906——PyTorch、TensorFlow、JAX 和 ONNX Runtime 在 AMD 平台上构建时正是基于这些目标。HIP 直接移植 CUDA 源代码,无需重写。

价格不包含机器本身。

加速器有自己的月度费用,服务器也有自己的月度费用,将两者相加即可。更换显卡无需更换服务器。目录中每张显卡的这两个费用都列在GPU 页面上。

我们安装了两块 AMD Instinct 加速卡。

这两款处理器目前均可通过同一配置器订购,但属于不同的服务器产品线。以下数据为AMD官方公布的数据。

AMD Instinct MI210 加速器

AMD Instinct MI210

这款 CDNA 2 架构的显卡采用标准的全高全长双槽 PCIe 卡设计,拥有 104 个计算单元、64 GB HBM2e 显存(最高读写速度达 1.6 TB/s),并支持最多三条 Infinity Fabric 链路,可实现卡间直接通信。它采用被动散热,通过 PCIe Gen 4 主机链路散热,功耗为 300 W。如果您正在考虑的问题是显卡型号是否符合内存要求,那么这款显卡就是您的最佳选择。

AMD Instinct MI50

这款老款 Vega 架构的显卡采用 GCN 5.1 芯片,拥有 60 个计算单元和 16GB 的封装内存。现在几乎没人租用这款显卡了,这意味着它在其他地方根本买不到,而不仅仅是价格便宜——而且它仍然是 ROCm 支持的平台,因此可以运行与 MI210 相同的 HIP 和 PyTorch 代码,月租费用却只有 MI210 的一小部分。在真正入手高端显卡之前,用它来搭建 ROCm 工具链是明智之举。

MI210 的矩阵吞吐量

AMD 公布了 MI210 在 1700 MHz 峰值加速引擎时钟频率下,FP16 和 BF16 矩阵峰值性能为 181.0 TFLOPS,FP64 和 FP32 向量峰值性能为 22.6 TFLOPS。

内存是限制因素

64 GB 的存储空间可以容纳一个 300 亿参数模型的 8 位权重,或者一个 130 亿参数模型的 16 位权重,并且还有剩余空间用于键值缓存。GPU页面会针对每种模型大小进行相应的运算。

主人递的卡片

主机通道生成是几乎无人公开的信息,但它却决定了显卡能否以其设计带宽运行。我们在每张显卡的GPU页面上都公布了主机通道生成信息。

字节数不计入任何因素

权重输入,检查点输出,数据集输入。该端口不限流量,因此,一次流式传输语料库的训练运行不会在月底产生带宽账单。

HPE 企业级专用服务器,采用 AMD Instinct™ 技术

HPE 企业

您的 AMD INSTINCT™ GPU 专用服务器由 HPE 企业级服务器提供支持,可确保为最苛刻的工作负载提供稳定的性能。

硬件升级

轻松为您的服务器基础架构添加资源或额外服务器。大多数升级会在 24 小时内完成。

全天候支持

我们有专业的服务器专家团队,可通过在线聊天和电子邮件全天候为您提供帮助。

MI210 也适用于 NVIDIA 显卡,我们也有相应的测试数据。

四个加速器均来自同一订购目录,因此这里比较的是您可以放入同一购物车中的部件。最后一行显示的月度数据是在页面加载时从该目录中读取的。

MI210L40SA100H100
GPU架构CDNA 2艾达·洛夫莱斯NVIDIA Ampere料斗
GPU 显存64GB HBM2e48GB GDDR6 显存,带 ECC 纠错功能80GB HBM2e80GB HBM3
GPU内存带宽最高可达 1.6 TB/秒864 GB/s1935 GB/s3352 GB/s
FP3222.6 TFLOPS91.6 TFLOPS19.5 TFLOPS51 TFLOPS
TF32 张量核心366 TFLOPS312 TFLOPS756 TFLOPS
FP16/BF16矩阵181 TFLOPS733 TFLOPS624 TFLOPS1513 TFLOPS
力量最高可达 300 瓦最高可达 350 瓦最高可达 400 瓦最高可达 350 瓦
加载中...加载中...加载中...加载中...

TF32 是 NVIDIA 的 Tensor Core 格式。CDNA 2 并未实现该格式,AMD 也未公布相关数据,因此 MI210 列中显示的是空值,而非从其他厂商借用的数据。NVIDIA Tensor Core 列显示的是已公布的稀疏化数据。我们测试的其他所有显卡,包括 MI50,其价格均已在GPU 产品目录中列出。

关于 AMD Instinct GPU 服务器的常见问题解答

关于在裸机上部署和管理 AMD Instinct 加速器以用于 AI、HPC 和机器学习工作负载的常见问题。

我可以订购哪些AMD Instinct加速卡?

两款:Instinct MI210 和 Instinct MI50。这些是我们订购目录中的 AMD 加速卡,配置器不会提供 Instinct 系列的其他产品。MI210 用于我们的三款服务器产品线,MI50 用于两款。我们不提供 MI250、MI250X 或 MI300A,也从未提供过。

MI210 和 MI50 有什么区别?

架构和内存。MI210 采用 AMD 的 CDNA 2 架构,拥有 104 个计算单元和 64 GB HBM2e 显存,最高读写速度可达 1.6 TB/s,采用双槽 PCIe 卡设计,通过 PCIe Gen 4 主机链路功耗最高可达 300 W,并支持最多三条 Infinity Fabric 链路用于卡间通信。MI50 采用更早的 GCN 5.1 架构,拥有 60 个计算单元和 16 GB 显存。两者均支持 ROCm 目标平台,因此相同的 HIP 和 PyTorch 代码可以在两者上运行——MI210 的模型容量是 MI50 的四倍。

我想运行的模型需要多少内存?

仅权重就是参数乘以每个参数的字节数:对于一个 70-80 亿参数的 16 位模型,大约需要 16 GB 内存;对于 130-140 亿参数的模型,大约需要 28 GB 内存;对于 300-340 亿参数的模型,大约需要 68 GB内存。键值缓存和运行时内存还要占用额外的空间,这就是为什么 16 GB 的显卡无法轻松处理权重为 16 GB 的模型。MI210 的 64 GB 内存足以处理一个 300 亿参数的 8 位模型,并且还有剩余的运行空间。GPU 页面上有完整的表格。

部署一台AMD Instinct GPU服务器需要多长时间?

如果机器已经装架,通常在付款到账后约 30 分钟即可激活。如果尚未装架,则需要按需定制,交货时间取决于零部件。如果您对日期有要求,请在付款前咨询—— “即时服务器”页面展示了目前已装架的服务器。每台服务器都包含即时操作系统重装功能,因此您可以快速迭代,无需重新提交工单。

这些显卡上运行哪些软件和框架?

ROCm 是 AMD 的开源 GPU 计算平台。MI210 和 MI50 都支持 ROCm 目标平台——gfx90a 对应 MI210,gfx906 对应 MI50——涵盖 PyTorch、TensorFlow、JAX 和 ONNX Runtime,以及 BLAS、FFT、RNG 和深度学习原语库。HIP 直接移植现有的 CUDA 源代码,无需重写。由于您拥有裸机 root 权限,因此可以自行选择 ROCm 和内核版本,并且可以在 Docker 或 Kubernetes 中运行整个系统。