专用服务器上的边缘 AI 加速器模块

Edge TPU 与 AI 加速器模块

Google Coral Edge TPU 或 Hailo-8,以 M.2 模块形式安装到您自己的专用服务器上 — 用于在数据旁边运行小型量化模型,而非训练大型模型。
查看机器

这种尺寸的模块适合做什么 — 又不适合做什么:

视觉推理

目标检测、分类和分割正是这些部件被制造出来的目的。网络规模小且经过 int8 量化 — 属于 MobileNet 和 EfficientDet 一类,提前为模块编译好 — 它们在保存帧的机器上以毫秒级响应。

全天候分析

两个模块的功耗都只有个位数瓦特,因此摄像头画面或传感器数据流可以全天候评分,而无需占用主机处理器。核心保持空闲供您的应用使用;模块负责运算。

不适合语言模型

参数以十亿计的模型在任何量化精度下都无法装入这两个模块,本页面也不会假装可以。为语言模型确定规模是另一套运算,见 运行一个模型需要什么;真正能运行语言模型的独立显卡,每张都标价在其机器旁,见 GPU 专用服务器

Coral M.2 加速器

Google’s Coral 模块搭载 Edge TPU,Google 标称其在约两瓦功耗下每秒可执行 4 万亿次 8 位整数运算。这些是厂商公布的数据,按原样引用 — 并非我们的测量结果。


它运行已量化为 int8 并提前为 Edge TPU 编译好的 TensorFlow Lite 模型。这个编译步骤是该部件的真实成本:模型要么能为其编译,要么不能,而经典的边缘网络 — 分类、检测、姿态 — 正是能够编译的那些。

Coral 加速器

Hailo-8 M.2 2280 模块

Hailo 标称 Hailo-8 在 8 位整数运算上最高可达每秒 26 万亿次运算 — 同样是厂商公布的数据,按原样引用。它是两个模块中明显更大的一个,当 Coral 规模的网络不够用时,应该选择它。


模型通过 Hailo 自有的编译器从 TensorFlow 或 ONNX 导入,其运行时在您的机器上为它们提供服务。与 Coral 一样,编译步骤决定什么能运行:这是一个神经网络部件,而非通用计算。

Hailo-8 模块
订单表单上独立的一行

该模块不是一个产品层级:它是机箱配置器上的一行,加到机器自身的价格之上。两个数字都不会在这里列出,因为价格应标注在它所搭配的机器旁 — 本系列每个页面都遵循同样的规则。

支持它的机箱

M.2 插槽位于 HPE Moonshot 机箱上。配置 m710x(四核 Xeon E3-1585L v5)或 m510(Xeon D,八核或十六核),并将该模块作为选项添加。

单一租户,您的工具链

这台机器完全属于您,拥有 root 权限。厂商的运行时 — Coral 使用带 Edge TPU 库的 TensorFlow Lite,Hailo-8 使用 Hailo 的 HailoRT — 安装在您的操作系统上,并保持在您固定的版本。不会有任何东西在您不知情的情况下升级。

当模型超出它的能力时

升级的方向不是更大的模块;而是装进为容纳独立显卡而设计的机器里的独立显卡。GPU 专用服务器 是我们安装的每一张显卡,标价在其机器旁;多 GPU 和多节点 则不止一张。

为您自己的机箱加装一个加速器。

配置一台服务器