Módulos aceleradores de IA Edge em um servidor dedicado

Módulos aceleradores Edge TPU & IA

Um Google Coral Edge TPU ou um Hailo-8, instalado como módulo M.2 em um servidor dedicado só seu — para executar modelos pequenos e quantizados junto aos dados que observam, não para treinar modelos grandes.
Ver as máquinas

Para que serve um módulo deste tamanho — e para que não serve:

Inferência de visão

Detecção de objetos, classificação e segmentação são o que estas peças foram feitas para fazer. As redes são pequenas e quantizadas em int8 — da classe MobileNet e EfficientDet, compiladas para o módulo com antecedência — e respondem em milissegundos na máquina que guarda os quadros.

Análise sempre ativa

Ambos os módulos consomem watts de um dígito, então um feed de câmera ou um fluxo de sensores pode ser avaliado o tempo todo sem ocupar o processador host. Os núcleos ficam livres para a sua aplicação; o módulo faz a aritmética.

Não são modelos de linguagem

Um modelo medido em bilhões de parâmetros não cabe em nenhum dos dois módulos, em qualquer quantização, e esta página não vai fingir o contrário. Dimensionar um modelo de linguagem é uma aritmética própria e vive em o que é preciso para executar um modelo; as placas discretas que de fato executam um, cada uma com preço ao lado da sua máquina, estão em servidores dedicados com GPU.

Acelerador Coral M.2

O módulo Coral do Google carrega o Edge TPU, que o Google classifica em 4 trilhões de operações por segundo em inteiros de 8 bits a cerca de dois watts. Esses são os números do fabricante, citados como publicados — não uma medição nossa.


Ele executa modelos TensorFlow Lite que foram quantizados para int8 e compilados para o Edge TPU com antecedência. Essa etapa de compilação é o custo honesto da peça: um modelo ou compila para ela ou não compila, e as redes de borda clássicas — classificação, detecção, pose — são as que compilam.

Acelerador Coral

Módulo Hailo-8 M.2 2280

A Hailo classifica o Hailo-8 em até 26 tera-operações por segundo em inteiros de 8 bits — novamente o número do fabricante, citado como publicado. É o maior dos dois módulos com folga, e é o que se deve pedir quando uma rede do tamanho do Coral não é suficiente.


Os modelos chegam a ele a partir do TensorFlow ou do ONNX pelo compilador da própria Hailo, e o runtime dela os serve na sua máquina. Como no Coral, a etapa de compilação decide o que executa: esta é uma peça de rede neural, não computação de uso geral.

Módulo Hailo-8
Sua própria linha no formulário de pedido

O módulo não é uma categoria de produto: é uma linha no configurador do cartucho, somada ao valor da própria máquina. Nenhum dos dois números é digitado aqui, porque um preço pertence ao lado da máquina com a qual ele vem — a mesma regra que toda página desta família segue.

Os cartuchos que o aceitam

O slot M.2 fica em um cartucho HPE Moonshot. Configure o m710x (Xeon E3-1585L v5 quad-core) ou o m510 (Xeon D, oito ou dezesseis núcleos) e adicione o módulo como opção.

Um locatário, sua cadeia de ferramentas

A máquina é somente sua, com root. O runtime do fabricante — TensorFlow Lite com a biblioteca Edge TPU para o Coral, o HailoRT da Hailo para o Hailo-8 — instala no seu sistema operacional e permanece na versão que você fixar. Nada é atualizado por baixo de você.

Quando o modelo o supera

O passo acima não é um módulo maior; é uma placa discreta em uma máquina feita para recebê-la. Servidores dedicados com GPU é cada placa que instalamos, com preço ao lado da sua máquina; multi-GPU e multi-nó é mais de uma.

Instale um acelerador em um cartucho só seu.

Configurar um servidor