Moduli acceleratori Edge AI su un server dedicato

Moduli acceleratori Edge TPU & AI

Un Google Coral Edge TPU o un Hailo-8, installato come modulo M.2 su un server dedicato di tua proprietà — per eseguire modelli piccoli e quantizzati accanto ai dati che osservano, non per addestrarne di grandi.
Vedi le macchine

A cosa serve un modulo di queste dimensioni — e a cosa non serve:

Inferenza visiva

Rilevamento di oggetti, classificazione e segmentazione sono ciò per cui questi componenti sono stati costruiti. Le reti sono piccole e quantizzate in int8 — della classe MobileNet ed EfficientDet, compilate in anticipo per il modulo — e rispondono in millisecondi sulla macchina che conserva i fotogrammi.

Analisi sempre attiva

Entrambi i moduli assorbono pochi watt, quindi un flusso video o un flusso di sensori può essere elaborato 24 ore su 24 senza occupare il processore host. I core restano liberi per la tua applicazione; il modulo fa i calcoli.

Non modelli linguistici

Un modello misurato in miliardi di parametri non entra in nessuno dei due moduli, a qualsiasi quantizzazione, e questa pagina non fingerà il contrario. Dimensionare un modello linguistico è un calcolo a sé e si trova su cosa serve per eseguire un modello; le schede discrete che ne eseguono uno, ciascuna con il prezzo accanto alla propria macchina, sono su server dedicati GPU.

Acceleratore Coral M.2

Il modulo Coral di Google’ monta l’Edge TPU, che Google valuta a 4 trilioni di operazioni al secondo su interi a 8 bit a circa due watt. Sono le cifre del produttore, citate come pubblicate — non una nostra misurazione.


Esegue modelli TensorFlow Lite quantizzati in int8 e compilati in anticipo per l’Edge TPU. Quel passaggio di compilazione è il costo onesto del componente: un modello o si compila per esso oppure no, e le classiche reti edge — classificazione, rilevamento, posa — sono quelle che ci riescono.

Acceleratore Coral

Modulo Hailo-8 M.2 2280

Hailo valuta l’Hailo-8 fino a 26 tera-operazioni al secondo su interi a 8 bit — anche in questo caso la cifra del produttore, citata come pubblicata. È il più grande dei due moduli di gran lunga, ed è quello da richiedere quando una rete di dimensioni Coral non basta.


I modelli vi arrivano da TensorFlow o ONNX tramite il compilatore di Hailo, e il suo runtime li serve sulla tua macchina. Come per il Coral, il passaggio di compilazione decide cosa gira: questo è un componente per reti neurali, non calcolo generico.

Modulo Hailo-8
Una riga propria nel modulo d’ordine

Il modulo non è una fascia di prodotto: è una riga nel configuratore della cartuccia, aggiunta alla cifra della macchina. Nessuno dei due numeri è digitato qui, perché un prezzo appartiene accanto alla macchina con cui viene fornito — la stessa regola che segue ogni pagina di questa famiglia.

Le cartucce che lo accettano

Lo slot M.2 si trova su una cartuccia HPE Moonshot. Configura la m710x (Xeon E3-1585L v5 quad-core) o la m510 (Xeon D, otto o sedici core) e aggiungi il modulo come opzione.

Un solo tenant, la tua toolchain

La macchina è solo tua, con root. Il runtime del produttore — TensorFlow Lite con la libreria Edge TPU per il Coral, HailoRT di Hailo per l’Hailo-8 — si installa sul tuo sistema operativo e resta alla versione che blocchi. Nulla si aggiorna sotto di te.

Quando il modello lo supera

Il passo successivo non è un modulo più grande; è una scheda discreta in una macchina costruita per ospitarla. Server dedicati GPU è ogni scheda che installiamo, con il prezzo accanto alla sua macchina; multi-GPU e multi-nodo è più di una.

Monta un acceleratore su una cartuccia di tua proprietà.

Configura un server