Imparano il normale da dati sporchi
Se la macchina era già malata durante l'apprendimento, il sistema impara la malattia come normale. Da quel momento non la vedrà mai più.
Anomaly detection industriale · Machine learning · Manutenzione predittiva
L'anomaly detection è diventata la parola magica della manutenzione predittiva. "La nostra intelligenza artificiale trova le anomalie": lo dicono tutti. È vero, le trova. Ne trova tantissime.
Il problema è che in una fabbrica quasi tutto è anomalo.
Cambia l'articolo in macchina: anomalia. La pressa riparte dopo il fine settimana: anomalia. L'operatore va in pausa e la macchina resta accesa senza produrre: anomalia. Arriva l'estate: anomalia. Entra una mescola nuova: anomalia.
Nessuna di queste è un guasto. Un sistema che le segnala tutte non trova i guasti. Trova la vita normale di una fabbrica, e la chiama problema.
Cinque eventi insoliti possono essere normali. Un guasto può iniziare senza un picco spettacolare.
La maggior parte dei sistemi funziona così: guarda i dati, impara che cosa è "solito", e segnala tutto ciò che è insolito. Più l'algoritmo è sofisticato, più è bravo a trovare l'insolito.
Ma insolito e rotto sono due cose diverse. Una macchina che fa una cosa nuova è insolita. Una macchina che si sta rompendo, all'inizio, spesso non lo è affatto.
Il risultato lo conosci: un punteggio di anomalia che sale e scende senza spiegazioni, allarmi che nessuno riesce a giustificare, un manutentore che dopo un mese smette di guardare. E quando qualcuno chiede "perché questa macchina è in rosso?", la risposta è un numero.
Un numero non è una diagnosi. È una scommessa.
Se la macchina era già malata durante l'apprendimento, il sistema impara la malattia come normale. Da quel momento non la vedrà mai più.
Molti sistemi aggiornano di continuo il loro riferimento per "adattarsi". Così una macchina che si deteriora lentamente sposta il normale con sé, giorno dopo giorno. L'allarme si spegne esattamente quando serviva.
Confrontano ogni lettura con un normale unico, per tutta la vita della macchina. Ma la stessa lettura è perfetta con un prodotto e sbagliata con un altro.
Se il riferimento segue il segnale che peggiora, il degrado diventa gradualmente normale.
Abbiamo costruito il nostro motore partendo da una regola: ogni allarme deve poter dire perché.
Atherya sa che cosa sta producendo la macchina, in quale mese, se è appena ripartita. Per ogni situazione esiste una firma imparata sullo storico di quella macchina. Quando cambia l'articolo, cambia il riferimento, nello stesso istante. Il campione nuovo non viene mai giudicato con la banda del prodotto precedente.
Dopo ogni cambio c'è un periodo di assestamento, imparato dai cambi veri di quella macchina, non deciso a tavolino. In quel periodo Atherya osserva, non allarma. Solo i limiti fisici restano accesi, perché la fisica non va in pausa.
Se arriva un prodotto mai visto, Atherya non finge di conoscerlo e non lo giudica contro le bande degli altri prodotti, che sarebbe rumore garantito. Si astiene e tiene acceso solo il controllo di plausibilità fisica.
Un tempo di vulcanizzazione deciso dall'operatore non "deriva": viene cambiato. Atherya lo controlla come perimetro di impostazioni legittime, mai come segnale di guasto.
Un rilevatore di attività distingue una pressa che lavora da una in pausa operatore, da una accesa senza nessuno, da una spenta. Le pause non generano allarmi.
Quando il gestionale registra il valore impostato, la differenza tra reale e impostato funziona dalla prima lettura, senza aspettare mesi di apprendimento.
Un picco isolato non è un guasto. Un guasto si riconosce da come si comporta nel tempo, e il nostro motore guarda proprio quello.
Non un punto rosso isolato: una forma coerente che resiste al rumore e attraversa il tempo.
C'è un punto su cui non facciamo compromessi.
Alcune macchine hanno un difetto cronico: lavorano da sempre un po' fuori dal nominale, stabili, senza peggiorare. Per quelle Atherya ricentra le bande sul loro comportamento reale, e registra il difetto come condizione nota e visibile. Da lì in poi un allarme torna a voler dire qualcosa.
Ma se la macchina è fuori dal nominale e si sta muovendo, non adattiamo niente. Adattarsi lì vorrebbe dire spegnere l'allarme mentre il guasto cresce. La differenza tra un difetto stabile e un degrado in corso è esattamente la differenza tra un sistema che impara e un sistema che si abitua.
Lo stesso vale per l'apprendimento iniziale: il normale viene calcolato con statistiche robuste e gli episodi anomali dello storico vengono esclusi, così un guasto passato non allarga le bande che dovranno giudicare il prossimo.
Ogni motore di Atherya produce un verdetto con il suo motivo. Un arbitro finale li mette insieme e conserva la traccia di chi ha detto cosa. Quando un manutentore chiede "perché questa macchina è critica?", la risposta non è un numero. È una frase: quale segnale, contro quale normale, di quanto, da quando, e quali motori lo confermano.
E Atherya conta anche il lavoro che non si vede. Ogni volta che una lettura sarebbe stata un allarme con una soglia fissa, ma è dentro il normale del prodotto in quel mese, il sistema lo registra. Sono gli allarmi inutili che non sono mai arrivati sul telefono di nessuno.
Il manutentore riceve il motivo, non soltanto un punteggio.
Nel nostro settore circolano numeri bellissimi. Noi abbiamo scelto un'altra strada: confrontiamo gli avvisi di Atherya con i guasti e gli interventi reali registrati nei sistemi di manutenzione del cliente. Quanti guasti veri erano stati preceduti da un avviso. Quanti avvisi sono stati seguiti da un intervento. Quanto anticipo ha avuto il cliente.
Il manutentore può dire quando un allarme era sbagliato, e quel giudizio torna nel sistema a rendere le soglie più giuste. La sensibilità si corregge con chi la macchina la conosce, non contro di lui.
Trovare anomalie è facile. In una fabbrica ce ne sono a ogni turno.
Il difficile è sapere quali contano: distinguere un prodotto nuovo da una tenuta che perde, una ripartenza a freddo da un raffreddamento che cede, una macchina diversa da una macchina che sta peggiorando.
Per questo non vendiamo anomaly detection. Diciamo, con un motivo, quando una macchina sta uscendo dal suo normale vero, e quando invece sta solo facendo il suo lavoro.
Un'anomalia non è un guasto. Un sistema che non conosce la differenza non sta proteggendo la tua fabbrica: la sta solo osservando.
Il team Atherya
Trova ciò che sta davvero uscendo dal normale della tua fabbrica.
Esplora Atherya