Data science & ML
I progetti di data science e machine learning producono modelli predittivi calibrati sui dati dell'azienda: dalla definizione della variabile obiettivo alla validazione, fino alla messa in esercizio con monitoraggio del degrado nel tempo.
Cosa comprende
Definizione del problema
Traduzione della domanda di business in una variabile obiettivo misurabile e in una metrica di successo condivisa prima di iniziare.
Esplorazione e preparazione
Analisi delle distribuzioni, trattamento dei valori mancanti e costruzione delle variabili che il modello userà davvero.
Addestramento e validazione
Confronto fra più modelli con validazione che rispetta l'ordine temporale dei dati, per evitare risultati ottimistici e irripetibili.
Esercizio e monitoraggio
Messa in produzione del modello e sorveglianza del degrado delle prestazioni, con criteri espliciti di riaddestramento.
Il problema più difficile è la domanda
La parte tecnicamente più delicata di un progetto di machine learning non è l’addestramento, ma la definizione della variabile obiettivo. «Prevedere l’abbandono dei clienti» non è una specifica: quanto tempo di inattività definisce un abbandono, quali clienti rientrano nel perimetro, con quale anticipo la previsione è ancora utile. Da queste risposte dipende se il modello sarà azionabile o soltanto accurato.
Un modello accurato può essere inutile
Un classificatore con il 95% di accuratezza su un fenomeno che si verifica nel 3% dei casi non ha imparato niente. La metrica va scelta in funzione della decisione che il modello deve supportare e del costo relativo degli errori: sbagliare in eccesso e sbagliare in difetto raramente costano uguale.
I modelli invecchiano
Le condizioni che hanno generato i dati di addestramento cambiano. Senza un monitoraggio delle prestazioni in esercizio, un modello continua a produrre previsioni con la stessa sicurezza anche quando ha smesso di essere valido: è il momento in cui diventa pericoloso, perché nessuno se ne accorge.
Tecnologie utilizzate
- Python
- pandas
- scikit-learn
- PyTorch
- MLflow
- SQL
- Jupyter
Domande frequenti
Quanti dati servono per iniziare?
Dipende dal fenomeno più che dal volume. Spesso il vincolo non è la quantità ma la qualità e la storicità: pochi anni di dati coerenti valgono più di molti mesi di dati incompleti.
Come capite se un modello sta peggiorando?
Confrontando nel tempo le previsioni con gli esiti reali e sorvegliando lo scostamento delle distribuzioni in ingresso. Superata una soglia definita in fase di progetto, si riaddestra.
Altri servizi di Data Intelligence
Data engineering
Il data engineering costruisce le pipeline che rendono i dati utilizzabili: ingestione da sorgenti eterogenee, normalizzazione, controlli di qualità e modellazione, così che ogni analisi a valle parta…