Un progetto tipico dura tra le 8 e le 16 settimane, a seconda della complessità dei dati e del numero di integrazioni richieste. Ecco come si articola.
Scoperta e definizione del problema
Nella prima settimana ci sediamo con il tuo team per capire il problema reale. Non quello tecnico, quello di business. Perché i clienti abbandonano il carrello? Perché la linea di produzione si ferma tre volte al mese? Raccogliamo dati qualitativi e quantitativi, esaminiamo i sistemi esistenti e identifichiamo le fonti di dati disponibili. Al termine di questa fase consegniamo un documento di scoping che include obiettivi, metriche di successo e rischi principali. Il documento viene approvato da entrambe le parti prima di procedere.
Audit e preparazione dei dati
I dati sono il carburante di qualsiasi modello. In questa fase, che dura circa due settimane, analizziamo la qualità dei dati disponibili: completezza, coerenza, distribuzione, eventuali bias. Scriviamo pipeline di pulizia e trasformazione in Python, documentando ogni passaggio. Se mancano dati critici, proponiamo strategie di raccolta o di data augmentation. Il risultato è un dataset pronto per l'addestramento, con una scheda tecnica che descrive ogni variabile.
Prototipazione rapida
Costruiamo un primo modello funzionante in 10-15 giorni. Non puntiamo alla perfezione: l'obiettivo è verificare che l'approccio scelto produca risultati accettabili. Testiamo diverse architetture (gradient boosting, reti neurali convoluzionali, transformer) e confrontiamo le prestazioni su un set di validazione. Presentiamo i risultati al cliente con grafici chiari, senza gergo inutile.
Sviluppo e ottimizzazione
Il modello selezionato viene affinato: tuning degli iperparametri, feature engineering avanzato, gestione dei casi limite. Questa fase richiede tra le tre e le cinque settimane. Ogni iterazione viene tracciata con MLflow, così il cliente può vedere come cambiano le metriche nel tempo. Alla fine, il modello raggiunge (o supera) le soglie concordate nel documento di scoping.
Integrazione e deploy
Installiamo il modello nell'infrastruttura del cliente. Può essere un endpoint API su cloud, un container Docker on-premise o un modulo integrato nel gestionale esistente. Scriviamo test automatici che verificano la correttezza delle previsioni a ogni aggiornamento. La documentazione tecnica copre l'architettura, le dipendenze, le procedure di rollback e il monitoraggio delle performance.
Monitoraggio e supporto continuo
Dopo il rilascio, monitoriamo il modello per 90 giorni. Controlliamo la drift dei dati, cioè il fenomeno per cui le distribuzioni cambiano nel tempo e il modello perde accuratezza. Se la drift supera le soglie concordate, riaddestriamo il modello con dati aggiornati. Il cliente riceve un report mensile con le metriche chiave: precisione, recall, latenza media, numero di previsioni errate segnalate dagli operatori.