Tanquem el mòdul introductori amb la lliçó més pràctica de totes: el cicle de vida complet d'un projecte de Machine Learning. Un model no apareix per art de màgia; és el resultat d'un procés amb fases ben definides, des de la definició del problema de negoci fins al monitoratge del model en producció. Aquesta lliçó té una doble funció: et dona el procés professional estàndard, i a més funciona com a mapa del curs, perquè cada fase del flux es correspon amb un o diversos mòduls que estudiarem en detall. Perquè res no quedi abstracte, recorrerem el flux de principi a fi amb un exemple guiat: el problema de churn (abandonament de clients) de MercaFresh, a alt nivell i sense codi complex.
Contingut
- Visió general: el flux i la seva naturalesa iterativa
- Fase 1: Definició del problema
- Fase 2: Obtenció de les dades
- Fase 3: Exploració de les dades
- Fase 4: Preprocessament
- Fase 5: Entrenament del model
- Fase 6: Avaluació
- Fase 7: Desplegament i monitoratge
- El flux com a mapa del curs
- Exemple guiat: el churn de MercaFresh de principi a fi
Visió general: el flux i la seva naturalesa iterativa
El flux estàndard té set fases. El primer que has de saber és que no és una línia recta, sinó un cicle amb retorns: és normal descobrir a l'avaluació que falten dades, o a l'exploració que el problema estava mal definit, i tornar enrere. Els projectes reals fan diverses voltes abans d'arribar a producció.
flowchart TD
A[1. Definicio del problema] --> B[2. Obtencio de dades]
B --> C[3. Exploracio de dades]
C --> D[4. Preprocessament]
D --> E[5. Entrenament del model]
E --> F[6. Avaluacio]
F -->|Resultats suficients| G[7. Desplegament i monitoratge]
F -->|Resultats insuficients| D
F -.->|Falten dades o senyal| B
C -.->|El problema estava mal plantejat| A
G -.->|El rendiment es degrada amb el temps| B
Una regla d'or que sorprèn els principiants: en un projecte típic, la major part del temps (sovint el 60-80 %) se'n va en les fases 2-4 (dades), no a entrenar models. L'entrenament és la fase més glamurosa i, gairebé sempre, la més curta.
Fase 1: Definició del problema
Tot comença al negoci, no a les dades. En aquesta fase es respon:
- Quina decisió volem millorar? ("A quins clients adreçar la campanya de retenció").
- Quin tipus de problema de ML és? Aplicant la guia de la lliçó 01-03: regressió, classificació, clustering...?
- Quina serà la mètrica d'èxit? Tant la tècnica (percentatge d'encert) com la de negoci (reduir les baixes un 15 %). És la P de la definició de Mitchell (lliçó 01-01).
- Quin és el baseline? La solució simple actual que el model haurà de superar (lliçó 01-04).
- És viable i surt a compte? Les 6 condicions que vam estudiar a la lliçó anterior.
Un enunciat ben definit té aquesta forma: "Predir [què] per a [qui/quan] fent servir [quines dades], mesurant l'èxit amb [mètrica], per millorar [decisió de negoci]".
Fase 2: Obtenció de les dades
Localitzar, extreure i ajuntar les dades rellevants:
- Fonts internes: base de dades de comandes, CRM de clients, logs de la web.
- Fonts externes: calendari de festius, meteorologia, dades demogràfiques públiques.
- Construcció de l'etiqueta (en problemes supervisats): definir operativament què és un "positiu". Sembla trivial i no ho és: què és exactament un client que "abandona" un supermercat en línia, si ningú no es "dona de baixa"? Caldrà definir-ho (p. ex., "90 dies sense comprar").
Els aspectes pràctics de manejar aquestes dades amb pandas apareixeran transversalment des del mòdul 3.
Fase 3: Exploració de les dades
Coneguda com a EDA (Exploratory Data Analysis): mirar les dades abans de tocar-les.
- Estadístiques descriptives: mitjanes, medianes, rangs, distribucions (tot això és el mòdul 2).
- Visualitzacions: histogrames, diagrames de dispersió, sèries temporals.
- Relacions entre variables: correlacions (lliçó 02-03).
- Sorpreses: valors impossibles (edats de 200 anys), duplicats, forats, desequilibris (només el 4 % dels clients abandona?).
L'exploració sovint reescriu el projecte: aquí es descobreix que la variable clau no es registra des de 2024, o que el 30 % dels clients no té el codi postal informat.
Fase 4: Preprocessament
Les dades crues gairebé mai no serveixen tal qual. Cal:
- Netejar: corregir errors, eliminar duplicats (03-01).
- Tractar valors absents: eliminar o imputar (03-02).
- Transformar i codificar: convertir categories com "ciutat" a nombres que l'algorisme entengui (03-03, 03-04).
- Escalar: normalitzar o estandarditzar magnituds (03-05).
- Crear característiques noves amb coneixement del negoci (feature engineering, 03-06): per exemple, "dies des de la darrera compra" no existeix a la base de dades, es calcula, i sol ser la variable més predictiva del churn.
A tot el mòdul 3 li dedicarem aquesta feina, perquè és on es guanya o es perd la qualitat del model.
Fase 5: Entrenament del model
Per fi, la fase "estrella" (i la més curta):
- Triar un o diversos algorismes candidats d'acord amb el tipus de problema (els del mòdul 4 si és supervisat, els del mòdul 5 si és no supervisat).
- Entrenar-los amb les dades preparades (el
fit()que ja coneixes de la lliçó 01-01). - Ajustar-ne la configuració (els hiperparàmetres, que optimitzarem al mòdul 7).
En la pràctica professional es proven diversos algorismes i es comparen; rarament se sap per endavant quin funcionarà millor amb les teves dades.
Fase 6: Avaluació
El model és bo de debò? Respondre-ho amb rigor és tot el mòdul 6:
- Separar dades d'entrenament i de prova, per mesurar sobre exemples que el model no va veure (06-01): la capacitat de generalitzar que vam esmentar a la lliçó 01-01.
- Calcular mètriques adequades al problema (06-02, 06-04): amb només un 4 % de clients que abandonen, un model inútil que sempre digui "es queda" encerta el 96 %; per això triar bé la mètrica és crític.
- Detectar overfitting/underfitting (06-05): memoritzar el passat no és aprendre.
- Comparar contra el baseline i contra la mètrica de negoci definida a la fase 1. Si no el supera, es torna a la fase 4 (o a la 2): el cicle del diagrama.
Fase 7: Desplegament i monitoratge
Un model que viu al portàtil de l'analista no genera valor. Cal:
- Desplegar-lo: integrar-lo als sistemes reals (una API que el CRM consulta, un procés nocturn que puntua tots els clients) — mòdul 8 (08-01, 08-02).
- Monitorar-lo: el món canvia (nous hàbits, nous productes, una pandèmia...) i el rendiment dels models es degrada amb el temps (fenomen conegut com a drift). Cal vigilar mètriques i reentrenar periòdicament (08-03).
- Governar-lo: ètica, privadesa i compliment normatiu (08-04).
Per això la darrera fletxa del diagrama torna al principi: un projecte de ML no "s'acaba"; es manté.
El flux com a mapa del curs
Aquesta taula és el teu mapa de navegació per a tot el curs: cada fase del flux indica on s'estudia en profunditat.
| Fase del flux | Què s'hi fa | On s'estudia en aquest curs |
|---|---|---|
| 1. Definició del problema | Objectiu, tipus de problema, mètrica, baseline, viabilitat | Mòdul 1 (lliçons 01-03 i 01-04) |
| 2. Obtenció de dades | Fonts, extracció, construcció de l'etiqueta | Transversal (mòduls 3 i 9) |
| 3. Exploració (EDA) | Estadístiques, distribucions, correlacions | Mòdul 2 |
| 4. Preprocessament | Neteja, valors absents, codificació, escalat, features | Mòdul 3 |
| 5. Entrenament | Algorismes supervisats / no supervisats | Mòduls 4 i 5 |
| 6. Avaluació | Divisió de dades, mètriques, validació, over/underfitting | Mòdul 6 |
| (Millora iterativa) | Regularització, ensembles, hiperparàmetres | Mòdul 7 |
| 7. Desplegament i monitoratge | Producció, manteniment, ètica | Mòdul 8 |
| Tot el cicle, integrat | Projectes complets de principi a fi | Mòdul 9 |
Exemple guiat: el churn de MercaFresh de principi a fi
Recorrem ara el cicle complet amb el problema que ens acompanyarà en diversos mòduls. Tot a alt nivell: els detalls tècnics arribaran als seus mòduls.
Fase 1 — Definició. La direcció constata que captar un client nou costa unes 5 vegades més que retenir-ne un d'existent. Enunciat del projecte: "Predir quins clients actius deixaran de comprar en els propers 90 dies, fent servir el seu historial de comandes i navegació, mesurant l'èxit per la proporció d'abandonaments correctament anticipats, per adreçar-los una campanya de retenció amb cupons". És un problema supervisat de classificació binària (lliçó 01-03). Baseline actual: l'equip de màrqueting envia cupons a qui no compra des de fa 60 dies, sense més criteri.
Fase 2 — Obtenció. S'extreuen del sistema de comandes 24 mesos d'historial i del CRM les dades de cada client. Decisió clau: es defineix "abandonament" com 90 dies consecutius sense cap comanda. Amb aquesta definició es construeix l'etiqueta: per a cada client, mirant una data de tall passada, sabem si en els 90 dies següents va abandonar (1) o no (0).
Fase 3 — Exploració. Primeres troballes: només el 7 % dels clients abandona per trimestre (classes molt desequilibrades, cosa que condicionarà la mètrica a la fase 6); hi ha clients duplicats per haver-se registrat amb dos correus; i la freqüència de compra cau de manera visible setmanes abans de l'abandonament — bona notícia: hi ha senyal a aprendre.
Fase 4 — Preprocessament. S'eliminen duplicats, s'imputen codis postals absents, es codifica la ciutat com a variable numèrica i es creen característiques amb coneixement de negoci: dies_des_ultima_compra, comandes_ultim_trimestre, variacio_tiquet_mitja, incidencies_lliurament_recents.
Fase 5 — Entrenament. S'entrenen dos o tres classificadors candidats del mòdul 4 (per exemple, regressió logística i arbres de decisió) amb les dades preparades. Conceptualment, l'escena és la que ja coneixes:
# El cor del projecte, conceptualment (els detalls, als moduls 3-6)
model.fit(X_entrenament, y_entrenament) # apren de clients del passat
probabilitats = model.predict(X_clients_avui) # puntua els clients actualsDues línies que resumeixen setmanes de feina: X_entrenament és el resultat de les fases 2-4 (clients històrics descrits per les seves característiques), y_entrenament és l'etiqueta construïda a la fase 2, i la predicció assigna a cada client actual el seu risc d'abandonament.
Fase 6 — Avaluació. Es mesura sobre clients que el model no va veure durant l'entrenament. Atès el desequilibri (7 %), el percentatge brut d'encerts enganya, així que es fan servir mètriques adequades al problema (les de 06-02 i 06-04). El model detecta el 71 % dels futurs abandonaments enfront del ~35 % que capturava la regla dels 60 dies: supera el baseline amb claredat.
Fase 7 — Desplegament i monitoratge. Cada dilluns, un procés automàtic puntua tots els clients actius i envia al CRM la llista d'alt risc; màrqueting els adreça la campanya de retenció. Es monitoren dues coses: la qualitat de les prediccions (continua encertant?) i el resultat de negoci (baixen les baixes?). Sis mesos després, un canvi a l'app mòbil altera els patrons de navegació i el rendiment cau: es reentrena amb dades recents. El cicle continua.
Errors Comuns i Consells
- Començar pel model i no pel problema. Entrenar sense una mètrica d'èxit i un baseline definits és caminar sense brúixola; les fases 1-3 no són burocràcia, són el projecte.
- Subestimar la feina de dades. Reserva en la teva planificació (mental i real) la major part de l'esforç per a les fases 2-4; és el que trobaràs en qualsevol equip professional.
- Tractar el flux com una cascada rígida. Tornar enrere no és fracassar: és el funcionament normal del cicle. Pressuposta iteracions.
- Avaluar amb les mateixes dades de l'entrenament. És l'error tècnic número u dels principiants: dona resultats espectaculars i inútils. El mòdul 6 t'ensenyarà a evitar-lo sistemàticament.
- Oblidar el monitoratge. Un model desplegat i abandonat es degrada en silenci. Si ningú no el vigila, ningú no sabrà quan va deixar de funcionar.
- Consell: guarda la taula "flux → mòduls" d'aquesta lliçó i torna-hi en començar cada mòdul del curs: sabràs sempre en quina fase del projecte estàs treballant i per què importa.
Exercicis
Exercici 1
Ordena aquestes activitats del projecte de churn segons la fase del flux a què pertanyen (1-7): (a) descobrir que el 7 % dels clients abandona per trimestre; (b) crear la variable dies_des_ultima_compra; (c) acordar amb màrqueting que l'èxit es mesurarà per la proporció d'abandonaments anticipats; (d) reentrenar el model perquè el seu rendiment va caure després del canvi de l'app; (e) definir "abandonament" com 90 dies sense comprar i construir l'etiqueta; (f) comparar el model contra la regla dels 60 dies.
Exercici 2
Escriu l'enunciat complet de projecte (amb la plantilla "Predir [què] per a [qui/quan] fent servir [quines dades], mesurant amb [mètrica], per millorar [decisió]") per al problema de previsió de demanda de frescos de MercaFresh presentat a la lliçó 01-04. Indica a més quin tipus de problema és i proposa un baseline raonable.
Exercici 3
A l'exemple guiat, l'exploració va revelar que només el 7 % dels clients abandona. Explica en 3-4 línies per què un model que sempre prediu "es queda" encertaria el 93 % de les vegades i, tanmateix, seria completament inútil per a MercaFresh. Quina fase del flux s'encarrega d'evitar aquest miratge i en quin mòdul s'estudia?
Solucions
Solució 1
- (c) → Fase 1 (definició del problema: mètrica d'èxit).
- (e) → Fase 2 (obtenció de dades: construcció de l'etiqueta).
- (a) → Fase 3 (exploració: descobrir el desequilibri de classes).
- (b) → Fase 4 (preprocessament: enginyeria de característiques).
- (f) → Fase 6 (avaluació: comparació contra el baseline).
- (d) → Fase 7 (monitoratge i manteniment: reentrenar davant la degradació).
Solució 2
Enunciat possible: "Predir les unitats que es vendran de cada producte fresc, per a cada dia de la setmana vinent, fent servir l'historial de vendes, el calendari de festius, les promocions actives i la previsió meteorològica, mesurant l'èxit amb l'error mitjà entre unitats previstes i venudes, per millorar les ordres de compra a proveïdors i reduir la minva i els trencaments d'estoc". És un problema supervisat de regressió (l'etiqueta és un nombre: unitats venudes). Baseline raonable: la regla actual del responsable de compres — la mitjana de vendes de les darreres 4 setmanes més un 10 % de marge.
Solució 3
Com que el 93 % dels clients no abandona, un model que respongui sempre "es queda" coincideix amb la realitat el 93 % de les vegades sense haver après res: no identifica cap dels clients en risc, que són precisament els que interessen per a la campanya de retenció. L'encert brut és un miratge en classes desequilibrades. Ho evita la fase 6 (avaluació), triant mètriques adequades al problema, i s'estudia al mòdul 6 (especialment les lliçons 06-02 i 06-04).
Conclusió
Amb aquesta lliçó es tanca el mòdul introductori i queda dibuixat el procés complet: definir el problema amb mètrica i baseline, obtenir i explorar les dades, preprocessar-les (on viu la major part de l'esforç), entrenar, avaluar amb rigor sobre dades no vistes, i desplegar amb monitoratge continu, iterant tantes vegades com calgui. Has vist el cicle sencer aplicat al churn de MercaFresh i tens la taula que connecta cada fase amb el seu mòdul: aquest és el teu mapa per a la resta del curs. El viatge comença pels fonaments de la fase d'exploració: al mòdul 2 estudiarem els fonaments d'estadística i probabilitat que permeten entendre les dades abans de modelar-les.
Curs de Machine Learning
Mòdul 1: Introducció al Machine Learning
- Què és el Machine Learning?
- Història i evolució del Machine Learning
- Tipus de Machine Learning
- Aplicacions del Machine Learning
- El flux de treball d'un projecte de Machine Learning
Mòdul 2: Fonaments d'Estadística i Probabilitat
- Conceptes bàsics d'estadística
- Distribucions de probabilitat
- Correlació i covariància
- Inferència estadística
- Teorema de Bayes
Mòdul 3: Preprocessament de Dades
- Neteja de dades
- Gestió de dades mancants
- Transformació de dades
- Codificació de variables categòriques
- Normalització i estandardització
- Enginyeria de característiques
Mòdul 4: Algorismes de Machine Learning Supervisat
- Regressió lineal
- Regressió logística
- Arbres de decisió
- Màquines de suport vectorial (SVM)
- K veïns més propers (K-NN)
- Naive Bayes
- Xarxes neuronals
Mòdul 5: Algorismes de Machine Learning No Supervisat
- Clustering: K-means
- Clustering jeràrquic
- Anàlisi de components principals (PCA)
- Anàlisi d'agrupament DBSCAN
- Visualització de dades amb t-SNE i UMAP
Mòdul 6: Avaluació i Validació de Models
- Divisió de dades: entrenament, validació i prova
- Mètriques d'avaluació
- Validació creuada
- Corba ROC i AUC
- Overfitting i underfitting
Mòdul 7: Tècniques Avançades i Optimització
- Regularització: Ridge, Lasso i Elastic Net
- Ensemble Learning
- Gradient Boosting
- Xarxes neuronals profundes (Deep Learning)
- Optimització d'hiperparàmetres
Mòdul 8: Implementació i Desplegament de Models
- Frameworks i biblioteques populars
- Implementació de models en producció
- Manteniment i monitoratge de models
- Consideracions ètiques i de privadesa
Mòdul 9: Projectes Pràctics
- Projecte 1: Predicció de preus d'habitatges
- Projecte 2: Classificació d'imatges
- Projecte 3: Anàlisi de sentiments a les xarxes socials
- Projecte 4: Detecció de fraus
- Projecte 5: Segmentació de clients
