Ja sabem què és el Machine Learning i d'on ve. El pas següent és organitzar el camp: no tots els problemes d'aprenentatge són iguals, i la primera decisió en qualsevol projecte és identificar quin tipus d'aprenentatge necessita el teu problema. En aquesta lliçó estudiarem els quatre grans paradigmes —supervisat, no supervisat, semisupervisat i per reforç—, amb una atenció especial a la distinció entre regressió i classificació dins del supervisat, i entre clustering i reducció de dimensionalitat dins del no supervisat. Farem servir els problemes de MercaFresh per veure que cada pregunta de negoci encaixa de manera natural en un d'aquests tipus. Aquesta lliçó és un mapa: els algorismes concrets de cada tipus s'estudien als mòduls 4 i 5.

Contingut

  1. El criteri de classificació: quina informació tenen les dades?
  2. Aprenentatge supervisat
  3. Regressió vs. classificació
  4. Aprenentatge no supervisat
  5. Aprenentatge semisupervisat
  6. Aprenentatge per reforç
  7. Taula comparativa dels quatre tipus
  8. Com identificar el tipus de problema: guia pràctica

El criteri de classificació: quina informació tenen les dades?

Els tipus de ML es distingeixen per una pregunta molt simple: les nostres dades d'entrenament inclouen la resposta correcta (l'"etiqueta") o no?

  • Si cada exemple ve amb la seva resposta coneguda → aprenentatge supervisat.
  • Si no hi ha respostes, només dades "en brut" → aprenentatge no supervisat.
  • Si només uns quants exemples tenen resposta → aprenentatge semisupervisat.
  • Si no hi ha dades prèvies, sinó un entorn on provar accions i rebre recompenses → aprenentatge per reforç.
flowchart TD
    Q1{Tens exemples amb la<br>resposta correcta coneguda?}
    Q1 -- "Si, tots" --> S[Supervisat]
    Q1 -- "Nomes uns quants" --> SS[Semisupervisat]
    Q1 -- "No, cap" --> NS[No supervisat]
    Q1 -- "No hi ha dades previes:<br>s'apren provant accions" --> RF[Per reforc]
    S --> Q2{Que predius?}
    Q2 -- "Un nombre" --> R[Regressio]
    Q2 -- "Una categoria" --> C[Classificacio]
    NS --> Q3{Que busques?}
    Q3 -- "Grups naturals" --> CL[Clustering]
    Q3 -- "Comprimir variables" --> RD[Reduccio de<br>dimensionalitat]

Guarda mentalment aquest diagrama: és el primer pas de qualsevol projecte de ML.

Aprenentatge supervisat

És el tipus més comú en la pràctica empresarial. S'anomena "supervisat" perquè durant l'entrenament hi ha un "supervisor" (les etiquetes) que diu a l'algorisme quina era la resposta correcta de cada exemple, igual que les etiquetes frau / no frau de l'exemple de la lliçó 01-01.

Ingredients:

  • Característiques (X): les dades d'entrada de cada exemple (import de la comanda, antiguitat del client…).
  • Etiqueta (y): la resposta correcta coneguda de cada exemple (va comprar / no va comprar; 37,50 €…).
  • Objectiu: aprendre la relació X → y per predir l'etiqueta de casos nous.

A MercaFresh, l'aprenentatge supervisat és possible perquè el passat ja ens va donar les respostes: sabem quanta llet es va vendre cada dia de l'any passat, i sabem quins clients van deixar de comprar. Aquest historial etiquetat és or per entrenar.

# Estructura tipica d'un problema supervisat a MercaFresh (il·lustratiu)
# X: caracteristiques de cada client        y: etiqueta coneguda
X = [
    # [mesos_antiguitat, comandes_ultim_trimestre, tiquet_mitja_eur]
    [24, 12, 45.0],
    [3,   1, 18.5],
    [36,  9, 60.2],
]
y = ["es_queda", "abandona", "es_queda"]   # el que sabem que va passar despres

Fixa't en l'estructura: cada fila de X descriu un client amb nombres, i la llista y guarda el que realment li va passar. El model aprendrà quines combinacions de característiques anticipen un abandonament. Aquesta parella (X, y) és la signatura inconfusible de l'aprenentatge supervisat.

Regressió vs. classificació

Dins del supervisat hi ha dos subtipus, segons la naturalesa de l'etiqueta:

Regressió: predir un nombre

L'etiqueta és un valor numèric continu: pot prendre qualsevol valor dins d'un rang.

  • MercaFresh: quants quilos de taronges vendrem dissabte? (demanda)
  • MercaFresh: quant gastarà aquest client el mes vinent?
  • Altres: preu d'un habitatge, temperatura de demà, minuts de retard d'un vol.

Classificació: predir una categoria

L'etiqueta és una classe discreta: una opció entre un conjunt finit.

  • MercaFresh: aquest client abandonarà o no en els propers 3 mesos? (churn: 2 classes, classificació binària)
  • MercaFresh: aquesta comanda és legítima o fraudulenta?
  • Altres: aquest correu és spam?, aquesta foto mostra un tomàquet, una poma o un pebrot? (classificació multiclasse)
Criteri Regressió Classificació
L'etiqueta és... Un nombre continu Una categoria discreta
Pregunta típica Quant? Quants? Quin? Sí o no?
Exemple MercaFresh Demanda de demà: 342 unitats Client: abandona / es queda
Sortida del model 342,7 "abandona" (o una probabilitat: 0,82)
Un error es mesura com... Distància al valor real Encert o errada de la classe
Mòdul on s'estudia 4 (p. ex. regressió lineal, 04-01) 4 (p. ex. regressió logística, 04-02)

Truc per no confondre's: pregunta't si té sentit dir que una predicció s'ha quedat "a prop" de la resposta. Predir 340 unitats quan n'eren 342 és gairebé perfecte (regressió); predir "es queda" quan va abandonar és simplement una errada (classificació). I una advertència terminològica que reprendrem a 04-02: la regressió logística, malgrat el nom, és un algorisme de classificació.

Aprenentatge no supervisat

Aquí no hi ha etiquetes: només dades. L'objectiu ja no és predir una resposta coneguda, sinó descobrir estructura oculta a les dades. És com rebre una capsa de peces sense foto de referència: ningú no et diu què n'ha de sortir; tu busques quines peces encaixen entre si.

Les seves dues famílies principals:

Clustering (agrupament)

Trobar grups naturals d'exemples semblants entre si i diferents dels altres.

  • MercaFresh: segmentació de clients. Ningú no ha etiquetat els clients com a "famílies de compra setmanal", "urbanites de darrera hora" o "caçadors d'ofertes"; aquests segments no existeixen a priori. Un algorisme de clustering els descobreix analitzant patrons de compra, i l'equip de màrqueting els posa nom després.
  • El clustering també serveix per a la detecció d'anomalies: una comanda que no encaixa en cap grup habitual mereix revisió (ho veurem a 05-04 amb DBSCAN).

Reducció de dimensionalitat

Comprimir moltes variables en poques, conservant la informació essencial.

  • MercaFresh: cada client es pot descriure amb centenars de variables (despesa per cada categoria de producte, horaris, freqüències…). Reduir-les a 2 o 3 "dimensions resum" permet visualitzar la cartera de clients en un gràfic i accelerar altres models.
  • S'estudia a 05-03 (PCA) i 05-05 (t-SNE i UMAP).
# Estructura tipica d'un problema NO supervisat (il·lustratiu)
X = [
    # [despesa_mensual_eur, num_comandes_mes, pct_compra_en_ofertes]
    [420.0, 8, 0.05],
    [95.5,  2, 0.60],
    [380.0, 7, 0.10],
]
# No existeix 'y': ningu no sap a priori a quin segment pertany cada client.
# L'algorisme agrupara les files semblants (aqui, la 1a i la 3a s'assemblen).

La diferència salta a la vista comparant amb el fragment anterior: ha desaparegut la llista y. Aquesta absència és la que converteix el problema en no supervisat.

Aprenentatge semisupervisat

Situació intermèdia i molt freqüent a la realitat: moltíssimes dades, però només unes quantes d'etiquetades, perquè etiquetar és car (requereix temps humà expert).

Exemple a MercaFresh: per entrenar un detector de frau, un analista pot revisar manualment 500 comandes i etiquetar-les com a legítimes o fraudulentes, però és inviable revisar els 2 milions de comandes de l'historial. L'aprenentatge semisupervisat combina el millor de tots dos mons: fa servir les 500 etiquetades com a guia i els 2 milions sense etiquetar per entendre millor l'estructura general de les dades, aconseguint millors resultats que fent servir només les 500.

Estratègia típica (a alt nivell): entrenar amb els pocs exemples etiquetats, deixar que el model etiqueti provisionalment els casos en què està molt segur, i reentrenar incorporant-los. En aquest curs ho tractem com a visió general; en la pràctica professional apareix sobretot en visió per computador i processament de text.

Aprenentatge per reforç

Paradigma diferent dels anteriors: no aprèn d'un conjunt de dades històric, sinó interactuant amb un entorn. Un agent executa accions, l'entorn respon amb un nou estat i una recompensa (positiva o negativa), i l'agent aprèn per assaig i error l'estratègia (política) que maximitza la recompensa acumulada.

  • És el paradigma darrere d'AlphaGo (que vam veure a la lliçó anterior): va jugar milions de partides contra si mateix, rebent com a recompensa guanyar o perdre.
  • Altres usos: robòtica, conducció autònoma, optimització de sistemes (climatització de centres de dades).
  • A MercaFresh es podria aplicar a la fixació dinàmica de preus: l'agent prova petits ajustos de preu (acció), observa les vendes resultants (estat) i el marge obtingut (recompensa), i aprèn una política de preus. És un ús avançat i amb riscos (experimenta amb clients reals!), per això queda fora de l'abast pràctic d'aquest curs.

L'analogia clàssica: així s'ensinistra un gos. Ningú no li dona un manual (dades etiquetades); prova comportaments i rep premis o indiferència, i d'aquí n'aprèn.

Taula comparativa dels quatre tipus

Aspecte Supervisat No supervisat Semisupervisat Per reforç
Dades etiquetades? Sí, totes No Només una petita part No hi ha dataset: entorn + recompenses
Objectiu Predir l'etiqueta de casos nous Descobrir estructura oculta Predir aprofitant dades sense etiquetar Aprendre la millor estratègia d'acció
Analogia Estudiar amb exàmens resolts Ordenar una capsa de peces sense foto Pocs exàmens resolts i molts sense corregir Ensinistrar un gos amb premis
Exemple MercaFresh Demanda (regressió), churn (classificació) Segmentació de clients, anomalies Detecció de frau amb poques revisions manuals Preus dinàmics
Cost de preparació Alt (cal etiquetar) Baix Mitjà Alt (dissenyar entorn i recompenses)
Avaluació Directa: comparar predicció vs. realitat Indirecta: els grups són útils/coherents? Directa sobre la part etiquetada Recompensa acumulada
En aquest curs Mòdul 4 Mòdul 5 Visió general (aquesta lliçó) Visió general (aquesta lliçó)

Com identificar el tipus de problema: guia pràctica

Davant d'un encàrrec nou, fes-te aquestes preguntes en ordre:

  1. Quina decisió de negoci vull recolzar? (Sense això, no hi ha projecte; ho reprendrem a la lliçó 01-05.)
  2. Existeix una "resposta correcta" històrica registrada a les meves dades?
    • Sí, per a tots els exemples → supervisat. Segueix a la pregunta 3.
    • Sí, però només per a uns quants → semisupervisat.
    • No; vull explorar/agrupar → no supervisat.
    • No hi ha historial, però puc provar accions i mesurar resultats → reforç.
  3. Si és supervisat: la resposta és un nombre o una categoria? Nombre → regressió; categoria → classificació.

Practiquem amb encàrrecs reals de MercaFresh:

Encàrrec del negoci Anàlisi Tipus
"Necessito saber quantes barres de pa demanar al proveïdor cada dia" Hi ha historial de vendes diàries (etiquetes) i la resposta és un nombre Supervisat → regressió
"Avisa'm de quins clients es donaran de baixa del servei prèmium" L'historial registra qui es va donar de baixa; la resposta és sí/no Supervisat → classificació
"Vull entendre quins tipus de client tenim per dissenyar campanyes" No existeixen tipus predefinits; cal descobrir-los No supervisat → clustering
"Tenim 200 variables per client i vull un mapa visual de la cartera" Comprimir variables conservant informació No supervisat → reducció de dimensionalitat
"Detecta frau; només tenim 300 casos confirmats entre milions de comandes" Molt poques etiquetes, moltíssimes dades sense etiquetar Semisupervisat

Errors Comuns i Consells

  • Triar l'algorisme abans que el tipus de problema. "Vull fer servir xarxes neuronals" no és un plantejament; primer identifica si el teu problema és de regressió, classificació o clustering, i després (mòduls 4-5) triaràs algorisme.
  • Tractar com a classificació el que és regressió (o viceversa). Si converteixes la demanda en categories ("alta/mitjana/baixa") perds informació valuosa sense necessitat; fes-ho només si el negoci realment decideix per trams.
  • Esperar del clustering respostes objectives. Els grups que troba un algorisme no venen amb nom ni garantia d'utilitat; validar-los i interpretar-los és feina teva i del negoci.
  • Oblidar que l'etiqueta ha d'existir abans de predir. Per predir churn necessites exemples històrics de clients que ja van abandonar; si el servei prèmium es va llançar el mes passat, encara no tens prou etiquetes.
  • Consell: memoritza les preguntes clau: quant? → regressió; quin/sí-o-no? → classificació; quins grups hi ha? → clustering; com resumeixo les meves variables? → reducció de dimensionalitat.

Exercicis

Exercici 1

Classifica cada encàrrec de MercaFresh en el seu tipus (i subtipus si escau): (a) predir el temps de lliurament en minuts de cada comanda; (b) agrupar els productes per patrons de compra conjunta per reorganitzar la web; (c) predir si un client valorarà la seva comanda amb 1-2 estrelles (insatisfet) o 3-5 (satisfet); (d) aprendre una política de reposició d'estoc provant decisions en un simulador de magatzem i mesurant el benefici.

Exercici 2

L'equip d'atenció al client de MercaFresh ha etiquetat a mà 800 converses de suport com a "urgent" / "no urgent", però hi ha 500 000 converses històriques sense etiquetar. Quin tipus d'aprenentatge hi encaixa millor i per què? Quina alternativa tindries si decidissis fer servir només aprenentatge supervisat pur?

Exercici 3

Escriu (sense codi, només l'estructura) com serien X i y per al problema de predicció de demanda de pa de MercaFresh: proposa almenys 4 característiques per a X i digues què contindria y i de quin tipus (nombre/categoria) seria.

Solucions

Solució 1

  • (a) Supervisat → regressió: l'etiqueta (minuts reals de lliurament) és un nombre continu i existeix a l'historial.
  • (b) No supervisat → clustering: no hi ha grups predefinits; es descobreixen a partir de les compres conjuntes.
  • (c) Supervisat → classificació (binària): l'etiqueta és una de dues categories i l'historial de valoracions la proporciona.
  • (d) Aprenentatge per reforç: un agent prova accions (reposar o no) en un entorn (simulador) i aprèn de la recompensa (benefici).

Solució 2

Hi encaixa l'aprenentatge semisupervisat: hi ha una petita part etiquetada (800) i una massa enorme sense etiquetar (500 000) que pot aportar estructura i millorar el model. L'alternativa supervisada pura seria entrenar només amb les 800 etiquetades (arriscant-se a un model pobre per escassetat d'exemples) o invertir a etiquetar manualment moltes més converses, cosa que és cara i lenta.

Solució 3

Estructura possible:

  • X (característiques de cada dia històric): dia de la setmana, si és festiu o vigília, preu del pa aquell dia, unitats venudes el mateix dia de la setmana anterior, si hi havia promoció activa, previsió meteorològica.
  • y (etiqueta): unitats de pa venudes aquell dia — un nombre continu, per la qual cosa el problema és de regressió.

Cada fila de X correspondria a un dia de l'historial, amb la seva venda real a y.

Conclusió

Ja tens el mapa complet del territori: aprenentatge supervisat (amb etiquetes; regressió si prediu nombres, classificació si prediu categories), no supervisat (sense etiquetes; clustering per descobrir grups, reducció de dimensionalitat per comprimir variables), semisupervisat (poques etiquetes, moltes dades) i per reforç (aprendre actuant i rebent recompenses). I saps situar cada problema de MercaFresh a la seva casella: demanda → regressió, churn → classificació, segmentació → clustering. A la propera lliçó sortirem del nostre supermercat per veure la fotografia completa: les aplicacions del Machine Learning en els diferents sectors de l'economia, i els criteris per decidir quan té sentit fer servir ML i quan no.

Curs de Machine Learning

Mòdul 1: Introducció al Machine Learning

Mòdul 2: Fonaments d'Estadística i Probabilitat

Mòdul 3: Preprocessament de Dades

Mòdul 4: Algorismes de Machine Learning Supervisat

Mòdul 5: Algorismes de Machine Learning No Supervisat

Mòdul 6: Avaluació i Validació de Models

Mòdul 7: Tècniques Avançades i Optimització

Mòdul 8: Implementació i Desplegament de Models

Mòdul 9: Projectes Pràctics

Mòdul 10: Recursos Addicionals

© Copyright 2026. Tots els drets reservats