Ja saps què és el deep learning (lliçó 01-01) i com ha arribat fins aquí (lliçó 01-02). Abans d'endinsar-nos en la mecànica interna de les xarxes neuronals, convé tenir un mapa del territori: què es pot fer avui amb deep learning i en quins sectors està funcionant de debò? Aquesta lliçó recorre els grans dominis d'aplicació i, per a cadascun, respon dues preguntes pràctiques: què necessitaria TecnoMarket d'aquest domini? i en quin mòdul del curs aprendràs la tècnica corresponent? En acabar, tindràs clar que aquest curs no és una col·lecció de temes solts, sinó la caixa d'eines completa del projecte TecnoMarket.
Contingut
- Com llegir aquest panorama
- Visió per computador
- Processament del llenguatge natural (NLP)
- Àudio i veu
- Sistemes de recomanació
- Salut i medicina
- Vehicles autònoms
- Detecció de frau i anomalies
- Mapa: dominis, TecnoMarket i mòduls del curs
Com llegir aquest panorama
A cada domini veurem tres coses: quines tasques resol el deep learning, exemples reals del món, i la seva connexió amb TecnoMarket i el curs. Important: aquí no expliquem com funciona cada arquitectura per dins (CNN, RNN, transformers, GAN...); això correspon als mòduls 3, 4 i 5. Aquesta lliçó és l'"aparador"; els mòduls posteriors són el "taller".
Un patró que veuràs repetir-se: gairebé tots els dominis es redueixen a unes poques famílies de tasques:
- Classificar: assignar una etiqueta a una entrada (aquesta foto és una cafetera?, aquesta ressenya és positiva?).
- Detectar/localitzar: trobar on és alguna cosa (on és el defecte en aquesta peça?).
- Predir valors: estimar un número (quantes unitats vendrem demà?).
- Generar: crear contingut nou (una imatge promocional, la resposta d'un chatbot).
- Transformar seqüències: convertir una seqüència en una altra (àudio → text, castellà → anglès).
Visió per computador
És el domini on el deep learning va fer el seu gran cop (AlexNet, 2012) i probablement el més madur.
Tasques típiques:
- Classificació d'imatges: dir què conté una foto.
- Detecció d'objectes: localitzar i etiquetar diversos objectes en una imatge (amb els seus requadres).
- Segmentació: delimitar píxel a píxel cada objecte.
- Reconeixement facial i verificació d'identitat.
- OCR: llegir text en imatges (tiquets, factures, matrícules).
- Inspecció visual industrial: detectar defectes de fabricació.
Exemples reals: el desbloqueig facial del mòbil, els filtres de les xarxes socials, el diagnòstic d'imatges de satèl·lit, el control de qualitat a les fàbriques.
A TecnoMarket: és la necessitat més urgent. Els venedors pugen milers de fotos de productes al dia i avui un equip humà les revisa i categoritza a mà. Amb visió per computador, TecnoMarket podria classificar automàticament cada foto en la seva categoria (informàtica, petit electrodomèstic, llar...), detectar fotos de mala qualitat o que incompleixen les normes (marques d'aigua, fons inadequats) i llegir automàticament els textos de les caixes dels productes.
Al curs: mòdul 3 (CNN) al complet, amb el projecte guiat a la lliçó 07-01. Prototiparem amb MNIST i CIFAR-10 abans de saltar al catàleg fictici de TecnoMarket.
Processament del llenguatge natural (NLP)
L'NLP (Natural Language Processing) aplica el deep learning al text: l'idioma humà escrit.
Tasques típiques:
- Anàlisi de sentiment: aquesta opinió és positiva, negativa o neutra?
- Classificació de textos: assignar temes o categories (aquesta consulta és sobre enviaments o sobre devolucions?).
- Traducció automàtica entre idiomes.
- Resum automàtic de documents llargs.
- Chatbots i assistents conversacionals.
- Extracció d'informació: treure dades estructurades de text lliure (noms, dates, imports).
Exemples reals: Google Translate, els correctors i autocompletats del teclat, els assistents tipus ChatGPT o Claude, el filtratge de spam.
A TecnoMarket: la botiga rep centenars de ressenyes diàries en diversos idiomes. Amb NLP podria mesurar automàticament la satisfacció per producte (anàlisi de sentiment), detectar ressenyes que esmenten defectes recurrents ("la bateria dura poc") per avisar el departament de compres, classificar els tiquets de suport i derivar-los al departament correcte, i en el futur oferir un chatbot d'atenció al client.
Al curs: mòdul 4 (RNN i aplicacions a NLP, amb el dataset IMDB de ressenyes de cinema com a banc de proves), la lliçó 05-05 (atenció i transformers, la base dels models de llenguatge actuals) i el projecte de generació de text a 07-02.
Àudio i veu
L'àudio és un altre senyal no estructurat on el deep learning domina.
Tasques típiques:
- Reconeixement de veu (speech-to-text): transcriure àudio a text.
- Síntesi de veu (text-to-speech): generar veu natural a partir de text.
- Identificació de parlant: qui està parlant?
- Classificació de sons: detectar alarmes, vidres trencats, música.
Exemples reals: Alexa, Siri i l'Assistent de Google; els subtítols automàtics de YouTube; les transcripcions de reunions.
A TecnoMarket: el call center grava (amb consentiment) les trucades d'atenció al client. Transcriure-les automàticament permetria analitzar-les després amb NLP: motius de trucada més freqüents, clients insatisfets, compliment de guions. És un bon exemple d'encadenament de models: veu → text (àudio) i després text → conclusions (NLP).
Al curs: no hi ha cap mòdul específic d'àudio, però les tècniques que el sustenten són les mateixes que estudiarem: l'àudio es processa com a seqüències (mòdul 4) o com a "imatges" d'espectrogrames (mòdul 3). A la pràctica professional, a més, la veu se sol resoldre amb models preentrenats (transfer learning, lliçó 05-03).
Sistemes de recomanació
Els recomanadors decideixen quin contingut o producte mostrar a cada usuari.
Tasques típiques:
- Recomanació de productes: "els clients que van comprar això també van comprar...".
- Personalització de la pàgina d'inici, els correus i les promocions.
- Rànquing: ordenar els resultats de cerca segons la rellevància per a aquell usuari.
Exemples reals: Netflix (quina sèrie suggerir-te), Spotify (llistes personalitzades), Amazon (productes relacionats), els feeds de les xarxes socials.
A TecnoMarket: el recomanador és directament diners: ensenyar el producte adequat a la persona adequada augmenta la conversió. El deep learning permet combinar senyals heterogenis —historial de compres, navegació, text de ressenyes, fins i tot imatges de productes— en una única representació del gust del client.
Al curs: no té mòdul propi, però es recolza en peces que sí que veurem: representacions apreses (embeddings, que apareixeran al mòdul 4 amb el text) i xarxes denses (mòdul 2). És una aplicació excel·lent per explorar pel teu compte en acabar el curs.
Salut i medicina
Un dels dominis de més impacte social.
Tasques típiques:
- Diagnòstic per imatge: detectar tumors en mamografies, retinopatia diabètica en fons d'ull, pneumònia en radiografies.
- Descobriment de fàrmacs: predir propietats de molècules; el cas AlphaFold (predicció d'estructures de proteïnes) és una fita científica recent.
- Monitoratge de pacients: detectar arrítmies en senyals d'ECG, predir deterioraments a l'UCI.
Exemples reals: sistemes de cribratge de retinopatia aprovats per a ús clínic, suport a radiòlegs en la detecció de càncer.
A TecnoMarket: directament, poc: no és el seu sector. Però l'incloem per dues raons. Primera: tècnicament, diagnosticar una radiografia i classificar la foto d'una cafetera són el mateix problema (classificació d'imatges, mòdul 3); dominar-ne un t'acosta a l'altre. Segona: la salut il·lustra millor que cap altre domini les exigències ètiques del deep learning (errors amb cost humà, biaixos, explicabilitat), que tractarem al mòdul 8.
Al curs: mòdul 3 (la tècnica) i mòdul 8 (les implicacions ètiques).
Vehicles autònoms
La conducció autònoma és potser el sistema de deep learning més complex en producció.
Components on intervé el DL:
- Percepció: detectar vianants, vehicles, senyals i carrils a partir de càmeres, radar i lidar (visió per computador en temps real).
- Predicció: anticipar què faran els altres (aquell vianant creuarà?).
- Planificació: decidir la trajectòria (aquí es combinen DL i algorismes clàssics de control).
Exemples reals: els sistemes d'assistència a la conducció (frenada automàtica d'emergència, manteniment de carril) que ja porten la majoria de cotxes nous, i els robotaxis en algunes ciutats.
A TecnoMarket: no fabricarà cotxes, però la logística d'última milla s'hi assembla més del que sembla: robots de magatzem que naveguen entre prestatgeries i, en el futur, repartiment autònom. A més, la percepció d'un robot de magatzem fa servir les mateixes CNN del mòdul 3.
Al curs: mòdul 3 (percepció visual) i mòdul 8 (els dilemes ètics i de responsabilitat, on els vehicles autònoms són el cas d'estudi clàssic).
Detecció de frau i anomalies
Detectar allò estrany entre milions d'esdeveniments normals.
Tasques típiques:
- Frau en pagaments: transaccions amb targeta robada, comptes compromesos.
- Detecció d'anomalies: comportaments que es desvien del que és normal, sense saber per endavant com serà l'atac.
- Ciberseguretat: trànsit de xarxa maliciós, accessos sospitosos.
- Ressenyes i comptes falsos: bots que inflen valoracions.
La particularitat d'aquest domini: el frau és escàs (potser 1 de cada 1.000 transaccions) i canviant (els defraudadors s'adapten). Per això, a més de classificadors entrenats amb fraus coneguts, es fan servir tècniques que aprenen "el que és normal" i avisen quan alguna cosa se surt del patró, sense necessitar exemples de frau.
A TecnoMarket: cada dia es processen milers de pagaments. Un sistema de detecció hauria d'assenyalar en temps real les transaccions sospitoses (imports atípics, adreces noves, patrons de compra estranys) per a revisió humana, i també detectar ressenyes falses que manipulen les valoracions de productes.
Al curs: els autoencoders per a detecció d'anomalies (lliçó 05-02) i el projecte complet de la lliçó 07-03, on construirem el detector de transaccions anòmales de TecnoMarket.
Mapa: dominis, TecnoMarket i mòduls del curs
Aquesta taula és el "mapa del tresor" del curs: guarda-la com a referència.
| Domini | Necessitat de TecnoMarket | Tècnica principal | Mòdul/lliçó |
|---|---|---|---|
| Visió per computador | Classificar fotos de productes, control de qualitat d'imatges | CNN | Mòdul 3, projecte 07-01 |
| NLP | Analitzar ressenyes, classificar tiquets de suport | RNN, transformers | Mòdul 4, 05-05, projecte 07-02 |
| Àudio i veu | Transcriure trucades del call center | Seqüències + transfer learning | Mòduls 3-4 (base), 05-03 |
| Recomanació | Suggerir productes, personalitzar la web | Embeddings + xarxes denses | Mòduls 2 i 4 (base) |
| Sèries temporals | Predir la demanda per al magatzem | RNN/LSTM | Mòdul 4 (04-04) |
| Frau i anomalies | Detectar pagaments sospitosos i ressenyes falses | Autoencoders | 05-02, projecte 07-03 |
| Generació de contingut | Crear imatges promocionals | GAN | 05-01, projecte 07-04 |
| Salut / vehicles autònoms | (No aplica directament; referència tècnica i ètica) | CNN + ètica | Mòduls 3 i 8 |
Dues observacions finals sobre el panorama:
- Les mateixes peces es reutilitzen: fixa't en quants dominis es recolzen en el mòdul 3 o el mòdul 4. El deep learning és modular: poques idees fonamentals, moltíssimes aplicacions.
- Els models s'encadenen: els sistemes reals combinen diversos models (veu → text → sentiment; foto → categoria → recomanació). Pensa en canonades (pipelines), no en models aïllats.
Errors Comuns i Consells
- Error: creure que cada aplicació necessita una tecnologia completament diferent. Com mostra la taula, unes poques arquitectures (CNN, RNN, transformers, autoencoders, GAN) cobreixen gairebé tots els dominis. Aprendre bé les bases val per a tot.
- Error: triar el projecte per l'espectacularitat i no pel retorn. Per a TecnoMarket, un classificador de fotos "avorrit" que estalvia 200 hores de feina manual al mes val més que un chatbot enlluernador que ningú no ha demanat. Prioritza per valor de negoci.
- Error: ignorar el cost de l'error. No és el mateix equivocar-se recomanant una cafetera que equivocar-se detectant frau (o en un diagnòstic mèdic). El domini determina quanta precisió necessites i quanta supervisió humana has de mantenir.
- Consell: quan llegeixis sobre un producte "amb IA", intenta descompondre'l en les tasques bàsiques d'aquesta lliçó (classificar, detectar, predir, generar, transformar seqüències). Veuràs que gairebé tot encaixa en aquest esquema, i sabràs quin mòdul del curs ho cobreix.
- Consell: revisa aquesta lliçó en començar cada mòdul del curs: et recordarà per a què serveix, al món real, el que estàs a punt d'aprendre.
Exercicis
Exercici 1: Classifica les tasques
Per a cada necessitat, indica el domini d'aplicació i el tipus de tasca (classificar, detectar, predir un valor, generar o transformar seqüències):
- TecnoMarket vol estimar quantes unitats de cada televisor vendrà la setmana que ve.
- TecnoMarket vol un sistema que converteixi les trucades gravades del call center en text.
- TecnoMarket vol crear imatges promocionals nadalenques a partir de les fotos de catàleg.
- TecnoMarket vol saber si una ressenya acabada de publicar és autèntica o generada per un bot.
Exercici 2: Prioritza els projectes
La direcció de TecnoMarket només pot finançar dos projectes de deep learning aquest any: (a) classificador automàtic de fotos de productes, (b) chatbot conversacional d'atenció al client, (c) detector de transaccions fraudulentes, (d) generador d'imatges promocionals. Tria'n dos i justifica la teva elecció considerant: valor de negoci, maduresa de la tècnica, disponibilitat de dades i cost de l'error.
Exercici 3: El pipeline complet
Dissenya (només amb paraules o un diagrama, sense codi) el pipeline de models que necessitaria TecnoMarket per a: "detectar automàticament productes les ressenyes recents dels quals esmenten defectes, i avisar el departament de compres". Indica quins dominis d'aquesta lliçó hi intervenen i en quin ordre.
Solucions
Solució 1:
- Sèries temporals / predicció de demanda — tasca de predir un valor (regressió sobre seqüències). Es cobreix al mòdul 4.
- Àudio i veu — tasca de transformar seqüències (àudio → text).
- Generació de contingut (visió generativa) — tasca de generar. Es cobreix amb les GAN (05-01, 07-04).
- NLP + detecció d'anomalies/frau — tasca de classificar (autèntica/falsa), possiblement recolzada en detecció d'anomalies si hi ha pocs exemples de ressenyes falses etiquetades.
Solució 2 (resposta orientativa; l'important és la justificació):
Una elecció defensable és (a) el classificador de fotos i (c) el detector de frau:
- (a) té valor immediat (estalvia revisió manual diària), la tècnica és molt madura (classificació d'imatges, el problema més ben resolt del DL), les dades ja existeixen (històric de fotos ja categoritzades per humans, que serveixen d'etiquetes) i el cost de l'error és baix (una foto mal classificada es corregeix fàcilment).
- (c) té retorn directe en diners (cada frau evitat és pèrdua evitada), i encara que el cost de l'error és més gran, es pot mitigar mantenint revisió humana dels casos assenyalats.
- (b) el chatbot és atractiu però arriscat: conversa oberta amb clients, errors molt visibles, i requereix més maduresa de l'equip. (d) el generador d'imatges aporta valor, però és menys crític per a l'operativa i mentrestant es pot cobrir amb eines comercials.
Solució 3 (resposta orientativa):
- Recollida: cada dia es recopilen les ressenyes noves de cada producte (text).
- NLP - classificació 1: un model d'anàlisi de sentiment filtra les ressenyes negatives.
- NLP - classificació/extracció 2: sobre les negatives, un segon model detecta si esmenten un defecte del producte (i de quin tipus: bateria, pantalla, trencament durant l'enviament...), distingint-lo de queixes alienes al producte (retard del transportista).
- Agregació i anomalia: es compten les mencions de defecte per producte i setmana; si un producte es desvia del seu patró normal (pic de defectes), es genera una alerta.
- Acció: l'alerta arriba a compres amb les ressenyes d'exemple adjuntes.
Dominis implicats: NLP (passos 2-3) i detecció d'anomalies (pas 4). És un pipeline: diversos models senzills encadenats, no un únic model gegant.
Conclusió
En aquesta lliçó has vist el panorama complet: visió per computador, NLP, veu, recomanació, salut, conducció autònoma i frau, i has comprovat dues idees clau: gairebé totes les aplicacions es redueixen a unes poques tasques fonamentals, i unes poques arquitectures —les que aprendràs als mòduls 3 a 5— sostenen tot l'edifici. També tens ja el mapa que connecta cada necessitat de TecnoMarket amb el mòdul del curs que la resol.
Fins ara hem parlat del deep learning "des de fora". A la propera lliçó obrirem per primera vegada la caixa: veurem què és una neurona artificial, com s'organitzen en capes i què vol dir realment "entrenar" una xarxa, el vocabulari essencial que faràs servir durant la resta del curs.
Curs de Deep Learning
Mòdul 1: Introducció al Deep Learning
- Què és el Deep Learning?
- Història i evolució del Deep Learning
- Aplicacions del Deep Learning
- Conceptes bàsics de xarxes neuronals
- Preparació de l'entorn de treball
Mòdul 2: Fonaments de Xarxes Neuronals
- Perceptró i Perceptró Multicapa
- Funció d'activació
- Propagació cap endavant i cap enrere
- Optimització i funció de pèrdua
- La teva primera xarxa neuronal completa
Mòdul 3: Xarxes Neuronals Convolucionals (CNN)
- Introducció a les CNN
- Capes convolucionals i de pooling
- Arquitectures populars de CNN
- Aplicacions de CNN en reconeixement d'imatges
Mòdul 4: Xarxes Neuronals Recurrents (RNN)
- Introducció a les RNN
- LSTM i GRU
- Aplicacions de RNN en processament del llenguatge natural
- Seqüències i sèries temporals
Mòdul 5: Tècniques Avançades en Deep Learning
- Xarxes Generatives Adversàries (GAN)
- Autoencoders
- Transfer Learning
- Regularització i tècniques de millora
- Mecanismes d'atenció i Transformers
Mòdul 6: Eines i Frameworks
- Introducció a TensorFlow
- Introducció a PyTorch
- Comparació de frameworks
- Entorns de desenvolupament i recursos addicionals
- Desar, carregar i desplegar models
Mòdul 7: Projectes Pràctics
- Classificació d'imatges amb CNN
- Generació de text amb RNN
- Detecció d'anomalies amb Autoencoders
- Creació d'una GAN per a generació d'imatges
- Fine-tuning d'un model preentrenat
