Ja sabem auditar els nostres models (08-01) i entendre'n el context social i econòmic (08-02). La pregunta natural de l'equip de TecnoMarket ara és estratègica: cap a on va el camp i què hauríem d'incorporar, vigilar o ignorar? Aquesta lliçó ofereix un panorama honest de les tendències principals —a nivell conceptual, sense tutorials—, sempre amb la mateixa vara de mesurar: què significa això per a un equip petit amb recursos limitats? Tan important com conèixer les tendències és saber filtrar-les: el deep learning és un camp amb molt de soroll, i distingir una tendència consolidada d'una moda passatgera és una habilitat professional en si mateixa, amb la qual tancarem.
Contingut
- LLMs i models fundacionals: l'escala com a estratègia
- Què signifiquen els models fundacionals per a equips petits
- Models de difusió: la promesa pendent de 07-04
- Multimodalitat: text, imatge i àudio en un mateix model
- L'eficiència com a frontera: l'arc MobileNet continua
- AutoML i cerca d'arquitectures, breument
- Aprenentatge autosupervisat: el motor silenciós
- Com mantenir-se al dia sense ofegar-se
- Taula síntesi: tendències i rellevància per a TecnoMarket
LLMs i models fundacionals: l'escala com a estratègia
A 05-05 vam tancar l'arc històric que vam obrir a 01-02: de la neurona als transformers i els LLMs. La tendència que domina el camp des de llavors és la consolidació del model fundacional: un model enorme, entrenat una vegada sobre dades massives i de propòsit general, que després s'adapta a mil tasques concretes. És el patró del transfer learning de 05-03 dut a l'extrem: ja no es preentrena "un model de visió per classificar", es preentrena "un model de gairebé tot".
Tres idees defineixen l'etapa actual, a nivell de concepte:
- Escala amb rendiments predictibles: fins ara, més dades + més paràmetres + més còmput ha continuat produint millores mesurables (les anomenades lleis d'escalat). Quant durarà aquesta corba és una de les preguntes obertes del camp — la tractarem amb els reptes a 08-04.
- Ajust per instruccions: els LLMs moderns no només prediuen text (com el nostre modest generador caràcter a caràcter de 07-02); s'afinen després per seguir instruccions i ser útils i segurs en conversa. És la diferència entre un motor i un cotxe conduïble.
- RAG i agents, com a idea: un LLM només sap el que va veure al seu entrenament i pot inventar la resta. La generació augmentada amb recuperació (RAG) li acobla un cercador: abans de respondre, recupera documents rellevants (el catàleg de TecnoMarket, les seves polítiques de devolució) i respon recolzant-s'hi, reduint invencions i mantenint-se actualitzat sense reentrenar. Els agents van un pas més enllà: el LLM no només respon, sinó que usa eines (consultar la base de dades de comandes, executar una cerca) en diversos passos per completar una tasca. Tots dos són avui patrons d'enginyeria sobre el model, més que canvis en el model mateix.
Què signifiquen els models fundacionals per a equips petits
Per a TecnoMarket, la pregunta no és "com entreno un LLM?" (no ho farà mai: 08-02 va explicar els costos), sinó "com l'aprofito?". Les dues rutes, amb els seus trade-offs:
| Criteri | Consumir via API | Model obert ajustat a casa |
|---|---|---|
| Qualitat inicial | Màxima (models de frontera) | Bona, per sota de la frontera |
| Cost | Per ús; barat en començar, creix amb el volum | Infraestructura pròpia + talent; més pla a gran volum |
| Dades | Surten al proveïdor (revisar amb legal, 08-01) | Es queden a casa |
| Dependència | Alta (preus, versions, disponibilitat: 08-02) | Baixa; el model és teu |
| Personalització | Limitada al prompt i ajustos lleugers | Fine-tuning complet sobre el teu domini (l'habilitat de 05-03/07-05) |
| Manteniment | Del proveïdor | Teu (i no és poc: 06-05) |
L'estratègia assenyada per a un equip petit acostuma a ser híbrida: API per explorar i per a allò no sensible; model obert ajustat quan el volum, la privadesa o l'especialització ho justifiquin. Nota encoratjadora: el fine-tuning que vas practicar a 07-05 amb MobileNetV2 és, conceptualment, la mateixa operació que ajustar un LLM obert sobre les ressenyes de TecnoMarket. Les habilitats del curs escalen.
Models de difusió: la promesa pendent de 07-04
A 07-04 vam entrenar una DCGAN sobre Fashion-MNIST i vam ser honestos amb les expectatives: entrenar GANs és inestable (el delicat equilibri generador-discriminador) i la qualitat té sostre. Vam prometre llavors que hi havia alguna cosa millor en camí. Aquí és: els models de difusió, que avui dominen la generació d'imatge i vídeo de qualitat.
La intuïció, sense matemàtica: en lloc del duel adversarial de la GAN, la difusió aprèn a treure soroll. Durant l'entrenament es pren una imatge real i se li afegeix soroll gradualment fins a convertir-la en estàtica pura; el model aprèn a revertir cada petit pas: "donat això lleugerament sorollós, com era una mica més net?". Per generar, es parteix de soroll pur i s'apliquen molts passos de neteja successius fins que emergeix una imatge nova. Com una escultura: el soroll és el bloc de marbre i el model va traient el que sobra, pas a pas.
Per què han desplaçat les GAN en generació de qualitat:
- Entrenament estable: és un problema de predicció normal (predir el soroll afegit), sense l'equilibri inestable entre dues xarxes que vam patir a 07-04. Convergeix de manera avorrida i fiable.
- Cobertura: les GAN tendeixen al mode collapse (generar només unes poques variants convincents); la difusió cobreix millor la diversitat de les dades.
- Control: la generació per passos es guia còmodament amb text ("una làmpada de disseny nòrdic sobre fons blanc"), que és el que fa útils els generadors d'imatge actuals.
- El seu preu: generar requereix molts passos, per tant és més lenta i cara en inferència que una GAN (que genera en una sola passada) — tot i que les tècniques de reducció de passos ho mitiguen ràpid.
Les GAN són mortes? No: es continuen usant on importa la velocitat d'inferència i en tasques específiques, i tot el que vas aprendre a 05-01/07-04 (espais latents, entrenament de generadors, avaluació de mostres) transfereix directament. Per a TecnoMarket, la implicació pràctica és clara: la següent generació del seu generador d'imatges promocionals no serà una GAN entrenada a casa, sinó un model de difusió guiat per text — consumit via API o obert—, amb les regles de contingut sintètic de 08-01 aplicant-se exactament igual.
Multimodalitat: text, imatge i àudio en un mateix model
El curs va tractar cada modalitat per separat: CNN per a imatges (mòdul 3), RNN/LSTM per a text i sèries (mòdul 4). La tendència clara és la fusió: models multimodals que entenen i generen text, imatge i àudio conjuntament, aprenent un espai comú on "la foto d'una cafetera" i la frase "cafetera espresso d'acer" queden a prop (una evolució natural dels espais de representació que vam veure als autoencoders de 05-02).
Per a TecnoMarket, la multimodalitat no és ciència-ficció sinó full de ruta de producte:
- Cerca visual: el client fotografia una làmpada que va veure en un bar i troba les semblants del catàleg. (Tècnicament: imatges i consultes de text projectades al mateix espai, cerca per proximitat.)
- Fitxes de producte enriquides: un model que mira la foto del producte i redacta la descripció coherent amb el que es veu — la fusió del nostre classificador (07-01/07-05) i el nostre generador (07-02) en un sol sistema, amb la mateixa revisió humana abans de publicar.
- Atenció al client amb context: "aquest cable serveix per al televisor que vaig comprar?" respost entenent el text, l'historial i les fotos del producte.
- Control de qualitat del catàleg: detectar automàticament que la foto i la descripció d'una fitxa es contradiuen.
L'eficiència com a frontera: l'arc MobileNet continua
Davant de la cursa de l'escala, la contratendència igual d'important: fer més amb menys. La coneixem bé: vam triar MobileNetV2 a 07-05 precisament per eficient, i a 08-02 vam veure la motivació ambiental i econòmica. Les tècniques que defineixen aquesta frontera, a nivell d'idea:
- Quantització: emmagatzemar i computar els pesos amb menys bits (de 32 bits a 8, fins i tot 4). Models diverses vegades més petits i ràpids amb pèrdua de qualitat sovint mínima. Ja la vam esmentar en desplegar a 06-05.
- Destil·lació: entrenar un model petit ("estudiant") per imitar les sortides d'un de gran ("mestre"), heretant gran part del seu rendiment a una fracció del cost. El mestre s'usa una vegada; l'estudiant serveix en producció.
- Poda: eliminar pesos i neurones que gairebé no contribueixen (recorda quanta redundància toleraven les xarxes a 05-04).
- Edge AI: la suma de les anteriors porta els models al dispositiu: el mòbil del client executa la cerca visual sense enviar la foto a cap servidor — menys latència, menys cost de servidor i millor privadesa (08-01). L'aparador natural de l'arc MobileNet: l'arquitectura ja va néixer per a això.
Per a equips petits aquesta tendència és una gran notícia: cada avenç en eficiència acosta capacitats de frontera a pressupostos modestos.
AutoML i cerca d'arquitectures, breument
Una part del disseny que vam fer a mà al curs (quantes capes, quants filtres, quina taxa d'aprenentatge) es pot automatitzar: l'AutoML explora configuracions automàticament, i la seva versió ambiciosa, la cerca d'arquitectures neuronals (NAS), dissenya la mateixa arquitectura (de fet, variants de MobileNet i EfficientNet van sortir de processos de NAS). Lectura honesta per a TecnoMarket: la cerca d'hiperparàmetres automatitzada és útil i accessible; la NAS completa és cara i rarament rendible davant de partir d'una bona arquitectura publicada, que és justament l'estratègia (transfer learning) que ja domina l'equip. Tendència real, però de rellevància moderada per a equips petits: el criteri humà sobre quin problema resoldre i amb quines dades continua sense automatitzar-se.
Aprenentatge autosupervisat: el motor silenciós
Sota gairebé tot l'anterior hi ha una idea que ja coneixes sense saber-ho. A 05-02, l'autoencoder aprenia representacions útils sense etiquetes: la seva tasca era reconstruir l'entrada, i les etiquetes eren... les mateixes dades. Això és aprenentatge autosupervisat: inventar una tasca de pretext les etiquetes de la qual surten gratis de les dades, i usar-la per aprendre representacions.
Els models fundacionals existeixen gràcies a aquesta idea duta a escala:
- Els LLMs es preentrenen predint la paraula següent: cada text d'internet porta les seves pròpies "etiquetes" (les paraules següents). El nostre generador de 07-02 feia exactament això, caràcter a caràcter, en miniatura.
- En visió, tasques de pretext com reconstruir zones ocultes de la imatge o aparellar vistes diferents de la mateixa escena produeixen representacions que rivalitzen amb les supervisades.
Per què importa: l'etiquetatge és el coll d'ampolla (el vam patir a cada projecte del mòdul 7, i 08-02 en va mostrar la cara laboral). L'autosupervisat converteix dades sense etiquetar —que en sobren— en representacions, i deixa les poques etiquetes disponibles per a l'ajust final. Per a TecnoMarket: els seus milers de fotos i ressenyes sense etiquetar deixen de ser emmagatzematge mort i passen a ser matèria primera de preentrenament, propi o aliè.
Com mantenir-se al dia sense ofegar-se
El camp publica més del que ningú no pot llegir, i el màrqueting infla resultats. Criteris professionals per filtrar el hype:
- Hi ha resultats reproduïbles? Codi i pesos publicats, avaluacions en benchmarks coneguts fetes per tercers. Desconfia de demos seleccionades i xifres només en nota de premsa.
- Resol un problema que tens? La pregunta TecnoMarket. Una tendència irrellevant per als teus casos d'ús pot esperar a la llista de vigilància.
- Sobreviu sis mesos? Poques idees moren tan ràpid com neixen. Esperar dos cicles de publicació abans d'adoptar filtra la major part del soroll sense perdre res d'essencial.
- El cost total està comptat? Inferència, manteniment, dependència del proveïdor (08-02), auditoria ètica (08-01). El paper mai no inclou la factura.
Fonts estables on mirar (tipus, més que URLs volàtils): els papers i blogs tècnics dels grans laboratoris de recerca; les conferències de referència del camp (NeurIPS, ICML, ICLR, CVPR per a visió, ACL per a llenguatge) i el seu repositori de preprints (arXiv); la documentació i exemples oficials dels frameworks del mòdul 6, que incorporen les tècniques que maduren; enquestes anuals de l'estat del camp; i comunitats tècniques on practicants comparen resultats reals. Una rutina realista: un parell d'hores setmanals fixes, seguint poques fonts bones, amb llista pròpia de "vigilar / provar / adoptar".
Taula síntesi: tendències i rellevància per a TecnoMarket
| Tendència | Maduresa | Rellevància per a TecnoMarket | Acció raonable |
|---|---|---|---|
| LLMs / models fundacionals | Consolidada i en evolució ràpida | Alta: atenció al client, descripcions, cerca | Adoptar via API amb les condicions de 08-02; avaluar model obert si creix el volum |
| RAG / agents | Patrons joves però ja pràctics | Alta: respostes basades en catàleg i polítiques reals | Provar en pilot intern abans que de cara al client |
| Models de difusió | Consolidada en imatge; vídeo en evolució | Mitjana-alta: substitut natural de la GAN de 07-04 | Adoptar eina existent; no entrenar a casa; regles de 08-01 |
| Multimodalitat | En maduració accelerada | Alta a mitjà termini: cerca visual, fitxes enriquides | Vigilar i prototipar la cerca visual |
| Eficiència (quantització, destil·lació, edge) | Consolidada i millorant | Alta: costos, latència, privadesa | Adoptar quantització en desplegar; l'arc MobileNet va seguir sempre aquesta via |
| AutoML / NAS | Madura en cerca d'hiperparàmetres; NAS cara | Baixa-mitjana | Usar cerca d'hiperparàmetres; NAS no |
| Autosupervisat | Consolidada com a motor d'allò fundacional | Mitjana directa (l'aprofita via models preentrenats) | Entendre el concepte; explotar dades sense etiquetar quan toqui |
Errors Comuns i Consells
- Confondre "l'últim" amb "el millor per al teu problema". El predictor de demanda de 04-04 amb la seva LSTM i els seus baselines pot continuar sent la solució correcta encara que existeixin transformers de sèries temporals. Canvia de tècnica quan una mètrica a les teves dades ho justifiqui, no quan ho digui un titular.
- Adoptar sense ruta de sortida. Tota adopció d'API o model extern ha de portar pla B documentat (08-02). Les tendències també es discontinuen.
- Ignorar una tendència perquè "això és de les grans". Els models fundacionals els entrenen pocs, però es consumeixen des de qualsevol lloc: la lliçó del transfer learning (05-03) és que la frontera arriba als petits amb un o dos anys de retard i cost mínim.
- Llegir papers sense gradient de profunditat. Ordre assenyat: abstract i figures de molts, la introducció de bastants, el detall complet de molt pocs. Llegir-ho tot a fons no escala; no llegir res et deixa a mercè del màrqueting.
- Consell: mantén viva la taula síntesi com a document de l'equip i revisa-la cada trimestre: és el teu radar tecnològic, barat i honest.
- Consell: quan provis una tendència, fes-ho contra un baseline teu ja mesurat (la disciplina de 04-04 i del conjunt congelat de 06-05). "Sembla millor" no és una dada; +3 punts sobre el teu baseline sí.
Exercicis
Exercici 1: renovar el generador d'imatges
Màrqueting demana "imatges promocionals millors que les de la nostra GAN de 07-04". Opcions: (A) millorar la DCGAN pròpia amb més dades i èpoques; (B) usar un servei de difusió guiada per text via API; (C) desplegar un model de difusió obert en infraestructura pròpia. Avalua les tres amb els criteris de la taula API vs. obert i les propietats de la difusió davant de la GAN, i recomana'n una per a un equip de 3 persones, citant quines obligacions de 08-01 apliquen a la triada.
Exercici 2: el chatbot amb RAG
Direcció proposa un assistent d'atenció al client basat en LLM. L'equip debat entre connectar-lo "tal qual" o construir un sistema RAG sobre el catàleg i les polítiques de TecnoMarket. Explica amb les teves paraules què aporta el RAG en aquest cas concret, quin risc principal redueix (i per què aquest risc existeix en un LLM a seques), quina nova feina de manteniment introdueix, i quin paper hauria de tenir la revisió humana en la fase inicial.
Exercici 3: filtrar el hype
Un proveïdor ofereix a TecnoMarket una "plataforma de NAS quàntica-neuronal que dissenya automàticament xarxes un 40 % millors, segons els nostres estudis interns". Aplica els quatre criteris de filtratge de hype un a un a aquesta oferta i redacta la resposta (tres frases) que donaries a direcció.
Solucions
Solució 1. (A) Millorar la DCGAN: cost de temps alt, sostre de qualitat baix — 07-04 ens va ensenyar de primera mà la inestabilitat de l'entrenament adversarial i el risc de mode collapse; per a qualitat promocional real és un carreró sense sortida. (B) API de difusió: qualitat de frontera immediata, cost per imatge, zero manteniment; riscos: dependència del proveïdor i sortida de dades (aquí menor: els prompts són descripcions de producte, no dades personals — tot i així, revisar). (C) Difusió oberta a casa: control i dades propis, però exigeix GPU dedicada i competències d'operació que un equip de 3 no hauria de gastar en un cas d'ús no diferencial. Recomanació: B, amb contracte revisat (08-02), i amb les obligacions de 08-01: marcatge del contingut com a generat, prohibició de fotorealisme enganyós del producte, revisió humana abans de publicar. Les habilitats de 07-04 no es llencen: serveixen per avaluar mostres i entendre què s'està comprant.
Solució 2. Què aporta el RAG: abans de respondre, el sistema recupera les fitxes i polítiques reals de TecnoMarket i el LLM redacta recolzant-s'hi; sense RAG, el LLM respon només des del seu entrenament, que no inclou el catàleg actual ni les polítiques de l'empresa. Risc que redueix: respostes inventades però versemblants — un LLM a seques "omplirà" amb seguretat aparent les dades que no té (terminis de devolució, compatibilitats), perquè la seva naturalesa és generar text plausible, la mateixa que vam veure en miniatura a les sortides inventades del nostre generador de 07-02. Nou manteniment: la base de coneixement recuperable passa a ser un artefacte viu — cal mantenir-la sincronitzada amb el catàleg i les polítiques (una fitxa desactualitzada produeix respostes errònies amb citació inclosa), i avaluar periòdicament la qualitat de la recuperació. Revisió humana inicial: fase pilot amb les respostes proposades a l'agent humà (que aprova o corregeix) abans d'exposar-les directament al client — la cua de revisió de 03-04 aplicada al xat; els casos de baixa confiança o alt impacte (reclamacions, pagaments) romanen en humans fins i tot després.
Solució 3. Criteri 1 (reproduïbilitat): "estudis interns" sense codi, pesos ni avaluació de tercers — suspens; el terme "quàntica-neuronal" aplicat com a màrqueting és a més un senyal clàssic de fum. Criteri 2 (problema propi): TecnoMarket no té el problema "dissenyar arquitectures": la seva estratègia guanyadora és partir d'arquitectures publicades amb transfer learning (07-05 va batre la CNN pròpia justament així). Criteri 3 (supervivència): no hi ha adopció coneguda de sis mesos que verificar. Criteri 4 (cost total): plataforma propietària = dependència màxima, cost de NAS alt per naturalesa, sense xifres d'inferència ni manteniment. Resposta a direcció: "L'oferta no aporta evidència verificable del seu 40 % i ataca un problema que no tenim, perquè la nostra via de millora contrastada és el fine-tuning d'arquitectures públiques. Proposem declinar i, si el proveïdor insisteix, demanar-li una prova gratuïta mesurada per nosaltres contra el nostre baseline del 91 % sobre el nostre conjunt congelat. Sense aquesta prova, no hi ha cas."
Conclusió
El panorama queda cartografiat: els models fundacionals converteixen l'escala en estratègia i arriben als equips petits per la doble via API / model obert ajustat —la decisió estructurada a la nostra taula—; la difusió salda la promesa de 07-04 substituint el duel inestable de les GAN per l'eliminació de soroll estable i controlable; la multimodalitat fusiona el que aquest curs va tractar per separat i apunta directe a la cerca visual i les fitxes enriquides de TecnoMarket; l'eficiència (quantització, destil·lació, edge) continua l'arc MobileNet i treballa a favor dels petits; l'autosupervisat —el pretext de l'autoencoder de 05-02 a escala planetària— és el motor que ho alimenta tot; i el filtratge del hype amb quatre criteris és l'habilitat que manté útil tota la resta. Però un panorama honest no pot explicar només el que avança: el camp arrossega problemes oberts seriosos —models que fallen fora de la seva distribució, generatius que inventen, sistemes fràgils davant d'adversaris— i, alhora, aquestes esquerdes són exactament on hi ha la feina i l'oportunitat professional. Dels reptes i les oportunitats, i del tancament de tot aquest viatge, tracta l'última lliçó del curs.
Curs de Deep Learning
Mòdul 1: Introducció al Deep Learning
- Què és el Deep Learning?
- Història i evolució del Deep Learning
- Aplicacions del Deep Learning
- Conceptes bàsics de xarxes neuronals
- Preparació de l'entorn de treball
Mòdul 2: Fonaments de Xarxes Neuronals
- Perceptró i Perceptró Multicapa
- Funció d'activació
- Propagació cap endavant i cap enrere
- Optimització i funció de pèrdua
- La teva primera xarxa neuronal completa
Mòdul 3: Xarxes Neuronals Convolucionals (CNN)
- Introducció a les CNN
- Capes convolucionals i de pooling
- Arquitectures populars de CNN
- Aplicacions de CNN en reconeixement d'imatges
Mòdul 4: Xarxes Neuronals Recurrents (RNN)
- Introducció a les RNN
- LSTM i GRU
- Aplicacions de RNN en processament del llenguatge natural
- Seqüències i sèries temporals
Mòdul 5: Tècniques Avançades en Deep Learning
- Xarxes Generatives Adversàries (GAN)
- Autoencoders
- Transfer Learning
- Regularització i tècniques de millora
- Mecanismes d'atenció i Transformers
Mòdul 6: Eines i Frameworks
- Introducció a TensorFlow
- Introducció a PyTorch
- Comparació de frameworks
- Entorns de desenvolupament i recursos addicionals
- Desar, carregar i desplegar models
Mòdul 7: Projectes Pràctics
- Classificació d'imatges amb CNN
- Generació de text amb RNN
- Detecció d'anomalies amb Autoencoders
- Creació d'una GAN per a generació d'imatges
- Fine-tuning d'un model preentrenat
