A la lliçó anterior vam definir el deep learning i vam veure per què TecnoMarket el vol incorporar. Però sorgeix una pregunta inevitable: si les xarxes neuronals existeixen des dels anys 50, per què la revolució ha arribat en l'última dècada? Conèixer la història no és un exercici d'erudició: entendre per què el deep learning va fracassar dues vegades abans de triomfar et donarà criteri per avaluar les promeses (i els límits) de la tecnologia que faràs servir. En aquesta lliçó recorrerem el camí des del perceptró de 1958 fins a l'era actual, passant pels "hiverns de la IA" i la fita que ho va canviar tot el 2012.
Contingut
- Els orígens: el perceptró (1943-1958)
- El primer hivern de la IA (1969-1980)
- Backpropagation i el renaixement dels 80
- El segon hivern (anys 90 i 2000)
- El ressorgiment: GPU, big data i la tempesta perfecta
- La fita ImageNet/AlexNet (2012)
- L'era actual: del 2012 fins avui
- Taula cronològica de fites
Els orígens: el perceptró (1943-1958)
La història comença abans dels ordinadors moderns. El 1943, el neurofisiòleg Warren McCulloch i el matemàtic Walter Pitts van publicar un model matemàtic de neurona: van demostrar que unitats simples connectades entre si podien, en teoria, calcular funcions lògiques. Era pura teoria, però va plantar la llavor d'una idea poderosa: potser la intel·ligència es pot construir connectant unitats simples.
El 1958, el psicòleg Frank Rosenblatt va fer el salt a la pràctica amb el perceptró: la primera màquina capaç d'aprendre d'exemples ajustant les seves connexions internes. Rosenblatt fins i tot el va implementar en maquinari (el Mark I Perceptron), i el va entrenar per distingir formes simples en imatges de 20x20 "píxels".
L'entusiasme va ser desbordant. El New York Times va arribar a publicar que el perceptró seria "l'embrió d'un ordinador capaç de caminar, parlar, veure, escriure i ser conscient de la seva existència". Recorda aquesta frase: l'excés d'expectatives serà un patró recurrent en aquesta història.
No entrarem aquí en com funciona el perceptró per dins (l'estudiarem amb detall a la lliçó 02-01); el que és rellevant ara és el seu paper històric: va demostrar que una màquina podia aprendre, i va desfermar la primera onada d'optimisme.
El primer hivern de la IA (1969-1980)
El 1969, Marvin Minsky i Seymour Papert van publicar el llibre Perceptrons, una anàlisi matemàtica rigorosa que demostrava les limitacions del perceptró d'una sola capa: hi havia problemes aparentment trivials (com la funció lògica XOR) que no podria resoldre mai, per moltes dades que se li donessin.
Se sabia que apilar diverses capes resoldria el problema, però ningú no tenia un mètode pràctic per entrenar xarxes multicapa. La combinació va ser letal:
- Expectatives inflades que no es complien.
- Limitació teòrica demostrada del model disponible.
- Ordinadors de l'època extremadament limitats.
Els governs i les agències (principals finançadors) van tallar els fons. La recerca en xarxes neuronals va quedar gairebé abandonada durant una dècada: és l'anomenat primer hivern de la IA. Lliçó per a TecnoMarket i per a qualsevol empresa: quan una tecnologia promet més del que pot lliurar, la decepció posterior s'endú també allò que sí que funcionava.
Backpropagation i el renaixement dels 80
El desglaç va arribar el 1986, quan David Rumelhart, Geoffrey Hinton i Ronald Williams van popularitzar l'algorisme de retropropagació de l'error (backpropagation): per fi existia un mètode pràctic i general per entrenar xarxes de diverses capes, superant la limitació que havia denunciat Minsky. (L'algorisme tenia precedents als anys 70, com el treball de Paul Werbos, però va ser el 1986 quan la comunitat el va adoptar massivament.)
Amb backpropagation van arribar èxits reals:
- 1989: Yann LeCun va aplicar xarxes convolucionals amb backpropagation al reconeixement de dígits manuscrits. El seu sistema va acabar llegint codis postals per al servei postal dels EUA i xecs bancaris: una de les primeres aplicacions comercials del deep learning.
- Es va desenvolupar la base teòrica de moltes arquitectures que fem servir avui.
De nou, no veurem aquí com funciona backpropagation per dins (és el tema de la lliçó 02-03). El que importa històricament és que va eliminar l'obstacle teòric... però en va aparèixer un de pràctic.
El segon hivern (anys 90 i 2000)
Si el problema teòric estava resolt, per què no va enlairar-se llavors? Perquè entrenar xarxes profundes als 90 topava contra tres murs:
| Mur | Descripció |
|---|---|
| Potència de càlcul | Les CPU de l'època trigaven setmanes a entrenar xarxes modestes. Afegir capes disparava el cost. |
| Manca de dades | No existia Internet massiu: no hi havia milions d'imatges o textos etiquetats amb què alimentar xarxes grans. |
| Dificultats tècniques | Les xarxes profundes de l'època patien problemes d'entrenament (com gradients que s'esvaeixen, que esmentarem al mòdul 4) que ningú no sabia encara mitigar bé. |
Mentrestant, mètodes de ML clàssic com les màquines de vectors de suport (SVM) donaven resultats iguals o millors amb molt menys cost. La comunitat investigadora hi va migrar en massa, i les xarxes neuronals van tornar a quedar com un camp marginal: el segon hivern. Durant aquests anys, un petit grup d'investigadors —Geoffrey Hinton, Yann LeCun i Yoshua Bengio, batejats després com "els padrins del deep learning"— va continuar treballant en xarxes neuronals contra el corrent dominant.
El ressorgiment: GPU, big data i la tempesta perfecta
Entre el 2006 i el 2012 es van alinear els tres factors que faltaven:
- GPU (targetes gràfiques): dissenyades per a videojocs, van resultar ser perfectes per al tipus de matemàtiques que necessiten les xarxes neuronals (moltíssimes operacions simples en paral·lel). Entrenaments que costaven setmanes en CPU van passar a costar dies o hores.
- Big data: Internet, els telèfons intel·ligents i les xarxes socials van generar per primera vegada datasets gegantins. El 2009, Fei-Fei Li i el seu equip van publicar ImageNet: més de 14 milions d'imatges etiquetades en milers de categories, i van organitzar una competició anual de classificació d'imatges sobre un subconjunt de 1.000 categories.
- Avenços algorísmics: el 2006, Hinton i col·laboradors van mostrar tècniques per entrenar xarxes profundes de manera més estable, i van encunyar amb força el terme deep learning. Noves funcions d'activació i tècniques de regularització (les veurem als mòduls 2 i 5) van fer l'entrenament molt més viable.
L'analogia del motor és útil: backpropagation era el motor, però faltaven el combustible (dades) i la carretera (maquinari). Cap al 2010, per fi hi era tot.
La fita ImageNet/AlexNet (2012)
El moment que gairebé tothom assenyala com el "big bang" del deep learning modern va arribar a la competició ImageNet del 2012. Una xarxa convolucional anomenada AlexNet, creada per Alex Krizhevsky, Ilya Sutskever i Geoffrey Hinton, i entrenada sobre dues GPU domèstiques, va arrasar:
| Any | Guanyador | Error top-5 aproximat |
|---|---|---|
| 2010 | Mètodes clàssics (característiques manuals + SVM) | ~28% |
| 2011 | Mètodes clàssics millorats | ~26% |
| 2012 | AlexNet (deep learning) | ~16% |
| 2015 | Xarxes profundes (ResNet) | ~3,6% (superant el nivell humà estimat, ~5%) |
Reduir l'error del 26% al 16% en un sol any va ser un salt sense precedents: les millores anuals habituals eren d'1-2 punts. El missatge va quedar clar per a tota la comunitat: l'extracció automàtica de característiques que vam veure a la lliçó 01-01 funcionava millor que dècades d'enginyeria manual. En dos o tres anys, pràcticament tota la recerca en visió per computador (i després en veu i text) va migrar al deep learning, i les grans tecnològiques van fitxar els pioners: Hinton (Google), LeCun (Facebook/Meta)...
Per al context de TecnoMarket: el classificador de fotos de productes que construirem al mòdul 3 és descendent directe d'AlexNet, i el 2012 hauria estat tecnologia punta mundial. Avui és un exercici de curs: així de ràpid ha avançat el camp.
L'era actual: del 2012 fins avui
Des del 2012, les fites s'han encadenat a un ritme vertiginós. Com a tancament cronològic (sense entrar en detall tècnic, cada tema té el seu lloc al curs):
- 2014: apareixen les GAN (xarxes generatives adversàries), capaces de generar imatges noves (mòdul 5).
- 2014-2016: les xarxes recurrents i les seves variants dominen la traducció automàtica i el processament del llenguatge (mòdul 4).
- 2016: AlphaGo (DeepMind) derrota el campió mundial de Go, un joc considerat fora de l'abast de les màquines durant dècades.
- 2017: es publica l'arquitectura Transformer ("Attention Is All You Need"), que revolucionarà el processament del llenguatge (la introduirem a la lliçó 05-05).
- 2018-2020: models de llenguatge preentrenats cada vegada més grans (BERT, GPT-2, GPT-3) mostren que escalar dades i paràmetres continua donant millores.
- 2021-avui: era dels LLM (grans models de llenguatge) i la IA generativa: ChatGPT, Claude, Gemini, generadors d'imatges com Stable Diffusion o Midjourney. El deep learning surt dels laboratoris i arriba al públic general.
El 2018, Hinton, LeCun i Bengio van rebre el Premi Turing (el "Nobel de la informàtica") per una aposta que van mantenir durant els hiverns en què gairebé ningú no hi creia.
Taula cronològica de fites
| Any | Fita | Per què importa |
|---|---|---|
| 1943 | Neurona de McCulloch i Pitts | Primer model matemàtic de neurona |
| 1958 | Perceptró de Rosenblatt | Primera màquina que aprèn d'exemples |
| 1969 | Llibre Perceptrons (Minsky i Papert) | Demostra els límits del perceptró simple; detona el primer hivern |
| 1969-1980 | Primer hivern de la IA | Fons i recerca gairebé desapareixen |
| 1986 | Backpropagation (Rumelhart, Hinton, Williams) | Mètode pràctic per entrenar xarxes multicapa |
| 1989 | LeCun: dígits manuscrits amb xarxes convolucionals | Primera gran aplicació comercial |
| ~1995-2006 | Segon hivern | Falten dades i potència; les SVM dominen |
| 2006 | Hinton rellança el terme deep learning | Tècniques per entrenar xarxes profundes estables |
| 2009 | Dataset ImageNet | El "combustible" de dades a gran escala |
| ~2010 | Ús generalitzat de GPU per entrenar xarxes | El "maquinari" que faltava |
| 2012 | AlexNet guanya ImageNet | El big bang: el DL supera clarament el ML clàssic en visió |
| 2014 | GAN | Neix el deep learning generatiu |
| 2016 | AlphaGo venç el campió mundial de Go | El DL conquereix problemes "impossibles" |
| 2017 | Arquitectura Transformer | Base de la revolució del llenguatge |
| 2018 | Premi Turing a Hinton, LeCun i Bengio | Reconeixement històric del camp |
| 2020-avui | LLM i IA generativa massiva | El DL arriba al gran públic i a les empreses |
Errors Comuns i Consells
- Error: creure que el deep learning és una tecnologia "nova". Les idees centrals tenen més de 60 anys; el que és nou són les dades, el maquinari i alguns refinaments. Això importa: la base teòrica està molt assentada.
- Error: pensar que el progrés va ser lineal. Hi va haver dos hiverns amb abandonament gairebé total. Les tecnologies avancen a salts, condicionades per expectatives, finançament i maquinari.
- Error: atribuir la revolució només a "millors algorismes". L'algorisme clau (backpropagation) és del 1986. Sense GPU i sense big data no hi hauria hagut revolució. Quan avaluïs projectes a la teva empresa, pregunta sempre per les dades i el còmput disponibles, no només pel model.
- Consell: desconfia dels titulars grandiloqüents, el 1958 ja prometien màquines conscients. La història del camp ensenya a distingir entre progrés real (mesurable, com el salt d'AlexNet) i expectatives inflades.
- Consell: quan llegeixis sobre una arquitectura nova, situa-la en la cronologia: quin problema de les anteriors resol? Aquesta pregunta és la millor guia per entendre el camp.
Exercicis
Exercici 1: Ordena les fites
Ordena cronològicament els esdeveniments següents i afegeix-hi l'any aproximat: (a) AlexNet guanya ImageNet, (b) perceptró de Rosenblatt, (c) popularització de backpropagation, (d) publicació del llibre Perceptrons, (e) arquitectura Transformer, (f) publicació del dataset ImageNet.
Exercici 2: Les causes dels hiverns
Explica amb les teves paraules què va causar cadascun dels dos hiverns de la IA, i quin factor concret va posar fi a cadascun. Què tenien en comú tots dos hiverns?
Exercici 3: L'informe per a TecnoMarket
La directora general de TecnoMarket et pregunta, escèptica: "Com sé que això del deep learning no és una altra moda passatgera que es desinflarà com als anys 90?". Redacta una resposta de 4-6 línies fent servir arguments històrics d'aquesta lliçó.
Solucions
Solució 1:
- (b) Perceptró de Rosenblatt — 1958
- (d) Llibre Perceptrons — 1969
- (c) Popularització de backpropagation — 1986
- (f) Dataset ImageNet — 2009
- (a) AlexNet guanya ImageNet — 2012
- (e) Arquitectura Transformer — 2017
Solució 2:
- Primer hivern (1969-1980): causat per la demostració de Minsky i Papert que el perceptró d'una capa no podia resoldre problemes bàsics (com XOR), unida a expectatives desmesurades incomplertes. Va acabar quan backpropagation (1986) va fer possible entrenar xarxes multicapa, eliminant la limitació teòrica.
- Segon hivern (anys 90-2000): causat per obstacles pràctics: manca de potència de càlcul, manca de grans datasets i dificultats d'entrenament, mentre mètodes com les SVM donaven millors resultats amb menys cost. Va acabar quan van confluir GPU, big data (ImageNet) i millores algorísmiques cap al 2006-2012.
- En comú: en tots dos casos hi va haver una bretxa entre expectatives i capacitats reals, i el finançament i l'interès es van enfonsar quan es va fer evident. La teoria sempre va anar per davant dels mitjans per aplicar-la.
Solució 3 (resposta orientativa):
"Els hiverns anteriors van passar perquè faltaven peces: als anys 70 no hi havia manera d'entrenar xarxes multicapa, i als 90 no hi havia ni dades ni maquinari suficients. Avui aquestes tres peces existeixen i són abundants: algorismes madurs amb dècades de base teòrica, dades massives i GPU barates, fins i tot al núvol. A més, ja no parlem de promeses de laboratori: des del 2012 el deep learning supera de manera mesurable les tècniques anteriors i sosté productes comercials que fem servir cada dia (cercadors, traductors, assistents). El risc de moda existeix en aplicacions concretes sobrevalorades, però la tecnologia base està consolidada; per això proposo començar per casos d'ús amb retorn clar, com la classificació automàtica de fotos de producte."
Conclusió
Hem recorregut més de 60 anys d'història: el perceptró va demostrar que les màquines podien aprendre (1958), Minsky i Papert en van marcar els límits (1969), backpropagation els va superar en teoria (1986), i la combinació de GPU + big data els va superar a la pràctica, amb AlexNet (2012) com a punt d'inflexió que va obrir l'era actual de transformers i models generatius. La moralitat professional: el deep learning no és màgia recent, sinó una idea antiga que va madurar quan el món va tenir les dades i el maquinari per alimentar-la.
Ja saps què és el deep learning i d'on ve. A la lliçó següent farem un recorregut panoràmic per les seves aplicacions actuals per dominis —visió, llenguatge, veu, recomanació, salut, frau...— i les connectarem amb les necessitats concretes de TecnoMarket i amb els mòduls del curs on aprendràs a construir cadascuna.
Curs de Deep Learning
Mòdul 1: Introducció al Deep Learning
- Què és el Deep Learning?
- Història i evolució del Deep Learning
- Aplicacions del Deep Learning
- Conceptes bàsics de xarxes neuronals
- Preparació de l'entorn de treball
Mòdul 2: Fonaments de Xarxes Neuronals
- Perceptró i Perceptró Multicapa
- Funció d'activació
- Propagació cap endavant i cap enrere
- Optimització i funció de pèrdua
- La teva primera xarxa neuronal completa
Mòdul 3: Xarxes Neuronals Convolucionals (CNN)
- Introducció a les CNN
- Capes convolucionals i de pooling
- Arquitectures populars de CNN
- Aplicacions de CNN en reconeixement d'imatges
Mòdul 4: Xarxes Neuronals Recurrents (RNN)
- Introducció a les RNN
- LSTM i GRU
- Aplicacions de RNN en processament del llenguatge natural
- Seqüències i sèries temporals
Mòdul 5: Tècniques Avançades en Deep Learning
- Xarxes Generatives Adversàries (GAN)
- Autoencoders
- Transfer Learning
- Regularització i tècniques de millora
- Mecanismes d'atenció i Transformers
Mòdul 6: Eines i Frameworks
- Introducció a TensorFlow
- Introducció a PyTorch
- Comparació de frameworks
- Entorns de desenvolupament i recursos addicionals
- Desar, carregar i desplegar models
Mòdul 7: Projectes Pràctics
- Classificació d'imatges amb CNN
- Generació de text amb RNN
- Detecció d'anomalies amb Autoencoders
- Creació d'una GAN per a generació d'imatges
- Fine-tuning d'un model preentrenat
