A la lliçó anterior vam definir el deep learning i vam veure per què TecnoMarket el vol incorporar. Però sorgeix una pregunta inevitable: si les xarxes neuronals existeixen des dels anys 50, per què la revolució ha arribat en l'última dècada? Conèixer la història no és un exercici d'erudició: entendre per què el deep learning va fracassar dues vegades abans de triomfar et donarà criteri per avaluar les promeses (i els límits) de la tecnologia que faràs servir. En aquesta lliçó recorrerem el camí des del perceptró de 1958 fins a l'era actual, passant pels "hiverns de la IA" i la fita que ho va canviar tot el 2012.

Contingut

  1. Els orígens: el perceptró (1943-1958)
  2. El primer hivern de la IA (1969-1980)
  3. Backpropagation i el renaixement dels 80
  4. El segon hivern (anys 90 i 2000)
  5. El ressorgiment: GPU, big data i la tempesta perfecta
  6. La fita ImageNet/AlexNet (2012)
  7. L'era actual: del 2012 fins avui
  8. Taula cronològica de fites

Els orígens: el perceptró (1943-1958)

La història comença abans dels ordinadors moderns. El 1943, el neurofisiòleg Warren McCulloch i el matemàtic Walter Pitts van publicar un model matemàtic de neurona: van demostrar que unitats simples connectades entre si podien, en teoria, calcular funcions lògiques. Era pura teoria, però va plantar la llavor d'una idea poderosa: potser la intel·ligència es pot construir connectant unitats simples.

El 1958, el psicòleg Frank Rosenblatt va fer el salt a la pràctica amb el perceptró: la primera màquina capaç d'aprendre d'exemples ajustant les seves connexions internes. Rosenblatt fins i tot el va implementar en maquinari (el Mark I Perceptron), i el va entrenar per distingir formes simples en imatges de 20x20 "píxels".

L'entusiasme va ser desbordant. El New York Times va arribar a publicar que el perceptró seria "l'embrió d'un ordinador capaç de caminar, parlar, veure, escriure i ser conscient de la seva existència". Recorda aquesta frase: l'excés d'expectatives serà un patró recurrent en aquesta història.

No entrarem aquí en com funciona el perceptró per dins (l'estudiarem amb detall a la lliçó 02-01); el que és rellevant ara és el seu paper històric: va demostrar que una màquina podia aprendre, i va desfermar la primera onada d'optimisme.

El primer hivern de la IA (1969-1980)

El 1969, Marvin Minsky i Seymour Papert van publicar el llibre Perceptrons, una anàlisi matemàtica rigorosa que demostrava les limitacions del perceptró d'una sola capa: hi havia problemes aparentment trivials (com la funció lògica XOR) que no podria resoldre mai, per moltes dades que se li donessin.

Se sabia que apilar diverses capes resoldria el problema, però ningú no tenia un mètode pràctic per entrenar xarxes multicapa. La combinació va ser letal:

  • Expectatives inflades que no es complien.
  • Limitació teòrica demostrada del model disponible.
  • Ordinadors de l'època extremadament limitats.

Els governs i les agències (principals finançadors) van tallar els fons. La recerca en xarxes neuronals va quedar gairebé abandonada durant una dècada: és l'anomenat primer hivern de la IA. Lliçó per a TecnoMarket i per a qualsevol empresa: quan una tecnologia promet més del que pot lliurar, la decepció posterior s'endú també allò que sí que funcionava.

Backpropagation i el renaixement dels 80

El desglaç va arribar el 1986, quan David Rumelhart, Geoffrey Hinton i Ronald Williams van popularitzar l'algorisme de retropropagació de l'error (backpropagation): per fi existia un mètode pràctic i general per entrenar xarxes de diverses capes, superant la limitació que havia denunciat Minsky. (L'algorisme tenia precedents als anys 70, com el treball de Paul Werbos, però va ser el 1986 quan la comunitat el va adoptar massivament.)

Amb backpropagation van arribar èxits reals:

  • 1989: Yann LeCun va aplicar xarxes convolucionals amb backpropagation al reconeixement de dígits manuscrits. El seu sistema va acabar llegint codis postals per al servei postal dels EUA i xecs bancaris: una de les primeres aplicacions comercials del deep learning.
  • Es va desenvolupar la base teòrica de moltes arquitectures que fem servir avui.

De nou, no veurem aquí com funciona backpropagation per dins (és el tema de la lliçó 02-03). El que importa històricament és que va eliminar l'obstacle teòric... però en va aparèixer un de pràctic.

El segon hivern (anys 90 i 2000)

Si el problema teòric estava resolt, per què no va enlairar-se llavors? Perquè entrenar xarxes profundes als 90 topava contra tres murs:

Mur Descripció
Potència de càlcul Les CPU de l'època trigaven setmanes a entrenar xarxes modestes. Afegir capes disparava el cost.
Manca de dades No existia Internet massiu: no hi havia milions d'imatges o textos etiquetats amb què alimentar xarxes grans.
Dificultats tècniques Les xarxes profundes de l'època patien problemes d'entrenament (com gradients que s'esvaeixen, que esmentarem al mòdul 4) que ningú no sabia encara mitigar bé.

Mentrestant, mètodes de ML clàssic com les màquines de vectors de suport (SVM) donaven resultats iguals o millors amb molt menys cost. La comunitat investigadora hi va migrar en massa, i les xarxes neuronals van tornar a quedar com un camp marginal: el segon hivern. Durant aquests anys, un petit grup d'investigadors —Geoffrey Hinton, Yann LeCun i Yoshua Bengio, batejats després com "els padrins del deep learning"— va continuar treballant en xarxes neuronals contra el corrent dominant.

El ressorgiment: GPU, big data i la tempesta perfecta

Entre el 2006 i el 2012 es van alinear els tres factors que faltaven:

  1. GPU (targetes gràfiques): dissenyades per a videojocs, van resultar ser perfectes per al tipus de matemàtiques que necessiten les xarxes neuronals (moltíssimes operacions simples en paral·lel). Entrenaments que costaven setmanes en CPU van passar a costar dies o hores.
  2. Big data: Internet, els telèfons intel·ligents i les xarxes socials van generar per primera vegada datasets gegantins. El 2009, Fei-Fei Li i el seu equip van publicar ImageNet: més de 14 milions d'imatges etiquetades en milers de categories, i van organitzar una competició anual de classificació d'imatges sobre un subconjunt de 1.000 categories.
  3. Avenços algorísmics: el 2006, Hinton i col·laboradors van mostrar tècniques per entrenar xarxes profundes de manera més estable, i van encunyar amb força el terme deep learning. Noves funcions d'activació i tècniques de regularització (les veurem als mòduls 2 i 5) van fer l'entrenament molt més viable.

L'analogia del motor és útil: backpropagation era el motor, però faltaven el combustible (dades) i la carretera (maquinari). Cap al 2010, per fi hi era tot.

La fita ImageNet/AlexNet (2012)

El moment que gairebé tothom assenyala com el "big bang" del deep learning modern va arribar a la competició ImageNet del 2012. Una xarxa convolucional anomenada AlexNet, creada per Alex Krizhevsky, Ilya Sutskever i Geoffrey Hinton, i entrenada sobre dues GPU domèstiques, va arrasar:

Any Guanyador Error top-5 aproximat
2010 Mètodes clàssics (característiques manuals + SVM) ~28%
2011 Mètodes clàssics millorats ~26%
2012 AlexNet (deep learning) ~16%
2015 Xarxes profundes (ResNet) ~3,6% (superant el nivell humà estimat, ~5%)

Reduir l'error del 26% al 16% en un sol any va ser un salt sense precedents: les millores anuals habituals eren d'1-2 punts. El missatge va quedar clar per a tota la comunitat: l'extracció automàtica de característiques que vam veure a la lliçó 01-01 funcionava millor que dècades d'enginyeria manual. En dos o tres anys, pràcticament tota la recerca en visió per computador (i després en veu i text) va migrar al deep learning, i les grans tecnològiques van fitxar els pioners: Hinton (Google), LeCun (Facebook/Meta)...

Per al context de TecnoMarket: el classificador de fotos de productes que construirem al mòdul 3 és descendent directe d'AlexNet, i el 2012 hauria estat tecnologia punta mundial. Avui és un exercici de curs: així de ràpid ha avançat el camp.

L'era actual: del 2012 fins avui

Des del 2012, les fites s'han encadenat a un ritme vertiginós. Com a tancament cronològic (sense entrar en detall tècnic, cada tema té el seu lloc al curs):

  • 2014: apareixen les GAN (xarxes generatives adversàries), capaces de generar imatges noves (mòdul 5).
  • 2014-2016: les xarxes recurrents i les seves variants dominen la traducció automàtica i el processament del llenguatge (mòdul 4).
  • 2016: AlphaGo (DeepMind) derrota el campió mundial de Go, un joc considerat fora de l'abast de les màquines durant dècades.
  • 2017: es publica l'arquitectura Transformer ("Attention Is All You Need"), que revolucionarà el processament del llenguatge (la introduirem a la lliçó 05-05).
  • 2018-2020: models de llenguatge preentrenats cada vegada més grans (BERT, GPT-2, GPT-3) mostren que escalar dades i paràmetres continua donant millores.
  • 2021-avui: era dels LLM (grans models de llenguatge) i la IA generativa: ChatGPT, Claude, Gemini, generadors d'imatges com Stable Diffusion o Midjourney. El deep learning surt dels laboratoris i arriba al públic general.

El 2018, Hinton, LeCun i Bengio van rebre el Premi Turing (el "Nobel de la informàtica") per una aposta que van mantenir durant els hiverns en què gairebé ningú no hi creia.

Taula cronològica de fites

Any Fita Per què importa
1943 Neurona de McCulloch i Pitts Primer model matemàtic de neurona
1958 Perceptró de Rosenblatt Primera màquina que aprèn d'exemples
1969 Llibre Perceptrons (Minsky i Papert) Demostra els límits del perceptró simple; detona el primer hivern
1969-1980 Primer hivern de la IA Fons i recerca gairebé desapareixen
1986 Backpropagation (Rumelhart, Hinton, Williams) Mètode pràctic per entrenar xarxes multicapa
1989 LeCun: dígits manuscrits amb xarxes convolucionals Primera gran aplicació comercial
~1995-2006 Segon hivern Falten dades i potència; les SVM dominen
2006 Hinton rellança el terme deep learning Tècniques per entrenar xarxes profundes estables
2009 Dataset ImageNet El "combustible" de dades a gran escala
~2010 Ús generalitzat de GPU per entrenar xarxes El "maquinari" que faltava
2012 AlexNet guanya ImageNet El big bang: el DL supera clarament el ML clàssic en visió
2014 GAN Neix el deep learning generatiu
2016 AlphaGo venç el campió mundial de Go El DL conquereix problemes "impossibles"
2017 Arquitectura Transformer Base de la revolució del llenguatge
2018 Premi Turing a Hinton, LeCun i Bengio Reconeixement històric del camp
2020-avui LLM i IA generativa massiva El DL arriba al gran públic i a les empreses

Errors Comuns i Consells

  • Error: creure que el deep learning és una tecnologia "nova". Les idees centrals tenen més de 60 anys; el que és nou són les dades, el maquinari i alguns refinaments. Això importa: la base teòrica està molt assentada.
  • Error: pensar que el progrés va ser lineal. Hi va haver dos hiverns amb abandonament gairebé total. Les tecnologies avancen a salts, condicionades per expectatives, finançament i maquinari.
  • Error: atribuir la revolució només a "millors algorismes". L'algorisme clau (backpropagation) és del 1986. Sense GPU i sense big data no hi hauria hagut revolució. Quan avaluïs projectes a la teva empresa, pregunta sempre per les dades i el còmput disponibles, no només pel model.
  • Consell: desconfia dels titulars grandiloqüents, el 1958 ja prometien màquines conscients. La història del camp ensenya a distingir entre progrés real (mesurable, com el salt d'AlexNet) i expectatives inflades.
  • Consell: quan llegeixis sobre una arquitectura nova, situa-la en la cronologia: quin problema de les anteriors resol? Aquesta pregunta és la millor guia per entendre el camp.

Exercicis

Exercici 1: Ordena les fites

Ordena cronològicament els esdeveniments següents i afegeix-hi l'any aproximat: (a) AlexNet guanya ImageNet, (b) perceptró de Rosenblatt, (c) popularització de backpropagation, (d) publicació del llibre Perceptrons, (e) arquitectura Transformer, (f) publicació del dataset ImageNet.

Exercici 2: Les causes dels hiverns

Explica amb les teves paraules què va causar cadascun dels dos hiverns de la IA, i quin factor concret va posar fi a cadascun. Què tenien en comú tots dos hiverns?

Exercici 3: L'informe per a TecnoMarket

La directora general de TecnoMarket et pregunta, escèptica: "Com sé que això del deep learning no és una altra moda passatgera que es desinflarà com als anys 90?". Redacta una resposta de 4-6 línies fent servir arguments històrics d'aquesta lliçó.

Solucions

Solució 1:

  1. (b) Perceptró de Rosenblatt — 1958
  2. (d) Llibre Perceptrons — 1969
  3. (c) Popularització de backpropagation — 1986
  4. (f) Dataset ImageNet — 2009
  5. (a) AlexNet guanya ImageNet — 2012
  6. (e) Arquitectura Transformer — 2017

Solució 2:

  • Primer hivern (1969-1980): causat per la demostració de Minsky i Papert que el perceptró d'una capa no podia resoldre problemes bàsics (com XOR), unida a expectatives desmesurades incomplertes. Va acabar quan backpropagation (1986) va fer possible entrenar xarxes multicapa, eliminant la limitació teòrica.
  • Segon hivern (anys 90-2000): causat per obstacles pràctics: manca de potència de càlcul, manca de grans datasets i dificultats d'entrenament, mentre mètodes com les SVM donaven millors resultats amb menys cost. Va acabar quan van confluir GPU, big data (ImageNet) i millores algorísmiques cap al 2006-2012.
  • En comú: en tots dos casos hi va haver una bretxa entre expectatives i capacitats reals, i el finançament i l'interès es van enfonsar quan es va fer evident. La teoria sempre va anar per davant dels mitjans per aplicar-la.

Solució 3 (resposta orientativa):

"Els hiverns anteriors van passar perquè faltaven peces: als anys 70 no hi havia manera d'entrenar xarxes multicapa, i als 90 no hi havia ni dades ni maquinari suficients. Avui aquestes tres peces existeixen i són abundants: algorismes madurs amb dècades de base teòrica, dades massives i GPU barates, fins i tot al núvol. A més, ja no parlem de promeses de laboratori: des del 2012 el deep learning supera de manera mesurable les tècniques anteriors i sosté productes comercials que fem servir cada dia (cercadors, traductors, assistents). El risc de moda existeix en aplicacions concretes sobrevalorades, però la tecnologia base està consolidada; per això proposo començar per casos d'ús amb retorn clar, com la classificació automàtica de fotos de producte."

Conclusió

Hem recorregut més de 60 anys d'història: el perceptró va demostrar que les màquines podien aprendre (1958), Minsky i Papert en van marcar els límits (1969), backpropagation els va superar en teoria (1986), i la combinació de GPU + big data els va superar a la pràctica, amb AlexNet (2012) com a punt d'inflexió que va obrir l'era actual de transformers i models generatius. La moralitat professional: el deep learning no és màgia recent, sinó una idea antiga que va madurar quan el món va tenir les dades i el maquinari per alimentar-la.

Ja saps què és el deep learning i d'on ve. A la lliçó següent farem un recorregut panoràmic per les seves aplicacions actuals per dominis —visió, llenguatge, veu, recomanació, salut, frau...— i les connectarem amb les necessitats concretes de TecnoMarket i amb els mòduls del curs on aprendràs a construir cadascuna.

Curs de Deep Learning

Mòdul 1: Introducció al Deep Learning

Mòdul 2: Fonaments de Xarxes Neuronals

Mòdul 3: Xarxes Neuronals Convolucionals (CNN)

Mòdul 4: Xarxes Neuronals Recurrents (RNN)

Mòdul 5: Tècniques Avançades en Deep Learning

Mòdul 6: Eines i Frameworks

Mòdul 7: Projectes Pràctics

Mòdul 8: Consideracions Ètiques i Futur del Deep Learning

© Copyright 2026. Tots els drets reservats