A 08-01 vam construir un mètode i el vam aplicar al predictor de devolucions. Un mètode, tanmateix, s'entén de debò quan es veu funcionar (o fallar) en projectes reals, amb pressupostos, pressions i conseqüències que cap exercici no reprodueix. Aquesta lliçó recorre sis casos d'estudi de domini públic, triats perquè cadascun il·lustra una fase del cicle de vida o una tècnica del curs: els sistemes de recomanació (del filtratge col·laboratiu al deep learning, amb el Netflix Prize com a història), el diagnòstic per imatge mèdica amb xarxes convolucionals (promeses i problemes de generalització), AlphaGo i AlphaFold (cerca, xarxes i reforç amb impacte científic), els sistemes de selecció i d'scoring que van discriminar (una eina de contractació descartada per biaix de gènere i el debat sobre COMPAS), els assistents conversacionals amb grans models de llenguatge (i el cas d'una aerolínia obligada a complir una política que el seu chatbot es va inventar) i un fracàs instructiu, Watson for Oncology, juntament amb el reconeixement facial policial. Els expliquem amb prudència: el que s'afirma és el que està documentat públicament, i assenyalem on simplifiquem. Cada cas acaba amb el paral·lel a NovaMarket: què n'aprèn la Marta per al seu recomanador, el seu assistent, el seu predictor o el seu classificador de fotos. És important perquè les lliçons més cares de la IA ja les han pagat altres; el professional júnior que les coneix evita repetir-les.
Contingut
- Com llegir un cas d'estudi
- Cas 1: sistemes de recomanació, del filtratge col·laboratiu al deep learning (Netflix Prize)
- Cas 2: diagnòstic per imatge mèdica amb CNN (retinopatia diabètica, càncer de pell)
- Cas 3: AlphaGo i AlphaFold, dels jocs a la ciència
- Cas 4: selecció de personal i scoring amb biaix (l'eina descartada i COMPAS)
- Cas 5: assistents conversacionals i LLM en atenció al client (el chatbot de l'aerolínia)
- Cas 6: un fracàs instructiu, Watson for Oncology (i el reconeixement facial policial)
- Un petit exemple executable: la lliçó d'equitat en cinc línies
- Taula resum: cas → tècnica → lliçó del curs → lliçó apresa
- Errors Comuns i Consells
- Exercicis
- Conclusió
- Com llegir un cas d'estudi
Els casos d'èxit i de fracàs en IA s'expliquen sovint com a titulars ("la IA supera els metges", "l'algorisme racista"). Per aprendre'n cal llegir-los amb la plantilla de 08-01: context (qui, per a què, amb quina pressió), problema (la pregunta i la decisió que canvia), tècnica (quin model i per què; ho enllacem amb la lliçó del curs on s'ha vist), resultat (el que es va mesurar, i el que no), lliçons (quina fase del cicle va fallar o va funcionar) i, per a nosaltres, el paral·lel a NovaMarket. I amb dues cauteles: moltes xifres cèlebres procedeixen de comunicats de les mateixes empreses o d'articles que després es van matisar, i en diversos casos hi va haver litigis o versions enfrontades. Quan diem "segons informes públics" és perquè no hi ha una font única i indiscutible.
- Cas 1: sistemes de recomanació, del filtratge col·laboratiu al deep learning (Netflix Prize)
Context. A principis dels anys 2000, el comerç electrònic i les plataformes de contingut van descobrir que la major part del que venien no cabia en una portada: calia una portada diferent per a cada client. Amazon va publicar el 2003 el seu mètode de filtratge col·laboratiu ítem a ítem ("els clients que van comprar això també van comprar allò"), el mateix principi que vam programar a 01-03 per a NovaMarket. El 2006, Netflix, llavors un servei de lloguer de DVD per correu, va convocar el Netflix Prize: un milió de dòlars per al primer equip que millorés en un 10 % l'error (RMSE, 04-05) del seu sistema Cinematch en predir les valoracions d'una a cinc estrelles, sobre un conjunt d'uns cent milions de valoracions anonimitzades.
Problema. Predir quina valoració donarà un usuari a una pel·lícula que no ha vist (regressió, 04-02) per ordenar el catàleg. La decisió que canvia: quins títols es mostren primer.
Tècnica. El concurs, que va durar fins al 2009, va popularitzar la factorització de matrius: representar cada usuari i cada pel·lícula amb un vector de factors latents (la idea dels embeddings de 05-04) el producte escalar del qual prediu la valoració; i va demostrar el poder dels conjunts de models (ensembles, 04-04): l'equip guanyador combinava centenars de models. Amb l'arribada de l'streaming, les plataformes van passar de les valoracions explícites als senyals implícits (què es reprodueix, quant de temps, què s'abandona) i, a la dècada de 2010, a xarxes neuronals profundes que combinen embeddings d'usuari, contingut i context (05-04), com va descriure YouTube en un article molt citat del 2016.
Resultat. El premi es va lliurar el 2009. Però Netflix va explicar públicament anys després que la solució guanyadora completa no va arribar a desplegar-se tal qual: el cost d'enginyeria de mantenir centenars de models en producció no compensava la millora, i el negoci havia canviat (del DVD i les estrelles a l'streaming i els senyals implícits). A més, investigadors van demostrar que el conjunt de dades "anonimitzat" permetia reidentificar alguns usuaris encreuant-lo amb valoracions públiques d'un altre lloc web, cosa que va derivar en una demanda i en la cancel·lació d'una segona edició del concurs.
Lliçons.
- La mètrica del concurs no era la mètrica del negoci: millorar l'RMSE un 10 % no equival al fet que la gent miri més o cancel·li menys. És l'error 3 de 08-01 (mètrica equivocada) a escala d'un milió de dòlars.
- La complexitat té un cost de desplegament i manteniment (fases 6-7): un model un 1 % millor que exigeix deu vegades més enginyeria pot ser una decisió pitjor.
- L'anonimització no és trivial (02-03, 02-04): treure els noms no n'hi ha prou quan les dades són riques.
- El model simple primer (filtratge col·laboratiu, factorització) continua sent la línia base que cal batre abans d'una xarxa profunda.
El paral·lel a NovaMarket. Per al recomanador (cas 1), la Marta comença pel filtratge col·laboratiu ítem a ítem de 01-03 amb dades de compra i navegació com a línia base; defineix la mètrica de negoci al document de definició (ingressos i clics del bloc "també et pot interessar", mesurats amb A/B, exercici 3 de 08-01), no l'error d'una valoració; i tracta els historials de compra com a dades personals, sense publicar-los ni compartir-los "anonimitzats" a la lleugera. Si un model més complex millora el clic un 1 % però exigeix un servei nou, la decisió és de negoci, no de la mètrica.
- Cas 2: diagnòstic per imatge mèdica amb CNN (retinopatia diabètica, càncer de pell)
Context. La retinopatia diabètica és una causa important de ceguesa evitable; el seu cribratge exigeix que un especialista examini fotografies del fons de l'ull, i hi ha molts més pacients que especialistes. El 2016 un equip de Google va publicar en una revista mèdica un estudi en què una xarxa convolucional (05-04), entrenada amb més de cent mil fotografies etiquetades per oftalmòlegs, assolia una sensibilitat i una especificitat comparables a les dels especialistes en dos conjunts de validació. El 2017 un altre grup (Stanford) va publicar a Nature un classificador de lesions cutànies entrenat amb una CNN que, a les proves de l'estudi, es comportava al nivell de dermatòlegs en distingir lesions malignes de benignes.
Problema. Classificació d'imatges (04-02): a partir d'una foto, hi ha signes de malaltia que justifiquin derivar a l'especialista? La decisió que canvia: qui es deriva i amb quina prioritat.
Tècnica. Xarxes convolucionals preentrenades i ajustades (transfer learning, 05-04), exactament el que vam fer amb la CNN de fotos d'incidències de NovaMarket (98,7 % en el nostre cas fictici), amb moltes més imatges i etiquetes de diversos especialistes per imatge per reduir el soroll d'etiquetatge.
Resultat. Els resultats de laboratori van ser sòlids i van obrir un camp sencer. Però el pas a la clínica va ensenyar les limitacions que avui coneix tot el sector: quan el sistema de retinopatia es va provar en clíniques reals de Tailàndia (estudi publicat el 2020), una part considerable de les imatges preses en condicions reals (il·luminació, càmeres, infermeres amb poca formació específica) no complia la qualitat que el model exigia i era rebutjada, cosa que generava feina extra i frustració; i el flux de treball (connexió a internet, temps d'espera) importava tant com l'AUC. En dermatologia es va documentar que els conjunts de dades tenien poca representació de pells fosques, i que alguns models aprenien dreceres: marques de retolador quirúrgic o regles de mesura presents sobretot a les fotos de lesions malignes, que el model feia servir com a pista. En radiografies de tòrax es va mostrar que un model podia reconèixer l'hospital d'origen de la imatge (per l'aparell o les etiquetes incrustades) i aprofitar-ho, de manera que el seu rendiment queia en hospitals nous.
Lliçons.
- Generalització entre centres (04-06): un model validat amb dades dels mateixos hospitals que el van entrenar no està validat per a altres. La validació s'ha de fer en centres diferents i en condicions reals.
- Fuites i dreceres (04-03): les regles i els retoladors són la versió mèdica de
motiu_devolucio. - Biaix de mostreig (02-03, 02-04): si un grup amb prou feines és a les dades, el rendiment sobre ell és desconegut, no "igual".
- El desplegament és un problema de flux de treball (08-01, fase 6): la qualitat de la imatge, el temps de resposta i la formació de qui fa servir el sistema decideixen tant com el model. I sempre amb revisió humana proporcional al risc: és alt risc al Reglament d'IA (02-04).
El paral·lel a NovaMarket. El classificador de fotos d'incidències (cas 9, 05-04) es va entrenar amb fotos fetes per l'equip de Zaragoza amb bona llum; abans de generalitzar-lo, la Marta prova amb fotos de clients fetes amb el mòbil a casa (pitjor llum, enquadrament, resolució) i amb les de Getafe, mesura per magatzem i per tipus de dispositiu, i afegeix una comprovació de qualitat d'imatge que demana una altra foto en lloc de classificar malament. I busca dreceres: aprèn la xarxa que "hi ha embalatge NovaMarket a la foto" en lloc del defecte?
- Cas 3: AlphaGo i AlphaFold, dels jocs a la ciència
Context. El Go era el gran joc pendent de la IA: el seu arbre de jugades és tan gran que la cerca amb funció d'avaluació escrita a mà, que va bastar a Deep Blue en escacs (03-03), no funcionava. El 2016 AlphaGo, de DeepMind, va vèncer Lee Sedol, un dels millors jugadors del món, per 4 a 1 (01-01). El seu successor AlphaGo Zero va aprendre sense partides humanes, només jugant contra si mateix, i va superar l'original. El 2020, la mateixa empresa va presentar AlphaFold 2 a la competició CASP de predicció d'estructura de proteïnes, amb una precisió que per a moltes proteïnes rivalitzava amb els mètodes experimentals; després va publicar una base de dades amb prediccions per a centenars de milions de proteïnes, i el 2024 els seus autors principals van compartir el Premi Nobel de Química amb David Baker.
Problema. Al Go: decidir la millor jugada (cerca amb adversari, 03-03) en un espai inabastable. A les proteïnes: predir la forma tridimensional d'una proteïna a partir de la seva seqüència d'aminoàcids, un problema obert durant dècades i clau per entendre malalties i dissenyar fàrmacs.
Tècnica. AlphaGo va combinar cerca en arbre Monte Carlo (una cerca que mostreja partides en lloc de recórrer tot l'arbre, en la família de 03-02/03-03) amb dues xarxes profundes, una que proposa jugades i una altra que avalua posicions (05-04), entrenades primer amb partides humanes i després per aprenentatge per reforç jugant contra si mateixa (04-02). AlphaFold 2 és un sistema de xarxes amb atenció (05-05) sobre seqüències relacionades evolutivament i sobre les relacions geomètriques entre aminoàcids, entrenat amb les estructures experimentals conegudes i, en part, amb les seves pròpies prediccions d'alta confiança. Simplifiquem molt: tots dos sistemes són enginyeria de recerca a gran escala.
Resultat. Més enllà del titular, el rellevant és l'impacte científic: la predicció d'estructures va deixar de ser el coll d'ampolla de molts projectes de biologia, i les tècniques (cerca + xarxes + reforç, atenció sobre dades estructurades) s'han estès a la química de materials, la predicció meteorològica o el control de sistemes físics.
Lliçons.
- La combinació de tècniques guanya: cerca simbòlica (mòdul 3) més xarxes (mòdul 5) més reforç, no una sola eina. És l'argument neurosimbòlic de 06-04 vist des d'un altre angle.
- El problema estava ben definit i era mesurable: guanyar partides; una mètrica de precisió sobre estructures conegudes en una competició cega. Els grans èxits de la IA tenen una mesura de rendiment clara (02-01).
- Les dades existien: dècades d'estructures experimentals dipositades en una base pública. Sense elles no hi ha AlphaFold.
- Compte amb l'extrapolació: superar un campió de Go no vol dir que "la IA sigui més llesta que les persones"; és IA estreta (02-02) en un entorn completament observable i de regles fixes.
El paral·lel a NovaMarket. No entrenarà cap AlphaGo, però la lliçó de "combinar cerca i models" ja l'aplica: les rutes de la furgoneta (03-04) milloren si l'estimació de temps per tram la dona un model après en lloc d'una constant; i l'aprenentatge per reforç és candidat, a mitjà termini, per a polítiques de reposició d'estoc, sempre amb una simulació prèvia (mai aprendre a força d'errors amb clients reals). I la lliçó de les dades: si NovaMarket vol models bons d'aquí a tres anys, ha de començar avui a desar bé el que passa (dates, decisions, resultats), com van fer els biòlegs amb les estructures.
- Cas 4: selecció de personal i scoring amb biaix (l'eina descartada i COMPAS)
Context (a). Segons va informar la premsa el 2018, un gran grup tecnològic havia desenvolupat internament una eina per puntuar currículums i així preseleccionar candidats, entrenada amb els currículums rebuts durant uns deu anys. L'equip va descobrir que el sistema penalitzava els currículums que contenien la paraula "women's" (per exemple, "capitana del club d'escacs femení") i els de graduades de determinades universitats femenines, perquè l'històric de contractacions en llocs tècnics estava dominat per homes. Es va intentar corregir neutralitzant aquests termes, però no hi havia garantia que el model no trobés altres indicis, i el projecte es va abandonar.
Context (b). COMPAS és una eina comercial usada en diversos estats dels Estats Units per estimar el risc de reincidència de persones acusades o condemnades, amb influència en decisions judicials. El 2016 una investigació periodística va analitzar milers de casos i va concloure que, entre les persones que no van reincidir, les de raça negra havien rebut puntuacions d'alt risc amb molta més freqüència que les blanques (més falsos positius), i a l'inrevés amb els falsos negatius. L'empresa va respondre que l'eina estava calibrada per igual per a tots dos grups (una puntuació de 7 volia dir la mateixa probabilitat de reincidència fos quina fos la raça). Investigadors van demostrar després que, quan les taxes base difereixen entre grups, és matemàticament impossible satisfer alhora la calibració i la igualtat de taxes d'error: cal triar quina noció d'equitat es prioritza, i aquesta tria no és tècnica.
Problema. Classificació supervisada (04-02) sobre persones: és bon candidat? reincidirà? La decisió que canvia: qui passa a entrevista; quina mesura cautelar s'aplica.
Tècnica. Models supervisats entrenats sobre decisions humanes passades com a etiqueta. Aquí hi ha l'arrel: el model aprèn a imitar el passat, amb els seus biaixos, i els codifica en proxies (paraules, codis postals, historial) encara que s'elimini la característica protegida (02-04, secció 3).
Resultat. L'eina de selecció es va descartar abans de fer-la servir per decidir; COMPAS continua en ús en alguns llocs enmig d'un debat obert sobre equitat, transparència (el model és propietari i opac) i responsabilitat.
Lliçons.
- L'etiqueta pot estar esbiaixada: "contractat" o "va reincidir" (en realitat, "detingut de nou") no són la veritat neutral que semblen (02-03).
- Treure la columna protegida no elimina el biaix si hi ha proxies; cal mesurar per grup (02-04, secció 10) i decidir amb quina mètrica.
- Cal triar la definició d'equitat abans d'entrenar, amb juristes i afectats, i documentar-la (avaluació d'impacte).
- Alt risc: ocupació i justícia són àmbits d'alt risc al Reglament d'IA; opacitat més impacte en persones és la combinació que exigeix revisió humana efectiva i dret a explicació (RGPD).
El paral·lel a NovaMarket. El predictor de devolucions no decideix sobre ocupació ni justícia, però sí sobre clients: la lliçó de 02-04 (marcar el 90 % d'una zona i el 20 % d'una altra amb la mateixa taxa real) és aquest cas en petit. Per això el document de definició de 08-01 fixa una ràtio d'impacte ≥ 0,8 entre zones, la model card diu que codi_postal_zona no decideix sense revisió, i el calendari de monitoratge mesura la paritat cada mes. I si algun dia RH demana "un model que ordeni candidatures", la Marta sap que la primera pregunta no és quin algorisme, sinó què diu l'històric i qui en respon.
- Cas 5: assistents conversacionals i LLM en atenció al client (el chatbot de l'aerolínia)
Context. Des del 2023 moltes empreses han incorporat assistents basats en grans models de llenguatge (05-05) a la seva atenció al client, per respondre preguntes freqüents, consultar l'estat d'una comanda o resoldre gestions senzilles. Els resultats publicats per les mateixes empreses acostumen a ser positius (més consultes resoltes sense agent, menys temps d'espera), tot i que són xifres de comunicats i cal llegir-les com a tals. I hi ha casos públics del contrari. El més citat: un client d'una aerolínia canadenca va preguntar al chatbot del web per les tarifes per dol; el chatbot li va dir que podia comprar el bitllet i demanar el reemborsament parcial després del viatge, cosa que la política real de la companyia no permetia. Quan l'aerolínia es va negar al reemborsament, el client va acudir a un tribunal de petites reclamacions. La companyia va al·legar que el chatbot era una "entitat separada" responsable de les seves pròpies paraules; el tribunal ho va rebutjar el 2024 i la va obligar a honorar el que el chatbot havia dit: la informació del seu web, la doni una pàgina o un chatbot, és responsabilitat de l'empresa. Altres casos públics inclouen chatbots de repartiment que, provocats per l'usuari, van insultar la mateixa empresa o van compondre poemes en contra seva, i sistemes que van "confirmar" descomptes inexistents.
Problema. Respondre en llenguatge natural preguntes sobre polítiques, comandes i productes, amb la decisió que canvia sent, sovint, una promesa al client.
Tècnica. LLM amb instruccions (prompting), idealment amb RAG (05-05): recuperar els fragments de la política real i respondre només a partir d'ells; i amb regles de validació a la sortida (06-04, exercici 3: si la resposta conté una xifra de diners, un termini o una promesa, comprovar-la contra la font o derivar a un agent).
Resultat. Els assistents ben delimitats funcionen i estalvien feina; els que es despleguen sense acotar l'abast ni verificar les respostes al·lucinen polítiques i comprometen l'empresa. La lliçó jurídica és nítida: l'empresa respon pel que diu el seu chatbot.
Lliçons.
- L'al·lucinació no és una fallada rara, és una propietat dels models generatius (05-05, secció 11): el disseny ha de suposar que passarà.
- RAG + fonts citades + validació per regles (neurosimbòlic, 06-04) redueixen el risc; i per al que compromet diners, derivar a una persona.
- Registre i avaluació contínua de converses (08-01, fase 7): mostreig setmanal de respostes revisades per l'equip d'atenció al client, i proves adversàries abans de desplegar.
- Responsabilitat (02-04): la resposta del chatbot és una comunicació de l'empresa; legal n'ha de revisar l'abast.
El paral·lel a NovaMarket. L'assistent (cas 7) que vam dissenyar amb RAG a 05-05 respon només amb fragments de la política de devolucions i les fitxes de producte, cita el fragment, i les regles de 06-04 bloquegen qualsevol resposta amb imports, terminis o promeses no verificats i la deriven a una persona; mai no confirma un reemborsament: crea la sol·licitud i la deixa a la cua del Diego. A la model card de l'assistent, l'"ús no previst" inclou "comprometre condicions comercials". I la Marta afegeix al calendari de monitoratge el mostreig setmanal de 50 converses revisades per atenció al client.
- Cas 6: un fracàs instructiu, Watson for Oncology (i el reconeixement facial policial)
Context. Després de guanyar el concurs Jeopardy! el 2011 (01-01), IBM va presentar Watson com a plataforma per a molts sectors, i en particular Watson for Oncology, un sistema per recomanar tractaments oncològics, desenvolupat amb un prestigiós centre oncològic nord-americà i comercialitzat a hospitals de diversos països. Segons informes públics de premsa especialitzada i d'una auditoria universitària (2017-2018), el projecte va patir diversos problemes: una part de l'entrenament es va fer amb casos hipotètics preparats per especialistes del centre, no només amb historials reals; les recomanacions reflectien les pràctiques d'aquell centre i no sempre encaixaven amb les guies o els recursos d'hospitals d'altres països; documents interns filtrats a la premsa descrivien recomanacions "insegures i incorrectes" en proves; i un gran hospital de Texas va cancel·lar el seu projecte de diversos anys després d'una despesa que l'auditoria va xifrar en desenes de milions de dòlars, sense arribar a fer-se servir amb pacients. La divisió de salut d'IBM es va vendre el 2022. Simplifiquem una història llarga i amb versions enfrontades; el que no es discuteix és la distància entre l'expectativa creada i el resultat.
Problema. Recomanar tractaments personalitzats a partir de la història clínica i de la literatura mèdica; la decisió que canvia, la d'un oncòleg sobre un pacient. Un problema amb etiquetes escasses i discutibles, dades heterogènies i risc màxim.
Tècnica. Sistemes de processament de llenguatge i recuperació d'informació de l'època (anteriors als transformers de 05-05), combinats amb coneixement curat per especialistes: en el fons, un sistema expert (06-02) alimentat amb dades i amb literatura, la "base de coneixement" del qual va resultar estar esbiaixada cap a un centre.
Resultat. Retirada progressiva del producte i una lliçó per a tot el sector sobre la sobreexpectativa (els hiverns de 01-01 començaven així) i sobre la diferència entre guanyar un concurs de televisió i ajudar en una consulta.
Reconeixement facial policial (breu). Un cas paral·lel: el 2018 un estudi acadèmic (Gender Shades) va mostrar que diversos sistemes comercials de classificació de rostres tenien taxes d'error molt més grans en dones de pell fosca que en homes de pell clara, per conjunts d'entrenament poc representatius; després es van documentar als Estats Units detencions errònies de persones negres identificades per sistemes de reconeixement facial policial. Diverses ciutats en van restringir o prohibir l'ús policial, algunes empreses van deixar de vendre'l a la policia i el Reglament d'IA europeu restringeix severament la identificació biomètrica remota en espais públics (02-04).
Lliçons.
- Dades que no representen la realitat d'ús (casos hipotètics d'un centre; rostres d'un sol grup): el model aprèn un altre problema (fase 2 de 08-01).
- Validació externa abans de vendre: cap desplegament en un país nou sense avaluar amb dades i guies d'aquell país (04-06, generalització).
- La sobreexpectativa mata projectes (01-01): prometre "curar el càncer" amb un sistema de recomanació crea un deute impossible de pagar.
- En alt risc, la revisió humana ha de ser real, no un botó d'"acceptar" que es prem per confiança en la màquina (biaix d'automatització, 02-04).
- Mesurar per grup és obligatori quan l'error té conseqüències greus; i per a certs usos, la resposta correcta és no desplegar.
El paral·lel a NovaMarket. El diagnòstic d'incidències (cas 9: la xarxa bayesiana de 06-03 més la CNN de fotos) és el "Watson" de NovaMarket a petita escala: el seu coneixement ve dels tècnics de Zaragoza. Abans de fer-lo servir a Getafe, la Marta valida amb incidències de Getafe, no promet "resoldre totes les incidències" sinó "proposar un diagnòstic que el tècnic confirma o corregeix" i registra cada correcció per millorar les taules de probabilitat. I sobre el reconeixement facial, la lliçó per al futur: si algú proposa "identificar clients per la càmera de la botiga física" o "detectar frau per la foto del DNI", la resposta comença per l'avaluació d'impacte i per legal, no pel model.
- Un petit exemple executable: la lliçó d'equitat en cinc línies
El cas 4 es pot reproduir en miniatura amb dades fictícies, aplicant la paritat de taxes de 02-04. Simulem un històric de candidatures en què la decisió passada depenia de l'experiència i d'un biaix contra un grup, i en què una paraula del currículum actua de proxy del grup. Després fem el que va fer l'equip del cas real: treure la columna del grup i entrenar amb la resta.
import numpy as np, pandas as pd
from sklearn.linear_model import LogisticRegression
rng = np.random.default_rng(42)
n = 2000
# Candidatures fictícies a un lloc tècnic. L'etiqueta 'contractat_historic' arrossega el biaix del passat.
genere = rng.choice(["dona", "home"], size=n, p=[0.35, 0.65])
experiencia = rng.integers(0, 15, size=n)
# proxy: a l'històric, certes paraules del CV (p. ex. "club femení") apareixen gairebé només en un grup
paraula_proxy = np.where(genere == "dona", rng.random(n) < 0.6, rng.random(n) < 0.05).astype(int)
# la decisió històrica depenia de l'experiència... i d'un biaix contra un grup
z = -2 + 0.25 * experiencia - 1.2 * (genere == "dona")
contractat = (rng.random(n) < 1 / (1 + np.exp(-z))).astype(int)
cv = pd.DataFrame({"genere": genere, "experiencia": experiencia,
"paraula_proxy": paraula_proxy, "contractat_historic": contractat})
# "Solució ingènua": treure la columna genere i entrenar amb la resta
X = cv[["experiencia", "paraula_proxy"]]
model = LogisticRegression().fit(X, cv["contractat_historic"])
cv["recomanat"] = model.predict(X)
taxes = cv.groupby("genere")["recomanat"].mean()
print("Taxa de recomanació per grup:\n", taxes.round(3).to_string())
print(f"Ràtio d'impacte: {taxes.min() / taxes.max():.2f} (regla dels quatre cinquens: >= 0,80)")
print("Coeficient de la paraula proxy:", round(float(model.coef_[0][1]), 2))Sortida (executada a l'entorn del curs):
Taxa de recomanació per grup: genere dona 0.193 home 0.348 Ràtio d'impacte: 0.56 (regla dels quatre cinquens: >= 0,80) Coeficient de la paraula proxy: -1.1
Explicació: el model no ha vist mai la columna genere i, tanmateix, recomana el 35 % dels homes i el 19 % de les dones (ràtio 0,56, molt per sota de 0,8). Ho aconsegueix a través del proxy: el coeficient de paraula_proxy és −1,1, és a dir, la presència de la paraula redueix fortament la puntuació, perquè a l'històric aquesta paraula anava associada a candidatures que es rebutjaven per un altre motiu. És exactament el que es va relatar al cas real, i és la raó per la qual la mesura per grup de 02-04 és obligatòria encara que el model "no faci servir" la característica protegida. Corregir-ho de debò exigeix actuar sobre l'etiqueta (quin històric és acceptable com a veritat?), sobre les característiques (quines paraules hi entren?) i sobre la decisió (revisió humana, quotes d'entrevista, o no automatitzar).
- Taula resum: cas → tècnica → lliçó del curs → lliçó apresa
| Cas | Tècnica principal | Lliçó del curs | Fase del cicle (08-01) que ensenya | Lliçó apresa | Paral·lel a NovaMarket |
|---|---|---|---|---|---|
| Recomanació (Netflix Prize) | Filtratge col·laboratiu, factorització, embeddings + xarxes | 01-03, 04-04, 05-04 | 1 (mètrica), 6-7 (cost de desplegament) | La mètrica del concurs no és la del negoci; la complexitat es paga en producció; anonimitzar és difícil | Recomanador (cas 1): línia base col·laborativa, A/B sobre ingressos, compte amb les dades |
| Diagnòstic per imatge | CNN, transfer learning | 05-04 | 2 (dades), 5 (validació externa), 6 (flux) | Generalització entre centres, dreceres, grups infrarepresentats, el flux de treball decideix | Fotos d'incidències (cas 9): validar a Getafe i amb fotos de clients, control de qualitat d'imatge |
| AlphaGo / AlphaFold | Cerca + xarxes + reforç; atenció | 03-03, 04-02, 05-04, 05-05 | 1 (problema mesurable), 2 (dades existents) | Combinar tècniques; mesura clara; les dades acumulades durant dècades són l'actiu | Rutes (cas 5) amb temps apresos; desar bé les dades des d'avui |
| Selecció i scoring amb biaix | Classificació supervisada sobre decisions humanes | 02-03, 02-04, 04-02 | 1 (restriccions), 2 (etiqueta), 7 (equitat) | L'etiqueta hereta el biaix; treure la columna no n'hi ha prou; triar la definició d'equitat | Predictor (cas 3): paritat entre zones a la model card i al calendari |
| Assistents amb LLM | LLM + RAG + regles de validació | 05-05, 06-04 | 6 (abast, human-in-the-loop), 7 (mostreig) | L'al·lucinació és una propietat; l'empresa respon pel seu chatbot | Assistent (cas 7): només amb fonts, sense promeses, derivació a persona |
| Watson for Oncology / reconeixement facial | Sistema expert + PLN; CNN de rostres | 06-02, 05-04, 01-01, 02-04 | 2 (dades no representatives), 5 (validació externa), 1 (expectatives) | Dades hipotètiques o d'un sol grup; sobreexpectativa; de vegades no desplegar | Diagnòstic (cas 9): validar per magatzem, prometre poc, registrar correccions; biometria, no |
Errors Comuns i Consells
- Llegir els casos com a titulars. "La IA supera els metges" i "l'algorisme racista" amaguen fases concretes que van fallar o van funcionar; busca sempre la mètrica, les dades i el desplegament.
- Prendre les xifres de comunicats com a resultats. Distingeix el que s'ha publicat amb revisió per parells o auditoria del que anuncia l'empresa interessada.
- Creure que el biaix s'elimina traient una columna. L'exemple de la secció 8 ho desmenteix en cinc línies; mesura per grup sempre.
- Pensar que els fracassos són "d'altres" o "d'una altra època". Watson i el chatbot de l'aerolínia són històries de sobreexpectativa i d'abast mal acotat; es repeteixen cada any amb tecnologia nova.
- Copiar la tècnica sense copiar el context. AlphaFold va funcionar perquè hi havia dècades de dades públiques i una mètrica cega; sense això, la mateixa arquitectura no serveix.
- Consell: quan et proposin un projecte, busca el cas públic més semblant i llegeix com va acabar; després escriu el document de definició de 08-01 amb aquesta història al davant.
Exercicis
Exercici 1: fitxa d'un cas nou
Tria un cas públic d'IA que no sigui en aquesta lliçó (per exemple, un sistema de detecció de frau bancari, un vehicle autònom, un sistema d'ajuts socials que va generar reclamacions, o un model de predicció de demanda en una cadena de distribució) i omple la plantilla de la secció 1: context, problema, tècnica (amb la lliçó del curs), resultat, lliçons i paral·lel a NovaMarket. Assenyala explícitament quines parts de la teva fitxa són de domini públic i quines són suposicions teves.
Exercici 2: l'assistent que promet
Un client pregunta a l'assistent de NovaMarket: "Puc retornar la cafetera NovaBrew als 45 dies si no m'agrada?". La política real és de 30 dies. Descriu com hauria d'estar dissenyat l'assistent (RAG, regles de validació, derivació) perquè no pugui contestar "sí", què es registra d'aquesta conversa i quin punt del calendari de monitoratge de 08-01 detectaria una fallada si passés. Relaciona-ho amb el cas 5.
Exercici 3: reparar el biaix de l'exemple
Amb el codi de la secció 8, prova dues "reparacions" i mesura la ràtio d'impacte en cadascuna: (a) entrenar sense paraula_proxy (només amb experiencia); (b) mantenir les dues característiques però fixar el llindar de recomanació per grup de manera que les taxes s'igualin. Discuteix quin problema té cada solució i per què cap no substitueix la pregunta sobre l'etiqueta.
Solucions
Solució 1. No hi ha una resposta única; el criteri és que la fitxa separi fets de suposicions i enllaci cada element amb el curs. Exemple amb un sistema d'ajuts socials que va generar reclamacions: context: una administració va automatitzar la detecció de frau en prestacions; problema: classificar sol·licituds com a sospitoses (04-02); tècnica: model supervisat amb historial i dades demogràfiques, en què la nacionalitat o el codi postal van actuar com a proxies (02-04); resultat: milers de famílies assenyalades injustament, dimissions polítiques i sancions (de domini públic en el cas més conegut, tot i que els detalls tècnics del model es coneixen només parcialment); lliçons: etiqueta esbiaixada, alt risc sense revisió humana real, absència de dret a explicació; paral·lel: el predictor de devolucions mai no denega ni penalitza automàticament i mesura la paritat entre zones.
Solució 2. Disseny: l'assistent respon amb RAG sobre la política de devolucions (05-05); el fragment recuperat diu "30 dies", així que la resposta generada hauria de ser "no, el termini és de 30 dies", citant el fragment. Com que la generació pot fallar, una regla de validació (06-04) detecta que la resposta conté un termini ("45 dies") i comprova que aparegui al fragment recuperat; si no hi apareix, substitueix la resposta per la política literal o deriva a una persona. A més, qualsevol resposta que suposi una excepció o promesa ("sí que pots", "t'ho reemborsem") es bloqueja i crea un tiquet per a atenció al client. Es registra la pregunta, els fragments recuperats, la resposta generada, la validació aplicada i la resposta final, amb identificador de conversa. Ho detectaria el mostreig setmanal de converses revisades per atenció al client (fila afegida al calendari a la secció 6), i abans encara les proves adversàries prèvies al desplegament. És el cas 5 en petit: si l'assistent hagués dit "sí", NovaMarket hauria d'honorar-ho.
Solució 3. (a) Sense paraula_proxy, el model només fa servir l'experiència. En aquest conjunt fictici l'experiència es reparteix igual entre grups, així que les taxes de recomanació s'acosten i la ràtio d'impacte puja clarament (a l'entorn del curs: 30,7 % d'homes i 36,4 % de dones recomanats, ràtio 0,84, per sobre de 0,8; el petit desequilibri a favor de l'altre grup és atzar de la generació). Problema: en un cas real sempre queden altres proxies (nom del centre d'estudis, buits al CV, aficions) i no es poden treure tots; a més, si a l'històric les dones amb la mateixa experiència es contractaven menys, l'etiqueta continua esbiaixada encara que les característiques siguin neutres. (b) Llindars per grup: es tria, per a cada grup, el llindar de probabilitat que produeix la mateixa taxa de recomanació (per exemple, la del grup més afavorit); la ràtio d'impacte passa a valer 1 per construcció. Problema: s'està fent servir explícitament la característica protegida per decidir (cosa que en molts àmbits exigeix justificació legal i en altres està prohibida), i s'iguala una mètrica (paritat de taxes) a costa d'altres (calibració, taxes d'error), el dilema de COMPAS. Cap de les dues no toca la pregunta de fons: si contractat_historic reflecteix decisions esbiaixades, el model està aprenent a reproduir-les; la reparació real comença per decidir quina etiqueta és acceptable com a veritat (per exemple, rendiment posterior dels contractats, o avaluacions cegues), quina definició d'equitat s'adopta i quin paper té la revisió humana.
Conclusió
Sis casos, sis lliçons que ja coneixíem en teoria i que aquí tenen nom i factura. Del Netflix Prize i els recomanadors: la mètrica del concurs no és la del negoci, la complexitat es paga en producció i anonimitzar és difícil. Del diagnòstic per imatge: els models brillen al laboratori i ensopeguen en canviar d'hospital, de càmera o de to de pell, i el flux de treball decideix tant com l'AUC. D'AlphaGo i AlphaFold: combinar cerca, xarxes i reforç sobre problemes mesurables i amb dades acumulades durant dècades produeix impacte científic real, i tot i així és IA estreta. De la selecció amb biaix i COMPAS: l'etiqueta hereta el passat, treure la columna no n'hi ha prou, cal mesurar per grup i triar la definició d'equitat (ho hem reproduït en cinc línies: ràtio d'impacte 0,56 sense veure el gènere). Del chatbot de l'aerolínia: l'al·lucinació és una propietat, l'empresa respon pel que diu el seu assistent, i RAG amb validació i derivació humana és el disseny mínim. De Watson for Oncology i el reconeixement facial: dades que no representen la realitat d'ús, sobreexpectativa i absència de validació externa enfonsen projectes, i de vegades la decisió correcta és no desplegar. I per a NovaMarket, cada cas ha deixat una decisió concreta al recomanador, el classificador de fotos, les rutes, el predictor, l'assistent i el diagnòstic d'incidències.
Amb el mètode (08-01) i l'experiència aliena (08-02), queda mirar endavant: què està canviant en la IA ara mateix, què és sòlid i què és especulació, i què ha de preparar un professional júnior i una empresa com NovaMarket. És l'última lliçó del mòdul, 08-03, Tendències Futures en IA.
Fonaments d'Intel·ligència Artificial (IA)
Mòdul 1: Introducció a la Intel·ligència Artificial
Mòdul 2: Principis Bàsics de la IA
- Conceptes Fonamentals: Agents, Entorns i Racionalitat
- Tipus d'Intel·ligència Artificial
- Les Dades com a Matèria Primera de la IA
- Ètica i Consideracions en IA
Mòdul 3: Algorismes en IA
- Introducció als Algorismes
- Algorismes de Cerca
- Cerca amb Adversari: Jocs i Minimax
- Algorismes d'Optimització
Mòdul 4: Aprenentatge Automàtic (Machine Learning)
- Conceptes Bàsics de Machine Learning
- Tipus d'Aprenentatge Automàtic
- Preparació de Dades i Característiques
- Algorismes de Machine Learning
- Avaluació i Validació de Models
- Sobreajust, Regularització i Ajust d'Hiperparàmetres
Mòdul 5: Xarxes Neuronals i Deep Learning
- Introducció a les Xarxes Neuronals
- Arquitectura de Xarxes Neuronals
- Com Aprèn una Xarxa: Descens del Gradient i Retropropagació
- Deep Learning i les seves Aplicacions
- Transformers, Grans Models de Llenguatge i IA Generativa
Mòdul 6: Lògica i Sistemes Experts
- Lògica en IA
- Sistemes Experts
- Raonament amb Incertesa: Probabilitat i Xarxes Bayesianes
- Aplicacions dels Sistemes Experts
Mòdul 7: Eines i Llenguatges de Programació en IA
- Llenguatges de Programació per a IA
- Python Científic: NumPy, pandas i Matplotlib
- Eines i Llibreries Populars
- Entorns de Desenvolupament
Mòdul 8: Projectes i Casos d'Estudi
Mòdul 9: Exercicis i Pràctiques
- Exercicis d'Algorismes
- Pràctiques de Machine Learning
- Projectes de Xarxes Neuronals
- Projecte Integrador: de la Idea al Prototip
