NovaMarket té 8.000 empleats i, des de fa dos anys, un programa de benestar (fisioteràpia preventiva, pauses actives al magatzem, suport psicològic) gestionat conjuntament amb una asseguradora. L'asseguradora ha proposat avaluar-ne junts els resultats, i els seus informes parlen un idioma propi: prevalences, riscos relatius, odds ratios, sensibilitat dels cribratges, corbes de supervivència. És l'idioma de la bioestadística, i aquesta lliçó te l'ensenya a llegir amb les eines que ja tens — perquè gairebé tot és Bayes, taules 2×2, intervals i disseny d'experiments amb altres noms. L'objectiu no és que facis de sanitari: és que, com a analista, puguis col·laborar amb els qui ho són i llegir críticament un informe o un titular de salut.
Advertència important: les dades de salut són categoria especial sota el RGPD i qualsevol anàlisi sobre empleats exigeix base legal, anonimització i revisió prèvia pel delegat de protecció de dades i el servei de prevenció/mèdic. I les decisions sanitàries — diagnòstics, tractaments, cribratges — corresponen sempre a professionals sanitaris: aquesta lliçó ensenya a llegir l'evidència, mai a substituir-los.
Contingut
- Mesurar la malaltia: incidència vs prevalença
- La taula 2×2 del programa de benestar: risc relatiu i odds ratio
- Cribratges: sensibilitat, especificitat i l'engany dels positius
- Disseny d'estudis: la jerarquia de l'evidència
- Anàlisi de supervivència: llegir una corba de Kaplan-Meier
- Lectura crítica: titulars, riscos relatius i absoluts
Mesurar la malaltia: incidència vs prevalença
Primera distinció, i font inesgotable de confusions als informes:
- Prevalença: proporció de persones que tenen la condició en un moment donat. És una foto. Exemple: a l'enquesta de salut laboral, el 18 % del personal de magatzem declara dolor lumbar actualment.
- Incidència: ritme al qual apareixen casos nous entre els qui no la tenien. És una pel·lícula, i es mesura sobre temps d'observació: 6 episodis nous de lumbàlgia amb baixa per cada 100 persones-any al magatzem.
Es relacionen però no s'intercanvien: prevalença ≈ incidència × durada mitjana. Una condició crònica de llarga durada pot tenir incidència baixa i prevalença alta (diabetis); una grip, incidència altíssima i prevalença modesta en qualsevol foto. Conseqüència pràctica: un programa preventiu eficaç abaixa la incidència gairebé de seguida, però la prevalença pot trigar anys a notar-se (els casos ja existents continuen sent-hi) — jutjar la prevenció amb la foto equivocada la condemna injustament. El paral·lelisme amb el Club Nova és exacte: la taxa de baixes del 14 % anual és una incidència; el 64 % de socis actius, una prevalença.
La taula 2×2 del programa de benestar: risc relatiu i odds ratio
Dels 4.000 empleats de logística, 1.200 participen en el programa de fisioteràpia preventiva. Episodis de lumbàlgia amb baixa durant l'últim any:
| Lumbàlgia | Sense lumbàlgia | Total | Risc | |
|---|---|---|---|---|
| Participa | 60 | 1.140 | 1.200 | 5,0 % |
| No participa | 224 | 2.576 | 2.800 | 8,0 % |
| Total | 284 | 3.716 | 4.000 | 7,1 % |
Risc relatiu (RR)
El quocient de riscos (probabilitats condicionades, com a Regles de Probabilitat):
\[ RR = \frac{60/1,200}{224/2,800} = \frac{0{,}050}{0{,}080} = 0{,}625 \]
Els participants tenen un 62,5 % del risc dels no participants: una reducció relativa del 37,5 %. I en absolut: la reducció absoluta de risc és \(8{,}0 - 5{,}0 = 3\) punts percentuals, d'on surt el NNT (nombre necessari a tractar): \(1/0{,}03 \approx 34\) — cal incloure 34 empleats al programa per evitar un episodi l'any. El NNT és la traducció de l'eficàcia a recursos, l'equivalent sanitari de «passar l'efecte a euros».
Odds ratio (OR)
L'odds d'un succés és \(p/(1-p)\) — la forma «3 contra 1» de les apostes. L'OR compara odds:
\[ OR = \frac{60/1,140}{224/2,576} = \frac{0{,}0526}{0{,}0870} = 0{,}605 \]
Quan es fa servir cadascun?
| Risc relatiu | Odds ratio | |
|---|---|---|
| Interpretació | Directa («la meitat de risc») | Menys intuïtiva (odds, no probabilitats) |
| Requereix | Poder estimar incidències → estudis de cohorts i assaigs | Només la taula → també en casos i controls |
| Apareix a | Informes de cohorts, assaigs | Casos i controls i regressió logística |
| Amb esdeveniment rar | — | OR ≈ RR |
Aquí OR (0,605) i RR (0,625) gairebé coincideixen perquè la lumbàlgia amb baixa és relativament infreqüent; amb esdeveniments freqüents l'OR exagera respecte del RR i llegir-lo com si fos un RR és un error clàssic de titular. Ja coneixies l'OR sense saber-ho del tot: la regressió logística de baixes del Club Nova retornava OR = 0,30 per als socis actius — el mateix objecte, ara amb partida de naixement.
Una cautela abans de brindar: la participació al programa és voluntària. Això és un estudi observacional, i qui s'apunta a fisioteràpia preventiva potser ja es cuidava més (el «biaix de l'usuari sa») — la variable de confusió de la lliçó anterior en versió sanitària. El RR de 0,625 és prometedor, no probatori; a l'apartat de dissenys es veu què caldria per provar-ho.
Cribratges: sensibilitat, especificitat i l'engany dels positius
L'asseguradora ofereix un cribratge voluntari d'una condició metabòlica amb una prevalença en població treballadora del 0,8 %. La prova té:
- Sensibilitat = 90 %: \(P(\text{positiu} \mid \text{malalt})\) — de cada 100 malalts, en detecta 90.
- Especificitat = 95 %: \(P(\text{negatiu} \mid \text{sa})\) — de cada 100 sans, n'encerta 95 (i alarma en fals 5).
La pregunta que importa a qui rep el resultat és la inversa: «he donat positiu, estic malalt?» — és a dir, el valor predictiu positiu \(P(\text{malalt} \mid \text{positiu})\). Invertir condicionals és exactament el teorema de Bayes, i el mètode de la taula de freqüències naturals el fa transparent. Imagina 10.000 empleats cribrats:
| Positiu | Negatiu | Total | |
|---|---|---|---|
| Malalts (0,8 %) | 72 | 8 | 80 |
| Sans | 496 | 9.424 | 9.920 |
| Total | 568 | 9.432 | 10.000 |
\[ VPP = \frac{72}{568} \approx 12{,}7\ % \qquad VPN = \frac{9,424}{9,432} \approx 99{,}9\ % \]
Resultat contraintuïtiu i capital: amb una prova «del 90/95 %», gairebé 9 de cada 10 positius són falses alarmes, perquè la malaltia és rara: 496 sans alarmats aixafen els 72 malalts detectats. Per això:
- Els cribratges poblacionals encadenen una prova barata i sensible amb una prova de confirmació més específica per als positius.
- La mateixa prova rendeix diferent segons a qui s'aplica: en un grup d'alt risc amb prevalença del 10 %, el VPP puja a \(0{,}9 \times 0{,}10 / (0{,}9 \times 0{,}10 + 0{,}05 \times 0{,}90) = 66{,}7\ %\). La prevalença — la probabilitat a priori de Bayes — mana.
- Comunicar-ho malament genera angoixa i sobrediagnòstic; comunicar-ho bé («un positiu significa passar a la prova de confirmació, i la majoria es resolen en no res») és part del disseny del cribratge.
Disseny d'estudis: la jerarquia de l'evidència
Com s'arriba a saber si una cosa — el programa de fisioteràpia, un fàrmac — funciona? Tres grans dissenys, de menys a més control:
- Casos i controls (retrospectiu): es parteix del resultat — empleats amb lumbàlgia (casos) i sense (controls) — i es mira enrere quines exposicions van tenir. Ràpid i barat, ideal per a condicions rares; però viu amenaçat pel biaix de memòria i de selecció, i només pot estimar OR (com que ets tu qui fixa quants casos i controls reclutes, les incidències reals queden fora de l'abast).
- Cohorts (prospectiu): es parteix de l'exposició — participants i no participants — i se'ls segueix en el temps comptant casos nous. Permet incidències i RR; continua sent observacional: la confusió (l'usuari sa) no desapareix, només es pot ajustar pel que s'ha mesurat.
- Assaig controlat aleatoritzat (ACA): l'exposició s'assigna a l'atzar. L'aleatorització reparteix per igual els confusors — mesurats i no mesurats — entre els grups: és el test A/B d'Estadística als Negocis amb bata blanca, i l'únic disseny que autoritza la paraula «causa» sense nota al peu. Dos reforços propis de l'àmbit: el placebo (el grup de control rep una cosa indistingible, perquè la mera expectativa millora símptomes) i el doble cec (ni el participant ni l'avaluador no saben el grup, perquè l'esperança no contamini ni la resposta ni la mesura).
La jerarquia de l'evidència ordena la confiança: revisions sistemàtiques i metaanàlisis d'assaigs aleatoritzats > assaig aleatoritzat individual > cohorts > casos i controls > sèries de casos > opinió d'expert. No és un dogma — un assaig petit i maldestre pot valer menys que una cohort enorme i neta — però és el mapa per defecte. Per al programa de benestar, la proposta de l'equip a l'asseguradora va ser de manual: oferir la propera ampliació per sorteig entre els interessats (llista d'espera aleatoritzada), convertint l'expansió en un assaig aleatoritzat sense negar el programa a ningú.
Anàlisi de supervivència: llegir una corba de Kaplan-Meier
Els informes de l'asseguradora inclouen «corbes de supervivència sense episodi». Malgrat el nom, la tècnica serveix per al temps fins a qualsevol esdeveniment — mort, recaiguda, primera baixa... o la baixa d'un soci del Club Nova. La seva dificultat característica és la censura: empleats que deixen l'empresa a mig seguiment, o que arriben al final sense esdeveniment. No saps quan els hauria passat, però sí que no els va passar mentre els vas veure — llençar aquesta informació esbiaixaria el resultat, i l'estimador de Kaplan-Meier està construït per aprofitar-la.
La corba \(S(t)\) parteix d'1 (tothom sense esdeveniment) i baixa amb esglaons a cada esdeveniment observat. Lectura de la corba de l'informe (seguiment de 24 mesos, «supervivència sense episodi lumbar»):
| Mes | \(S(t)\) participants | \(S(t)\) no participants |
|---|---|---|
| 6 | 0,98 | 0,96 |
| 12 | 0,95 | 0,92 |
| 18 | 0,93 | 0,87 |
| 24 | 0,91 | 0,83 |
Claus de lectura:
- Altura en un instant: a 24 mesos, el 91 % dels participants continua sense episodi davant del 83 % — coherent amb el RR de la taula 2×2, però ara veient quan se separen (aquí, sobretot a partir del mes 12: la prevenció triga a rendir).
- Mediana de supervivència: l'instant en què la corba creua 0,50. Cap d'aquestes dues no ho fa en 24 mesos («mediana no assolida», bona notícia); la mediana de 25,5 h dels lliuraments era, en el fons, la mateixa idea.
- Comparació formal: el contrast habitual entre corbes és el log-rank (un parent del khi quadrat que compara esdeveniments observats i esperats a cada instant); queda't amb la idea que el seu valor p respon «són distingibles les corbes?» i que els models de regressió de supervivència (Cox) retornen hazard ratios, cosins del RR.
- Cues poc poblades: al final del seguiment queden pocs individus en risc i la corba es torna inestable; els informes seriosos imprimeixen a sota la taula de «pacients en risc» per aquest motiu.
Lectura crítica: titulars, riscos relatius i absoluts
Tanca la lliçó el múscul més transferible: llegir un titular de salut sense deixar-se arrossegar.
Titular: «Un complement redueix un 50 % el risc de certa complicació.» Lletra petita: la complicació passa de 2 casos a 1 per cada 10.000 persones-any.
- Reducció relativa: 50 %. Cert i espectacular.
- Reducció absoluta: 0,01 punts percentuals. \(NNT = 1/0{,}0001 = 10,000\) persones tractades un any per evitar un cas.
- Amb el preu del complement i els seus possibles efectes adversos multiplicats per 10.000, la decisió racional pot capgirar-se del tot. Regla: exigir sempre els riscos absoluts; el relatiu sol, sense base, és màrqueting.
Llista de comprovació ràpida davant de qualsevol afirmació de salut:
- Risc absolut i NNT, o només relatiu?
- Interval de confiança o només valor p? Un RR de 0,60 amb IC \((0{,}45;; 0{,}80)\) és un efecte sòlid; amb IC \((0{,}35;; 1{,}05)\) és un «potser» que creua l'1 (el RR nul). L'IC informa de magnitud i precisió; l'asterisc, de gairebé res — la vella lliçó de Proves d'Hipòtesis.
- Quin disseny? Un assaig aleatoritzat o una cohort amb confusors a l'aguait?
- Resultat principal preespecificat o troballa entre vint subgrups? (Amb 20 contrastos a \(\alpha = 0{,}05\), un surt tot sol — el problema de les comparacions múltiples.)
- En qui es va mesurar? Un efecte en homes de 60 anys amb patologia prèvia no s'extrapola a la plantilla d'un supermercat.
I l'advertència final, repetida a propòsit: aquest criteri serveix per llegir i per fer millors preguntes als professionals — no per automedicar-se ni per prendre decisions clíniques o organitzatives de salut sense ells.
Errors Comuns i Consells
- Confondre prevalença amb incidència. La foto no mesura el ritme: un programa preventiu s'avalua per incidència; jutjar-lo per prevalença a curt termini l'infravalora.
- Llegir un OR com si fos un RR. Només s'assemblen amb esdeveniments rars; amb esdeveniments freqüents l'OR exagera. Mira sempre quina mesura és i quina freqüència té l'esdeveniment.
- Oblidar la prevalença en interpretar un positiu. Sensibilitat i especificitat són propietats de la prova; el VPP depèn de a qui la fas. Amb prevalença baixa, la majoria de positius són falsos: taula de 10.000 i Bayes abans d'alarmar(-se).
- Donar per causal un estudi observacional. Participació voluntària = usuari sa = confusió. Pregunta sempre pel disseny abans que pel valor p.
- Comprar reduccions relatives sense base absoluta. «Redueix un 50 %» pot ser 2→1 per 10.000. Exigeix risc absolut i NNT.
- Ignorar la censura. Excloure de l'anàlisi qui va abandonar el seguiment esbiaixa les corbes; Kaplan-Meier existeix precisament per a això.
- Analitzar dades de salut com si fossin tiquets. Categoria especial del RGPD: anonimització, base legal i revisió per compliance i el servei mèdic abans de la primera consulta a la base de dades.
Exercicis
Exercici 1
En una cohort de 1.000 empleats d'oficina, 400 passen més de 9 hores asseguts (exposats) i 600 no. Episodis de dolor cervical durant l'any: 60 entre els exposats i 54 entre els no exposats. Calcula el risc de cada grup, RR, OR i la reducció/augment absolut. Per què s'assemblen RR i OR?
Exercici 2
Un cribratge té sensibilitat del 85 % i especificitat del 92 %, i la prevalença és del 2 %. Amb la taula de 10.000 persones, calcula el VPP i interpreta el resultat per a qui rep un positiu.
Exercici 3
Titular: «Un nou hàbit redueix un 40 % el risc de certa lesió». L'estudi: observacional, risc de 5 per 1.000 en no practicants davant de 3 per 1.000 en practicants, RR = 0,60 amb IC 95 % \((0{,}33;; 1{,}08)\). Fes-ne la crítica completa: absoluts, NNT, precisió i disseny.
Solucions
Exercici 1.
Riscos: \(60/400 = 15{,}0\ %\) i \(54/600 = 9{,}0\ %\). \(RR = 0{,}15/0{,}09 = 1{,}67\): un 67 % més de risc relatiu. \(OR = (60/340)/(54/546) = 0{,}1765/0{,}0989 = 1{,}78\). Augment absolut: 6 punts percentuals (equival a un «nombre necessari per danyar» de \(1/0{,}06 \approx 17\)). RR i OR s'assemblen (1,67 vs 1,78) perquè l'esdeveniment ronda el 10 %; ja s'aprecia que l'OR infla una mica més. Recordatori: és una cohort observacional — sedentarisme i dolor cervical comparteixen confusors (edat, lloc de treball, ergonomia) i aquest RR no prova causalitat.
Exercici 2.
De 10.000: 200 malalts → 170 positius vertaders, 30 falsos negatius; 9.800 sans → 784 falsos positius, 9.016 negatius vertaders. Positius totals: 954. \(VPP = 170/954 \approx 17{,}8\ %\). Interpretació: fins i tot amb un positiu, el més probable (82 %) és no tenir la condició; el resultat significa «passar a confirmació», no «diagnòstic». Error freqüent: respondre 85 % (la sensibilitat) — és la confusió de condicionals \(P(+\mid E) \neq P(E \mid +)\) que Bayes existeix per desfer.
Exercici 3.
(1) Absoluts: de 5 a 3 per 1.000 = reducció absoluta de 2 per 1.000; \(NNT = 1/0{,}002 = 500\) practicants-any per lesió evitada — el «40 %» relatiu era molt menys glamurós en absolut. (2) Precisió: l'IC \((0{,}33;; 1{,}08)\) creua l'1: les dades són compatibles tant amb una reducció notable com amb cap efecte (o un lleu augment); en termes de contrast, no significatiu al 5 %. (3) Disseny: observacional — els qui adopten l'hàbit probablement difereixen en tota la resta (usuari sa). Veredicte: hipòtesi interessant que demanarà un estudi millor, no un titular. Consell: aquesta tríada — absoluts, IC, disseny — desmunta o valida el 90 % dels titulars de salut.
Conclusió
Ja saps llegir l'idioma sanitari amb les teves pròpies eines: incidència i prevalença com a pel·lícula i foto; el RR de 0,625 del programa de benestar amb el seu NNT de 34, i l'OR com el parent que sobreviu en casos i controls i en la logística que ja vas fer servir; el cribratge on el 87 % dels positius eren falsos — Bayes en estat pur —; la jerarquia que corona l'assaig aleatoritzat (el teu test A/B amb placebo i doble cec); les corbes de Kaplan-Meier que respecten la censura; i la lectura crítica que exigeix absoluts i intervals abans de creure's un titular. I dos límits que no són opcionals: les dades de salut passen per compliance, i les decisions sanitàries, per professionals.
Amb això acaba el recorregut sectorial. Queda l'última peça del curs, la més pragmàtica de totes: amb quines eines — del full de càlcul a Python, passant per jamovi i la IA generativa — es fa tot això en el dia a dia, i com triar l'adequada per a cada tasca. És el tancament del viatge: Eines Estadístiques a la Pràctica.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
