La lliçó anterior ens va deixar dues incomoditats pendents: en rebutjar \( H_0 \) podem «condemnar un innocent», i en no rebutjar-la — com ens va passar amb el redisseny de l'app — podem «deixar escapar un culpable». Aquesta lliçó posa nom, número i preu a aquests dos errors (tipus I i tipus II), presenta la potència d'un contrast i respon la pregunta més pràctica de tota la inferència: quanta mostra necessito? Amb això saldarem la promesa que vam deixar al Mòdul 1 (aquell «uns 400 enquestats donen un ±5 %») i dimensionarem un projecte real: el pilot de la campanya de cupons que la Marta vol provar abans de llançar-la als 380.000 socis del Club Nova. Tanquem amb dos avisos de maduresa professional: el perill de les comparacions múltiples (p-hacking) i l'ètica de l'honestedat estadística.
Contingut
- Els dos errors possibles: tipus I (α) i tipus II (β)
- La potència (1 − β) i què l'augmenta
- La compensació entre α i β
- Mida mostral per estimar una mitjana amb un marge d'error donat
- Mida mostral per estimar una proporció: tancant la promesa del ~400
- Dimensionar el pilot de cupons: l'efecte mínim rellevant
- Comparacions múltiples i p-hacking
- L'ètica de l'honestedat estadística
Els dos errors possibles: tipus I (α) i tipus II (β)
Tot contrast acaba en una decisió (rebutjar o no rebutjar \( H_0 \)) presa sense conèixer la veritat. Creuant decisió i realitat surten quatre caselles:
| \( H_0 \) és certa (no hi ha efecte) | \( H_0 \) és falsa (sí que hi ha efecte) | |
|---|---|---|
| No rebutgem \( H_0 \) | Decisió correcta \( (1-\alpha) \) | Error de tipus II — probabilitat \( \beta \) |
| Rebutgem \( H_0 \) | Error de tipus I — probabilitat \( \alpha \) | Decisió correcta: potència \( (1-\beta) \) |
L'analogia clàssica és un detector d'incendis:
- Error de tipus I (falsa alarma): el detector sona sense foc. A NovaMarket: concloure que el redisseny de l'app apuja el tiquet quan en realitat no fa res → es desplega a tota la cadena un canvi inútil, amb el seu cost de desenvolupament i formació.
- Error de tipus II (incendi no detectat): hi ha foc i el detector calla. A NovaMarket: el redisseny sí que funcionava, però la nostra mostra de 225 tiquets no ho va detectar (et sona? p = 0,063) → s'arxiva una millora que valia diners.
Dos matisos importants:
- \( \alpha \) el tries tu en fixar el nivell de significació: és la taxa de falses alarmes que la teva regla de decisió tolera. Per això es fixa abans de mirar les dades.
- \( \beta \) no és un número únic: depèn de quin sigui l'efecte real. Si el redisseny apuja el tiquet 5 €, detectar-ho és fàcil i \( \beta \) és petita; si l'apuja 0,50 €, és dificilíssim i \( \beta \) és enorme. Per això β sempre es calcula «per a un efecte suposat».
La potència (1 − β) i què l'augmenta
La potència és la probabilitat de detectar un efecte quan realment existeix: la sensibilitat del detector d'incendis. Un contrast amb potència 0,80 (l'estàndard habitual a la pràctica) troba l'efecte 4 de cada 5 vegades que hi és; amb potència 0,30, la majoria dels efectes reals se li escapen — i l'estudi és, gairebé literalment, llençar els diners.
Quatre palanques augmenten la potència:
| Palanca | Per què funciona | Controlable? |
|---|---|---|
| Més mostra (\( n \uparrow \)) | Encongeix l'error típic: el mateix efecte sobresurt més del soroll | Sí — la palanca principal |
| Efecte real més gran | Un incendi gran es detecta abans que una brasa | No (és la realitat), però sí que decidim quin efecte mínim volem poder detectar |
| Menys dispersió (\( \sigma \downarrow \)) | Menys soroll de fons | De vegades: mesurar millor, segmentar poblacions homogènies |
| \( \alpha \) més lax (0,05 → 0,10) | Un detector més sensible salta amb menys fum | Sí, però a costa de més falses alarmes |
Rellegim el cas de l'app amb aquests ulls: amb \( n = 225 \), una pujada real d'1 € (efecte d'1/1,433 ≈ 0,7 errors típics) tindria una potència baixíssima — l'estudi va néixer gairebé incapaç de detectar efectes modestos. El «no significatiu» de la lliçó anterior era, en part, un problema de disseny, no de realitat. Moral de la història: la potència es decideix abans de recollir les dades, no es lamenta després.
La compensació entre α i β
Amb la mostra fixa, α i β són els dos plats d'una balança: si fas el criteri més exigent (abaixes α de 0,05 a 0,01 per protegir-te de falses alarmes), el llistó de rebuig puja i se t'escapen més efectes reals (puja β, baixa la potència). I a l'inrevés. És la sensibilitat del detector de fums: molt sensible = moltes falses alarmes; molt insensible = incendis sense detectar.
On posar l'equilibri? Depèn del cost relatiu de cada error, que és una decisió de negoci, no d'estadística:
| Decisió a NovaMarket | Error més car | α raonable |
|---|---|---|
| Retirar un producte per possible risc alimentari | Tipus II (no detectar el problema) | Lax (0,10) i fins i tot actuar amb indicis |
| Redissenyar tota la logística per un pilot | Tipus I (falsa alarma caríssima) | Exigent (0,01) |
| Test rutinari d'una promoció reversible | Cap no domina | Estàndard (0,05) |
L'única manera d'abaixar els dos errors alhora és més informació: augmentar \( n \). Cosa que ens porta a la pregunta estrella.
Mida mostral per estimar una mitjana amb un marge d'error donat
Per a estimació, el plantejament és directe: fixo el marge d'error \( E \) que tolero i aïllo \( n \) de la fórmula de l'interval. De \( E = z_{\alpha/2} \cdot \sigma/\sqrt{n} \):
\[ n = \left( \frac{z_{\alpha/2} \cdot \sigma}{E} \right)^{2} \]
Exemple: la despesa del Club Nova amb precisió de ±5 €. L'IC de la lliçó 05-02 va sortir [116,46; 136,34] — marge de ±9,94 €, que a Finances li sembla excessiu. Demanen ±5 € al 95 %. Fent servir com a \( \sigma \) la millor informació disponible (el \( s = 38{,}50 \) de l'estudi previ):
\[ n = \left( \frac{1{,}96 \times 38{,}50}{5} \right)^{2} = \left( \frac{75{,}46}{5} \right)^{2} = (15{,}09)^{2} \approx 227{,}8 ;\Rightarrow; n = 228 \]
(Sempre s'arrodoneix a l'alça: 227 socis no garanteixen el marge.) Quadruplicar aproximadament la mostra (de 60 a 228) per reduir el marge a la meitat — la llei de l'arrel quadrada una vegada més. I si demanessin ±2,50 €, sortiria \( n \approx 912 \): cada duplicació de precisió quadruplica el cost. Aquest càlcul converteix una conversa vaga («volem més precisió») en una decisió pressupostable («paguem 228 o 912 verificacions?»).
Mida mostral per estimar una proporció: tancant la promesa del ~400
Per a una proporció, aïllant del seu marge d'error:
\[ n = \frac{z_{\alpha/2}^{2} \cdot p(1-p)}{E^{2}} \]
Problema: necessitem \( p \)… que és just el que volem estimar. Dues sortides: fer servir una estimació prèvia si existeix, o posar-se en el pitjor cas, \( p = 0{,}5 \), que maximitza \( p(1-p) = 0{,}25 \) i garanteix el marge passi el que passi.
La promesa del Mòdul 1. Quan vam dissenyar l'enquesta de satisfacció vam dir que «uns 400 enquestats donen un marge de ±5 %». Ara ho podem demostrar. Amb confiança del 95 %, pitjor cas i \( E = 0{,}05 \):
\[ n = \frac{1{,}96^{2} \times 0{,}25}{0{,}05^{2}} = \frac{0{,}9604}{0{,}0025} = 384{,}2 ;\Rightarrow; n = 385 \approx 400 \]
Aquí teniu el famós ~400 de totes les enquestes electorals i estudis de mercat. La taula completa del pitjor cas, útil per pressupostar qualsevol enquesta:
| Marge desitjat (95 %) | \( n \) necessari (pitjor cas) |
|---|---|
| ±10 % | 97 |
| ±5 % | 385 |
| ±3 % | 1.068 |
| ±2 % | 2.401 |
| ±1 % | 9.604 |
Dues lectures valuoses: la precisió s'encareix quadràticament (de ±5 % a ±1 % la mostra es multiplica per 25), i — sorpresa habitual — la mida de la població gairebé no importa: 385 respostes donen ±5 % igual per als 9.500 socis de Cuenca que per als 380.000 del Club Nova (la correcció per població finita només ajuda quan es mostreja una fracció gran de la població, cosa rara a la pràctica). La sopa es tasta amb una cullera, tant si l'olla és gran com si és enorme.
Dimensionar el pilot de cupons: l'efecte mínim rellevant
Per a contrastos (no només estimar, sinó detectar un efecte), la mida mostral depèn de quatre ingredients que cal pactar abans de l'estudi: \( \alpha \), la potència desitjada, la dispersió \( \sigma \) i — la decisió més de negoci de totes — l'efecte mínim rellevant (EMR): l'efecte més petit que valdria la pena detectar.
El cas. Màrqueting vol llançar cupons personalitzats als 380.000 socis del Club Nova, però abans exigeix un pilot: grup amb cupó vs grup de control, comparant el tiquet mitjà (\( \mu_0 = 32{,}40 \) €, \( \sigma = 21{,}50 \) €). Finances calcula que la campanya només és rendible si apuja el tiquet almenys 1 €: aquest és l'EMR — pujades menors no paguen el cost dels descomptes.
Per comparar dos grups amb contrast bilateral, la fórmula operativa (que farem servir com a recepta, sense deduir-la) és:
\[ n_{\text{per grup}} \approx \frac{2,(z_{\alpha/2} + z_{\beta})^{2},\sigma^{2}}{\Delta^{2}} \]
on \( \Delta \) és l'EMR i \( z_{\beta} \) el valor z de la potència desitjada (potència 0,80 → \( z_{\beta} = 0{,}84 \), el P80 de la normal; potència 0,90 → 1,282, el nostre vell conegut P90).
Amb \( \alpha = 0{,}05 \) (bilateral, 1,96), potència 0,80 i \( \Delta = 1 \) €:
\[ n_{\text{per grup}} \approx \frac{2 \times (1{,}96 + 0{,}84)^{2} \times 21{,}50^{2}}{1^{2}} = \frac{2 \times 7{,}84 \times 462{,}25}{1} \approx 7.248 ;\Rightarrow; \text{uns } 7.250 \text{ socis per grup} \]
Lectura de negoci: el pilot necessita uns 14.500 socis (7.250 amb cupó, 7.250 de control) — perfectament viable sobre 380.000, però molt i molt lluny dels «500 i ja veurem» que proposava Màrqueting. Amb 500 per grup, la potència per detectar +1 € rondaria el 10 %: nou de cada deu vegades el pilot diria «no significatiu» encara que la campanya funcionés, condemnant una bona idea (l'error de disseny exacte que vam cometre amb l'app a la lliçó anterior). I si l'EMR fos de 2 €, la mostra cauria a \( 7.248/4 \approx 1.812 \) per grup: detectar efectes fins és caríssim; detectar efectes gruixuts, barat. L'EMR — quant ha de pujar el tiquet perquè ens importi — és la conversa que l'analista ha de forçar amb Finances abans de recollir ni una sola dada.
Comparacions múltiples i p-hacking
Un perill silenciós: cada contrast al 5 % és una loteria amb un 5 % de falses alarmes. Si fas molts contrastos, les falses alarmes s'acumulen.
Exemple domèstic: comparar la satisfacció de cadascuna de les 42 botigues de NovaMarket contra la mitjana de la cadena, al 5 %. Encara que cap botiga no fos realment diferent, esperaríem \( 42 \times 0{,}05 \approx 2 \) botigues «significatives» per pur atzar. La probabilitat d'almenys una falsa alarma seria \( 1 - 0{,}95^{42} \approx 0{,}88 \): un 88 %. El titular «Sevilla-Nervión destaca significativament» estaria gairebé garantit… i probablement buit.
La versió deliberada d'aquest fenomen s'anomena p-hacking: provar moltes variants (segments, mètriques, finestres temporals, treure «atípics») fins que alguna cosa creui el 0,05, i publicar només això. No cal mala fe — n'hi ha prou amb l'entusiasme del «continua buscant, que alguna cosa sortirà». Defenses bàsiques:
- Preregistrar la hipòtesi, la mètrica i l'anàlisi abans de mirar les dades (com vam fixar la direcció del contrast a la lliçó anterior).
- Distingir l'anàlisi confirmatòria (la hipòtesi pactada) de l'exploratòria (tota la resta: legítima, però s'etiqueta com a generadora d'hipòtesis i es reconfirma amb dades noves).
- Si fas moltes comparacions, ajusta el criteri (la correcció més simple, Bonferroni, reparteix α entre els contrastos: amb 42 botigues, exigir p < 0,05/42 ≈ 0,0012). El tractament seriós de comparar molts grups alhora arriba amb l'ANOVA a la lliçó Anàlisi de Variància.
L'ètica de l'honestedat estadística
Tanquem el mòdul amb allò que converteix la tècnica en professió. Qui domina la inferència pot, amb les mateixes dades, fabricar el titular que vulgui: triar el contrast a posteriori, tallar la mostra on convé, silenciar les anàlisis que no van sortir. Un analista honest s'obliga al contrari:
- Decidir abans de mirar: hipòtesi, α, mètrica i mida mostral es fixen per endavant; els canvis sobre la marxa es declaren.
- Reportar-ho tot: l'efecte amb el seu interval (no només el p), les anàlisis que no van sortir significatives, el nombre de comparacions intentades i les limitacions de la mostra (els biaixos del Mòdul 1 no els cura cap valor p).
- No confondre qui decideix: traduir a euros i punts, distingir «no detectat» de «no existeix», i resistir la pressió del «troba'm un p < 0,05 per al comitè».
La credibilitat de l'equip d'anàlisi és el seu únic actiu real: es construeix informe a informe i es perd amb un sol titular inflat. Com resumeix la Marta: «prefereixo un "encara no ho sabem, necessitem 7.250 per grup" que un "funciona!" que s'ensorri en el desplegament».
Errors Comuns i Consells
- Confondre els tipus d'error. Truc mnemotècnic: tipus I = falsa alarma (rebutges sense raó; la seva probabilitat és l'α que tu fixes); tipus II = incendi no detectat (no rebutges quan tocava; probabilitat β).
- Creure que β és fix. La potència sempre és «potència per detectar un efecte de tal mida»; exigeix preguntar «potència contra quin efecte?» en qualsevol estudi que et presentin.
- Interpretar «no significatiu» sense mirar la potència. Amb potència baixa, un p > 0,05 no diu gairebé res — l'estudi no podia detectar l'efecte ni que existís. Abans d'arxivar una idea, comprova amb quina potència es va testar.
- Arrodonir n a la baixa o oblidar el pitjor cas en proporcions. El n calculat és un mínim: sempre a l'alça. I sense estimació prèvia de p, fes servir 0,5.
- Dimensionar per a l'efecte esperat en lloc del mínim rellevant. El pilot no es dissenya per a l'efecte que somies (+3 €), sinó per al mínim que justificaria actuar (+1 €); si no, un resultat «no significatiu» no et deixarà distingir «no arriba al llindar» de «no ho vam poder veure».
- Mirar vint talls i reportar el que va sortir. Si has provat 20 segments, un sortirà significatiu per atzar gairebé segur. Declara quantes comparacions vas fer o ajusta el criteri.
Exercicis
Exercici 1. El control de qualitat de NovaMarket contrasta cada lot de fruita (\( H_0 \): el lot compleix la norma) amb α = 0,05. (a) Descriu en paraules del negoci l'error de tipus I i el de tipus II d'aquest contrast i qui «paga» cadascun. (b) Si el proveïdor és nou i hi ha dubtes seriosos sobre la seva fiabilitat, mouries α cap a 0,01 o cap a 0,10? Raona-ho amb la balança α↔β.
Exercici 2. Recursos Humans vol estimar la proporció d'empleats interessats en el nou pla de torns amb un marge de ±4 % al 95 %, sense cap estimació prèvia. (a) Calcula el n necessari. (b) Un directiu objecta: «som 6.000 empleats, no els 380.000 del Club Nova; en necessitarem molts menys». Té raó?
Exercici 3. Per al pilot de cupons, Finances canvia l'efecte mínim rellevant d'1 € a 1,50 €, mantenint α = 0,05 (bilateral), potència 0,80 i σ = 21,50 €. Recalcula el n per grup i explica per què el resultat no és «dos terços» de l'original.
Solucions
Solució 1. (a) Tipus I: rebutjar un lot que en realitat complia la norma — falsa alarma; el paga l'empresa (fruita malbaratada, conflicte amb el proveïdor). Tipus II: acceptar un lot defectuós — incendi no detectat; el paguen el client i la marca (reclamacions, risc sanitari). (b) Cap a 0,10: amb un proveïdor dubtós, l'error car és el de tipus II, així que convé un detector més sensible — més falses alarmes a canvi que es coli menys fruita dolenta; α = 0,01 faria just el contrari. Error freqüent: pensar que «més exigent» (α menor) sempre protegeix més; protegeix contra el tipus I, però desprotegeix contra el tipus II.
Solució 2. (a) \( n = \dfrac{1{,}96^{2} \times 0{,}25}{0{,}04^{2}} = \dfrac{0{,}9604}{0{,}0016} = 600{,}25 \Rightarrow n = 601 \). (b) No: el n depèn del marge, la confiança i \( p(1-p) \), no de la mida de la població — 601 respostes donen ±4 % igual per a 6.000 que per a 380.000 (la correcció per població finita amb prou feines rebaixaria la xifra aquí, i només importa quan es mostreja una fracció gran de la població). Error freqüent: dividir n en proporció a la mida poblacional; la precisió la dona la cullera, no l'olla.
Solució 3. \( n = \dfrac{2 \times (1{,}96 + 0{,}84)^{2} \times 21{,}50^{2}}{1{,}50^{2}} = \dfrac{7.248{,}1}{2{,}25} \approx 3.221 \Rightarrow \) uns 3.225 socis per grup (~6.450 en total). No és dos terços de 7.250, sinó menys de la meitat, perquè \( \Delta \) entra al quadrat en el denominador: relaxar l'efecte detectable un 50 % divideix la mostra per \( 1{,}5^{2} = 2{,}25 \). Error freqüent: escalar linealment amb \( \Delta \); la relació és quadràtica, i és la raó que els efectes fins siguin tan cars de demostrar.
Conclusió
El mòdul d'inferència queda complet. Sabem estimar paràmetres i mesurar la precisió de l'estimació (05-01), embolcallar-la en intervals amb garanties (05-02), sotmetre afirmacions a contrast amb el valor p ben entès (05-03) i, en aquesta lliçó, gestionar els dos errors possibles — falsa alarma (α) i incendi no detectat (β) —, exigir potència als nostres estudis i calcular la mostra necessària: 228 socis per a la despesa a ±5 €, els 385 que expliquen el mític «~400 per a ±5 %» promès al Mòdul 1, i 7.250 per grup perquè el pilot de cupons pugui detectar l'euro que el fa rendible. I, sobretot, hem après que l'honestedat estadística — decidir abans de mirar, reportar-ho tot, no torturar les dades — val més que qualsevol fórmula.
Fins aquí hem inferit sobre una variable cada vegada: una mitjana, una proporció, una diferència. Però les preguntes més sucoses de NovaMarket relacionen variables entre si: venen més les botigues amb més trànsit? Puja la satisfacció quan baixa el temps de lliurament? Mesurar la força d'aquestes relacions — i no confondre correlació amb causalitat — és el punt de partida del Mòdul 6, que arrenca amb l'Anàlisi de Correlació.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
