Els intervals de confiança de la lliçó anterior ens van deixar afirmacions del tipus «la bretxa botiga vs en línia és entre 0,4 i 1 punt». En aquesta lliçó aprendrem l'altra gran maquinària de la inferència: les proves d'hipòtesis (o contrastos), el procediment formal per decidir entre dues afirmacions enfrontades — «el canvi no ha tingut efecte» davant de «sí que n'ha tingut» — amb un risc d'error conegut i controlat. Veurem la lògica del contrast (sorprenentment semblant a la d'un judici), el paper del valor p (la xifra més citada i pitjor entesa de tota l'estadística) i ho aplicarem a tres decisions reals de NovaMarket: si el nou disseny de l'app apuja el tiquet mitjà, si logística està incomplint el seu SLA de lliuraments, i si la satisfacció en línia és de debò pitjor que la de botiga.

Contingut

  1. La lògica del contrast: presumpció d'innocència
  2. Hipòtesi nul·la i alternativa; contrastos unilaterals i bilaterals
  3. El procediment en cinc passos: estadístic, α i regla de decisió
  4. Cas 1 — El nou disseny de l'app apuja el tiquet mitjà? (contrast z per a una mitjana)
  5. El valor p: interpretació correcta i males interpretacions cèlebres
  6. Cas 2 — S'està incomplint l'SLA de lliuraments? (contrast per a una proporció)
  7. Contrast t per a una mitjana i la connexió IC ↔ contrast
  8. Cas 3 — Botiga vs en línia (contrast per a dues mitjanes)
  9. Significació estadística vs rellevància pràctica

La lògica del contrast: presumpció d'innocència

Un contrast d'hipòtesis funciona exactament com un judici penal:

Al judici Al contrast
Presumpció d'innocència Hipòtesi nul·la \( H_0 \): «no hi ha efecte, no hi ha canvi»
Acusació Hipòtesi alternativa \( H_1 \): «sí que hi ha efecte»
Proves presentades Dades de la mostra
«Culpable més enllà de tot dubte raonable» Les dades són molt improbables si \( H_0 \) fos certa
Veredicte: culpable Rebutgem \( H_0 \)
Veredicte: no culpable No rebutgem \( H_0 \) — que no és el mateix que «innocència provada»

Tres idees clau de l'analogia:

  • La càrrega de la prova recau sobre l'alternativa. Partim de la base que el canvi no funciona, i només el donarem per bo si les dades li fan costat amb força. És un disseny deliberadament conservador: protegeix l'empresa de perseguir miratges.
  • Mai no «acceptem» \( H_0 \). Un veredicte de «no culpable» no certifica innocència; només diu que les proves no van ser suficients. Igualment, «no rebutjar \( H_0 \)» significa «les dades no basten per afirmar l'efecte», no «hem demostrat que no hi ha efecte».
  • «Més enllà de tot dubte raonable» necessita un llindar numèric. Aquest llindar serà \( \alpha \), el nivell de significació.

Hipòtesi nul·la i alternativa; contrastos unilaterals i bilaterals

  • \( H_0 \) (nul·la): l'afirmació d'statu quo, sempre amb el signe igual: \( \mu = \mu_0 \), \( p = p_0 \). És la que se sotmet a judici.
  • \( H_1 \) (alternativa): allò que volem detectar. La seva forma defineix el tipus de contrast:
Tipus \( H_1 \) Quan fer-lo servir Exemple NovaMarket
Unilateral dret \( \mu > \mu_0 \) Només interessa detectar pujades El redisseny de l'app apuja el tiquet?
Unilateral esquerre \( \mu < \mu_0 \) Només interessa detectar baixades Ha caigut la satisfacció després del canvi de proveïdor?
Bilateral \( \mu \neq \mu_0 \) Qualsevol desviació importa El pes real de les safates de 500 g difereix del que diu l'etiqueta?

Regla d'or: la direcció del contrast es decideix abans de mirar les dades, segons la pregunta de negoci — mai després, mirant cap a on va sortir la mostra (això infla artificialment els resultats, com veurem en parlar de p-hacking a la pròxima lliçó).

El procediment en cinc passos: estadístic, α i regla de decisió

Tot contrast segueix la mateixa litúrgia:

  1. Plantejar \( H_0 \) i \( H_1 \) (i decidir si és uni o bilateral).
  2. Fixar el nivell de significació \( \alpha \): la probabilitat màxima que acceptem de rebutjar \( H_0 \) sent certa (condemnar un innocent). Convencions habituals: 0,05 (estàndard), 0,01 (exigent), 0,10 (exploratori). Es fixa abans de veure les dades.
  3. Calcular l'estadístic de contrast: una mesura de discrepància entre allò observat i allò que \( H_0 \) prediu, en unitats d'error típic. Per a una mitjana és la puntuació z del Mòdul 2 aplicada a \( \bar{x} \): \[ z = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}} \qquad \text{o} \qquad t = \frac{\bar{x} - \mu_0}{s/\sqrt{n}} \] Es llegeix: «a quants errors típics és la meva mostra d'allò que diu la nul·la?».
  4. Decidir, per qualsevol d'aquestes dues vies equivalents:
    • Regió crítica: rebutjar si l'estadístic supera el valor crític de la taula (1,645 per a unilateral al 5 %; 1,96 per a bilateral al 5 %…).
    • Valor p: calcular la probabilitat d'un resultat tan extrem com l'observat, suposant certa \( H_0 \), i rebutjar si \( p < \alpha \).
  5. Concloure en llenguatge de negoci, no en argot: què s'ha decidit, amb quin risc, i què implica.

Cas 1 — El nou disseny de l'app apuja el tiquet mitjà? (contrast z per a una mitjana)

L'equip de producte va redissenyar la pantalla de pagament de l'app amb recomanacions personalitzades. El tiquet mitjà històric de NovaMarket és \( \mu_0 = 32{,}40 \) € amb \( \sigma = 21{,}50 \) € (Mòdul 2), i s'assumeix que el redisseny no canvia la dispersió. Després del llançament es pren una mostra aleatòria de \( n = 225 \) tiquets de l'app: \( \bar{x} = 34{,}60 \) €.

Pas 1. \( H_0: \mu = 32{,}40 \) (el redisseny no canvia res) davant de \( H_1: \mu > 32{,}40 \) (unilateral: només ens interessa la pujada).

Pas 2. \( \alpha = 0{,}05 \).

Pas 3. Error típic: \( 21{,}50/\sqrt{225} = 21{,}50/15 = 1{,}433 \) €. Estadístic:

\[ z = \frac{34{,}60 - 32{,}40}{1{,}433} = \frac{2{,}20}{1{,}433} \approx 1{,}53 \]

La mitjana mostral és 1,53 errors típics per sobre del que prediu la nul·la.

Pas 4. Valor crític unilateral al 5 %: 1,645. Com que \( 1{,}53 < 1{,}645 \), no rebutgem \( H_0 \). Per la via del valor p: \( p = P(Z \ge 1{,}53) = 1 - 0{,}9370 = 0{,}063 \) (taula Z del Mòdul 4). Com que \( 0{,}063 > 0{,}05 \), mateixa decisió.

Pas 5. Conclusió de negoci: «Els tiquets de la mostra pugen 2,20 € de mitjana, però amb 225 tiquets aquesta pujada és compatible amb l'atzar del mostreig (p = 0,063): no podem afirmar al 5 % que el redisseny augmenti el tiquet. Resultat prometedor però no concloent; recomanem ampliar la mostra abans d'estendre el disseny». Compte: no hem demostrat que el redisseny no funcioni — només que les proves encara no basten. La diferència entre «no detectat» i «no existeix» és el cor de la pròxima lliçó.

El valor p: interpretació correcta i males interpretacions cèlebres

Definició correcta: el valor p és la probabilitat d'obtenir un resultat tan extrem o més que l'observat, suposant que \( H_0 \) és certa. És una mesura de sorpresa: p petit = «si la nul·la fos veritat, veure això seria molt estrany» → desconfiem de la nul·la.

En el cas 1: si el redisseny no fes res, una mostra amb mitjana ≥ 34,60 € apareixeria el 6,3 % de les vegades per pur atzar. Estrany, però no estranyíssim.

Les males interpretacions del valor p són tan freqüents que l'Associació Americana d'Estadística va publicar el 2016 un comunicat oficial per combatre-les. Les quatre més cèlebres:

Mala interpretació Per què és falsa
«p = 0,063 és la probabilitat que \( H_0 \) sigui certa» El p es calcula suposant \( H_0 \) certa; no en pot mesurar la probabilitat. Mesura P(dades | H₀), no P(H₀ | dades) — la confusió de condicionades que ja vam desmuntar amb Bayes al Mòdul 3
«p = 0,04 significa que hi ha un 96 % de probabilitat que l'efecte sigui real» El mateix error, embolicat per a regal
«p > 0,05 demostra que no hi ha efecte» Només indica absència de proves suficients; potser la mostra era petita
«p = 0,049 és una troballa i p = 0,051 no és res» El 0,05 és una convenció, no una llei física; dos resultats gairebé idèntics no haurien de rebre veredictes oposats. Reporta sempre el p exacte

Consell professional: als informes, acompanya sempre el valor p de la mida de l'efecte (els 2,20 € de pujada) i, si pots, del seu interval de confiança. El p diu «fins a quin punt n'estem segurs»; l'efecte diu «quant importa».

Cas 2 — S'està incomplint l'SLA de lliuraments? (contrast per a una proporció)

L'SLA de NovaMarket Online promet que com a màxim el 10 % dels lliuraments supera les 48 hores (recordem: F(48) = 0,899 en el model del Mòdul 4, un ~10 % fora de termini). Operacions sospita que el nou operador logístic l'està incomplint. S'auditen \( n = 300 \) lliuraments: 39 fora de termini, és a dir, \( \hat{p} = 0{,}13 \).

Plantejament. \( H_0: p = 0{,}10 \) (es compleix l'SLA) davant de \( H_1: p > 0{,}10 \) (s'incompleix). \( \alpha = 0{,}05 \).

Estadístic. Amb proporcions, l'error típic es calcula amb el valor de la nul·la (\( p_0 \)), perquè el contrast es fa «com si \( H_0 \) fos certa»:

\[ z = \frac{\hat{p} - p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}} = \frac{0{,}13 - 0{,}10}{\sqrt{\dfrac{0{,}10 \times 0{,}90}{300}}} = \frac{0{,}03}{0{,}01732} \approx 1{,}73 \]

(Validesa: \( np_0 = 30 \) i \( n(1-p_0) = 270 \), tots dos ≥ 10, així que l'aproximació normal del Mòdul 4 és legítima.)

Decisió. \( 1{,}73 > 1{,}645 \): rebutgem \( H_0 \). Valor p: \( P(Z \ge 1{,}73) = 1 - 0{,}9582 = 0{,}042 < 0{,}05 \).

Conclusió de negoci: «Amb un 13 % de lliuraments fora de termini en 300 auditats, hi ha evidència significativa al 5 % que l'operador incompleix l'SLA del 10 % (p = 0,042). Recomanem activar la clàusula de revisió del contracte i repetir l'auditoria el mes que ve». Fixa't en la prudència: p = 0,042 és significatiu però no aclaparador; una segona auditoria protegeix la decisió.

Contrast t per a una mitjana i la connexió IC ↔ contrast

Quan \( \sigma \) és desconeguda (el cas normal), l'estadístic fa servir \( s \) i es compara amb la taula t amb \( n-1 \) graus de llibertat, exactament com en els intervals.

Exemple: la despesa del Club Nova contra l'objectiu. Finances va fixar fa anys un supòsit de planificació: «el soci mitjà gasta 120 € al mes». El desmenteixen les nostres dades (\( n = 60 \), \( \bar{x} = 126{,}40 \), \( s = 38{,}50 \), ET = 4,97)?

  • \( H_0: \mu = 120 \) davant de \( H_1: \mu \neq 120 \) (bilateral: ens importaria tant quedar-nos curts com passar-nos). \( \alpha = 0{,}05 \).
  • \( t = \dfrac{126{,}40 - 120}{4{,}97} = \dfrac{6{,}40}{4{,}97} \approx 1{,}29 \)
  • Crític bilateral: \( t_{0{,}025,,59} = 2{,}001 \). Com que \( |1{,}29| < 2{,}001 \), no rebutgem. (El p bilateral ronda el 0,20.)
  • Conclusió: «les dades són compatibles amb el supòsit de 120 €; no hi ha base per revisar el pla financer».

La connexió amb els intervals. A la lliçó anterior vam obtenir l'IC al 95 % de la despesa: [116,46; 136,34]. Fixa-t'hi: conté el 120, i el contrast bilateral al 5 % no rebutja \( \mu = 120 \). No és casualitat, és un teorema en miniatura:

Un contrast bilateral al nivell \( \alpha \) rebutja \( H_0: \mu = \mu_0 \) exactament quan \( \mu_0 \) queda fora de l'IC al \( (1-\alpha) \) de confiança.

L'interval és, literalment, «el conjunt de totes les nul·les que sobreviurien al contrast». Per això molts analistes prefereixen reportar l'IC: conté la mateixa decisió i a més la mida de l'efecte.

Cas 3 — Botiga vs en línia (contrast per a dues mitjanes)

Tanquem el cas obert a la lliçó anterior: satisfacció a botiga \( \bar{x}_1 = 8{,}3 \) (\( n_1 = 450 \), \( s_1 = 1{,}5 \)) davant del canal en línia \( \bar{x}_2 = 7{,}6 \) (\( n_2 = 190 \), \( s_2 = 1{,}9 \)). La Marta pregunta: «el canal en línia és realment pitjor, o és soroll?».

  • \( H_0: \mu_1 - \mu_2 = 0 \) davant de \( H_1: \mu_1 - \mu_2 \neq 0 \). \( \alpha = 0{,}05 \). (El plantegem bilateral: abans de veure les dades, la diferència podria haver anat en qualsevol sentit.)
  • Estadístic (mostres grans i independents; l'error típic de la diferència, 0,155, ja el vam calcular):

\[ z = \frac{(8{,}3 - 7{,}6) - 0}{\sqrt{\dfrac{1{,}5^2}{450} + \dfrac{1{,}9^2}{190}}} = \frac{0{,}70}{0{,}155} \approx 4{,}52 \]

  • Decisió: \( 4{,}52 \gg 1{,}96 \); el valor p bilateral és menor que 0,0001 (fora del rang de la taula Z: 4,52 errors típics és territori de «pràcticament impossible per atzar»).
  • Coherència amb l'IC: [0,40; 1,00] no contenia el zero — mateixa conclusió, com havia de ser.

Conclusió de negoci: «La diferència de 0,7 punts entre botiga i en línia és estadísticament inequívoca (p < 0,0001). El canal en línia té un problema real de satisfacció; proposem investigar-ne les causes — els terminis de lliurament del cas 2 són el primer sospitós».

Significació estadística vs rellevància pràctica

Última idea de la lliçó, i potser la més important per a un professional: significatiu no vol dir important. «Significatiu» només vol dir «difícil d'atribuir a l'atzar». Amb mostres enormes, efectes minúsculs i irrellevants surten significatius; amb mostres petites, efectes grans i valuosos poden no sortir-ne.

Situació p Efecte Lectura correcta
Enquesta a 500.000 clients: satisfacció 8,10 vs 8,13 0,001 0,03 punts Significatiu i irrellevant: ningú no nota 0,03 punts; no justifica cap acció
Cas 1 (app): +2,20 € de tiquet amb n = 225 0,063 +6,8 % del tiquet No significatiu però potencialment molt rellevant: mereix més mostra, no la paperera

El protocol professional: mirar sempre les dues coses — el valor p (és real?) i la mida de l'efecte amb el seu IC (quant és i quant importa?) — i traduir-les totes dues a l'idioma del negoci (euros, punts, clients). Decidir quanta mostra cal perquè un efecte rellevant resulti també detectable és exactament el problema de què s'ocupa la lliçó següent.

Errors Comuns i Consells

  • «Acceptar \( H_0 \)». No rebutjar no és acceptar. Escriu «no hi ha evidència suficient que…», mai «queda demostrat que no…». El cas de l'app n'és l'exemple canònic.
  • Triar la direcció del contrast després de veure les dades. Convertir un bilateral en unilateral a posteriori divideix el p per dos de manera tramposa. La hipòtesi es fixa abans de mirar.
  • Interpretar p com a P(H₀ certa). És P(dades tan extremes | H₀), i les condicionades no es capgiren de franc (Bayes, Mòdul 3).
  • Fer servir \( \hat{p} \) en lloc de \( p_0 \) en l'error típic del contrast de proporció. En el contrast, l'error típic es calcula sota la nul·la (\( p_0 \)); en l'interval, amb \( \hat{p} \). És la diferència operativa entre totes dues eines.
  • Tractar el 0,05 com una frontera sagrada. p = 0,049 i p = 0,051 diuen gairebé el mateix. Reporta el p exacte i l'efecte, i deixa que la decisió ponderi costos i context.
  • Ignorar la mida de l'efecte. Un asterisc de significació sense euros al darrere no hauria de moure cap decisió.

Exercicis

Exercici 1. Safates de fruita etiquetades «500 g». Una mostra de \( n = 49 \) safates dona \( \bar{x} = 493 \) g amb \( \sigma = 21 \) g (coneguda per l'històric de l'envasadora). Contrasta al 5 % si el pes mitjà difereix del que diu l'etiqueta (pensa primer si és uni o bilateral) i conclou en llenguatge de negoci.

Exercici 2. Màrqueting afirma que «més de la meitat» dels socis del Club Nova està activa. Amb la mostra de la lliçó 05-01 (\( n = 150 \), 96 actius, \( \hat{p} = 0{,}64 \)), contrasta \( H_0: p = 0{,}50 \) davant de \( H_1: p > 0{,}50 \) a l'1 %. Calcula l'estadístic, decideix i dona el valor p aproximat.

Exercici 3. Un analista escriu: «p = 0,20 en el contrast de la despesa vs 120 €, per tant hi ha un 80 % de probabilitat que la despesa mitjana sigui diferent de 120 €… no, espera, que sigui igual a 120 €». Explica per què totes dues lectures són errònies i dona la correcta. Després, sense calcular res de nou, digues què hauria passat amb el contrast si l'IC del 95 % hagués estat [121,3; 141,2].

Solucions

Solució 1. Bilateral (\( H_1: \mu \neq 500 \)): un pes de més costa marge i un pes de menys és un problema legal — totes dues desviacions importen. ET \( = 21/\sqrt{49} = 3 \) g. \( z = (493-500)/3 = -2{,}33 \). Com que \( |-2{,}33| > 1{,}96 \), es rebutja (p bilateral \( = 2 \times P(Z \le -2{,}33) = 2 \times 0{,}0099 \approx 0{,}02 \)). Conclusió: «les safates pesen de mitjana significativament menys del que diu l'etiqueta (uns 7 g, p ≈ 0,02); cal recalibrar l'envasadora i revisar el risc de reclamacions». Error freqüent: plantejar-lo unilateral esquerre perquè la mostra va sortir baixa — la direcció es decideix per la pregunta, no per les dades.

Solució 2. ET sota la nul·la: \( \sqrt{0{,}50 \times 0{,}50/150} = \sqrt{0{,}001667} = 0{,}0408 \). \( z = (0{,}64 - 0{,}50)/0{,}0408 \approx 3{,}43 \). Crític unilateral a l'1 %: 2,326. Com que \( 3{,}43 > 2{,}326 \), es rebutja; \( p = P(Z \ge 3{,}43) \approx 0{,}0003 \). Conclusió: evidència molt forta que més de la meitat dels socis està activa, fins i tot amb un α exigent. Error freqüent: fer servir \( \hat{p} = 0{,}64 \) en l'error típic (donaria 0,0392); en el contrast es fa servir \( p_0 = 0{,}50 \).

Solució 3. El valor p no és la probabilitat de cap hipòtesi: p = 0,20 significa que, si la despesa mitjana fos exactament 120 €, una desviació com l'observada (o més gran) apareixeria el 20 % de les vegades per atzar — massa sovint per descartar la nul·la. Ni «80 % que sigui diferent» ni «20 % que sigui igual». Amb un IC del 95 % de [121,3; 141,2], el 120 quedaria fora de l'interval, i per l'equivalència IC ↔ contrast bilateral, el contrast al 5 % hauria rebutjat \( H_0: \mu = 120 \). Error freqüent: oblidar que aquesta equivalència exigeix que coincideixin el nivell (95 % ↔ 5 %) i el caràcter bilateral.

Conclusió

Ja domines la maquinària de decisió de l'estadística: plantejar \( H_0 \) i \( H_1 \) (amb la càrrega de la prova sobre l'alternativa), fixar \( \alpha \) abans de mirar, mesurar la discrepància en errors típics (z o t, per a mitjanes i proporcions), traduir-la a un valor p ben interpretat i concloure en llenguatge de negoci — sabent que l'IC i el contrast bilateral són dues cares de la mateixa moneda, i que la significació estadística mai no substitueix la rellevància pràctica.

Però en aquesta lliçó hem conviscut amb dues incomoditats: en rebutjar \( H_0 \) podem estar condemnant un innocent, i en no rebutjar-la (com amb l'app) podem estar deixant escapar un culpable. Com es diuen aquests dos errors, quant costen, com s'equilibren i — la pregunta del milió — quanta mostra necessito perquè el meu contrast tingui potència de debò? Tot això, inclosa la promesa pendent del Mòdul 1 sobre el famós «uns 400 enquestats per a un ±5 %», es resol a Errors, Potència i Mida Mostral.

© Copyright 2026. Tots els drets reservats