A la lliçó d'Errors, Potència i Mida Mostral vam deixar un deute pendent: quan vam voler comparar les 42 botigues de NovaMarket a base de contrastos t de dues en dues, vam descobrir que multiplicar comparacions dispara la probabilitat de falses alarmes, i vam prometre una eina que compara molts grups alhora amb un únic contrast. Aquesta eina és l'Anàlisi de la Variància (ANOVA, per ANalysis Of VAriance), i la seva lògica és una paradoxa elegant: per comparar mitjanes, analitza variàncies — en concret, compara quant varien els grups entre si amb quant varia la gent dins de cada grup. En aquesta lliçó construirem aquesta lògica des de zero, calcularem a mà una taula ANOVA completa amb dades de satisfacció de tres formats de botiga, aprendrem a llegir la taula de la distribució F, repassarem els supòsits del mètode i veurem què cal fer després de rebutjar: les comparacions post-hoc i la mida de l'efecte.
Contingut
- Per què no fer molts contrastos t: el deute del Mòdul 5
- La lògica de l'ANOVA: variabilitat entre grups vs dins dels grups
- Hipòtesis i dades del cas: satisfacció en tres formats de botiga
- La taula ANOVA pas a pas: SC, gl, QM i F
- La distribució F i com llegir-ne la taula
- Supòsits de l'ANOVA (versió operativa)
- Després de rebutjar: comparacions post-hoc (Tukey i Bonferroni)
- Com de gran és l'efecte? Eta quadrat
- Fins on arriba aquesta lliçó: dos factors i alternatives no paramètriques
Per què no fer molts contrastos t: el deute del Mòdul 5
La Marta vol saber si la satisfacció del client depèn del format de botiga. NovaMarket opera tres formats: Express (urbà, petit), Estàndard (supermercat de barri) i Gran Superfície. Comparar tres grups amb contrastos t exigeix tres comparacions (Express–Estàndard, Express–Gran Superfície, Estàndard–Gran Superfície), i ja sabem què significa això: si cada contrast té un 5 % de risc de falsa alarma, la probabilitat que almenys una de les tres doni un fals positiu és
\[ 1 - 0{,}95^3 = 1 - 0{,}857 = 0{,}143 \]
un 14,3 % — gairebé el triple del 5 % pactat. Amb més grups el problema explota (recordem l'experiment mental de les 42 botigues del Mòdul 5, amb un 88 % de probabilitat d'alguna falsa alarma). L'ANOVA resol el problema d'arrel: planteja una única hipòtesi global amb un únic α:
- \( H_0: \mu_{\text{Express}} = \mu_{\text{Estàndard}} = \mu_{\text{Gran Sup.}} \) — totes les mitjanes són iguals; el format no hi influeix
- \( H_1: \) almenys una mitjana és diferent
Atenció al matís de \( H_1 \): rebutjar \( H_0 \) diu que «no totes són iguals», no quines difereixen. Aquest segon pas vindrà després, amb les comparacions post-hoc.
La lògica de l'ANOVA: variabilitat entre grups vs dins dels grups
Com es detecta amb variàncies si unes mitjanes difereixen? Pensa en dos escenaris amb les mateixes tres mitjanes mostrals (7, 8 i 9):
- Escenari A: dins de cada format, les botigues puntuen gairebé idèntic (totes les Express entre 6,8 i 7,2…). Les diferències entre els grups (7 vs 8 vs 9) destaquen nítides sobre aquest silenci intern: semblen reals.
- Escenari B: dins de cada format hi ha de tot (botigues Express entre 4 i 10…). Unes mitjanes de 7, 8 i 9 podrien ser perfectament fruit de l'atzar mostral: el senyal s'ofega en el soroll.
L'ANOVA formalitza aquesta intuïció amb un quocient senyal/soroll:
\[ F = \frac{\text{variabilitat ENTRE grups (senyal: allò que separa les mitjanes)}}{\text{variabilitat DINS dels grups (soroll: allò que varia la gent per atzar)}} \]
- Si \( H_0 \) és certa, totes dues variabilitats estimen el mateix (la variància natural de la població) i F rondarà el valor 1.
- Si algun grup té una mitjana diferent, la variabilitat entre s'infla i F creix molt per sobre d'1.
La pregunta «quant ha de valer F per rebutjar?» la respondrà la distribució F. Abans, els càlculs.
Hipòtesis i dades del cas: satisfacció en tres formats de botiga
L'equip de la Marta pren una mostra de 5 botigues de cada format i calcula la satisfacció mitjana dels clients de cada botiga (escala 0–10, arrodonida a enters per al càlcul a mà):
| Format | Puntuacions | Suma | Mitjana \( \bar{x}_j \) |
|---|---|---|---|
| Express | 7, 8, 6, 7, 7 | 35 | 7,0 |
| Estàndard | 8, 9, 8, 7, 8 | 40 | 8,0 |
| Gran Superfície | 9, 8, 9, 10, 9 | 45 | 9,0 |
En total \( N = 15 \) observacions, \( k = 3 \) grups, i la mitjana global és \( \bar{x} = (35+40+45)/15 = 120/15 = 8{,}0 \). Les mitjanes mostrals difereixen (7, 8, 9), però ja sabem que això sol no basta: cal pesar el senyal contra el soroll.
La taula ANOVA pas a pas: SC, gl, QM i F
El cor de l'ANOVA és la mateixa descomposició de variabilitat que vam veure a la regressió: la suma de quadrats total es parteix en dos trossos.
\[ \underbrace{\sum_{j}\sum_{i} (x_{ij} - \bar{x})^2}{\text{SC Total}} ;=; \underbrace{\sum{j} n_j (\bar{x}j - \bar{x})^2}{\text{SC Entre}} ;+; \underbrace{\sum_{j}\sum_{i} (x_{ij} - \bar{x}j)^2}{\text{SC Dins}} \]
Pas 1 — SC Entre (cada mitjana de grup davant de la global, ponderada per la seva mida):
\[ \text{SC}_{\text{Entre}} = 5(7-8)^2 + 5(8-8)^2 + 5(9-8)^2 = 5 + 0 + 5 = 10 \]
Pas 2 — SC Dins (cada observació davant de la mitjana del seu grup):
| Format | Desviacions respecte de la seva mitjana | Quadrats | Suma |
|---|---|---|---|
| Express (mitjana 7) | 0, +1, −1, 0, 0 | 0, 1, 1, 0, 0 | 2 |
| Estàndard (mitjana 8) | 0, +1, 0, −1, 0 | 0, 1, 0, 1, 0 | 2 |
| Gran Sup. (mitjana 9) | 0, −1, 0, +1, 0 | 0, 1, 0, 1, 0 | 2 |
\[ \text{SC}{\text{Dins}} = 2 + 2 + 2 = 6 \qquad\qquad \text{SC}{\text{Total}} = 10 + 6 = 16 ; \checkmark \]
Pas 3 — Graus de llibertat. Entre: \( k - 1 = 2 \). Dins: \( N - k = 12 \). (Total: \( N - 1 = 14 = 2 + 12 \), la comprovació de sempre.)
Pas 4 — Quadrats mitjans: cada SC dividida pels seus gl, cosa que la converteix en una variància comparable:
\[ \text{QM}{\text{Entre}} = \frac{10}{2} = 5{,}0 \qquad\qquad \text{QM}{\text{Dins}} = \frac{6}{12} = 0{,}5 \]
Pas 5 — L'estadístic F i la taula completa, en el format estàndard amb què la presenta qualsevol informe o programa:
| Font de variació | SC | gl | QM | F |
|---|---|---|---|---|
| Entre grups (format) | 10 | 2 | 5,0 | 10,0 |
| Dins dels grups (residual) | 6 | 12 | 0,5 | |
| Total | 16 | 14 |
El senyal és deu vegades el soroll. És prou per rebutjar?
La distribució F i com llegir-ne la taula
Sota \( H_0 \), el quocient \( F = \text{QM}{\text{Entre}}/\text{QM}{\text{Dins}} \) segueix la distribució F (de Fisher), que és nova al curs, així que presentem-la bé:
- És la distribució d'un quocient de dues variàncies: només pren valors positius i és asimètrica amb cua a la dreta.
- Depèn de dos graus de llibertat: els del numerador (entre grups, aquí 2) i els del denominador (dins, aquí 12). S'escriu \( F_{2;,12} \).
- El contrast és sempre unilateral dret: només els F grans (molt senyal davant del soroll) desmenteixen \( H_0 \).
Com llegir la taula F: a diferència de la taula t (una fila per gl), la taula F és una graella de doble entrada per a un α fix (hi ha una taula per a α = 0,05, una altra per a 0,01…). A la taula d'α = 0,05: busca la columna dels gl del numerador (2) i la fila dels gl del denominador (12); l'encreuament dona el valor crític. Un extracte:
| gl denominador \ gl numerador | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| 10 | 4,96 | 4,10 | 3,71 | 3,48 |
| 12 | 4,75 | 3,89 | 3,49 | 3,26 |
| 14 | 4,60 | 3,74 | 3,34 | 3,11 |
El crític és \( F_{0{,}05;,2;,12} = 3{,}89 \). Com que el nostre \( F = 10{,}0 > 3{,}89 \), rebutgem \( H_0 \) al 5 % (de fet també a l'1 %: \( F_{0{,}01;,2;,12} = 6{,}93 \); el valor p és < 0,01). Conclusió per a la Marta: la satisfacció no és la mateixa en els tres formats — el format de botiga importa. Compte amb l'ordre dels gl: \( F_{2;12} \neq F_{12;2} \); el numerador sempre primer.
Supòsits de l'ANOVA (versió operativa)
Com tot contrast, l'ANOVA es recolza en supòsits. En versió pràctica:
| Supòsit | Què exigeix | Com comprovar-ho a la pràctica |
|---|---|---|
| Independència | Les observacions no s'influeixen entre si | Es garanteix en el disseny: mostreig aleatori, botigues diferents, sense mesurar dues vegades el mateix client. És el supòsit més important i l'únic irreparable |
| Normalitat | Les dades de cada grup provenen de poblacions ~normals | Histogrames/boxplots per grup sense asimetries salvatges. Amb grups grans, el TCL del Mòdul 4 relaxa molt aquesta exigència |
| Homogeneïtat de variàncies (homoscedasticitat) | Les variàncies dels grups són similars | Regla ràpida: la desviació típica més gran no hauria de doblar la més petita. Aquí les tres variàncies mostrals són idèntiques (0,5): impecable |
Si la normalitat falla greument amb mostres petites, o les dades són ordinals, existeix una alternativa per rangs (la prova de Kruskal-Wallis), que veurem entre els Mètodes No Paramètrics.
Després de rebutjar: comparacions post-hoc (Tukey i Bonferroni)
L'F significatiu diu «no totes les mitjanes són iguals», però la Marta preguntarà de seguida: «quines difereixen?». Respondre exigeix tornar a les comparacions per parelles — però ara amb protecció contra la inflació de l'error de tipus I. Les dues estratègies més comunes:
- Correcció de Bonferroni (ja la coneixem del Mòdul 5): repartir α entre les \( m \) comparacions, exigint a cadascuna \( \alpha' = \alpha/m \). Amb 3 comparacions, \( \alpha' = 0{,}05/3 = 0{,}0167 \). Senzilla i vàlida sempre, tot i que conservadora.
- Prova HSD de Tukey: dissenyada específicament per a «totes les parelles després d'un ANOVA». Calcula una diferència mínima honesta (HSD) a partir del QM Dins i del nombre de grups: qualsevol parella de mitjanes que difereixi més que l'HSD es declara diferent, mantenint el 5 % d'error global per al conjunt de comparacions. És l'opció estàndard dels programes estadístics i una mica més potent que Bonferroni en aquest ús.
Apliquem Bonferroni al nostre cas. L'error típic d'una diferència de mitjanes, fent servir el QM Dins com a variància comuna, és
\[ \text{ET} = \sqrt{\text{QM}_{\text{Dins}}\left(\tfrac{1}{n_1}+\tfrac{1}{n_2}\right)} = \sqrt{0{,}5 \times \tfrac{2}{5}} = \sqrt{0{,}2} = 0{,}447 \]
| Comparació | Diferència | t = dif/ET | Crític Bonferroni \( t_{0{,}0167/2;,12} \approx 2{,}78 \) | Conclusió |
|---|---|---|---|---|
| Express vs Gran Superfície | 2,0 | 4,47 | 2,78 | Difereixen |
| Express vs Estàndard | 1,0 | 2,24 | 2,78 | No concloent |
| Estàndard vs Gran Superfície | 1,0 | 2,24 | 2,78 | No concloent |
(Tukey arriba aquí a la mateixa conclusió.) El resultat és molt instructiu: l'ANOVA global és rotund, i el post-hoc localitza amb claredat la diferència entre els formats extrems (Express vs Gran Superfície), mentre que les diferències d'1 punt entre formats veïns, amb només 5 botigues per grup, no assoleixen la significació corregida — són suggerents, però caldrien més botigues per confirmar-les (potència, com vam veure a 05-04). Informe honest per a la Marta: «el format influeix en la satisfacció; la bretxa demostrada és entre Express (7,0) i Gran Superfície (9,0); les comparacions intermèdies apunten en la mateixa direcció però requereixen més mostra».
Com de gran és l'efecte? Eta quadrat
Significatiu, sí — però important? Igual que al Mòdul 5 vam distingir significació de rellevància, l'ANOVA té la seva mesura de mida de l'efecte: eta quadrat, la proporció de la variabilitat total atribuïble al factor:
\[ \eta^2 = \frac{\text{SC}{\text{Entre}}}{\text{SC}{\text{Total}}} = \frac{10}{16} = 0{,}625 \]
El format de botiga explica el 62,5 % de la variabilitat de la satisfacció a la mostra — un efecte gran (orientativament: ~0,01 petit, ~0,06 mitjà, ~0,14 gran). Fixa't en el paral·lelisme exacte amb l'R² de la regressió: mateix concepte, factor categòric en lloc de variable contínua.
Fins on arriba aquesta lliçó: dos factors i alternatives no paramètriques
El que hem construït aquí és l'ANOVA d'un factor (una sola variable d'agrupació). Existeix l'ANOVA de dos factors, que analitza simultàniament, per exemple, format i regió — inclosa la possibilitat d'interacció (que l'efecte del format sigui diferent segons la regió) —; la seva mecànica estén la mateixa descomposició de sumes de quadrats i queda fora del nostre abast introductori. I quan els supòsits no s'aguanten, l'alternativa per rangs (Kruskal-Wallis) espera als Mètodes No Paramètrics.
Errors Comuns i Consells
- Fer contrastos t per parelles sense correcció en lloc d'un ANOVA (o després d'un). És la fàbrica de falses alarmes del Mòdul 5; l'ANOVA existeix precisament per evitar-la.
- Interpretar el rebuig com a «totes les mitjanes difereixen». \( H_1 \) només afirma que almenys una difereix; sense post-hoc no saps quina. I al revés: no rebutjar no demostra que siguin iguals.
- Invertir els graus de llibertat en llegir la taula F. \( F_{2;12} = 3{,}89 \) però \( F_{12;2} = 19{,}4 \): numerador (entre) primer, sempre.
- Buscar la cua esquerra. El contrast F de l'ANOVA és unilateral dret; un F proper a 0 no «demostra igualtat», només indica grups anormalment semblants (a vegades, símptoma de dades manipulades o dependents).
- Oblidar comprovar les variàncies. Si un grup té una dispersió molt més gran (regla ràpida: s màxima > 2 × s mínima), l'F perd fiabilitat; considera transformar les dades o el mètode no paramètric.
- Quedar-se en el valor p sense mida de l'efecte. Amb mostres enormes, diferències trivials donen F significatius. Acompanya sempre el veredicte amb \( \eta^2 \) i amb les mitjanes dels grups en unitats reals.
Exercicis
Exercici 1. Operacions prova tres configuracions de personal de caixa i mesura el temps mitjà d'espera (minuts) en 4 botigues per configuració:
| Configuració | Temps | Mitjana |
|---|---|---|
| A (actual) | 4, 5, 6, 5 | 5 |
| B (reforç hora punta) | 6, 7, 7, 8 | 7 |
| C (caixa ràpida) | 5, 6, 6, 7 | 6 |
Construeix la taula ANOVA completa i decideix al 5 % si la configuració hi influeix (\( F_{0{,}05;,2;,9} = 4{,}26 \)). Calcula també \( \eta^2 \).
Exercici 2. Un analista júnior, en lloc de l'ANOVA de l'exercici 1, executa els tres contrastos t possibles al 5 % i presenta com a troballa l'únic que va sortir significatiu. Explica els dos errors metodològics i calcula la probabilitat d'almenys una falsa alarma en el seu enfocament suposant que \( H_0 \) fos certa en les tres comparacions.
Exercici 3. D'un informe arriba aquesta taula ANOVA incompleta sobre la despesa mitjana dels socis del Club Nova en 4 segments d'antiguitat (6 socis per segment, N = 24):
| Font | SC | gl | QM | F |
|---|---|---|---|---|
| Entre grups | 90 | ? | ? | ? |
| Dins dels grups | ? | ? | ? | |
| Total | 210 | ? |
Completa les caselles i decideix al 5 % (\( F_{0{,}05;,3;,20} = 3{,}10 \)).
Solucions
Exercici 1. Mitjana global = (20+28+24)/12 = 6. \( \text{SC}{\text{Entre}} = 4(5-6)^2 + 4(7-6)^2 + 4(6-6)^2 = 8 \). Dins: A: 1+0+1+0 = 2; B: 1+0+0+1 = 2; C: 1+0+0+1 = 2; \( \text{SC}{\text{Dins}} = 6 \). Taula: SC 8 i 6; gl 2 i 9; QM 4 i 0,667; \( F = 4/0{,}667 = 6{,}0 \). Com que 6,0 > 4,26, es rebutja \( H_0 \): la configuració influeix en l'espera. \( \eta^2 = 8/14 = 0{,}57 \). (De cara a l'acció, el post-hoc apuntaria a la diferència A vs B — i compte amb la lectura de negoci: el «reforç» B és el que mostra MÉS espera!) Error freqüent: oblidar multiplicar per \( n_j = 4 \) a la SC Entre, o fer servir N − 1 = 11 com a gl del denominador en lloc de N − k = 9.
Exercici 2. Errors: (1) inflació de l'error de tipus I — tres contrastos al 5 % acumulen \( 1 - 0{,}95^3 = 14{,}3,% \) de probabilitat d'alguna falsa alarma, gairebé el triple del que s'havia pactat; (2) informe selectiu (p-hacking, vist a 05-04): presentar només el contrast significatiu amaga el procés de cerca i converteix un possible atzar en «troballa». El correcte: ANOVA global primer i, només si rebutja, post-hoc amb correcció (Bonferroni: cada comparació al 0,05/3 = 0,0167), informant de totes tres. Error freqüent: creure que la correcció és opcional si «només» són 3 comparacions — el 14,3 % ja gairebé triplica el risc nominal.
Exercici 3. \( \text{SC}_{\text{Dins}} = 210 - 90 = 120 \). gl: entre = 3, dins = 20, total = 23. QM: entre = 90/3 = 30; dins = 120/20 = 6. \( F = 30/6 = 5{,}0 \). Com que 5,0 > 3,10, es rebutja \( H_0 \): la despesa mitjana no és igual en els quatre segments d'antiguitat (amb \( \eta^2 = 90/210 = 0{,}43 \), efecte gran). Faltaria un post-hoc per saber quins segments difereixen. Error freqüent: calcular els gl entre com a k = 4 en lloc de k − 1 = 3, amb la qual cosa tots els QM i l'F surten malament en cascada.
Conclusió
L'ANOVA salda el deute del Mòdul 5: en lloc d'una perillosa bateria de contrastos t, un únic contrast global que compara la variabilitat entre grups amb la variabilitat dins d'ells mitjançant l'estadístic F — en el nostre cas, F = 10 davant d'un crític de 3,89: el format de botiga influeix en la satisfacció, l'efecte és gran (η² = 0,625) i el post-hoc amb Bonferroni localitza la diferència demostrada entre Express i Gran Superfície. Hem afegit la distribució F i la seva taula de doble entrada al nostre arsenal, juntament amb la disciplina de comprovar supòsits i d'acompanyar cada valor p amb la seva mida de l'efecte. Però l'ANOVA exigeix una variable resposta quantitativa (satisfacció, temps, euros). I quan el que volem creuar són dues variables categòriques — canal de compra i mètode de pagament, franja d'edat i baixa del club —, on no hi ha mitjanes a comparar sinó freqüències a comptar? Per a això necessitem la prova khi quadrat, protagonista de l'Anàlisi de Dades Categòriques amb què tanquem el mòdul.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
