Correlació, regressió i ANOVA treballen amb variables quantitatives: metres, euros, punts de satisfacció. Però bona part de les dades de NovaMarket són categòriques: canal de compra (botiga/en línia), mètode de pagament, franja d'edat, continuar o donar-se de baixa del Club Nova. Amb categories no hi ha mitjanes a comparar; hi ha freqüències a comptar, i la pregunta de negoci es converteix en «estan relacionades aquestes dues classificacions?». En aquesta lliçó recuperarem les taules de contingència que vam fer servir amb probabilitats al Mòdul 3 — però ara amb inferència —, construirem la prova khi quadrat d'independència pas a pas (freqüències esperades, estadístic, graus de llibertat i lectura de la seva taula), aprendrem la prova de bondat d'ajust per comparar unes freqüències amb una distribució de referència, localitzarem les discrepàncies amb els residus tipificats, mesurarem la força de l'associació amb la V de Cramér i ho connectarem tot amb la prova z de dues proporcions del Mòdul 5.
Contingut
- De les probabilitats a la inferència: la taula de contingència, segona visita
- La lògica de la prova: freqüències observades vs esperades
- Cas 1 — Depèn el mètode de pagament del canal? Prova d'independència pas a pas
- La distribució khi quadrat i com llegir-ne la taula
- Condicions de validesa de la prova
- On és la discrepància? Residus tipificats
- Com de forta és l'associació? La V de Cramér
- Prova de bondat d'ajust: segueixen les vendes el patró històric?
- Connexió amb la prova z de dues proporcions
De les probabilitats a la inferència: la taula de contingència, segona visita
A les Regles de Probabilitat vam fer servir taules de contingència per calcular probabilitats conjuntes i condicionades: allà les freqüències eren el punt de partida i les preníem com a veritat. Ara fem el salt inferencial del Mòdul 5: la taula prové d'una mostra, i la pregunta és si el patró que mostra reflecteix una relació real a la població o és només soroll mostral. El contrast que respon a aquesta pregunta és la prova khi quadrat d'independència (\( \chi^2 \), «khi quadrat»):
- \( H_0: \) les dues variables són independents (el repartiment de l'una no depèn de l'altra)
- \( H_1: \) les dues variables estan relacionades
La lògica de la prova: freqüències observades vs esperades
La idea és preguntar a \( H_0 \): «si les variables fossin independents, quina taula esperaríem veure?», i mesurar quant s'allunya la taula real d'aquesta taula ideal. Del Mòdul 3 sabem que sota independència \( P(A \cap B) = P(A) \cdot P(B) \); traduït a freqüències, la freqüència esperada de cada casella és
\[ E_{ij} = \frac{(\text{total de la seva fila}) \times (\text{total de la seva columna})}{n} \]
i la discrepància global s'acumula casella a casella en l'estadístic
\[ \chi^2 = \sum_{\text{caselles}} \frac{(O_{ij} - E_{ij})^2}{E_{ij}} \]
on \( O_{ij} \) és l'observat. Cada sumand mesura quant es desvia una casella d'allò esperat, en termes relatius a allò esperat (dividir per \( E_{ij} \) evita que les caselles grans dominin només per ser-ho). Si \( H_0 \) és certa, totes les desviacions són petites i \( \chi^2 \) queda a prop de 0; si hi ha relació, algunes caselles es desvien molt i \( \chi^2 \) creix. Com a l'ANOVA, el contrast és unilateral dret: només els valors grans desmenteixen la independència.
Cas 1 — Depèn el mètode de pagament del canal? Prova d'independència pas a pas
La Marta vol saber si el mètode de pagament depèn del canal (decisió pràctica: quines passarel·les prioritzar al web i quines caixes instal·lar a la botiga). Es pren una mostra aleatòria de 200 compres:
Freqüències observades \( O_{ij} \):
| Canal \ Pagament | Targeta | Efectiu / contra reemborsament | Pagament mòbil | Total |
|---|---|---|---|---|
| Botiga | 70 | 35 | 15 | 120 |
| En línia | 52 | 4 | 24 | 80 |
| Total | 122 | 39 | 39 | 200 |
Pas 1 — Freqüències esperades. Sota independència, el repartiment de pagaments hauria de ser el mateix en tots dos canals. Per exemple, la casella Botiga–Targeta: \( E = 120 \times 122 / 200 = 73{,}2 \). La taula completa:
| Canal \ Pagament | Targeta | Efectiu | Mòbil |
|---|---|---|---|
| Botiga | 73,2 | 23,4 | 23,4 |
| En línia | 48,8 | 15,6 | 15,6 |
(Comprovació: les esperades reprodueixen els mateixos totals de fila i columna que les observades.)
Pas 2 — Contribucions a l'estadístic. Casella a casella, \( (O-E)^2/E \):
| Canal \ Pagament | Targeta | Efectiu | Mòbil |
|---|---|---|---|
| Botiga | \( (70-73{,}2)^2/73{,}2 = 0{,}14 \) | \( (35-23{,}4)^2/23{,}4 = 5{,}75 \) | \( (15-23{,}4)^2/23{,}4 = 3{,}02 \) |
| En línia | \( (52-48{,}8)^2/48{,}8 = 0{,}21 \) | \( (4-15{,}6)^2/15{,}6 = 8{,}63 \) | \( (24-15{,}6)^2/15{,}6 = 4{,}52 \) |
\[ \chi^2 = 0{,}14 + 5{,}75 + 3{,}02 + 0{,}21 + 8{,}63 + 4{,}52 = 22{,}27 \]
Pas 3 — Graus de llibertat. En una taula de \( f \) files i \( c \) columnes:
\[ gl = (f-1)(c-1) = (2-1)(3-1) = 2 \]
La intuïció: fixats els totals de fila i columna, només pots omplir lliurement 2 caselles; la resta queda determinada.
Pas 4 — Decisió. El valor crític al 5 % amb 2 gl és \( \chi^2_{0{,}05;,2} = 5{,}99 \) (de seguida veurem d'on surt). Com que \( 22{,}27 > 5{,}99 \), rebutgem \( H_0 \) amb contundència (p < 0,001): el mètode de pagament depèn del canal.
La distribució khi quadrat i com llegir-ne la taula
L'estadístic segueix, sota \( H_0 \), la distribució khi quadrat, la tercera i última distribució de taules del curs (després de la t i l'F):
- Només pren valors positius (és una suma de quadrats) i és asimètrica amb cua a la dreta.
- Depèn d'un únic paràmetre: els graus de llibertat. La seva mitjana és justament gl, cosa que dona una referència mental ràpida: un \( \chi^2 \) molt per sobre dels seus gl comença a ser sospitós per a \( H_0 \).
- Amb més gl es desplaça a la dreta i se simetritza.
Com llegir-ne la taula: igual que la taula t — una fila per graus de llibertat, una columna per àrea a la cua dreta (α); l'encreuament dona el valor crític. Un extracte:
| gl \ α | 0,10 | 0,05 | 0,01 |
|---|---|---|---|
| 1 | 2,71 | 3,84 | 6,63 |
| 2 | 4,61 | 5,99 | 9,21 |
| 3 | 6,25 | 7,81 | 11,34 |
| 4 | 7,78 | 9,49 | 13,28 |
Fila 2, columna 0,05: el 5,99 que hem fet servir. El nostre 22,27 supera fins i tot el crític a l'1 % (9,21).
Condicions de validesa de la prova
La khi quadrat és una aproximació (les freqüències són discretes; la distribució, contínua), i funciona bé si:
- Freqüències esperades ≥ 5 en totes les caselles (la regla pràctica més estesa). Compte: la condició es comprova sobre les esperades, no sobre les observades — la nostra casella En línia–Efectiu té \( O = 4 \), però la seva esperada és 15,6, així que no hi ha cap problema.
- Observacions independents entre si i cadascuna comptada en una sola casella (una compra, una fila de la taula; mai el mateix client comptat dues vegades).
Si alguna esperada baixa de 5, les solucions habituals són agrupar categories afins (p. ex., fusionar dos mètodes de pagament minoritaris en «altres») o ampliar la mostra.
On és la discrepància? Residus tipificats
Com l'F de l'ANOVA, el \( \chi^2 \) global diu «hi ha relació», però no on. Per localitzar-la es fan servir els residus tipificats de cada casella:
\[ r_{ij} = \frac{O_{ij} - E_{ij}}{\sqrt{E_{ij}}} \]
que es comporten aproximadament com puntuacions z: valors més enllà de ±2 assenyalen caselles amb una desviació destacable (el signe indica excés o dèficit respecte de la independència).
| Canal \ Pagament | Targeta | Efectiu | Mòbil |
|---|---|---|---|
| Botiga | −0,37 | +2,40 | −1,74 |
| En línia | +0,46 | −2,94 | +2,13 |
Lectura per a la Marta: la targeta es comporta igual en tots dos canals (residus minúsculs — coherent amb el seu paper dominant: el 61 % de clients amb targeta que vam estimar al Mòdul 5). La relació la generen l'efectiu, sobrerepresentat a la botiga i gairebé absent en línia, i el pagament mòbil, sobrerepresentat en línia. Decisió informada: reforçar Bizum/wallets al web i mantenir la caixa d'efectiu a la botiga.
Com de forta és l'associació? La V de Cramér
Amb mostres grans, fins i tot relacions trivials donen \( \chi^2 \) significatius (l'eterna lliçó: significació ≠ rellevància). La mesura de força estàndard és la V de Cramér:
\[ V = \sqrt{\frac{\chi^2}{n \cdot \min(f-1,, c-1)}} = \sqrt{\frac{22{,}27}{200 \times 1}} = \sqrt{0{,}111} = 0{,}33 \]
V va de 0 (independència) a 1 (associació perfecta); orientativament, ~0,1 és feble, ~0,3 moderada i ~0,5 forta. El nostre 0,33 indica una associació moderada: real i accionable, sense ser cap determinisme. És l'anàleg categòric de l'r de Pearson i de l'η² de l'ANOVA: el trio complet de «mides de l'efecte» del mòdul.
Prova de bondat d'ajust: segueixen les vendes el patró històric?
La segona gran aplicació de la khi quadrat no creua dues variables: compara una variable categòrica amb una distribució de referència. Històricament, les vendes de NovaMarket es reparteixen així per categoria (la quota que ja vam fer servir al Mòdul 3): alimentació fresca 38 %, rebost 27 %, begudes 14 %, drogueria i perfumeria 12 %, altres 9 %. Després de l'última reforma d'assortiment, la Marta vol saber si el patró s'ha mogut. Es classifiquen 400 línies de venda de l'última setmana:
| Categoria | Observat \( O_i \) | % històric | Esperat \( E_i = 400 \times p_i \) | \( (O_i-E_i)^2/E_i \) |
|---|---|---|---|---|
| Alimentació fresca | 132 | 38 % | 152 | 2,63 |
| Rebost | 106 | 27 % | 108 | 0,04 |
| Begudes | 62 | 14 % | 56 | 0,64 |
| Drogueria i perfumeria | 55 | 12 % | 48 | 1,02 |
| Altres | 45 | 9 % | 36 | 2,25 |
| Total | 400 | 100 % | 400 | χ² = 6,58 |
Aquí \( H_0 \) és «les vendes segueixen la distribució històrica», els graus de llibertat són \( gl = k - 1 = 5 - 1 = 4 \) (k categories; el −1 perquè els percentatges han de sumar 100), i el crític al 5 % és \( \chi^2_{0{,}05;,4} = 9{,}49 \). Com que \( 6{,}58 < 9{,}49 \), no rebutgem \( H_0 \): les desviacions observades (menys fresc, més «altres») són compatibles amb l'atzar mostral. Bon recordatori del Mòdul 5: no rebutjar no demostra que res no hagi canviat — només que 400 línies no basten per afirmar-ho; si la sospita persisteix, tocaria més mostra (potència).
Connexió amb la prova z de dues proporcions
Un cas particular important: la taula 2×2. Comparar la proporció de pagament amb targeta entre Madrid-Centro (0,68) i Cuenca (0,49), com vam fer al Mòdul 5 amb la prova z de dues proporcions, equival exactament a muntar la taula 2×2 (botiga × paga-amb-targeta-sí/no) i aplicar-hi khi quadrat: es compleix la identitat
\[ \chi^2_{(1,gl)} = z^2 \]
i també entre crítics: \( 3{,}84 = 1{,}96^2 \). Totes dues proves donen sempre el mateix valor p bilateral; són la mateixa inferència amb dos vestits. Quan cal fer servir cadascuna? La z quan hi ha exactament dues proporcions i vols un contrast unilateral o un interval de confiança per a la diferència; la khi quadrat quan hi ha més de dues files o columnes — el seu gran avantatge és generalitzar sense esforç, igual que l'ANOVA generalitzava el contrast t.
Errors Comuns i Consells
- Aplicar khi quadrat a percentatges o mitjanes. L'estadístic es calcula sempre sobre recomptes (freqüències absolutes). Convertir la taula a percentatges abans de calcular ho invalida tot (n desapareix, i n és la força de l'evidència).
- Comprovar la condició «≥ 5» sobre les observades. La regla s'aplica a les freqüències esperades. Una observada de 4 amb una esperada de 15,6 és perfectament vàlida.
- Oblidar que el contrast és de cua dreta. Un \( \chi^2 \) minúscul no «confirma» la independència; i un ajust sospitosament perfecte a vegades delata dades retocades.
- Confondre significació amb força. Amb n = 20.000, un \( \chi^2 \) enorme pot correspondre a una V de Cramér de 0,05: relació real però irrellevant. Informa sempre de totes dues.
- Quedar-se en el veredicte global. Sense residus tipificats no saps quines caselles generen la relació, i la decisió de negoci viu precisament allà.
- Comptar dues vegades el mateix individu (un client amb dues compres a la mostra, una enquesta resposta a la botiga i en línia). Trenca la independència i esbiaixa l'estadístic.
- Llegir l'associació com a causalitat. Que la baixa del club estigui associada a la franja d'edat no explica el perquè; les variables ocultes de la primera lliçó del mòdul també aguaiten les taules.
Exercicis
Exercici 1. El Club Nova (380.000 socis) segueix durant un any una mostra de 300 socis per estudiar si la baixa depèn de la franja d'edat:
| Edat \ Situació | Baixa | Continua | Total |
|---|---|---|---|
| Menys de 35 | 22 | 78 | 100 |
| 35–55 | 12 | 108 | 120 |
| Més de 55 | 8 | 72 | 80 |
| Total | 42 | 258 | 300 |
Contrasta la independència al 5 % (\( \chi^2_{0{,}05;,2} = 5{,}99 \)) i, si escau, localitza la discrepància amb els residus tipificats de la columna «Baixa».
Exercici 2. Auditoria de transportistes: de 200 lliuraments, LogiExpress en va fer 140 (14 amb retard) i RápidoSur 60 (12 amb retard). (a) Munta la taula 2×2 i contrasta al 5 % si arribar tard depèn del transportista (\( \chi^2_{0{,}05;,1} = 3{,}84 \)). (b) Comprova la relació amb la prova z: quina z equival al teu \( \chi^2 \)? (c) Canvia res si la pregunta de la Marta era, des del principi, «és RápidoSur pitjor?»?
Exercici 3. Atenció al client registra 100 reclamacions setmanals i vol saber si es reparteixen uniformement entre els 5 dies feiners: dilluns 32, dimarts 18, dimecres 16, dijous 12, divendres 22. Contrasta la bondat d'ajust al 5 % (\( \chi^2_{0{,}05;,4} = 9{,}49 \)) i assenyala el dia responsable de la discrepància més gran.
Solucions
Exercici 1. Esperades de la columna «Baixa»: \( 100 \times 42/300 = 14 \); \( 120 \times 42/300 = 16{,}8 \); \( 80 \times 42/300 = 11{,}2 \) (i «Continua»: 86; 103,2; 68,8 — totes ≥ 5). Contribucions: \( (22-14)^2/14 = 4{,}57 \); \( (12-16{,}8)^2/16{,}8 = 1{,}37 \); \( (8-11{,}2)^2/11{,}2 = 0{,}91 \); \( (78-86)^2/86 = 0{,}74 \); \( (108-103{,}2)^2/103{,}2 = 0{,}22 \); \( (72-68{,}8)^2/68{,}8 = 0{,}15 \). Total \( \chi^2 = 7{,}97 > 5{,}99 \): es rebutja — la baixa depèn de la franja d'edat. Residus de «Baixa»: joves \( (22-14)/\sqrt{14} = +2{,}14 \); 35–55: \( -1{,}17 \); grans: \( -0{,}96 \). La discrepància la concentren els menors de 35, que es donen de baixa molt més del que seria esperable (22 % observat davant del 14 % global): candidat clar per a un pla de fidelització jove. Error freqüent: calcular gl com a caselles − 1 = 5 en lloc de (3−1)(2−1) = 2.
Exercici 2. (a) Taula: LogiExpress 14 amb retard / 126 a temps; RápidoSur 12 / 48; totals 26 amb retard, 174 a temps. Esperades: 18,2 i 7,8 (amb retard); 121,8 i 52,2 (a temps) — totes ≥ 5. \( \chi^2 = 0{,}97 + 2{,}26 + 0{,}14 + 0{,}34 = 3{,}71 < 3{,}84 \): al 5 % no es rebutja la independència, tot i que les taxes mostrals (10 % vs 20 %) es doblen l'una a l'altra — amb només 60 enviaments de RápidoSur, l'evidència es queda al llindar (p ≈ 0,054). (b) \( z = \sqrt{3{,}71} = 1{,}93 < 1{,}96 \): mateixa conclusió, com exigeix la identitat \( \chi^2 = z^2 \). (c) Sí: amb hipòtesi unilateral formulada a priori (\( H_1: p_{\text{RS}} > p_{\text{LE}} \)), el crític z és 1,645 i 1,93 sí que rebutja. La direcció s'ha de decidir abans de mirar les dades — i encaixa amb el que ja sabíem de tots dos transportistes (8 % vs 15 % de retards històrics). Error freqüent: passar-se a unilateral després de veure el resultat; això és el p-hacking del Mòdul 5.
Exercici 3. Esperades: \( 100/5 = 20 \) per dia. \( \chi^2 = \frac{144+4+16+64+4}{20} = \frac{232}{20} = 11{,}6 > 9{,}49 \): es rebutja la uniformitat — les reclamacions no es reparteixen per igual. Discrepància més gran: el dilluns, residu \( (32-20)/\sqrt{20} = +2{,}68 \) (acumula el que ha passat el cap de setmana, probablement); el dijous queda per sota del que s'esperava (\( -1{,}79 \)). Implicació operativa: reforçar l'equip d'atenció els dilluns. Error freqüent: fer servir gl = 5 en comptes de k − 1 = 4, o repartir les esperades segons les observades (les esperades venen del model d'H₀ — aquí, uniforme —, mai de les dades).
Conclusió
Amb la khi quadrat completem l'arsenal del mòdul: la prova d'independència ens ha dit que el mètode de pagament depèn del canal (χ² = 22,27, amb l'efectiu ancorat a la botiga i el pagament mòbil al canal en línia, V = 0,33), la de bondat d'ajust que el mix de vendes continua sent compatible amb el patró històric 38/27/14/12/9, i els residus tipificats ens han ensenyat a assenyalar la casella exacta on viu cada discrepància — a més de descobrir que la vella prova z de dues proporcions era una khi quadrat disfressada. Es tanca així un mòdul amb una idea unificadora: mesurar relacions (r i rs), convertir-les en predicció (regressió), comparar grups (ANOVA) i creuar categories (χ²), sempre amb el seu contrast de significació i la seva mida de l'efecte. Però totes aquestes eines comparteixen un supòsit silenciós: que les observacions són independents i el temps no hi juga. Tan bon punt les dades són vendes de cada setmana, l'una darrere l'altra — amb la seva tendència, la seva estacionalitat de Nadal i les seves ratxes —, aquest supòsit salta pels aires i cal maquinària nova: les Sèries Temporals amb què arrenca el Mòdul 7.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
