Al mòdul anterior vam aprendre a inferir sobre una variable cada vegada: una mitjana, una proporció, una diferència. Però, com ja anunciàvem en tancar-lo, les preguntes més sucoses de NovaMarket relacionen variables entre si: venen més les botigues grans? baixa la satisfacció quan el lliurament triga? En aquesta lliçó aprendrem a quantificar la força d'una relació entre dues variables quantitatives: partirem del núvol de punts que vam presentar al Mòdul 2, definirem la covariància i el coeficient de correlació de Pearson (calculat a mà, pas a pas), en veurem les condicions i els paranys — amb el cèlebre quartet d'Anscombe com a advertiment —, presentarem l'alternativa de Spearman basada en rangs, contrastarem si una correlació és estadísticament significativa i, sobretot, gravarem a foc la regla més important de l'anàlisi de dades: correlació no implica causalitat.

Contingut

  1. Del núvol de punts a un número
  2. La covariància: signe, interpretació i el problema de les unitats
  3. El coeficient de correlació de Pearson: càlcul a mà
  4. Interpretar la magnitud de r
  5. Condicions i paranys: linealitat i valors atípics (el quartet d'Anscombe)
  6. Correlació de Spearman: rangs per a ordinals i relacions no lineals
  7. És significativa la correlació? El contrast sobre r
  8. Correlació no implica causalitat

Del núvol de punts a un número

Recuperem el gràfic de dispersió que vam dibuixar a la lliçó de Representació Gràfica de Dades: la superfície de sala i la venda mitjana diària de vuit botigues de NovaMarket. Per treballar amb números manejables expressarem les vendes en milers d'euros:

Botiga Superfície \( x \) (m²) Venda diària \( y \) (milers €)
Cuenca 850 19,2
Bilbao-Casco 1.100 44,0
Zaragoza-Centro 1.150 44,0
Valencia-Ruzafa 1.200 44,1
Barcelona-Gràcia 1.250 46,1
Madrid-Chamberí 1.300 47,5
Sevilla-Nervión 1.400 52,3
Madrid-Centro 2.000 68,4

En dibuixar el núvol de punts, el patró salta a la vista: com més superfície, més venda. Però la Marta, la directora d'anàlisi, vol més que una impressió visual: «Com de forta és la relació? Dona'm un número que pugui comparar amb altres variables». Aquest número existeix, i per arribar-hi calen dos passos: primer la covariància i després la correlació.

La covariància: signe, interpretació i el problema de les unitats

La idea és senzilla. Calculem les mitjanes de totes dues variables i ens preguntem, botiga a botiga, si les dues variables es desvien de la seva mitjana en el mateix sentit o en sentits oposats:

\[ s_{xy} = \frac{\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})}{n-1} \]

  • Si una botiga està per sobre de la mitjana en superfície i per sobre en vendes (o per sota en totes dues), el producte \( (x_i-\bar{x})(y_i-\bar{y}) \) és positiu.
  • Si està per sobre en una i per sota en l'altra, el producte és negatiu.
  • La covariància és (gairebé) la mitjana d'aquests productes: el seu signe ens diu el sentit de la relació.

Calculem les mitjanes: \( \bar{x} = 10.250/8 = 1.281{,}25 \) m² i \( \bar{y} = 365{,}6/8 = 45{,}7 \) milers €. Muntem la taula de càlcul, que reutilitzarem durant tota la lliçó (i també a la següent, així que val la pena fer-la amb cura):

Botiga \( x_i \) \( y_i \) \( x_i-\bar{x} \) \( y_i-\bar{y} \) \( (x_i-\bar{x})(y_i-\bar{y}) \) \( (x_i-\bar{x})^2 \) \( (y_i-\bar{y})^2 \)
Cuenca 850 19,2 −431,25 −26,5 11.428,13 185.976,56 702,25
Bilbao-Casco 1.100 44,0 −181,25 −1,7 308,13 32.851,56 2,89
Zaragoza-Centro 1.150 44,0 −131,25 −1,7 223,13 17.226,56 2,89
Valencia-Ruzafa 1.200 44,1 −81,25 −1,6 130,00 6.601,56 2,56
Barcelona-Gràcia 1.250 46,1 −31,25 0,4 −12,50 976,56 0,16
Madrid-Chamberí 1.300 47,5 18,75 1,8 33,75 351,56 3,24
Sevilla-Nervión 1.400 52,3 118,75 6,6 783,75 14.101,56 43,56
Madrid-Centro 2.000 68,4 718,75 22,7 16.315,63 516.601,56 515,29
Suma 0 0 29.210,0 774.687,5 1.272,84

Fixa't en dues comprovacions: les columnes de desviacions sumen zero (passa sempre; si no, hi ha un error de càlcul), i set dels vuit productes creuats són positius — només Barcelona-Gràcia, lleugerament per sota de la mitjana en superfície però una mica per sobre en vendes, hi aporta un producte negatiu (i minúscul).

\[ s_{xy} = \frac{29.210}{8-1} = 4.172{,}9 ; \text{m²·milers €} \]

Interpretació: la covariància és positiva, per tant superfície i vendes es mouen en el mateix sentit. Però 4.172,9 és una relació forta? Aquí apareix el problema de les unitats: la covariància es mesura en «m² per milers d'euros», una unitat ininterpretable, i el seu valor canvia si canviem d'escala. Si haguéssim expressat les vendes en euros en comptes de milers, la covariància seria 4.172.900 — mil vegades més gran — sense que la relació hagués canviat gens ni mica! La covariància serveix per al signe, però no per mesurar la força. Cal estandarditzar-la.

El coeficient de correlació de Pearson: càlcul a mà

La solució és la mateixa que vam fer servir amb les puntuacions z al Mòdul 2: dividir per les desviacions típiques per eliminar les unitats. El resultat és el coeficient de correlació de Pearson:

\[ r = \frac{s_{xy}}{s_x , s_y} = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum (x_i-\bar{x})^2 ; \sum (y_i-\bar{y})^2}} \]

La segona forma és la més còmoda per calcular a mà, perquè fa servir directament les sumes de la taula (els \( n-1 \) es cancel·len entre numerador i denominador). Amb les nostres dades:

\[ r = \frac{29.210}{\sqrt{774.687{,}5 \times 1.272{,}84}} = \frac{29.210}{\sqrt{986.053.238}} = \frac{29.210}{31.401{,}5} = 0{,}93 \]

Propietats de \( r \) que convé memoritzar:

  • Sempre és entre −1 i +1. És adimensional: tant és mesurar en m² o en hectàrees, en euros o en milers d'euros.
  • \( r = +1 \): relació lineal positiva perfecta (tots els punts sobre una recta creixent). \( r = -1 \): lineal negativa perfecta. \( r = 0 \): absència de relació lineal.
  • És simètric: la correlació de superfície amb vendes és la mateixa que la de vendes amb superfície. No distingeix causa d'efecte (hi tornarem).

Interpretar la magnitud de r

0,93 és molt o poc? No hi ha fronteres universals — depenen de l'àmbit —, però per a dades de negoci aquesta guia orientativa funciona bé:

\( \lvert r \rvert \) Interpretació orientativa
0,00 – 0,20 Relació molt feble o inexistent
0,20 – 0,40 Feble
0,40 – 0,60 Moderada
0,60 – 0,80 Forta
0,80 – 1,00 Molt forta

El nostre \( r = 0{,}93 \) indica una relació lineal molt forta: les botigues grans venen sistemàticament més. Compte amb dos matisos:

  • La taula és orientativa, no un dogma. En enquestes de comportament, un 0,4 pot ser una troballa notable; en un procés físic controlat, un 0,9 pot ser decebedor.
  • \( r \) mesura la força de la relació, no la seva rellevància econòmica ni la magnitud de l'efecte («per cada m² addicional, quants euros més?»). Aquesta pregunta la respondrà el pendent de la regressió a la propera lliçó.

Condicions i paranys: linealitat i valors atípics (el quartet d'Anscombe)

Pearson mesura relacions lineals, i és molt sensible als valors atípics. L'estadístic Francis Anscombe va construir el 1973 quatre conjunts d'onze punts — el famós quartet d'Anscombe — dissenyats perquè tots comparteixin pràcticament els mateixos estadístics: mateixa mitjana de \( x \), mateixa mitjana de \( y \), mateixa correlació (\( r \approx 0{,}82 \) en tots quatre)… i tanmateix els seus gràfics no poden ser més diferents:

Conjunt Què es veu en dibuixar-lo És \( r = 0{,}82 \) un bon resum?
I Núvol lineal clàssic amb dispersió moderada Sí: és el cas «de manual»
II Una corba perfecta (paràbola), sense soroll No: la relació és fortíssima però no lineal; \( r \) la infravalora i la descriu malament
III Recta gairebé perfecta amb un atípic que se'n surt No: sense aquest punt, \( r \) seria ≈ 1; l'atípic l'arrossega cap avall
IV Tots els punts amb el mateix \( x \), llevat d'un d'allunyat No: la «correlació» la fabrica un únic punt; sense ell no hi ha cap relació

La moralitat és d'aplicació diària a NovaMarket: abans de calcular r, dibuixa sempre el núvol de punts. Un mateix número pot amagar una relació neta, una corba, o l'efecte d'una sola botiga. En el nostre exemple convé fixar-se en Madrid-Centro (2.000 m², 68,4 milers €): és l'observació més extrema i aporta més de la meitat del producte creuat total (16.315,6 de 29.210). No és cap error — és una botiga real i coherent amb el patró —, però si la seva xifra estigués mal registrada, distorsionaria greument el resultat. Regla pràctica: recalcula \( r \) sense l'observació sospitosa; si el valor canvia dràsticament, la teva conclusió penja d'un sol punt.

Correlació de Spearman: rangs per a ordinals i relacions no lineals

Què fem quan la relació és clarament monòtona però no lineal (creix o decreix sempre, però de forma corbada), o quan alguna variable és ordinal (com una satisfacció de 0 a 10, on els números ordenen però les distàncies no són garantidament iguals), o quan tenim por dels atípics? Fer servir la correlació de Spearman \( r_s \): se substitueix cada valor pel seu rang (posició ordenada: 1 el més petit, 2 el següent…) i es calcula la correlació sobre els rangs. Amb rangs sense empats hi ha una fórmula ràpida:

\[ r_s = 1 - \frac{6 \sum d_i^2}{n(n^2-1)} \]

on \( d_i \) és la diferència entre els rangs de cada observació en les dues variables.

Cas NovaMarket: la Marta sospita que la satisfacció dels clients en línia (recordem-ho: mitjana 7,6 davant de 8,3 a la botiga) depèn del temps de lliurament. Prenem vuit comandes en línia amb el seu temps de lliurament i la nota de satisfacció del client:

Comanda Lliurament (h) Satisfacció Rang lliurament Rang satisf. \( d_i \) \( d_i^2 \)
A 14 9 1 7 −6 36
B 17 10 2 8 −6 36
C 20 8 3 6 −3 9
D 23 6 4 4 0 0
E 26 7 5 5 0 0
F 32 5 6 3 3 9
G 44 3 7 2 5 25
H 55 2 8 1 7 49
Suma 0 164

Comprovació: la columna \( d_i \) suma zero. Apliquem la fórmula:

\[ r_s = 1 - \frac{6 \times 164}{8 \times (64-1)} = 1 - \frac{984}{504} = 1 - 1{,}952 = -0{,}95 \]

Interpretació: relació monòtona negativa molt forta — com més triga el lliurament, menor és la satisfacció, de forma gairebé perfectament consistent. Fixa't que Spearman només pregunta «l'ordre d'una variable replica (o inverteix) l'ordre de l'altra?»: per això és immune a curvatures monòtones i molt més robust davant dels atípics (una comanda que trigués 200 h continuaria sent simplement «el rang 8»). Si hi ha empats, s'assigna als valors empatats la mitjana dels rangs que ocuparien (dues comandes empatades a les posicions 3a i 4a reben rang 3,5 cadascuna) i és preferible calcular \( r_s \) com el Pearson dels rangs.

Quan cal fer servir cadascun?

Situació Coeficient recomanat
Dues variables quantitatives, relació lineal, sense atípics greus Pearson \( r \)
Variable(s) ordinal(s) (notes, rànquings, escales de satisfacció) Spearman \( r_s \)
Relació monòtona però corbada Spearman \( r_s \)
Atípics que no es poden justificar ni eliminar Spearman \( r_s \) (com a anàlisi de robustesa)

És significativa la correlació? El contrast sobre r

El nostre \( r = 0{,}93 \) s'ha calculat amb només 8 botigues. Amb mostres petites, no podria sortir una correlació aparent per pur atzar, encara que a la població no existeixi cap relació? És la mateixa pregunta que vam resoldre al Mòdul 5, i es respon amb un contrast:

  • \( H_0: \rho = 0 \) (no hi ha correlació lineal a la població; \( \rho \), «rho», és la correlació poblacional)
  • \( H_1: \rho \neq 0 \)

Sota \( H_0 \), l'estadístic

\[ t = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}} \]

segueix una distribució t de Student amb \( n-2 \) graus de llibertat (en perdem dos: un per cada mitjana estimada). Amb les nostres dades:

\[ t = \frac{0{,}93 \times \sqrt{6}}{\sqrt{1-0{,}865}} = \frac{0{,}93 \times 2{,}449}{\sqrt{0{,}135}} = \frac{2{,}278}{0{,}367} = 6{,}21 \]

A la taula t (que vam aprendre a llegir a l'estimació de paràmetres), el valor crític bilateral al 5 % amb 6 gl és \( t_{0{,}025;,6} = 2{,}447 \). Com que \( 6{,}21 > 2{,}447 \), rebutgem \( H_0 \): la correlació és estadísticament significativa (p < 0,001). Fins i tot amb només 8 botigues, una relació tan forta és molt improbable per atzar.

Dos avisos heretats del Mòdul 5: amb mostres grans, correlacions minúscules (r = 0,05) surten «significatives» sense ser rellevants — significació ≠ rellevància —; i si correlaciones moltes parelles de variables alhora, recorda el problema de les comparacions múltiples: alguna sortirà significativa per atzar.

Correlació no implica causalitat

És la frase més repetida de l'estadística, i tot i així s'incompleix cada dia a les empreses. Que dues variables es moguin juntes no demostra que una causi l'altra. Hi ha tres explicacions possibles per a una correlació observada:

  1. X causa Y (o Y causa X — recorda que r és simètric i no distingeix el sentit).
  2. Una tercera variable oculta (variable de confusió) causa totes dues.
  3. Casualitat (especialment amb mostres petites o després de mirar moltes parelles de variables).

Dos exemples de negoci:

  • Gelats i protector solar. A les dades de NovaMarket, les vendes setmanals de gelats i de protector solar tenen una correlació altíssima. Vendre gelats fa que la gent compri protector? Òbviament no: la variable oculta és la calor de l'estiu, que dispara totes dues. Promocionar gelats al gener no vendrà ni una crema.
  • La mida de botiga com a variable oculta. Un analista júnior descobreix que les botigues amb més caixes d'autopagament venen més, i proposa instal·lar caixes d'autopagament a Cuenca per fer-ne pujar les vendes. L'error: les botigues grans tenen alhora més caixes d'autopagament i més vendes — la superfície (i la ubicació que sol acompanyar-la) causa totes dues coses. Instal·lar caixes no converteix Cuenca en Madrid-Centro.

Fins i tot la nostra correlació estrella (superfície–vendes, r = 0,93) mereix cautela causal: les botigues grans de NovaMarket són, a més, en ubicacions més cèntriques i amb més trànsit de clients. Part de l'efecte atribuït als metres quadrats pot ser degut a la ubicació. Com s'estableix la causalitat de debò? Amb experiments controlats (proves A/B, assignació aleatòria — ho vam esbossar en parlar de la recollida de dades) o amb dissenys estadístics que controlin les variables de confusió, com la regressió múltiple que anunciarem a l'Anàlisi Multivariant. La correlació, per si sola, només suggereix hipòtesis; mai no les demostra.

Errors Comuns i Consells

  • Calcular r sense dibuixar el núvol de punts. És l'error número u: el quartet d'Anscombe existeix precisament per curar-lo. Gràfic primer, número després.
  • Interpretar r = 0 com a «no hi ha relació». Només significa «no hi ha relació lineal». Una U perfecta (p. ex., vendes davant de preu: cauen si és molt car i també si és tan barat que genera desconfiança) pot donar r ≈ 0.
  • Confondre covariància gran amb relació forta. La covariància depèn de les unitats; per comparar forces, fes servir sempre r.
  • Saltar de correlació a causalitat. Abans de recomanar una acció («ampliem la botiga per vendre més»), pregunta't quina variable oculta podria explicar la relació.
  • Ignorar els atípics. Un sol punt pot fabricar o destruir una correlació. Recalcula sense ell i compara; si la història canvia, investiga aquest punt abans de concloure.
  • Aplicar Pearson a escales ordinals sense pensar-hi. Amb rànquings o escales d'opinió, Spearman és l'opció defensable.
  • Correlacionar-ho tot amb tot. Amb 20 variables hi ha 190 parelles: al 5 % de significació, n'esperaràs ~9 o 10 correlacions «significatives» falses. Formula les hipòtesis abans de mirar.

Exercicis

Exercici 1. Amb la taula de superfície–vendes de la lliçó, un becari proposa repetir l'anàlisi mesurant la superfície en hectàrees (1 ha = 10.000 m²) «perquè els números siguin més petits». (a) Canviarà la covariància? I r? Raona-ho sense calcular. (b) La Marta pregunta: «aquest 0,93 significa que la superfície explica el 93 % de les vendes?» Què li respondries?

Exercici 2. El responsable del Club Nova ordena 8 campanyes d'email segons la seva inversió i segons els socis captats:

Campanya Rang inversió Rang captació
C1 1 2
C2 2 1
C3 3 4
C4 4 3
C5 5 6
C6 6 5
C7 7 8
C8 8 7

Calcula la correlació de Spearman i interpreta-la en una frase per al responsable.

Exercici 3. Analitzant 6 botigues, una altra analista obté r = 0,75 entre trànsit de clients i vendes. (a) Contrasta al 5 % si la correlació és significativa (valor crític bilateral: \( t_{0{,}025;,4} = 2{,}776 \)). (b) La mateixa r = 0,75 amb n = 30 dona t = 6,00. Quina lliçó pràctica en treus de comparar tots dos casos?

Solucions

Exercici 1. (a) La covariància sí que canvia: quedarà dividida per 10.000, perquè depèn de les unitats de totes dues variables. La correlació no canvia gens: r és adimensional i invariant davant de canvis d'escala; continuarà valent 0,93. Aquest és exactament el motiu pel qual preferim r a la covariància. (b) No: r no és un percentatge explicat. La proporció de variància de les vendes associada a la superfície és \( r^2 = 0{,}93^2 \approx 0{,}865 \), és a dir, un 86,5 % — un concepte (l'R²) que desenvoluparem a la propera lliçó. Error freqüent: llegir r directament com a percentatge; r = 0,5 no és «la meitat explicada» (seria r² = 0,25, un 25 %).

Exercici 2. Diferències de rangs: −1, 1, −1, 1, −1, 1, −1, 1, de manera que \( \sum d_i^2 = 8 \). Aleshores \( r_s = 1 - \frac{6 \times 8}{8 \times 63} = 1 - \frac{48}{504} = 1 - 0{,}095 = 0{,}90 \). Interpretació: «l'ordre de captació replica gairebé perfectament l'ordre d'inversió: les campanyes amb més pressupost capten sistemàticament més socis». Error freqüent: oblidar elevar al quadrat les diferències (amb aquestes d, \( \sum d_i \) dona 0 i semblaria correlació perfecta) o fer servir malament n² − 1 = 63 (recorda: és n·(n²−1) = 8 × 63 = 504).

Exercici 3. (a) \( t = \frac{0{,}75\sqrt{4}}{\sqrt{1-0{,}5625}} = \frac{1{,}5}{0{,}661} = 2{,}27 \). Com que 2,27 < 2,776, no podem rebutjar \( H_0 \): amb només 6 botigues, una correlació de 0,75 és compatible amb l'atzar. (b) La mateixa correlació amb n = 30 sí que és significativa. Lliçó: la significació depèn conjuntament de la força (r) i de la mida mostral (n). Una r alta amb una n minúscula no demostra res, i — a la inversa, com vam veure al Mòdul 5 — una r irrellevant amb una n enorme pot sortir «significativa». Error freqüent: fer servir n en lloc de n − 2 a la fórmula, o concloure de l'apartat (a) que «no hi ha relació»: només hi ha evidència insuficient.

Conclusió

En aquesta lliçó hem fet el salt de descriure variables per separat a mesurar relacions: la covariància ens dona el signe (però és esclava de les unitats), el coeficient de Pearson r la converteix en una mesura universal entre −1 i +1, Spearman ens cobreix quan hi ha ordinals, corbes monòtones o atípics, i el contrast t sobre r ens protegeix de les correlacions fabricades per l'atzar en mostres petites. Ens enduem dues disciplines: dibuixar sempre abans de calcular (Anscombe) i no confondre correlació amb causalitat (gelats i protector solar). Però la Marta ja demana el següent pas: «D'acord, superfície i vendes van plegades amb r = 0,93. Si obrim una botiga de 1.500 m², quant vendrà?». Respondre «quant» exigeix convertir la relació en una equació de predicció — una recta amb pendent i intercepte —, i això és exactament l'Anàlisi de Regressió que abordem a continuació, reutilitzant la taula de càlcul que hem construït aquí.

© Copyright 2026. Tots els drets reservats