Vas acabar la lliçó anterior amb una advertència: dues botigues poden tenir la mateixa venda mitjana i comportar-se de manera completament diferent. La Marta t'ho planteja ara com a encàrrec real: «Zaragoza-Centro i Bilbao-Casco facturen de mitjana el mateix, uns 44.000 € al dia, però el director d'operacions jura que Bilbao és impossible de planificar. Demostra-m'ho amb números». Per respondre necessites les mesures de dispersió, que quantifiquen quant s'allunyen les dades del seu centre. En aquesta lliçó aprendràs el rang, la variància, la desviació típica (i per què la versió mostral divideix entre \( n-1 \)) i el coeficient de variació, que permet comparar la variabilitat de coses mesurades en escales diferents. I veuràs per què, a l'empresa, dispersió es tradueix gairebé sempre en una paraula: risc.
Contingut
- Per què la mitjana no n'hi ha prou
- El rang
- Desviacions respecte de la mitjana
- La variància
- La desviació típica
- Poblacional (\(\sigma\)) davant de mostral (\(s\)): el perquè de l'n−1
- El coeficient de variació
- Lectura gerencial de la dispersió
Per què la mitjana no n'hi ha prou
Aquestes són les vendes diàries (en euros) de les dues botigues durant la mateixa setmana laborable de 5 dies:
| Dia | Zaragoza-Centro | Bilbao-Casco |
|---|---|---|
| Dilluns | 43.000 | 38.000 |
| Dimarts | 43.500 | 41.000 |
| Dimecres | 44.000 | 44.000 |
| Dijous | 44.500 | 47.000 |
| Divendres | 45.000 | 50.000 |
| Mitjana | 44.000 | 44.000 |
Comprova les mitjanes: \( 220.000 / 5 = 44.000 \) € en tots dos casos. Si només miressis la mitjana (o fins i tot la mediana, que també és 44.000 € en totes dues), diries que les botigues són bessones. Però mira les dades: Zaragoza es mou com a molt 1.000 € amunt o avall; Bilbao oscil·la 6.000 €. El director d'operacions té raó, i la teva feina és posar un número a aquesta diferència.
Una mesura de tendència central més una mesura de dispersió formen el resum mínim honest d'una variable quantitativa. L'una sense l'altra és informació incompleta.
El rang
La mesura de dispersió més simple és el rang: la diferència entre el valor màxim i el mínim.
\[ R = x_{\max} - x_{\min} \]
- Zaragoza-Centro: \( 45.000 - 43.000 = 2.000 \) €
- Bilbao-Casco: \( 50.000 - 38.000 = 12.000 \) €
Ja distingeix les dues botigues, i es calcula en dos segons. Però té limitacions serioses:
- Només fa servir dues dades (els extrems) i ignora tota la resta: no distingeix si els altres valors estan enganxats a la mitjana o repartits.
- És extremadament sensible a un valor atípic: un únic dia excepcional (una gran nevada, una promoció viral) dispara el rang.
- Tendeix a créixer amb la mida de la mostra: amb més dies observats, més fàcil és capturar un extrem, així que comparar rangs de mostres de mida diferent és injust.
Fes-lo servir com a primera exploració ràpida, mai com a mesura definitiva. (Existeix una variant robusta, el rang interquartílic, que veuràs a la lliçó Mesures de Posició i Valors Atípics.)
Desviacions respecte de la mitjana
La idea natural per mesurar dispersió és preguntar-se: a quina distància és cada dada de la mitjana? Aquesta distància és la desviació: \( x_i - \bar{x} \).
Calculem-les per a Zaragoza-Centro (\( \bar{x} = 44.000 \)):
| Dia | \( x_i \) | Desviació \( x_i - \bar{x} \) |
|---|---|---|
| Dilluns | 43.000 | −1.000 |
| Dimarts | 43.500 | −500 |
| Dimecres | 44.000 | 0 |
| Dijous | 44.500 | +500 |
| Divendres | 45.000 | +1.000 |
| Suma | 0 |
Primera temptació: fer la mitjana de les desviacions. Però la seva suma és sempre exactament zero —és la propietat de "punt d'equilibri" de la mitjana que vas veure a la lliçó anterior—, així que la seva mitjana sempre surt 0 i no mesura res. Les desviacions negatives cancel·len les positives.
La solució clàssica és elevar al quadrat cada desviació abans de fer-ne la mitjana: els quadrats són sempre positius, ja no es cancel·len, i a més penalitzen més les desviacions grans (una desviació de 2.000 pesa quatre vegades més que una de 1.000, no el doble). D'aquí neix la variància.
La variància
La variància és la mitjana de les desviacions al quadrat. Per a una població de \( N \) valors amb mitjana \( \mu \):
\[ \sigma^2 = \frac{\sum_{i=1}^{N} (x_i - \mu)^2}{N} \]
Per a una mostra de \( n \) valors amb mitjana \( \bar{x} \) (fixa't en el denominador, de seguida ho justifiquem):
\[ s^2 = \frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n-1} \]
Càlcul pas a pas: Zaragoza-Centro
Tractem els 5 dies com una mostra de com es comporta la botiga (volem parlar de la botiga en general, no només d'aquella setmana).
Pas 1 — Desviacions i quadrats:
| Dia | \( x_i \) | \( x_i - \bar{x} \) | \( (x_i - \bar{x})^2 \) |
|---|---|---|---|
| Dilluns | 43.000 | −1.000 | 1.000.000 |
| Dimarts | 43.500 | −500 | 250.000 |
| Dimecres | 44.000 | 0 | 0 |
| Dijous | 44.500 | +500 | 250.000 |
| Divendres | 45.000 | +1.000 | 1.000.000 |
| Suma | 0 | 2.500.000 |
Pas 2 — Dividir entre \( n - 1 = 4 \):
\[ s^2 = \frac{2.500.000}{4} = 625.000 \text{ €}^2 \]
I ara Bilbao-Casco
| Dia | \( x_i \) | \( x_i - \bar{x} \) | \( (x_i - \bar{x})^2 \) |
|---|---|---|---|
| Dilluns | 38.000 | −6.000 | 36.000.000 |
| Dimarts | 41.000 | −3.000 | 9.000.000 |
| Dimecres | 44.000 | 0 | 0 |
| Dijous | 47.000 | +3.000 | 9.000.000 |
| Divendres | 50.000 | +6.000 | 36.000.000 |
| Suma | 0 | 90.000.000 |
\[ s^2 = \frac{90.000.000}{4} = 22.500.000 \text{ €}^2 \]
La variància de Bilbao és 36 vegades la de Zaragoza. La diferència queda claríssima… però què vol dir "625.000 euros al quadrat"? Res d'interpretable: en elevar al quadrat, les unitats també es van elevar. La variància és una peça tècnica fonamental (reapareixerà constantment en inferència), però no és la mesura que comuniques a la Marta.
La desviació típica
La desviació típica (o desviació estàndard) desfà el quadrat: és l'arrel quadrada de la variància, i torna a estar en les unitats originals.
\[ \sigma = \sqrt{\sigma^2} \qquad \text{(poblacional)} \qquad \qquad s = \sqrt{s^2} \qquad \text{(mostral)} \]
- Zaragoza-Centro: \( s = \sqrt{625.000} \approx 790{,}6 \) €
- Bilbao-Casco: \( s = \sqrt{22.500.000} \approx 4.743{,}4 \) €
Interpretació pràctica: la desviació típica és, aproximadament, la distància "típica" d'una dada qualsevol a la mitjana. Un dia normal de Zaragoza s'allunya dels seus 44.000 € uns 800 €; un dia normal de Bilbao, gairebé 4.750 €. Ara sí que tens la frase per a la Marta: «Les dues botigues facturen de mitjana 44.000 € diaris, però la desviació típica de Bilbao (≈ 4.743 €) és unes sis vegades la de Zaragoza (≈ 791 €): mateixa mitjana, risc molt diferent».
Dos apunts:
- La desviació típica mai no és negativa, i val 0 només si totes les dades són idèntiques.
- Quan les dades segueixen la famosa "corba normal", la desviació típica permet regles molt concretes del tipus "el 95 % dels dies cauen a menys de 2 desviacions de la mitjana". Aquesta regla empírica la veuràs amb detall a la lliçó de la Distribució Normal; de moment queda't amb la lectura de "distància típica".
- Com que es construeix sobre la mitjana, n'hereta la sensibilitat als valors extrems: una sola dada disbaratada infla molt \( s \). Recorda-ho quan treballem amb atípics a la propera lliçó.
Poblacional ((\sigma)) davant de mostral ((s)): el perquè de l'n−1
Ja et deu haver cridat l'atenció el denominador: \( N \) per a la població, \( n-1 \) per a la mostra. No és un caprici.
Quan fer servir cadascuna:
| Fórmula | Denominador | Quan | Exemple NovaMarket |
|---|---|---|---|
| \( \sigma^2, \sigma \) | \( N \) | Tens totes les dades de la població que t'interessa i només vols descriure-la | Les vendes de les 42 botigues ahir, si la teva pregunta és només sobre ahir |
| \( s^2, s \) | \( n-1 \) | Tens una mostra i vols estimar la dispersió de la població | 5 dies observats per parlar de la botiga "en general" |
La intuïció de l'n−1. Quan treballes amb una mostra no coneixes la veritable mitjana poblacional \( \mu \); en el seu lloc fas servir la mitjana mostral \( \bar{x} \), calculada amb les mateixes dades. I \( \bar{x} \) és, per construcció, el valor que fa les desviacions al quadrat tan petites com és possible: les dades sempre són més a prop de la seva pròpia mitjana que de la mitjana veritable \( \mu \). Resultat: si divideixes entre \( n \), subestimes sistemàticament la variància de la població. Dividir entre \( n-1 \) engrandeix el resultat just el necessari per corregir aquest biaix (per això a \( s^2 \) se l'anomena quasivariància o variància corregida).
Una altra manera de veure-ho: de les \( n \) desviacions, només \( n-1 \) són "lliures", perquè coneguda la mitjana, l'última desviació queda obligada (han de sumar zero). Es diu que hi ha \( n-1 \) graus de llibertat, un concepte que reapareixerà al Mòdul 5.
Amb les nostres dades de Zaragoza: \( \sigma = \sqrt{2.500.000/5} = \sqrt{500.000} \approx 707{,}1 \) € davant de \( s \approx 790{,}6 \) €. Amb \( n = 5 \) la diferència es nota (un 12 %); amb \( n = 500 \) seria irrellevant. Regla pràctica: a l'empresa gairebé sempre treballes amb mostres → fes servir \( n-1 \) per defecte (és el que fan els fulls de càlcul amb les seves funcions "mostrals"); la diferència només importa amb mostres petites.
El coeficient de variació
La desviació típica està en les unitats de la variable, i això, que era un avantatge per interpretar, es torna un problema per comparar dispersions de variables amb escales o unitats diferents. Què varia més: els imports dels tiquets o la satisfacció dels socis? Comparar 21,50 € amb 1,6 punts és comparar peres amb pomes.
El coeficient de variació (CV) ho resol expressant la desviació típica com a percentatge de la mitjana:
\[ CV = \frac{s}{\bar{x}} \times 100 \]
Exemple 1: les dues botigues
- Zaragoza-Centro: \( CV = 790{,}6 / 44.000 \times 100 \approx 1{,}8,% \)
- Bilbao-Casco: \( CV = 4.743{,}4 / 44.000 \times 100 \approx 10{,}8,% \)
Aquí les mitjanes eren iguals i el CV no hi afegeix gaire. El seu veritable valor apareix quan les escales difereixen.
Exemple 2: variables d'escales diferents
Amb les dades consolidades de NovaMarket:
| Variable | Mitjana | Desviació típica | CV |
|---|---|---|---|
| Import del tiquet | 32,40 € | 21,50 € | 66,4 % |
| Venda diària per botiga | 43.983 € | 6.200 € | 14,1 % |
| Satisfacció (0–10) | 8,1 | 1,6 | 19,8 % |
Lectura: encara que la desviació típica de les vendes diàries (6.200 €) és enorme comparada amb la dels tiquets (21,50 €), en termes relatius els tiquets són molt més variables (66 % de la seva mitjana davant del 14 %). Té tota la lògica de negoci: un tiquet pot ser de 3 € o de 300 €, però una botiga sencera fa la mitjana de milers de compres al dia i els seus totals són proporcionalment més estables.
Precaucions amb el CV:
- Només té sentit amb variables d'escala de raó (zero real i valors positius): euros, temps, unitats. Amb temperatures en °C o amb escales tipus 0–10 la seva interpretació és discutible (la satisfacció és a la taula com a il·lustració; tracta-la amb cautela).
- Si la mitjana és a prop de zero, el CV explota i deixa de ser interpretable.
Lectura gerencial de la dispersió
Tradueix sempre la dispersió a l'idioma del negoci. Amb el cas Zaragoza/Bilbao:
- Planificació de plantilles: Zaragoza pot dimensionar caixes i reposadors gairebé amb pilot automàtic; Bilbao necessita torns flexibles per no pagar hores mortes els dies fluixos ni col·lapsar els forts.
- Gestió d'estoc: la variabilitat de la demanda obliga Bilbao a mantenir més estoc de seguretat (més capital immobilitzat i més minva en frescos) per no trencar estoc els dies punta.
- Tresoreria i objectius: amb la mateixa mitjana, Bilbao incomplirà el seu objectiu diari molts més dies (i el superarà uns quants més). Avaluar els seus responsables només per dies solts seria injust.
- Risc i qualitat de servei: en els temps de lliurament de l'e-commerce, la mitjana importa menys que la dispersió: un client no percep "la mitjana de 24 h", percep el seu lliurament; una dispersió alta significa molts clients amb experiències dolentes encara que la mitjana sigui bona.
- Senyal de recerca: una dispersió alta és sovint una pregunta disfressada: què fa diferents els dies (o botigues, o comandes) bons i dolents? Detectar-la és el primer pas d'anàlisis que arribaran després (comparacions entre grups, regressió…).
La frase que t'has de gravar: mateixa mitjana, dispersió diferent = risc diferent i gestió diferent.
Errors Comuns i Consells
- Informar d'una mitjana sense la seva dispersió. «Tiquet mitjà: 32,40 €» diu la meitat; «32,40 € amb desviació típica de 21,50 €» descriu el negoci real.
- Interpretar la variància directament. Les seves unitats al quadrat (€²) no signifiquen res per a negoci; comunica sempre la desviació típica i guarda't la variància per als càlculs.
- Confondre \( \sigma \) i \( s \) o fer servir la fórmula poblacional amb una mostra petita: subestimaràs la variabilitat. En cas de dubte, \( n-1 \).
- Comparar desviacions típiques de variables amb mitjanes o unitats molt diferents. Per a això hi ha el coeficient de variació.
- Oblidar que \( s \) és sensible a atípics. Un únic valor d'error (un tiquet de 3.240 € que en realitat era de 32,40 €) pot multiplicar la desviació típica. Inspecciona els extrems abans de calcular (lliçó següent).
- Consell: verifica sempre que la suma de les desviacions et doni 0 (o gairebé 0, per arrodoniments) abans d'elevar al quadrat; és la comprovació aritmètica més barata que existeix.
Exercicis
Exercici 2.1: desviació típica pas a pas
Vendes diàries de Valencia-Ruzafa la mateixa setmana (en euros): 40.000 — 42.000 — 44.000 — 46.000 — 48.000.
- Calcula la mitjana, la variància mostral \( s^2 \) i la desviació típica \( s \).
- Situa la botiga entre Zaragoza-Centro (\( s \approx 791 \) €) i Bilbao-Casco (\( s \approx 4.743 \) €): a quina s'assembla més en estabilitat?
Exercici 2.2: triar proveïdor amb la mateixa mitjana
Dos operadors logístics ofereixen el repartiment de l'e-commerce. En una prova amb 60 comandes cadascun, tots dos aconsegueixen un temps mitjà de lliurament de 24 hores, però l'operador A té una desviació típica de 3 hores i el B de 9 hores.
- Sense fer comptes: què significa aquesta diferència per a l'experiència dels clients?
- Calcula el CV de cada operador. Quin recomanaries a la Marta i amb quin argument gerencial?
Exercici 2.3: comparar variabilitat entre botigues amb el CV
Imports de tiquet de dues botigues: Madrid-Centro té mitjana de 34,10 € i desviació típica de 24,50 €; Cuenca té mitjana de 27,80 € i desviació típica de 12,30 €.
Quina botiga té tiquets més variables en termes absoluts? I en termes relatius? Calcula tots dos CV i interpreta'ls.
Solucions
Exercici 2.1:
- Mitjana: \( 220.000/5 = 44.000 \) €. Desviacions: −4.000, −2.000, 0, +2.000, +4.000 (sumen 0 ✓). Quadrats: 16.000.000 + 4.000.000 + 0 + 4.000.000 + 16.000.000 = 40.000.000. Variància mostral: \( s^2 = 40.000.000/4 = 10.000.000 \) €². Desviació típica: \( s = \sqrt{10.000.000} \approx 3.162{,}3 \) €.
- Amb \( s \approx 3.162 \) € (CV ≈ 7,2 %), Valencia-Ruzafa queda entre totes dues, força més a prop del perfil variable de Bilbao que de l'estabilitat de Zaragoza. Error freqüent: dividir entre \( n = 5 \) en lloc d'entre \( n-1 = 4 \) (donaria \( s \approx 2.828 \) €); són 5 dies de mostra, no la població.
Exercici 2.2:
- Amb la mateixa mitjana, l'operador B tindrà molts més lliuraments molt primerencs i, sobretot, molt tardans: més clients esperant 33, 40 o més hores. La mitjana no captura aquestes males experiències; la dispersió sí.
- \( CV_A = 3/24 \times 100 = 12{,}5,% \); \( CV_B = 9/24 \times 100 = 37{,}5,% \). Recomanació: l'operador A, perquè a igualtat de cost i de mitjana ofereix un servei predictible: menys incidències, menys reclamacions i la possibilitat de prometre terminis fiables al client. Error freqüent: concloure que "són iguals perquè la mitjana és la mateixa": és exactament l'error que aquesta lliçó ensenya a evitar.
Exercici 2.3:
En termes absoluts, Madrid-Centro (24,50 € > 12,30 €). En termes relatius també: \( CV_{Madrid} = 24{,}50/34{,}10 \times 100 \approx 71{,}8,% \) davant de \( CV_{Cuenca} = 12{,}30/27{,}80 \times 100 \approx 44{,}2,% \). Interpretació: la clientela de Madrid-Centro és més heterogènia (barreja compres petites de passada amb grans compres, incloent-hi negocis d'hostaleria), mentre que Cuenca té un patró de compra més homogeni. Nota: aquí tots dos veredictes coincideixen, però no sempre passa: quan les mitjanes difereixen molt, només el CV permet una comparació justa.
Conclusió
Ara saps mesurar el que la mitjana amaga: el rang com a cop d'ull ràpid, la variància com a peça tècnica, la desviació típica com a "distància típica a la mitjana" en unitats reals (dividint entre \( n-1 \) quan treballes amb mostres) i el coeficient de variació per comparar variabilitats entre escales diferents. I saps traduir-ho a l'idioma de la Marta: mateixa mitjana amb dispersió diferent significa risc diferent, estoc diferent, plantilles diferents.
Mitjana i desviació típica descriuen el centre i l'amplada de les dades, però continuen sense dir-te on cau una dada concreta dins del conjunt: un tiquet de 95 € és una cosa notable o una cosa extraordinària? A partir de quin temps de lliurament una comanda és un cas rar per investigar? Per respondre necessites les mesures de posició —quartils, percentils, puntuacions z— i les eines per detectar valors atípics. És el contingut de la propera lliçó: Mesures de Posició i Valors Atípics.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
