Amb la mitjana i la desviació típica ja descrius el centre i l'amplada de les teves dades. Però la Marta rarament pregunta per "les dades en general"; pregunta per casos concrets: «Una comanda que va trigar 36 hores és normal o és una incidència?», «Aquest soci és entre els que més gasten?», «Aquell tiquet de 3.240 € és real o algú va teclejar malament?». Per respondre necessites saber on cau un valor dins del conjunt: això fan les mesures de posició (quartils, decils, percentils i puntuacions z) i, amb elles, les regles per detectar valors atípics. En aquesta lliçó aprendràs a calcular-les, a llegir un diagrama de caixa i, sobretot, a decidir què fer quan apareix una dada sospitosa —una decisió que connecta directament amb la qualitat de dades que vas veure a Tipus de Dades.
Contingut
- La idea de posició relativa
- Quartils
- Decils i percentils
- El rang interquartílic (IQR)
- El diagrama de caixa (boxplot)
- Detecció d'atípics: la regla 1,5×IQR
- Puntuacions z: posició en unitats de desviació típica
- Què faig amb un atípic?
La idea de posició relativa
Una dada aïllada no diu gairebé res: 36 hores de lliurament és molt? Depèn de com es reparteixen els altres lliuraments. Les mesures de posició responen ordenant les dades de menor a major i localitzant punts de tall que divideixen el conjunt en parts amb el mateix nombre d'observacions:
| Mesura | Divideix les dades en… | Punts de tall |
|---|---|---|
| Mediana | 2 meitats | 1 (el 50 %) |
| Quartils | 4 quarts | 3 (Q1, Q2, Q3) |
| Decils | 10 dècimes parts | 9 (D1 … D9) |
| Percentils | 100 centèsimes | 99 (P1 … P99) |
Totes són la mateixa idea amb resolucions diferents: la mediana és Q2, que és D5, que és P50. Com que es basen en l'ordre i no en els valors dels extrems, són mesures robustes, igual que la mediana.
El material de treball: 12 lliuraments de l'e-commerce
Logística et passa els temps de lliurament (en hores, des de la comanda fins a la porta del client) de 12 comandes de la setmana passada, ja ordenats:
\[ 18 \quad 20 \quad 21 \quad 22 \quad 24 \quad 25 \quad 26 \quad 28 \quad 30 \quad 33 \quad 36 \quad 72 \]
La comanda de 72 hores crida l'atenció de seguida (un client va estar tres dies esperant). Treballarem tota la lliçó amb aquesta mostra.
Quartils
Els quartils divideixen les dades ordenades en quatre parts iguals:
- Q1 (primer quartil): deixa per sota el 25 % de les dades.
- Q2 (segon quartil): la mediana; deixa per sota el 50 %.
- Q3 (tercer quartil): deixa per sota el 75 %.
Farem servir el mètode de la posició interpolada: el quartil \( k \) és a la posició
\[ \text{posició de } Q_k = \frac{k , (n+1)}{4} \]
i si la posició no és entera, s'interpola entre els dos valors veïns. (Avís honest: existeixen diverses convencions de càlcul i els fulls de càlcul poden donar resultats lleugerament diferents entre si; amb mostres grans les diferències són irrellevants.)
Càlcul pas a pas amb els 12 lliuraments (( n = 12 ))
Q1: posició \( \frac{1 \times 13}{4} = 3{,}25 \) → és un 25 % del camí entre el 3r valor (21) i el 4t (22):
\[ Q_1 = 21 + 0{,}25 \times (22 - 21) = 21{,}25 \text{ hores} \]
Q2 (mediana): posició \( \frac{2 \times 13}{4} = 6{,}5 \) → a mig camí entre el 6è valor (25) i el 7è (26):
\[ Q_2 = \frac{25 + 26}{2} = 25{,}5 \text{ hores} \]
Q3: posició \( \frac{3 \times 13}{4} = 9{,}75 \) → un 75 % del camí entre el 9è valor (30) i el 10è (33):
\[ Q_3 = 30 + 0{,}75 \times (33 - 30) = 32{,}25 \text{ hores} \]
Lectura de negoci: el 25 % de les comandes arriba en menys de ~21 h; la meitat, en menys de 25,5 h; el 75 %, en menys de ~32 h. Ja pots contestar a la Marta: una comanda de 36 hores és per sobre de Q3 —entre el 25 % més lent— però dins del que passa cada setmana. La de 72 hores és una altra història, com veurem.
Decils i percentils
Els decils i percentils afinen la mateixa idea. El percentil \( P_k \) és el valor que deixa per sota el \( k,% \) de les dades; la seva posició interpolada és \( \frac{k,(n+1)}{100} \). Per exemple, amb els lliuraments, \( P_{10} \): posició \( 0{,}10 \times 13 = 1{,}3 \) → \( 18 + 0{,}3 \times (20-18) = 18{,}6 \) hores: només el 10 % de les comandes arriba abans de ~18,6 h.
Els percentils són omnipresents en la gestió:
- Compromisos de servei (SLA): logística de NovaMarket no promet "lliurament mitjà de 26 h" sinó «el 90 % de les comandes en menys de 48 h», és a dir, un compromís sobre el P90. La mitjana no protegeix el client que cau a la cua lenta; el percentil sí.
- Segmentació de clients: l'equip de fidelització classifica els ≈380.000 socis del Club Nova per la seva despesa anual fent servir decils:
| Decil | Despesa anual (límit superior) | Lectura |
|---|---|---|
| D1 | 120 € | El 10 % que menys gasta no arriba a 120 €/any |
| D2 | 210 € | |
| D3 | 310 € | |
| D4 | 430 € | |
| D5 | 580 € | Despesa mediana: la meitat dels socis gasta menys de 580 € |
| D6 | 760 € | |
| D7 | 990 € | |
| D8 | 1.320 € | |
| D9 | 1.980 € | El 10 % superior gasta més de 1.980 €/any |
Fixa't en l'asimetria: de D1 a D2 hi ha 90 €, però de D8 a D9 n'hi ha 660. Els decils dibuixen la forma de la distribució sense necessitat de gràfic: cua llarga cap a les despeses altes, com correspon a imports.
- Posició individual: dir a un soci (o a un gestor) «aquest client és al percentil 92 de despesa» és més informatiu que «gasta 2.300 €».
El rang interquartílic (IQR)
El rang interquartílic és l'amplada del "50 % central" de les dades:
\[ IQR = Q_3 - Q_1 \]
Amb els lliuraments: \( IQR = 32{,}25 - 21{,}25 = 11 \) hores. La meitat central de les comandes cap en una finestra d'11 hores.
L'IQR és l'alternativa robusta a la desviació típica, igual que la mediana ho és a la mitjana: com que ignora el 25 % inferior i el 25 % superior, els valors extrems no l'alteren. Comprova-ho: si la comanda de 72 h hagués trigat 172 h, la desviació típica de la mostra es dispararia, però Q1, Q3 i l'IQR no es mourien ni una dècima. Per això l'IQR és la base de la regla estàndard de detecció d'atípics que veurem de seguida.
Resum de parelles centre–dispersió:
| Enfocament | Centre | Dispersió | Quan convé |
|---|---|---|---|
| Clàssic | Mitjana \( \bar{x} \) | Desviació típica \( s \) | Dades sense extrems problemàtics; càlculs posteriors |
| Robust | Mediana | IQR | Dades asimètriques o amb atípics; descripció honesta |
El diagrama de caixa (boxplot)
El diagrama de caixa (boxplot) és la representació gràfica de tot l'anterior en un sol dibuix. Es construeix així:
- Una caixa que va de Q1 a Q3 (la seva longitud és l'IQR).
- Una línia dins de la caixa a la mediana.
- Bigotis: línies que s'estenen des de la caixa fins a la dada més extrema que no sigui atípica (segons la regla 1,5×IQR de l'apartat següent).
- Punts individuals més enllà dels bigotis: els atípics, dibuixats un a un.
Per als nostres lliuraments, el resum que el boxplot representa és:
| Element | Valor |
|---|---|
| Mínim (no atípic) | 18 h |
| Q1 (inici de la caixa) | 21,25 h |
| Mediana (línia central) | 25,5 h |
| Q3 (final de la caixa) | 32,25 h |
| Màxim no atípic (final del bigoti) | 36 h |
| Atípics (punts solts) | 72 h |
Com es llegeix:
- Posició de la caixa → on viu el 50 % central.
- Longitud de la caixa → dispersió (IQR).
- Mediana descentrada dins de la caixa i bigotis desiguals → asimetria. En els nostres lliuraments, el bigoti i les dades superiors s'estiren molt més que els inferiors: asimetria cap a la dreta (cua de comandes lentes).
- Punts solts → candidats a investigar.
La seva gran virtut és la comparació: alineant un boxplot per botiga (o per mes, o per operador logístic) es comparen d'un cop d'ull centres, dispersions i atípics de molts grups. Ho explotarem a la propera lliçó, Representació Gràfica de Dades.
Detecció d'atípics: la regla 1,5×IQR
Un valor atípic (outlier) és una observació anormalment allunyada de la resta. "Anormalment" necessita una definició operativa, i la convenció més estesa (proposada per John Tukey, l'inventor del boxplot) fa servir l'IQR. Es calculen dues tanques:
\[ \text{Tanca inferior} = Q_1 - 1{,}5 \times IQR \qquad \qquad \text{Tanca superior} = Q_3 + 1{,}5 \times IQR \]
Tota dada fora de les tanques es marca com a atípica.
Aplicació als 12 lliuraments
\[ 1{,}5 \times IQR = 1{,}5 \times 11 = 16{,}5 \] \[ \text{Tanca inferior} = 21{,}25 - 16{,}5 = 4{,}75 \text{ h} \qquad \text{Tanca superior} = 32{,}25 + 16{,}5 = 48{,}75 \text{ h} \]
Cap comanda no baixa de 4,75 h (el mínim és 18), però 72 h > 48,75 h: la comanda de 72 hores és un atípic formal, no només una impressió. Els bigotis del boxplot arriben fins a 18 i 36 (les dades més extremes dins de les tanques), i el 72 es dibuixa com a punt aïllat.
Observa l'efecte sobre els resums clàssics: la mitjana dels 12 lliuraments és \( 355/12 \approx 29{,}6 \) h, però sense l'atípic baixa a \( 283/11 \approx 25{,}7 \) h, molt més a prop de la mediana (25,5 h). Una sola comanda movia la mitjana gairebé 4 hores.
Dos matisos importants:
- La regla és un detector de candidats, no un jutge: marca dades "per investigar", no dades "per esborrar".
- En distribucions naturalment asimètriques (imports, temps) és normal que apareguin alguns atípics legítims pel costat llarg; amb mostres grans, uns quants punts fora de les tanques no són cap alarma.
Puntuacions z: posició en unitats de desviació típica
Les mesures anteriors situen una dada pel seu ordre. La puntuació z (o valor tipificat) la situa per la seva distància a la mitjana, mesurada en desviacions típiques:
\[ z = \frac{x - \bar{x}}{s} \]
- \( z = 0 \): la dada coincideix amb la mitjana.
- \( z = +1 \): és una desviació típica per sobre de la mitjana.
- \( z = -2 \): dues desviacions típiques per sota.
La seva gran utilitat és que elimina les unitats: permet comparar posicions relatives entre variables d'escales completament diferents.
Exemple: què va ser més excepcional?
El mateix dia passen dues coses: un client paga un tiquet de 95 € i la botiga Madrid-Chamberí factura 60.000 €. Quin dels dos fets és més extraordinari en el seu context? Amb les xifres de referència de NovaMarket:
| Fet | Valor \( x \) | Mitjana \( \bar{x} \) | Desv. típica \( s \) | Puntuació z |
|---|---|---|---|---|
| Tiquet de 95 € | 95 | 32,40 € | 21,50 € | \( z = \frac{95 - 32{,}40}{21{,}50} \approx +2{,}91 \) |
| Dia de 60.000 € | 60.000 | 43.983 € | 6.200 € | \( z = \frac{60.000 - 43.983}{6.200} \approx +2{,}58 \) |
Encara que 60.000 € "sona" molt més gran que 95 €, el tiquet és més excepcional dins del seu món: és gairebé 3 desviacions típiques per sobre de la seva mitjana, davant de les 2,6 del dia de vendes. Les puntuacions z funcionen com una moneda comuna de "raresa".
Un exemple amb signe negatiu: un soci puntua la satisfacció amb un 5. Amb mitjana 8,1 i desviació típica 1,6: \( z = (5 - 8{,}1)/1{,}6 \approx -1{,}94 \). És gairebé dues desviacions per sota del soci mitjà: un descontent clar a qui atenció al client potser hauria de trucar.
Com a criteri orientatiu, els valors amb \( |z| > 3 \) solen tractar-se també com a candidats a atípics. De moment fes-lo servir només com a regla de posició relativa: quina proporció de dades cal esperar més enllà de cada valor de z és una cosa que depèn de la forma de la distribució i que podràs precisar quan estudiïs la Distribució Normal. Tingues en compte, a més, que \( \bar{x} \) i \( s \) no són robustes: en mostres petites amb extrems, la regla de l'IQR és més fiable que la de les z.
Què faig amb un atípic?
Detectar l'atípic és la part fàcil; decidir què fer-ne és on et jugues la qualitat de l'anàlisi. El protocol professional té tres passos:
1. Investigar-ne l'origen. Torna a la font (el sistema de tiquets, el registre de la comanda, el qüestionari) i pregunta: és un error de registre o un valor real?
| Diagnòstic | Exemple NovaMarket | Acció |
|---|---|---|
| Error de registre | Un tiquet de 3.240,00 € que resulta ser un de 32,40 € amb la coma decimal mal teclejada; un lliurament amb data de comanda posterior a la de lliurament | Corregir si coneixes el valor veritable; si no, tractar-lo com a dada perduda. Documentar-ho sempre |
| Valor real però aliè a la població d'interès | El tiquet de 289 € del bar: és real, però si la teva anàlisi és sobre llars, aquell client majorista no pertany a la població definida | Excloure'l de l'anàlisi, declarant-ho: redefineixes l'abast, no "neteges" |
| Valor real i pertinent | La comanda de 72 h: hi va haver una avaria en el repartiment d'aquella ruta | Conservar-lo. És informació valuosíssima: els atípics reals són sovint la troballa (frau, avaries, clients excepcionals) |
2. Analitzar amb ell i sense ell quan hi hagi dubtes. Si la conclusió de negoci canvia segons incloguis o no l'atípic, el teu resultat és fràgil i ho has de dir. Si no canvia, millor: informa'n amb la dada inclosa.
3. Documentar la decisió. A l'informe (i al diccionari de dades que vas muntar a Tipus de Dades): què vas detectar, què vas decidir i per què. Mai no esborris dades en silenci: una anàlisi on els atípics desapareixen sense explicació no és reproduïble ni honesta.
La regla d'or: un atípic s'investiga; només es corregeix si és un error demostrat, i només s'exclou si no pertany a la població que estudies.
Errors Comuns i Consells
- Oblidar ordenar les dades abans de buscar quartils o percentils. És l'errada número u; tota mesura de posició pressuposa dades ordenades.
- Alarmar-se perquè el full de càlcul dona un altre quartil. Hi ha diverses convencions d'interpolació legítimes; documenta quina fas servir i no barregis mètodes en comparar.
- Confondre el percentil amb el valor. «Ser al P90 de despesa» no significa gastar 90 € ni gastar un 90 % més: significa gastar més que el 90 % dels socis.
- Esborrar atípics automàticament (o, al revés, no mirar mai els extrems). Tots dos destrueixen informació: la regla 1,5×IQR marca candidats a investigar, no una llista d'eliminació.
- Fer servir puntuacions z amb dades molt asimètriques o mostres petites com a únic criteri: mitjana i desviació típica estan contaminades justament pels valors que intentes jutjar. Prefereix l'IQR en aquests casos.
- Consell: acostuma't a demanar (o construir) el resum de cinc números —mínim, Q1, mediana, Q3, màxim— de tota variable nova que t'arribi. Són cinc xifres i expliquen la forma completa de la distribució.
Exercicis
Exercici 3.1: quartils, IQR i tanques
Onze imports de tiquet de la botiga Barcelona-Gràcia, ja ordenats (en euros): 9,80 — 14,20 — 19,60 — 22,10 — 25,40 — 28,90 — 33,50 — 38,70 — 44,20 — 51,80 — 120,00.
- Calcula Q1, Q2 i Q3 amb el mètode de la posició \( k(n+1)/4 \).
- Calcula l'IQR i les tanques de la regla 1,5×IQR. Hi ha atípics?
- Descriu com seria el boxplot (extrems de la caixa, mediana, bigotis, punts solts).
Exercici 3.2: comparar amb puntuacions z
Un dia concret, la botiga de Cuenca factura 39.500 € i Sevilla-Nervión factura 52.000 €. Fent servir la mitjana (43.983 €) i la desviació típica (6.200 €) de les vendes diàries de la cadena:
- Calcula la puntuació z de cada botiga aquell dia.
- Interpreta els signes i les magnituds. Algun dels dos dies és "excepcional" segons el criteri orientatiu \( |z| > 3 \)?
Exercici 3.3: decidir què fer
Al fitxer de l'enquesta de satisfacció hi trobes tres casos: (a) un soci amb edat registrada de 141 anys; (b) un soci amb despesa anual de 9.400 € que, comprovat, és el propietari d'un restaurant que fa les seves compres a NovaMarket; (c) una satisfacció de 0 d'un client que va escriure un comentari furiós sobre un lliurament perdut. La teva anàlisi busca descriure la satisfacció de les llars sòcies del Club Nova. Què faries amb cada cas?
Solucions
Exercici 3.1:
- \( n = 11 \), així que \( n+1 = 12 \) i les posicions són enteres: Q1 a la posició 3 → 19,60 €; Q2 a la posició 6 → 28,90 €; Q3 a la posició 9 → 44,20 €.
- \( IQR = 44{,}20 - 19{,}60 = 24{,}60 \) €. \( 1{,}5 \times IQR = 36{,}90 \). Tanques: \( 19{,}60 - 36{,}90 = -17{,}30 \) € i \( 44{,}20 + 36{,}90 = 81{,}10 \) €. El tiquet de 120,00 € és atípic (supera la tanca superior); no hi ha atípics inferiors (una tanca negativa és normal i simplement inabastable amb imports). Error freqüent: fer servir el màxim i el mínim reals com a bigotis encara que hi hagi atípics.
- Caixa de 19,60 a 44,20 amb la mediana a 28,90 (descentrada cap avall: asimetria a la dreta); bigoti inferior fins a 9,80 (mínim, dins de tanques) i superior fins a 51,80 (la dada més gran ≤ 81,10); un punt aïllat a 120,00.
Exercici 3.2:
- Cuenca: \( z = (39.500 - 43.983)/6.200 \approx -0{,}72 \). Sevilla-Nervión: \( z = (52.000 - 43.983)/6.200 \approx +1{,}29 \).
- Cuenca és una mica per sota de la mitjana de la cadena (menys d'una desviació típica: un dia fluix però corrent); Sevilla, clarament per sobre però sense arribar a rar. Cap no supera \( |z| > 3 \): no hi ha res d'excepcional per investigar. Error freqüent: comparar els euros directament (52.000 davant de 39.500) sense tipificar; compte també amb fer servir la mitjana de la cadena si el que vols és comparar cada botiga amb el seu propi històric, que seria una altra pregunta (i unes altres \( \bar{x} \) i \( s \)).
Exercici 3.3:
(a) Error de registre evident (ningú no té 141 anys): intenta recuperar el valor real (un 41?); si no és possible, marca'l com a perdut. Documenta-ho. (b) Valor real però fora de la població definida (llars): exclou-lo de l'anàlisi declarant-ho a l'informe; no és "neteja", és definició d'abast. (c) Valor real i pertinent: conserva'l; aquell 0 amb el seu comentari és probablement la dada més accionable de l'enquesta per a logística. Error freqüent: tractar els tres casos igual (esborrar-los "per ser rars"); cada atípic exigeix el seu propi diagnòstic.
Conclusió
Ja domines la caixa d'eines descriptiva completa: a la mitjana i la desviació típica hi has afegit quartils, decils i percentils per localitzar qualsevol dada pel seu ordre, l'IQR com a dispersió robusta, el boxplot com a resum visual de cinc números, la regla 1,5×IQR per assenyalar candidats a atípics, les puntuacions z per comparar rareses entre escales diferents i, el més important, un protocol per decidir —investigant, no esborrant— què fer amb cada dada anòmala.
Fins ara tots aquests resums han estat numèrics. Però quan la Marta entri al comitè de direcció no projectarà taules de quartils: projectarà gràfics, i que estiguin ben triats i ben construïts determinarà que la sala entengui —o malinterpreti— les dades. Triar el gràfic adequat per a cada tipus de variable, llegir la forma d'una distribució i esquivar els gràfics enganyosos és el tema de la propera lliçó: Representació Gràfica de Dades.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
