A les dues lliçons anteriors hem treballat amb esdeveniments descrits amb paraules: «el tiquet es paga amb targeta», «la comanda arriba tard». Però l'anàlisi de dades guanya potència quan l'atzar es tradueix a números: en lloc de preguntar-nos per un esdeveniment concret, descrivim d'una sola vegada totes les probabilitats de tots els valors possibles d'una quantitat incerta. Aquest objecte s'anomena variable aleatòria, i el seu «carnet d'identitat» és la seva distribució de probabilitat. En aquesta lliçó aprendràs a distingir variables aleatòries discretes i contínues, a llegir i construir la taula de distribució d'una discreta, a calcular-ne l'esperança i la variància (amb una aplicació de negoci directa: decidir si una promoció del Club Nova és rendible), i a entendre què són la funció de densitat i la funció de distribució en el cas continu — sense integrals, amb la intuïció de l'histograma. Tanquem amb la idea que dona nom al Mòdul 4: els models de distribució com a plantilles reutilitzables.
Contingut
- Què és una variable aleatòria; discretes vs contínues
- La funció de massa de probabilitat i la taula de distribució
- Esperança matemàtica: el valor mitjà a llarg termini
- Variància i desviació típica d'una variable aleatòria
- El valor esperat com a criteri de decisió: la promoció del Club Nova
- Variables contínues: funció de densitat i funció de distribució acumulada
- Models de distribució: plantilles per a l'atzar
Què és una variable aleatòria; discretes vs contínues
Una variable aleatòria (v.a.) és una regla que assigna un número al resultat d'un experiment aleatori. Es denota amb majúscules (\( X, Y, Z \)) i els seus valors concrets amb minúscules (\( x, y, z \)). Abans de dur a terme l'experiment, \( X \) és incerta; després, pren un valor concret.
| Experiment NovaMarket | Variable aleatòria | Valors possibles | Tipus |
|---|---|---|---|
| Un client passa per caixa | \( X \) = import del tiquet (€) | qualsevol valor > 0 | Contínua |
| S'observa un tiquet | \( Y \) = 1 si paga amb targeta, 0 si no | {0, 1} | Discreta |
| Una hora al web | \( N \) = nre. de comandes rebudes | {0, 1, 2, …} | Discreta |
| S'envia una comanda | \( T \) = hores fins al lliurament | qualsevol valor ≥ 0 | Contínua |
| Un soci rep un cupó | \( C \) = 1 si el bescanvia, 0 si no | {0, 1} | Discreta |
La classificació replica la dels tipus de dades del Mòdul 1, ara amb probabilitats:
- Discreta: els seus valors possibles es poden enumerar (finits o infinits numerables). Sol néixer de comptar.
- Contínua: pot prendre qualsevol valor dins d'un interval. Sol néixer de mesurar (imports, temps, pesos).
La distinció importa perquè les eines matemàtiques són diferents: a una discreta se li assigna probabilitat valor a valor; a una contínua, per intervals.
La funció de massa de probabilitat i la taula de distribució
Per a una v.a. discreta \( X \), la funció de massa de probabilitat (f.m.p.) assigna a cada valor possible la seva probabilitat:
\[ p(x) = P(X = x) \]
Ha de complir dues condicions (herència directa dels axiomes de Kolmogórov): \( p(x) \geq 0 \) per a tot \( x \), i \( \sum_x p(x) = 1 \). A la pràctica es presenta com una taula de distribució.
Exemple NovaMarket: bosses reutilitzables. A caixa s'ofereixen bosses reutilitzables a 1 €. Analitzant milions de tiquets, l'equip de la Marta estima les probabilitats del nombre de bosses \( X \) que compra un client:
| \( x \) (nre. de bosses) | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| \( p(x) = P(X = x) \) | 0,60 | 0,25 | 0,10 | 0,05 |
Comprovació: \( 0{,}60 + 0{,}25 + 0{,}10 + 0{,}05 = 1 \). ✔ Nota el paral·lelisme amb el Mòdul 2: aquesta taula és com una taula de freqüències relatives, però descriu probabilitats del que passarà, no freqüències del que ja s'ha observat. L'enfocament freqüentista de la lliçó 03-01 és el pont entre totes dues.
De la taula se n'extreu la probabilitat de qualsevol esdeveniment sobre \( X \) sumant els valors que el componen:
- \( P(X \geq 1) = 0{,}25 + 0{,}10 + 0{,}05 = 0{,}40 \) — o millor, pel complementari: \( 1 - P(X=0) = 1 - 0{,}60 = 0{,}40 \).
- \( P(1 \leq X \leq 2) = 0{,}25 + 0{,}10 = 0{,}35 \).
Esperança matemàtica: el valor mitjà a llarg termini
L'esperança (o valor esperat) d'una v.a. discreta és la mitjana dels seus valors possibles ponderada per les seves probabilitats:
\[ E(X) = \mu = \sum_x x \cdot p(x) \]
És l'extensió natural de la mitjana ponderada del Mòdul 2, amb les probabilitats com a pesos. Interpretació clau: és el valor mitjà a llarg termini, el que obtindríem de mitjana si l'experiment es repetís moltíssimes vegades. No és «el valor més probable» ni ha de ser necessàriament un valor possible.
Amb les bosses:
\[ E(X) = 0 \times 0{,}60 + 1 \times 0{,}25 + 2 \times 0{,}10 + 3 \times 0{,}05 = 0 + 0{,}25 + 0{,}20 + 0{,}15 = 0{,}60 \text{ bosses} \]
Cap client no compra 0,6 bosses, però la dada és or per a operacions: amb uns 2.000 clients diaris a Madrid-Centro, es pot esperar vendre al voltant de \( 2.000 \times 0{,}60 = 1.200 \) bosses al dia — la base de la comanda de reposició.
Dues propietats útils (sense demostració): si \( a \) i \( b \) són constants, \( E(aX + b) = a,E(X) + b \). Per exemple, si cada bossa deixa 0,40 € de marge, el marge per client és la v.a. \( 0{,}40 \cdot X \), amb esperança \( 0{,}40 \times 0{,}60 = 0{,}24 \) €.
Variància i desviació típica d'una variable aleatòria
Igual que al Mòdul 2 la mitjana necessitava la desviació típica, l'esperança necessita una mesura de dispersió. La variància d'una v.a. mesura com s'allunyen els seus valors de l'esperança, en mitjana ponderada per probabilitats:
\[ \operatorname{Var}(X) = \sigma^2 = \sum_x (x - \mu)^2 , p(x) \qquad \sigma = \sqrt{\operatorname{Var}(X)} \]
Càlcul pas a pas amb les bosses (\( \mu = 0{,}60 \)):
| \( x \) | \( p(x) \) | \( x - \mu \) | \( (x-\mu)^2 \) | \( (x-\mu)^2 , p(x) \) |
|---|---|---|---|---|
| 0 | 0,60 | −0,60 | 0,36 | 0,2160 |
| 1 | 0,25 | 0,40 | 0,16 | 0,0400 |
| 2 | 0,10 | 1,40 | 1,96 | 0,1960 |
| 3 | 0,05 | 2,40 | 5,76 | 0,2880 |
| Suma: | 0,7400 |
\[ \operatorname{Var}(X) = 0{,}74 \qquad \sigma = \sqrt{0{,}74} \approx 0{,}86 \text{ bosses} \]
Lectura: el nombre de bosses per client fluctua típicament en ±0,86 al voltant de 0,60. Fixa't que aquí fem servir \( \sigma \) (paràmetre del model), no \( s \): no estem estimant a partir d'una mostra dividint entre \( n-1 \), sinó calculant la dispersió teòrica de la distribució. La \( s \) mostral del Mòdul 2 és l'estimació empírica d'aquesta \( \sigma \) teòrica.
El valor esperat com a criteri de decisió: la promoció del Club Nova
Aquí la teoria es converteix en diners. Reprenem el fil de l'exercici de retenció de la lliçó anterior, ara amb una campanya ofensiva: la Marta valora enviar un cupó de 5 € de descompte en compres superiors a 40 € als 380.000 socis del Club Nova. Dades estimades per l'equip (a partir de campanyes pilot):
- Cost d'emissió i comunicació per cupó enviat: 0,30 €.
- Probabilitat que un soci bescanviï el cupó: 0,18.
- Si el bescanvia, la compra associada deixa un marge brut mitjà de 7,50 € (ja descomptats els 5 € del cupó); un 60 % d'aquests bescanvis s'estima que són vendes incrementals (no haurien passat sense cupó), i el 40 % restant hauria passat igualment, amb la qual cosa el cupó els resta marge: en aquests casos l'efecte net és de −2,10 €.
Definim \( G \) = guany net per cupó enviat. La seva taula de distribució (aplicant la regla del producte de la lliçó anterior per a les branques del bescanvi):
| Escenari | Probabilitat | \( g \) (€) |
|---|---|---|
| No bescanvia | 0,82 | −0,30 |
| Bescanvia, venda incremental | \( 0{,}18 \times 0{,}60 = 0{,}108 \) | \( 7{,}50 - 0{,}30 = 7{,}20 \) |
| Bescanvia, venda que passaria igualment | \( 0{,}18 \times 0{,}40 = 0{,}072 \) | \( -2{,}10 - 0{,}30 = -2{,}40 \) |
Comprovació: \( 0{,}82 + 0{,}108 + 0{,}072 = 1 \). ✔ Esperança:
\[ E(G) = (-0{,}30)(0{,}82) + (7{,}20)(0{,}108) + (-2{,}40)(0{,}072) = -0{,}246 + 0{,}7776 - 0{,}1728 \approx 0{,}36 \text{ €} \]
Cada cupó enviat val, de mitjana, uns +0,36 €. Sobre 380.000 socis, la campanya té un resultat esperat de \( 380.000 \times 0{,}36 \approx 136.800 \) €: endavant. Tres observacions d'analista:
- La majoria dels cupons (82 %) perden diners individualment; la campanya és rendible perquè els bescanvis incrementals ho compensen amb escreix. Decidir pel cas més probable en lloc de pel valor esperat hauria matat una campanya rendible.
- El valor esperat és fiable aquí perquè s'aplicarà moltes vegades (380.000 enviaments): la llei dels grans nombres garanteix que el resultat real quedarà a prop de l'esperat. Per a una decisió única i irrepetible, el valor esperat continua sent orientatiu, però la dispersió i la tolerància al risc pesen més.
- La conclusió és sensible a les estimacions (el 0,18 i el 60 % incremental surten de pilots, és a dir, de mostres). Quanta confiança mereixen aquestes estimacions és exactament el tema del Mòdul 5.
Variables contínues: funció de densitat i funció de distribució acumulada
Per a una v.a. contínua com \( T \) = «hores fins al lliurament d'una comanda», preguntar \( P(T = 25{,}5) \) no té sentit útil: entre infinits valors possibles amb decimals il·limitats, la probabilitat de qualsevol valor exacte és 0. Amb les contínues es pregunta sempre per intervals: \( P(T < 48) \), \( P(24 \leq T \leq 36) \).
L'eina és la funció de densitat \( f(x) \): una corba tal que la probabilitat d'un interval és l'àrea sota la corba sobre aquell interval. Intuïció des del Mòdul 2: imagina l'histograma dels temps de lliurament amb barres cada cop més fines (a mesura que acumulem més i més comandes); la silueta a la qual tendeix aquell histograma és la densitat. Propietats:
- \( f(x) \geq 0 \) (la corba no baixa de l'eix).
- L'àrea total sota la corba és 1 (l'esdeveniment segur).
- \( f(x) \) no és una probabilitat: pot valer més d'1 en zones estretes; només les àrees són probabilitats.
La seva companya és la funció de distribució acumulada (F.d.a.):
\[ F(x) = P(X \leq x) \]
que acumula l'àrea des de l'esquerra fins a \( x \). És la versió teòrica dels percentatges acumulats i percentils del Mòdul 2, i existeix també per a discretes (on puja a salts). Amb ella, qualsevol interval es resol restant:
\[ P(a < X \leq b) = F(b) - F(a) \]
Exemple NovaMarket. De l'anàlisi de lliuraments sabem que la mediana és 25,5 h i que l'SLA exigeix el 90 % en menys de 48 h. En llenguatge de F.d.a.: \( F(25{,}5) = 0{,}50 \) (la mediana és el punt que acumula el 50 %) i l'objectiu és \( F(48) \geq 0{,}90 \). Si a més \( F(24) = 0{,}45 \), aleshores:
\[ P(24 < T \leq 48) = F(48) - F(24) = 0{,}90 - 0{,}45 = 0{,}45 \]
El 45 % de les comandes es lliuren entre les 24 i les 48 hores. Observa que treballem amb probabilitats de \( T \) sense conèixer la fórmula de la seva densitat: llegint l'acumulada. Al Mòdul 4, quan la densitat tingui una forma coneguda (la campana normal), \( F \) vindrà tabulada i aquest joc de restes serà la nostra rutina diària.
| V.a. discreta | V.a. contínua | |
|---|---|---|
| Neix de… | comptar | mesurar |
| Probabilitat puntual \( P(X=x) \) | \( p(x) \), pot ser > 0 | sempre 0 |
| Objecte que reparteix la probabilitat | f.m.p. \( p(x) \) (taula) | densitat \( f(x) \) (corba; àrees = probabilitats) |
| \( P(X \leq x) \) | suma de \( p \) fins a \( x \) | àrea acumulada fins a \( x \) |
| Esperança | \( \sum x , p(x) \) | àrea ponderada sota la corba (mateixa idea, amb integral) |
Models de distribució: plantilles per a l'atzar
La taula de les bosses la vam construir empíricament, valor a valor. Però moltes situacions d'atzar repeteixen patrons estructurals idèntics encara que canviïn els números:
- «Repeteixo \( n \) vegades un experiment amb dos resultats (bescanvia/no bescanvia, targeta/no targeta) i compto els èxits» — sigui amb cupons, amb pagaments o amb lliuraments dins de l'SLA.
- «Compto quants esdeveniments passen en un interval de temps (comandes per hora, reclamacions per dia)».
- «Mesuro una magnitud que resulta de sumar molts petits efectes independents (venda diària d'una botiga)».
Per a aquests patrons, l'estadística ofereix models de distribució: famílies de distribucions amb fórmula coneguda, governades per uns pocs paràmetres que s'ajusten a cada cas concret. En lloc d'estimar una taula sencera amb dades, n'hi ha prou d'identificar el patró, fixar els paràmetres (per exemple, \( n = 380.000 \) enviaments i probabilitat de bescanvi \( \pi = 0{,}18 \)) i el model regala totes les probabilitats, l'esperança i la variància. Són plantilles reutilitzables i contrastades: l'equivalent estadístic de no redissenyar la roda a cada anàlisi.
Els tres patrons de la llista tenen nom propi — binomial, Poisson i normal — i són exactament el contingut del Mòdul 4. La distinció del Mòdul 1 entre paràmetre i estadístic culmina aquí: els paràmetres d'aquests models (\( \mu, \sigma, \pi \)) són els que després, al Mòdul 5, aprendrem a estimar a partir de mostres.
Errors Comuns i Consells
- Confondre l'esperança amb «el valor més probable». \( E(X) = 0{,}6 \) bosses i el valor més probable és 0. L'esperança és una mitjana a llarg termini; pot ser un valor impossible d'observar en un cas individual.
- Oblidar comprovar que les probabilitats sumen 1 abans de calcular res amb una taula de distribució. És la comprovació més barata i la que més errors caça (inclosos els de branques d'arbre mal multiplicades).
- Restar el cost només en alguns escenaris. A la promoció, els 0,30 € es paguen sempre, bescanviï o no el soci. Repartir malament costos fixos entre escenaris és l'error comptable més comú en taules de guany.
- Interpretar la densitat com a probabilitat. \( f(x) = 1{,}3 \) no vol dir «probabilitat 130 %»; les probabilitats d'una contínua són àrees, i \( P(X = x) = 0 \) per a qualsevol valor exacte.
- Descuidar els signes «≤» i «<». En contínues és igual (\( P(X \leq 48) = P(X < 48) \) perquè el punt exacte pesa 0), però en discretes no: \( P(X < 2) = P(X \leq 1) \neq P(X \leq 2) \).
- Decidir només pel valor esperat ignorant la dispersió. Dues campanyes amb la mateixa \( E(G) \) poden tenir riscos molt diferents; acompanya sempre l'esperança de la desviació típica, igual que al Mòdul 2 acompanyàvem la mitjana amb \( s \).
Exercicis
Exercici 1. A la caixa ràpida de Valencia-Ruzafa, el nombre \( X \) d'articles rebutjats per l'escàner en un tiquet té aquesta distribució: \( P(X=0) = 0{,}70 \), \( P(X=1) = 0{,}20 \), \( P(X=2) = 0{,}08 \), \( P(X=3) = a \). (a) Troba \( a \). (b) Calcula \( P(X \geq 1) \) i \( P(X < 2) \). (c) Calcula \( E(X) \), \( \operatorname{Var}(X) \) i \( \sigma \).
Exercici 2. NovaMarket estudia una assegurança de lliurament per a comandes en línia per 1,50 €: si la comanda supera les 48 h, el client rep un val de 10 €. Amb les dades actuals, la probabilitat de superar les 48 h és 0,101 (calculada a la lliçó anterior). Sigui \( G \) el guany de NovaMarket per assegurança venuda. (a) Construeix la taula de distribució de \( G \). (b) Calcula \( E(G) \) i interpreta el resultat. (c) Quina probabilitat de retard faria que l'assegurança deixés de ser rendible?
Exercici 3. Per al temps de lliurament \( T \) (en hores) se sap que \( F(11) = 0{,}10 \), \( F(25{,}5) = 0{,}50 \), \( F(36) = 0{,}75 \) i \( F(48) = 0{,}899 \). (a) Calcula \( P(11 < T \leq 36) \) i interpreta què té a veure amb l'IQR d'11 h... quadra amb el que sabies del Mòdul 2? (b) Calcula \( P(T > 48) \). Compleix NovaMarket el seu SLA? (c) Per què no preguntem per \( P(T = 25{,}5) \)?
Solucions
Solució 1. (a) Les probabilitats han de sumar 1: \( a = 1 - 0{,}70 - 0{,}20 - 0{,}08 = 0{,}02 \). (b) \( P(X \geq 1) = 1 - 0{,}70 = 0{,}30 \); \( P(X < 2) = P(X \leq 1) = 0{,}70 + 0{,}20 = 0{,}90 \). (c) \( E(X) = 0(0{,}70) + 1(0{,}20) + 2(0{,}08) + 3(0{,}02) = 0{,}42 \). Variància: \( (0-0{,}42)^2(0{,}70) + (1-0{,}42)^2(0{,}20) + (2-0{,}42)^2(0{,}08) + (3-0{,}42)^2(0{,}02) = 0{,}1235 + 0{,}0673 + 0{,}1997 + 0{,}1332 \approx 0{,}524 \); \( \sigma \approx 0{,}72 \) articles. Error freqüent: a (b), tractar \( P(X<2) \) com \( P(X \leq 2) \) — en discretes la vora importa.
Solució 2. (a) Dos escenaris: arriba a temps (probabilitat 0,899): NovaMarket ingressa 1,50 €; arriba tard (0,101): ingressa 1,50 € però paga el val, guany \( 1{,}50 - 10 = -8{,}50 \) €. Taula: \( P(G = 1{,}50) = 0{,}899 \), \( P(G = -8{,}50) = 0{,}101 \). (b) \( E(G) = 1{,}50 \times 0{,}899 + (-8{,}50) \times 0{,}101 = 1{,}3485 - 0{,}8585 = 0{,}49 \) €: cada assegurança venuda deixa de mitjana uns 49 cèntims; a gran escala, el producte és rendible (tot i que, matís de negoci, un val de 10 € no és un cost pur de 10 € si es gasta en productes amb marge — el càlcul prudent el tracta com a cost complet). (c) Busquem \( p \) tal que \( E(G) = 1{,}50 - 10p = 0 \Rightarrow p = 0{,}15 \). Si el retard superés el 15 %, l'assegurança perdria diners: la rendibilitat del producte depèn de mantenir l'operativa logística. Error freqüent: escriure el guany de l'escenari dolent com a −10 € oblidant que els 1,50 € es cobren sempre.
Solució 3. (a) \( P(11 < T \leq 36) = F(36) - F(11) = 0{,}75 - 0{,}10 = 0{,}65 \). L'IQR del Mòdul 2 anava del percentil 25 al 75; aquí el tram va del percentil 10 al 75, per això acumula el 65 % i no el 50 %: quadra, però no és l'IQR (comparar percentils concrets evita confusions). (b) \( P(T > 48) = 1 - F(48) = 1 - 0{,}899 = 0{,}101 \): el 89,9 % arriba dins del termini, una dècima per sota de l'SLA del 90 % — coherent amb l'anàlisi de transportistes de la lliçó anterior, i argument per renegociar amb RápidoSur. (c) Perquè \( T \) és contínua: la probabilitat d'un valor exacte és 0; el que és informatiu és \( F(25{,}5) = 0{,}50 \), que identifica 25,5 h com la mediana. Retroalimentació: si a (b) has respost 0,899, rellegeix l'enunciat — es demanava la cua dreta; dibuixar la corba i ombrejar l'àrea demanada abans de calcular evita aquest descuit.
Conclusió
Hem fet el salt dels esdeveniments als números: una variable aleatòria resumeix un experiment en una quantitat, i la seva distribució de probabilitat — taula i f.m.p. a les discretes, densitat i acumulada a les contínues — conté tot el que se'n pot saber abans d'observar el resultat. L'esperança \( E(X) \) ens dona el valor mitjà a llarg termini (i amb ell, el criteri de valor esperat que va convertir la promoció del Club Nova en una decisió calculada de +136.800 €), i la variància \( \sigma^2 \) mesura el risc al voltant d'aquesta mitjana, mirall teòric de la \( s \) mostral del Mòdul 2.
I ha quedat plantada la idea decisiva: molts fenòmens d'atzar segueixen patrons repetits que no cal modelar des de zero, perquè existeixen plantilles amb nom i cognoms. Al Mòdul 4 les coneixerem una a una, començant per la més natural per a NovaMarket: comptar èxits en \( n \) intents independents — quants dels 380.000 cupons es bescanvien, quants dels propers 20 tiquets es paguen amb targeta. És la Distribució Binomial, la primera plantilla de la nostra caixa d'eines.
Curs d'Estadística
Mòdul 1: Introducció a l'Estadística
Mòdul 2: Descripció de Dades
- Mesures de Tendència Central
- Mesures de Dispersió
- Mesures de Posició i Valors Atípics
- Representació Gràfica de Dades
Mòdul 3: Probabilitat
- Conceptes Bàsics de Probabilitat
- Regles de Probabilitat
- Variables Aleatòries i Distribucions de Probabilitat
Mòdul 4: Distribucions de Probabilitat
- Distribució Binomial
- Distribució Normal
- Altres Distribucions Importants
- El Teorema Central del Límit
Mòdul 5: Inferència Estadística
Mòdul 6: Anàlisi de Dades
- Anàlisi de Correlació
- Anàlisi de Regressió
- Anàlisi de la Variància (ANOVA)
- Anàlisi de Dades Categòriques: Khi Quadrat
