A les dues lliçons anteriors hem treballat amb esdeveniments descrits amb paraules: «el tiquet es paga amb targeta», «la comanda arriba tard». Però l'anàlisi de dades guanya potència quan l'atzar es tradueix a números: en lloc de preguntar-nos per un esdeveniment concret, descrivim d'una sola vegada totes les probabilitats de tots els valors possibles d'una quantitat incerta. Aquest objecte s'anomena variable aleatòria, i el seu «carnet d'identitat» és la seva distribució de probabilitat. En aquesta lliçó aprendràs a distingir variables aleatòries discretes i contínues, a llegir i construir la taula de distribució d'una discreta, a calcular-ne l'esperança i la variància (amb una aplicació de negoci directa: decidir si una promoció del Club Nova és rendible), i a entendre què són la funció de densitat i la funció de distribució en el cas continu — sense integrals, amb la intuïció de l'histograma. Tanquem amb la idea que dona nom al Mòdul 4: els models de distribució com a plantilles reutilitzables.

Contingut

  1. Què és una variable aleatòria; discretes vs contínues
  2. La funció de massa de probabilitat i la taula de distribució
  3. Esperança matemàtica: el valor mitjà a llarg termini
  4. Variància i desviació típica d'una variable aleatòria
  5. El valor esperat com a criteri de decisió: la promoció del Club Nova
  6. Variables contínues: funció de densitat i funció de distribució acumulada
  7. Models de distribució: plantilles per a l'atzar

Què és una variable aleatòria; discretes vs contínues

Una variable aleatòria (v.a.) és una regla que assigna un número al resultat d'un experiment aleatori. Es denota amb majúscules (\( X, Y, Z \)) i els seus valors concrets amb minúscules (\( x, y, z \)). Abans de dur a terme l'experiment, \( X \) és incerta; després, pren un valor concret.

Experiment NovaMarket Variable aleatòria Valors possibles Tipus
Un client passa per caixa \( X \) = import del tiquet (€) qualsevol valor > 0 Contínua
S'observa un tiquet \( Y \) = 1 si paga amb targeta, 0 si no {0, 1} Discreta
Una hora al web \( N \) = nre. de comandes rebudes {0, 1, 2, …} Discreta
S'envia una comanda \( T \) = hores fins al lliurament qualsevol valor ≥ 0 Contínua
Un soci rep un cupó \( C \) = 1 si el bescanvia, 0 si no {0, 1} Discreta

La classificació replica la dels tipus de dades del Mòdul 1, ara amb probabilitats:

  • Discreta: els seus valors possibles es poden enumerar (finits o infinits numerables). Sol néixer de comptar.
  • Contínua: pot prendre qualsevol valor dins d'un interval. Sol néixer de mesurar (imports, temps, pesos).

La distinció importa perquè les eines matemàtiques són diferents: a una discreta se li assigna probabilitat valor a valor; a una contínua, per intervals.

La funció de massa de probabilitat i la taula de distribució

Per a una v.a. discreta \( X \), la funció de massa de probabilitat (f.m.p.) assigna a cada valor possible la seva probabilitat:

\[ p(x) = P(X = x) \]

Ha de complir dues condicions (herència directa dels axiomes de Kolmogórov): \( p(x) \geq 0 \) per a tot \( x \), i \( \sum_x p(x) = 1 \). A la pràctica es presenta com una taula de distribució.

Exemple NovaMarket: bosses reutilitzables. A caixa s'ofereixen bosses reutilitzables a 1 €. Analitzant milions de tiquets, l'equip de la Marta estima les probabilitats del nombre de bosses \( X \) que compra un client:

\( x \) (nre. de bosses) 0 1 2 3
\( p(x) = P(X = x) \) 0,60 0,25 0,10 0,05

Comprovació: \( 0{,}60 + 0{,}25 + 0{,}10 + 0{,}05 = 1 \). ✔ Nota el paral·lelisme amb el Mòdul 2: aquesta taula és com una taula de freqüències relatives, però descriu probabilitats del que passarà, no freqüències del que ja s'ha observat. L'enfocament freqüentista de la lliçó 03-01 és el pont entre totes dues.

De la taula se n'extreu la probabilitat de qualsevol esdeveniment sobre \( X \) sumant els valors que el componen:

  • \( P(X \geq 1) = 0{,}25 + 0{,}10 + 0{,}05 = 0{,}40 \) — o millor, pel complementari: \( 1 - P(X=0) = 1 - 0{,}60 = 0{,}40 \).
  • \( P(1 \leq X \leq 2) = 0{,}25 + 0{,}10 = 0{,}35 \).

Esperança matemàtica: el valor mitjà a llarg termini

L'esperança (o valor esperat) d'una v.a. discreta és la mitjana dels seus valors possibles ponderada per les seves probabilitats:

\[ E(X) = \mu = \sum_x x \cdot p(x) \]

És l'extensió natural de la mitjana ponderada del Mòdul 2, amb les probabilitats com a pesos. Interpretació clau: és el valor mitjà a llarg termini, el que obtindríem de mitjana si l'experiment es repetís moltíssimes vegades. No és «el valor més probable» ni ha de ser necessàriament un valor possible.

Amb les bosses:

\[ E(X) = 0 \times 0{,}60 + 1 \times 0{,}25 + 2 \times 0{,}10 + 3 \times 0{,}05 = 0 + 0{,}25 + 0{,}20 + 0{,}15 = 0{,}60 \text{ bosses} \]

Cap client no compra 0,6 bosses, però la dada és or per a operacions: amb uns 2.000 clients diaris a Madrid-Centro, es pot esperar vendre al voltant de \( 2.000 \times 0{,}60 = 1.200 \) bosses al dia — la base de la comanda de reposició.

Dues propietats útils (sense demostració): si \( a \) i \( b \) són constants, \( E(aX + b) = a,E(X) + b \). Per exemple, si cada bossa deixa 0,40 € de marge, el marge per client és la v.a. \( 0{,}40 \cdot X \), amb esperança \( 0{,}40 \times 0{,}60 = 0{,}24 \) €.

Variància i desviació típica d'una variable aleatòria

Igual que al Mòdul 2 la mitjana necessitava la desviació típica, l'esperança necessita una mesura de dispersió. La variància d'una v.a. mesura com s'allunyen els seus valors de l'esperança, en mitjana ponderada per probabilitats:

\[ \operatorname{Var}(X) = \sigma^2 = \sum_x (x - \mu)^2 , p(x) \qquad \sigma = \sqrt{\operatorname{Var}(X)} \]

Càlcul pas a pas amb les bosses (\( \mu = 0{,}60 \)):

\( x \) \( p(x) \) \( x - \mu \) \( (x-\mu)^2 \) \( (x-\mu)^2 , p(x) \)
0 0,60 −0,60 0,36 0,2160
1 0,25 0,40 0,16 0,0400
2 0,10 1,40 1,96 0,1960
3 0,05 2,40 5,76 0,2880
Suma: 0,7400

\[ \operatorname{Var}(X) = 0{,}74 \qquad \sigma = \sqrt{0{,}74} \approx 0{,}86 \text{ bosses} \]

Lectura: el nombre de bosses per client fluctua típicament en ±0,86 al voltant de 0,60. Fixa't que aquí fem servir \( \sigma \) (paràmetre del model), no \( s \): no estem estimant a partir d'una mostra dividint entre \( n-1 \), sinó calculant la dispersió teòrica de la distribució. La \( s \) mostral del Mòdul 2 és l'estimació empírica d'aquesta \( \sigma \) teòrica.

El valor esperat com a criteri de decisió: la promoció del Club Nova

Aquí la teoria es converteix en diners. Reprenem el fil de l'exercici de retenció de la lliçó anterior, ara amb una campanya ofensiva: la Marta valora enviar un cupó de 5 € de descompte en compres superiors a 40 € als 380.000 socis del Club Nova. Dades estimades per l'equip (a partir de campanyes pilot):

  • Cost d'emissió i comunicació per cupó enviat: 0,30 €.
  • Probabilitat que un soci bescanviï el cupó: 0,18.
  • Si el bescanvia, la compra associada deixa un marge brut mitjà de 7,50 € (ja descomptats els 5 € del cupó); un 60 % d'aquests bescanvis s'estima que són vendes incrementals (no haurien passat sense cupó), i el 40 % restant hauria passat igualment, amb la qual cosa el cupó els resta marge: en aquests casos l'efecte net és de −2,10 €.

Definim \( G \) = guany net per cupó enviat. La seva taula de distribució (aplicant la regla del producte de la lliçó anterior per a les branques del bescanvi):

Escenari Probabilitat \( g \) (€)
No bescanvia 0,82 −0,30
Bescanvia, venda incremental \( 0{,}18 \times 0{,}60 = 0{,}108 \) \( 7{,}50 - 0{,}30 = 7{,}20 \)
Bescanvia, venda que passaria igualment \( 0{,}18 \times 0{,}40 = 0{,}072 \) \( -2{,}10 - 0{,}30 = -2{,}40 \)

Comprovació: \( 0{,}82 + 0{,}108 + 0{,}072 = 1 \). ✔ Esperança:

\[ E(G) = (-0{,}30)(0{,}82) + (7{,}20)(0{,}108) + (-2{,}40)(0{,}072) = -0{,}246 + 0{,}7776 - 0{,}1728 \approx 0{,}36 \text{ €} \]

Cada cupó enviat val, de mitjana, uns +0,36 €. Sobre 380.000 socis, la campanya té un resultat esperat de \( 380.000 \times 0{,}36 \approx 136.800 \) €: endavant. Tres observacions d'analista:

  1. La majoria dels cupons (82 %) perden diners individualment; la campanya és rendible perquè els bescanvis incrementals ho compensen amb escreix. Decidir pel cas més probable en lloc de pel valor esperat hauria matat una campanya rendible.
  2. El valor esperat és fiable aquí perquè s'aplicarà moltes vegades (380.000 enviaments): la llei dels grans nombres garanteix que el resultat real quedarà a prop de l'esperat. Per a una decisió única i irrepetible, el valor esperat continua sent orientatiu, però la dispersió i la tolerància al risc pesen més.
  3. La conclusió és sensible a les estimacions (el 0,18 i el 60 % incremental surten de pilots, és a dir, de mostres). Quanta confiança mereixen aquestes estimacions és exactament el tema del Mòdul 5.

Variables contínues: funció de densitat i funció de distribució acumulada

Per a una v.a. contínua com \( T \) = «hores fins al lliurament d'una comanda», preguntar \( P(T = 25{,}5) \) no té sentit útil: entre infinits valors possibles amb decimals il·limitats, la probabilitat de qualsevol valor exacte és 0. Amb les contínues es pregunta sempre per intervals: \( P(T < 48) \), \( P(24 \leq T \leq 36) \).

L'eina és la funció de densitat \( f(x) \): una corba tal que la probabilitat d'un interval és l'àrea sota la corba sobre aquell interval. Intuïció des del Mòdul 2: imagina l'histograma dels temps de lliurament amb barres cada cop més fines (a mesura que acumulem més i més comandes); la silueta a la qual tendeix aquell histograma és la densitat. Propietats:

  • \( f(x) \geq 0 \) (la corba no baixa de l'eix).
  • L'àrea total sota la corba és 1 (l'esdeveniment segur).
  • \( f(x) \) no és una probabilitat: pot valer més d'1 en zones estretes; només les àrees són probabilitats.

La seva companya és la funció de distribució acumulada (F.d.a.):

\[ F(x) = P(X \leq x) \]

que acumula l'àrea des de l'esquerra fins a \( x \). És la versió teòrica dels percentatges acumulats i percentils del Mòdul 2, i existeix també per a discretes (on puja a salts). Amb ella, qualsevol interval es resol restant:

\[ P(a < X \leq b) = F(b) - F(a) \]

Exemple NovaMarket. De l'anàlisi de lliuraments sabem que la mediana és 25,5 h i que l'SLA exigeix el 90 % en menys de 48 h. En llenguatge de F.d.a.: \( F(25{,}5) = 0{,}50 \) (la mediana és el punt que acumula el 50 %) i l'objectiu és \( F(48) \geq 0{,}90 \). Si a més \( F(24) = 0{,}45 \), aleshores:

\[ P(24 < T \leq 48) = F(48) - F(24) = 0{,}90 - 0{,}45 = 0{,}45 \]

El 45 % de les comandes es lliuren entre les 24 i les 48 hores. Observa que treballem amb probabilitats de \( T \) sense conèixer la fórmula de la seva densitat: llegint l'acumulada. Al Mòdul 4, quan la densitat tingui una forma coneguda (la campana normal), \( F \) vindrà tabulada i aquest joc de restes serà la nostra rutina diària.

V.a. discreta V.a. contínua
Neix de… comptar mesurar
Probabilitat puntual \( P(X=x) \) \( p(x) \), pot ser > 0 sempre 0
Objecte que reparteix la probabilitat f.m.p. \( p(x) \) (taula) densitat \( f(x) \) (corba; àrees = probabilitats)
\( P(X \leq x) \) suma de \( p \) fins a \( x \) àrea acumulada fins a \( x \)
Esperança \( \sum x , p(x) \) àrea ponderada sota la corba (mateixa idea, amb integral)

Models de distribució: plantilles per a l'atzar

La taula de les bosses la vam construir empíricament, valor a valor. Però moltes situacions d'atzar repeteixen patrons estructurals idèntics encara que canviïn els números:

  • «Repeteixo \( n \) vegades un experiment amb dos resultats (bescanvia/no bescanvia, targeta/no targeta) i compto els èxits» — sigui amb cupons, amb pagaments o amb lliuraments dins de l'SLA.
  • «Compto quants esdeveniments passen en un interval de temps (comandes per hora, reclamacions per dia)».
  • «Mesuro una magnitud que resulta de sumar molts petits efectes independents (venda diària d'una botiga)».

Per a aquests patrons, l'estadística ofereix models de distribució: famílies de distribucions amb fórmula coneguda, governades per uns pocs paràmetres que s'ajusten a cada cas concret. En lloc d'estimar una taula sencera amb dades, n'hi ha prou d'identificar el patró, fixar els paràmetres (per exemple, \( n = 380.000 \) enviaments i probabilitat de bescanvi \( \pi = 0{,}18 \)) i el model regala totes les probabilitats, l'esperança i la variància. Són plantilles reutilitzables i contrastades: l'equivalent estadístic de no redissenyar la roda a cada anàlisi.

Els tres patrons de la llista tenen nom propi — binomial, Poisson i normal — i són exactament el contingut del Mòdul 4. La distinció del Mòdul 1 entre paràmetre i estadístic culmina aquí: els paràmetres d'aquests models (\( \mu, \sigma, \pi \)) són els que després, al Mòdul 5, aprendrem a estimar a partir de mostres.

Errors Comuns i Consells

  • Confondre l'esperança amb «el valor més probable». \( E(X) = 0{,}6 \) bosses i el valor més probable és 0. L'esperança és una mitjana a llarg termini; pot ser un valor impossible d'observar en un cas individual.
  • Oblidar comprovar que les probabilitats sumen 1 abans de calcular res amb una taula de distribució. És la comprovació més barata i la que més errors caça (inclosos els de branques d'arbre mal multiplicades).
  • Restar el cost només en alguns escenaris. A la promoció, els 0,30 € es paguen sempre, bescanviï o no el soci. Repartir malament costos fixos entre escenaris és l'error comptable més comú en taules de guany.
  • Interpretar la densitat com a probabilitat. \( f(x) = 1{,}3 \) no vol dir «probabilitat 130 %»; les probabilitats d'una contínua són àrees, i \( P(X = x) = 0 \) per a qualsevol valor exacte.
  • Descuidar els signes «≤» i «<». En contínues és igual (\( P(X \leq 48) = P(X < 48) \) perquè el punt exacte pesa 0), però en discretes no: \( P(X < 2) = P(X \leq 1) \neq P(X \leq 2) \).
  • Decidir només pel valor esperat ignorant la dispersió. Dues campanyes amb la mateixa \( E(G) \) poden tenir riscos molt diferents; acompanya sempre l'esperança de la desviació típica, igual que al Mòdul 2 acompanyàvem la mitjana amb \( s \).

Exercicis

Exercici 1. A la caixa ràpida de Valencia-Ruzafa, el nombre \( X \) d'articles rebutjats per l'escàner en un tiquet té aquesta distribució: \( P(X=0) = 0{,}70 \), \( P(X=1) = 0{,}20 \), \( P(X=2) = 0{,}08 \), \( P(X=3) = a \). (a) Troba \( a \). (b) Calcula \( P(X \geq 1) \) i \( P(X < 2) \). (c) Calcula \( E(X) \), \( \operatorname{Var}(X) \) i \( \sigma \).

Exercici 2. NovaMarket estudia una assegurança de lliurament per a comandes en línia per 1,50 €: si la comanda supera les 48 h, el client rep un val de 10 €. Amb les dades actuals, la probabilitat de superar les 48 h és 0,101 (calculada a la lliçó anterior). Sigui \( G \) el guany de NovaMarket per assegurança venuda. (a) Construeix la taula de distribució de \( G \). (b) Calcula \( E(G) \) i interpreta el resultat. (c) Quina probabilitat de retard faria que l'assegurança deixés de ser rendible?

Exercici 3. Per al temps de lliurament \( T \) (en hores) se sap que \( F(11) = 0{,}10 \), \( F(25{,}5) = 0{,}50 \), \( F(36) = 0{,}75 \) i \( F(48) = 0{,}899 \). (a) Calcula \( P(11 < T \leq 36) \) i interpreta què té a veure amb l'IQR d'11 h... quadra amb el que sabies del Mòdul 2? (b) Calcula \( P(T > 48) \). Compleix NovaMarket el seu SLA? (c) Per què no preguntem per \( P(T = 25{,}5) \)?

Solucions

Solució 1. (a) Les probabilitats han de sumar 1: \( a = 1 - 0{,}70 - 0{,}20 - 0{,}08 = 0{,}02 \). (b) \( P(X \geq 1) = 1 - 0{,}70 = 0{,}30 \); \( P(X < 2) = P(X \leq 1) = 0{,}70 + 0{,}20 = 0{,}90 \). (c) \( E(X) = 0(0{,}70) + 1(0{,}20) + 2(0{,}08) + 3(0{,}02) = 0{,}42 \). Variància: \( (0-0{,}42)^2(0{,}70) + (1-0{,}42)^2(0{,}20) + (2-0{,}42)^2(0{,}08) + (3-0{,}42)^2(0{,}02) = 0{,}1235 + 0{,}0673 + 0{,}1997 + 0{,}1332 \approx 0{,}524 \); \( \sigma \approx 0{,}72 \) articles. Error freqüent: a (b), tractar \( P(X<2) \) com \( P(X \leq 2) \) — en discretes la vora importa.

Solució 2. (a) Dos escenaris: arriba a temps (probabilitat 0,899): NovaMarket ingressa 1,50 €; arriba tard (0,101): ingressa 1,50 € però paga el val, guany \( 1{,}50 - 10 = -8{,}50 \) €. Taula: \( P(G = 1{,}50) = 0{,}899 \), \( P(G = -8{,}50) = 0{,}101 \). (b) \( E(G) = 1{,}50 \times 0{,}899 + (-8{,}50) \times 0{,}101 = 1{,}3485 - 0{,}8585 = 0{,}49 \) €: cada assegurança venuda deixa de mitjana uns 49 cèntims; a gran escala, el producte és rendible (tot i que, matís de negoci, un val de 10 € no és un cost pur de 10 € si es gasta en productes amb marge — el càlcul prudent el tracta com a cost complet). (c) Busquem \( p \) tal que \( E(G) = 1{,}50 - 10p = 0 \Rightarrow p = 0{,}15 \). Si el retard superés el 15 %, l'assegurança perdria diners: la rendibilitat del producte depèn de mantenir l'operativa logística. Error freqüent: escriure el guany de l'escenari dolent com a −10 € oblidant que els 1,50 € es cobren sempre.

Solució 3. (a) \( P(11 < T \leq 36) = F(36) - F(11) = 0{,}75 - 0{,}10 = 0{,}65 \). L'IQR del Mòdul 2 anava del percentil 25 al 75; aquí el tram va del percentil 10 al 75, per això acumula el 65 % i no el 50 %: quadra, però no és l'IQR (comparar percentils concrets evita confusions). (b) \( P(T > 48) = 1 - F(48) = 1 - 0{,}899 = 0{,}101 \): el 89,9 % arriba dins del termini, una dècima per sota de l'SLA del 90 % — coherent amb l'anàlisi de transportistes de la lliçó anterior, i argument per renegociar amb RápidoSur. (c) Perquè \( T \) és contínua: la probabilitat d'un valor exacte és 0; el que és informatiu és \( F(25{,}5) = 0{,}50 \), que identifica 25,5 h com la mediana. Retroalimentació: si a (b) has respost 0,899, rellegeix l'enunciat — es demanava la cua dreta; dibuixar la corba i ombrejar l'àrea demanada abans de calcular evita aquest descuit.

Conclusió

Hem fet el salt dels esdeveniments als números: una variable aleatòria resumeix un experiment en una quantitat, i la seva distribució de probabilitat — taula i f.m.p. a les discretes, densitat i acumulada a les contínues — conté tot el que se'n pot saber abans d'observar el resultat. L'esperança \( E(X) \) ens dona el valor mitjà a llarg termini (i amb ell, el criteri de valor esperat que va convertir la promoció del Club Nova en una decisió calculada de +136.800 €), i la variància \( \sigma^2 \) mesura el risc al voltant d'aquesta mitjana, mirall teòric de la \( s \) mostral del Mòdul 2.

I ha quedat plantada la idea decisiva: molts fenòmens d'atzar segueixen patrons repetits que no cal modelar des de zero, perquè existeixen plantilles amb nom i cognoms. Al Mòdul 4 les coneixerem una a una, començant per la més natural per a NovaMarket: comptar èxits en \( n \) intents independents — quants dels 380.000 cupons es bescanvien, quants dels propers 20 tiquets es paguen amb targeta. És la Distribució Binomial, la primera plantilla de la nostra caixa d'eines.

© Copyright 2026. Tots els drets reservats