Aquest mòdul t'ha donat plantilles per a variables individuals: un tiquet, un lliurament, un recompte d'incidències. Però la feina diària de l'analista gairebé mai no gira al voltant d'una dada individual, sinó de mitjanes i proporcions de mostres: el tiquet mitjà de 640 compres, el 61 % de targeta calculat sobre milers de tiquets, el 8,1 de satisfacció sobre 640 respostes. Aquí sorgeix la pregunta que la Marta esquiva des del Mòdul 1, quan el comitè va preguntar per l'enquesta: si haguéssim obtingut 640 respostes diferents, hauria sortit un altre nombre? Quant pot ballar? La resposta exigeix un canvi de mirada — tractar la mateixa mitjana mostral com una variable aleatòria — i culmina en el resultat més important de tota l'estadística: el Teorema Central del Límit (TCL), que explica per què la campana normal apareix pertot arreu i per què ens podem refiar de les mitjanes encara que les dades de partida siguin asimètriques i rebels. És el pont que uneix tot el que hem après fins aquí amb la inferència del Mòdul 5.

Contingut

  1. El canvi de mirada: la mitjana mostral és una variable aleatòria
  2. La distribució mostral de la mitjana: centre i error típic
  3. L'experiment conceptual: mitjanes de tiquets amb mostres creixents
  4. L'enunciat del TCL i la seva intuïció
  5. Calcular amb el TCL: probabilitats sobre mitjanes
  6. L'aproximació normal a la binomial i a les proporcions
  7. El pont cap a la inferència: la pregunta del comitè, a punt per respondre

El canvi de mirada: la mitjana mostral és una variable aleatòria

Fins ara, «la mitjana» era un nombre que es calculava i prou (Mòdul 2). El canvi de mirada és aquest: abans de prendre la mostra, la mitjana mostral \( \bar{X} \) és incerta — depèn de quins 640 clients contestin, de quins 100 tiquets caiguin a la mostra. I una quantitat incerta amb valors numèrics és, exactament, una variable aleatòria com les del Mòdul 3. Per tant té la seva pròpia distribució de probabilitat, anomenada distribució mostral de la mitjana: la distribució dels valors que \( \bar{X} \) prendria al llarg de totes les mostres possibles.

Convé tenir el vocabulari del Mòdul 1 ben esmolat, perquè aquí conviuen tres nivells que no s'han de barrejar:

Nivell Objecte Exemple NovaMarket Aleatori?
Població Paràmetre \( \mu, \sigma \) Tiquet mitjà real de tots els tiquets: \( \mu = 32{,}40 \) €, \( \sigma = 21{,}50 \) € No (fix, encara que desconegut a la pràctica)
Mostra concreta Estadístic calculat \( \bar{x} \) La mitjana d'aquests 100 tiquets: 33,10 € No (ja observat)
Abans de mostrejar Variable aleatòria \( \bar{X} \) La mitjana dels 100 tiquets que sortiran — i la seva distribució és el tema d'avui

La distribució mostral de la mitjana: centre i error típic

Dos resultats exactes (vàlids sempre que la mostra sigui aleatòria i les observacions independents, sigui quina sigui la forma de la població):

\[ E(\bar{X}) = \mu \qquad\qquad \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]

  • El centre no es mou: en mitjana, la mitjana mostral ni sobreestima ni subestima \( \mu \). Les mostres «altes» i «baixes» es compensen al llarg de totes les mostres possibles.
  • La dispersió s'encongeix amb \( \sqrt{n} \). A \( \sigma_{\bar{X}} \) se l'anomena error típic (o error estàndard) de la mitjana, i és el nombre més important d'aquesta lliçó: mesura quant fluctua la mitjana mostral d'una mostra a una altra. En fer la mitjana, els tiquets grans i petits es cancel·len parcialment, i com més gran és \( n \), més eficaç és la cancel·lació.

Amb els tiquets de NovaMarket (\( \mu = 32{,}40 \), \( \sigma = 21{,}50 \)):

Mida mostral \( n \) Error típic \( \sigma/\sqrt{n} \) Lectura
1 21,50 € Un tiquet solt és una dada salvatge
4 10,75 € Duplicar la precisió exigeix quadruplicar \( n \)
25 4,30 €
100 2,15 € La mitjana de 100 tiquets fluctua ±2 € típicament
400 1,08 €
640 0,85 € La mida de la nostra enquesta de satisfacció

Fixa't en la llei de l'arrel quadrada: passar de 100 a 400 observacions (×4) només redueix l'error a la meitat. La precisió extra costa cada cop més cara — un principi que governa els pressupostos de tot estudi de mercat i que reapareixerà en calcular mides mostrals al Mòdul 5.

L'experiment conceptual: mitjanes de tiquets amb mostres creixents

Recordem una cosa crucial de la lliçó anterior: l'import del tiquet no és normal — és fortament asimètric a la dreta (molts tiquets petits, cua de carros grans). Imaginem ara un experiment mental que qualsevol analista pot fer amb l'històric de tiquets: extreure 200 mostres aleatòries de mida \( n \), calcular la mitjana de cadascuna, i mirar l'histograma d'aquestes 200 mitjanes. Repetim amb \( n \) creixent. Resultats típics de l'experiment:

Amb \( n = 5 \) (error típic teòric \( 21{,}50/\sqrt{5} \approx 9{,}6 \) €): les 200 mitjanes continuen sent disperses i amb cua a la dreta — n'hi ha prou amb un carro de 150 € per disparar la mitjana de la seva mostra:

Mitjana mostral (€) 10–20 20–30 30–40 40–50 50–60 60–70
Nre. de mostres 24 78 56 26 12 4

Amb \( n = 50 \) (error típic \( \approx 3{,}0 \) €): la distribució s'estreny al voltant de 32,40 i l'asimetria gairebé ha desaparegut:

Mitjana mostral (€) 26–29 29–31 31–33 33–35 35–37 37–40
Nre. de mostres 8 42 74 52 20 4

Amb \( n = 500 \) (error típic \( \approx 0{,}96 \) €): campana estreta, simètrica, indistingible d'una normal centrada en 32,40:

Mitjana mostral (€) 30,0–31,0 31,0–31,8 31,8–32,6 32,6–33,4 33,4–34,2 34,2–35,2
Nre. de mostres 6 30 66 64 28 6

Dos fenòmens alhora, i convé distingir-los: (1) la dispersió s'encongeix segons \( \sigma/\sqrt{n} \) — això ja ho sabíem de l'apartat anterior; i (2) la forma es torna normal, encara que els tiquets individuals no ho siguin ni de bon tros. Aquest segon fenomen és el contingut del teorema.

L'enunciat del TCL i la seva intuïció

Teorema Central del Límit (enunciat pràctic, sense demostració): si \( \bar{X} \) és la mitjana d'una mostra aleatòria de \( n \) observacions independents d'una població amb mitjana \( \mu \) i desviació típica \( \sigma \) (finita), aleshores, per a \( n \) prou gran,

\[ \bar{X} ;\approx; N!\left(\mu,\ \frac{\sigma}{\sqrt{n}}\right) \]

sigui quina sigui la forma de la distribució de la població. L'aproximació millora en créixer \( n \); la regla pràctica habitual és \( n \geq 30 \), tot i que amb poblacions molt asimètriques (com els tiquets) convé una mica més, i si la població ja és normal, \( \bar{X} \) és exactament normal per a qualsevol \( n \).

La intuïció connecta amb el que vam dir en obrir la lliçó de la normal: una mitjana és una suma de moltes contribucions petites i independents (cada observació aporta \( x_i/n \)). En sumar, les rareses individuals es dilueixen: perquè la mitjana de 500 tiquets surti altíssima no n'hi ha prou amb un carro gran — caldria que molts tiquets fossin simultàniament grans, i la independència fa aquest consens cada cop més improbable. El resultat és la campana: valors centrals fàcils d'aconseguir per mil camins diferents, valors extrems que exigeixen coincidències massives.

Per això la normal «apareix pertot arreu»: vendes diàries (suma de tiquets), errors de mesura (suma de pertorbacions), indicadors agregats de tota mena. El TCL és el teorema que fabrica normals a partir de gairebé qualsevol cosa.

Calcular amb el TCL: probabilitats sobre mitjanes

Amb el TCL, les preguntes sobre mitjanes mostrals es responen amb la maquinària de la lliçó anterior — estandarditzar, taula Z, traduir — fent servir l'error típic al denominador:

\[ z = \frac{\bar{x} - \mu}{\sigma / \sqrt{n}} \]

Exemple 1 — auditoria d'una caixa. S'auditaran \( n = 100 \) tiquets a l'atzar de Valencia-Ruzafa. Si la botiga es comporta com la cadena (\( \mu = 32{,}40 \), \( \sigma = 21{,}50 \)), quina probabilitat hi ha que la mitjana de la mostra superi els 35 €?

  1. Error típic: \( 21{,}50 / \sqrt{100} = 2{,}15 \) €.
  2. Estandarditzar: \( z = \dfrac{35 - 32{,}40}{2{,}15} \approx 1{,}21 \).
  3. Taula i traducció: \( P(\bar{X} > 35) = 1 - \Phi(1{,}21) = 1 - 0{,}8869 = 0{,}1131 \).

Un 11 %: una mitjana mostral de 35 € seria alta però no escandalosa. Fixa't en què ha regalat el TCL: els tiquets no són normals, i tot i així el càlcul és legítim perquè amb \( n = 100 \) la mitjana sí que ho és (aproximadament).

Exemple 2 — el mateix llindar amb més mostra. Amb \( n = 400 \): error típic \( 21{,}50/20 = 1{,}08 \) €, \( z = 2{,}60/1{,}08 \approx 2{,}41 \), i \( P(\bar{X} > 35) \approx 1 - 0{,}9920 = 0{,}008 \). El mateix desviament de 2,60 € que era rutina amb 100 tiquets és una raresa extrema amb 400: com més gran la mostra, més rar és que la mitjana s'allunyi de \( \mu \) per pur atzar. Guarda aquesta frase: és el mecanisme exacte amb què funcionaran els contrastos del Mòdul 5.

L'aproximació normal a la binomial i a les proporcions

El TCL també tanca el cercle obert a la primera lliçó del mòdul: una binomial és una suma de \( n \) Bernoullis independents, així que el TCL s'hi aplica de ple. Per a \( n \) gran,

\[ X \sim B(n, p) ;\approx; N!\left(np,\ \sqrt{np(1-p)}\right) \]

Regla pràctica de validesa: \( np \geq 10 \) i \( n(1-p) \geq 10 \) (alguns textos admeten 5; amb 10 es va sobre segur).

Exemple — tiquets amb targeta a escala de botiga. Dels pròxims \( n = 200 \) tiquets de Bilbao-Casco, probabilitat que 130 o més siguin amb targeta (\( p = 0{,}61 \))? Sumar 71 termes binomials és inviable a mà; l'aproximació ho resol:

  1. Validesa: \( np = 122 \geq 10 \) i \( n(1-p) = 78 \geq 10 \). ✔
  2. Paràmetres: mitjana \( 122 \), desviació \( \sqrt{200 \times 0{,}61 \times 0{,}39} = \sqrt{47{,}58} \approx 6{,}90 \).
  3. Correcció de continuïtat: la binomial és discreta (esglaons) i la normal contínua; el succés «\( X \geq 130 \)» es representa millor per l'àrea des de 129,5 (l'esglaó de 130 comença allà). És un ajust fi que millora l'aproximació; n'hi ha prou de conèixer-lo i aplicar-lo quan es busca precisió.
  4. \( z = \dfrac{129{,}5 - 122}{6{,}90} \approx 1{,}09 \), per tant \( P(X \geq 130) \approx 1 - \Phi(1{,}09) = 1 - 0{,}8621 = 0{,}1379 \).

En termes de proporcions, que és com es comuniquen aquests resultats, dividir entre \( n \) dona directament la distribució mostral de la proporció \( \hat{p} \):

\[ \hat{p} ;\approx; N!\left(p,\ \sqrt{\frac{p(1-p)}{n}}\right) \]

Amb \( n = 200 \) i \( p = 0{,}61 \): error típic \( \sqrt{0{,}61 \times 0{,}39 / 200} \approx 0{,}0345 \). És a dir: el «61 % de targeta» mesurat sobre 200 tiquets fluctua típicament ±3,5 punts percentuals de mostra a mostra — i sobre 2.000 tiquets, només ±1,1 punts. La proporció és una mitjana disfressada (mitjana d'uns i zeros), així que hereta tota la teoria d'aquesta lliçó, inclosa la llei de l'arrel quadrada.

El pont cap a la inferència: la pregunta del comitè, a punt per respondre

Tornem a la pregunta que va obrir el curs. L'enquesta de satisfacció: 2.000 invitacions, 640 respostes, mitjana 8,1 amb \( s = 1{,}6 \). El comitè pregunta: «fins a quin punt ens podem refiar del 8,1?». Ara tenim totes les peces:

  1. El 8,1 és una realització de la variable aleatòria \( \bar{X} \): 640 respostes diferents haurien donat un altre nombre.
  2. El seu error típic és \( \sigma/\sqrt{640} \approx 1{,}6/25{,}3 \approx 0{,}063 \) punts.
  3. Pel TCL, \( \bar{X} \) és aproximadament normal. Amb la regla 68-95-99,7: si la satisfacció real de la població de clients fos \( \mu \), la mitjana de 640 respostes cauria a menys de \( 2 \times 0{,}063 \approx 0{,}13 \) punts de \( \mu \) en el 95 % de les mostres.

És a dir: la fluctuació mostral del 8,1 és de l'ordre de ±0,1 — petita, però no nul·la. El que falta per respondre del tot al comitè és invertir el raonament: passar de «si conegués \( \mu \), sé com balla \( \bar{X} \)» a «he observat \( \bar{x} = 8{,}1 \): què puc afirmar sobre la \( \mu \) desconeguda, i amb quanta confiança?». Aquesta inversió — amb els seus matisos, com fer servir \( s \) en lloc de la \( \sigma \) desconeguda, i sense oblidar que el 32 % de no-resposta pot esbiaixar més que l'atzar (Mòdul 1) — és exactament la inferència estadística, i comença a la pròxima lliçó.

Errors Comuns i Consells

  • Confondre \( \sigma \) amb \( \sigma/\sqrt{n} \). La desviació típica de les dades mesura quant varia un tiquet; l'error típic mesura quant varia la mitjana de la mostra. Fer servir 21,50 on va 2,15 multiplica per deu qualsevol probabilitat de cua. Pregunta't sempre: la meva pregunta és sobre un individu o sobre una mitjana?
  • Creure que el TCL normalitza les dades. El TCL parla de la mitjana mostral, no de les observacions: per molts tiquets que reuneixis, el seu histograma continuarà sent asimètric. El que es torna normal és la distribució de les mitjanes entre mostres.
  • Aplicar \( n \geq 30 \) com a dogma. És una orientació: amb poblacions gairebé simètriques n'hi ha prou amb menys; amb asimetries fortes o valors atípics extrems en convé més. I amb dades dependents (tiquets de la mateixa família, vendes de dies consecutius) el TCL tal com l'hem enunciat no s'aplica: la independència és part del contracte.
  • Oblidar comprovar \( np \geq 10 \) i \( n(1-p) \geq 10 \) abans d'aproximar una binomial. Amb \( p = 0{,}005 \) (frau) i \( n = 400 \), \( np = 2 \): allà l'aproximació correcta era la Poisson de la lliçó anterior, no la normal.
  • Ignorar la correcció de continuïtat en recomptes discrets quan es necessita precisió: sense ella, \( P(X \geq 130) \) sortia 0,123 en lloc de 0,138. Per comunicar ordres de magnitud es pot ometre; per a decisions al mil·límetre, no.
  • Consell: memoritza la llei de l'arrel quadrada (\( \times 4 \) mostra → \( \div 2 \) error) per reaccionar en reunions: quan algú proposi «doblar l'enquesta per afinar el doble», ja saps que no funciona així.

Exercicis

Exercici 1. Amb els tiquets de NovaMarket (\( \mu = 32{,}40 \) €, \( \sigma = 21{,}50 \) €): (a) Calcula l'error típic de la mitjana per a mostres de 64 i de 256 tiquets, i comenta la relació entre tots dos resultats. (b) Per a \( n = 256 \), calcula \( P(\bar{X} > 34) \) (\( \Phi(1{,}19) = 0{,}8830 \)). (c) Per què és vàlid fer servir la normal a (b) si els imports de tiquet són asimètrics?

Exercici 2. El 45 % dels tiquets inclou producte fresc. En una mostra de 100 tiquets de Sevilla-Nervión: (a) Comprova si escau l'aproximació normal a la binomial. (b) Calcula, amb correcció de continuïtat, la probabilitat que 40 o menys tiquets incloguin fresc (\( \Phi(0{,}90) = 0{,}8159 \)). (c) Expressa l'error típic de la proporció mostral en punts percentuals.

Exercici 3. Sobre l'enquesta de satisfacció (\( n = 640 \), \( s = 1{,}6 \)): (a) Calcula l'error típic de la mitjana. (b) Suposant que la mitjana poblacional fos realment 8,1, entre quins dos valors cauria la mitjana mostral en el 95 % de les enquestes de 640 respostes? (c) Màrqueting proposa repetir l'enquesta amb només 160 respostes «perquè la mitjana sortirà igual». Què li respondries amb números?

Solucions

Solució 1. (a) \( 21{,}50/\sqrt{64} = 21{,}50/8 \approx 2{,}69 \) € i \( 21{,}50/\sqrt{256} = 21{,}50/16 \approx 1{,}34 \) €. Quadruplicar la mostra ha reduït l'error just a la meitat: llei de l'arrel quadrada. (b) \( z = \frac{34 - 32{,}40}{1{,}34} \approx 1{,}19 \); \( P = 1 - 0{,}8830 = 0{,}1170 \). (c) Pel TCL: amb \( n = 256 \), molt per sobre de 30, la distribució mostral de la mitjana és aproximadament normal encara que la població no ho sigui. Error freqüent: a (b), fer servir \( \sigma = 21{,}50 \) al denominador, que donaria \( z = 0{,}07 \) i una probabilitat absurda del 47 %.

Solució 2. (a) \( np = 45 \geq 10 \) i \( n(1-p) = 55 \geq 10 \): escau. (b) Mitjana \( 45 \), desviació \( \sqrt{100 \times 0{,}45 \times 0{,}55} = \sqrt{24{,}75} \approx 4{,}97 \). Amb correcció de continuïtat, «\( X \leq 40 \)» s'avalua en 40,5: \( z = \frac{40{,}5 - 45}{4{,}97} \approx -0{,}90 \), per tant \( P \approx 1 - 0{,}8159 = 0{,}1841 \). (c) \( \sqrt{0{,}45 \times 0{,}55/100} \approx 0{,}0497 \): la proporció mostral fluctua típicament uns ±5 punts percentuals amb 100 tiquets. Error freqüent: fer servir 39,5 en lloc de 40,5 — l'esglaó de «fins a 40 inclòs» acaba en 40,5.

Solució 3. (a) \( 1{,}6/\sqrt{640} \approx 1{,}6/25{,}3 \approx 0{,}063 \) punts. (b) \( 8{,}1 \pm 2 \times 0{,}063 \): entre 7,97 i 8,23 aproximadament (regla del 95 %). (c) Amb \( n = 160 \), l'error típic seria \( 1{,}6/\sqrt{160} \approx 0{,}126 \): el doble. La mitjana «sortiria semblant», sí, però amb una fluctuació típica de ±0,25 punts al 95 %, suficient per confondre un 8,1 amb un 7,9 o un 8,3 — just les diferències que el comitè vol vigilar. Matís d'analista: a més de l'atzar, en totes dues enquestes persisteix el possible biaix de no-resposta del Mòdul 1, que cap augment de \( n \) no corregeix.

Conclusió

El Teorema Central del Límit corona el mòdul i li dona sentit retrospectiu: la mitjana mostral és una variable aleatòria centrada en \( \mu \), amb error típic \( \sigma/\sqrt{n} \) i — aquí el miracle — forma normal sigui quina sigui la població de partida; les proporcions, mitjanes disfressades, hereten el mateix comportament, i la binomial de \( n \) gran es rendeix a la campana. Amb això, la caixa d'eines del Mòdul 4 queda tancada i passa una cosa més profunda: per primera vegada sabem quant balla un estadístic al voltant del paràmetre que persegueix — el 8,1 de satisfacció balla ±0,06, el 61 % de targeta sobre 200 tiquets balla ±3,5 punts. Només falta capgirar l'ullera de llarga vista: deixar de deduir la mostra a partir de la població i començar a inferir la població a partir de la mostra, que és el que la Marta necessita per respondre al comitè. Aquest gir — estimar paràmetres desconeguts i quantificar la confiança de l'estimació — arrenca al Mòdul 5 amb l'Estimació de Paràmetres.

© Copyright 2026. Tots els drets reservats