La correlació de la lliçó anterior ens va dir que superfície i vendes van fortament plegades (r = 0,93), però la Marta vol més: «Estem valorant obrir una botiga de 1.500 m² a Alicante. Quant vendrà?». Per passar de l'«estan relacionades» al «si x val tant, y valdrà tant» necessitem la regressió lineal simple: la tècnica que ajusta la millor recta possible al núvol de punts i la converteix en una màquina de predicció. En aquesta lliçó plantejarem el model, calcularem a mà els seus coeficients per mínims quadrats (reutilitzant la taula de la lliçó anterior), interpretarem pendent i intercepte en euros, mesurarem la qualitat de l'ajust amb l'R², examinarem els residus, farem la predicció per a Alicante — i aprendrem per què predir fora del rang de les dades és jugar amb foc. Tancarem amb la inferència sobre el pendent i un avançament de la regressió múltiple.

Contingut

  1. El model de regressió lineal simple
  2. Mínims quadrats: la millor recta possible
  3. Càlcul a mà de la recta de NovaMarket
  4. Interpretar pendent i intercepte en unitats de negoci
  5. Com ajusta? El coeficient de determinació R²
  6. Els residus: diagnòstic visual del model
  7. Predicció: interpolació sí, extrapolació amb molta cura
  8. Inferència sobre el pendent: IC i contrast
  9. Anunci: quan una variable no basta (regressió múltiple)

El model de regressió lineal simple

La regressió fa un pas que la correlació no feia: designa una variable com a explicativa (o independent, \( x \): la superfície) i una altra com a resposta (o dependent, \( y \): les vendes), i proposa un model per a la població:

\[ y = \beta_0 + \beta_1 x + \varepsilon \]

  • \( \beta_0 \) (intercepte): el valor mitjà de \( y \) quan \( x = 0 \).
  • \( \beta_1 \) (pendent): quant canvia \( y \), en mitjana, per cada unitat addicional de \( x \). És el paràmetre estrella.
  • \( \varepsilon \) (terme d'error): tot allò que afecta les vendes i no és la superfície — ubicació, competència, gestió del gerent, atzar. El model no pretén que els punts caiguin exactament sobre la recta; pretén que la recta capturi la tendència mitjana i que \( \varepsilon \) reculli les desviacions.

Com sempre en inferència, \( \beta_0 \) i \( \beta_1 \) són paràmetres poblacionals desconeguts; amb la mostra en calcularem les estimacions \( b_0 \) i \( b_1 \), i la recta ajustada serà \( \hat{y} = b_0 + b_1 x \) (el «barret» de \( \hat{y} \) indica valor predit, no observat).

Mínims quadrats: la millor recta possible

Pel núvol de vuit botigues hi poden passar infinites rectes. Quina és «la millor»? El criteri universal és el de mínims quadrats: per a cada botiga, l'error de la recta és el residu \( e_i = y_i - \hat{y}_i \) (l'observat menys el predit, la distància vertical del punt a la recta). Triem la recta que minimitza la suma dels residus al quadrat:

\[ \min \sum_{i=1}^{n} e_i^2 = \min \sum_{i=1}^{n} \left( y_i - b_0 - b_1 x_i \right)^2 \]

(S'eleven al quadrat pel mateix motiu que a la variància: perquè errors positius i negatius no es cancel·lin, i per penalitzar més els errors grans.) Resolent aquest problema de minimització s'obtenen dues fórmules tancades:

\[ b_1 = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} \qquad\qquad b_0 = \bar{y} - b_1 \bar{x} \]

Fixa't en la primera: el numerador és el mateix que el de la covariància i la correlació. De fet, pendent i correlació estan emparentats (\( b_1 = r \cdot s_y/s_x \)): el pendent és «la correlació posada en les unitats del problema». I la segona fórmula diu una cosa elegant: la recta de mínims quadrats passa sempre pel punt de mitjanes \( (\bar{x}, \bar{y}) \).

Càlcul a mà de la recta de NovaMarket

Aquí collim el treball de la lliçó anterior. D'aquella taula ja en tenim tot el que cal (vendes en milers de €):

\[ \bar{x} = 1.281{,}25 \text{ m²} \quad \bar{y} = 45{,}7 \quad \sum (x_i-\bar{x})(y_i-\bar{y}) = 29.210 \quad \sum (x_i-\bar{x})^2 = 774.687{,}5 \]

Pendent:

\[ b_1 = \frac{29.210}{774.687{,}5} = 0{,}0377 ; \text{milers € per m²} \]

Intercepte:

\[ b_0 = 45{,}7 - 0{,}0377 \times 1.281{,}25 = 45{,}7 - 48{,}30 = -2{,}60 ; \text{milers €} \]

Recta ajustada (amb vendes en milers d'euros i superfície en m²):

\[ \hat{y} = -2{,}60 + 0{,}0377,x \]

Interpretar pendent i intercepte en unitats de negoci

Aquesta és la part que la Marta vol sentir, i cal dir-la amb precisió:

  • Pendent \( b_1 = 0{,}0377 \) milers €/m² = 37,7 € per m²: per cada metre quadrat addicional de sala, la venda diària mitjana augmenta uns 37,7 €. En termes de decisió: ampliar una botiga en 100 m² s'associa, en mitjana, amb uns 3.770 € més de venda diària. Dues cauteles obligades: és un efecte mitjà (cap botiga concreta no obeirà la xifra exacta) i és una associació, no una causalitat demostrada — recorda la variable oculta «ubicació» de la lliçó anterior.
  • Intercepte \( b_0 = -2{,}60 \) milers €: literalment, «una botiga de 0 m² vendria −2.600 € al dia». És un absurd evident, i no passa res: l'intercepte és aquí una simple àncora matemàtica de la recta. Només té interpretació de negoci quan \( x = 0 \) és un valor possible i observat (no existeixen botigues de 0 m², i la més petita de la mostra té 850 m²). És el nostre primer avís sobre l'extrapolació.

Com ajusta? El coeficient de determinació R²

La recta és la millor possible, però és bona? La mesura estàndard és el coeficient de determinació \( R^2 \), que neix de descompondre la variabilitat de les vendes:

\[ \underbrace{\sum (y_i-\bar{y})^2}_{\text{SC Total}} = \underbrace{\sum (\hat{y}i-\bar{y})^2}{\text{SC explicada per la recta}} + \underbrace{\sum (y_i-\hat{y}i)^2}{\text{SC residual}} \qquad R^2 = \frac{\text{SC explicada}}{\text{SC Total}} \]

\( R^2 \) és la proporció de la variància d'y que la recta explica, entre 0 (la recta no aporta res) i 1 (ajust perfecte). En regressió lineal simple hi ha una drecera preciosa: \( R^2 = r^2 \), el quadrat de la correlació de Pearson. Amb les nostres dades:

\[ R^2 = 0{,}93^2 = 0{,}865 \]

La superfície explica el 86,5 % de la variabilitat de les vendes entre botigues; el 13,5 % restant es deu a tota la resta (ubicació, gestió, competència…). Amb les sumes de quadrats es veu igual: SC Total = 1.272,84 (la suma de \( (y_i-\bar{y})^2 \) de la taula), SC explicada = \( b_1 \times 29.210 = 1.101{,}2 \) i SC residual = 171,6, i en efecte \( 1.101{,}2/1.272{,}84 = 0{,}865 \). No hi ha cap llindar universal de «bon R²»: en processos industrials s'exigeixen valors altíssims; en comportament de clients, un 0,3 pot ser or. Aquesta descomposició de la variabilitat en «explicada + residual», guarda-la a la memòria: és exactament la maquinària que reutilitzarà l'ANOVA.

Els residus: diagnòstic visual del model

Els residus són la lupa del model: si la recta és adequada, han de semblar soroll sense estructura. Calculem-los:

Botiga \( x_i \) \( y_i \) \( \hat{y}_i = -2{,}60 + 0{,}0377x_i \) Residu \( e_i = y_i - \hat{y}_i \)
Cuenca 850 19,2 29,4 −10,2
Bilbao-Casco 1.100 44,0 38,9 +5,1
Zaragoza-Centro 1.150 44,0 40,8 +3,2
Valencia-Ruzafa 1.200 44,1 42,6 +1,5
Barcelona-Gràcia 1.250 46,1 44,5 +1,6
Madrid-Chamberí 1.300 47,5 46,4 +1,1
Sevilla-Nervión 1.400 52,3 50,2 +2,1
Madrid-Centro 2.000 68,4 72,8 −4,4
Suma 0,0

(Els residus de mínims quadrats sempre sumen zero — una altra comprovació de càlcul.) Dues lectures:

  • Lectura de negoci: Cuenca ven 10.200 € diaris menys del que la seva superfície prediu — de llarg el residu més gran. No és només «la botiga petita»: és una botiga que rendeix per sota fins i tot per a la seva mida. La Marta hi té una investigació pendent (ubicació? assortiment? competència local?). Els residus converteixen la regressió en una eina de benchmarking: comparen cada botiga amb el que seria esperable per a les seves característiques, no amb la mitjana bruta.
  • Lectura estadística (diagnòstic visual). Dibuixant els residus davant de \( \hat{y} \) (o davant d'x) hauríem de veure una banda horitzontal aleatòria al voltant de zero. Senyals d'alarma:
Patró al gràfic de residus Què indica Conseqüència
Corba (∩ o ∪) La relació real no és lineal La recta infraprediu/sobreprediu sistemàticament per trams
Embut (dispersió que creix amb \( \hat{y} \)) Heteroscedasticitat: variància no constant Les prediccions són menys fiables allà on l'embut s'obre
Un o dos residus enormes Atípics o dades mal registrades Poden arrossegar tota la recta: investigar abans de res
Banda horitzontal sense forma Tot en ordre (homoscedasticitat i linealitat) Endavant

En el nostre cas, set residus moderats i el de Cuenca destacant: amb n = 8 no dona per a un veredicte rotund, però mereix vigilància.

Predicció: interpolació sí, extrapolació amb molta cura

Anem per fi a la pregunta de la Marta: la botiga candidata d'Alicante tindria 1.500 m².

\[ \hat{y} = -2{,}60 + 0{,}0377 \times 1.500 = -2{,}60 + 56{,}55 = 53{,}95 ; \text{milers €} \approx 53.900 ; \text{€ de venda diària} \]

Aquesta predicció és una interpolació: 1.500 m² és dins del rang observat (850–2.000 m²), on la recta ha estat «entrenada» i l'ajust és bo. Tot i així, comunica-la amb humilitat: és la venda mitjana esperada per a una botiga d'aquesta mida; la real vindrà acompanyada de l'error del model (l'error típic residual és \( s_e = \sqrt{171{,}6/6} = 5{,}35 \) milers €, així que desviacions de ±5.000–10.000 € diaris respecte del que s'ha predit són perfectament normals, com mostra el mateix residu de Cuenca).

L'extrapolació és una altra història. Direcció vol valorar també un hipermercat de 5.000 m²: la recta diria \( \hat{y} = -2{,}60 + 0{,}0377 \times 5.000 = 185{,}9 \) milers € (~185.900 €/dia). Aquesta xifra no és fiable: 5.000 m² és 2,5 vegades més enllà de la botiga més gran observada, i res no garanteix que la relació continuï sent lineal allà fora (els hipermercats tenen un altre model comercial, una altra rotació per m², passadissos més amples que no venen…). La recta només descriu el món d'on prové. Regla pràctica: prediu dins del rang de les dades; fora d'ell, la teva recta és una hipòtesi sense contrastar, no una predicció. L'intercepte negatiu (\( x = 0 \Rightarrow \hat{y} = -2{,}6 \)) ja era la caricatura perfecta d'aquest perill.

Inferència sobre el pendent: IC i contrast

Com tot allò calculat amb una mostra, \( b_1 = 0{,}0377 \) té error mostral: unes altres 8 botigues donarien un altre pendent. Podria el pendent poblacional \( \beta_1 \) ser 0 (la superfície no aporta res)? El contrast és l'habitual del Mòdul 5:

  • \( H_0: \beta_1 = 0 \) — la superfície no ajuda a predir les vendes
  • \( H_1: \beta_1 \neq 0 \)

L'estadístic fa servir l'error típic del pendent, \( \text{ET}(b_1) = s_e / \sqrt{\sum (x_i-\bar{x})^2} \), on \( s_e = \sqrt{\text{SC residual}/(n-2)} \):

\[ \text{ET}(b_1) = \frac{5{,}35}{\sqrt{774.687{,}5}} = \frac{5{,}35}{880{,}2} = 0{,}00608 \qquad t = \frac{b_1 - 0}{\text{ET}(b_1)} = \frac{0{,}0377}{0{,}00608} = 6{,}20 \]

Amb \( n-2 = 6 \) graus de llibertat, el crític bilateral al 5 % és 2,447: rebutgem \( H_0 \) amb escreix. (No és casualitat que surti el mateix t ≈ 6,2 que al contrast sobre r de la lliçó anterior: en regressió simple són el mateix contrast.) L'interval de confiança al 95 % per al pendent:

\[ b_1 \pm t_{0{,}025;,6} \cdot \text{ET}(b_1) = 0{,}0377 \pm 2{,}447 \times 0{,}00608 = 0{,}0377 \pm 0{,}0149 ;\Rightarrow; [0{,}0228 ;; 0{,}0526] \]

En unitats de negoci: cada m² addicional s'associa amb entre 22,8 i 52,6 € més de venda diària, amb un 95 % de confiança. L'interval és ample — només tenim 8 botigues —, però no conté el 0: l'efecte existeix. Per valorar la inversió d'Alicante, la Marta hauria de treballar amb tota aquesta forquilla, no només amb els 37,7 € centrals.

Anunci: quan una variable no basta (regressió múltiple)

El nostre model deixa un 13,5 % de la variabilitat sense explicar, i sabem que allà hi viuen la ubicació, el trànsit de clients o la renda de la zona. L'extensió natural és la regressió múltiple: un model amb diverses explicatives alhora, \( y = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \varepsilon \), on cada pendent mesura l'efecte de la seva variable mantenint constants les altres — justament l'eina que permet separar l'efecte de la superfície del de la ubicació, atacant el problema de les variables ocultes. La desenvoluparem a l'Anàlisi Multivariant; de moment n'hi ha prou de saber que existeix i què promet.

Errors Comuns i Consells

  • Intercanviar x i y. A diferència de la correlació, la regressió no és simètrica: la recta que prediu vendes a partir de superfície no és la mateixa que la que prediria superfície a partir de vendes. Decideix què vols predir abans de calcular.
  • Interpretar l'intercepte a la força. Si \( x = 0 \) no és un valor possible o queda fora del rang de les dades, \( b_0 \) és només una àncora matemàtica. No presentis «−2.600 €» com una xifra de negoci.
  • Extrapolar sense avisar. Les prediccions fora del rang observat (l'hipermercat de 5.000 m²) hereten la forma de la recta, no la realitat. Assenyala sempre el rang de validesa del model.
  • Llegir el pendent com a causalitat. «+37,7 € per m²» és una associació mitjana en dades observacionals; només un experiment o un model que controli les confusores justifica el llenguatge causal.
  • Quedar-se en l'R² sense mirar residus. Un R² alt pot conviure amb una curvatura clara o amb un atípic que sosté tot l'ajust (recorda Anscombe: els quatre conjunts comparteixen també la mateixa recta i el mateix R²). El gràfic de residus és el control de qualitat.
  • Oblidar la incertesa de la predicció. \( \hat{y} \) és una mitjana esperada: acompanya-la de l'error típic residual o d'un interval, sobretot si dona suport a una inversió.

Exercicis

Exercici 1. Amb la recta de la lliçó (\( \hat{y} = -2{,}60 + 0{,}0377x \), en milers de €): (a) prediu la venda diària d'una botiga de 1.000 m² i d'una altra de 1.900 m², i indica si són interpolacions o extrapolacions; (b) l'equip d'expansió demana la predicció per a un local de 400 m² en format «ultraproximitat»: dona la xifra que llança la recta i explica per què no hauries de lliurar-la sense reserves.

Exercici 2. Ajustant la relació entre despesa en publicitat local (x, milers de €/mes) i vendes en línia a la zona (y, milers de €/mes) amb 10 zones, una analista obté \( b_0 = 12{,}4 \), \( b_1 = 3{,}2 \), \( \text{ET}(b_1) = 1{,}25 \) i \( R^2 = 0{,}45 \). (a) Interpreta \( b_1 \) i \( R^2 \) en llenguatge de negoci. (b) Contrasta al 5 % si la publicitat aporta capacitat predictiva (\( t_{0{,}025;,8} = 2{,}306 \)) i construeix l'IC del 95 % per a \( \beta_1 \).

Exercici 3. Un company presenta una regressió amb R² = 0,91 on el gràfic de residus mostra un embut clar: residus petits en botigues de predicció baixa i enormes en les de predicció alta. Afirma: «amb aquest R², el model és excel·lent i les prediccions són igual de fiables per a qualsevol botiga». Assenyala quina part de l'afirmació és defensable i quina no.

Solucions

Exercici 1. (a) Per a 1.000 m²: \( \hat{y} = -2{,}60 + 37{,}7 = 35{,}1 \) milers € ≈ 35.100 €/dia. Per a 1.900 m²: \( \hat{y} = -2{,}60 + 71{,}63 = 69{,}0 \) milers € ≈ 69.000 €/dia. Totes dues són interpolacions: 1.000 i 1.900 m² cauen dins del rang observat (850–2.000). (b) Per a 400 m² la recta dona \( \hat{y} = -2{,}60 + 15{,}08 = 12{,}5 \) milers € ≈ 12.500 €/dia, però és una extrapolació: queda molt per sota de la botiga més petita de la mostra (850 m²), i un format d'ultraproximitat opera amb una lògica comercial diferent (rotació, assortiment, tiquet). La xifra s'ha de presentar com a orientació no validada, idealment acompanyada de dades de botigues comparables. Error freqüent: mirar només si la predicció «sona raonable» en comptes de comprovar si x és dins del rang de les dades.

Exercici 2. (a) \( b_1 = 3{,}2 \): cada 1.000 € addicionals de publicitat mensual s'associen, en mitjana, amb 3.200 € més de vendes en línia a la zona. \( R^2 = 0{,}45 \): la publicitat explica el 45 % de la variabilitat de les vendes entre zones; més de la meitat depèn d'altres factors. (b) \( t = 3{,}2/1{,}25 = 2{,}56 > 2{,}306 \): es rebutja \( H_0: \beta_1 = 0 \) al 5 % — la relació és significativa. IC del 95 %: \( 3{,}2 \pm 2{,}306 \times 1{,}25 = 3{,}2 \pm 2{,}88 \Rightarrow [0{,}32 ;; 6{,}08] \). Fixa't com l'interval, tot i no contenir el 0, és amplíssim: significatiu no vol dir precís. Error freqüent: fer servir el crític z = 1,96 en lloc del t amb n − 2 = 8 gl, i afirmar causalitat («la publicitat genera 3.200 €») quan les dades són observacionals.

Exercici 3. És defensable que el model captura una part molt gran de la variabilitat global (R² = 0,91) i que la relació és aproximadament lineal en mitjana. No és defensable que les prediccions siguin igual de fiables a tot arreu: l'embut indica heteroscedasticitat — la variància dels errors creix amb el nivell predit —, així que les prediccions per a botigues grans porten molta més incertesa que per a les petites, encara que l'R² global sigui alt. Caldria comunicar marges d'error diferents per tram (o transformar la variable). Error freqüent: tractar l'R² com a certificat universal de qualitat; l'R² és una mitjana global que no veu on es concentren els errors.

Conclusió

Hem convertit una correlació en una eina de decisió: el model \( y = \beta_0 + \beta_1 x + \varepsilon \), ajustat per mínims quadrats, ens ha donat la recta \( \hat{y} = -2{,}60 + 0{,}0377x \), un pendent amb significat econòmic directe (entre 22,8 i 52,6 € de venda diària per m², amb un 95 % de confiança), un R² del 86,5 %, uns residus que assenyalen Cuenca com a botiga a investigar i una predicció concreta per a Alicante: uns 53.900 € diaris per a 1.500 m² — dins del rang de les dades, que és on la recta té jurisdicció. També hem vist la maquinària que hi ha a sota: descompondre la variabilitat total en «explicada + residual». Doncs bé: aquesta mateixa descomposició, aplicada no a una recta sinó a la comparació de diversos grups alhora, és exactament l'Anàlisi de la Variància (ANOVA) — la resposta que vam deixar pendent al Mòdul 5 quan vam descobrir que comparar 42 botigues amb t de dues en dues era una fàbrica de falses alarmes.

© Copyright 2026. Tots els drets reservats