Durant tot el curs has treballat «a mà»: fórmules, taules i calculadora. Ha estat deliberat — qui entén el càlcul entén el resultat —, però en el dia a dia ningú no suma 33.000 tiquets amb llapis. Aquesta última lliçó és el pont cap a la feina real: un panorama honest de les eines amb què es fa estadística en una empresa, del full de càlcul (que arriba molt més lluny del que se sol creure) a Python i R (que comencen on aquell s'esgota), passant pel programari estadístic clàssic i l'ús assenyat de la IA generativa. Veuràs l'anàlisi de NovaMarket reproduïda amb fórmules de full de càlcul, un primer contacte comentat amb pandas i scipy, i criteris per triar eina segons la tasca. I, com que és l'última lliçó, tanca també el curs: quin camí has recorregut i cap a on continuar.

Contingut

  1. El mapa: quina eina per a quina tasca
  2. El full de càlcul com a primera eina seriosa
  3. NovaMarket en fórmules: el curs sencer en un full
  4. Taules dinàmiques: freqüències i encreuaments sense fórmules
  5. On s'acaba el full de càlcul
  6. Python amb pandas i scipy: el següent esglaó
  7. R: l'altre gran camí
  8. Programari estadístic clàssic: SPSS, Stata, jamovi i JASP
  9. La IA generativa com a assistent d'anàlisi
  10. Un flux de treball reproduïble
  11. Tancament del curs: el viatge, el que saps fer i els següents passos

El mapa: quina eina per a quina tasca

No hi ha cap eina «millor»: hi ha aparellaments millors o pitjors entre tasca, volum de dades i perfil de qui analitza.

Eina Ideal per a Es queda curta quan Corba d'aprenentatge
Full de càlcul Descriptius, IC, proves t i khi quadrat, gràfics ràpids, dades < ~100.000 files Anàlisis repetibles, dades grans, mètodes avançats Baixa (ja el fas servir)
jamovi / JASP Tots els contrastos del curs amb menús i sortida neta, gratis Automatització, dades molt grans Baixa
SPSS / Stata El mateix, estàndard en acadèmia i consultoria Pressupost (llicències), flexibilitat Mitjana
R Qualsevol mètode estadístic existent; gràfics de qualitat Qui no vulgui programar gens Mitjana-alta
Python (pandas/scipy) Estadística + automatització + integració amb sistemes i ML Mètodes estadístics molt de nínxol (R hi arriba abans) Mitjana-alta

La trajectòria natural del professional de negoci és de dalt a baix: dominar de debò el full de càlcul, provar jamovi/JASP quan els menús ajudin, i fer el salt a Python o R quan la repetició o el volum ho demanin.

El full de càlcul com a primera eina seriosa

Excel, Google Sheets i LibreOffice Calc comparteixen un arsenal estadístic que cobreix la major part d'aquest curs. En aquesta lliçó les funcions apareixen amb els noms de la configuració en espanyol — la més habitual, amb diferència, entre els usuaris d'Excel de casa nostra; si tens el programa configurat en un altre idioma, l'ajuda del mateix full de càlcul et dona l'equivalència de cada nom. La taula següent és el teu mapa de tornada: cada funció, amb la lliçó on vas aprendre què significa.

Funció (ES) Què calcula Lliçó
PROMEDIO, MEDIANA, MODA.UNO Tendència central 02-01
DESVEST.M, VAR.S Desviació típica i variància mostrals (divisor \(n-1\)) 02-02
PERCENTIL.INC, CUARTIL.INC Percentils i quartils 02-03
CONTAR.SI, FRECUENCIA Freqüències 02-04
DISTR.BINOM.N, POISSON.DIST Probabilitats binomial i Poisson 04-01, 04-03
DISTR.NORM.N, DISTR.NORM.INV Probabilitats i percentils de la normal 04-02
INTERVALO.CONFIANZA.T Semiamplitud de l'IC de la mitjana (t) 05-02
PRUEBA.T, PRUEBA.Z Valor p de proves t i z 05-03
COEF.DE.CORREL Correlació de Pearson 06-01
PENDIENTE, INTERSECCION.EJE, COEFICIENTE.R2, ESTIMACION.LINEAL Regressió lineal 06-02
PRUEBA.CHICUAD Valor p de khi quadrat (observats vs esperats) 06-04
PRONOSTICO.LINEAL, PRONOSTICO.ETS Previsió (lineal / allisat amb estacionalitat) 07-01

A més, el complement gratuït Análisis de datos d'Excel (Herramientas para análisis) afegeix ANOVA, regressió múltiple amb la sortida completa i histogrames — amb ell, el full cobreix fins i tot bona part dels mòduls 6 i 7.

NovaMarket en fórmules: el curs sencer en un full

Suposa el full tiquets amb 500 tiquets de Madrid-Centro: els imports a A2:A501 i, a B2:B501, el canal (botiga/en línia). Així es reprodueix, fórmula a fórmula, la feina del curs:

  • Descriptiva (mòdul 2):
    • Mitjana: =PROMEDIO(A2:A501) → 32,40 €
    • Desviació: =DESVEST.M(A2:A501) → 21,50 € (fixa-t'hi: la .M de mostral; DESVEST.P dividiria entre \(n\) i seria la poblacional)
    • Mediana i P90: =MEDIANA(A2:A501), =PERCENTIL.INC(A2:A501;0,9)
    • CV: =DESVEST.M(A2:A501)/PROMEDIO(A2:A501) → 0,66: l'enorme dispersió relativa dels tiquets, una vella coneguda.
  • Probabilitat (mòdul 4): probabilitat que una botiga vengui menys de 40.000 € en un dia, amb \(N(43,983;\ 6,200)\)? =DISTR.NORM.N(40000;43983;6200;VERDADERO) → 0,26. El percentil 95 de la demanda del cas d'inventari: =DISTR.NORM.INV(0,95;720;70) → 835,1.
  • Inferència (mòdul 5): IC al 95 % per al tiquet mitjà:
    • Semiamplitud: =INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500) → 1,89
    • Interval: mitjana ± semiamplitud → \((30{,}51;\ 34{,}29)\) €.
  • Contrast (mòdul 5): gasten igual botiga i en línia? Amb els imports de cada canal a D2:D341 i E2:E161: =PRUEBA.T(D2:D341;E2:E161;2;3) → retorna directament el valor p (el 2 demana contrast bilateral; el 3, variàncies diferents — la variant de Welch, l'opció prudent per defecte).
  • Regressió (mòdul 6): vendes vs superfície de les 42 botigues a G2:H43: =PENDIENTE(H2:H43;G2:G43), =INTERSECCION.EJE(H2:H43;G2:G43), =COEFICIENTE.R2(H2:H43;G2:G43) — i la regressió múltiple del R² = 0,912, amb el complement d'anàlisi o =ESTIMACION.LINEAL amb diverses columnes de X.

La lliçó de fons: tot el que vas calcular a mà durant el curs viu a una fórmula de distància. El full no pensa per tu — continua calent saber que PRUEBA.T contrasta mitjanes i què significa el seu valor p —, però executa per tu.

Taules dinàmiques: freqüències i encreuaments sense fórmules

Per a variables categòriques, l'eina reina del full és la taula dinàmica: arrossegues canal a files i obtens la distribució de freqüències de 02-04; arrossegues grup d'edat a columnes i tens la taula de contingència de 06-04 — la de l'encreuament hàbits × edat de la lliçó de ciències socials es munta en 30 segons. Amb «mostra els valors com a % de fila» llegeixes els perfils directament. Per al contrast, calcules al costat els esperats (total fila × total columna / total) i ho remates amb PRUEBA.CHICUAD(observats;esperats). Mitjana d'import per segment i format, mínims i màxims per transportista... qualsevol «quant val X per grup?» és una taula dinàmica abans que cent fórmules.

On s'acaba el full de càlcul

Honestedat obligada: el full s'esgota, i convé reconèixer-ne els símptomes:

  • Repetició: la mateixa anàlisi cada setmana, amb el mateix ritual de copiar-enganxar-ajustar-rangs. Cada repetició manual és una oportunitat d'error silenciós.
  • Volum: centenars de milers de files el fan lent i inestable (i els 4,5 milions de tiquets mensuals de NovaMarket, senzillament, no hi caben).
  • Traçabilitat: una cel·la sobreescrita no deixa rastre; auditar qui va canviar què és gairebé impossible. Errors cèlebres de fulls de càlcul han costat carreres i pressupostos públics.
  • Mètodes: logística, ACP, k-means, Kaplan-Meier, no paramètrics seriosos... o no existeixen o exigeixen contorsions.
  • Barreja de dada i càlcul: en un full, les dades brutes i les fórmules conviuen i es contaminen; els fluxos seriosos les separen.

Cap d'aquests límits no invalida el full per al que fa bé: anàlisis puntuals, mides moderades, comunicació. Només marquen la frontera.

Python amb pandas i scipy: el següent esglaó

Python és avui l'idioma més comú de l'anàlisi de dades a l'empresa. Dues biblioteques basten per reproduir el curs: pandas (taules de dades) i scipy.stats (mètodes estadístics). Un primer script complet, línia a línia:

import pandas as pd                        # pandas: taules de dades ("DataFrames")
from scipy import stats                    # scipy.stats: funcions estadístiques

df = pd.read_csv("tiquets.csv")            # carrega el CSV: una fila per tiquet
print(df["import"].describe())             # n, mitjana, desviació, mín, quartils, màx
                                           # (tot el mòdul 2 en una línia)

mitjana = df["import"].mean()              # mitjana mostral
s = df["import"].std()                     # desviació típica mostral (divisor n-1)
n = len(df)                                # mida mostral

ic = stats.t.interval(0.95, df=n - 1,      # IC al 95 % amb la t de Student:
        loc=mitjana, scale=s / n ** 0.5)   # centre = mitjana, escala = error estàndard
print(f"IC 95%: {ic}")                     # p. ex. (30.51, 34.29) — com al full

botiga = df[df["canal"] == "botiga"]["import"]      # filtra els tiquets de botiga
en_linia = df[df["canal"] == "en línia"]["import"]  # i els del canal en línia
t, p = stats.ttest_ind(botiga, en_linia, equal_var=False)  # t de Welch (dues mostres)
print(f"t = {t:.2f}, valor p = {p:.4f}")   # el mateix contrast de la lliçó 05-03

L'important no és memoritzar la sintaxi, sinó veure el patró: cada línia executa una cosa que ja saps interpretar. describe() és el mòdul 2; t.interval, la lliçó 05-02; ttest_ind, la 05-03. A scipy hi viuen també chi2_contingency (khi quadrat), f_oneway (ANOVA), pearsonr i mannwhitneyu; la regressió múltiple i la logística, a la biblioteca statsmodels; el k-means que va segmentar el Club Nova, a scikit-learn. Aprendre Python per a dades és un curs en si mateix — aquí n'hi ha prou que sàpigues que la porta existeix, que és oberta i que l'idioma que es parla a l'altra banda és el que acabes d'aprendre.

R: l'altre gran camí

R va néixer per a l'estadística i continua sent l'estàndard en recerca: qualsevol mètode publicat té paquet en R abans que enlloc més. L'equivalent de l'script anterior:

tiquets <- read.csv("tiquets.csv")   # carregar les dades
summary(tiquets$import)              # descriptius bàsics
t.test(import ~ canal,               # t de Welch i IC del 95 % en una sola
       data = tiquets)               # crida: fórmula "import segons canal"

Triar entre Python i R importa menys del que sembla: els conceptes són idèntics i migrar costa dies, no mesos. Orientació pràctica: entorn d'enginyeria de dades/ML i automatització → Python; entorn acadèmic, bioestadística o gràfics estadístics fins → R.

Programari estadístic clàssic: SPSS, Stata, jamovi i JASP

Entre el full i la programació hi ha una tercera via: programes de menús pensats per a l'estadística.

  • SPSS (IBM) i Stata: veterans de ciències socials, salut i consultoria; sortides completes i documentades, però llicències cares.
  • jamovi i JASP: gratuïts, de codi obert, moderns i — això és or per a qui comença — amb una interfície netíssima: carregues un CSV, marques «t de mostres independents» i obtens el contrast amb la seva mida d'efecte i el seu gràfic, sense escriure res. Tots dos corren sobre R per sota, així que créixer després cap a R és natural. JASP hi afegeix de sèrie els enfocaments bayesians.

Per a un professional de negoci sense intenció de programar, jamovi o JASP són probablement la millor segona eina després del full de càlcul: tots els mètodes d'aquest curs, sortida ordenada i cost zero.

La IA generativa com a assistent d'anàlisi

Els assistents d'IA (com el que potser t'ha acompanyat en aquest campus) han canviat el dia a dia de l'anàlisi, i mereixen un judici equilibrat:

On ajuden de debò:

  • Escriure i explicar codi («què fa aquesta línia de pandas?», «dona'm la fórmula de full de càlcul per a un IC»).
  • Explorar enfocaments: «tinc dades ordinals de satisfacció en 3 grups, quin contrast hi encaixa?» — i ara saps verificar que la resposta (Kruskal-Wallis) és correcta.
  • Redactar: passar d'una taula de resultats a un esborrany d'informe executiu.
  • Interpretar sortides de programari que no coneixes.

On exigeixen cautela:

  • Verificar els càlculs: un model de llenguatge pot equivocar-se en aritmètica o citar un valor crític incorrecte amb tot l'aplom. Els nombres es comproven amb l'eina estadística; la IA proposa, el programari disposa.
  • No pujar dades personals ni confidencials a serveis externs: els tiquets de clients o les dades del programa de benestar no surten de NovaMarket sense passar per compliance (ho vas veure amb el RGPD). Existeixen desplegaments corporatius precisament per a això.
  • El criteri no es delega: la IA no sap si la teva mostra està esbiaixada, si falta el grup de control o si l'efecte és rellevant per al negoci. Aquest és exactament el criteri que has construït en vuit mòduls — i la raó que la IA multipliqui l'analista format i confongui el que no ho està.

Un flux de treball reproduïble

Sigui quina sigui l'eina, els hàbits que distingeixen una anàlisi professional d'un nyap amb sort:

  1. Conserva les dades brutes intactes. Una còpia de només lectura, sempre. Tota neteja es fa sobre còpies; si la neteja va ser errònia, es pot tornar a començar.
  2. Documenta cada pas. Què vas filtrar, quins atípics vas apartar i per què, quina versió de la dada vas fer servir. En codi, això surt gratis (l'script és la documentació); en un full de càlcul, una pestanya de «notes de l'anàlisi» en fa el paper.
  3. Que un altre ho pugui repetir. L'estàndard d'or: un company, amb les teves dades i els teus passos, arriba al teu nombre. Si el teu resultat depèn de dotze clics que només tu recordes, no és un resultat: és una anècdota.
  4. Versiona. Res d'analisi_final_v3_DEFINITIU_ara_si.xlsx: dates als noms com a mínim; eines de control de versions quan treballis amb codi.
  5. Separa dada, càlcul i presentació. L'informe cita l'anàlisi; l'anàlisi cita la dada. Quan la Marta pregunti «d'on surt aquest 0,32?», la cadena s'ha de poder recórrer en un minut.
  6. Registra les decisions abans de veure els resultats quan hi hagi contrastos en joc: quina hipòtesi, quina \(\alpha\), quina mida mostral — l'antídot contra el p-hacking que vas conèixer a Errors, Potència i Mida Mostral.

Tancament del curs: el viatge, el que saps fer i els següents passos

El viatge

Vuit mòduls enrere entraves a les oficines de NovaMarket sense saber distingir una mediana d'una mitjana. Mira el camí amb perspectiva:

Mòdul El que vas construir El moment NovaMarket
1 Població, mostra, tipus de dades, biaixos Aprendre a desconfiar de l'enquesta còmoda
2 Descriure: mitjanes, dispersió, percentils, gràfics El tiquet de 32,40 € amb la seva enorme \(s = 21{,}50\)
3 Probabilitat, Bayes, valor esperat El cupó de 5 € valorat en +0,36 €/enviament abans de llançar-lo
4 Binomial, normal, Poisson, TCL Vendes diàries \(N(43,983;\ 6,200)\) i per què les mitjanes són normals
5 Inferir: IC, contrastos, errors, potència Dimensionar el pilot del cupó (7.250 per grup)
6 Relacionar: correlació, regressió, ANOVA, khi quadrat Superfície i vendes; formats comparats; hàbits × edat
7 Sèries, multivariant, no paramètrics Els 7,1 M€ previstos per al T4 (MAPE 1,8 %); el misteri de Cuenca resolt; els tres segments del Club Nova
8 Aplicar-ho tot: negoci, societat, salut, eines El checkout aprovat, la bretxa digital mesurada, el cribratge llegit amb Bayes

El que saps fer ara

  • Descriure un conjunt de dades amb les mesures i els gràfics adequats al seu tipus, i detectar atípics i asimetries abans que contaminin tota la resta.
  • Quantificar la incertesa: triar el model de probabilitat raonable, construir un interval de confiança i explicar-lo a qui decideix.
  • Contrastar amb les regles del joc completes: hipòtesi i \(\alpha\) per endavant, mida mostral calculada, i la diferència entre significatiu i rellevant sempre present.
  • Relacionar variables — i no confondre correlació amb causalitat, agregats amb individus, ni un efecte brut amb un d'ajustat per confusors.
  • Predir amb sèries temporals i avaluar honestament l'error de predicció.
  • Dissenyar i llegir experiments: del test A/B a l'assaig clínic són el mateix animal, i saps reconèixer quan un estudi observacional ven més del que pot provar.
  • Triar eina i muntar un flux que un altre pugui auditar i repetir.

En una frase: has passat de consumir xifres a interrogar-les — i aquesta és la diferència entre opinar amb dades i decidir amb dades.

Següents passos

  1. Practica amb dades pròpies, ja. Aquesta setmana. Els tiquets, enquestes o temps de la teva organització, o dades obertes (INE, Eurostat, portals de dades obertes): tria una pregunta petita i recorre el cicle complet — pregunta, dada, mètode, resultat, decisió. L'estadística es fixa fent.
  2. Adopta una segona eina. Si vius al full de càlcul, instal·la jamovi o JASP aquesta setmana i repeteix-hi una anàlisi que ja vas fer; si et crida la programació, l'script de pandas d'aquesta lliçó és el teu punt de partida.
  3. Aprofundeix cap on apunti la teva feina: regressió i modelització si et toca explicar i predir (el camí natural cap a l'aprenentatge automàtic), mostreig i enquestes si treballes amb persones, sèries temporals si vius de previsions.
  4. Continua al campus: els cursos d'anàlisi de dades, fulls de càlcul, Python i matemàtiques aplicades d'aquest campus continuen de manera natural diversos dels camins oberts aquí.
  5. Rellegeix els teus informes antics. És l'exercici més revelador: hi veuràs mitjanes sense dispersió, percentatges sense \(n\), causalitats sense control. No t'hi amoïnis — és senyal de tot el que has après.

Errors Comuns i Consells

  • Confondre DESVEST.M amb DESVEST.P (i VAR.S amb VAR.P): la variant mostral divideix entre \(n-1\) i és gairebé sempre la que vols; amb \(n\) gran a penes canvia, amb \(n\) petit sí.
  • Fer servir INTERVALO.CONFIANZA.T com si retornés l'interval. Retorna la semiamplitud: l'interval és mitjana ± resultat. Llegit sense cura, es reporta un «interval» que és només el marge.
  • Refiar-se d'una cel·la que ningú no pot auditar. El full no deixa rastre dels canvis: per a anàlisis que importen, documenta els passos i conserva la dada bruta — o passa a codi, on el rastre és automàtic.
  • Canviar d'eina esperant que resolgui un problema de mètode. Python calcula la mateixa mitjana esbiaixada que Excel, només que més de pressa. Els problemes de mostreig, confusió o disseny no els arregla cap sintaxi.
  • Copiar codi o fórmules de la IA sense verificar. Demana sempre l'explicació línia a línia (ara la pots seguir) i comprova el resultat amb un cas petit que sàpigues resoldre a mà.
  • Aprendre eines en lloc d'estadística. És l'error invers i també existeix: qui col·lecciona cursos de Python sense entendre què és un valor p automatitza confusions a gran velocitat. Tu ja tens la base; les eines són execució.

Exercicis

Exercici 1

Els imports de 500 tiquets són a A2:A501. Escriu les fórmules de full de càlcul (amb els noms de funció en espanyol, com a la lliçó) per a: (a) mitjana i desviació típica mostral; (b) el percentil 90; (c) l'interval de confiança al 95 % per a la mitjana (els dos extrems).

Exercici 2

Executes l'script de Python de la lliçó i obtens: t = 2.31, valor p = 0.0214 per a botiga vs en línia. Amb \(\alpha = 0{,}05\): què en conclous, quina prova s'ha fet servir exactament i què demanaries mirar abans de portar la conclusió a la Marta?

Exercici 3

Tria eina i justifica-ho: (a) un contrast t puntual sobre 200 files per a una reunió de demà; (b) l'informe setmanal de lliuraments que avui ocupa 2 h de copiar i enganxar; (c) un company sense cap experiència en programació vol fer ANOVA i khi quadrat amb sortides presentables i sense cost.

Solucions

Exercici 1.

(a) =PROMEDIO(A2:A501) i =DESVEST.M(A2:A501). (b) =PERCENTIL.INC(A2:A501;0,9). (c) Semiamplitud: =INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500); extrems: =PROMEDIO(A2:A501)-INTERVALO.CONFIANZA.T(0,05;DESVEST.M(A2:A501);500) i el mateix amb +. Errors freqüents: passar 0,95 en lloc de 0,05 (la funció demana \(\alpha\), no la confiança) i oblidar que retorna la semiamplitud, no l'interval.

Exercici 2.

S'ha fet servir la t de Welch per a dues mostres independents (ttest_ind amb equal_var=False), bilateral. Com que \(0{,}0214 < 0{,}05\), es rebutja \(H_0\): la diferència de despesa mitjana entre canals és estadísticament detectable. Abans d'anar a la Marta: (1) la mida de la diferència amb el seu IC — significatiu no diu quants euros, i amb mostres grans pot ser una diferència irrellevant; (2) els descriptius i atípics de cada canal (els imports dels tiquets són molt asimètrics: potser convé contrastar també amb la U de Mann-Whitney com a comprovació); (3) que la mostra no tingui biaixos de recollida. L'eina va donar el valor p en un segon; les tres comprovacions són la teva feina.

Exercici 3.

(a) Full de càlcul: PRUEBA.T resol en minuts una anàlisi puntual de 200 files; muntar cap altra cosa seria sobreenginyeria. (b) Python (o R): la repetició setmanal és el símptoma clàssic — un script ho fa en segons, sense errors de còpia i amb rastre auditable; les 2 h s'amortitzen en un mes. (c) jamovi o JASP: gratuïts, de menús, amb ANOVA i khi quadrat de sèrie i sortida presentable; SPSS faria el mateix però amb llicència, i programar contradiu l'enunciat. Consell general: la pregunta no és «quina eina és millor?» sinó «quina combinació de tasca, volum, repetició i perfil tinc al davant?».

Conclusió

Aquí s'acaba el curs. Va començar amb una pregunta modesta — què és una dada i com es resumeix? — i acaba amb tu triant entre PRUEBA.T, ttest_ind i jamovi per respondre preguntes de negoci amb intervals, contrastos i models que entens per dins, perquè cadascun el vas calcular abans a mà. Pel camí, NovaMarket ha estat el teu laboratori: els seus tiquets et van ensenyar a descriure, el seu cupó a esperar valors, les seves botigues a inferir, el seu e-commerce a predir, el seu Club Nova a segmentar, i els seus casos finals a integrar tot l'arsenal en decisions de debò — a l'empresa, a la societat i fins i tot llegint un titular de salut.

Queda't amb les tres idees que sostenen tota la resta: les dades varien (i la variabilitat es mesura, no s'ignora), tota conclusió porta incertesa (i la incertesa es quantifica, no s'amaga) i el mètode segueix la pregunta (mai a l'inrevés). Les eines canviaran — canviaran els programes, canviarà la IA —, però aquest criteri és teu i ja no te'l pren ningú. Ara, cap a les teves pròpies dades: la Marta ja no et fa falta.

© Copyright 2026. Tots els drets reservats