Amb els llibres de 10-01 i els cursos de 10-02 tens contingut per a anys. El que cap material aporta és el que més accelera l'aprenentatge: altres persones. Algú que ja va topar amb el teu error de scikit-learn i el va resoldre; algú que revisa el teu quadern i t'assenyala una fuita de dades que no veies; algú que comparteix un article que canvia la teva manera de plantejar un problema; algú a qui tu, d'aquí a uns mesos, ajudaràs. Aquesta lliçó explica per què participar en comunitats, com preguntar bé (l'habilitat més rendible d'un júnior, amb un exemple redactat de pregunta dolenta davant d'una de bona), quines comunitats existeixen i per a què serveix cadascuna (preguntes i respostes, competició i dades, codi obert, agregadors, xats, butlletins i blogs, esdeveniments, comunitats en castellà), quines normes de convivència i de seguretat cal respectar (no compartir mai dades de clients ni claus: enllaça amb el RGPD de 02-03), com contribuir encara que siguis principiant, i acaba amb una taula resum i amb com NovaMarket faria servir les comunitats sense exposar res.

Com a tot el mòdul: només citem comunitats reals i consolidades, pel seu nom; les plataformes canvien de regles, d'activitat i fins i tot d'existència, així que comprova'n l'estat abans de dedicar-hi temps.

Contingut

  1. Per què participar: aprendre, desencallar-se, xarxa professional i actualitat
  2. Com preguntar bé: l'exemple mínim reproduïble
  3. Comunitats de preguntes i respostes
  4. Plataformes de competició i dades
  5. Codi obert: GitHub i Hugging Face Hub
  6. Agregadors, discussió, xats i fòrums de projectes
  7. Butlletins i blogs de referència
  8. Esdeveniments: meetups, PyData i conferències acadèmiques
  9. Comunitats en castellà
  10. Netiqueta, seguretat i com contribuir
  11. Taula resum i aterratge a NovaMarket
  12. Errors Comuns i Consells
  13. Exercicis
  14. Conclusió

  1. Per què participar: aprendre, desencallar-se, xarxa professional i actualitat

Quatre raons, de la més immediata a la més duradora:

  • Desencallar-se. Un error d'instal·lació, una excepció críptica de PyTorch, un pipeline que dona un AUC de 0,99 sospitós (fuita de dades, segur): algú ho ha vist abans. Buscar bé i, si no apareix, preguntar bé, estalvia dies.
  • Aprendre de com ho fan els altres. Llegir els quaderns més ben valorats d'una competició, les respostes acceptades en un fòrum o les discussions d'un issue ensenya criteri: què es considera bona pràctica i per què.
  • Xarxa professional. Els meetups i les contribucions obertes són la manera més natural que et coneguin pel que fas, no pel teu currículum. Moltes primeres oportunitats surten d'aquí.
  • Mantenir-se al dia sense aclaparar-se. Un butlletí setmanal ben triat i una comunitat activa filtren el soroll millor que qualsevol cerca.

I una raó més, en sentit contrari: ensenyar és la millor manera d'aprendre. Respondre una pregunta senzilla t'obliga a entendre-ho de debò.

  1. Com preguntar bé: l'exemple mínim reproduïble

Gairebé totes les comunitats de preguntes i respostes comparteixen unes normes que Stack Overflow resumeix a la seva guia "How to ask". La idea central és l'exemple mínim reproduïble (MRE per les sigles en anglès): el fragment de codi més petit, amb les dades mínimes, que reprodueix el problema a la màquina d'una altra persona.

Elements d'una bona pregunta:

  1. Títol concret amb la llibreria i el símptoma ("ValueError a Pipeline.fit de scikit-learn amb OneHotEncoder i columnes noves a test").
  2. Què intentes aconseguir, en una o dues frases, sense la història completa.
  3. Codi mínim que es pugui executar tal qual: importacions, dades de joguina generades al mateix codi (mai les teves dades reals), les línies que fallen.
  4. L'error complet (la traça sencera, no només l'última línia) o el resultat obtingut davant de l'esperat.
  5. Versions (Python, llibreria, sistema) i què has provat ja i què va passar.
  6. Abans de publicar: busca (probablement ja està resposta), redueix l'exemple fins que treure una línia més faci desaparèixer l'error, i rellegeix com si fossis qui respon.

Exemple: el mateix dubte, mal i ben formulat

Pregunta dolenta:

Títol: "scikit-learn no funciona, ajuda urgent"

Hola, tinc un model de frau per a la meva empresa i quan l'executo amb les dades d'aquest mes em dona un error que diu que les columnes no coincideixen. Adjunto el CSV de comandes (2 MB). Algú sap què passa? Ho necessito per demà.

Problemes: títol buit, sense codi, sense error complet, sense versions, i adjunta dades reals de l'empresa (possible incompliment del RGPD i de la política interna). Ningú no pot ajudar i, a més, genera un risc.

Pregunta bona:

Títol: "ValueError: columns are missing en cridar predict amb un ColumnTransformer ajustat, després d'eliminar una columna del DataFrame d'entrada (scikit-learn 1.4)"

Tinc un Pipeline amb ColumnTransformer + LogisticRegression entrenat amb les columnes ["import_comanda", "pais", "n_comandes_previes"]. En inferència, el DataFrame nou ja no inclou n_comandes_previes i predict falla. Vull saber si hi ha una manera recomanada de tolerar columnes absents (omplint-les) sense reentrenar, o si el correcte és garantir l'esquema abans.

Exemple mínim reproduïble:

import pandas as pd
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder, StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import Pipeline

X = pd.DataFrame({"import_comanda": [10.0, 200.0, 35.0, 500.0],
                  "pais": ["ES", "FR", "ES", "PT"],
                  "n_comandes_previes": [3, 0, 12, 1]})
y = [0, 1, 0, 1]
pre = ColumnTransformer([("num", StandardScaler(), ["import_comanda", "n_comandes_previes"]),
                         ("cat", OneHotEncoder(handle_unknown="ignore"), ["pais"])])
model = Pipeline([("pre", pre), ("clf", LogisticRegression())]).fit(X, y)

X_nou = X.drop(columns=["n_comandes_previes"])
model.predict(X_nou)   # ValueError: columns are missing: {'n_comandes_previes'}

Traça completa: (enganxada íntegra).

Versions: Python 3.11, scikit-learn 1.4, pandas 2.2, Linux.

He provat X_nou["n_comandes_previes"] = 0 abans de predict i funciona, però em preocupa que un zero alteri l'StandardScaler; també he mirat la documentació de ColumnTransformer i no hi veig cap opció per a columnes absents. Quina és la pràctica recomanada?

Observa: títol amb símptoma i context, objectiu clar, dades de joguina generades al codi (no hi ha cap client real), error, versions, el que s'ha provat i una pregunta concreta. És el tipus de pregunta que es respon en minuts i que, a més, ajuda els següents que busquin aquell error.

  1. Comunitats de preguntes i respostes

Comunitat Per a què Nivell Com començar
Stack Overflow (stackoverflow.com) Errors concrets de codi: Python, pandas, scikit-learn, PyTorch, entorns Tots Busca abans; llegeix "How to ask"; la teva primera pregunta ha de portar un MRE. Comença responent preguntes de pandas fàcils per agafar soltesa.
Cross Validated (stats.stackexchange.com) Dubtes d'estadística i ML conceptual: quina mètrica, per què sobreajusta, com interpretar un interval Intermedi És més exigent en rigor; formula la pregunta amb el model i les dades descrites, no amb codi.
Data Science Stack Exchange (datascience.stackexchange.com) Preguntes de pràctica de ciència de dades entre el codi i la teoria (enginyeria de característiques, elecció de model) Introductori-intermedi Bon lloc per als dubtes de "com se sol fer això?" que a Stack Overflow serien massa oberts.

Regla pràctica: si el problema és "aquest codi falla", Stack Overflow; si és "no sé si això està ben plantejat", Cross Validated o Data Science SE.

  1. Plataformes de competició i dades

Kaggle (kaggle.com) és alhora plataforma de competicions, repositori de conjunts de dades, entorn de quaderns gratuït amb GPU limitada (comprova les condicions actuals), microcursos (10-02) i fòrums: cada competició i cada dataset té la seva discussió, on els participants expliquen enfocaments, errors i trucs. Com aprofitar-lo com a júnior:

  • Comença per Titanic o House Prices (10-02) i, sobretot, llegeix els quaderns amb més vots i les discussions: és una classe magistral gratuïta d'enginyeria de característiques i validació.
  • Publica el teu propi quadern, encara que sigui modest, amb una explicació clara; els comentaris que rebis valen més que la puntuació.
  • Els datasets públics serveixen per practicar els casos de NovaMarket amb dades "de debò" (vendes minoristes, ressenyes, sèries temporals) sense fer servir dades internes.
  • Compte amb el reflex d'"optimitzar la taula": a la feina real la mètrica és la del negoci (08-01), no la d'una taula pública.

  1. Codi obert: GitHub i Hugging Face Hub

GitHub no és només on deses el teu repositori novamarket_ia/ (07-04); és la comunitat tècnica més gran:

  • Issues de scikit-learn, pandas, PyTorch: quan alguna cosa sembla un bug, busca primer als issues oberts i tancats; molt sovint ja està explicat i amb solució provisional.
  • Discussions (als repositoris que les activen) per a preguntes d'ús, més informals que un issue.
  • Contribuir: no cal començar pel codi. Corregir una errata de documentació, afegir un exemple, millorar un missatge d'error o reportar un bug amb MRE són contribucions reals i valorades. Els projectes grans etiqueten tasques per a principiants (busca etiquetes de l'estil "good first issue"). Llegeix sempre la guia de contribució del projecte (CONTRIBUTING.md).

Hugging Face Hub (huggingface.co) és el "GitHub dels models": models, datasets i demostracions (Spaces) compartits, cadascun amb la seva model card (la mateixa idea de 08-01 i, de fet, la seva plantilla s'inspira en l'article de Mitchell et al. de 10-01). Els seus fòrums (discuss.huggingface.co) i les discussions de cada model són el lloc per a preguntes sobre transformers, ajust fi i desplegament. Per a NovaMarket és on la Marta buscaria un model preentrenat en català per a les ressenyes i en llegiria la model card abans de fer-lo servir.

  1. Agregadors, discussió, xats i fòrums de projectes

  • Reddit: r/MachineLearning (recerca, discussió d'articles, anuncis; nivell alt, útil per llegir, no per a preguntes bàsiques) i r/learnmachinelearning (preguntes de principiants, recursos, projectes; bon lloc per demanar orientació d'itinerari). També hi ha comunitats per eina (Python, dades).
  • Hacker News (news.ycombinator.com): agregador tecnològic general amb molta IA; interessant pels comentaris de professionals, amb esperit crític. Fes-lo servir per prendre el pols del sector, no com a font única.
  • Discord i Slack de comunitats: molts projectes i cursos tenen el seu xat, amb activitat i normes pròpies: el de fast.ai (associat al seu fòrum i curs), el de Hugging Face (molt actiu en PLN i models oberts), i els PyTorch Forums (discuss.pytorch.org), un fòrum clàssic on el mateix equip de PyTorch respon dubtes tècnics. La disponibilitat i les invitacions als xats canvien; consulta el web oficial de cada projecte.

Els xats són immediats però efímers; els fòrums i Stack Overflow queden indexats i ajuden els següents. Prefereix el fòrum per a preguntes que altres puguin reutilitzar.

  1. Butlletins i blogs de referència

  • The Batch (DeepLearning.AI): butlletí setmanal amb notícies comentades per Andrew Ng, accessible i amb criteri. Ideal per al perfil del Diego.
  • Distill (distill.pub): revista en línia d'explicacions visuals i interactives de deep learning; fa temps que està en pausa, però els seus articles continuen sent un model de com explicar (atenció, feature visualization, momentum).
  • Blogs de recerca dels grans laboratoris (Google/DeepMind, Meta AI, OpenAI, Anthropic, Microsoft Research, entre d'altres): anuncis i explicacions de primera mà; llegeix-los amb la cautela que també són comunicació corporativa.
  • Towards Data Science i plataformes similars d'articles d'autors independents: hi ha material excel·lent i també de fluix; aplica criteri (l'autor mostra codi i dades?, cita fonts?, els resultats són plausibles?). Ben usades, són bones per a tutorials de casos concrets.
  • Blogs personals de referents (per exemple, els de Chollet, Karpathy o Huyen, citats a 10-01 i 10-02) solen valer més que molts agregadors.

  1. Esdeveniments: meetups, PyData i conferències acadèmiques

  • Meetups locals de dades, Python o IA a la teva ciutat: xerrades curtes, gent propera, sense cost o amb cost baix. És el lloc on es construeix més xarxa; anar-hi amb una pregunta preparada i un projecte del qual parlar (el teu portafolis de 10-04) multiplica el valor.
  • PyData (pydata.org): xarxa internacional de comunitats i conferències de la fundació NumFOCUS sobre l'ecosistema Python de dades; hi ha capítols locals a moltes ciutats, espanyoles incloses, amb esdeveniments periòdics i vídeos publicats.
  • Conferències acadèmiques (NeurIPS, ICML, ICLR, AAAI, i per àrees ACL o CVPR): són on es publica la recerca de la taula de 10-01. Per a un júnior són referència, no destinació immediata: serveixen per saber què s'està investigant (els articles i molts vídeos es publiquen en obert) i per entendre d'on vindran les eines d'aquí a dos anys.

  1. Comunitats en castellà

La comunitat hispanoparlant és àmplia i activa, tot i que més dispersa. Amb la prudència de no recomanar res que no puguem garantir:

  • PyData i meetups de dades i IA a ciutats espanyoles i llatinoamericanes: hi ha capítols i grups locals actius en diverses ciutats; busca "PyData" o "meetup IA/dades" juntament amb la teva ciutat i comprova'n l'activitat recent.
  • Spain AI i associacions similars organitzen xerrades, grups de treball i trobades a Espanya; consulta'n el web per veure la programació vigent.
  • Comunitats locals de Python (grups d'usuaris i les conferències nacionals de Python de cada país) solen tenir seccions o xerrades de dades i IA i són molt acollidores amb els principiants.
  • Molts hispanoparlants participen també a les comunitats internacionals de les seccions anteriors; l'idioma tècnic compartit és l'anglès, i preguntar en anglès multiplica qui et pot ajudar, encara que no sigui perfecte.

Criteri per a qualsevol comunitat, en castellà o no: activitat recent, codi de conducta publicat i respostes útils a les preguntes dels novells.

  1. Netiqueta, seguretat i com contribuir

Netiqueta (normes de convivència):

  • Busca abans de preguntar; agraeix i marca la resposta que ho va resoldre; torna a explicar què va funcionar (ajuda els següents).
  • Sigues concret i educat; no exigeixis urgència ("per demà"); no publiquis la mateixa pregunta a cinc llocs alhora.
  • Respecta el codi de conducta de cada comunitat; gairebé totes en tenen.

Seguretat i confidencialitat, el més important per a qui treballa en una empresa com NovaMarket:

  • No comparteixis mai dades de clients (ni una fila, ni "anonimitzada a mà"): noms, correus, adreces, comandes reals. El RGPD i la política de la teva empresa ho prohibeixen (recorda 02-03); una pregunta en un fòrum és pública i permanent. Genera dades sintètiques que reprodueixin el problema, com a la pregunta bona de la secció 2 o com vas fer amb incidencies.csv a 09-04.
  • No enganxis mai claus, tokens, contrasenyes ni URL internes en preguntes, quaderns públics o repositoris (07-04: variables d'entorn i .gitignore). Si se te n'escapa una, revoca-la immediatament.
  • No descriguis detalls de negoci confidencials (llindars de frau, marges, proveïdors) més enllà del que calgui per a la pregunta tècnica.
  • Abans de pujar un quadern a Kaggle o GitHub, revisa les sortides de les cel·les i els fitxers adjunts: és on més es filtren dades sense voler.

Com contribuir encara que siguis principiant: respondre preguntes fàcils, corregir documentació, afegir un exemple a una galeria, reportar bugs amb MRE, traduir materials, fer una xerrada curta en un meetup sobre un projecte propi. Cadascuna d'aquestes coses és visible i compta com a experiència.

  1. Taula resum i aterratge a NovaMarket

Comunitat Per a què Nivell Com començar
Stack Overflow Errors de codi Tots Buscar; preguntar amb MRE; respondre pandas
Cross Validated / Data Science SE Dubtes d'estadística i mètode Intermedi Descriure el problema i les dades, no el codi
Kaggle (fòrums, quaderns, datasets) Aprendre dels altres, practicar amb dades públiques Introductori Llegir quaderns top de Titanic; publicar-ne un de propi
GitHub (issues, discussions, contribuir) Bugs, ús, codi obert Tots Buscar issues; corregir documentació; "good first issue"
Hugging Face Hub i fòrums Models preentrenats, transformers, LLM Intermedi Llegir model cards; preguntar al fòrum del model
Reddit r/learnmachinelearning / r/MachineLearning Orientació / recerca Introductori / avançat Llegir; preguntar itineraris al primer
Hacker News Pols del sector Tots Llegir comentaris amb esperit crític
Discord/Slack (fast.ai, Hugging Face), PyTorch Forums Ajuda ràpida en un ecosistema Intermedi Entrar pel web oficial del projecte; llegir les normes
The Batch, Distill, blogs de laboratoris Mantenir-se al dia Tots Un butlletí setmanal; Distill com a model d'explicació
Meetups, PyData, Spain AI, comunitats Python Xarxa professional Tots Anar-hi amb una pregunta i un projecte; comprovar l'activitat
NeurIPS/ICML/ICLR/AAAI Referència de recerca Avançat Llegir articles i vídeos oberts; no és destinació immediata

NovaMarket sense exposar dades. La Marta establiria una norma d'equip en tres línies: (1) tota pregunta pública es fa amb dades sintètiques generades al mateix codi (ja tenen els generadors de comandes_nm.csv i incidencies.csv); (2) cap quadern no surt del repositori sense revisar-ne les sortides i sense passar pel .gitignore de 07-04; (3) les claus de serveis (l'LLM del cas 7 quan es construeixi) viuen en variables d'entorn i mai en preguntes ni exemples. Amb això, l'equip faria servir Stack Overflow per a errors de pipeline, el fòrum de Hugging Face per triar un model en català per a ressenyes, Kaggle per practicar amb dades minoristes públiques, i un meetup local per explicar (sense xifres confidencials) com van desplegar el predictor per lots amb cues i model card, cosa que a més atrau talent. El Diego, per la seva banda, se subscriuria a The Batch i acompanyaria la Marta al meetup: és la manera més barata que operacions entengui què s'està fent al sector.

Errors Comuns i Consells

  • Preguntar sense buscar i sense exemple reproduïble: la pregunta es tanca o s'ignora, i aprens que "la comunitat és hostil" quan el problema era la pregunta.
  • Enganxar dades reals o claus "només un trosset": és una bretxa, no una drecera. Dades sintètiques sempre.
  • Multiplicar canals: cinc Discords, tres butlletins, dos subreddits. Tria un canal de preguntes, un butlletí i un esdeveniment periòdic.
  • Llegir sense participar durant anys. Respondre una pregunta fàcil al mes canvia la teva relació amb la comunitat i la teva confiança.
  • Prendre com a veritat la resposta més votada sense comprovar-la a la teva versió; les llibreries canvien.
  • Consell: quan resolguis alguna cosa que t'ha costat, escriu-ne la resposta (al fòrum, al teu blog o a les notes del teu repositori): és contribució, portafolis i memòria alhora.

Exercicis

  1. Redactar una pregunta bona. Agafa un error real que hagis tingut durant el curs (per exemple, una fallada de dimensions a la xarxa de 09-03 o un KeyError de pandas a 07-02) i redacta'l seguint la secció 2: títol, objectiu, MRE amb dades de joguina, error, versions, què vas provar.
  2. Triar comunitats. Tria, amb la taula de la secció 11, un canal de preguntes, un butlletí i un esdeveniment periòdic per als propers sis mesos, i justifica cada tria en dues línies segons el teu itinerari.
  3. Revisió de seguretat. Imagina que publicaràs a Kaggle el quadern del predictor de frau de NovaMarket. Escriu una llista de verificació de sis punts que revisaries abans de prémer "publicar".

Solucions

  1. Exemple: Títol: "RuntimeError: mat1 and mat2 shapes cannot be multiplied a nn.Linear després d'nn.EmbeddingBag (PyTorch 2.x)". Objectiu: classificar ressenyes amb EmbeddingBag seguit d'una capa lineal. MRE: vocabulari de 10 paraules, EmbeddingBag(10, 8), Linear(16, 2) (aquí hi ha l'error: la sortida de l'embedding és de dimensió 8, no 16), un lot d'índexs de joguina i la crida al model. Error: traça completa. Versions: Python 3.11, PyTorch 2.x, CPU. Provat: canviar la mida del lot (sense efecte). Pregunta: com deduir la dimensió d'entrada de la capa lineal a partir de l'embedding.
  2. Exemple (itinerari ML/MLOps): Preguntes: Stack Overflow (errors de scikit-learn i desplegament). Butlletí: The Batch (setmanal, criteri, poc temps). Esdeveniment: PyData de la meva ciutat (xerrades de dades en producció, xarxa local).
  3. Exemple: (1) Totes les dades són sintètiques o públiques? (2) He revisat les sortides de totes les cel·les per si mostren files reals? (3) Hi ha rutes internes, noms de servidors o URL de l'empresa? (4) Hi ha claus o tokens al codi o a la configuració? (5) Els llindars, xifres de negoci o noms de proveïdors són necessaris, o els puc substituir per valors d'exemple? (6) Ho ha revisat una altra persona de l'equip?

Conclusió

Has vist per què participar en comunitats (desencallar-se, aprendre dels altres, xarxa, actualitat, i ensenyar), com preguntar bé amb un exemple mínim reproduïble (i la diferència entre la pregunta dolenta amb un CSV real adjunt i la bona amb dades de joguina, error, versions i un dubte concret), quina comunitat serveix per a què (Stack Overflow, Cross Validated i Data Science SE; Kaggle; GitHub i Hugging Face Hub; Reddit i Hacker News; Discord/Slack i PyTorch Forums; The Batch, Distill i blogs; meetups, PyData i les conferències com a referència; comunitats en castellà amb prudència), quines normes de convivència i de seguretat no es negocien (RGPD, dades sintètiques, claus fora) i com contribuir des del primer dia. Ja tens contingut (10-01, 10-02) i persones (10-03). Falta l'últim: cap a on anar. A la lliçó final del curs (10-04) faràs una autoavaluació del que has après, veuràs el mapa de perfils professionals de la IA i quatre itineraris detallats amb recursos, projecte de portafolis i fites, i els propers passos de la Marta i el Diego a NovaMarket, abans de tancar el curs amb una recapitulació dels deu mòduls.

Fonaments d'Intel·ligència Artificial (IA)

Mòdul 1: Introducció a la Intel·ligència Artificial

Mòdul 2: Principis Bàsics de la IA

Mòdul 3: Algorismes en IA

Mòdul 4: Aprenentatge Automàtic (Machine Learning)

Mòdul 5: Xarxes Neuronals i Deep Learning

Mòdul 6: Lògica i Sistemes Experts

Mòdul 7: Eines i Llenguatges de Programació en IA

Mòdul 8: Projectes i Casos d'Estudi

Mòdul 9: Exercicis i Pràctiques

Mòdul 10: Recursos Addicionals

© Copyright 2026. Tots els drets reservats