Ves al contingut

IA des de zero

Un curs complet d'intel·ligència artificial, des de les matemàtiques fins als LLM, els agents i MCP. Trenta capítols, cadascun amb prou valor per llegir-lo per separat.

  1. El perceptró des de zero: què calcula una neurona

    Una neurona és una suma ponderada i un llindar. Aquesta és tota la idea — i els seus límits van forçar tot el que va venir després.

    Capítol 1 de 30

  2. D’on surt una funció de pèrdua: versemblança, no convenció

    L’error quadràtic no és una convenció. És una afirmació sobre el soroll, i pots veure com s’equivoca.

    Capítol 2 de 30

  3. Pendent avall: gradient descent i els dos passos que tothom se salta

    Tothom escriu el signe menys. Gairebé ningú explica per què hi és, ni quina mida de pas pot suportar.

    Capítol 3 de 30

  4. Classificació, entropia creuada i com no enganyar-te

    L’exactitud és el nombre més fàcil d’informar i també el més fàcil perquè t’enganyi.

    Capítol 4 de 30

  5. Backpropagation des de zero: primer el motor, després la xarxa

    Backpropagation no és un algoritme de xarxes neuronals. És la regla de la cadena, aplicada a un graf, en la direcció eficient.

    Capítol 5 de 30

  6. Fer que entreni i que generalitzi

    El gradient és correcte i la xarxa, tot i així, no aprèn. Aquest capítol tracta d’aquesta diferència.

    Capítol 6 de 30

  7. Construeix un tokenitzador BPE: per què el teu model no pot comptar les erres

    El model no veu mai lletres. Tot el que sembla estrany quan escriu, compta o indenta ve d’aquí.

    Capítol 7 de 30

  8. Predicció del següent token: embeddings i què vol dir la perplexitat

    Un objectiu, cap etiqueta i una taula de vectors que ningú no va dissenyar.

    Capítol 8 de 30

  9. Attention i el bloc transformer, derivats d’una mitjana

    Attention no és una fórmula que cal acceptar. És el que obtens quan deixes de mitjanar el passat uniformement i permets al model triar els pesos.

    Capítol 9 de 30

  10. Preentrenar un LLM: dades, còmput, lleis d’escala i cost

    Les decisions que queden no són de programació. Són compres.

    Capítol 10 de 30

  11. Del model base a l’assistent: SFT, RLHF, DPO i GRPO

    Un model preentrenat no respon preguntes. Continua text, i la diferència és una segona fase d’entrenament que ningú no veu.

    Capítol 11 de 30

  12. Chain of Thought, RLVR i Test-Time Compute, mesurats

    Un model no pensa. Gasta més tokens abans de respondre, i això es pot mesurar i facturar.

    Capítol 12 de 30

  13. Abaratir la inferència: KV cache, batching i quantization

    La generació no és un sol problema: un primer token limitat pel càlcul seguit de milers limitats per memòria.

    Capítol 13 de 30

  14. La teva primera crida LLM en producció: streaming, reintents i timeouts

    El model ara és darrere d’un port. Gairebé res del que falla a partir d’aquí és matemàtica.

    Capítol 14 de 30

  15. Prompt engineering, mesurat: què canvia la sortida

    Un prompt es mesura, no es debat. Quatre variants sobre vint casos no distingeixen absolutament res.

    Capítol 15 de 30

  16. El context window, els tokens i la factura, mesurats

    La window no és memòria. Es torna a omplir des de zero a cada call, i pagues per reomplir-la.

    Capítol 16 de 30

  17. Temperature, top-p i el determinisme que no tens

    Temperature no fa un model més creatiu: apuja la probabilitat dels tokens que el mateix model havia puntuat pitjor.

    Capítol 17 de 30

  18. Tool Calling i sortides estructurades: el contracte que aguanta

    El model no executa mai res. Demana, amb una forma que has definit, i la forma és l’única part que controles.

    Capítol 18 de 30

  19. RAG en producció: chunking, recuperació i cites honestes

    Un mal chunking destrueix la resposta abans que comenci la cerca, i cap reranker la recupera.

    Capítol 19 de 30

  20. Fine-tuning, retrieval o prompt? La decisió és econòmica

    Ningú no fa aquesta pregunta sobre el model. La fa sobre un pressupost.

    Capítol 20 de 30

  21. Preus multimodals: què facturen realment imatges, àudio i vídeo

    Una fotografia no costa una fotografia. Costa tokens, segons una fórmula que no has triat.

    Capítol 21 de 30

  22. Què és un AI agent: cinc tipus clàssics, dues definicions rivals

    Una sola eina al catàleg va convertir una crida en dues i 39 input tokens en 420. Que això fos un agent depèn de quina definició obris.

    Capítol 22 de 30

  23. Construeix un agent harness: el bucle i les cinc maneres de sortir-ne

    El bucle té quinze línies. Tot el que el fa apte per a producció és una manera de sortir-ne.

    Capítol 23 de 30

  24. Context Engineering: per què el teu agent es torna més ximple al torn 40

    La finestra no s’ha desbordat. El fet només s’ha mogut, i l’agent ha deixat de trobar-lo.

    Capítol 24 de 30

  25. Orquestració multi-agent: cinc patrons i quan en guanya un

    Quatre disposicions, una tasca, una factura. La més barata s’equivocava i la més cara no podia verificar els seus propis treballadors.

    Capítol 25 de 30

  26. MCP explicat des de l’especificació: què és realment un servidor

    No és màgia. És un transport, un format de missatge i tres primitives, i ho pots escriure a mà.

    Capítol 26 de 30

  27. Publica un servidor MCP: TypeScript i Python, mesurats

    Dos SDKs, un sol cable. Les diferències interessants són les que el protocol no pot veure.

    Capítol 27 de 30

  28. Agent Skills i SKILL.md: divulgació progressiva, mesurada

    Un skill és una carpeta amb un fitxer Markdown a dins. Tot el que és interessant depèn de quina part d’aquest fitxer es llegeix, i quan.

    Capítol 28 de 30

  29. Avaluació d’LLM: dels benchmarks públics al teu golden set

    Un número sense interval és una anècdota amb decimals.

    Capítol 29 de 30

  30. Injecció de prompt i la tríada letal: protegir un agent real

    El model no pot distingir la teva instrucció de la d’un desconegut. Tot el que funciona parteix d’acceptar-ho.

    Capítol 30 de 30