IA da zero
Un corso completo sull’intelligenza artificiale, dalla matematica fino a LLM, agenti e MCP. Trenta capitoli, ciascuno valido anche da solo.
Il perceptron da zero: che cosa calcola un neurone
Un neurone è una somma pesata e una soglia. L’idea è tutta qui — e i suoi limiti hanno imposto tutto ciò che è venuto dopo.
Da dove nasce una funzione di loss: verosimiglianza, non convenzione
L’errore quadratico non è una convenzione. È un’affermazione sul rumore, e puoi vederla sbagliare.
In discesa: Gradient Descent e i due passaggi che tutti saltano
Tutti scrivono il segno meno. Quasi nessuno spiega perché sia lì, o quanto grande possa essere un passo prima di rompersi.
Classificazione, cross-entropy e come non ingannarti da solo
L’accuracy è il numero più facile da riportare e quello da cui è più facile farsi ingannare.
Backpropagation da zero: prima il motore, poi la rete
La backpropagation non è un algoritmo per reti neurali. È la regola della catena, applicata a un grafo, nella direzione efficiente.
Far sì che si alleni, e che generalizzi
Il gradiente è corretto e la rete continua a non imparare. Questo capitolo parla di quella differenza.
Costruire un Tokenizer BPE: perché il tuo modello non conta le R
Il modello non vede mai lettere. Tutte le stranezze su come scrive, conta e indenta derivano da questo.
Predizione del next-token: embedding e cosa significa la perplexity
Un solo obiettivo, nessuna etichetta e una tabella di vettori che nessuno ha progettato.
Attention e transformer block, derivati da una media
Attention non è una formula da accettare. È ciò che ottieni quando smetti di fare la media uniforme del passato e lasci scegliere i pesi al modello.
Pretraining di un LLM: dati, compute, scaling laws e costi
Le decisioni rimaste non sono decisioni di programmazione. Sono acquisti.
Dal modello di base all'assistente: SFT, RLHF, DPO e GRPO
Un modello preaddestrato non risponde alle domande: continua il testo. La differenza è una seconda fase di addestramento che nessuno vede.
Chain of Thought, RLVR e Test-Time Compute, misurati
Un model non pensa. Spende più token prima di rispondere, e questo è misurabile e fatturabile.
Rendere l’inference economica: KV cache, batching e quantizzazione
La generation non è un solo problema: primo token compute-bound, poi migliaia memory-bound. Da questa divisione nasce quasi tutto il serving.
La tua prima chiamata LLM in produzione: streaming, retry, timeout
Il model ora è dietro una porta. Da qui in poi, quasi nulla di ciò che va storto è matematica.
Prompt Engineering misurato: cosa cambia l’output
Un prompt si misura, non si discute. Quattro varianti su venti casi non distinguono proprio nulla.
Context window, token e conto: misurati
La window non è memoria. Viene ricostruita da zero a ogni call, e paghi per ricostruirla.
Temperature, Top-p e il determinismo che non hai
La temperature non rende un modello più creativo: aumenta la probabilità dei token che il modello stesso aveva valutato peggio.
Tool Calling e output strutturati: il contratto che regge
Il modello non esegue nulla. Chiede, nella forma che hai definito, e quella forma è l’unica parte che controlli.
RAG in produzione: chunking, retrieval e citazioni oneste
Un cattivo chunking distrugge la risposta prima che inizi la ricerca, e nessun reranker la recupera.
Fine-Tune, retrieval o prompt? La decisione è economica
Nessuno fa questa domanda sul model. La fa sul budget.
Prezzi multimodali: cosa fatturano davvero immagini, audio e video
Una fotografia non costa una fotografia. Costa token, secondo una formula che non hai scelto.
Cos’è un AI agent: cinque tipi classici, due definizioni rivali
Un tool nel catalogo ha trasformato una chiamata in due e 39 input token in 420. Che questo lo renda un agent dipende dalla definizione che apri.
Costruire un agent harness: il loop e le sue cinque vie d’uscita
Il loop è di quindici righe. Tutto ciò che lo rende distribuibile è un modo per uscirne.
Context Engineering: perché il tuo agent diventa più stupido al turno 40
La window non era piena. Il dato si è solo spostato, e l’agent ha smesso di trovarlo.
Orchestrazione multi-agent: cinque pattern e quando ne vince uno
Quattro configurazioni, un compito, un conto. La più economica era sbagliata e la più costosa non poteva controllare i propri worker.
MCP spiegato a partire dalla specifica: che cos’è davvero un server
Non è magia. È un transport, un formato di messaggi e tre primitive, e puoi digitarlo a mano.
Pubblicare un server MCP: TypeScript e Python, misurati
Due SDK, un solo wire. Le differenze interessanti sono quelle che il protocollo non può vedere.
Agent Skills e SKILL.md: disclosure progressiva, misurata
Una skill è una cartella con dentro un file Markdown. Tutto ciò che conta deriva da quale parte di quel file viene letta, e quando.
Valutazione degli LLM: dai benchmark pubblici al tuo golden set
Un numero senza intervallo è un aneddoto con decimali.
Prompt injection e trifecta letale: mettere in sicurezza un vero agent
Il modello non distingue le tue istruzioni da quelle di uno sconosciuto. Tutto ciò che funziona parte dall'accettarlo.