L’IA à partir de zéro
Un cours complet sur l’intelligence artificielle, des mathématiques aux LLM, agents et MCP. Trente chapitres, chacun pouvant se lire indépendamment.
Le perceptron à partir de zéro : ce que calcule un neurone
Un neurone est une somme pondérée et un seuil. C’est toute l’idée — et ses limites ont imposé tout ce qui a suivi.
D’où vient une fonction de perte : de la vraisemblance, pas d’une convention
L’erreur quadratique n’est pas une convention. C’est une hypothèse sur le bruit, et vous pouvez la voir se tromper.
En descente : gradient descent et les deux étapes que tout le monde saute
Tout le monde écrit le signe moins. Presque personne n’explique pourquoi il est là, ni quelle taille de pas il supporte.
Classification, entropie croisée et l’art de ne pas se raconter d’histoires
L’accuracy est le chiffre le plus facile à annoncer — et celui qui trompe le plus facilement.
Backpropagation de zéro : le moteur, puis le réseau
Backpropagation n’est pas un algorithme de réseau de neurones. C’est la règle de la chaîne, appliquée à un graphe, dans le sens efficace.
Le faire apprendre, puis le faire généraliser
Le gradient est correct et le réseau n’apprend toujours pas. Ce chapitre explique la différence.
Construire un tokenizer BPE : pourquoi votre modèle ne compte pas les « r »
Le modèle ne voit jamais les lettres. Tout ce qu’il fait d’étrange en orthographe, comptage et indentation en découle.
Prédiction du token suivant : embeddings et sens de la perplexité
Un seul objectif, aucune étiquette, et une table de vecteurs que personne n’a conçue.
Attention et bloc transformer, dérivés d’une moyenne
L’attention n’est pas une formule à accepter : c’est ce qui apparaît quand le modèle cesse de moyenner le passé uniformément.
Pré-entraîner un LLM : données, calcul, scaling laws et coût
Les décisions restantes ne relèvent pas de la programmation. Ce sont des achats.
Du modèle de base à l’assistant : SFT, RLHF, DPO et GRPO
Un modèle préentraîné ne répond pas aux questions. Il continue du texte — la différence vient d’une deuxième phase d’entraînement invisible.
Chain of Thought, RLVR et test-time compute, mesurés
Un modèle ne pense pas. Il dépense plus de tokens avant de répondre, et cela se mesure comme cela se facture.
Rendre l’inférence moins chère : KV cache, batching et quantification
La génération combine un premier token limité par le calcul, puis des milliers d’autres limités par la mémoire.
Votre premier appel LLM en production : streaming, retries, timeouts
Le modèle est désormais derrière un port. Presque rien de ce qui peut mal tourner ensuite ne relève des mathématiques.
Prompt engineering, mesuré : ce qui change la sortie
Un prompt se mesure, il ne se débat pas. Quatre variantes sur vingt cas ne distinguent rien du tout.
Context window, tokens et facture : les chiffres
La fenêtre n’est pas une mémoire. Elle est remplie à nouveau à chaque appel, et vous payez ce remplissage.
Température, top-p et le déterminisme que vous n’avez pas
La température ne rend pas un modèle plus créatif. Elle augmente la probabilité des tokens que le modèle avait lui-même mal notés.
Tool calling et sorties structurées : le contrat qui tient
Le modèle n’exécute jamais rien. Il demande, dans une forme que vous avez définie, et cette forme est la seule partie que vous contrôlez.
RAG en production : chunking, retrieval et citations honnêtes
Un mauvais chunking détruit la réponse avant même la recherche, et aucun reranking ne la récupère.
Fine-tuning, retrieval ou prompt ? La décision est économique
Personne ne pose vraiment cette question à propos du modèle. On la pose à propos d’un budget.
Tarification multimodale : ce que facturent vraiment images, audio et vidéo
Une photographie ne coûte pas une photographie. Elle coûte des tokens, selon une formule que vous n’avez pas choisie.
Qu’est-ce qu’un agent IA : cinq types classiques, deux définitions rivales
Un outil du catalogue a transformé un appel en deux et 39 tokens d’entrée en 420. Est-ce un agent ? Tout dépend de la définition.
Construire un agent harness : la boucle et ses cinq issues
La boucle tient en quinze lignes. Tout ce qui la rend livrable est une façon d’en sortir.
Context Engineering : pourquoi votre agent devient moins fiable au tour 40
La fenêtre n’a pas débordé. Le fait a juste bougé, et l’agent a cessé de le retrouver.
Orchestration multi-agent : cinq schémas, et quand l’un l’emporte
Quatre organisations, une tâche, une facture. La moins chère s’est trompée, la plus chère ne pouvait pas vérifier ses propres workers.
MCP expliqué à partir de la spec : ce qu’est vraiment un serveur
Ce n’est pas de la magie : un transport, un format de message, trois primitives, et tout se tape à la main.
Livrer un serveur MCP : TypeScript et Python, mesurés
Deux SDK, un même fil. Les différences intéressantes sont celles que le protocole ne voit pas.
Agent Skills et SKILL.md : la divulgation progressive, mesurée
Un skill est un dossier contenant un fichier Markdown. Tout ce qui compte découle de la partie de ce fichier qui est lue, et du moment où elle l’est.
Évaluer les LLM : des benchmarks publics à votre golden set
Un nombre sans intervalle est une anecdote avec des décimales.
Prompt Injection et trifecta létal : sécuriser un vrai agent
Le modèle ne distingue pas votre instruction de celle d’un inconnu. Tout ce qui fonctionne part de ce constat.