KI von Grund auf
Ein vollständiger Kurs über künstliche Intelligenz, von der Mathematik bis zu LLMs, Agenten und MCP. Dreißig Kapitel, jedes für sich lesenswert.
Das Perceptron von Grund auf: Was ein Neuron berechnet
Ein Neuron ist eine gewichtete Summe und ein Schwellenwert. Das ist die ganze Idee — und ihre Grenzen erzwangen alles, was danach kam.
Woher eine Verlustfunktion kommt: Likelihood, nicht Konvention
Der quadratische Fehler ist keine Konvention. Er ist eine Behauptung über das Rauschen — und du kannst zusehen, wie sie falsch ist.
Bergab: Gradient Descent und die zwei Schritte, die alle überspringen
Alle schreiben das Minuszeichen. Fast niemand erklärt, warum es dort steht oder wie groß der Schritt sein darf.
Klassifikation, Cross-Entropy und wie du dich nicht selbst täuschst
Accuracy ist die einfachste Zahl im Bericht — und die, von der man sich am leichtesten täuschen lässt.
Backpropagation von Grund auf: erst die Engine, dann das Netzwerk
Backpropagation ist kein Neural-Network-Algorithmus. Sie ist die Kettenregel, auf einen Graphen angewandt, in der effizienten Richtung.
Zum Trainieren bringen – und zum Generalisieren
Der Gradient stimmt, und trotzdem lernt das Netzwerk nicht. Dieses Kapitel erklärt den Unterschied.
BPE-Tokenizer bauen: Warum dein Modell die R nicht zählen kann
Das Modell sieht nie Buchstaben. Alles Merkwürdige daran, wie es schreibt, zählt und einrückt, folgt daraus.
Next-token prediction: Embeddings und was Perplexity bedeutet
Ein Ziel, keine Labels und eine Tabelle aus Vektoren, die niemand entworfen hat.
Attention und der Transformer-Block, aus einem Durchschnitt hergeleitet
Attention ist keine Formel, die man einfach akzeptiert. Sie entsteht, wenn man die Vergangenheit nicht mehr gleichmäßig mittelt, sondern das Modell die Gewichte wählen lässt.
Pretraining eines LLM: Daten, Compute, Scaling Laws und Kosten
Die verbleibenden Entscheidungen sind keine Programmierentscheidungen. Es sind Käufe.
Vom Basismodell zum Assistenten: SFT, RLHF, DPO und GRPO
Ein vortrainiertes Modell beantwortet keine Fragen. Es setzt Text fort – und der Unterschied ist eine zweite Trainingsphase, die niemand sieht.
Chain of Thought, RLVR und Test-Time Compute: gemessen
Ein Modell denkt nicht. Es gibt vor der Antwort mehr tokens aus — und das ist messbar und abrechenbar.
Inference günstig machen: KV cache, Batching und Quantisierung
Generation ist nicht ein Problem: erst ein rechenlimitierter erster token, dann tausende speicherlimitierte tokens. Fast jeder Serving-Trick folgt daraus.
Dein erster LLM-Call in Production: Streaming, Retries, Timeouts
Das Modell liegt jetzt hinter einem Port. Fast nichts, was ab hier schiefgeht, ist Mathematik.
Prompt Engineering, gemessen: Was die Ausgabe verändert
Ein prompt wird gemessen, nicht diskutiert. Vier Varianten über zwanzig Fälle unterscheiden gar nichts.
Context Window, Tokens und Rechnung: gemessen
Das Window ist kein Gedächtnis. Es wird bei jedem Call neu befüllt, und du zahlst für dieses Neubefüllen.
Temperature, Top-p und der Determinismus, den du nicht hast
Temperature macht ein Modell nicht kreativer. Sie erhöht die Wahrscheinlichkeit von Tokens, die das Modell selbst niedrig bewertet hat.
Tool Calling und strukturierte Outputs: Der Vertrag, der hält
Das Modell führt nie etwas aus. Es fragt in einer von dir definierten Form – und nur diese Form kontrollierst du.
RAG in Production: Chunking, Retrieval und ehrliche Zitationen
Schlechtes chunking zerstört die Antwort, bevor die Suche beginnt – und kein reranker holt sie zurück.
Fine-Tuning, Retrieval oder Prompt? Die Entscheidung ist wirtschaftlich
Niemand stellt diese Frage zum Modell. Es geht immer um ein Budget.
Multimodale Preise: Was Bilder, Audio und Video wirklich kosten
Ein Foto kostet nicht ein Foto. Es kostet tokens, nach einer Formel, die du nicht gewählt hast.
Was ein AI Agent ist: fünf klassische Typen, zwei rivalisierende Definitionen
Ein tool im Katalog machte aus einem Call zwei und aus 39 input Tokens 420. Ob das ein agent ist, hängt davon ab, welche Definition du öffnest.
Ein Agent Harness bauen: Die Schleife und ihre fünf Ausgänge
Die Schleife hat fünfzehn Zeilen. Alles, was sie produktionsreif macht, ist ein Weg, sie zu verlassen.
Context Engineering: Warum dein agent in Runde 40 dümmer wird
Die context window lief nicht über. Die Tatsache wanderte nur, und der agent fand sie nicht mehr.
Multi-agent-Orchestrierung: fünf Muster – und wann eines gewinnt
Vier Arrangements, eine Aufgabe, eine Rechnung. Das billigste lag falsch, das teuerste konnte seine eigenen Worker nicht prüfen.
MCP anhand der Spec erklärt: Was ein Server wirklich ist
Es ist keine Magie. Es ist ein Transport, ein Nachrichtenformat und drei Primitive – und du kannst es von Hand tippen.
MCP Server shippen: TypeScript und Python im Messvergleich
Zwei SDKs, ein Wire-Protokoll. Interessant sind die Unterschiede, die das Protokoll nicht sehen kann.
Agent Skills und SKILL.md: Progressive Disclosure, gemessen
Ein skill ist ein Ordner mit einer Markdown-Datei darin. Alles Interessante folgt daraus, welcher Teil dieser Datei wann gelesen wird.
LLM-Evaluation: Von öffentlichen Benchmarks zu deinem Golden Set
Eine Zahl ohne Intervall ist eine Anekdote mit Dezimalstellen.
Prompt Injection und die Lethal Trifecta: Einen echten Agent absichern
Das Model kann deine Anweisung nicht von der eines Fremden unterscheiden. Alles, was funktioniert, beginnt damit, das zu akzeptieren.