AI от нулата
Пълен курс по изкуствен интелект — от математиката до LLM, агенти и MCP. Тридесет глави, всяка от които си струва да се прочете самостоятелно.
Персептронът от нулата: какво изчислява един неврон
Невронът е претеглена сума и праг. Това е цялата идея — а ограниченията ѝ доведоха до всичко след нея.
Откъде идва една функция на загуба: от правдоподобие, не от конвенция
Квадратичната грешка не е конвенция. Тя е твърдение за шума — и можете да видите кога е грешно.
Надолу по склона: gradient descent и двете стъпки, които всички пропускат
Всички пишат знака минус. Почти никой не казва защо е там или колко голяма стъпка издържа.
Класификация, cross-entropy и как да не се заблудите сами
Accuracy е най-лесното число за докладване — и най-лесното, което може да ви заблуди.
Backpropagation от нулата: първо двигателят, после мрежата
Backpropagation не е алгоритъм за neural network. Това е верижното правило, приложено към граф, в ефективната посока.
Да го накараме да се обучава — и да обобщава
Градиентът е правилен, а мрежата пак не учи. Тази глава е за разликата.
Създайте BPE tokenizer: защо моделът ви не може да преброи R-тата
Моделът никога не вижда букви. Всичко странно в правописа, броенето и отстъпите произтича от това.
Предсказване на следващия token: embedding-и и какво означава перплексията
Една цел, без етикети, и таблица от вектори, която никой не е проектирал.
Attention и transformer блокът, изведени от средно
Attention не е формула за приемане на доверие. То се появява, когато спрете да осреднявате миналото равномерно и оставите модела да избере теглата.
Pretraining на LLM: данни, compute, scaling laws и цена
Оставащите решения не са програмни. Те са покупки.
От базов модел до асистент: SFT, RLHF, DPO и GRPO
Pretrained моделът не отговаря на въпроси. Той продължава текст — а разликата идва от втори етап на обучение, който никой не вижда.
Chain of Thought, RLVR и Test-Time Compute — измерени
Моделът не мисли. Той харчи повече tokens преди отговора — и това е измеримо и платимо.
Как да направим inference евтин: KV cache, batching и квантизация
Генерирането не е един проблем: compute-bound първи token, после хиляди memory-bound tokens. Почти всеки трик в serving идва от това разделение.
Първото ви production LLM извикване: streaming, retries, timeouts
Моделът вече е зад порт. Почти нищо от това, което се обърква оттук нататък, не е математика.
Prompt engineering с измервания: какво променя резултата
prompt се измерва, не се обсъжда. Четири варианта върху двадесет случая не различават нищо.
Context window, tokens и сметката — измерени
Window не е памет. Тя се пълни от нулата при всяко извикване — и плащате за това презареждане.
Temperature, Top-p и детерминизмът, който нямате
Temperature не прави модела по-креативен. Той повишава вероятността за tokens, които самият модел е оценил най-ниско.
Tool Calling и structured outputs: договорът, който издържа
Моделът никога не изпълнява нищо. Той пита във форма, която сте задали — и формата е единственото, което контролирате.
RAG в production: chunking, retrieval и честни цитати
Лошият chunking унищожава отговора преди търсенето, а reranker не може да го възстанови.
Fine-tuning, извличане или prompt? Решението е икономическо
Никой не задава този въпрос за модела. Задават го за бюджета.
Мултимодално ценообразуване: какво наистина се таксува при изображения, аудио и видео
Една снимка не струва една снимка. Струва tokens по формула, която не сте избрали.
Какво е AI agent: пет класически типа и две конкуриращи се дефиниции
Един tool в каталога превърна един call в два и 39 input tokens в 420. Дали това го прави agent зависи от дефиницията.
Изградете agent harness: цикълът и петте изхода от него
Цикълът е от петнадесет реда. Всичко, което го прави годен за production, е начин да излезете от него.
Context Engineering: Защо вашият agent оглупява на ход 40
Прозорецът не преля. Фактът просто се премести и agent спря да го намира.
Multi-Agent orchestration: пет модела и кога един печели
Четири подредби, една задача, една сметка. Най-евтината греши, а най-скъпата не може да провери собствените си работници.
MCP според спецификацията: какво всъщност е server
Не е магия. Това са transport, формат за съобщения и три primitives — и можете да го напишете на ръка.
Пускане на MCP сървър: TypeScript и Python, измерени
Два SDK, един wire. Интересните разлики са онези, които протоколът не може да види.
Agent Skills и SKILL.md: измерено постепенно разкриване
Skill е папка с Markdown файл в нея. Всичко интересно следва от това коя част от файла се чете и кога.
Оценяване на LLM: от публични benchmarks до вашия златен набор
Число без интервал е анекдот с десетични знаци.
Prompt injection и смъртоносната триада: защита на реален agent
Моделът не различава вашата инструкция от тази на непознат. Работещата защита започва с приемането на този факт.