AI מאפס
קורס מלא בבינה מלאכותית, מהמתמטיקה ועד LLMs, סוכנים ו-MCP. שלושים פרקים, שכל אחד מהם שווה קריאה בפני עצמו.
הפרספטרון מאפס: מה נוירון מחשב
נוירון הוא סכום משוקלל וסף. זה כל הרעיון — והמגבלות שלו הן מה שחייב את כל מה שבא אחריו.
מאיפה מגיעה פונקציית loss: likelihood, לא מוסכמה
שגיאה ריבועית אינה מוסכמה. היא טענה על הרעש, ואפשר לראות אותה טועה.
במורד: Gradient Descent, ושני הצעדים שכולם מדלגים עליהם
כולם כותבים את סימן המינוס. כמעט אף אחד לא מסביר למה הוא שם, או כמה גדול הצעד שהוא יכול לשרוד.
סיווג, אנטרופיה צולבת, ואיך לא לעבוד על עצמך
דיוק הוא המספר שהכי קל לדווח עליו — והכי קל ליפול בגללו.
Backpropagation מאפס: קודם המנוע, אחר כך הרשת
Backpropagation אינו אלגוריתם של רשתות נוירונים. זה כלל השרשרת, מיושם על גרף, בכיוון היעיל.
לגרום לה להתאמן, ולגרום לה להכליל
הגרדיאנט נכון והרשת עדיין לא לומדת. הפרק הזה הוא על ההבדל.
בונים BPE Tokenizer: למה המודל שלך לא מצליח לספור R
המודל אף פעם לא רואה אותיות. כל המוזרויות באיות, בספירה ובהזחה נובעות מזה.
חיזוי ה-token הבא: embedding, ומה באמת אומרת perplexity
מטרה אחת, בלי תוויות, וטבלת וקטורים שאיש לא תכנן.
Attention ובלוק ה-Transformer, נגזרים מממוצע
Attention אינה נוסחה שמקבלים כמובן מאליו. היא מה שמקבלים כשמפסיקים למצע את העבר באופן אחיד ונותנים למודל לבחור את המשקלים.
Pretraining ל-LLM: נתונים, חישוב, חוקי scaling ועלות
ההחלטות שנשארו אינן החלטות תכנות. הן רכישות.
ממודל בסיס לעוזר: SFT, RLHF, DPO ו-GRPO
מודל שעבר pretraining לא עונה על שאלות. הוא ממשיך טקסט — וההבדל הוא שלב אימון שני שכמעט אף אחד לא רואה.
Chain of Thought, RLVR ו-Test-Time Compute — במדידה
מודל לא חושב. הוא מוציא יותר tokens לפני התשובה — וזה מדיד וגם מחויב בתשלום.
להוזיל Inference: KV cache, Batching ו-Quantization
Generation הוא לא בעיה אחת: token ראשון מוגבל-חישוב ואחריו אלפים מוגבלי-זיכרון. כמעט כל טריק ב-serving נובע מהפיצול הזה.
קריאת ה-LLM הראשונה שלך בייצור: streaming, ניסיונות חוזרים ו-timeouts
המודל נמצא עכשיו מאחורי port. כמעט שום דבר שמשתבש מכאן ואילך אינו מתמטיקה.
Prompt engineering במדידה: מה באמת משנה את הפלט
prompt מודדים, לא מתווכחים עליו. ארבע וריאציות על פני עשרים מקרים לא מבדילות כלום.
ה-context window, ה-tokens והחשבון — במדידה
ה-window אינה זיכרון. היא נבנית מחדש מאפס בכל קריאה, ואתם משלמים על המילוי מחדש.
טמפרטורה, top-p והדטרמיניזם שאין לכם
Temperature לא הופכת מודל ליצירתי יותר. היא מעלה את הסתברות ה-tokens שהמודל עצמו דירג בתחתית — ואפשר לראות את זה קורה.
Tool Calling ופלטים מובנים: החוזה שמחזיק מעמד
המודל אף פעם לא מבצע דבר. הוא מבקש, בצורה שהגדרתם, והצורה היא החלק היחיד שבשליטתכם.
RAG בפרודקשן: chunking, אחזור וציטוטים אמינים
chunking גרוע הורס את התשובה עוד לפני שהחיפוש מתחיל, ושום reranking לא מציל אותה.
Fine-Tuning, אחזור או Prompt? ההחלטה היא כלכלית
אף אחד לא שואל את זה על המודל. שואלים את זה על תקציב.
תמחור רב־מודלי: על מה באמת משלמים בתמונות, אודיו ווידאו
תצלום לא עולה תצלום אחד. הוא עולה token, לפי נוסחה שלא בחרתם.
מהו AI agent: חמישה סוגים קלאסיים ושתי הגדרות יריבות
כלי אחד בקטלוג הפך קריאה אחת לשתיים ו-39 input tokens ל-420. האם זה הפך אותו ל-agent תלוי באיזו הגדרה פתחתם.
בנו agent harness: הלולאה וחמש הדרכים לצאת ממנה
הלולאה היא 15 שורות. כל מה שהופך אותה לראויה לפרודקשן הוא דרך לצאת ממנה.
Context Engineering: למה ה-agent שלך נעשה פחות חכם בתור 40
ה-window לא התמלא. העובדה פשוט זזה, וה-agent הפסיק למצוא אותה.
תזמור Multi-Agent: חמישה דפוסים, ומתי אחד מנצח
ארבעה סידורים, משימה אחת, חשבון אחד. הזול ביותר טעה, והיקר ביותר לא יכול לבדוק את העובדים שלו.
MCP מוסבר מול המפרט: מהו שרת באמת
זה לא קסם. זה transport, פורמט הודעות ושלושה primitives — ואפשר להקליד את זה ידנית.
השקת שרת MCP: TypeScript ו-Python, במדידה
שני SDKs, אותו wire. ההבדלים המעניינים הם אלה שהפרוטוקול לא יכול לראות.
Agent Skills ו-SKILL.md: חשיפה הדרגתית, במדידה
skill הוא תיקייה שבתוכה קובץ Markdown. כל מה שמעניין נובע מאיזה חלק בקובץ הזה נקרא, ומתי.
הערכת LLM: מבנצ'מרקים ציבוריים לסט הזהב שלך
מספר בלי רווח סמך הוא אנקדוטה עם ספרות עשרוניות.
Prompt injection והשילוש הקטלני: איך מאבטחים agent אמיתי
המודל לא יכול להבדיל בין ההוראה שלך לזו של זר. כל פתרון שעובד מתחיל בקבלה של העובדה הזו.