AI شروع سے
مصنوعی ذہانت پر مکمل کورس، ریاضی سے لے کر LLMs، ایجنٹس اور MCP تک۔ تیس ابواب، اور ہر باب اپنی جگہ پڑھنے کے قابل۔
Perceptron ابتدا سے: ایک Neuron کیا compute کرتا ہے
ایک neuron ایک weighted sum اور ایک threshold ہے۔ اصل خیال یہی ہے — اور اسی کی حدوں نے بعد کی ہر چیز کو جنم دیا۔
Loss Function کہاں سے آتا ہے: Likelihood، روایت نہیں
squared error کوئی روایت نہیں۔ یہ noise کے بارے میں دعویٰ ہے — اور آپ اسے غلط ہوتے دیکھ سکتے ہیں۔
ڈھلوان کی طرف: Gradient Descent، اور وہ دو قدم جو سب چھوڑ دیتے ہیں
minus sign سب لکھتے ہیں۔ تقریباً کوئی نہیں بتاتا کہ وہ وہاں کیوں ہے، یا قدم کتنا بڑا ہو سکتا ہے۔
Classification، cross-entropy، اور خود کو دھوکا نہ دینے کا طریقہ
Accuracy رپورٹ کرنے کے لیے سب سے آسان عدد ہے، اور اسی سے دھوکا کھانا بھی سب سے آسان ہے۔
Backpropagation شروع سے: پہلے انجن، پھر نیٹ ورک
Backpropagation نیورل نیٹ ورک algorithm نہیں؛ یہ chain rule ہے، graph پر مؤثر سمت میں لاگو کیا گیا۔
اسے train کروانا، اور اسے generalise کروانا
gradient درست ہے اور network پھر بھی نہیں سیکھتا۔ یہ باب اسی فرق کے بارے میں ہے۔
BPE Tokenizer بنائیں: آپ کا model R کیوں نہیں گن سکتا
model کبھی letters نہیں دیکھتا۔ اس کے spelling، counting اور indentation کی ہر عجیب بات اسی سے نکلتی ہے۔
Next-token prediction: embeddings، اور perplexity کا مطلب
ایک objective، کوئی labels نہیں، اور vectors کی ایک table جسے کسی نے design نہیں کیا۔
Attention اور Transformer block: ایک اوسط سے اخذ شدہ
Attention کوئی formula نہیں جسے بس مان لیا جائے۔ یہ وہ چیز ہے جو تب ملتی ہے جب آپ ماضی کو برابر اوسط کرنے کے بجائے model کو weights چننے دیتے ہیں۔
LLM کی pretraining: data، compute، scaling laws اور لاگت
باقی فیصلے programming کے نہیں رہتے۔ وہ خریداری بن جاتے ہیں۔
Base Model سے Assistant تک: SFT، RLHF، DPO اور GRPO
pretrained model سوالوں کے جواب نہیں دیتا؛ وہ متن جاری رکھتا ہے۔ فرق اس دوسرے training مرحلے میں ہے جو اکثر دکھائی نہیں دیتا۔
Chain of Thought، RLVR اور Test-Time Compute کی پیمائش
model سوچتا نہیں۔ جواب دینے سے پہلے زیادہ tokens خرچ کرتا ہے، اور یہ قابلِ پیمائش بھی ہے اور قابلِ بل بھی۔
Inference کو سستا بنانا: KV cache، Batching اور Quantization
Generation ایک مسئلہ نہیں: پہلا token compute-bound ہے، پھر ہزاروں memory-bound tokens آتے ہیں؛ serving کی زیادہ تر چالیں اسی فرق سے نکلتی ہیں۔
آپ کی پہلی production LLM call: streaming، retries، timeouts
model اب ایک port کے پیچھے ہے۔ یہاں سے جو کچھ بگڑتا ہے، اس میں تقریباً کچھ بھی ریاضی نہیں۔
Prompt Engineering، ناپ کر: output کو کیا بدلتا ہے
prompt کو ناپا جاتا ہے، اس پر بحث نہیں ہوتی۔ بیس cases پر چار variants کچھ بھی الگ ثابت نہیں کرتے۔
context window، tokens اور بل: ناپ تول کے ساتھ
window memory نہیں۔ ہر call پر اسے نئے سرے سے بھرا جاتا ہے، اور آپ اسی refill کی قیمت دیتے ہیں۔
Temperature، top-p اور وہ determinism جو آپ کے پاس نہیں
Temperature model کو زیادہ creative نہیں بناتی؛ یہ ان tokens کا امکان بڑھاتی ہے جنہیں model نے خود کم ترین score دیا تھا۔
Tool Calling اور Structured Outputs: وہ contract جو قائم رہتا ہے
model کبھی کچھ execute نہیں کرتا۔ وہ آپ کی مقرر کردہ shape میں درخواست کرتا ہے، اور shape ہی وہ حصہ ہے جسے آپ control کرتے ہیں۔
Production میں RAG: chunking، retrieval اور دیانت دار citations
خراب chunking تلاش شروع ہونے سے پہلے جواب تباہ کر دیتی ہے، اور کوئی reranker اسے واپس نہیں لا سکتا۔
Fine-Tune، Retrieve یا Prompt؟ فیصلہ معاشی ہے
کوئی یہ سوال model کے بارے میں نہیں پوچھتا۔ اصل سوال budget کا ہوتا ہے۔
Multimodal قیمتیں: images، audio اور video پر اصل بل کیسے بنتا ہے
ایک photograph کی قیمت ایک photograph نہیں ہوتی۔ یہ tokens کی قیمت ہوتی ہے، ایک ایسے formula سے جو آپ نے نہیں چنا۔
AI Agent کیا ہے: پانچ کلاسیکی اقسام، دو حریف تعریفیں
catalogue میں ایک tool نے ایک call کو دو میں اور 39 input tokens کو 420 میں بدل دیا۔ یہ agent تھا یا نہیں، اس کا دارومدار تعریف پر ہے۔
Agent harness بنائیں: loop اور اس سے نکلنے کے پانچ راستے
loop پندرہ لائنوں کا ہے۔ اسے ship کے قابل بنانے والی ہر چیز اس سے نکلنے کا ایک راستہ ہے۔
Context Engineering: آپ کا agent ٹرن 40 پر کم عقل کیوں ہو جاتا ہے
window overflow نہیں ہوئی۔ fact صرف جگہ بدلا، اور agent نے اسے ڈھونڈنا چھوڑ دیا۔
Multi-Agent Orchestration: پانچ patterns، اور کب ایک ہی جیتتا ہے
چار arrangements، ایک task، ایک bill۔ سب سے سستا غلط تھا، اور سب سے مہنگا اپنے workers کو check نہیں کر سکتا تھا۔
MCP کو spec کے مقابل سمجھیں: server اصل میں کیا ہے
یہ جادو نہیں۔ یہ transport، message format اور تین primitives ہیں — اور آپ اسے ہاتھ سے ٹائپ کر سکتے ہیں۔
MCP Server شپ کریں: TypeScript اور Python، ناپ تول کے ساتھ
دو SDKs، ایک ہی wire۔ اصل فرق وہ ہیں جو protocol دیکھ نہیں سکتا۔
Agent Skills اور SKILL.md: progressive disclosure، پیمائش کے ساتھ
skill ایک فولڈر ہے جس میں Markdown فائل ہوتی ہے۔ اصل بات یہ ہے کہ اس فائل کا کون سا حصہ کب پڑھا جاتا ہے۔
LLM evaluation: public benchmarks سے آپ کے golden set تک
interval کے بغیر عدد decimals والی anecdote ہے۔
Prompt injection اور lethal trifecta: ایک حقیقی agent کو محفوظ بنانا
model آپ کی instruction اور اجنبی کی instruction میں فرق نہیں کر سکتا۔ جو بھی کام کرتا ہے، اسی حقیقت کو مان کر بنتا ہے۔