AI từ con số 0
Một khóa học đầy đủ về trí tuệ nhân tạo, từ toán học đến LLM, agent và MCP. Ba mươi chương, mỗi chương đều đáng đọc riêng.
Perceptron từ đầu: một neuron thật sự tính gì
Một neuron là tổng có trọng số và một ngưỡng. Toàn bộ ý tưởng chỉ có vậy — và chính giới hạn của nó đã buộc mọi thứ sau này ra đời.
Hàm mất mát đến từ đâu: likelihood, không phải quy ước
Squared error không phải quy ước. Nó là một tuyên bố về nhiễu, và bạn có thể thấy nó sai.
Xuống dốc: Gradient Descent và hai bước ai cũng bỏ qua
Ai cũng viết dấu trừ. Hầu như không ai nói vì sao nó ở đó, hay bước đi lớn đến đâu thì còn chịu được.
Phân loại, cross-entropy và cách đừng tự đánh lừa mình
Accuracy là con số dễ báo cáo nhất — và cũng dễ khiến bạn bị đánh lừa nhất.
Backpropagation từ đầu: Động cơ trước, rồi đến mạng
Backpropagation không phải là thuật toán mạng nơ-ron. Nó là quy tắc dây chuyền, áp dụng lên một đồ thị, theo hướng hiệu quả.
Làm cho mạng train được, rồi khái quát hóa được
Gradient đúng nhưng mạng vẫn không học. Chương này nói về khác biệt đó.
Tự xây BPE Tokenizer: Vì sao model của bạn không đếm được chữ R
Model không bao giờ nhìn thấy chữ cái. Mọi điều kỳ lạ về cách nó đánh vần, đếm và thụt lề đều bắt nguồn từ đó.
Dự đoán next-token: embeddings và ý nghĩa của perplexity
Một mục tiêu, không nhãn, và một bảng vector không ai thiết kế.
Attention và khối Transformer, suy ra từ phép trung bình
Attention không phải là một công thức để chấp nhận. Nó xuất hiện khi bạn ngừng trung bình hóa quá khứ đồng đều và để model chọn trọng số.
Huấn luyện trước một LLM: dữ liệu, compute, scaling laws và chi phí
Những quyết định còn lại không phải là quyết định lập trình. Chúng là các khoản mua.
Từ mô hình gốc đến trợ lý: SFT, RLHF, DPO và GRPO
Mô hình pretrained không trả lời câu hỏi. Nó tiếp tục văn bản — khác biệt nằm ở giai đoạn huấn luyện thứ hai ít ai thấy.
Đo lường Chain of Thought, RLVR và Test-Time Compute
Model không suy nghĩ. Nó dùng nhiều token hơn trước khi trả lời, và điều đó đo được cũng như tính phí được.
Làm inference rẻ hơn: KV cache, batching và lượng tử hóa
Generation không phải một bài toán duy nhất: token đầu bị giới hạn bởi compute, hàng nghìn token sau bị giới hạn bởi memory.
Lần gọi LLM production đầu tiên: streaming, retry, timeout
Model giờ đã nằm sau một port. Từ đây, hầu như mọi thứ hỏng đều không còn là toán học.
Prompt Engineering qua đo lường: Điều gì làm thay đổi đầu ra
prompt cần được đo, không phải tranh luận. Bốn biến thể trên hai mươi ca chẳng phân biệt được gì.
Context window, token và hóa đơn, đo bằng số liệu
Window không phải là bộ nhớ. Nó được nạp lại từ đầu ở mỗi call, và bạn trả tiền cho lần nạp đó.
Temperature, top-p và tính quyết định mà bạn không có
Temperature không làm model sáng tạo hơn. Nó tăng xác suất của các token mà chính model đã chấm thấp, và bạn có thể thấy điều đó.
Tool Calling và structured outputs: Bản hợp đồng vẫn đứng vững
Model không bao giờ thực thi gì cả. Nó chỉ yêu cầu, theo hình dạng bạn định nghĩa, và hình dạng là phần duy nhất bạn kiểm soát.
RAG trong production: chunking, retrieval và trích dẫn trung thực
Chunking tệ phá hỏng câu trả lời trước khi tìm kiếm bắt đầu, và không reranker nào cứu được.
Fine-Tune, retrieve hay prompt? Quyết định nằm ở kinh tế
Không ai hỏi câu này vì mô hình. Họ hỏi vì ngân sách.
Định giá multimodal: hình ảnh, âm thanh và video thực sự tính phí gì
Một bức ảnh không có giá một bức ảnh. Nó có giá bằng token, theo công thức bạn không chọn.
AI agent là gì: năm kiểu kinh điển, hai định nghĩa đối nghịch
Một công cụ trong catalogue biến một lệnh gọi thành hai và 39 input token thành 420. Nó có phải agent hay không còn tùy định nghĩa bạn mở.
Xây dựng Agent Harness: Vòng lặp và năm lối thoát
Vòng lặp chỉ có 15 dòng. Mọi thứ giúp nó sẵn sàng triển khai đều là một cách để thoát khỏi nó.
Context engineering: Vì sao agent của bạn kém thông minh hơn ở lượt 40
Context window chưa hề tràn. Dữ kiện chỉ bị dời chỗ, và agent ngừng tìm thấy nó.
Điều phối multi-agent: Năm pattern và khi nào một agent thắng
Bốn cách sắp xếp, một nhiệm vụ, một hóa đơn. Cách rẻ nhất sai; cách đắt nhất không kiểm chứng được worker của mình.
Giải thích MCP theo đặc tả: Server thực sự là gì
Không phải phép màu. Đó là transport, định dạng thông điệp và ba primitive — bạn có thể gõ bằng tay.
Ship một MCP Server: TypeScript và Python, đo đạc rõ ràng
Hai SDK, một wire. Những khác biệt thú vị là thứ protocol không nhìn thấy.
Agent Skills và SKILL.md: Đo lường cơ chế tiết lộ dần
Một skill là một thư mục có file Markdown bên trong. Phần thú vị nằm ở đoạn nào của file được đọc, và đọc khi nào.
Đánh giá LLM: từ benchmark công khai đến golden set của bạn
Một con số không có khoảng tin cậy chỉ là giai thoại có thêm số thập phân.
Prompt Injection và bộ ba chí mạng: Bảo mật một agent thật
Model không thể phân biệt chỉ dẫn của bạn với chỉ dẫn của người lạ. Mọi thứ hiệu quả đều bắt đầu từ việc chấp nhận điều đó.