IA do zero
Um curso completo sobre inteligência artificial, da matemática até LLMs, agentes e MCP. Trinta capítulos, cada um valendo a leitura por si só.
O perceptron do zero: o que um neurônio calcula
Um neurônio é uma soma ponderada e um limiar. Essa é a ideia inteira — e seus limites forçaram tudo o que veio depois.
De onde vem uma função de perda: verossimilhança, não convenção
Erro quadrático não é uma convenção. É uma afirmação sobre o ruído — e você pode vê-la estar errada.
Ladeira abaixo: gradient descent e os dois passos que todo mundo pula
Todo mundo escreve o sinal de menos. Quase ninguém explica por que ele está ali, ou até que tamanho de passo ele aguenta.
Classificação, entropia cruzada e como não se enganar
Acurácia é o número mais fácil de reportar — e o mais fácil de enganar você.
Backpropagation do zero: primeiro o motor, depois a rede
Backpropagation não é um algoritmo de rede neural. É a regra da cadeia, aplicada a um grafo, na direção eficiente.
Fazer a rede treinar — e fazê-la generalizar
O gradiente está correto e, ainda assim, a rede não aprende. Este capítulo é sobre a diferença.
Crie um tokenizer BPE: por que seu modelo não conta os R's
O modelo nunca vê letras. Tudo de estranho em como ele soletra, conta e indenta vem disso.
Predição do próximo token: embeddings e o que perplexidade significa
Um objetivo, nenhum rótulo e uma tabela de vetores que ninguém projetou.
Attention e o bloco transformer, derivados de uma média
Attention não é uma fórmula para aceitar. É o que surge quando você para de fazer médias uniformes do passado e deixa o modelo escolher os pesos.
Pré-treinando um LLM: dados, computação, leis de escala e custo
As decisões restantes não são de programação. São compras.
Do modelo base ao assistant: SFT, RLHF, DPO e GRPO
Um modelo pré-treinado não responde perguntas. Ele continua texto — e a diferença está em uma segunda etapa de treino que quase ninguém vê.
Chain of Thought, RLVR e compute em test-time, medidos
Um modelo não pensa. Ele gasta mais tokens antes de responder — e isso é mensurável e cobrável.
Barateando a inferência: KV cache, batching e quantização
Geração não é um problema só: começa compute-bound no primeiro token e segue memory-bound por milhares de tokens.
Sua primeira chamada LLM em produção: streaming, retentativas e timeouts
Agora o model está atrás de uma porta. Quase nada que dá errado daqui em diante é matemática.
Prompt Engineering, medido: o que muda a saída
Um prompt é medido, não debatido. Quatro variantes em vinte casos não distinguem nada.
Context Window, Tokens e a conta, medidos
A window não é memória. Ela é preenchida do zero a cada chamada, e você paga por esse preenchimento.
Temperatura, top-p e o determinismo que você não tem
Temperatura não deixa um modelo mais criativo. Ela aumenta a probabilidade de tokens que o próprio modelo avaliou como ruins — e dá para ver isso acontecer.
Tool calling e saídas estruturadas: o contrato que não quebra
O modelo nunca executa nada. Ele pede, no formato que você definiu — e o formato é a única parte que você controla.
RAG em produção: chunking, retrieval e citações honestas
Chunking ruim destrói a resposta antes da busca começar, e nenhum reranker a recupera.
Fine-Tune, Retrieve ou Prompt? A decisão é econômica
Ninguém faz essa pergunta sobre o model. Faz sobre o orçamento.
Precificação multimodal: o que imagens, áudio e vídeo realmente cobram
Uma fotografia não custa uma fotografia. Ela custa tokens, por uma fórmula que você não escolheu.
O que é um AI Agent: cinco tipos clássicos, duas definições rivais
Uma tool no catálogo transformou uma chamada em duas e 39 input tokens em 420. Se isso virou um agent depende da definição que você abre.
Construa um agent harness: o loop e suas cinco saídas
O loop tem quinze linhas. Tudo que o torna pronto para produção é uma forma de sair dele.
Context Engineering: por que seu agent fica mais burro no turno 40
A window não transbordou. O fato só mudou de lugar, e o agent parou de encontrá-lo.
Orquestração multi-agent: cinco padrões e quando um vence
Quatro arranjos, uma tarefa, uma conta. O mais barato errou, e o mais caro não conseguia verificar seus próprios workers.
MCP explicado pela especificação: o que um servidor realmente é
Não é mágica. É um transporte, um formato de mensagem e três primitivas — e você pode digitar tudo à mão.
Publique um servidor MCP: TypeScript e Python, medidos
Dois SDKs, um protocolo. As diferenças interessantes são as que o protocolo não consegue ver.
Agent Skills e SKILL.md: progressive disclosure, medido
Uma skill é uma pasta com um arquivo Markdown dentro. O interessante vem de qual parte desse arquivo é lida, e quando.
Avaliação de LLM: dos benchmarks públicos ao seu golden set
Um número sem intervalo é uma anedota com decimais.
Prompt Injection e a tríade letal: protegendo um agent real
O modelo não distingue sua instrução da de um estranho. Tudo que funciona parte de aceitar isso.