IA do zero
Um curso completo sobre inteligência artificial, da matemática aos LLMs, agentes e MCP. Trinta capítulos, cada um com valor próprio.
O perceptron de raiz: o que calcula um neurónio
Um neurónio é uma soma ponderada e um limiar. Essa é a ideia toda — e os seus limites obrigaram a tudo o que veio depois.
De onde vem uma função de perda: verosimilhança, não convenção
O erro quadrático não é uma convenção. É uma afirmação sobre o ruído — e pode vê-la falhar.
Ladeira abaixo: Gradient Descent e os dois passos que todos saltam
Todos escrevem o sinal menos. Quase ninguém explica porque está lá, nem que tamanho de passo aguenta.
Classificação, entropia cruzada e como não se enganar
A exatidão é o número mais fácil de comunicar — e o mais fácil para nos enganar.
Backpropagation do zero: primeiro o motor, depois a rede
Backpropagation não é um algoritmo de rede neuronal. É a regra da cadeia, aplicada a um grafo, na direção eficiente.
Fazer a rede treinar — e fazê-la generalizar
O gradiente está correto e, mesmo assim, a rede não aprende. Este capítulo é sobre essa diferença.
Construa um tokenizer BPE: porque é que o seu modelo não consegue contar os R
O modelo nunca vê letras. Tudo o que parece estranho na forma como soletra, conta e indenta vem daí.
Previsão do próximo token: embeddings e o que significa a perplexidade
Um objetivo, sem rótulos, e uma tabela de vetores que ninguém desenhou.
Attention e o bloco transformer, derivados de uma média
Attention não é uma fórmula para aceitar. É o que surge quando deixamos de fazer a média uniforme do passado e deixamos o modelo escolher os pesos.
Pré-treinar um LLM: dados, compute, leis de escala e custo
As decisões que restam não são decisões de programação. São compras.
De modelo base a assistente: SFT, RLHF, DPO e GRPO
Um modelo pré-treinado não responde a perguntas. Continua texto — e a diferença está numa segunda fase de treino que ninguém vê.
Chain of Thought, RLVR e test-time compute: medidos
Um modelo não pensa. Gasta mais tokens antes de responder, e isso é mensurável e faturável.
Tornar a inferência barata: KV cache, batching e quantização
A geração não é um só problema: começa com um primeiro token limitado por computação e segue com milhares limitados por memória.
A sua primeira chamada LLM em produção: streaming, retries e timeouts
O modelo está agora atrás de uma porta. Quase nada do que corre mal daqui em diante é matemática.
Prompt engineering, medido: o que muda o output
Um prompt mede-se, não se debate. Quatro variantes em vinte casos não distinguem absolutamente nada.
A context window, os tokens e a conta, medidos
A janela não é memória. É preenchida do zero em cada chamada, e paga esse preenchimento.
Temperatura, top-p e o determinismo que não tem
A temperatura não torna um modelo mais criativo. Aumenta a probabilidade de tokens que o próprio modelo classificou no fundo.
Tool Calling e outputs estruturados: o contrato que se mantém
O modelo nunca executa nada. Pede, na forma que definiu, e a forma é a única parte que controla.
RAG em produção: chunking, retrieval e citações honestas
Mau chunking destrói a resposta antes da pesquisa começar, e nenhum reranker a recupera.
Fine-tuning, retrieval ou prompt? A decisão é económica
Ninguém faz esta pergunta sobre o modelo. Faz sobre um orçamento.
Preços multimodais: o que imagens, áudio e vídeo faturam realmente
Uma fotografia não custa uma fotografia. Custa tokens, segundo uma fórmula que não escolheu.
O que é um AI agent: cinco tipos clássicos, duas definições rivais
Uma tool no catálogo transformou uma chamada em duas e 39 input tokens em 420. Se isso fez dela um agent depende da definição que abrir.
Construa um agent harness: o loop e as suas cinco saídas
O loop tem quinze linhas. Tudo o que o torna pronto a lançar é uma forma de sair dele.
Context Engineering: porque o seu agent fica mais burro no turno 40
A janela não transbordou. O facto só mudou de sítio, e o agent deixou de o encontrar.
Orquestração multi-agent: cinco padrões e quando um vence
Quatro configurações, uma tarefa, uma conta. A mais barata errou; a mais cara não conseguia verificar os próprios trabalhadores.
MCP explicado pela especificação: o que é realmente um server
Não é magia. É um transporte, um formato de mensagem e três primitivos — e pode escrevê-lo à mão.
Lançar um servidor MCP: TypeScript e Python, medidos
Dois SDKs, um só protocolo. As diferenças interessantes são as que o protocolo não consegue ver.
Agent Skills e SKILL.md: divulgação progressiva, medida
Uma skill é uma pasta com um ficheiro Markdown lá dentro. Tudo o que interessa depende de que parte desse ficheiro é lida, e quando.
Avaliação de LLM: dos benchmarks públicos ao seu golden set
Um número sem intervalo é uma anedota com casas decimais.
Prompt injection e a trifecta letal: proteger um agent real
O modelo não distingue a sua instrução da de um estranho. Tudo o que funciona parte de aceitar isso.