Currículo
Trilhas de aprendizagem
Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.
foundations · 8 aulas disponíveis
Orientação e fundamentos
Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.
- O que é, de verdade, um modelo de linguagem?
- Uma história em 60 segundos: de n-grams à era do GPT-5
- A probabilidade de que você realmente precisa
- Vetores, matrizes e produtos escalares
- Multiplicação de matrizes como transformação
- Derivadas e gradientes, geometricamente
- Python, NumPy e PyTorch em 20 minutos
- Como ler um paper de ML
foundations · 7 aulas disponíveis
Do texto aos tensores
Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.
- Por que computadores não sabem ler
- Tokenização I: caracteres, palavras e subwords
- Tokenização II: BPE, passo a passo
- Tokenização III: SentencePiece, byte-level e o impacto da contagem
- Embeddings: significado como geometria
- word2vec, GloVe e o truque das analogias
- Entropia, perplexidade e o que significa 'bom'
foundations · 9 aulas disponíveis
Fundamentos de redes neurais
Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.
- O perceptron
- Perceptrons multicamadas e não linearidade
- Funções de activation: ReLU, GELU e SwiGLU
- Funções de loss e cross-entropy
- Backpropagation, visualizado
- Gradient descent e a paisagem da loss
- Optimizers: SGD → Momentum → Adam → AdamW
- Inicialização, normalização e residuals
- Overfitting, regularização e a bitter lesson
core · 5 aulas disponíveis
Modelos de sequência
Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.
core · 14 aulas disponíveis
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- Attention Is All You Need em contexto
- Self-attention desde os primeiros princípios: Q, K e V
- Scaled dot-product attention e a raiz de d_k
- Causal masking e por que a ordem importa
- Multi-head attention
- Positional encoding I: sinusoidal e aprendido
- Positional encoding II: RoPE
- Positional encoding III: ALiBi e relative bias
- O bloco feed-forward e onde o conhecimento vive
- Residuals, pre-norm versus post-norm
- O bloco completo, montado
- Encoder-only, decoder-only, encoder–decoder
- Construa um GPT do zero, com anotações
- Lendo pesos reais: a aparência de um modelo treinado
advanced · 13 aulas disponíveis
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- Objetivos: causal LM, MLM, span corruption e FIM
- Dados: origem, filtragem, deduplicação e decontamination
- Treinando seu próprio tokenizer
- Scaling laws I: Kaplan
- Scaling laws II: Chinchilla e compute-optimality
- Scaling laws III: inference-aware e over-training
- Data parallelism, ZeRO e FSDP
- Tensor, pipeline e sequence parallelism
- Mixed precision: fp16, bf16 e fp8
- Gradient checkpointing e matemática de memória
- Learning-rate schedules e warmup
- Quando o treinamento falha: spikes, divergence e NaNs
- Quanto custa um pretraining real
advanced · 11 aulas disponíveis
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- Por que modelos base não são assistentes
- Supervised fine-tuning e dados de instruções
- LoRA, QLoRA e PEFT
- Reward models e dados de preferência humana
- RLHF com PPO
- DPO: sem o reward model
- ORPO, KTO, SimPO e o zoológico do alinhamento
- GRPO e RL com rewards verificáveis
- Modelos de reasoning: test-time compute e CoT longo
- Constitutional AI e RLAIF
- Distillation: modelos pequenos jogando acima do peso
advanced · 12 aulas disponíveis
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- O que realmente acontece quando você aperta enviar
- O KV cache
- Prefill e decode: duas máquinas diferentes
- Sampling: temperature, top-k, top-p e min-p
- Beam search, speculative decoding e Medusa
- MQA, GQA e MLA
- FlashAttention e IO-awareness
- PagedAttention e continuous batching
- Quantização I: int8, int4 e fundamentos
- Quantização II: GPTQ, AWQ, GGUF e QAT
- Serving stacks: vLLM, SGLang e TensorRT-LLM
- Executando modelos localmente