Currículo

Trilhas de aprendizagem

Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.

foundations · 8 aulas disponíveis

Orientação e fundamentos

Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.

  1. O que é, de verdade, um modelo de linguagem?
  2. Uma história em 60 segundos: de n-grams à era do GPT-5
  3. A probabilidade de que você realmente precisa
  4. Vetores, matrizes e produtos escalares
  5. Multiplicação de matrizes como transformação
  6. Derivadas e gradientes, geometricamente
  7. Python, NumPy e PyTorch em 20 minutos
  8. Como ler um paper de ML

foundations · 7 aulas disponíveis

Do texto aos tensores

Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.

  1. Por que computadores não sabem ler
  2. Tokenização I: caracteres, palavras e subwords
  3. Tokenização II: BPE, passo a passo
  4. Tokenização III: SentencePiece, byte-level e o impacto da contagem
  5. Embeddings: significado como geometria
  6. word2vec, GloVe e o truque das analogias
  7. Entropia, perplexidade e o que significa 'bom'

foundations · 9 aulas disponíveis

Fundamentos de redes neurais

Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.

  1. O perceptron
  2. Perceptrons multicamadas e não linearidade
  3. Funções de activation: ReLU, GELU e SwiGLU
  4. Funções de loss e cross-entropy
  5. Backpropagation, visualizado
  6. Gradient descent e a paisagem da loss
  7. Optimizers: SGD → Momentum → Adam → AdamW
  8. Inicialização, normalização e residuals
  9. Overfitting, regularização e a bitter lesson

core · 5 aulas disponíveis

Modelos de sequência

Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.

  1. Modelando sequências: a configuração
  2. RNNs e o vanishing gradient
  3. LSTM e GRU: gates que lembram
  4. Seq2seq, encoder-decoder e o bottleneck
  5. Bahdanau attention: a ideia que mudou tudo

core · 14 aulas disponíveis

O Transformer

Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.

  1. Attention Is All You Need em contexto
  2. Self-attention desde os primeiros princípios: Q, K e V
  3. Scaled dot-product attention e a raiz de d_k
  4. Causal masking e por que a ordem importa
  5. Multi-head attention
  6. Positional encoding I: sinusoidal e aprendido
  7. Positional encoding II: RoPE
  8. Positional encoding III: ALiBi e relative bias
  9. O bloco feed-forward e onde o conhecimento vive
  10. Residuals, pre-norm versus post-norm
  11. O bloco completo, montado
  12. Encoder-only, decoder-only, encoder–decoder
  13. Construa um GPT do zero, com anotações
  14. Lendo pesos reais: a aparência de um modelo treinado

advanced · 13 aulas disponíveis

Pretraining em Escala

Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.

  1. Objetivos: causal LM, MLM, span corruption e FIM
  2. Dados: origem, filtragem, deduplicação e decontamination
  3. Treinando seu próprio tokenizer
  4. Scaling laws I: Kaplan
  5. Scaling laws II: Chinchilla e compute-optimality
  6. Scaling laws III: inference-aware e over-training
  7. Data parallelism, ZeRO e FSDP
  8. Tensor, pipeline e sequence parallelism
  9. Mixed precision: fp16, bf16 e fp8
  10. Gradient checkpointing e matemática de memória
  11. Learning-rate schedules e warmup
  12. Quando o treinamento falha: spikes, divergence e NaNs
  13. Quanto custa um pretraining real

advanced · 11 aulas disponíveis

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

  1. Por que modelos base não são assistentes
  2. Supervised fine-tuning e dados de instruções
  3. LoRA, QLoRA e PEFT
  4. Reward models e dados de preferência humana
  5. RLHF com PPO
  6. DPO: sem o reward model
  7. ORPO, KTO, SimPO e o zoológico do alinhamento
  8. GRPO e RL com rewards verificáveis
  9. Modelos de reasoning: test-time compute e CoT longo
  10. Constitutional AI e RLAIF
  11. Distillation: modelos pequenos jogando acima do peso

advanced · 12 aulas disponíveis

Inferência e eficiência

Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.

  1. O que realmente acontece quando você aperta enviar
  2. O KV cache
  3. Prefill e decode: duas máquinas diferentes
  4. Sampling: temperature, top-k, top-p e min-p
  5. Beam search, speculative decoding e Medusa
  6. MQA, GQA e MLA
  7. FlashAttention e IO-awareness
  8. PagedAttention e continuous batching
  9. Quantização I: int8, int4 e fundamentos
  10. Quantização II: GPTQ, AWQ, GGUF e QAT
  11. Serving stacks: vLLM, SGLang e TensorRT-LLM
  12. Executando modelos localmente