Currículo

Trilhas de aprendizagem

Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.

01

Orientação e fundamentos

Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.

Abrir trilha
  1. 01.01O que é, de fato, um modelo de linguagem?
  2. 01.02Uma história de 60 segundos: dos n-gramas à era GPT-5
  3. 01.03A probabilidade que você realmente precisa
  4. 01.04Vetores, matrizes e produtos escalares
  5. 01.05Multiplicação de matrizes como transformação
  6. 01.06Derivadas e gradientes, geometricamente
  7. 01.07Python, NumPy e PyTorch em 20 minutos
  8. 01.08Como ler um artigo de ML
02

Do texto aos tensores

Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.

Abrir trilha
  1. 02.01Por que computadores não sabem ler
  2. 02.02Tokenization I: caracteres, palavras e subpalavras
  3. 02.03Tokenization II: BPE, passo a passo
  4. 02.04Tokenization III: SentencePiece, byte-level e por que a contagem de tokens morde
  5. 02.05Embeddings: significado como geometria
  6. 02.06word2vec, GloVe e o truque da analogia
  7. 02.07Entropia, perplexity e o que significa 'bom'
03

Fundamentos de redes neurais

Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.

Abrir trilha
  1. 03.01O perceptron
  2. 03.02Perceptrons multicamada e não linearidade
  3. 03.03Funções de ativação: ReLU, GELU e SwiGLU
  4. 03.04Funções de loss e cross-entropy
  5. 03.05Retropropagação, visualizada
  6. 03.06Gradient descent e a paisagem de loss
  7. 03.07Otimizadores: de SGD a Momentum, Adam e AdamW
  8. 03.08Inicialização, normalização e residuais
  9. 03.09Overfitting, regularização e a lição amarga
04

Modelos de sequência

Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.

Abrir trilha
  1. 04.01Modelar sequências: o ponto de partida
  2. 04.02RNNs, estado de tamanho fixo e o vanishing gradient
  3. 04.03LSTM e GRU: gates que lembram
  4. 04.04Seq2seq, encoder-decoder e o gargalo
  5. 04.05Bahdanau attention: a ideia que mudou tudo
  6. 04.06Linear attention e fast weights
05

O Transformer

Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.

Abrir trilha
  1. 05.01"Attention Is All You Need" em contexto
  2. 05.02Self-attention a partir de princípios básicos: Q, K, V
  3. 05.03Scaled dot-product attention e o √d_k
  4. 05.04Causal masking e por que a ordem importa
  5. 05.05Multi-head attention
  6. 05.06Positional encoding I: senoidal e aprendido
  7. 05.07Positional encoding II: RoPE
  8. 05.08Positional encoding III: ALiBi e bias relativo
  9. 05.09O bloco feed-forward e onde o conhecimento vive
  10. 05.10Residuals, pre-norm vs post-norm
  11. 05.11O bloco clássico — e os dois tipos de bloco do Qwen
  12. 05.12Famílias de Transformer, de encoder-only a híbrido
  13. 05.13Construa um GPT do zero: a baseline uniforme
  14. 05.14Lendo pesos reais: abrindo o checkpoint do Qwen3.8-27B
  15. 05.15Gated DeltaNet: o mixer em 48 das 64 camadas
  16. 05.16Layouts híbridos: três DeltaNet, uma attention
  17. 05.17Como imagens entram na sequência: o vision encoder
06

Pretraining em Escala

Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.

Abrir trilha
  1. 06.01Objetivos: causal LM, MLM, span corruption, FIM
  2. 06.02Dados: origem, filtragem, dedup, descontaminação
  3. 06.03Treinando seu próprio tokenizer
  4. 06.04Scaling laws I: Kaplan
  5. 06.05Scaling laws II: Chinchilla e compute-optimality
  6. 06.06Scaling laws III: inference-aware e over-training
  7. 06.07Data parallelism, ZeRO e FSDP
  8. 06.08Tensor, pipeline e sequence parallelism
  9. 06.09Mixed precision: fp16, bf16, fp8
  10. 06.10Gradient checkpointing e a matemática da memória
  11. 06.11Schedules de learning rate e warmup
  12. 06.12Quando o treino dá errado: spikes, divergência, NaNs
  13. 06.13Quanto custa de verdade uma run de pretraining
07

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

Abrir trilha
  1. 07.01Por que base models não são assistentes
  2. 07.02Supervised fine-tuning e dados de instrução
  3. 07.03LoRA, QLoRA e PEFT
  4. 07.04Reward models e preference data humana
  5. 07.05RLHF com PPO
  6. 07.06DPO: pulando o reward model
  7. 07.07ORPO, KTO, SimPO e o zoológico do alinhamento
  8. 07.08GRPO e RL sobre recompensas verificáveis
  9. 07.09Modelos de raciocínio: computação em tempo de teste e long CoT
  10. 07.10Constitutional AI e RLAIF
  11. 07.11Distillation: fazendo modelos pequenos brigarem acima do peso
08

Inferência e eficiência

Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.

Abrir trilha
  1. 08.01O que realmente acontece quando você aperta enviar
  2. 08.02O KV cache
  3. 08.03Prefill vs decode: duas máquinas diferentes
  4. 08.04Sampling: temperature, top-k, top-p e min-p
  5. 08.05Beam search, speculative decoding e Medusa
  6. 08.06MQA, GQA e MLA
  7. 08.07FlashAttention e IO-awareness
  8. 08.08PagedAttention e continuous batching
  9. 08.09Quantization I: int8, int4, o básico
  10. 08.10Quantization II: GPTQ, AWQ, GGUF, QAT
  11. 08.11Serving stacks: vLLM, SGLang, TensorRT-LLM
  12. 08.12Rodando modelos localmente
  13. 08.13Escolhendo e julgando um quant da comunidade
09

Stacks de construção e serving

Domine o software que de fato executa o Qwen3.8-27B — PyTorch, Transformers, vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, MLX e Modular MAX — e saiba qual deles cada situação pede.

Abrir trilha
  1. 09.01PyTorch: o runtime de referência
  2. 09.02O ecossistema Hugging Face Transformers
  3. 09.03torch.compile e CUDA graphs
  4. 09.04vLLM
  5. 09.05SGLang
  6. 09.06TensorRT-LLM
  7. 09.07llama.cpp e GGUF
  8. 09.08Ollama e runners locais
  9. 09.09MLX
  10. 09.10Modular MAX e Mojo
  11. 09.11Serving na nuvem
  12. 09.12Escolhendo o seu stack
10

Hardware e infraestrutura

Entenda o silício sob o Qwen3.8-27B — NVIDIA, AMD, Apple, Qualcomm e Cerebras — e a aritmética de bandwidth, roofline e custo que decide o que roda onde, e por quanto.

Abrir trilha
  1. 10.01Memory bandwidth vs FLOPs
  2. 10.02O modelo roofline
  3. 10.03Dimensionamento do KV cache e orçamentos de memória
  4. 10.04NVIDIA, CUDA, Hopper e Blackwell
  5. 10.05AMD, ROCm e a linha MI3xx
  6. 10.06Apple silicon e unified memory
  7. 10.07Qualcomm Hexagon e a edge
  8. 10.08Cerebras e wafer scale
  9. 10.09Interconnects e clusters
  10. 10.10Custo por token