Currículo
Trilhas de aprendizagem
Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.
Orientação e fundamentos
Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.
- 01.01O que é, de fato, um modelo de linguagem?→
- 01.02Uma história de 60 segundos: dos n-gramas à era GPT-5→
- 01.03A probabilidade que você realmente precisa→
- 01.04Vetores, matrizes e produtos escalares→
- 01.05Multiplicação de matrizes como transformação→
- 01.06Derivadas e gradientes, geometricamente→
- 01.07Python, NumPy e PyTorch em 20 minutos→
- 01.08Como ler um artigo de ML→
Do texto aos tensores
Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.
- 02.01Por que computadores não sabem ler→
- 02.02Tokenization I: caracteres, palavras e subpalavras→
- 02.03Tokenization II: BPE, passo a passo→
- 02.04Tokenization III: SentencePiece, byte-level e por que a contagem de tokens morde→
- 02.05Embeddings: significado como geometria→
- 02.06word2vec, GloVe e o truque da analogia→
- 02.07Entropia, perplexity e o que significa 'bom'→
Fundamentos de redes neurais
Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.
- 03.01O perceptron→
- 03.02Perceptrons multicamada e não linearidade→
- 03.03Funções de ativação: ReLU, GELU e SwiGLU→
- 03.04Funções de loss e cross-entropy→
- 03.05Retropropagação, visualizada→
- 03.06Gradient descent e a paisagem de loss→
- 03.07Otimizadores: de SGD a Momentum, Adam e AdamW→
- 03.08Inicialização, normalização e residuais→
- 03.09Overfitting, regularização e a lição amarga→
Modelos de sequência
Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- 05.01"Attention Is All You Need" em contexto→
- 05.02Self-attention a partir de princípios básicos: Q, K, V→
- 05.03Scaled dot-product attention e o √d_k→
- 05.04Causal masking e por que a ordem importa→
- 05.05Multi-head attention→
- 05.06Positional encoding I: senoidal e aprendido→
- 05.07Positional encoding II: RoPE→
- 05.08Positional encoding III: ALiBi e bias relativo→
- 05.09O bloco feed-forward e onde o conhecimento vive→
- 05.10Residuals, pre-norm vs post-norm→
- 05.11O bloco clássico — e os dois tipos de bloco do Qwen→
- 05.12Famílias de Transformer, de encoder-only a híbrido→
- 05.13Construa um GPT do zero: a baseline uniforme→
- 05.14Lendo pesos reais: abrindo o checkpoint do Qwen3.8-27B→
- 05.15Gated DeltaNet: o mixer em 48 das 64 camadas→
- 05.16Layouts híbridos: três DeltaNet, uma attention→
- 05.17Como imagens entram na sequência: o vision encoder→
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- 06.01Objetivos: causal LM, MLM, span corruption, FIM→
- 06.02Dados: origem, filtragem, dedup, descontaminação→
- 06.03Treinando seu próprio tokenizer→
- 06.04Scaling laws I: Kaplan→
- 06.05Scaling laws II: Chinchilla e compute-optimality→
- 06.06Scaling laws III: inference-aware e over-training→
- 06.07Data parallelism, ZeRO e FSDP→
- 06.08Tensor, pipeline e sequence parallelism→
- 06.09Mixed precision: fp16, bf16, fp8→
- 06.10Gradient checkpointing e a matemática da memória→
- 06.11Schedules de learning rate e warmup→
- 06.12Quando o treino dá errado: spikes, divergência, NaNs→
- 06.13Quanto custa de verdade uma run de pretraining→
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- 07.01Por que base models não são assistentes→
- 07.02Supervised fine-tuning e dados de instrução→
- 07.03LoRA, QLoRA e PEFT→
- 07.04Reward models e preference data humana→
- 07.05RLHF com PPO→
- 07.06DPO: pulando o reward model→
- 07.07ORPO, KTO, SimPO e o zoológico do alinhamento→
- 07.08GRPO e RL sobre recompensas verificáveis→
- 07.09Modelos de raciocínio: computação em tempo de teste e long CoT→
- 07.10Constitutional AI e RLAIF→
- 07.11Distillation: fazendo modelos pequenos brigarem acima do peso→
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- 08.01O que realmente acontece quando você aperta enviar→
- 08.02O KV cache→
- 08.03Prefill vs decode: duas máquinas diferentes→
- 08.04Sampling: temperature, top-k, top-p e min-p→
- 08.05Beam search, speculative decoding e Medusa→
- 08.06MQA, GQA e MLA→
- 08.07FlashAttention e IO-awareness→
- 08.08PagedAttention e continuous batching→
- 08.09Quantization I: int8, int4, o básico→
- 08.10Quantization II: GPTQ, AWQ, GGUF, QAT→
- 08.11Serving stacks: vLLM, SGLang, TensorRT-LLM→
- 08.12Rodando modelos localmente→
- 08.13Escolhendo e julgando um quant da comunidade→
Stacks de construção e serving
Domine o software que de fato executa o Qwen3.8-27B — PyTorch, Transformers, vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, MLX e Modular MAX — e saiba qual deles cada situação pede.
- 09.01PyTorch: o runtime de referência→
- 09.02O ecossistema Hugging Face Transformers→
- 09.03torch.compile e CUDA graphs→
- 09.04vLLM→
- 09.05SGLang→
- 09.06TensorRT-LLM→
- 09.07llama.cpp e GGUF→
- 09.08Ollama e runners locais→
- 09.09MLX→
- 09.10Modular MAX e Mojo→
- 09.11Serving na nuvem→
- 09.12Escolhendo o seu stack→
Hardware e infraestrutura
Entenda o silício sob o Qwen3.8-27B — NVIDIA, AMD, Apple, Qualcomm e Cerebras — e a aritmética de bandwidth, roofline e custo que decide o que roda onde, e por quanto.
- 10.01Memory bandwidth vs FLOPs→
- 10.02O modelo roofline→
- 10.03Dimensionamento do KV cache e orçamentos de memória→
- 10.04NVIDIA, CUDA, Hopper e Blackwell→
- 10.05AMD, ROCm e a linha MI3xx→
- 10.06Apple silicon e unified memory→
- 10.07Qualcomm Hexagon e a edge→
- 10.08Cerebras e wafer scale→
- 10.09Interconnects e clusters→
- 10.10Custo por token→