Trilha de aprendizagem
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
core · 14 aulas disponíveis
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- Attention Is All You Need em contexto
- Self-attention desde os primeiros princípios: Q, K e V
- Scaled dot-product attention e a raiz de d_k
- Causal masking e por que a ordem importa
- Multi-head attention
- Positional encoding I: sinusoidal e aprendido
- Positional encoding II: RoPE
- Positional encoding III: ALiBi e relative bias
- O bloco feed-forward e onde o conhecimento vive
- Residuals, pre-norm versus post-norm
- O bloco completo, montado
- Encoder-only, decoder-only, encoder–decoder
- Construa um GPT do zero, com anotações
- Lendo pesos reais: a aparência de um modelo treinado