Trilha de aprendizagem
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- 05.01"Attention Is All You Need" em contexto→
- 05.02Self-attention a partir de princípios básicos: Q, K, V→
- 05.03Scaled dot-product attention e o √d_k→
- 05.04Causal masking e por que a ordem importa→
- 05.05Multi-head attention→
- 05.06Positional encoding I: senoidal e aprendido→
- 05.07Positional encoding II: RoPE→
- 05.08Positional encoding III: ALiBi e bias relativo→
- 05.09O bloco feed-forward e onde o conhecimento vive→
- 05.10Residuals, pre-norm vs post-norm→
- 05.11O bloco clássico — e os dois tipos de bloco do Qwen→
- 05.12Famílias de Transformer, de encoder-only a híbrido→
- 05.13Construa um GPT do zero: a baseline uniforme→
- 05.14Lendo pesos reais: abrindo o checkpoint do Qwen3.8-27B→
- 05.15Gated DeltaNet: o mixer em 48 das 64 camadas→
- 05.16Layouts híbridos: três DeltaNet, uma attention→
- 05.17Como imagens entram na sequência: o vision encoder→