Essencial
"Attention Is All You Need" em contexto
O Transformer substituiu o processamento recorrente de sequências por attention paralela — e o Qwen3.8-27B mostra quais partes daquele projeto de 2017 sobreviveram e quais foram substituídas.
Atualizada em
01 · Conceito
Conceito
Comece pelo problema concreto da tradução automática da era de 2016. Para traduzir uma frase de cem tokens, uma rede recorrente lê o token um, atualiza um estado oculto, depois lê o token dois, e assim por diante: cem passos estritamente sequenciais. A informação do primeiro token só chega ao centésimo sobrevivendo a noventa e nove atualizações de estado. O treinamento é lento porque nenhum passo pode começar antes de o anterior terminar, e o sinal de longo alcance é frágil porque atravessa todos os passos intermediários.
A primeira correção óbvia — a que o campo de fato tentou — foi fortalecer a recorrência: gates de LSTM e GRU para proteger o estado, pilhas mais profundas, vetores ocultos maiores. Ajudou, mas atacou o termo errado. Os gates melhoraram o que sobrevive a cada repasse; não fizeram nada quanto ao número de repasses. A cadeia de dependências, e não o design da célula, era o gargalo. A correção foi remover a cadeia por inteiro.
Attention Is All You Need, publicado em junho de 2017, propôs uma arquitetura encoder–decoder cuja rota principal entre posições da sequência usava attention em vez de recorrência ou convolução. Duas propriedades decorrem disso, e um pequeno exemplo trabalhado torna ambas visíveis. Pegue uma sequência de quatro tokens. Uma RNN precisa de 3 atualizações sequenciais de estado antes que o último token seja processado, e o caminho do token 1 ao token 4 atravessa todas as 3. Attention, em vez disso, calcula uma pontuação para cada par permitido de posições: pontuações, todas produzidas juntas numa única multiplicação de matrizes, e o caminho do token 1 ao token 4 é uma única aresta direta. Escale isso para comprimento : a profundidade sequencial permanece constante enquanto o trabalho por pares cresce como . O Transformer trocou um gargalo sequencial por um quadrático — uma troca que fez sentido porque aceleradores são excelentes em grandes multiplicações de matrizes paralelas e péssimos em longas cadeias dependentes.
O slogan é memorável, mas fácil de interpretar longe demais. Um Transformer não é só attention. O sistema original continha embeddings de tokens, positional encodings, multi-head attention, redes feed-forward por posição, conexões residuais, layer normalization, uma projeção de saída, softmax e um objetivo de treinamento. “Tudo de que você precisa” significava que attention podia substituir as camadas recorrentes e convolucionais de mistura de sequência naquele projeto. Não significava que embeddings, transformações não lineares, otimização ou informação de ordem tinham desaparecido.
Encoder e decoder tinham trabalhos diferentes: self-attention bidirecional no encoder, self-attention causal mais cross-attention no decoder. Famílias posteriores mantiveram subconjuntos diferentes — BERT encoder-only, GPT decoder-only, T5 encoder–decoder — e a pilha causal decoder-only virou o formato padrão dos grandes modelos de linguagem. Leia qualquer um deles como duas operações alternadas: attention permite que posições troquem informação, e a rede feed-forward transforma cada posição de forma independente, com caminhos residuais carregando o estado em evolução através das duas.
O custo quadrático foi o preço. Para uma sequência de comprimento , attention convencional forma da ordem de pontuações por pares por head, e esse custo retorna com força quando as janelas de contexto alcançam centenas de milhares de tokens. A track 7 trata, em grande parte, de pagar, esquivar ou reestruturar essa conta.
Este curso estuda um modelo de 2026 em produção contra aquela baseline de 2017, e a comparação é o resumo mais limpo do que durou. O Qwen3.8-27B mantém as três ideias estruturais: attention como roteamento dependente de conteúdo, uma rede feed-forward em cada camada e um residual stream pre-norm atravessando todas as 64 camadas. Ele substitui a pilha uniforme: em vez de attention em toda camada, repete um padrão 3
— três camadas de Gated DeltaNet, uma recorrência de linear attention com gating, seguidas de uma camada de Gated Attention completa — dezesseis vezes, totalizando 48 camadas DeltaNet e 16 camadas de attention completa. A recorrência que o Transformer famosamente deletou retorna em forma modernizada em três quartos da profundidade, precisamente para amortecer o custo quadrático, enquanto attention completa é mantida em intervalos para acesso direto, endereçado por conteúdo, a posições distantes. A lição 4.15 cobre esse mecanismo; o restante desta track primeiro constrói o bloco clássico que o artigo de 2017 definiu, porque ele continua sendo tanto a baseline pedagógica quanto um quarto do modelo em produção.02 · Analogia
Analogia
Imagine a tradução de um discurso por uma fileira de editores. Uma RNN passa um caderno cada vez mais cheio de editor para editor; o centésimo editor depende do que sobreviveu a noventa e nove repasses. Um Transformer dá a cada editor uma visão de todas as anotações permitidas, cartões numerados de posição e uma regra compartilhada de roteamento para escolher os trechos relevantes. Nenhum editor é magicamente onisciente: roteamento, numeração, mesa de revisão e atalhos precisam funcionar juntos.
03 · Explique de volta
Explique de volta
Explique o que o Transformer removeu, o que manteve e quais de suas partes sobrevivem sem mudanças num modelo de 2026 como o Qwen3.8-27B.
Comparar com uma resposta-modelo
O Transformer de 2017 removeu recorrência e convolução do caminho principal de sequência, de modo que as posições de treinamento pudessem ser processadas em paralelo com operações matriciais. Ele manteve embeddings, informação de posição, redes feed-forward, conexões residuais, normalização e uma projeção de saída. No Qwen3.8-27B, o mecanismo de attention, o bloco feed-forward e o residual stream sobrevivem essencialmente intactos, mas a pilha uniforme de camadas de attention não: três de cada quatro camadas substituem attention por Gated DeltaNet, mantendo attention completa em apenas dezesseis das sessenta e quatro camadas.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Ashish Vaswani et al. (2017). Attention Is All You Need.
- Dzmitry Bahdanau, Kyunghyun Cho e Yoshua Bengio (2015). Neural Machine Translation by Jointly Learning to Align and Translate.
- Qwen Team (2026). Qwen3.8-27B Model Card.