Essencial
Attention Is All You Need em contexto
O Transformer substituiu o processamento recorrente de sequências por attention paralela, mas sua inovação real foi um sistema treinável completo, não um slogan.
Atualizada em
1
Conceito
Em 2017, modelos de sequência eram dominados por redes recorrentes. Uma RNN lê uma posição, atualiza um estado oculto e passa esse estado para a posição seguinte. LSTMs e GRUs tornaram o estado mais controlável, e attention já permitia que o decoder de tradução consultasse estados do encoder, em vez de espremer uma frase num único vetor. O problema não era que a recorrência jamais pudesse funcionar. Sua cadeia de dependências dificultava paralelizar o treinamento e obrigava informação distante a atravessar muitas atualizações sequenciais.
O artigo Attention Is All You Need, publicado em junho de 2017, propôs uma arquitetura encoder–decoder cujo caminho principal entre posições usava attention, não recorrência nem convolução. Durante o treinamento, todas as posições de uma camada podiam ser calculadas juntas por operações matriciais. O caminho entre duas posições também ficou curto: a informação podia atravessar diretamente uma aresta de attention, sem passar por cada estado intermediário.
O slogan é memorável, porém fácil de interpretar longe demais. Um Transformer não é só attention. O sistema original continha embeddings de tokens, positional encodings, multi-head attention, redes feed-forward por posição, conexões residuais, layer normalization, projeção de saída, softmax e um objetivo de treinamento. “Tudo de que você precisa” significava que attention podia substituir as camadas recorrentes e convolucionais naquele projeto. Não significava que embeddings, transformações não lineares, otimização ou informação de ordem tinham desaparecido.
Encoder e decoder tinham papéis diferentes. Cada camada do encoder usava self-attention bidirecional: uma posição da fonte podia ler todas as outras. Cada camada do decoder usava self-attention causal, impedindo uma posição de ver tokens posteriores do alvo, seguida de cross-attention sobre as saídas do encoder. Isso atendia à tradução automática, tarefa central do artigo. Famílias posteriores mantiveram subconjuntos diferentes. BERT popularizou o encoder-only com masked modelling; modelos no estilo GPT usam uma pilha decoder-only causal; T5 preservou a forma encoder–decoder.
Por que o projeto escalou tão bem? Paralelismo é parte da resposta, não a resposta inteira. Aceleradores são excelentes em grandes multiplicações de matrizes, e attention expressa muitas comparações como matrizes densas. Conexões residuais abrem um caminho estável por pilhas profundas. Blocos feed-forward fornecem muita capacidade não linear em cada posição. Múltiplas heads permitem vários sistemas aprendidos de roteamento. Nenhum item garante inteligência, mas juntos formam uma arquitetura altamente treinável, capaz de absorver mais dados e compute.
Existe um custo. Self-attention convencional cria uma pontuação para cada par permitido de posições, então a matriz cresce quadraticamente com o tamanho da sequência. Para comprimento , existem da ordem de pontuações por head. A recorrência possui um caminho sequencial, mas não materializa a mesma matriz quadrada. O Transformer trocou um gargalo — dependência sequencial — por outro: memória e computação de attention em contextos longos.
Os resultados de 2017 tampouco devem virar uma afirmação eterna de leaderboard. Hardware, dados, avaliação e arquiteturas mudaram. O fato durável é arquitetural: um modelo pode representar relações numa sequência com roteamento dependente de conteúdo e, ao mesmo tempo, processar posições de treinamento em paralelo.
Leia o bloco como duas operações alternadas. Attention permite que posições troquem informação. A rede feed-forward transforma essa informação independentemente em cada posição. Caminhos residuais carregam o estado pelos dois passos, enquanto a normalização controla a escala. Empilhe o padrão, treine para prever tokens ocultos ou seguintes, e a representação avança de uma identidade superficial para features sensíveis ao contexto.
A melhor interpretação histórica evita dois extremos: nem “um artigo inventou a IA moderna”, nem “foi apenas um ajuste pequeno”. O Transformer recombinou ideias conhecidas num sistema cujo caminho paralelo combinou com aceleradores e cujas interfaces eram excepcionalmente reutilizáveis. O restante desta track abre esse sistema peça por peça e depois o remonta.
2
Como explicar para uma criança de cinco anos
Imagine a tradução de um discurso por uma fileira de editores. Uma RNN passa um caderno cada vez mais cheio de editor para editor; o centésimo depende do que sobreviveu a 99 repasses. Um Transformer dá a cada editor uma visão de todas as anotações permitidas, cartões numerados de posição e uma regra comum para escolher os trechos relevantes. Nenhum editor é magicamente onisciente: roteamento, numeração, mesa de revisão e atalhos precisam funcionar juntos.
3
Ensine de volta
Explique o que o Transformer removeu, o que manteve e por que attention não é literalmente a arquitetura inteira.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
O Transformer original removeu recorrência e convolução do caminho principal de sequence-to-sequence, permitindo processar os tokens em paralelo no treinamento. Ele manteve embeddings aprendidos, informação de posição, redes feed-forward, conexões residuais, normalização e uma projeção de saída. Attention roteia informação entre posições, mas as outras partes preservam ordem, transformam cada posição, estabilizam a otimização e convertem estados ocultos em previsões.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Ashish Vaswani et al. (2017). Attention Is All You Need.
- Dzmitry Bahdanau, Kyunghyun Cho e Yoshua Bengio (2015). Neural Machine Translation by Jointly Learning to Align and Translate.