Essencial
Encoder-only, decoder-only, encoder–decoder
Famílias Transformer diferem na visibilidade, no objetivo e na comunicação entre inputs e outputs, moldando as tarefas naturais de cada uma.
Atualizada em
1
Conceito
“Transformer” descreve uma caixa de ferramentas, não um único padrão de visibilidade. As três famílias clássicas — encoder-only, decoder-only e encoder–decoder — reutilizam attention e FFN, mas conectam informação e aprendem problemas distintos. Essas escolhas criam defaults diferentes para representação, geração e transformação condicionada.
Um modelo encoder-only permite que toda posição comum leia à esquerda e à direita. O masked-language objective do BERT substitui ou corrompe tokens selecionados e treina sua reconstrução usando os dois lados. A saída é uma representação contextual por posição, não um gerador autoregressivo nativo. Classificação pode ler uma posição agregada; tagging usa estados por token; sistemas de retrieval extraem embeddings. Existem procedimentos de geração, mas não são a fatoração natural.
Um modelo decoder-only usa self-attention causal. A posição lê somente até , e seu estado prevê . O treinamento calcula losses para todas as posições em paralelo sob máscara triangular. Em inference, anexa um token e repete. Modelos GPT pertencem aqui. Um prompt e sua continuação formam uma única sequência, permitindo representar tarefas como text completion.
Um encoder–decoder possui duas pilhas. O encoder lê a fonte bidirecionalmente. O decoder lê tokens anteriores do alvo de forma causal e inclui uma subcamada extra de cross-attention. Queries vêm do alvo em evolução; keys e values, dos estados finais do encoder. Tradução é o exemplo clássico: a frase-fonte completa está disponível, mas o alvo ainda precisa ser gerado da esquerda para a direita.
A diferença pode ser escrita em máscaras. Self-attention do encoder costuma ter visibilidade completa, exceto padding. A do decoder é triangular inferior. Cross-attention deixa toda query do alvo ler keys válidas da fonte, pois a fonte já é conhecida. Dados empacotados e objetivos de prefixo criam máscaras híbridas; o rótulo da família não revela toda aresta.
Objetivos importam tanto quanto topologia. Um encoder bidirecional treinado com corrupção aprende a recuperar conteúdo oculto. Um decoder causal aprende uma distribuição normalizada de continuações. T5 transforma tarefas em text-to-text span corruption, substituindo spans por sentinelas e decodificando o conteúdo ausente. Arquitetura e objetivo decidem juntos qual sinal chega a cada posição.
Os custos acompanham a estrutura. Um encoder processa a fonte uma vez. Um sistema encoder–decoder reutiliza suas saídas durante a geração, mas o decoder paga self-attention e cross-attention. Decoder-only pode repetir representações do prompt entre tarefas, embora o KV cache evite recalcular todo o prefixo numa mesma geração. A divisão de parâmetros entre pilhas também afeta qualidade e serving.
Prefix language modelling borra a fronteira: uma pilha única pode permitir attention bidirecional no prefixo e causal no sufixo. Sistemas multimodais podem adicionar cross-attention a um backbone decoder-only. Arquiteturas reais são composições, mas as três famílias continuam úteis.
Ao escolher, comece pelo contrato de informação. O input completo é conhecido antes do output? O modelo precisa produzir sequência livre? Cada token precisa de uma feature contextual? Quantas vezes a fonte codificada será reutilizada? Visibilidade e objetivo respondem melhor que moda.
2
Como explicar para uma criança de cinco anos
Três equipes de linguagem ocupam o mesmo prédio. Analistas leem um dossiê completo em ambas as direções. Romancistas escrevem da esquerda para a direita atrás de uma cortina que esconde páginas não escritas. Tradutores deixam analistas lerem toda a fonte e então escrevem o alvo consultando suas notas. As mesas são blocos Transformer; visibilidade e trabalho criam instituições diferentes.
3
Ensine de volta
Compare a visibilidade de attention e o objetivo típico de pretraining nas três famílias.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Modelos encoder-only usam self-attention bidirecional e objetivos de tokens mascarados ou corrompidos para representar um input completo. Decoder-only usa attention causal e next-token prediction, tornando geração nativa. Encoder–decoder codifica a fonte bidirecionalmente, decodifica o alvo causalmente e adiciona cross-attention de queries do decoder para keys e values do encoder, adequado a geração condicionada.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Jacob Devlin, Ming-Wei Chang, Kenton Lee e Kristina Toutanova (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
- Alec Radford et al. (2019). Language Models are Unsupervised Multitask Learners.
- Colin Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.