Essencial

Encoder-only, decoder-only, encoder–decoder

Famílias Transformer diferem na visibilidade, no objetivo e na comunicação entre inputs e outputs, moldando as tarefas naturais de cada uma.

Atualizada em

1

Conceito

“Transformer” descreve uma caixa de ferramentas, não um único padrão de visibilidade. As três famílias clássicas — encoder-only, decoder-only e encoder–decoder — reutilizam attention e FFN, mas conectam informação e aprendem problemas distintos. Essas escolhas criam defaults diferentes para representação, geração e transformação condicionada.

Um modelo encoder-only permite que toda posição comum leia à esquerda e à direita. O masked-language objective do BERT substitui ou corrompe tokens selecionados e treina sua reconstrução usando os dois lados. A saída é uma representação contextual por posição, não um gerador autoregressivo nativo. Classificação pode ler uma posição agregada; tagging usa estados por token; sistemas de retrieval extraem embeddings. Existem procedimentos de geração, mas não são a fatoração natural.

Um modelo decoder-only usa self-attention causal. A posição ii lê somente até ii, e seu estado prevê i+1i+1. O treinamento calcula losses para todas as posições em paralelo sob máscara triangular. Em inference, anexa um token e repete. Modelos GPT pertencem aqui. Um prompt e sua continuação formam uma única sequência, permitindo representar tarefas como text completion.

Um encoder–decoder possui duas pilhas. O encoder lê a fonte bidirecionalmente. O decoder lê tokens anteriores do alvo de forma causal e inclui uma subcamada extra de cross-attention. Queries vêm do alvo em evolução; keys e values, dos estados finais do encoder. Tradução é o exemplo clássico: a frase-fonte completa está disponível, mas o alvo ainda precisa ser gerado da esquerda para a direita.

A diferença pode ser escrita em máscaras. Self-attention do encoder costuma ter visibilidade completa, exceto padding. A do decoder é triangular inferior. Cross-attention deixa toda query do alvo ler keys válidas da fonte, pois a fonte já é conhecida. Dados empacotados e objetivos de prefixo criam máscaras híbridas; o rótulo da família não revela toda aresta.

Objetivos importam tanto quanto topologia. Um encoder bidirecional treinado com corrupção aprende a recuperar conteúdo oculto. Um decoder causal aprende uma distribuição normalizada de continuações. T5 transforma tarefas em text-to-text span corruption, substituindo spans por sentinelas e decodificando o conteúdo ausente. Arquitetura e objetivo decidem juntos qual sinal chega a cada posição.

Os custos acompanham a estrutura. Um encoder processa a fonte uma vez. Um sistema encoder–decoder reutiliza suas saídas durante a geração, mas o decoder paga self-attention e cross-attention. Decoder-only pode repetir representações do prompt entre tarefas, embora o KV cache evite recalcular todo o prefixo numa mesma geração. A divisão de parâmetros entre pilhas também afeta qualidade e serving.

Prefix language modelling borra a fronteira: uma pilha única pode permitir attention bidirecional no prefixo e causal no sufixo. Sistemas multimodais podem adicionar cross-attention a um backbone decoder-only. Arquiteturas reais são composições, mas as três famílias continuam úteis.

Ao escolher, comece pelo contrato de informação. O input completo é conhecido antes do output? O modelo precisa produzir sequência livre? Cada token precisa de uma feature contextual? Quantas vezes a fonte codificada será reutilizada? Visibilidade e objetivo respondem melhor que moda.

2

Como explicar para uma criança de cinco anos

Três equipes de linguagem ocupam o mesmo prédio. Analistas leem um dossiê completo em ambas as direções. Romancistas escrevem da esquerda para a direita atrás de uma cortina que esconde páginas não escritas. Tradutores deixam analistas lerem toda a fonte e então escrevem o alvo consultando suas notas. As mesas são blocos Transformer; visibilidade e trabalho criam instituições diferentes.

3

Ensine de volta

Compare a visibilidade de attention e o objetivo típico de pretraining nas três famílias.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Modelos encoder-only usam self-attention bidirecional e objetivos de tokens mascarados ou corrompidos para representar um input completo. Decoder-only usa attention causal e next-token prediction, tornando geração nativa. Encoder–decoder codifica a fonte bidirecionalmente, decodifica o alvo causalmente e adiciona cross-attention de queries do decoder para keys e values do encoder, adequado a geração condicionada.

4

Teste seu entendimento

1. Qual família inclui cross-attention entre duas pilhas?
Resposta e explicação

Encoder–decoder — O decoder lê as saídas do encoder por cross-attention enquanto gera o alvo.

2. Por que geração é direta em decoder-only?
Resposta e explicação

Seu objetivo causal coincide com prever e anexar o próximo token — Pretraining e inference compartilham a fatoração de prefixo para próximo token.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Jacob Devlin, Ming-Wei Chang, Kenton Lee e Kristina Toutanova (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
  2. Alec Radford et al. (2019). Language Models are Unsupervised Multitask Learners.
  3. Colin Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.