Essencial

Famílias de Transformer, de encoder-only a híbrido

Encoder-only, decoder-only, encoder–decoder, mixture-of-experts e a família híbrida de 2025–26 diferem em visibilidade, objetivo e escolha de mixer — e o Qwen3.8-27B é um híbrido denso e multimodal, não um MoE.

Atualizada em

01 · Conceito

Conceito

Você recebe o lançamento de um modelo novo e uma pergunta prática: que tipo de coisa é isso? “Transformer” sozinho não diz quase nada — é o nome de uma caixa de ferramentas, não de um padrão de visibilidade, de um objetivo ou de uma escolha de mixer. A taxonomia clássica tem três famílias; a moderna precisa de mais dois eixos. Percorrer as cinco e depois classificar o Qwen3.8-27B passo a passo transforma uma página de marketing numa arquitetura sobre a qual você consegue raciocinar.

Um modelo encoder-only deixa cada posição dar attention à esquerda e à direita ao longo de toda a entrada. O objetivo de masked language modeling do BERT corrompe tokens selecionados e treina o modelo a reconstruí-los usando os dois lados. A saída é uma representação contextual por posição, não um gerador autorregressivo: classificação lê um estado agregado, tagging usa estados por token, retrieval deriva embeddings. Geração é possível com procedimentos especiais, mas não é a fatoração nativa.

Um modelo decoder-only usa self-attention causal: a posição ii lê apenas posições até ii, e seu estado prevê o token i+1i+1. O treino avalia todas as posições em paralelo sob uma máscara triangular; a inferência acrescenta um token e repete. Modelos no estilo GPT vivem aqui, e um prompt com sua continuação é simplesmente uma sequência de tokens, de modo que tarefas viram completions.

Um modelo encoder–decoder roda duas pilhas. O encoder lê a fonte bidirecionalmente; o decoder lê os tokens alvo anteriores de forma causal e acrescenta uma subcamada de cross-attention cujas queries vêm do alvo em construção e cujas keys e values vêm dos estados do encoder. Tradução é o caso canônico; o T5 generaliza a ideia tratando muitas tarefas como corrupção de spans text-to-text.

As máscaras expressam as distinções de forma compacta: a self-attention do encoder é total exceto por padding; a self-attention do decoder é triangular inferior; a cross-attention deixa cada query do alvo ler todas as keys da fonte porque a fonte já é conhecida. Objetivos importam tanto quanto topologia — arquitetura e objetivo decidem juntos que sinal chega a cada posição.

A quarta família varia um eixo diferente: esparsidade de parâmetros. Um modelo mixture-of-experts (MoE) mantém a visibilidade de um decoder, mas substitui cada FFN densa por um router e um conjunto de FFNs expert, ativando apenas algumas por token. O total de parâmetros pode ser enorme enquanto o compute por token permanece modesto. A troca é complexidade de sistemas — roteamento, balanceamento de carga, paralelismo de experts — e o rótulo da família responde a uma pergunta diferente das três primeiras: não “quem pode ver quem”, mas “quem paga por quais parâmetros”.

A quinta família, proeminente ao longo de 2025–26, varia o próprio mixer. Um modelo híbrido mantém o contrato causal do decoder, mas substitui softmax attention na maioria das camadas por um mixer de sequência com estado de tamanho fixo — uma recorrência de linear attention ou de state space — mantendo full attention numa minoria de camadas. Designs no estilo Jamba intercalaram blocos de state space com blocos de attention; a linha Granite-H da IBM seguiu caminho semelhante; e o Qwen3.8-27B é o espécime que este curso disseca: três blocos Gated DeltaNet para cada bloco de attention, 48 e 16 das 64 camadas respectivamente. O eixo híbrido responde ainda a outra pergunta: nem visibilidade, nem esparsidade, mas “quanto custa o token mixing conforme o contexto cresce?” Full attention paga por token passado; um mixer de estado de tamanho fixo paga uma constante. Manter uma minoria de camadas de attention preserva acesso direto, endereçado por conteúdo, a posições arbitrárias onde ele justifica seu custo — o argumento de projeto da lição 4.16.

Agora classifique o Qwen3.8-27B, do jeito que você faria com qualquer lançamento, e note onde a resposta reflexa erra. Passo um, visibilidade: ele prevê próximos tokens sob máscara causal, uma pilha só, sem cross-attention entre pilhas separadas de encoder e decoder — decoder-only. Passo dois, esparsidade — e aqui está a armadilha. O reflexo diz “27B de parâmetros, benchmarks de fronteira, 2026 — certamente MoE, todo mundo roteia experts hoje”. Confira a configuração: não há experts nem router; cada token passa pela FFN gated completa de cada camada. O Qwen3.8-27B é denso. Seu movimento de economia foi feito no eixo do mixer, não no eixo da FFN. Passo três, mixer: 48 camadas DeltaNet, 16 camadas de attention — híbrido. Passo quatro, modalidade: ele aceita imagens e vídeo além de texto, através de um vision encoder cujas saídas são projetadas no mesmo stream de 5120 dimensões que os embeddings de texto usam (lição 4.17) — multimodal na entrada, texto na saída. Veredito: um híbrido decoder-only, denso e multimodal. Quatro eixos, quatro respostas independentes, e o palpite popular errado justamente naquele em que estava mais confiante.

As famílias também diferem na economia de serving. Um encoder processa sua fonte uma vez; um encoder–decoder faz cache das saídas do encoder mas paga self- mais cross-attention enquanto decodifica; um decoder puro se apoia num KV cache que cresce com o contexto; um MoE movimenta pesos entre experts; um híbrido encolhe o cache crescente para sua minoria de attention. A track 7 quantifica essas diferenças — por ora basta que o rótulo da família preveja de onde vem a conta do serving.

Prefix language modelling, módulos de retrieval e torres multimodais borram todas as fronteiras, e arquiteturas reais são composições. Mas os eixos continuam úteis justamente porque são independentes: visibilidade, objetivo, esparsidade de parâmetros, custo do mixer, modalidade. Faça as cinco perguntas em ordem e qualquer model card — mesmo um sem relatório técnico, como o do Qwen3.8-27B, cuja arquitetura é documentada apenas pela configuração e pela linhagem herdada do Qwen3.5 — se torna legível.

02 · Analogia

Analogia

Várias equipes de linguagem ocupam o mesmo prédio. A equipe de analistas lê um dossiê completo com páginas visíveis nas duas direções. A equipe de romancistas escreve da esquerda para a direita atrás de uma cortina que esconde as páginas ainda não escritas. A equipe de tradutores deixa os analistas lerem a fonte e depois os escritores consultam suas anotações. Uma equipe mais nova divide o trabalho de cada mesa entre funcionários especialistas chamados apenas quando necessário. E a equipe mais nova de todas mantém a maioria das mesas rodando com livros-caixa compactos, sentando um arquivista completo a cada quarta mesa. Mesmas mesas, mesmo prédio — instituições diferentes.

03 · Explique de volta

Explique de volta

Compare as três famílias clássicas de Transformer por visibilidade e objetivo, depois explique o que os eixos MoE e híbrido acrescentam e onde o Qwen3.8-27B se encaixa.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Modelos encoder-only usam self-attention bidirecional com objetivos de corrupção para representar entradas completas; modelos decoder-only usam self-attention causal com predição do próximo token, tornando a geração nativa; modelos encoder–decoder codificam uma fonte bidirecionalmente e decodificam um alvo causalmente através de cross-attention. Dois eixos mais novos são ortogonais à visibilidade: modelos MoE substituem FFNs densas por FFNs expert roteadas, ativando um subconjunto por token, enquanto modelos híbridos substituem softmax attention na maioria das camadas por mixers de estado de tamanho fixo, mantendo full attention numa minoria. O Qwen3.8-27B é decoder-only, causal, híbrido (48 camadas Gated DeltaNet, 16 camadas de attention), denso nas suas FFNs — não MoE — e multimodal através de um vision encoder que alimenta o mesmo stream.

04 · Teste seu entendimento

Teste seu entendimento

01Um modelo de escala de fronteira de 2026 é descrito como tendo 27B de parâmetros e sendo multimodal. Um colega conclui que ele deve ser um mixture-of-experts. O que o Qwen3.8-27B mostra sobre essa inferência?
Resposta e explicação

Ela é inválida: o Qwen3.8-27B é denso — cada token paga cada FFN — e sua eficiência vem do eixo do mixer híbrido — Escala não implica esparsidade. O Qwen3.8-27B mantém FFNs densas nas 64 camadas e economiza no mixer, substituindo attention por Gated DeltaNet em 48 delas.

02Qual família inclui cross-attention entre duas pilhas?
Resposta e explicação

Encoder–decoder — O decoder lê as saídas do encoder por cross-attention enquanto gera sua sequência alvo; as outras famílias usam uma pilha só.

03Nos termos da lição anterior, o que um bloco DeltaNet e um bloco de attention compartilham que permite a um mesmo modelo conter os dois?
Resposta e explicação

A interface do bloco: pre-norm lê de um residual stream compartilhado e cada mixer devolve uma atualização com a largura do modelo — Híbridos funcionam porque o contrato do residual stream é agnóstico ao mixer: qualquer subcamada que leia um estado normalizado e some uma atualização de largura compatível encaixa na pilha.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Jacob Devlin, Ming-Wei Chang, Kenton Lee e Kristina Toutanova (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
  2. Alec Radford et al. (2019). Language Models are Unsupervised Multitask Learners.
  3. Colin Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.
  4. Qwen Team (2026). Qwen3.8-27B Model Card.
  5. Opher Lieber et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model.