Essencial

Layouts híbridos: três DeltaNet, uma attention

O Qwen3.8-27B repete um motivo de quatro camadas dezesseis vezes — três blocos DeltaNet de estado fixo, depois um bloco de full attention — trocando a maior parte da memória crescente de attention por estado constante e mantendo acesso direto, endereçado por conteúdo, a posições arbitrárias.

Atualizada em

01 · Conceito

Conceito

Você agora tem dois mixers e um problema de projeto. Full attention expõe keys e values por token ao longo do contexto: uma query pode endereçar diretamente qualquer posição passada, embora isso não garanta recuperação literal, ao preço de armazenar keys e values do contexto inteiro e relê-los a cada passo. Gated DeltaNet é barato: estado de tamanho constante, custo por token constante em qualquer comprimento, ao preço de uma compressão aprendida com perdas — um quadro fixo não pode prometer recall perfeito de um recorte arbitrário de meio milhão de tokens atrás. Um modelo que quer um contexto nativo de 262.144 tokens precisa decidir, camada a camada, qual preço pagar. A resposta do Qwen3.8-27B é um layout híbrido: um motivo de quatro camadas — Gated DeltaNet, DeltaNet, DeltaNet, full attention — repetido dezesseis vezes. São 48 camadas DeltaNet, 16 camadas de attention, um arquivista a cada quarto andar.

Percorra as consequências de memória passo a passo, porque a leitura intuitiva as inverte. O reflexo diz: quarenta e oito camadas recorrentes, cada uma arrastando uma matriz de estado de token em token — certamente é que mora a memória de contexto longo, com as dezesseis camadas de attention como erro de arredondamento. Agora confira cada tipo contra o seu contrato de verdade. O estado de uma camada DeltaNet é um conjunto fixo de matrizes, editado no lugar; o token 200.000 custa exatamente o que custou o token 200, e a camada não armazena nada por token. Uma camada de attention é o oposto: seu acesso direto por posição depende de armazenamento — cada token gerado acrescenta keys e values que todas as queries futuras podem consultar, então sua memória cresce linearmente com o contexto, multiplicada por todas as dezesseis camadas desse tipo. Na janela nativa completa, os totais não chegam perto: o key-value cache das dezesseis camadas de attention chega a cerca de 16 GiB por sequência, enquanto todos os quarenta e oito estados DeltaNet juntos ocupam cerca de 144 MiB quando a implementação de referência mantém o estado recorrente em fp32, constantes no comprimento; outro dtype de runtime mudaria a contagem de bytes — um contraste de mais de duas ordens de grandeza, na direção oposta à do reflexo. A lição 7.2 deriva ambos os números a partir das contagens de heads e das dimensões; aqui o que importa é o formato do resultado: o tipo de camada minoritário domina a conta de memória precisamente por ser o tipo que lembra de tudo.

Essa assimetria é o argumento inteiro a favor da proporção. Se toda camada fosse full attention, o cache crescente seria quatro vezes maior e contextos longos ficariam inviáveis por memória. Se toda camada fosse DeltaNet, o modelo enfrentaria recuperação de agulha no palheiro — citar o número de série exato da página dois de um documento de quatrocentas páginas — armado apenas de resumos com perdas. A mistura 3

mantém rotas diretas de recuperação disponíveis, tornando seu custo a exceção e não a regra: demandas de recall são esparsas em cargas de trabalho reais, mas quando chegam, alguma camada precisa conseguir endereçar as posições relevantes sem antes comprimi-las em estado fixo.

O que faz a mistura funcionar como um modelo só, e não como dois intercalados, é o contrato de bloco da lição 4.11. Ambos os tipos de camada leem o mesmo residual stream de 5120 dimensões através do mesmo RMSNorm em pre-norm e somam de volta atualizações do mesmo shape. Uma recuperação feita pela camada de attention do andar 3 — uma representação roteada de um token distante por attention endereçada por conteúdo — é escrita no stream, onde as camadas DeltaNet dos andares 4 a 6 podem transformá-la, roteá-la e construir sobre ela com sua maquinaria barata. O arquivista recupera; os editores processam. Divisão de trabalho, coordenada pelo quadro compartilhado, com a mesma FFN gated fazendo a transformação pesada de features em cada andar dos dois tipos.

O layout também molda onde diferentes capacidades podem morar. Operações entre partes do contexto que se beneficiam de acesso direto por posição — copiar um identificador longo, casar um parêntese aberto 100.000 tokens atrás, indução sobre repetições distantes — precisam passar por uma das dezesseis camadas de attention, porque só elas conseguem endereçar posições arbitrárias sem compressão em estado fixo. Processamento ponderado por recência, composição local e acumulação de estado corrente cabem naturalmente na maioria DeltaNet, cuja convolução de kernel 4 e estado com gate dão conta de estrutura de curto e médio alcance sem tocar num depósito crescente. Trabalho de interpretabilidade em modelos híbridos parte desse mapa: se um comportamento exige acesso direto de longo alcance, você sabe quais dezesseis camadas vasculhar.

O Qwen não inventou o padrão — 2025–26 produziu uma família de projetos assim, intercalando blocos de state-space ou de linear attention com full attention nas linhagens estilo Jamba e Granite-H —, mas uma proporção de 3

está entre as mais agressivas publicamente documentadas nessa escala, e o checkpoint que você leu na lição 4.14 mostra o motivo diretamente: três camadas de maquinaria linear_attn, uma camada de projeções self_attn, dezesseis vezes seguidas.

Aonde isso leva é a inferência. O layout híbrido é, no fundo, uma aposta sobre economia de serving: a de que um modelo pode manter a qualidade de recuperação de attention encolhendo para um quarto das camadas a memória que cresce por token — e a de que isso determina quais contextos, batch sizes e hardware são viáveis. Precificar essa aposta exige derivar a aritmética do cache direito: bytes por token por camada, por sequência, por gigabyte de memória do acelerador. Essa derivação — e a contabilidade completa de 16 GiB contra aproximadamente 144 MiB em fp32 na implementação de referência que esta lição apenas insinuou — é a lição 7.2, onde o KV cache ganha tratamento próprio.

02 · Analogia

Analogia

Uma redação monta dezesseis andares idênticos: três bancadas de editores que mantêm tudo em resumos correntes compactos, depois um arquivista com acesso ao acervo completo de cada página já publicada. Os editores dão conta do fluxo constante de forma barata; quando uma matéria precisa de um recorte antigo, o arquivista pode endereçar diretamente qualquer página armazenada e afixa a representação recuperada no quadro compartilhado, onde os editores dos andares de cima podem trabalhar com ele. Um arquivista por andar já é caro o suficiente; um por bancada quebraria o jornal.

03 · Explique de volta

Explique de volta

Descreva o layout de camadas do Qwen3.8-27B, o que cada tipo de mixer contribui e por que a conta de memória em contexto longo é dominada pelas camadas de attention, que são minoria.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

A pilha repete um super-bloco dezesseis vezes: três blocos Gated DeltaNet seguidos de um bloco de full attention, dando 48 camadas DeltaNet e 16 camadas de attention, com uma camada de attention a cada quarta posição. Attention contribui com acesso direto, endereçado por conteúdo, às keys e values de cada posição do contexto — a precisão da recuperação continua sendo uma propriedade empírica — enquanto o DeltaNet contribui com estado de tamanho constante e custo por token constante, independentemente do comprimento. Durante o decode, cada camada de attention acrescenta keys e values para cada token, então sua memória cresce com o contexto e alcança a escala de gibibytes na janela nativa de 262.144, ao passo que todas as 48 camadas DeltaNet juntas guardam cerca de 144 MiB por sequência no caminho de estado float32 da referência, constantes no comprimento; outro dtype ou layout de runtime muda essa contagem, e a derivação está na lição 7.2. O residual stream compartilhado permite que recuperações feitas por uma camada de attention sejam consumidas pelas camadas DeltaNet acima dela.

04 · Teste seu entendimento

Teste seu entendimento

01O Qwen3.8-27B coloca uma camada de full attention a cada quatro camadas numa pilha de 64. Quantas camadas de cada tipo resultam?
Resposta e explicação

48 camadas Gated DeltaNet e 16 camadas de attention — O motivo de quatro camadas — três DeltaNet, uma attention — se repete 16 vezes: 16 × 3 = 48 camadas DeltaNet e 16 × 1 = 16 camadas de attention.

02Durante o decode em contexto longo, a memória de quais camadas cresce a cada token gerado, e por quê?
Resposta e explicação

Apenas das 16 camadas de attention, porque attention acrescenta keys e values por token enquanto o estado do DeltaNet é uma matriz de tamanho fixo — A exatidão de attention vem de armazenar o passado, então seu cache cresce linearmente; o estado da delta rule da lição 4.15 é editado no lugar e nunca cresce.

03Uma camada DeltaNet na posição 5 precisa de informação de um token 200.000 posições atrás. Por qual mecanismo da lição 4.11 ela pode obtê-lo?
Resposta e explicação

O residual stream compartilhado: a camada de attention na posição 3 pode rotear informação dessa posição arbitrária e escrevê-la como uma atualização que a camada posterior lê — Todas as 64 camadas leem e escrevem um único residual stream, então uma recuperação feita por qualquer camada de attention fica disponível para todas as camadas acima dela.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Qwen Team (2026). Qwen3.8-27B Model Card.
  2. Hugging Face and Qwen Team (2026). Qwen3.5/Qwen3.8 reference implementation.
  3. Songlin Yang, Jan Kautz e Ali Hatamizadeh (2024). Gated Delta Networks: Improving Mamba2 with Delta Rule.
  4. Opher Lieber et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model.