Essencial

O bloco feed-forward e onde o conhecimento vive

Depois que o mixer move informação entre posições, uma rede larga com gate transforma cada posição de forma independente — e no Qwen3.8-27B esse bloco guarda a maior parte dos 27B de parâmetros.

Atualizada em

01 · Conceito

Conceito

Comece com uma pergunta de contabilidade. O Qwen3.8-27B é anunciado com cerca de 27 bilhões de parâmetros — então onde eles ficam fisicamente? Attention leva a publicidade porque desenha ligações visíveis entre tokens, mas se você abrir o checkpoint e somar os tamanhos dos tensores, a resposta é pouco glamourosa: cerca de 17 bilhões de parâmetros, a clara maioria do modelo, vivem na feed-forward network (FFN) repetida em cada uma das 64 camadas. Attention roteia informação; a FFN a transforma; e a FFN é onde reside a maior parte da capacidade aprendida.

O bloco Transformer original aplica dois mapas lineares com uma não linearidade entre eles:

FFN(x)=W2σ(W1x+b1)+b2.\operatorname{FFN}(x)=W_2\,\sigma(W_1x+b_1)+b_2.

A primeira projeção expande da largura do modelo dmodeld_{model} para uma largura intermediária maior dffd_{ff}; a segunda projeta de volta para que o resultado possa se juntar ao residual stream. Os mesmos pesos se aplicam a todas as posições da sequência, as posições são processadas em paralelo e nenhuma informação se move entre tokens dentro do bloco.

O Qwen3.8-27B usa o descendente gated dessa ideia. Sua FFN forma três projeções em vez de duas:

FFN(x)=Wdown(SiLU(Wgatex)Wupx).\operatorname{FFN}(x)=W_{down}\left(\operatorname{SiLU}(W_{gate}\,x)\odot W_{up}\,x\right).

WgateW_{gate} e WupW_{up} expandem, ambas, o hidden state de 5120 dimensões para uma largura intermediária de 17.408. O caminho do gate passa pela SiLU — a ativação suave zσ(z)z\,\sigma(z), onde σ\sigma é a sigmoide logística — e multiplica o caminho up elemento a elemento. Uma projeção propõe features candidatas; a outra decide, feature por feature, com que intensidade cada uma dispara. WdownW_{down} então comprime as 17.408 ativações de volta para 5120 para a soma residual.

Agora conte os parâmetros, e conte do jeito que a maioria erra na primeira vez. O instinto treinado na fórmula de duas matrizes diz: duas matrizes de 5120×1740889.15120\times 17408\approx 89.1 milhões de entradas cada, ou seja, cerca de 178 milhões de parâmetros por camada. Isso esquece o gate. O bloco gated guarda três matrizes — gate e up em 5120×174085120\times 17408, down em 17408×512017408\times 5120 — cada uma com cerca de 89,1 milhões de parâmetros, dando aproximadamente 267 milhões por camada. Multiplique por 64 camadas e as FFNs sozinhas respondem por cerca de 17 bilhões de parâmetros do total de ~27 bilhões. As projeções do lado de attention, em comparação, são uma fração pequena do orçamento de uma camada. Cada matriz da FFN também custa cerca de 89,1 milhões de multiply-adds por token, então esse bloco domina tanto a computação quanto o armazenamento para comprimentos de contexto típicos.

Por que gastar o orçamento em largura? Um espaço intermediário largo é um grande banco de detectores de padrão. Uma linha de WgateW_{gate} ou WupW_{up} responde com força quando o vetor residual que chega se alinha à sua direção aprendida; o gate suprime ou admite essa resposta; colunas de WdownW_{down} então escrevem combinações das features sobreviventes de volta no espaço de 5120 dimensões do modelo. O bloco se comporta menos como uma “camada extra” genérica e mais como um dicionário de features aprendido, consultado em cada posição.

A pesquisa refinou essa intuição na lente de key–value memory: direções de entrada agem como keys que reconhecem padrões, direções de saída como values que escrevem a informação associada. É um quadro produtivo. Uma ativação oculta pode responder a um padrão como “capital da França é”, montado por attention no token “Paris”, e adicionar uma feature que o output head associa a uma continuação provável. Também ajuda a explicar por que edições direcionadas na FFN podem mudar o comportamento factual.

Note o que a FFN nunca vê: posição. O bloco aplica pesos idênticos no token 3 e no token 200.000, e não realiza nenhuma operação entre posições. Tudo que é posicional que você estudou nas últimas lições — RoPE rotacionando queries e keys, ALiBi adicionando penalidades dependentes de distância aos scores de attention — atua dentro da subcamada de mistura, nunca aqui. Se a FFN numa posição se comporta diferente de outra, é porque attention entregou conteúdo residual diferente, não porque a FFN sabe onde está.

Escolhas arquiteturais posteriores remodelam a economia desse bloco, não seu papel. Modelos esparsos de mixture-of-experts substituem uma FFN densa por um router e várias FFNs expert, ativando um subconjunto por token; o Qwen3.8-27B não faz isso — suas FFNs são densas, e cada token paga os 267 milhões de parâmetros completos por camada. Ao inspecionar uma FFN real, acompanhe tanto shapes quanto efeitos no residual: quais direções ativam, o que escrevem, quão grande é a atualização em relação ao stream existente e se camadas posteriores a preservam. Ativação sozinha não é causação; ablação e intervenção controlada dão evidência mais forte.

O modelo mental estável é um ritmo de fábrica. Attention é o entregador levando a cada endereço suas anotações selecionadas. A FFN é a oficina mecânica: expande o estado local por 17.408 bancadas, aplica gate com SiLU em cada bancada e comprime uma atualização de volta na esteira compartilhada. Sessenta e quatro oficinas em fila, guardando dezessete bilhões dos vinte e sete bilhões de peças — é aqui, bem literalmente, que a maior parte do modelo vive.

02 · Analogia

Analogia

Attention é uma rede de entregas que leva a cada oficina um pacote de anotações selecionadas. O bloco feed-forward é a oficina mecânica em cada endereço: cada oficina expande as anotações por milhares de bancadas, uma válvula em cada bancada decide com que força sua prensa bate, e os resultados são comprimidos num único pacote para a esteira principal. Entregadores movem informação entre endereços; oficinas transformam o que chega — e as oficinas guardam a maior parte da maquinaria da fábrica.

03 · Explique de volta

Explique de volta

Descreva o shape e o gating do bloco feed-forward do Qwen3.8-27B, mostre por que ele domina a contagem de parâmetros e explique por que dizer que todo conhecimento factual vive nele é forte demais.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Cada camada do Qwen3.8-27B tem uma FFN gated com três projeções: gate e up mapeiam o hidden state de 5120 dimensões para a largura 17.408, SiLU aplicada ao caminho do gate multiplica o caminho up elemento a elemento, e down projeta de volta para 5120. Cada matriz tem cerca de 89,1M de parâmetros, então a FFN de uma camada soma aproximadamente 267M de parâmetros, e 64 camadas dão cerca de 17B do total de ~27B. O bloco atua de forma independente em cada posição, sem mistura entre tokens. Algumas direções da FFN se correlacionam com associações factuais, mas o comportamento emerge de embeddings, mixers, composição residual e profundidade, então a FFN não é um banco de dados isolado.

04 · Teste seu entendimento

Teste seu entendimento

01Um colega conta a FFN do Qwen3.8-27B como duas matrizes 5120×17.408, cerca de 178M de parâmetros por camada. O que ele deixou passar?
Resposta e explicação

A terceira projeção: gate e up ambas expandem, mais uma projeção down de volta para 5120, dando cerca de 267M por camada — Uma FFN com gate SiLU usa projeções gate, up e down; cada uma tem cerca de 89,1M de parâmetros, então o total por camada é de aproximadamente 267M, não 178M.

02Onde atua um bias posicional relativo no estilo ALiBi, e por que a FFN não pode substituí-lo?
Resposta e explicação

Na matriz de scores de attention antes do softmax; a FFN processa cada posição de forma independente e nunca compara posições — ALiBi adiciona penalidades dependentes de distância aos scores de attention. A FFN não realiza nenhuma operação entre posições, então a informação posicional precisa entrar pela subcamada de mistura.

03Qual é o papel do gating com SiLU no bloco?
Resposta e explicação

Uma projeção expandida propõe features candidatas enquanto o caminho com gate escala cada uma elemento a elemento antes da projeção down — O caminho do gate passa pela SiLU e multiplica o caminho up feature por feature, selecionando quanto de cada feature candidata sobrevive.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Ashish Vaswani et al. (2017). Attention Is All You Need.
  2. Mor Geva, Roei Schuster, Jonathan Berant e Omer Levy (2021). Transformer Feed-Forward Layers Are Key-Value Memories.
  3. Qwen Team (2026). Qwen3.8-27B Model Card.