Essencial

O bloco feed-forward e onde o conhecimento vive

Depois que attention mistura posições, uma rede larga e não linear transforma cada posição e escreve features de volta no residual stream.

Atualizada em

1

Conceito

Attention recebe a maior parte da publicidade por criar ligações visíveis entre posições. Mesmo assim, grande parte dos parâmetros e compute de um Transformer denso vive na feed-forward network (FFN), também chamada MLP. Attention roteia informação; a FFN a transforma.

O bloco original aplica duas transformações lineares com uma não linearidade no meio:

FFN(x)=W2σ(W1x+b1)+b2.\operatorname{FFN}(x)=W_2\,\sigma(W_1x+b_1)+b_2.

A primeira projeção expande de dmodeld_{model} para uma largura intermediária dffd_{ff}. A segunda volta a dmodeld_{model} para o resultado se juntar ao residual stream. Os mesmos pesos servem a todas as posições, processadas em paralelo. Não existe mistura entre tokens dentro dessa FFN comum.

A expansão importa porque um espaço intermediário largo representa muitos detectores de features. Uma linha de W1W_1 responde quando o vetor residual se alinha à direção aprendida. A activation function suprime ou remodela a resposta. Colunas de W2W_2 escrevem combinações das features ativadas de volta ao espaço do modelo. Isso se parece mais com um banco aprendido de padrões que com uma camada extra genérica.

Variantes usam ReLU, GELU ou ativações com gate, como SwiGLU. Uma FFN gated forma duas projeções: uma produz candidatos e outra controla sua intensidade, seguida de multiplicação elemento a elemento e projeção de saída. Ao comparar versões, é preciso ajustar o orçamento de parâmetros; citar apenas a largura intermediária pode representar mal a capacidade.

Pesquisas descrevem FFNs como key–value memories: direções de entrada agem como keys reconhecendo padrões, e direções de saída escrevem informação associada. É uma lente produtiva. Uma ativação escondida pode responder a um padrão textual e adicionar uma feature útil para a continuação provável.

Mas “os fatos vivem na FFN” é literal demais. Comportamento emerge do cálculo completo. Embeddings estabelecem features; attention recupera sinais contextuais; conexões residuais sobrepõem atualizações; normalização muda escala efetiva; várias FFNs se compõem; a projeção final lê o estado. Uma associação factual pode depender de uma rota longa. Neurônios individuais não são linhas de banco de dados com rótulos estáveis.

Considere o token “Paris” depois de attention reunir features do padrão “capital da França é”. A FFN pode detectar a conjunção e escrever algo que o language-model head associa à continuação provável. Em outro contexto, “Paris” chega com outro estado e ativa outro subconjunto da mesma FFN compartilhada.

O bloco é caro porque as projeções largas tocam todo token. Para comprimento fixo, sua aritmética pode rivalizar ou superar attention, principalmente em contextos não muito longos. Arquiteturas mixture-of-experts substituem uma FFN densa por router e vários experts, ativando poucos por token. Isso muda capacidade e comunicação, mas preserva o papel de transformar cada posição.

Ao inspecionar uma FFN, acompanhe shapes e efeitos residuais: quais direções ativam, o que escrevem, quão grande é a atualização e se camadas posteriores a preservam. Ativação sozinha não é causalidade; ablation ou intervenção controlada produz evidência mais forte.

O modelo estável alterna comunicação e computação. Attention traz contexto relevante a cada endereço. A FFN expande o estado local, seleciona features não lineares e comprime uma atualização de volta ao residual stream.

2

Como explicar para uma criança de cinco anos

Attention é uma rede de entregas que leva a cada oficina um pacote de anotações selecionadas. O bloco feed-forward é a máquina em cada endereço: toda oficina usa a mesma prensa de dois estágios, expande as notas por muitas bancadas, ativa padrões úteis e comprime o resultado para a esteira principal. Entregadores movem informação; oficinas transformam o que chega.

3

Ensine de volta

Explique o shape do bloco feed-forward, seu papel em relação a attention e por que dizer que todo conhecimento factual vive nele é forte demais.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Uma FFN projeta de d_model para uma dimensão intermediária maior, aplica uma não linearidade ou gate e volta a d_model, independentemente em cada posição. Attention mistura informação entre tokens; a FFN transforma features locais. Neurônios e atualizações podem se correlacionar com associações factuais, mas conhecimento se distribui por embeddings, attention, residual stream e várias camadas, não forma um banco isolado na FFN.

4

Teste seu entendimento

1. Em qual eixo uma FFN padrão mistura informação?
Resposta e explicação

Canais de features dentro de cada posição — A mesma FFN roda independentemente por posição; attention realiza a mistura entre posições.

2. Por que expandir a largura intermediária?
Resposta e explicação

Para criar um espaço maior de features não lineares antes de projetar de volta — A representação mais larga oferece capacidade para detectar e combinar muitas features.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Ashish Vaswani et al. (2017). Attention Is All You Need.
  2. Mor Geva, Roei Schuster, Jonathan Berant e Omer Levy (2021). Transformer Feed-Forward Layers Are Key-Value Memories.