Essencial

Residuals, pre-norm versus post-norm

Caminhos residuais preservam um estado comum em profundidade, enquanto a posição da normalização muda otimização e escala das atualizações.

Atualizada em

1

Conceito

Um Transformer não passa a saída de cada camada para a seguinte como substituição total. Ele mantém um residual stream e pede a cada subcamada uma atualização. Para uma transformação FF, o padrão é

x=x+F(x).x'=x+F(x).

O termo identidade xx abre um caminho direto para a informação. A camada aprende uma correção pequena e útil em vez de reconstruir a representação. Em backpropagation, gradientes também ganham uma rota aditiva que não multiplica pela Jacobiana de toda subcamada. Isso não elimina exploding ou vanishing gradients, mas torna profundidade muito mais administrável.

Attention e FFN escrevem nesse stream. Depois de attention, o estado contém as features anteriores e uma atualização de comunicação. Depois da FFN, contém esse resultado e uma atualização não linear por posição. O residual stream não é a saída de um componente; é um espaço de trabalho comum acumulando features sobrepostas.

Normalização controla escala e distribuição vistas pelas transformações. LayerNorm calcula estatísticas na dimensão de features de um token e aplica escala e deslocamento aprendidos. Muitos decoders modernos usam RMSNorm, que normaliza a magnitude RMS sem subtrair a média. A questão de posição permanece: normalizar antes da subcamada ou depois da soma residual?

O Transformer original usava post-norm:

x=LN(x+F(x)).x'=\operatorname{LN}(x+F(x)).

O estado combinado é normalizado depois de cada atualização. Uma alternativa moderna comum é pre-norm:

x=x+F(LN(x)).x'=x+F(\operatorname{LN}(x)).

Cada subcamada recebe input normalizado, enquanto o caminho principal continua sendo uma soma identidade. Pilhas pre-norm profundas costumam otimizar com maior confiabilidade porque o gradiente encontra uma rota mais limpa. É uma tendência empírica, não prova de que pre-norm sempre atinge melhor qualidade.

As duas formas também produzem dinâmicas distintas. Post-norm reescala repetidamente o stream combinado. Pre-norm permite que sua magnitude cresça com atualizações acumuladas, então a arquitetura pode usar uma normalização final e escalas residuais. Inicialização, profundidade, learning rate, precisão e optimizer interagem com a escolha.

Dropout, quando existe, costuma ser aplicado ao branch antes da soma, não ao caminho identidade. Isso preserva a rota confiável enquanto regulariza atualizações. Em inference, dropout é desativado. Métodos como stochastic depth podem remover branches inteiros durante treinamento, novamente confiando na identidade.

A expressão “residual stream” ajuda a interpretar. Muitas features estão sobrepostas no mesmo espaço, e componentes leem e escrevem nele. A saída de uma attention head pode ser cancelada, carregada por várias camadas ou transformada depois. Observar somente uma subcamada ignora o estado já presente e as operações posteriores.

Um hábito de debugging é registrar normas de xx, de F()F(\cdot) e da soma. Uma atualização que domina o stream pode desestabilizar; uma sempre desprezível pode indicar branch morto. São diagnósticos, não thresholds universais.

O quadro durável é edição colaborativa. O residual stream preserva o documento atual. Cada subcamada normalizada lê esse documento e propõe uma mudança estruturada. A posição da normalização decide se a calibração ocorre antes do trabalho especializado ou depois da incorporação da edição.

2

Como explicar para uma criança de cinco anos

Uma restauração longa mantém a fotografia original numa mesa de luz central. Cada especialista recebe uma cópia calibrada ou o composto atual, propõe uma correção limitada e a soma de volta em vez de repintar tudo. Pre-norm calibra o que entra no especialista e mantém a mesa contínua. Post-norm soma a correção primeiro e calibra a imagem combinada depois.

3

Ensine de volta

Escreva as equações conceituais de pre-norm e post-norm e explique como o caminho residual ajuda os gradientes.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Pre-norm usa x' = x + F(LN(x)); post-norm usa x' = LN(x + F(x)). O caminho identidade aditivo permite que informação e gradientes atravessem uma pilha profunda sem cada camada reconstruir toda a representação. Pre-norm geralmente oferece uma rota de identidade mais direta e costuma facilitar Transformers profundos; post-norm altera a escala do estado após cada soma e pode exigir otimização mais cuidadosa.

4

Teste seu entendimento

1. Qual expressão descreve uma subcamada pre-norm?
Resposta e explicação

x + F(LN(x)) — Pre-norm normaliza a entrada da subcamada e soma a atualização resultante ao residual stream existente.

2. Qual é o propósito central de uma conexão residual?
Resposta e explicação

Fornecer um caminho identidade enquanto as camadas somam atualizações — O stream carrega informação anterior, e cada subcamada aprende uma correção em vez de uma substituição completa.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Kaiming He, Xiangyu Zhang, Shaoqing Ren e Jian Sun (2015). Deep Residual Learning for Image Recognition.
  2. Ruibin Xiong et al. (2020). On Layer Normalization in the Transformer Architecture.