Essencial
Residuals, pre-norm versus post-norm
Caminhos residuais preservam um estado comum em profundidade, enquanto a posição da normalização muda otimização e escala das atualizações.
Atualizada em
1
Conceito
Um Transformer não passa a saída de cada camada para a seguinte como substituição total. Ele mantém um residual stream e pede a cada subcamada uma atualização. Para uma transformação , o padrão é
O termo identidade abre um caminho direto para a informação. A camada aprende uma correção pequena e útil em vez de reconstruir a representação. Em backpropagation, gradientes também ganham uma rota aditiva que não multiplica pela Jacobiana de toda subcamada. Isso não elimina exploding ou vanishing gradients, mas torna profundidade muito mais administrável.
Attention e FFN escrevem nesse stream. Depois de attention, o estado contém as features anteriores e uma atualização de comunicação. Depois da FFN, contém esse resultado e uma atualização não linear por posição. O residual stream não é a saída de um componente; é um espaço de trabalho comum acumulando features sobrepostas.
Normalização controla escala e distribuição vistas pelas transformações. LayerNorm calcula estatísticas na dimensão de features de um token e aplica escala e deslocamento aprendidos. Muitos decoders modernos usam RMSNorm, que normaliza a magnitude RMS sem subtrair a média. A questão de posição permanece: normalizar antes da subcamada ou depois da soma residual?
O Transformer original usava post-norm:
O estado combinado é normalizado depois de cada atualização. Uma alternativa moderna comum é pre-norm:
Cada subcamada recebe input normalizado, enquanto o caminho principal continua sendo uma soma identidade. Pilhas pre-norm profundas costumam otimizar com maior confiabilidade porque o gradiente encontra uma rota mais limpa. É uma tendência empírica, não prova de que pre-norm sempre atinge melhor qualidade.
As duas formas também produzem dinâmicas distintas. Post-norm reescala repetidamente o stream combinado. Pre-norm permite que sua magnitude cresça com atualizações acumuladas, então a arquitetura pode usar uma normalização final e escalas residuais. Inicialização, profundidade, learning rate, precisão e optimizer interagem com a escolha.
Dropout, quando existe, costuma ser aplicado ao branch antes da soma, não ao caminho identidade. Isso preserva a rota confiável enquanto regulariza atualizações. Em inference, dropout é desativado. Métodos como stochastic depth podem remover branches inteiros durante treinamento, novamente confiando na identidade.
A expressão “residual stream” ajuda a interpretar. Muitas features estão sobrepostas no mesmo espaço, e componentes leem e escrevem nele. A saída de uma attention head pode ser cancelada, carregada por várias camadas ou transformada depois. Observar somente uma subcamada ignora o estado já presente e as operações posteriores.
Um hábito de debugging é registrar normas de , de e da soma. Uma atualização que domina o stream pode desestabilizar; uma sempre desprezível pode indicar branch morto. São diagnósticos, não thresholds universais.
O quadro durável é edição colaborativa. O residual stream preserva o documento atual. Cada subcamada normalizada lê esse documento e propõe uma mudança estruturada. A posição da normalização decide se a calibração ocorre antes do trabalho especializado ou depois da incorporação da edição.
2
Como explicar para uma criança de cinco anos
Uma restauração longa mantém a fotografia original numa mesa de luz central. Cada especialista recebe uma cópia calibrada ou o composto atual, propõe uma correção limitada e a soma de volta em vez de repintar tudo. Pre-norm calibra o que entra no especialista e mantém a mesa contínua. Post-norm soma a correção primeiro e calibra a imagem combinada depois.
3
Ensine de volta
Escreva as equações conceituais de pre-norm e post-norm e explique como o caminho residual ajuda os gradientes.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Pre-norm usa x' = x + F(LN(x)); post-norm usa x' = LN(x + F(x)). O caminho identidade aditivo permite que informação e gradientes atravessem uma pilha profunda sem cada camada reconstruir toda a representação. Pre-norm geralmente oferece uma rota de identidade mais direta e costuma facilitar Transformers profundos; post-norm altera a escala do estado após cada soma e pode exigir otimização mais cuidadosa.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Kaiming He, Xiangyu Zhang, Shaoqing Ren e Jian Sun (2015). Deep Residual Learning for Image Recognition.
- Ruibin Xiong et al. (2020). On Layer Normalization in the Transformer Architecture.