Essencial
LSTM e GRU: gates que lembram
Uma válvula multiplicativa aprendida sobre um caminho aditivo de estado transforma o esquecimento numa decisão que o modelo toma — o mesmo mecanismo que põe a palavra Gated nas camadas Gated DeltaNet e Gated Attention do Qwen3.8-27B.
Atualizada em
01 · Conceito
Conceito
A lição 3.2 deixou um diagnóstico específico, não uma queixa vaga. O problema da RNN simples é que seu estado passa pela mesma multiplicação e pela mesma não linearidade saturante a cada passo, então o crédito ao longo de passos é um produto de jacobianas cujos fatores o modelo não controla. Dois reparos seguem diretamente desse diagnóstico. Dê ao estado um caminho ao qual se soma, em vez de transformá-lo. E deixe o modelo decidir, por passo e por feature, quanto do estado velho manter.
Os dois reparos estão na LSTM, e os dois são visíveis numa única equação. Ao lado da saída oculta , a célula mantém um cell state separado , atualizado como
seguido de . Aqui , e são os gates de forget, input e output: saídas de sigmoide entre zero e um, calculadas a partir de e por mapas afins aprendidos, e multiplicadas elemento a elemento. O candidato é o conteúdo novo em oferta.
Leia a atualização da célula como uma instrução, não como uma fórmula. O forget gate diz, coordenada por coordenada, que fração do livro-razão existente sobrevive. O input gate diz quanto do candidato novo é escrito. Os dois são somados, não compostos. Uma coordenada cujo forget gate está em um e cujo input gate está em zero leva seu valor adiante completamente intacto — sem multiplicação de matriz, sem não linearidade, sem nada.
Isso muda o caminho do gradiente exatamente como a lição 3.2 pediu. Mantendo fixos os valores dos gates, o caminho direto de cell state de a contribui com : o produto dos forget gates. As matrizes de pesos e a derivada saturante estão ausentes dessa rota direta, e o que resta é uma quantidade que a própria rede calcula. Esse produto, porém, não é a derivada total inteira: os gates e o candidato também dependem do hidden state anterior, criando caminhos adicionais de gradiente.
Agora descubra o que esse produto de fato compra, porque é aqui que a contabilidade honesta importa. Suponha que o forget gate de uma coordenada estabilize em . Ao longo de 100 passos a fração retida é — cerca de um terço do sinal sobrevive, o que é perfeitamente utilizável. Baixe o gate para e os mesmos 100 passos dão : sumiu. O gate não é um interruptor entre lembrar e esquecer; ele define uma meia-vida exponencial, e diferenças pequenas no valor do gate produzem diferenças enormes de alcance.
Isso torna a inicialização consequente de um jeito que surpreende as pessoas. Deixe o bias do forget gate em zero e a sigmoide parte perto de , então no início do treino a célula retém ao longo de cem passos — uma meia-vida de um passo. O modelo precisa primeiro aprender a lembrar antes de poder aprender o que lembrar, e o gradiente que o ensinaria isso já desapareceu. A correção padrão é inicializar o bias do forget gate positivo: com bias 3 o gate parte perto de , e , que é pequeno mas não mais astronomicamente morto, então o gradiente de longo alcance existe e pode ser melhorado. O desvio aqui é diagnosticar a falha resultante como problema de learning rate ou de capacidade e passar dias ajustando; a causa real é uma inicialização de bias que fez o caminho da memória começar na posição desligada.
Uma GRU simplifica o projeto fundindo cell state e hidden state. Um update gate interpola entre o estado anterior e um candidato, e um reset gate controla quanto do estado anterior contribui enquanto o candidato é formado. Menos gates, menos parâmetros, muitas vezes qualidade comparável. As equações exatas variam por convenção — notadamente se o reset é aplicado antes ou depois de uma multiplicação de matriz — e essas variantes não são numericamente equivalentes, então a compatibilidade de checkpoint depende da definição precisa, não do nome.
Visualizações de gate convidam a um segundo erro que vale nomear. Uma coordenada exibindo forget alto num token específico não prova que aquela unidade “armazena” um fato nomeável por humanos. As features de estado são distribuídas, os gates interagem entre milhares de coordenadas, e uma projeção downstream pode amplificar ou descartar o que quer que tenha sido preservado. Intervenção causal — fixar a coordenada, medir a mudança de comportamento — é evidência; um heatmap colorido é uma hipótese.
Para comparar células recorrentes com honestidade, iguale a contagem total de parâmetros ajustando a largura oculta em vez de fixar o hidden size — hidden size igual favorece a GRU, que é menor em custo de parâmetros, enquanto parâmetros iguais mudam a largura e portanto a representação. Reporte latência e memória nos comprimentos de sequência que você realmente usa, e teste explicitamente os resets de estado em streaming: estado carregado entre sequências não relacionadas produz números impressionantes que são vazamento, não memória.
02 · Analogia
Analogia
Um arquivista mantém um livro-razão de trabalho enquanto relatórios chegam. O forget gate decide quais entradas velhas apagar, o input gate decide que notas candidatas novas escrever, e o output gate decide que parte do livro revelar agora. Uma GRU usa um painel de controle menor: um gate mistura estado velho com um candidato, outro decide quanto do histórico molda esse candidato. Gates são válvulas suaves de zero a um, não compartimentos de memória legíveis por humanos.
03 · Explique de volta
Explique de volta
Explique como a atualização da célula LSTM muda o caminho do gradiente em comparação com uma RNN simples, por que o valor do forget gate define uma meia-vida em vez de conceder permanência, e onde a mesma ideia de gating reaparece numa arquitetura de 2026.
Comparar com uma resposta-modelo
Uma RNN simples remultiplica seu estado por uma matriz de pesos e por uma não linearidade saturante a cada passo, então gradientes ao longo de k passos carregam um produto de k jacobianas. A atualização da célula LSTM c_t = f_t ⊙ c_{t−1} + i_t ⊙ c̃_t é aditiva, e o caminho direto de cell state de c_T de volta até c_k contribui com o produto dos forget gates no intervalo — uma quantidade que o modelo controla, e não uma propriedade fixa de uma matriz de pesos. A derivada total também inclui rotas pelos gates e pelo candidato, porque eles dependem do hidden state anterior. Como isso continua sendo um produto, um forget gate em 0,99 preserva cerca de 37 por cento de um sinal depois de 100 passos, enquanto um em 0,9 quase não preserva nada; ou seja, gates definem uma meia-vida, não permanência. O mesmo controle multiplicativo aparece nos blocos feed-forward com gate da lição 2.3 e, aplicado a um estado recorrente matricial, é o gate das camadas Gated DeltaNet do Qwen3.8-27B.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Sepp Hochreiter e Jürgen Schmidhuber (1997). Long Short-Term Memory.
- Kyunghyun Cho et al. (2014). Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation.
- Qwen Team (2026). Qwen3.8-27B Model Card.