Essencial

LSTM e GRU: gates que lembram

Uma válvula multiplicativa aprendida sobre um caminho aditivo de estado transforma o esquecimento numa decisão que o modelo toma — o mesmo mecanismo que põe a palavra Gated nas camadas Gated DeltaNet e Gated Attention do Qwen3.8-27B.

Atualizada em

01 · Conceito

Conceito

A lição 3.2 deixou um diagnóstico específico, não uma queixa vaga. O problema da RNN simples é que seu estado passa pela mesma multiplicação e pela mesma não linearidade saturante a cada passo, então o crédito ao longo de kk passos é um produto de kk jacobianas cujos fatores o modelo não controla. Dois reparos seguem diretamente desse diagnóstico. Dê ao estado um caminho ao qual se soma, em vez de transformá-lo. E deixe o modelo decidir, por passo e por feature, quanto do estado velho manter.

Os dois reparos estão na LSTM, e os dois são visíveis numa única equação. Ao lado da saída oculta hth_t, a célula mantém um cell state separado ctc_t, atualizado como

ct=ftct1+itc~t,c_t=f_t\odot c_{t-1}+i_t\odot\tilde c_t,

seguido de ht=ottanh(ct)h_t=o_t\odot\tanh(c_t). Aqui ftf_t, iti_t e oto_t são os gates de forget, input e output: saídas de sigmoide entre zero e um, calculadas a partir de xtx_t e ht1h_{t-1} por mapas afins aprendidos, e multiplicadas elemento a elemento. O candidato c~t\tilde c_t é o conteúdo novo em oferta.

Leia a atualização da célula como uma instrução, não como uma fórmula. O forget gate diz, coordenada por coordenada, que fração do livro-razão existente sobrevive. O input gate diz quanto do candidato novo é escrito. Os dois são somados, não compostos. Uma coordenada cujo forget gate está em um e cujo input gate está em zero leva seu valor adiante completamente intacto — sem multiplicação de matriz, sem não linearidade, sem nada.

Isso muda o caminho do gradiente exatamente como a lição 3.2 pediu. Mantendo fixos os valores dos gates, o caminho direto de cell state de ckc_k a cTc_T contribui com t=k+1Tft\prod_{t=k+1}^{T} f_t: o produto dos forget gates. As matrizes de pesos e a derivada saturante estão ausentes dessa rota direta, e o que resta é uma quantidade que a própria rede calcula. Esse produto, porém, não é a derivada total inteira: os gates e o candidato também dependem do hidden state anterior, criando caminhos adicionais de gradiente.

Agora descubra o que esse produto de fato compra, porque é aqui que a contabilidade honesta importa. Suponha que o forget gate de uma coordenada estabilize em 0.990.99. Ao longo de 100 passos a fração retida é 0.991000.3660.99^{100}\approx0.366 — cerca de um terço do sinal sobrevive, o que é perfeitamente utilizável. Baixe o gate para 0.90.9 e os mesmos 100 passos dão 0.91002.7×1050.9^{100}\approx2.7\times10^{-5}: sumiu. O gate não é um interruptor entre lembrar e esquecer; ele define uma meia-vida exponencial, e diferenças pequenas no valor do gate produzem diferenças enormes de alcance.

Isso torna a inicialização consequente de um jeito que surpreende as pessoas. Deixe o bias do forget gate em zero e a sigmoide parte perto de 0.50.5, então no início do treino a célula retém 0.51008×10310.5^{100}\approx8\times10^{-31} ao longo de cem passos — uma meia-vida de um passo. O modelo precisa primeiro aprender a lembrar antes de poder aprender o que lembrar, e o gradiente que o ensinaria isso já desapareceu. A correção padrão é inicializar o bias do forget gate positivo: com bias 3 o gate parte perto de 0.9530.953, e 0.9531000.0080.953^{100}\approx0.008, que é pequeno mas não mais astronomicamente morto, então o gradiente de longo alcance existe e pode ser melhorado. O desvio aqui é diagnosticar a falha resultante como problema de learning rate ou de capacidade e passar dias ajustando; a causa real é uma inicialização de bias que fez o caminho da memória começar na posição desligada.

Uma GRU simplifica o projeto fundindo cell state e hidden state. Um update gate interpola entre o estado anterior e um candidato, e um reset gate controla quanto do estado anterior contribui enquanto o candidato é formado. Menos gates, menos parâmetros, muitas vezes qualidade comparável. As equações exatas variam por convenção — notadamente se o reset é aplicado antes ou depois de uma multiplicação de matriz — e essas variantes não são numericamente equivalentes, então a compatibilidade de checkpoint depende da definição precisa, não do nome.

Visualizações de gate convidam a um segundo erro que vale nomear. Uma coordenada exibindo forget alto num token específico não prova que aquela unidade “armazena” um fato nomeável por humanos. As features de estado são distribuídas, os gates interagem entre milhares de coordenadas, e uma projeção downstream pode amplificar ou descartar o que quer que tenha sido preservado. Intervenção causal — fixar a coordenada, medir a mudança de comportamento — é evidência; um heatmap colorido é uma hipótese.

Para comparar células recorrentes com honestidade, iguale a contagem total de parâmetros ajustando a largura oculta em vez de fixar o hidden size — hidden size igual favorece a GRU, que é menor em custo de parâmetros, enquanto parâmetros iguais mudam a largura e portanto a representação. Reporte latência e memória nos comprimentos de sequência que você realmente usa, e teste explicitamente os resets de estado em streaming: estado carregado entre sequências não relacionadas produz números impressionantes que são vazamento, não memória.

02 · Analogia

Analogia

Um arquivista mantém um livro-razão de trabalho enquanto relatórios chegam. O forget gate decide quais entradas velhas apagar, o input gate decide que notas candidatas novas escrever, e o output gate decide que parte do livro revelar agora. Uma GRU usa um painel de controle menor: um gate mistura estado velho com um candidato, outro decide quanto do histórico molda esse candidato. Gates são válvulas suaves de zero a um, não compartimentos de memória legíveis por humanos.

03 · Explique de volta

Explique de volta

Explique como a atualização da célula LSTM muda o caminho do gradiente em comparação com uma RNN simples, por que o valor do forget gate define uma meia-vida em vez de conceder permanência, e onde a mesma ideia de gating reaparece numa arquitetura de 2026.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Uma RNN simples remultiplica seu estado por uma matriz de pesos e por uma não linearidade saturante a cada passo, então gradientes ao longo de k passos carregam um produto de k jacobianas. A atualização da célula LSTM c_t = f_t ⊙ c_{t−1} + i_t ⊙ c̃_t é aditiva, e o caminho direto de cell state de c_T de volta até c_k contribui com o produto dos forget gates no intervalo — uma quantidade que o modelo controla, e não uma propriedade fixa de uma matriz de pesos. A derivada total também inclui rotas pelos gates e pelo candidato, porque eles dependem do hidden state anterior. Como isso continua sendo um produto, um forget gate em 0,99 preserva cerca de 37 por cento de um sinal depois de 100 passos, enquanto um em 0,9 quase não preserva nada; ou seja, gates definem uma meia-vida, não permanência. O mesmo controle multiplicativo aparece nos blocos feed-forward com gate da lição 2.3 e, aplicado a um estado recorrente matricial, é o gate das camadas Gated DeltaNet do Qwen3.8-27B.

04 · Teste seu entendimento

Teste seu entendimento

01A lição 3.2 mostrou que o gradiente de longo alcance de uma RNN simples é um produto de jacobianas. Qual é a contribuição direta ao longo do caminho de cell state da LSTM?
Resposta e explicação

Um produto de valores de forget gate, que o próprio modelo calcula a partir da entrada e pode aprender a manter perto de um — Essa contribuição direta continua sendo um produto, e portanto ainda decai, mas seus fatores são aprendidos e dependentes da entrada. Outras rotas pelos gates e pelo candidato também contribuem para a derivada total.

02O bias do forget gate de uma LSTM fica em zero, então o gate parte perto de 0,5 na inicialização. Qual é a consequência prática?
Resposta e explicação

O conteúdo da célula cai pela metade a cada passo, então nada sobrevive a mais que um punhado de passos e o aprendizado de longo alcance nunca começa — Inicializar o forget bias positivo é um remédio padrão justamente porque o valor default põe a meia-vida do estado em um passo.

03Qual é a diferença estrutural de uma GRU?
Resposta e explicação

Ela funde cell state e hidden state e usa menos gates, com um update gate interpolando entre estado velho e candidato — Uma GRU é uma recorrência com gates mais simples, não um modelo sem recorrência nem baseado em attention.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Sepp Hochreiter e Jürgen Schmidhuber (1997). Long Short-Term Memory.
  2. Kyunghyun Cho et al. (2014). Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation.
  3. Qwen Team (2026). Qwen3.8-27B Model Card.