Fundamentos
Derivadas e gradientes, geometricamente
Derivadas medem sensibilidade local; gradientes reúnem essas medidas na direção de maior crescimento.
Atualizada em
1
Conceito
Uma derivada mede sensibilidade local. Para uma função de uma variável , a derivada em é o limite das inclinações de secantes cada vez menores:
Se , uma variação positiva suficientemente pequena produz mudança de aproximadamente . É uma aproximação linear local, não uma promessa sobre movimentos grandes ou regiões distantes.
Geometricamente, a derivada é a inclinação da reta tangente. Valor positivo sobe com ; negativo desce; zero indica região plana, mas não necessariamente um mínimo. O ponto pode ser máximo, mínimo ou inflexão horizontal. Derivadas descrevem a vizinhança. Não revelam automaticamente o melhor ponto da função inteira.
Redes neurais dependem de muitos parâmetros, então sua loss é . Uma derivada parcial pergunta como a loss muda quando o parâmetro varia um pouco e os outros ficam fixos. Reunir todas produz o gradiente:
O gradiente aponta para o maior aumento local segundo a distância euclidiana; seu negativo, para a maior redução. Gradient descent atualiza , com learning rate . Pequeno demais torna o avanço lento; grande demais pode atravessar o vale ou ficar instável. A curvatura faz o passo adequado variar entre direções e ao longo do tempo.
A regra da cadeia conecta sensibilidades numa composição. Se e , então . Uma rede é uma longa composição de multiplicações, activations, normalização e loss. Backpropagation aplica a regra da cadeia eficientemente, reaproveitando derivadas intermediárias em vez de expandir separadamente cada caminho de cada parâmetro até a saída.
Gradientes têm unidades e escala. Multiplicar a loss por mil multiplica o gradiente por mil sem mudar quais parâmetros representam a solução. Features em escalas muito diferentes tornam a superfície mal condicionada: íngreme numa direção e rasa em outra. Normalização, inicialização, optimizers adaptativos e schedules ajudam a lidar com a geometria, mas não mudam o significado da derivada.
Nem toda operação é diferenciável em todo ponto. ReLU tem um canto em zero; o software escolhe um subgradiente convencional ali. Seleção de token é discreta, portanto o treinamento diferencia probabilidades e representações contínuas, não a palavra amostrada. Diferenças finitas verificam implementações pequenas perturbando parâmetros, mas diferenciação automática analítica é muito mais barata em bilhões deles.
O modelo mental é um mapa local. A loss é terreno sobre o espaço de parâmetros. A parcial é uma inclinação por coordenada; o gradiente é a seta combinada para cima; o negativo sugere a descida. A otimização é difícil porque o terreno é enorme, ruidoso, curvo e observado por batches, não porque a definição seja misteriosa. A geometria explica tanto o sucesso quanto o limite de uma única seta local.
Uma verificação útil em funções pequenas compara o gradiente analítico com diferenças finitas em várias escalas de . Concordância apenas num passo extremo pode indicar arredondamento ou bug; a comparação deve ocorrer longe de pontos não diferenciáveis conhecidos.
2
Como explicar para uma criança de cinco anos
Imagine estar numa encosta coberta por neblina com um aparelho que mede inclinação sob seus pés. Uma derivada informa a subida ao longo de uma direção. O gradiente combina a inclinação de cada coordenada numa seta para a maior subida local. Para descer, caminhe contra a seta. O aparelho descreve apenas o terreno perto das botas; um salto grande pode cair além da região que a leitura representava bem.
3
Ensine de volta
Explique derivada, derivada parcial, gradiente e learning rate numa superfície de loss, usando explicitamente a ideia de localidade.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Uma derivada mede como uma saída muda diante de uma variação minúscula numa entrada. Numa loss com muitos parâmetros, cada parcial varia um parâmetro e mantém os outros fixos. O gradiente reúne as parciais e aponta para o maior crescimento local. Gradient descent atualiza parâmetros na direção oposta, com escala dada pelo learning rate. Como o gradiente é local, um passo grande pode ultrapassar o vale ou aumentar a loss.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Ian Goodfellow, Yoshua Bengio e Aaron Courville (2016). Deep Learning.