Avançado

Scaling laws I: Kaplan

Scaling laws no estilo Kaplan ajustam relações power-law entre loss, tamanho, dados e compute dentro de um regime experimental observado.

Atualizada em

1

Conceito

Treinar um modelo de fronteira só para descobrir se a configuração era sensata é caro demais. Scaling laws usam famílias de experimentos menores para estimar como held-out loss muda com parâmetros, dados e compute. A observação marcante é que as relações podem ser suaves por grandes intervalos, apesar da complexidade das redes.

Uma forma comum é power law mais termo irredutível:

L(x)=L+Axα.L(x)=L_\infty+A x^{-\alpha}.

xx pode ser parâmetros sem embedding, tamanho do dataset ou compute. Em eixos log-log, a parte redutível fica aproximadamente linear, tornando o expoente α\alpha visível como slope. α\alpha maior significa queda mais rápida de loss ao ampliar o recurso. A curva resume runs observadas; não explica todos os mecanismos.

Kaplan e colaboradores treinaram muitos Transformers autoregressivos e estudaram loss em função de modelo, dados e compute. A análise destacou que desempenho era limitado pelo recurso escasso: parâmetros não compensam indefinidamente falta de dados, e tokens não compensam para sempre um modelo minúsculo.

Sob orçamento fixo, é preciso escolher um tradeoff. Modelo maior gasta mais por token e vê menos tokens. Modelo menor processa mais texto, mas tem menos capacidade. O ótimo ajustado na era Kaplan favorecia crescer o modelo rapidamente e encerrar o treinamento antes de muitas passagens. Essa recomendação influenciou planejamento de modelos grandes.

Compute de Transformer denso é frequentemente aproximado como parâmetros vezes tokens. Uma estimativa comum é C6NDC\approx6ND FLOPs para NN parâmetros sem embedding e DD tokens, mas a constante depende do que é contado e da arquitetura. FLOPs não são tempo: utilização, comunicação, data loading, recomputação e falhas determinam duração.

Bom trabalho de scaling separa interpolação de extrapolação. Ajuste em algumas runs, segure outras e verifique erro de previsão antes de confiar além do intervalo. Plote resíduos, não apenas uma reta bonita. Pequeno desvio sistemático fica caro ao atravessar ordens de grandeza.

Loss não é o produto inteiro. Modelos com validation loss parecida diferem em tarefas downstream, calibração, safety, cobertura multilíngue, latency e memória. Thresholds aparentemente emergentes podem surgir quando uma capacidade suave cruza a regra de pontuação. A curva guia alocação; não substitui avaliação.

Qualidade de dados complica o eixo DD. Um token não é unidade padrão de informação. Boilerplate repetido, texto ruim e domínio valioso contam igualmente, mas contribuem de formas distintas. Tamanho efetivo depende de duplicação e mixture. Experimentos precisam manter o pipeline estável ou modelar a mudança.

O workflow prático escolhe vários tamanhos e budgets de tokens, mantém receitas comparáveis, reserva validação, registra compute realizado, ajusta formas concorrentes, valida em runs separadas, quantifica incerteza e seleciona o próximo experimento. Refaça o fit quando dados ou arquitetura mudarem.

O insight durável é previsibilidade com fronteiras. Loss pode seguir tendências suaves e tornar ciência empírica útil para decisões enormes. A lição igualmente importante é humildade: a curva descreve um regime. A próxima aula mostra como outro desenho experimental mudou a alocação recomendada.

2

Como explicar para uma criança de cinco anos

Um estaleiro testa cascos pequenos num tanque e ajusta curvas entre tamanho, motor e arrasto. As curvas ajudam a escolher o protótipo seguinte, mas não são leis naturais para todo oceano e material. Scaling laws fazem isso com modelos: experimentos controlados revelam tendências suaves de loss, e extrapolar vira instrumento de orçamento com barras de erro.

3

Ensine de volta

Explique o que é uma neural scaling law, o que Kaplan et al. variaram e por que os expoentes não são constantes universais.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Scaling law é um ajuste empírico, muitas vezes power-law, ligando held-out loss a parâmetros, dados ou compute num regime medido. Kaplan et al. treinaram famílias autoregressivas e observaram tendências suaves e uma alocação compute-optimal que favorecia modelos maiores com relativamente menos tokens. Expoentes dependem de dataset, tokenizer, arquitetura, optimizer, loss e intervalo do fit, então evidência posterior pode gerar outro ótimo.

4

Teste seu entendimento

1. O que uma linha reta em eixos log-log sugere?
Resposta e explicação

Uma relação power-law naquele intervalo — Tomar logs converte y = ax^b em log y = log a + b log x, reta cujo slope é o expoente.

2. Por que executar muitos experimentos menores?
Resposta e explicação

Para estimar tendências antes de comprometer o maior orçamento — Runs menores e controladas ajustam e validam a superfície usada no planejamento da maior.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Jared Kaplan et al. (2020). Scaling Laws for Neural Language Models.