Avançado
Scaling laws I: Kaplan
Scaling laws no estilo Kaplan ajustam relações power-law entre loss, tamanho, dados e compute dentro de um regime experimental observado.
Atualizada em
1
Conceito
Treinar um modelo de fronteira só para descobrir se a configuração era sensata é caro demais. Scaling laws usam famílias de experimentos menores para estimar como held-out loss muda com parâmetros, dados e compute. A observação marcante é que as relações podem ser suaves por grandes intervalos, apesar da complexidade das redes.
Uma forma comum é power law mais termo irredutível:
pode ser parâmetros sem embedding, tamanho do dataset ou compute. Em eixos log-log, a parte redutível fica aproximadamente linear, tornando o expoente visível como slope. maior significa queda mais rápida de loss ao ampliar o recurso. A curva resume runs observadas; não explica todos os mecanismos.
Kaplan e colaboradores treinaram muitos Transformers autoregressivos e estudaram loss em função de modelo, dados e compute. A análise destacou que desempenho era limitado pelo recurso escasso: parâmetros não compensam indefinidamente falta de dados, e tokens não compensam para sempre um modelo minúsculo.
Sob orçamento fixo, é preciso escolher um tradeoff. Modelo maior gasta mais por token e vê menos tokens. Modelo menor processa mais texto, mas tem menos capacidade. O ótimo ajustado na era Kaplan favorecia crescer o modelo rapidamente e encerrar o treinamento antes de muitas passagens. Essa recomendação influenciou planejamento de modelos grandes.
Compute de Transformer denso é frequentemente aproximado como parâmetros vezes tokens. Uma estimativa comum é FLOPs para parâmetros sem embedding e tokens, mas a constante depende do que é contado e da arquitetura. FLOPs não são tempo: utilização, comunicação, data loading, recomputação e falhas determinam duração.
Bom trabalho de scaling separa interpolação de extrapolação. Ajuste em algumas runs, segure outras e verifique erro de previsão antes de confiar além do intervalo. Plote resíduos, não apenas uma reta bonita. Pequeno desvio sistemático fica caro ao atravessar ordens de grandeza.
Loss não é o produto inteiro. Modelos com validation loss parecida diferem em tarefas downstream, calibração, safety, cobertura multilíngue, latency e memória. Thresholds aparentemente emergentes podem surgir quando uma capacidade suave cruza a regra de pontuação. A curva guia alocação; não substitui avaliação.
Qualidade de dados complica o eixo . Um token não é unidade padrão de informação. Boilerplate repetido, texto ruim e domínio valioso contam igualmente, mas contribuem de formas distintas. Tamanho efetivo depende de duplicação e mixture. Experimentos precisam manter o pipeline estável ou modelar a mudança.
O workflow prático escolhe vários tamanhos e budgets de tokens, mantém receitas comparáveis, reserva validação, registra compute realizado, ajusta formas concorrentes, valida em runs separadas, quantifica incerteza e seleciona o próximo experimento. Refaça o fit quando dados ou arquitetura mudarem.
O insight durável é previsibilidade com fronteiras. Loss pode seguir tendências suaves e tornar ciência empírica útil para decisões enormes. A lição igualmente importante é humildade: a curva descreve um regime. A próxima aula mostra como outro desenho experimental mudou a alocação recomendada.
2
Como explicar para uma criança de cinco anos
Um estaleiro testa cascos pequenos num tanque e ajusta curvas entre tamanho, motor e arrasto. As curvas ajudam a escolher o protótipo seguinte, mas não são leis naturais para todo oceano e material. Scaling laws fazem isso com modelos: experimentos controlados revelam tendências suaves de loss, e extrapolar vira instrumento de orçamento com barras de erro.
3
Ensine de volta
Explique o que é uma neural scaling law, o que Kaplan et al. variaram e por que os expoentes não são constantes universais.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Scaling law é um ajuste empírico, muitas vezes power-law, ligando held-out loss a parâmetros, dados ou compute num regime medido. Kaplan et al. treinaram famílias autoregressivas e observaram tendências suaves e uma alocação compute-optimal que favorecia modelos maiores com relativamente menos tokens. Expoentes dependem de dataset, tokenizer, arquitetura, optimizer, loss e intervalo do fit, então evidência posterior pode gerar outro ótimo.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Jared Kaplan et al. (2020). Scaling Laws for Neural Language Models.