Trilha de aprendizagem
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
advanced · 13 aulas disponíveis
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- Objetivos: causal LM, MLM, span corruption e FIM
- Dados: origem, filtragem, deduplicação e decontamination
- Treinando seu próprio tokenizer
- Scaling laws I: Kaplan
- Scaling laws II: Chinchilla e compute-optimality
- Scaling laws III: inference-aware e over-training
- Data parallelism, ZeRO e FSDP
- Tensor, pipeline e sequence parallelism
- Mixed precision: fp16, bf16 e fp8
- Gradient checkpointing e matemática de memória
- Learning-rate schedules e warmup
- Quando o treinamento falha: spikes, divergence e NaNs
- Quanto custa um pretraining real