Trilha de aprendizagem
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- 06.01Objetivos: causal LM, MLM, span corruption, FIM→
- 06.02Dados: origem, filtragem, dedup, descontaminação→
- 06.03Treinando seu próprio tokenizer→
- 06.04Scaling laws I: Kaplan→
- 06.05Scaling laws II: Chinchilla e compute-optimality→
- 06.06Scaling laws III: inference-aware e over-training→
- 06.07Data parallelism, ZeRO e FSDP→
- 06.08Tensor, pipeline e sequence parallelism→
- 06.09Mixed precision: fp16, bf16, fp8→
- 06.10Gradient checkpointing e a matemática da memória→
- 06.11Schedules de learning rate e warmup→
- 06.12Quando o treino dá errado: spikes, divergência, NaNs→
- 06.13Quanto custa de verdade uma run de pretraining→