Trilha de aprendizagem
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
advanced · 11 aulas disponíveis
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- Por que modelos base não são assistentes
- Supervised fine-tuning e dados de instruções
- LoRA, QLoRA e PEFT
- Reward models e dados de preferência humana
- RLHF com PPO
- DPO: sem o reward model
- ORPO, KTO, SimPO e o zoológico do alinhamento
- GRPO e RL com rewards verificáveis
- Modelos de reasoning: test-time compute e CoT longo
- Constitutional AI e RLAIF
- Distillation: modelos pequenos jogando acima do peso