Trilha de aprendizagem
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- 07.01Por que base models não são assistentes→
- 07.02Supervised fine-tuning e dados de instrução→
- 07.03LoRA, QLoRA e PEFT→
- 07.04Reward models e preference data humana→
- 07.05RLHF com PPO→
- 07.06DPO: pulando o reward model→
- 07.07ORPO, KTO, SimPO e o zoológico do alinhamento→
- 07.08GRPO e RL sobre recompensas verificáveis→
- 07.09Modelos de raciocínio: computação em tempo de teste e long CoT→
- 07.10Constitutional AI e RLAIF→
- 07.11Distillation: fazendo modelos pequenos brigarem acima do peso→