Trilha de aprendizagem

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

07

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

  1. 07.01Por que base models não são assistentes
  2. 07.02Supervised fine-tuning e dados de instrução
  3. 07.03LoRA, QLoRA e PEFT
  4. 07.04Reward models e preference data humana
  5. 07.05RLHF com PPO
  6. 07.06DPO: pulando o reward model
  7. 07.07ORPO, KTO, SimPO e o zoológico do alinhamento
  8. 07.08GRPO e RL sobre recompensas verificáveis
  9. 07.09Modelos de raciocínio: computação em tempo de teste e long CoT
  10. 07.10Constitutional AI e RLAIF
  11. 07.11Distillation: fazendo modelos pequenos brigarem acima do peso