Avançado
Distillation: modelos pequenos jogando acima do peso
Knowledge distillation treina um student menor com saídas de um teacher, transferindo comportamento útil dentro dos limites de capacidade do modelo pequeno.
Atualizada em
1
Conceito
Modelos grandes podem produzir dados valiosos para modelos menores. Knowledge distillation treina um student para imitar sinais de um teacher, buscando preservar comportamento útil com menos memória, latência ou custo. Distillation não é compressão de arquivo: o student tem outra parametrização e aprende uma aproximação sobre uma distribuição escolhida de entradas.
A forma clássica usa logits do teacher. Para uma entrada, o teacher produz uma distribuição de probabilidade sobre classes ou tokens. Uma temperature suaviza a distribuição e expõe probabilidades de alternativas. O student minimiza uma divergência entre as distribuições, normalmente combinada à loss comum dos rótulos reais:
As probabilidades fora do alvo carregam relações. Se o teacher atribui probabilidade moderada a dois tokens semanticamente próximos e quase nenhuma a irrelevantes, o student aprende mais do que uma resposta one-hot revela. Temperature e escalas variam; a fórmula é um template comum, não a única implementação.
Para teachers fechados cujos logits não estão disponíveis, sequence distillation usa saídas geradas como alvos supervisionados. O teacher responde a prompts curados; as saídas são filtradas, verificadas ou ranqueadas; o student executa SFT nas conversas. O teacher também pode gerar explicações, tool traces, pares de preferência, críticas ou candidatas diversas. Nesse cenário, geração e validação de dados se tornam o núcleo do algoritmo.
A cobertura dos prompts define o comportamento transferido. Um currículo de aritmética pode melhorar aritmética e não tocar instruction following multilíngue. Prompts fáceis saturam sem ensinar a fronteira de decisão. Prompts difíceis viram ruído quando o teacher falha ou o student não tem capacidade. Geração adaptativa procura casos de discordância ou aqueles em que verificação externa separa estratégias bem-sucedidas.
Saídas do teacher não são ground truth. Hallucinations, instruções inseguras, bias cultural, prolixidade e manias de formatação podem ser copiados. Filtrar tudo pelo mesmo teacher cria aprovação circular. Pipelines fortes usam ferramentas externas, datasets confiáveis, judges independentes, auditoria humana e registros de proveniência. Dados sintéticos devem reter versão do teacher, decoding, origem do prompt, decisões de filtro e data.
Capacidade impõe um teto real. Um student menor aprende comportamento superficial frequente e perde conhecimento raro, long context, nuances multilíngues ou composição robusta. Médias de benchmark escondem perdas. Avalie por capacidade, dificuldade, idioma, limite de segurança e distribuição. Compare com um student treinado nos dados originais para atribuir o ganho ao sinal do teacher, e não apenas a tokens extras.
Distillation pode ser offline, com dataset sintético fixo, ou online, consultando o teacher enquanto o student muda. Dados offline são reproduzíveis e baratos para reutilizar, mas envelhecem. Ensino online mira erros atuais, porém custa mais e dificulta reprodução. Também é possível destilar features intermediárias quando arquiteturas e ativações são acessíveis, embora alinhar representações internas possa restringir demais uma geometria diferente.
Distillation complementa quantização e pruning. Destile primeiro e depois comprima; ou use o teacher durante quantization-aware training para recuperar qualidade. São problemas diferentes: distillation muda o que o modelo menor aprende, enquanto quantização muda como seus pesos e ativações são representados.
O modelo mental é transferência comportamental guiada por currículo. O teacher fornece alvos ricos, o student comprime padrões dentro de sua capacidade, e a avaliação revela o que sobreviveu. Um modelo pequeno “joga acima do peso” não porque contém secretamente o teacher, mas porque a supervisão escolhida aloca sua capacidade limitada aos comportamentos que mais importam.
2
Como explicar para uma criança de cinco anos
Uma mestre relojoeira não consegue colocar a oficina inteira numa maleta de viagem. Ela demonstra reparos representativos, explica pontos de decisão e deixa uma aprendiz praticar em falhas escolhidas. A maleta fica excelente para seus trabalhos sem conter todas as máquinas da oficina. Um student destilado comprime o comportamento do teacher em capacidade limitada; demonstrações e currículo decidem quais habilidades cabem na bagagem.
3
Ensine de volta
Diferencie logit distillation de sequence distillation e explique por que o student pode imitar erros do teacher ou perder capacidades raras.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Logit distillation treina o student contra a distribuição de probabilidades do teacher, cujas probabilidades fora do alvo revelam semelhança entre alternativas. Sequence distillation treina em respostas amostradas ou selecionadas do teacher, muitas vezes quando logits não estão disponíveis. Os dois mostram apenas o comportamento nos prompts escolhidos. Se o teacher erra, o alvo sintético reproduz o erro; se habilidades raras faltam no currículo ou excedem a capacidade do student, elas não serão transferidas com confiabilidade.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Geoffrey Hinton, Oriol Vinyals e Jeff Dean (2015). Distilling the Knowledge in a Neural Network.