Fundamentos
Entropia, perplexidade e o que significa 'bom'
Entropia mede incerteza, cross-entropy pontua probabilidade atribuída e perplexidade resume surpresa média por token.
Atualizada em
1
Conceito
Teoria da informação transforma probabilidade em medida de surpresa. Um evento com probabilidade tem informação : eventos prováveis surpreendem pouco; improváveis carregam mais informação quando acontecem. A base do log escolhe a unidade. Base dois produz bits; log natural, nats. Bibliotecas de machine learning normalmente usam log natural.
A entropia de uma distribuição discreta é a surpresa esperada:
Uma distribuição concentrada num resultado tem entropia zero. Uma distribuição uniforme sobre muitos resultados tem entropia maior. Entropia descreve incerteza da própria distribuição. Não é automaticamente desordem no sentido cotidiano, nem valor alto indica modelo ruim quando a situação é genuinamente ambígua.
Para avaliar uma distribuição do modelo sobre resultados de , usamos cross-entropy:
Num dataset finito, o próximo token observado representa a distribuição dos dados. Tiramos a média do negative log da probabilidade atribuída a cada token correto. Essa é a mean negative log-likelihood, a loss conhecida do treinamento. Dar probabilidade minúscula ao observado gera penalidade grande; dar probabilidade alta gera penalidade pequena.
Cross-entropy se decompõe como . O primeiro termo é incerteza inerente aos dados; KL divergence é o custo extra de usar no lugar de . Não conhecemos exatamente a distribuição real da língua, e um corpus de teste é apenas amostra, mas a decomposição mostra por que nem o modelo perfeito elimina ambiguidade genuína.
Perplexidade exponencia a cross-entropy média. Com log natural, . Se em cada passo o modelo enfrentasse escolha uniforme entre tokens, a perplexidade seria . Distribuições reais não são uniformes; “fator efetivo de ramificação” é intuição, não contagem literal. Perplexidade menor indica mais probabilidade para os tokens observados sob aquele protocolo.
A comparabilidade tem fronteiras rígidas. Perplexidade depende de dataset, tokenização, tokens de começo e fim, comprimento do contexto, janela deslizante e posições mascaradas na loss. Um tokenizer que divide o texto de outra forma muda os eventos da média. Números de vocabulários diferentes não podem ser ordenados ingenuamente. Medidas normalizadas por byte ou caractere ajudam, mas exigem definição explícita.
Vazamento de dados pode produzir perplexidade enganadoramente baixa. Texto de avaliação duplicado no treinamento testa memória e generalização misturadas. Domain mismatch faz um modelo forte parecer fraco para a aplicação ou o inverso. Incerteza estatística importa em diferenças pequenas. Relate proveniência, contagem de tokens, versões de modelo e tokenizer, política de contexto e precisão suficiente para apoiar, não exagerar, a conclusão.
Por fim, ajuste preditivo não esgota o sentido de “bom”. Um modelo com perplexidade menor ainda pode seguir instruções mal, alucinar, reproduzir viés ou custar demais. Pós-treinamento melhora comportamento de assistente e altera métricas de base de formas complexas. Perplexidade responde a uma pergunta estreita: quanto estes tokens surpreenderam o modelo? Seu valor vem justamente de não confundir essa resposta com alegações amplas de utilidade e confiabilidade.
Ao relatar a medida, inclua a loss média antes da exponenciação. Isso evita arredondamentos escondidos, permite recomputar perplexidade na base correta e torna diferenças pequenas mais fáceis de analisar com incerteza estatística.
2
Como explicar para uma criança de cinco anos
Uma chaveira testa chaves numa sequência de portas. Uma guia confiante e correta aponta quase uma chave por porta; outra espalha crença entre muitas. Cross-entropy cobra a guia conforme a probabilidade que ela deu à chave que realmente abriu cada porta. Perplexidade converte a cobrança média num número efetivo de chaves igualmente plausíveis. A comparação só é justa quando as guias enfrentam as mesmas portas cortadas nas mesmas peças de token.
3
Ensine de volta
Conecte entropia, cross-entropy, negative log-likelihood e perplexidade e diga por que tokenizers diferentes impedem comparação direta.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Entropia é a surpresa esperada numa distribuição. Cross-entropy calcula a média do negative log da probabilidade que q atribui aos resultados de p; num dataset, vira mean negative log-likelihood. Perplexidade exponencia essa média, fornecendo um fator efetivo de ramificação por token. Tokenizers definem eventos e comprimentos diferentes, então a surpresa por token muda com a segmentação; comparação justa exige os mesmos tokens, dados e protocolo.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Claude E. Shannon (1948). A Mathematical Theory of Communication.