Fundamentos
Embeddings: significado como geometria
Embeddings substituem IDs arbitrários por vetores aprendidos cujas relações permitem generalização útil.
Atualizada em
1
Conceito
Um tokenizer emite inteiros, mas seus valores são arbitrários. Alimentar o ID 742 como número escalar sugeriria uma distância falsa: o token 743 pareceria mais próximo do que o 20. Uma matriz de embedding resolve isso atribuindo a cada item do vocabulário um vetor aprendido. Consultar um token seleciona uma linha e produz features contínuas para as camadas seguintes combinarem e transformarem.
Se o vocabulário tem tamanho e largura , a matriz tem shape . Multiplicar um vetor one-hot de tamanho pela matriz devolve a linha selecionada, embora implementações usem indexação direta. Durante o treinamento, gradientes atualizam as linhas envolvidas e os demais pesos. Nenhuma definição de dicionário é inserida numa coordenada.
Por que a geometria se torna útil? Tokens presentes em contextos que exigem previsões parecidas recebem sinais de aprendizagem relacionados. Se “gato” e “cachorro” aparecem em posições gramaticais e tópicas comparáveis, updates tornam suas representações úteis de modos semelhantes. Coordenadas distribuídas permitem compartilhar força estatística: uma feature aprendida com um item transfere-se a outro sem regras separadas para cada par.
A geometria oferece lentes diferentes. Distância euclidiana mede separação em linha reta. Similaridade de cosseno compara direções após normalizar comprimentos. Produto escalar mistura direção e magnitude. Vizinhos dependem da métrica e do pré-processamento. Projetar centenas de dimensões em duas ou três com PCA, t-SNE ou UMAP introduz distorção; clusters aparentes são hipóteses, não mapas exatos do espaço original.
O sentido de um embedding é relacional e dependente do objetivo. Um embedding de language model pode enfatizar substituição útil à previsão. Um embedding de retrieval treinado com perguntas e passagens pode aproximar textos complementares. Um embedding multimodal alinha legendas e imagens. Chamar tudo de “similaridade semântica” esconde contratos diferentes. Avalie vizinhos e retrieval na tarefa que a representação pretende apoiar.
Embeddings estáticos enfrentam polissemia. A linha de “banco” é a mesma em “banco da praça” e “empréstimo do banco”. Camadas contextuais produzem estados diferentes ao misturar informação ao redor. Modelos modernos contêm vários espaços: tabela inicial, residual states de cada camada, projeções de attention e estados finais de previsão. “O embedding” é ambíguo; nomeie a camada e o pooling.
Vieses dos dados aparecem na geometria. Associações entre profissões, identidades, sentimento ou dialeto podem refletir desigualdades e estereótipos. Remover uma direção visível não garante apagar o viés, pois a informação pode ser não linear e distribuída. Riscos de privacidade também permanecem: ser numérico não torna um embedding anônimo, especialmente se ligado a texto raro ou a serviço reversível.
A ideia durável não é que o significado viva literalmente num mapa perfeito. Vetores aprendidos levam símbolos discretos a um espaço onde transformações compartilhadas e relações graduais são possíveis. IDs escolhem linhas; o treino molda a geometria; contexto remodela estados; métricas revelam relações específicas. Embeddings são interfaces poderosas entre símbolos e compute neural, mas sua interpretação precisa estar ligada a dados, objetivo, camada e avaliação.
Ao apresentar vizinhos, inclua frequência e norma dos vetores. Um token pode aparecer perto por artefato de escala ou corpus, e uma projeção 3D pode separar pontos próximos no espaço original. A visualização deve declarar técnica e distorção relevante.
2
Como explicar para uma criança de cinco anos
Uma loja organiza peças numa parede de coordenadas ajustáveis: elétrica versus mecânica, interna versus externa, rígida versus flexível, comum versus especializada. Parafuso e porca podem ficar próximos sem compartilhar um rótulo. O espaço de embedding funciona assim, mas os eixos são aprendidos e raramente nomeáveis. Proximidade significa que o objetivo encontrou usos semelhantes, não que uma curadora escreveu definições iguais.
3
Ensine de volta
Explique como o lookup de embedding difere do ID e por que proximidade geométrica é útil, mas não define completamente significado.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
O ID é um índice arbitrário de linha. O lookup devolve o vetor aprendido nessa linha, oferecendo features contínuas que a rede transforma. Tokens usados em contextos preditivos parecidos podem adquirir direções ou vizinhanças relacionadas, permitindo transferência. Distância depende de objetivo, dados, escala e métrica; um vetor estático também não expressa todos os sentidos contextuais. A geometria evidencia usos aprendidos, não uma teoria semântica completa.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin (2003). A Neural Probabilistic Language Model.