Fundamentos

Embeddings: significado como geometria

Embeddings substituem IDs arbitrários por vetores aprendidos cujas relações permitem generalização útil.

Atualizada em

1

Conceito

Um tokenizer emite inteiros, mas seus valores são arbitrários. Alimentar o ID 742 como número escalar sugeriria uma distância falsa: o token 743 pareceria mais próximo do que o 20. Uma matriz de embedding resolve isso atribuindo a cada item do vocabulário um vetor aprendido. Consultar um token seleciona uma linha e produz features contínuas para as camadas seguintes combinarem e transformarem.

Se o vocabulário tem tamanho VV e largura dd, a matriz tem shape V×dV\times d. Multiplicar um vetor one-hot de tamanho VV pela matriz devolve a linha selecionada, embora implementações usem indexação direta. Durante o treinamento, gradientes atualizam as linhas envolvidas e os demais pesos. Nenhuma definição de dicionário é inserida numa coordenada.

Por que a geometria se torna útil? Tokens presentes em contextos que exigem previsões parecidas recebem sinais de aprendizagem relacionados. Se “gato” e “cachorro” aparecem em posições gramaticais e tópicas comparáveis, updates tornam suas representações úteis de modos semelhantes. Coordenadas distribuídas permitem compartilhar força estatística: uma feature aprendida com um item transfere-se a outro sem regras separadas para cada par.

A geometria oferece lentes diferentes. Distância euclidiana mede separação em linha reta. Similaridade de cosseno compara direções após normalizar comprimentos. Produto escalar mistura direção e magnitude. Vizinhos dependem da métrica e do pré-processamento. Projetar centenas de dimensões em duas ou três com PCA, t-SNE ou UMAP introduz distorção; clusters aparentes são hipóteses, não mapas exatos do espaço original.

O sentido de um embedding é relacional e dependente do objetivo. Um embedding de language model pode enfatizar substituição útil à previsão. Um embedding de retrieval treinado com perguntas e passagens pode aproximar textos complementares. Um embedding multimodal alinha legendas e imagens. Chamar tudo de “similaridade semântica” esconde contratos diferentes. Avalie vizinhos e retrieval na tarefa que a representação pretende apoiar.

Embeddings estáticos enfrentam polissemia. A linha de “banco” é a mesma em “banco da praça” e “empréstimo do banco”. Camadas contextuais produzem estados diferentes ao misturar informação ao redor. Modelos modernos contêm vários espaços: tabela inicial, residual states de cada camada, projeções de attention e estados finais de previsão. “O embedding” é ambíguo; nomeie a camada e o pooling.

Vieses dos dados aparecem na geometria. Associações entre profissões, identidades, sentimento ou dialeto podem refletir desigualdades e estereótipos. Remover uma direção visível não garante apagar o viés, pois a informação pode ser não linear e distribuída. Riscos de privacidade também permanecem: ser numérico não torna um embedding anônimo, especialmente se ligado a texto raro ou a serviço reversível.

A ideia durável não é que o significado viva literalmente num mapa perfeito. Vetores aprendidos levam símbolos discretos a um espaço onde transformações compartilhadas e relações graduais são possíveis. IDs escolhem linhas; o treino molda a geometria; contexto remodela estados; métricas revelam relações específicas. Embeddings são interfaces poderosas entre símbolos e compute neural, mas sua interpretação precisa estar ligada a dados, objetivo, camada e avaliação.

Ao apresentar vizinhos, inclua frequência e norma dos vetores. Um token pode aparecer perto por artefato de escala ou corpus, e uma projeção 3D pode separar pontos próximos no espaço original. A visualização deve declarar técnica e distorção relevante.

2

Como explicar para uma criança de cinco anos

Uma loja organiza peças numa parede de coordenadas ajustáveis: elétrica versus mecânica, interna versus externa, rígida versus flexível, comum versus especializada. Parafuso e porca podem ficar próximos sem compartilhar um rótulo. O espaço de embedding funciona assim, mas os eixos são aprendidos e raramente nomeáveis. Proximidade significa que o objetivo encontrou usos semelhantes, não que uma curadora escreveu definições iguais.

3

Ensine de volta

Explique como o lookup de embedding difere do ID e por que proximidade geométrica é útil, mas não define completamente significado.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

O ID é um índice arbitrário de linha. O lookup devolve o vetor aprendido nessa linha, oferecendo features contínuas que a rede transforma. Tokens usados em contextos preditivos parecidos podem adquirir direções ou vizinhanças relacionadas, permitindo transferência. Distância depende de objetivo, dados, escala e métrica; um vetor estático também não expressa todos os sentidos contextuais. A geometria evidencia usos aprendidos, não uma teoria semântica completa.

4

Teste seu entendimento

1. Qual operação recupera o embedding inicial de um token?
Resposta e explicação

Selecionar a linha da matriz indicada pelo ID — O lookup equivale a multiplicar one-hot pela matriz, mas indexação direta é mais eficiente.

2. Por que dois tokens podem ficar próximos no espaço?
Resposta e explicação

O treino encontrou usos preditivos relacionados — A geometria reflete corpus e objetivo, não a ordem dos IDs nem somente a grafia.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin (2003). A Neural Probabilistic Language Model.