Fundamentos

Embeddings: significado como geometria

Uma tabela de embeddings transforma ids arbitrários de token em vetores aprendidos; no Qwen3.8-27B essa tabela é 248.320 por 5120, cerca de 1,271 bilhão de parâmetros, e como os embeddings não são compartilhados existe uma segunda matriz do mesmo tamanho na saída.

Atualizada em

01 · Conceito

Conceito

O tokenizer fez seu trabalho e entregou a você uma lista de inteiros. Agora aparece um problema fácil de não enxergar, porque a solução óbvia é tão errada que parece boa. Você poderia simplesmente alimentar a rede com esses inteiros como números. O token 742 entra como 742. Isso falha imediatamente e de forma instrutiva: afirma que o token 743 está mais perto de 742 do que o token 20 está, que o token 248.000 é enorme comparado ao token 5, e que a ordem arbitrária em que um algoritmo de merge numerou seus pedaços é uma escala semântica. Nada disso é verdade. Ids são rótulos, e rótulos não têm aritmética.

Uma matriz de embeddings conserta isso dando a cada entrada do vocabulário seu próprio vetor aprendido. Buscar um token significa selecionar uma linha, produzindo features contínuas que as camadas seguintes podem combinar, girar e misturar. Se o vocabulário tem tamanho VV e a largura oculta é dd, a matriz tem shape V×dV \times d. Multiplicar um vetor one-hot de comprimento VV por essa matriz devolve a linha selecionada, que é a descrição matemática arrumadinha; as implementações indexam direto, porque multiplicar por um quarto de milhão de zeros é um péssimo uso de uma GPU.

Ponha os números do nosso espécime e a escala dessa fronteira fica visível. O Qwen3.8-27B tem 248.320 linhas e hidden size de 5120. Faça a conta em duas partes para manter tudo legível: 248,320×5000=1,241,600,000248{,}320 \times 5000 = 1{,}241{,}600{,}000 e 248,320×120=29,798,400248{,}320 \times 120 = 29{,}798{,}400. Somando:

248,320×5120=1,271,398,4001.271 bilha˜o de paraˆmetros.248{,}320 \times 5120 = 1{,}271{,}398{,}400 \approx 1.271\ \text{bilhão de parâmetros}.

Mais de um bilhão de parâmetros, antes de o modelo ter executado uma única camada de computação. É isso que custa simplesmente ter opiniões sobre tokens individuais.

Agora o erro de caminho, que quase todo mundo comete porque quase todo tutorial comete. Muitos modelos de linguagem compartilham seus embeddings: a mesma matriz que transforma ids em vetores na entrada é reutilizada, transposta, para transformar o hidden state final em logits de vocabulário na saída. É uma economia elegante e é extremamente comum, então o passo natural é anotar 1,271 bilhão e seguir em frente. Confira a configuração em vez disso, como a lição 0.7 ensinou. O Qwen3.8-27B define tie_word_embeddings como false. O language-model head é uma matriz separada, com o mesmo shape 248.320 por 5120 e, portanto, mais uns 1,271 bilhão de parâmetros próprios.

1.271 B+1.271 B2.54 bilho˜es de paraˆmetros1.271\ \text{B} + 1.271\ \text{B} \approx 2.54\ \text{bilhões de parâmetros}

Cerca de um décimo do modelo inteiro está nessas duas matrizes, e uma estimativa que tivesse suposto compartilhamento estaria curta em mais de um bilhão de parâmetros — cerca de 2,5 gigabytes de pesos a dois bytes cada. É o tipo de erro que sobrevive à revisão porque o número errado é plausível, e é precisamente por isso que a lição 0.8 insistiu em ler a configuração em vez da convenção.

Por que a geometria se torna útil, afinal? Porque tokens que aparecem em contextos que exigem predições parecidas recebem sinais de aprendizado parecidos. Se duas palavras surgem repetidamente em posições gramaticais e temáticas comparáveis, as atualizações que ajudam uma tendem a ajudar a outra, e suas representações derivam para regiões relacionadas. Coordenadas distribuídas deixam a rede compartilhar força estatística em vez de aprender uma regra separada para cada par. Nada insere uma definição numa coordenada; a estrutura é resíduo de predição.

A geometria oferece várias lentes, e elas respondem a perguntas diferentes. A distância euclidiana mede a separação em linha reta. A similaridade de cosseno compara direção depois de dividir fora o comprimento, que é o que a lição 0.4 mostrou ser normalmente o que você quer quando as magnitudes variam. Um produto escalar cru mistura as duas coisas. Vizinhos mais próximos dependem da métrica escolhida e de qualquer pré-processamento, então uma visualização precisa declarar as duas coisas. Projetar 5120 dimensões para duas com PCA, t-SNE ou UMAP introduz distorção real, e um cluster aparente num gráfico desses é uma hipótese a testar, não um mapa do espaço.

O significado de um embedding também é relacional e dependente do objetivo. Um embedding de modelo de linguagem enfatiza a substituibilidade útil para prever o próximo token. Um embedding de retrieval treinado em pares de pergunta e passagem coloca textos complementares juntos, que é quase a relação oposta. Um embedding de alinhamento multimodal põe legendas perto de imagens. Chamar os três de similaridade semântica esconde três contratos diferentes, e isso importa concretamente para o nosso espécime, cuja torre de visão projeta patches de imagem no mesmo espaço de 5120 dimensões em que vivem os tokens de texto, como a lição 4.17 cobre.

Embeddings estáticos de token encaram a polissemia de frente. A linha de banco é idêntica bit a bit em banco de rio e em banco de investimento; só as camadas acima separam os dois estados. Então um modelo contém muitos espaços de representação, não um: a tabela de entrada, o estado residual de cada camada, as projeções de attention e o estado final que encontra a matriz de saída. Quando alguém disser o embedding, pergunte qual camada e qual pooling.

A ideia durável não é que o significado mora num mapa perfeito. É que vetores aprendidos convertem símbolos discretos num espaço onde transformações compartilhadas e relações graduais se tornam possíveis. Ids escolhem linhas, o treino molda a geometria, o contexto remodela os estados e as métricas expõem relações particulares. Dois bilhões e meio de parâmetros do Qwen3.8-27B existem para fazer essa tradução funcionar nos dois sentidos.

02 · Analogia

Analogia

Uma loja de ferragens organiza as peças ao longo de eixos ajustáveis que ninguém imprimiu numa placa: elétrico a mecânico, interno a externo, rígido a flexível, cotidiano a especializado. Um parafuso e um pino acabam perto um do outro sem dividir a mesma etiqueta de prateleira. Um espaço de embeddings funciona igual, só que os eixos foram ajustados por um otimizador em vez de escolhidos por um gerente, e a proximidade registra que o objetivo de treino achou dois tokens úteis de maneiras parecidas. Ninguém escreveu uma definição em lugar nenhum da parede.

03 · Explique de volta

Explique de volta

Explique o que uma busca de embedding faz, calcule o tamanho da tabela de embeddings do Qwen3.8-27B e diga por que embeddings não compartilhados mudam essa contabilidade.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Um id de token é um índice de linha arbitrário; a busca devolve o vetor aprendido guardado naquela linha, dando à rede features contínuas que ela pode transformar. O Qwen3.8-27B tem 248.320 linhas de tensor e hidden size 5120, então a tabela guarda 248.320 vezes 5120, o que dá 1.271.398.400 parâmetros, cerca de 1,271 bilhão. Muitos modelos compartilham o embedding de entrada e a projeção de saída para que uma matriz sirva às duas pontas, mas este modelo define tie_word_embeddings como false, então o language-model head é uma matriz separada de mesmo shape e aproximadamente os mesmos 1,271 bilhão de parâmetros. As duas juntas somam cerca de 2,54 bilhões de parâmetros, perto de um décimo do modelo inteiro, gastos inteiramente na fronteira entre ids de token e vetores.

04 · Teste seu entendimento

Teste seu entendimento

01O Qwen3.8-27B tem 248.320 linhas de tensor e hidden size 5120, e não compartilha seus embeddings. Quantos parâmetros ficam no embedding de entrada e na projeção de saída somados?
Resposta e explicação

Cerca de 2,54 bilhões — 248.320 vezes 5120 dá 1.271.398.400 para a tabela de embeddings. Como tie_word_embeddings é false, a projeção de saída é uma segunda matriz de mesmo shape, então o par custa aproximadamente 2,54 bilhões de parâmetros.

02Por que dois tokens podem acabar próximos no espaço de embeddings?
Resposta e explicação

O treino descobriu que seus usos preditivos são relacionados — A geometria reflete o objetivo e o corpus. Ordem de id e grafia não contribuem em nada, e proximidade registra substituibilidade sob predição, não sinonímia.

03A lição 1.4 mostrou que texto em português pode exigir mais tokens que seu equivalente em inglês. O que isso implica para as buscas de embedding desse texto?
Resposta e explicação

Mais linhas são buscadas e mais posições entram na rede, então o mesmo conteúdo custa mais trabalho em cada camada — Acontece uma busca por posição de token, então a fragmentação multiplica não só a fatura, mas toda operação subsequente que a sequência dispara.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin (2003). A Neural Probabilistic Language Model.
  2. John X. Morris et al. (2023). Text Embeddings Reveal (Almost) As Much As Text.
  3. Congzheng Song e Ananth Raghunathan (2020). Information Leakage in Embedding Models.
  4. Qwen Team (2026). Qwen3.8-27B Model Card.