Fundamentos

Vetores, matrizes e produtos escalares

Vetores guardam features, matrizes organizam transformações e produtos escalares medem evidência ponderada alinhada.

Atualizada em

1

Conceito

Um vetor é uma lista ordenada de números. A ordem importa: (2,5)(2,5) não representa o mesmo vetor que (5,2)(5,2). Na geometria, vetores de duas ou três dimensões descrevem direção e comprimento. Em machine learning, um vetor pode ter centenas ou milhares de coordenadas e representar um token, um trecho de imagem, um estado oculto ou um gradiente. Não conseguimos desenhar todas as dimensões, mas a aritmética continua igual.

Vetores podem ser somados componente a componente e multiplicados por um escalar. Se a=(1,2)a=(1,2) e b=(3,1)b=(3,-1), então a+b=(4,1)a+b=(4,1). Multiplicar aa por três produz (3,6)(3,6). O comprimento euclidiano, ou norma, é a=12+22\lVert a\rVert=\sqrt{1^2+2^2}. O comprimento costuma expressar magnitude, enquanto a direção captura o padrão relativo entre coordenadas. Redes neurais remodelam os dois continuamente.

O produto escalar combina dois vetores de mesmo tamanho num único escalar:

ab=iaibi.a\cdot b=\sum_i a_i b_i.

Para os vetores acima, ab=1×3+2×(1)=1a\cdot b=1\times3+2\times(-1)=1. Cada par oferece evidência positiva quando os sinais concordam e negativa quando se opõem. Geometricamente, ab=abcosθa\cdot b=\lVert a\rVert\lVert b\rVert\cos\theta. Direções semelhantes geram valor positivo; vetores perpendiculares, zero; direções opostas, valor negativo.

Essa interpretação pede um cuidado. O produto escalar bruto mistura direção e comprimento. Dois vetores podem pontuar alto porque se alinham, porque têm normas grandes ou pelos dois motivos. A similaridade de cosseno divide pelas normas e isola a direção: (ab)/(ab)(a\cdot b)/(\lVert a\rVert\lVert b\rVert). Aplicações de embeddings às vezes usam cosseno, enquanto attention emprega produtos escalares escalados e preserva magnitudes no cálculo aprendido.

Uma matriz é um arranjo retangular de números, com formato linhas por colunas. Uma matriz 3×43\times4 mapeia uma entrada de quatro componentes para uma saída de três. Cada coordenada de saída é o produto escalar de uma linha da matriz com a entrada. Por isso, a multiplicação matriz-vetor é central: ela calcula simultaneamente muitas somas ponderadas aprendidas.

Shapes formam um sistema prático de tipos. Uma matriz m×nm\times n multiplicada por um vetor com nn componentes produz um vetor com mm. As dimensões internas precisam coincidir. Em batches, linhas frequentemente armazenam exemplos ou posições de tokens; uma matriz XX de sequência por features multiplica pesos de features por saídas. Anotar shapes ao lado das equações evita muitos bugs antes de executar código.

Features neurais raramente são faders com nomes humanos. Uma coordenada participa de vários padrões, e um conceito pode estar distribuído por muitas coordenadas. Uma rotação do sistema preserva relações enquanto muda valores individuais. Assim, inspecionar uma única dimensão dificilmente revela um rótulo semântico limpo. A geometria é mais útil por relações: distâncias, direções, subespaços, projeções e efeitos das transformações aprendidas.

A ponte para modelos de linguagem é direta. Uma busca na tabela de embedding devolve um vetor por ID. Matrizes de projeção transformam estados em queries, keys, values ou logits. Produtos escalares query-key criam pontuações de attention. Gradientes são vetores de mudança local da loss. Ao enxergar vetores como estados, matrizes como mapas aprendidos e produtos escalares como alinhamento ponderado, boa parte do Transformer vira álgebra linear repetida com não linearidades bem posicionadas.

2

Como explicar para uma criança de cinco anos

Imagine uma engenheira de som descrevendo cada gravação com três faders: graves, médios e agudos. As posições formam um vetor. Outro vetor registra a preferência de uma ouvinte por essas faixas. O produto escalar vira uma pontuação de compatibilidade: alta quando features fortes coincidem com preferências fortes, baixa ou negativa quando se opõem. Uma matriz é a mesa de mixagem inteira que converte um conjunto de faders em outro.

3

Ensine de volta

Explique o papel de um vetor, uma matriz e um produto escalar e conecte cada ideia a uma operação de rede neural.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Um vetor é uma lista ordenada que representa um estado ou conjunto de features. Uma matriz é um arranjo retangular cujas linhas ou colunas armazenam vetores e cuja multiplicação define uma transformação linear. O produto escalar multiplica componentes correspondentes e os soma, produzindo alinhamento escalar. Attention usa produtos escalares entre queries e keys, enquanto matrizes de embedding e projeção transformam representações de tokens.

4

Teste seu entendimento

1. O que o produto escalar entre dois vetores de mesmo tamanho produz?
Resposta e explicação

Um escalar — Ele multiplica componentes correspondentes e soma os resultados num único número.

2. Se dois vetores não nulos são perpendiculares, qual é seu produto escalar?
Resposta e explicação

Zero — O cosseno de um ângulo reto é zero, portanto não há alinhamento direcional.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Ian Goodfellow, Yoshua Bengio e Aaron Courville (2016). Deep Learning.