Essencial

Positional encoding III: ALiBi e relative bias

Relative position biases modificam diretamente os logits de attention, expressando preferências de distância sem vetores absolutos.

Atualizada em

1

Conceito

Informação de posição não precisa ser somada a embeddings nem codificada por rotações. Ela pode alterar a própria pontuação de attention. Métodos de relative-position bias dizem: “depois de avaliar a compatibilidade de conteúdo, ajuste a pontuação segundo distância e direção entre posições”.

Se sij=qikj/dks_{ij}=q_i\cdot k_j/\sqrt{d_k} é a pontuação de conteúdo da query ii para a key jj, a camada usa

s~ij=sij+b(i,j).\tilde{s}_{ij}=s_{ij}+b(i,j).

Softmax normaliza as pontuações ajustadas. Como o bias entra antes, altera probabilidades de roteamento sem mudar o payload dos values. A função bb pode ser fixa ou aprendida, exata ou agrupada, compartilhada ou específica por head.

T5 usa biases aprendidos com buckets. Offsets pequenos recebem buckets distintos, enquanto distâncias maiores são agrupadas de forma mais grossa. O modelo aprende um bias por bucket e head. A escolha contém uma hipótese útil: a diferença exata entre um e dois tokens pode importar mais que entre 1.001 e 1.002. O agrupamento também limita o número de parâmetros.

ALiBi, Attention with Linear Biases, aplica uma regra fixa simples. Em attention causal, cada head recebe uma penalidade negativa que cresce linearmente para o passado:

bh(i,j)=mh(ij),ji.b_h(i,j)=-m_h(i-j),\qquad j\le i.

O slope mhm_h varia entre heads. Um slope íngreme favorece keys próximas; um suave tolera longo alcance. Conteúdo pode superar a penalidade quando uma key distante é compatível o bastante. ALiBi não impõe uma janela rígida, e sim um prior gradual de recência.

Diferentemente de uma tabela absoluta, ALiBi calcula bias para distâncias maiores que as vistas sem alocar novas linhas. Os autores demonstraram extrapolação de comprimento em seus experimentos, origem do título “train short, test long”. A interpretação exige cuidado. Estar matematicamente definido em comprimentos maiores é necessário, mas não suficiente para raciocínio robusto. Dados, otimização, padrões de attention e tarefa de avaliação também importam.

Relative biases oferecem separação conceitual. Projeções de query e key perguntam “quão compatível é este conteúdo?”. O bias pergunta “como o deslocamento deve influenciar a compatibilidade?”. Embeddings absolutos misturam os fatores mais cedo no residual stream. Nenhuma interface é universalmente superior; elas apresentam inductive biases distintos.

Direção importa. Num encoder bidirecional, offsets 3-3 e +3+3 podem usar buckets diferentes. Num decoder causal, keys futuras já estão proibidas, restando a distância no passado. Máscaras de padding e de fronteira ainda são necessárias; bias relativo não impede leitura de tokens inválidos.

Comparar esquemas exige mais que uma métrica longa. Verifique qualidade em contexto curto, perplexity por comprimento, recuperação em distâncias variadas, repetição e memória. RoPE representa fase relativa com frequências ricas; ALiBi fornece recência monotônica por head; buckets aprendidos adaptam padrões flexíveis, porém finitos.

Também inspecione exemplos em que duas ocorrências idênticas aparecem a distâncias diferentes. Essa comparação separa a compatibilidade de conteúdo da preferência posicional e deixa claro quando um bias local vence uma key semanticamente forte. O experimento é simples, mas evita confundir uma matriz visualmente diagonal com compreensão real da sequência.

O quadro durável é pontuação de conteúdo mais prior posicional. Em vez de carimbar cada token com endereço, relative bias altera o preço da comunicação entre posições e deixa a localidade visível na matriz de attention.

2

Como explicar para uma criança de cinco anos

Um operador de rádio classifica mensagens por relevância e depois desconta um pedágio por quilômetro entre emissor e receptor. Canais distintos cobram tarifas diferentes: um favorece muito relatos próximos, outro aceita estações distantes. O conteúdo define a pontuação base; a tarifa de distância adiciona uma preferência previsível. ALiBi é esse pedágio nos logits de attention.

3

Ensine de volta

Compare ALiBi, relative-position bias aprendido e embeddings de posição absoluta.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

ALiBi adiciona aos logits uma penalidade linear fixa, específica de cada head e proporcional à distância. Relative bias aprendido também altera logits, mas consulta um valor treinado por offset ou bucket. Embeddings absolutos somam um vetor de posição às representações. Biases nos logits tornam localidade explícita e evitam uma tabela absoluta fixa, embora extrapolação ainda dependa do sistema treinado.

4

Teste seu entendimento

1. Onde ALiBi injeta informação de posição?
Resposta e explicação

Nos logits de attention como bias dependente da distância — ALiBi ajusta a compatibilidade query–key antes de softmax.

2. Por que usar slopes diferentes entre heads?
Resposta e explicação

Para oferecer várias preferências de distância — Slopes íngremes favorecem contexto local; slopes suaves aceitam relativamente mais informação distante.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Ofir Press, Noah A. Smith e Mike Lewis (2022). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation.
  2. Colin Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.