Essencial
Positional encoding III: ALiBi e relative bias
Relative position biases modificam diretamente os logits de attention, expressando preferências de distância sem vetores absolutos.
Atualizada em
1
Conceito
Informação de posição não precisa ser somada a embeddings nem codificada por rotações. Ela pode alterar a própria pontuação de attention. Métodos de relative-position bias dizem: “depois de avaliar a compatibilidade de conteúdo, ajuste a pontuação segundo distância e direção entre posições”.
Se é a pontuação de conteúdo da query para a key , a camada usa
Softmax normaliza as pontuações ajustadas. Como o bias entra antes, altera probabilidades de roteamento sem mudar o payload dos values. A função pode ser fixa ou aprendida, exata ou agrupada, compartilhada ou específica por head.
T5 usa biases aprendidos com buckets. Offsets pequenos recebem buckets distintos, enquanto distâncias maiores são agrupadas de forma mais grossa. O modelo aprende um bias por bucket e head. A escolha contém uma hipótese útil: a diferença exata entre um e dois tokens pode importar mais que entre 1.001 e 1.002. O agrupamento também limita o número de parâmetros.
ALiBi, Attention with Linear Biases, aplica uma regra fixa simples. Em attention causal, cada head recebe uma penalidade negativa que cresce linearmente para o passado:
O slope varia entre heads. Um slope íngreme favorece keys próximas; um suave tolera longo alcance. Conteúdo pode superar a penalidade quando uma key distante é compatível o bastante. ALiBi não impõe uma janela rígida, e sim um prior gradual de recência.
Diferentemente de uma tabela absoluta, ALiBi calcula bias para distâncias maiores que as vistas sem alocar novas linhas. Os autores demonstraram extrapolação de comprimento em seus experimentos, origem do título “train short, test long”. A interpretação exige cuidado. Estar matematicamente definido em comprimentos maiores é necessário, mas não suficiente para raciocínio robusto. Dados, otimização, padrões de attention e tarefa de avaliação também importam.
Relative biases oferecem separação conceitual. Projeções de query e key perguntam “quão compatível é este conteúdo?”. O bias pergunta “como o deslocamento deve influenciar a compatibilidade?”. Embeddings absolutos misturam os fatores mais cedo no residual stream. Nenhuma interface é universalmente superior; elas apresentam inductive biases distintos.
Direção importa. Num encoder bidirecional, offsets e podem usar buckets diferentes. Num decoder causal, keys futuras já estão proibidas, restando a distância no passado. Máscaras de padding e de fronteira ainda são necessárias; bias relativo não impede leitura de tokens inválidos.
Comparar esquemas exige mais que uma métrica longa. Verifique qualidade em contexto curto, perplexity por comprimento, recuperação em distâncias variadas, repetição e memória. RoPE representa fase relativa com frequências ricas; ALiBi fornece recência monotônica por head; buckets aprendidos adaptam padrões flexíveis, porém finitos.
Também inspecione exemplos em que duas ocorrências idênticas aparecem a distâncias diferentes. Essa comparação separa a compatibilidade de conteúdo da preferência posicional e deixa claro quando um bias local vence uma key semanticamente forte. O experimento é simples, mas evita confundir uma matriz visualmente diagonal com compreensão real da sequência.
O quadro durável é pontuação de conteúdo mais prior posicional. Em vez de carimbar cada token com endereço, relative bias altera o preço da comunicação entre posições e deixa a localidade visível na matriz de attention.
2
Como explicar para uma criança de cinco anos
Um operador de rádio classifica mensagens por relevância e depois desconta um pedágio por quilômetro entre emissor e receptor. Canais distintos cobram tarifas diferentes: um favorece muito relatos próximos, outro aceita estações distantes. O conteúdo define a pontuação base; a tarifa de distância adiciona uma preferência previsível. ALiBi é esse pedágio nos logits de attention.
3
Ensine de volta
Compare ALiBi, relative-position bias aprendido e embeddings de posição absoluta.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
ALiBi adiciona aos logits uma penalidade linear fixa, específica de cada head e proporcional à distância. Relative bias aprendido também altera logits, mas consulta um valor treinado por offset ou bucket. Embeddings absolutos somam um vetor de posição às representações. Biases nos logits tornam localidade explícita e evitam uma tabela absoluta fixa, embora extrapolação ainda dependa do sistema treinado.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Ofir Press, Noah A. Smith e Mike Lewis (2022). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation.
- Colin Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.