Avançado

Dados: origem, filtragem, deduplicação e decontamination

Um corpus de pretraining é um pipeline governado cuja proveniência, qualidade, política de duplicatas e fronteiras de avaliação moldam o modelo.

Atualizada em

1

Conceito

Em escala, “o dataset” não é um arquivo. É uma sequência de decisões: de onde vieram documentos, se a coleta era autorizada, o que foi descartado, como duplicatas foram detectadas, como idiomas foram balanceados e qual versão chegou ao treinamento. Essas escolhas moldam comportamento tanto quanto arquitetura.

Sourcing começa pela proveniência. Cada documento precisa de ID estável e metadata de fonte, data de aquisição, idioma, licença ou base de permissão e método de coleta. Estar publicamente acessível não significa ser apropriado para qualquer uso. Políticas de robots, termos contratuais, dados pessoais, copyright e pedidos de remoção exigem governança explícita. Uma URL sozinha é proveniência fraca, pois seu conteúdo muda.

Filtragem remove material segundo política declarada. Checks mecânicos pegam arquivos vazios, parser quebrado, repetição extrema, lixo binário e distribuições improváveis de caracteres. Identificação de idioma permite roteamento e controle de mistura. Classificadores de qualidade ranqueiam documentos, mas herdam valores e vieses dos labels. Um filtro que privilegia um dialeto de prestígio pode apagar linguagem regional útil. Registre scores e thresholds.

Filtragem de segurança não é uma lista de palavras. Identificadores pessoais, secrets, malware, material de exploração sexual e outros conteúdos proibidos pedem camadas e restrições de acesso. Detectores têm falsos positivos e negativos. Revisão de alto risco precisa proteger revisores. Minimizar dados é mais forte que prometer que o modelo esquecerá conteúdo sensível depois.

Deduplicação reduz exemplos repetidos. Hashes exatos encontram documentos idênticos depois da canonicalização. Métodos near-duplicate com shingles, fingerprints ou locality-sensitive hashing acham páginas copiadas com pequenas edições. Decisões podem ocorrer dentro de uma fonte, entre fontes ou entre splits. A unidade importa: remover um livro inteiro porque um parágrafo-padrão de licença se repete seria excessivo.

Duplicatas distorcem pesos de sampling. Se um artigo aparece em mil espelhos, o optimizer o vê mil vezes. Isso incentiva memorização, reduz diversidade e cria leakage entre splits. O estudo de 2021 encontrou benefícios de deduplicação, mas o efeito exato depende do corpus e método. Preserve cluster e regra de representante.

Decontamination protege a avaliação. Ela busca no treino perguntas, respostas, testes de código ou variantes próximas do benchmark e exclui ou sinaliza overlaps. Matching exato perde paráfrases; fuzzy matching cria falsos positivos em frases comuns. Threshold, normalização, versão do benchmark e decisão pertencem ao resultado reportado.

Depois dos filtros, a mixture construction escolhe quanto vem de cada domínio e idioma. Volume bruto da web não deve decidir isso por acidente. Domínios pequenos e valiosos podem ser upsampled; fontes enormes e ruidosas podem ser limitadas. Upsampling aumenta repetição, então registre tokens e epochs efetivas por fonte.

Versione snapshot cru, texto normalizado, configuração dos filtros, clusters, relatório de decontamination, manifesto da mistura e tokenizer. Preserve contagens antes e depois de cada estágio sem reter amostras sensíveis desnecessárias. Um manifesto reproduzível deve permitir a outro operador autorizado reconstruir os IDs elegíveis.

Qualidade não é escalar. Cobertura, atualidade, legalidade, equilíbrio linguístico, segurança, duplicação e independência de avaliação entram em conflito. Um pipeline sério expõe tradeoffs. O modelo aprende a distribuição realmente fornecida, não a descrição publicada.

2

Como explicar para uma criança de cinco anos

Abastecer o reservatório de uma cidade não é abrir todos os canos. Engenheiros registram cada manancial, rejeitam derramamentos, removem recirculação repetida, deixam amostras de teste fora da água potável e mantêm um ledger para isolar uma fonte ruim. Um trilhão de tokens sem proveniência é um tanque enorme sem rótulo: o volume aparece, a adequação não.

3

Ensine de volta

Descreva um pipeline defensável e diferencie deduplicação de benchmark decontamination.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

O pipeline registra fonte, data de coleta, licença ou base de permissão, idioma, transformações e identidade; aplica filtros determinísticos de segurança e qualidade; remove duplicatas exatas e próximas; e versiona cada estágio. Deduplicação reduz conteúdo repetido dentro do treino. Decontamination compara candidatos com avaliações held-out e exclui overlaps que invalidariam a medição. Ambos exigem thresholds e logs de decisão.

4

Teste seu entendimento

1. Por que manter IDs estáveis de documentos?
Resposta e explicação

Para rastrear proveniência, remoções, duplicatas e splits — Identidade estável torna transformações auditáveis e permite rastrear ou remover problemas depois.

2. O que decontamination protege principalmente?
Resposta e explicação

A validade da avaliação held-out — Treinar em perguntas de benchmark ou variantes próximas pode medir memorização em vez de generalização.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Katherine Lee et al. (2021). Deduplicating Training Data Makes Language Models Better.
  2. Jesse Dodge et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.