Avançado
Dados: origem, filtragem, deduplicação e decontamination
Um corpus de pretraining é um pipeline governado cuja proveniência, qualidade, política de duplicatas e fronteiras de avaliação moldam o modelo.
Atualizada em
1
Conceito
Em escala, “o dataset” não é um arquivo. É uma sequência de decisões: de onde vieram documentos, se a coleta era autorizada, o que foi descartado, como duplicatas foram detectadas, como idiomas foram balanceados e qual versão chegou ao treinamento. Essas escolhas moldam comportamento tanto quanto arquitetura.
Sourcing começa pela proveniência. Cada documento precisa de ID estável e metadata de fonte, data de aquisição, idioma, licença ou base de permissão e método de coleta. Estar publicamente acessível não significa ser apropriado para qualquer uso. Políticas de robots, termos contratuais, dados pessoais, copyright e pedidos de remoção exigem governança explícita. Uma URL sozinha é proveniência fraca, pois seu conteúdo muda.
Filtragem remove material segundo política declarada. Checks mecânicos pegam arquivos vazios, parser quebrado, repetição extrema, lixo binário e distribuições improváveis de caracteres. Identificação de idioma permite roteamento e controle de mistura. Classificadores de qualidade ranqueiam documentos, mas herdam valores e vieses dos labels. Um filtro que privilegia um dialeto de prestígio pode apagar linguagem regional útil. Registre scores e thresholds.
Filtragem de segurança não é uma lista de palavras. Identificadores pessoais, secrets, malware, material de exploração sexual e outros conteúdos proibidos pedem camadas e restrições de acesso. Detectores têm falsos positivos e negativos. Revisão de alto risco precisa proteger revisores. Minimizar dados é mais forte que prometer que o modelo esquecerá conteúdo sensível depois.
Deduplicação reduz exemplos repetidos. Hashes exatos encontram documentos idênticos depois da canonicalização. Métodos near-duplicate com shingles, fingerprints ou locality-sensitive hashing acham páginas copiadas com pequenas edições. Decisões podem ocorrer dentro de uma fonte, entre fontes ou entre splits. A unidade importa: remover um livro inteiro porque um parágrafo-padrão de licença se repete seria excessivo.
Duplicatas distorcem pesos de sampling. Se um artigo aparece em mil espelhos, o optimizer o vê mil vezes. Isso incentiva memorização, reduz diversidade e cria leakage entre splits. O estudo de 2021 encontrou benefícios de deduplicação, mas o efeito exato depende do corpus e método. Preserve cluster e regra de representante.
Decontamination protege a avaliação. Ela busca no treino perguntas, respostas, testes de código ou variantes próximas do benchmark e exclui ou sinaliza overlaps. Matching exato perde paráfrases; fuzzy matching cria falsos positivos em frases comuns. Threshold, normalização, versão do benchmark e decisão pertencem ao resultado reportado.
Depois dos filtros, a mixture construction escolhe quanto vem de cada domínio e idioma. Volume bruto da web não deve decidir isso por acidente. Domínios pequenos e valiosos podem ser upsampled; fontes enormes e ruidosas podem ser limitadas. Upsampling aumenta repetição, então registre tokens e epochs efetivas por fonte.
Versione snapshot cru, texto normalizado, configuração dos filtros, clusters, relatório de decontamination, manifesto da mistura e tokenizer. Preserve contagens antes e depois de cada estágio sem reter amostras sensíveis desnecessárias. Um manifesto reproduzível deve permitir a outro operador autorizado reconstruir os IDs elegíveis.
Qualidade não é escalar. Cobertura, atualidade, legalidade, equilíbrio linguístico, segurança, duplicação e independência de avaliação entram em conflito. Um pipeline sério expõe tradeoffs. O modelo aprende a distribuição realmente fornecida, não a descrição publicada.
2
Como explicar para uma criança de cinco anos
Abastecer o reservatório de uma cidade não é abrir todos os canos. Engenheiros registram cada manancial, rejeitam derramamentos, removem recirculação repetida, deixam amostras de teste fora da água potável e mantêm um ledger para isolar uma fonte ruim. Um trilhão de tokens sem proveniência é um tanque enorme sem rótulo: o volume aparece, a adequação não.
3
Ensine de volta
Descreva um pipeline defensável e diferencie deduplicação de benchmark decontamination.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
O pipeline registra fonte, data de coleta, licença ou base de permissão, idioma, transformações e identidade; aplica filtros determinísticos de segurança e qualidade; remove duplicatas exatas e próximas; e versiona cada estágio. Deduplicação reduz conteúdo repetido dentro do treino. Decontamination compara candidatos com avaliações held-out e exclui overlaps que invalidariam a medição. Ambos exigem thresholds e logs de decisão.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Katherine Lee et al. (2021). Deduplicating Training Data Makes Language Models Better.
- Jesse Dodge et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.