Avançado

Dados: origem, filtragem, dedup, descontaminação

Um corpus de pretraining é um pipeline governado cuja proveniência, filtros de qualidade, política de duplicatas e fronteiras de avaliação moldam o modelo — e para o Qwen3.8-27B nenhuma dessas escolhas é publicada.

Atualizada em

01 · Conceito

Conceito

Aqui está uma pergunta que você não consegue responder, e o fato de não conseguir é a lição. Em que o Qwen3.8-27B foi treinado? O model card dá arquitetura, licença, presets de amostragem e uma tabela de benchmarks. Ele não dá um corpus, uma contagem de tokens, um equilíbrio de idiomas ou uma data de corte, e não há relatório técnico acompanhando. Alguém tomou cada decisão abaixo para este modelo, e nenhuma delas foi divulgada. Essa é hoje a norma para releases de open-weight: você recebe os pesos e os formatos, não o pipeline que os produziu.

Então esta lição ensina o pipeline de forma genérica, e você carrega o formato dele como um conjunto de perguntas que sabe fazer a qualquer release — inclusive a este, onde a resposta honesta para a maioria delas é “não é público”.

Origem começa com proveniência. Cada documento precisa de um identificador estável e de metadados de fonte, data de aquisição, idioma, licença ou base de permissão e método de coleta. Alcançável publicamente não significa automaticamente adequado legal ou eticamente para todo uso. Políticas de robots, termos contratuais, dados pessoais, material protegido por direitos autorais e pedidos de remoção exigem governança explícita. Uma URL sozinha é proveniência fraca, porque o conteúdo por trás dela muda.

Filtragem remove material segundo uma política declarada. Verificações mecânicas pegam arquivos vazios, falhas de parser, repetição extrema, lixo binário e distribuições de caracteres implausíveis. Identificação de idioma dá suporte a roteamento e controle de mistura. Classificadores de qualidade podem ranquear documentos, mas herdam os valores e vieses dos seus rótulos; um filtro que prefere um dialeto de prestígio apaga silenciosamente linguagem regional útil. Filtragem de segurança não é uma lista de palavras-chave — identificadores pessoais, segredos, malware e material de exploração precisam de controles em camadas, restrições de acesso e proteção para os humanos que revisam os casos difíceis. Registre pontuações e limiares para que as escolhas possam ser auditadas depois.

Deduplicação reduz exemplos de treino repetidos. Hashes exatos pegam documentos byte a byte idênticos após canonicalização; métodos de quase-duplicata comparam shingles, fingerprints ou hashes sensíveis à localidade para achar páginas copiadas com pequenas edições. A unidade importa: descartar um livro inteiro porque um parágrafo de licença padrão se repete seria absurdo. Duplicatas distorcem pesos de amostragem, e sob o objetivo de próximo token da lição 5.1 essa distorção é direta — um documento espelhado mil vezes contribui mil vezes o gradiente, incentivando memorização e encolhendo a diversidade efetiva.

Descontaminação protege a avaliação. Ela busca nos dados de treino candidatos por perguntas de benchmark, respostas, testes de código ou variantes próximas e exclui ou sinaliza as sobreposições. Correspondência exata perde paráfrases; correspondência difusa produz falsos positivos em frases comuns. O limiar, a normalização, a versão do benchmark e o registro da decisão fazem parte do resultado reportado. É por isso que os números reportados pelo fornecedor no model card — SWE-bench Pro 61,7, GPQA Diamond 89,2 e os demais — são reportados pelo fornecedor e aguardam reprodução independente: sem um relatório de contaminação, uma pontuação é uma alegação, não uma medição.

Agora a aritmética, porque é na construção da mistura que um pipeline vira numérico. Suponha — e esta é uma suposição ilustrativa nossa, não um fato sobre qualquer modelo lançado — que você planeje um orçamento de 3 trilhões de tokens e queira que um domínio de código curado seja 10% dele, mas esse domínio contenha apenas 50 bilhões de tokens únicos. Você vai extrair

0.10×3,000 B=300 B tokens,300 B50 B=6 eˊpocas efetivas0.10\times 3{,}000\ \text{B}=300\ \text{B tokens}, \qquad \frac{300\ \text{B}}{50\ \text{B}}=6\ \text{épocas efetivas}

sobre essa fonte. Enquanto isso, um pool web de 2 trilhões de tokens com 40% do orçamento é amostrado em 0.40×3,000=1,2000.40\times 3{,}000 = 1{,}200 B tokens, o que dá 1,200/2,000=0.61{,}200/2{,}000 = 0.6 época — ele nunca é visto uma vez por inteiro. Mesmo corpus, mesma run, uma fonte repetida seis vezes e outra amostrada a 60% de cobertura. Épocas efetivas por fonte, e não o total de tokens da manchete, é o número que prevê risco de memorização. Recalcule sempre que um peso de mistura se mover.

O desvio clássico aqui é deduplicar dentro de cada fonte e declarar o trabalho concluído. Fontes se sobrepõem: o mesmo artigo da Wikipédia chega até você pelo dump da enciclopédia, três sites espelho, dois fóruns raspados que o citam e um livro que o reproduz. A dedup por fonte não acha nenhum desses, porque cada cópia é única dentro do seu próprio shard. A deduplicação entre fontes sobre o pool candidato combinado é o que de fato colapsa o cluster, e ela precisa rodar antes da divisão treino/validação, não depois — senão cópias de um mesmo texto caem dos dois lados e a loss de validação reporta um número melhor do que qualquer desempenho genuíno fora da fonte.

Versione todo artefato: snapshot bruto, texto normalizado, configuração dos filtros, clusters de duplicatas, relatório de descontaminação, manifesto da mistura e tokenizer. Preserve contagens antes e depois de cada estágio sem reter amostras sensíveis desnecessárias. Um manifesto reprodutível deve permitir que outro operador autorizado reconstrua exatamente quais IDs de documento eram elegíveis para uma run.

O modelo vai aprender a distribuição que você de fato alimenta, não a descrição num post de lançamento. E quando não há descrição nenhuma, a única posição responsável é dizer isso.

02 · Analogia

Analogia

Abastecer o reservatório de uma cidade não é questão de abrir todos os canos. Engenheiros registram cada bacia, rejeitam derramamentos químicos, removem recirculação repetida, mantêm amostras de teste fora do fluxo potável e preservam um registro para que uma fonte ruim possa ser isolada depois. Um trilhão de tokens sem proveniência é como um tanque enorme sem etiqueta: o volume é visível, a adequação não.

03 · Explique de volta

Explique de volta

Descreva um pipeline de dados defensável, distinga deduplicação de descontaminação de benchmarks e diga o que pode ser honestamente afirmado sobre os dados de treino do Qwen3.8-27B.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Um pipeline defensável registra fonte, data de coleta, licença ou base de permissão, idioma, transformações e identidade do documento; aplica filtros determinísticos de segurança e qualidade; remove duplicatas exatas e aproximadas; e versiona cada estágio. A deduplicação reduz conteúdo repetido dentro dos dados de treino. A descontaminação compara candidatos de treino contra avaliações held-out e exclui sobreposições que invalidariam a medição. Sobre o Qwen3.8-27B especificamente, quase nada pode ser afirmado: não existe relatório técnico, e o model card publica arquitetura, licença, benchmarks e presets de amostragem, mas nenhuma composição de corpus, contagem de tokens ou data de corte. A afirmação honesta é que a mistura não foi divulgada.

04 · Teste seu entendimento

Teste seu entendimento

01Qual destes é um fato publicável sobre os dados de pretraining do Qwen3.8-27B?
Resposta e explicação

Nenhum deles — nenhuma composição de corpus, contagem de tokens ou data de corte é publicada para este modelo — Não existe relatório técnico; o model card documenta arquitetura, licença, presets de amostragem e benchmarks reportados pelo fornecedor, e para por aí.

02Sob o objetivo causal da lição 5.1, por que um artigo espelhado em mil sites raspados distorce o treino?
Resposta e explicação

Seus tokens recebem mil vezes o gradiente de próximo token de um artigo único igualmente informativo — A loss é somada por token, então a duplicação multiplica silenciosamente o peso de amostragem de um documento e incentiva memorização.

03O que a descontaminação protege principalmente?
Resposta e explicação

A validade da avaliação held-out — Treinar em perguntas de benchmark ou variantes próximas pode fazer a avaliação medir memorização em vez de generalização.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Qwen Team (2026). Qwen3.8-27B Model Card.
  2. Katherine Lee et al. (2021). Deduplicating Training Data Makes Language Models Better.
  3. Jesse Dodge et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.