Avançado
Dados: origem, filtragem, dedup, descontaminação
Um corpus de pretraining é um pipeline governado cuja proveniência, filtros de qualidade, política de duplicatas e fronteiras de avaliação moldam o modelo — e para o Qwen3.8-27B nenhuma dessas escolhas é publicada.
Atualizada em
01 · Conceito
Conceito
Aqui está uma pergunta que você não consegue responder, e o fato de não conseguir é a lição. Em que o Qwen3.8-27B foi treinado? O model card dá arquitetura, licença, presets de amostragem e uma tabela de benchmarks. Ele não dá um corpus, uma contagem de tokens, um equilíbrio de idiomas ou uma data de corte, e não há relatório técnico acompanhando. Alguém tomou cada decisão abaixo para este modelo, e nenhuma delas foi divulgada. Essa é hoje a norma para releases de open-weight: você recebe os pesos e os formatos, não o pipeline que os produziu.
Então esta lição ensina o pipeline de forma genérica, e você carrega o formato dele como um conjunto de perguntas que sabe fazer a qualquer release — inclusive a este, onde a resposta honesta para a maioria delas é “não é público”.
Origem começa com proveniência. Cada documento precisa de um identificador estável e de metadados de fonte, data de aquisição, idioma, licença ou base de permissão e método de coleta. Alcançável publicamente não significa automaticamente adequado legal ou eticamente para todo uso. Políticas de robots, termos contratuais, dados pessoais, material protegido por direitos autorais e pedidos de remoção exigem governança explícita. Uma URL sozinha é proveniência fraca, porque o conteúdo por trás dela muda.
Filtragem remove material segundo uma política declarada. Verificações mecânicas pegam arquivos vazios, falhas de parser, repetição extrema, lixo binário e distribuições de caracteres implausíveis. Identificação de idioma dá suporte a roteamento e controle de mistura. Classificadores de qualidade podem ranquear documentos, mas herdam os valores e vieses dos seus rótulos; um filtro que prefere um dialeto de prestígio apaga silenciosamente linguagem regional útil. Filtragem de segurança não é uma lista de palavras-chave — identificadores pessoais, segredos, malware e material de exploração precisam de controles em camadas, restrições de acesso e proteção para os humanos que revisam os casos difíceis. Registre pontuações e limiares para que as escolhas possam ser auditadas depois.
Deduplicação reduz exemplos de treino repetidos. Hashes exatos pegam documentos byte a byte idênticos após canonicalização; métodos de quase-duplicata comparam shingles, fingerprints ou hashes sensíveis à localidade para achar páginas copiadas com pequenas edições. A unidade importa: descartar um livro inteiro porque um parágrafo de licença padrão se repete seria absurdo. Duplicatas distorcem pesos de amostragem, e sob o objetivo de próximo token da lição 5.1 essa distorção é direta — um documento espelhado mil vezes contribui mil vezes o gradiente, incentivando memorização e encolhendo a diversidade efetiva.
Descontaminação protege a avaliação. Ela busca nos dados de treino candidatos por perguntas de benchmark, respostas, testes de código ou variantes próximas e exclui ou sinaliza as sobreposições. Correspondência exata perde paráfrases; correspondência difusa produz falsos positivos em frases comuns. O limiar, a normalização, a versão do benchmark e o registro da decisão fazem parte do resultado reportado. É por isso que os números reportados pelo fornecedor no model card — SWE-bench Pro 61,7, GPQA Diamond 89,2 e os demais — são reportados pelo fornecedor e aguardam reprodução independente: sem um relatório de contaminação, uma pontuação é uma alegação, não uma medição.
Agora a aritmética, porque é na construção da mistura que um pipeline vira numérico. Suponha — e esta é uma suposição ilustrativa nossa, não um fato sobre qualquer modelo lançado — que você planeje um orçamento de 3 trilhões de tokens e queira que um domínio de código curado seja 10% dele, mas esse domínio contenha apenas 50 bilhões de tokens únicos. Você vai extrair
sobre essa fonte. Enquanto isso, um pool web de 2 trilhões de tokens com 40% do orçamento é amostrado em B tokens, o que dá época — ele nunca é visto uma vez por inteiro. Mesmo corpus, mesma run, uma fonte repetida seis vezes e outra amostrada a 60% de cobertura. Épocas efetivas por fonte, e não o total de tokens da manchete, é o número que prevê risco de memorização. Recalcule sempre que um peso de mistura se mover.
O desvio clássico aqui é deduplicar dentro de cada fonte e declarar o trabalho concluído. Fontes se sobrepõem: o mesmo artigo da Wikipédia chega até você pelo dump da enciclopédia, três sites espelho, dois fóruns raspados que o citam e um livro que o reproduz. A dedup por fonte não acha nenhum desses, porque cada cópia é única dentro do seu próprio shard. A deduplicação entre fontes sobre o pool candidato combinado é o que de fato colapsa o cluster, e ela precisa rodar antes da divisão treino/validação, não depois — senão cópias de um mesmo texto caem dos dois lados e a loss de validação reporta um número melhor do que qualquer desempenho genuíno fora da fonte.
Versione todo artefato: snapshot bruto, texto normalizado, configuração dos filtros, clusters de duplicatas, relatório de descontaminação, manifesto da mistura e tokenizer. Preserve contagens antes e depois de cada estágio sem reter amostras sensíveis desnecessárias. Um manifesto reprodutível deve permitir que outro operador autorizado reconstrua exatamente quais IDs de documento eram elegíveis para uma run.
O modelo vai aprender a distribuição que você de fato alimenta, não a descrição num post de lançamento. E quando não há descrição nenhuma, a única posição responsável é dizer isso.
02 · Analogia
Analogia
Abastecer o reservatório de uma cidade não é questão de abrir todos os canos. Engenheiros registram cada bacia, rejeitam derramamentos químicos, removem recirculação repetida, mantêm amostras de teste fora do fluxo potável e preservam um registro para que uma fonte ruim possa ser isolada depois. Um trilhão de tokens sem proveniência é como um tanque enorme sem etiqueta: o volume é visível, a adequação não.
03 · Explique de volta
Explique de volta
Descreva um pipeline de dados defensável, distinga deduplicação de descontaminação de benchmarks e diga o que pode ser honestamente afirmado sobre os dados de treino do Qwen3.8-27B.
Comparar com uma resposta-modelo
Um pipeline defensável registra fonte, data de coleta, licença ou base de permissão, idioma, transformações e identidade do documento; aplica filtros determinísticos de segurança e qualidade; remove duplicatas exatas e aproximadas; e versiona cada estágio. A deduplicação reduz conteúdo repetido dentro dos dados de treino. A descontaminação compara candidatos de treino contra avaliações held-out e exclui sobreposições que invalidariam a medição. Sobre o Qwen3.8-27B especificamente, quase nada pode ser afirmado: não existe relatório técnico, e o model card publica arquitetura, licença, benchmarks e presets de amostragem, mas nenhuma composição de corpus, contagem de tokens ou data de corte. A afirmação honesta é que a mistura não foi divulgada.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Qwen Team (2026). Qwen3.8-27B Model Card.
- Katherine Lee et al. (2021). Deduplicating Training Data Makes Language Models Better.
- Jesse Dodge et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.