Avançado
Quantization II: GPTQ, AWQ, GGUF, QAT
As quantizations comunitárias do Qwen3.8-27B abrangem algoritmos, formatos e runtimes — três camadas que precisam ser nomeadas separadamente para serem bem escolhidas.
Atualizada em
01 · Conceito
Conceito
Procure builds quantizados do Qwen3.8-27B num hub de modelos e você encontra uma parede de sufixos. Quantizations comunitárias deste modelo circulam nos ecossistemas llama.cpp/GGUF, Ollama, LM Studio e MLX — mantidas por essas comunidades, e não pelos autores do modelo. Os nomes desses artefatos misturam três camadas diferentes: um algoritmo que escolhe valores aproximados, um formato que armazena tensores e metadados, e um runtime cujos kernels consomem o resultado. GPTQ, AWQ, GGUF e QAT vivem cada um numa camada distinta, e escolher bem começa por separar seus papéis.
GPTQ é um método de quantization de pesos pós-treino. Partindo do checkpoint bf16 treinado e de entradas de calibração, ele quantiza os pesos coluna a coluna usando informação aproximada de segunda ordem para compensar o erro de reconstrução ao longo da camada — pesos posteriores se ajustam para absorver o estrago causado pelo arredondamento anterior, preservando as saídas da camada muito melhor do que um arredondamento independente para o valor mais próximo. As implementações expõem escolhas de largura de bits, tamanho de grupo e ordenação.
AWQ, activation-aware weight quantization, observa as ativações em dados de calibração para encontrar a pequena fração de canais de peso que mais importa para as saídas observadas, e então os protege via escalonamento antes da conversão para baixa precisão. Os dados de ativação informam como os pesos são tratados; o artefato publicado ainda é low-bit apenas de pesos. Tanto GPTQ quanto AWQ são post-training quantization (PTQ): sem retreino, então a qualidade depende fortemente da cobertura da calibração — um conjunto de prompts curtos em inglês pode não preservar o comportamento em código, em outros idiomas ou nos contextos muito longos do Qwen.
Um terceiro membro da mesma família é o que você de fato vai ver nomeado no Hub. Uma importance matrix — imatrix — é produzida passando dados de calibração pelo modelo e acumulando, por coluna de tensor, a soma dos quadrados das ativações que passam por ali; o quantizador então pondera seu erro por essa estatística, gastando precisão escassa nas colunas que o corpus mais exercitou. Ela mede ativações, e não sensibilidade por peso, e é uma medição em vez de um formato, então pode ser aplicada por baixo de vários deles. A lição 7.13 trabalha os artefatos que ela produz e a distinção com que mais se confunde.
QAT, quantization-aware training, antecipa o esforço: operações de fake-quantization arredondam e fazem clipping dentro do forward pass de treino enquanto pesos mestres em precisão mais alta recebem gradientes aproximados, de modo que o otimizador afasta os valores de fronteiras frágeis de arredondamento. Custa compute de treino e exige uma receita casada com o formato de deployment, mas pode recuperar qualidade onde o PTQ de uma passada só sofre em larguras de bits agressivas.
GGUF não é um algoritmo, de forma alguma. É o ecossistema de contêiner dos runtimes da família llama.cpp: um único arquivo carregando metadados do modelo, informação do tokenizer e tensores em qualquer degrau de uma escada de tipos quantizados, de 8 bits até abaixo de 4 bits. Dizer um GGUF do Qwen3.8-27B não diz nada sobre qualidade até você nomear o tipo de tensor, a ferramenta que o produziu e o checkpoint de origem.
Os próprios tamanhos de arquivo ensinam a estratificação. Códigos puros de 4 bits para 27 bilhões de parâmetros arredondados ocupariam GB. Na revisão comunitária fixada, o arquivo Q4_K_M do modelo de texto tem exatamente 17.106.773.984 bytes: 17,1 GB, ou 15,93 GiB. Metadados de grupo e tensores retidos em precisão maior explicam a diferença. Não inverta esse tamanho pela contagem comercial de 27B e chame o resultado de bpw exato: a contagem é arredondada e inclui a torre de visão, enquanto o GGUF é o modelo de texto; o projector multimodal é um arquivo separado de aproximadamente 0,93 GB.
Um segundo equívoco clássico é tratar conversão como gratuita. Reempacotar pesos bf16 num formato de 4 bits entrega ao algoritmo a melhor fonte disponível. Requantizar um artefato já em 4 bits para outro formato parte de valores que foram arredondados e sofreram clipping uma vez; a precisão descartada se foi, e os erros se acumulam. Um contêiner pode mudar; informação não retorna. Mantenha proveniência e hashes do checkpoint original e de todo artefato derivado.
Quanta qualidade os degraus custam neste modelo? Seja honestamente cauteloso: não existe relatório técnico dedicado ao Qwen3.8-27B, e quantizations comunitárias são publicadas sem avaliações padronizadas, então trate qualquer delta específico de perplexidade ou benchmark que você encontre como não verificado. O formato qualitativo é estável entre modelos: 8 bits apenas de pesos costuma ser difícil de distinguir de bf16; receitas mainstream de 4 bits cedem qualidade mensurável, mas muitas vezes aceitável; abaixo de 4 bits a degradação cresce rápido e de forma desigual, atingindo decisões de margem estreita — tokens raros, saída estruturada, recuperação em contexto longo — antes que as médias se movam. Avalie o artefato nas suas tarefas e nos seus idiomas antes de confiar nele.
O mapa durável: GPTQ reconstrói com consciência do erro, AWQ protege aquilo que as ativações provam ser saliente, QAT deixa o treino se adaptar ao erro de deployment, e GGUF empacota o resultado para runtimes compatíveis. Algoritmos criam aproximações, formatos as transportam, kernels as transformam em velocidade — e as lições 7.12 e 8.7 colocam esses artefatos em máquinas reais.
02 · Analogia
Analogia
Preparar pinturas para uma exposição itinerante envolve três trabalhos separados. Um conservador escolhe como reduzir o detalhe de cor protegendo as regiões importantes; um engradado de transporte etiqueta e embala cada tela; o museu de destino precisa de suportes e iluminação compatíveis com esse engradado. GPTQ, AWQ e QAT são estratégias de conservação, GGUF é um formato de empacotamento com metadados e codificações de tensores, e o runtime é o museu. Chamar os três simplesmente de quatro bits esconde as interfaces que decidem o sucesso.
03 · Explique de volta
Explique de volta
Distinga GPTQ, AWQ, GGUF e QAT por papel, explique por que o GGUF Q4_K_M fixado do Qwen3.8-27B pesa 17,1 GB em vez do piso de 13,5 GB dos códigos puros, e diga por que converter entre formatos com perda não restaura qualidade.
Comparar com uma resposta-modelo
GPTQ é quantization de pesos pós-treino que usa informação aproximada de segunda ordem para controlar o erro de reconstrução; AWQ usa observações de ativações para proteger canais de peso salientes; QAT simula quantization durante o treino para que os pesos se adaptem; GGUF é um formato de contêiner usado pelos runtimes da família llama.cpp que pode guardar tensores em muitos tipos quantizados — ele nomeia empacotamento, não algoritmo. Códigos puros de 4 bits para 27 bilhões de parâmetros dariam um piso de 13,5 GB, enquanto o artefato fixado Q4_K_M do modelo de texto tem exatamente 17.106.773.984 bytes: 17,1 GB ou 15,93 GiB. Metadados de grupo e tensores mantidos em precisão mais alta explicam a diferença, mas dividir pelo 27B comercial não mede bpw exato, porque essa contagem arredondada inclui a torre de visão e o arquivo é só do modelo de texto. Requantizar um artefato já quantizado parte de valores arredondados e com clipping, então a precisão descartada não pode ser recuperada.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Elias Frantar et al. (2022). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.
- Ji Lin et al. (2023). AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.
- Zechun Liu et al. (2023). LLM-QAT: Data-Free Quantization Aware Training for Large Language Models.
- Qwen Team (2026). Qwen3.8-27B Model Card.
- Unsloth (2026). Artefato GGUF Q4_K_M fixado do Qwen3.8-27B.