Fronteira

Qualcomm Hexagon e a edge

Inferência classe celular dimensionada com honestidade: um modelo de 27B não cabe num aparelho com qualidade útil alguma, o que cabe é um irmão destilado, e o caminho de toolchain passa pelo AI Engine Direct.

Atualizada em

01 · Conceito

Conceito

Um gerente de produto faz a única pergunta que importa para um roadmap mobile: dá para embarcar o Qwen3.8-27B no aplicativo, de modo que ele rode no celular sem ida e volta pela rede? Esta lição responde que não, e a razão pela qual a resposta merece uma lição inteira é que chegar a um não bem fundamentado é um resultado de engenharia. A maior parte das decepções na edge vem de times que nunca fizeram essa aritmética e descobriram o teto três meses adentro de uma integração.

Comece pelo orçamento de memória, que não é o número da ficha técnica. Um aparelho topo de linha atual vem com algo na região de 12 a 16 GB de DRAM, mas um aplicativo não é dono dessa máquina. O sistema operacional, o compositor, a stack da câmera e todo aplicativo em segundo plano dividem isso, e o SO recupera memória de aplicativos em primeiro plano sob pressão. Um orçamento sustentado realista para os pesos de modelo de um aplicativo é de alguns gigabytes — tome 3 GB como hipótese de trabalho declarada para o resto desta lição, e ajuste-a para a sua própria plataforma. Agora traga a escada da lição 7.9 e os tamanhos de artefato da lição 7.12:

16 GB (artefato de 4 bits)÷3 GB (orc¸amento)5.3× grande demais.16\ \text{GB (artefato de 4 bits)} \div 3\ \text{GB (orçamento)} \approx 5.3\times\ \text{grande demais}.

O desvio errado clássico chega de imediato: quantizar com mais força. Dois bits em vez de quatro, certamente, corta pela metade e traz para dentro. Faça a aritmética em vez da torcida:

27e9×0.25 B=6.75 GB,27\text{e}9 \times 0.25\ \text{B} = 6.75\ \text{GB},

antes das escalas de grupo e dos tensores de precisão mista que a lição 7.10 mostrou sempre virem junto, e portanto ainda mais que o dobro do orçamento. O movimento falha no tamanho, e falha com mais força na qualidade — a curva de degradação da lição 7.9 é suave de 16 para 8 para 4 bits e íngreme abaixo disso. Leve a lógica à sua conclusão e ela vira absurdo: encaixar 27 bilhões de parâmetros em 3 GB exige

3 GB×8 bits/B27e9 paraˆmetros0.89 bits por peso,\frac{3\ \text{GB} \times 8\ \text{bits/B}}{27\text{e}9\ \text{parâmetros}} \approx 0.89\ \text{bits por peso},

menos de um bit por parâmetro, o que não é uma configuração de quantização e sim um programa de pesquisa.

Resolva a equação no outro sentido e ela vira um briefing de projeto. A 4 bits, um orçamento de 3 GB de pesos comporta cerca de 6 bilhões de parâmetros, e isso antes do KV cache, do workspace do runtime e do tokenizer. Não reutilize aqui os 64 KiB por token da lição 7.2: esse valor pertence às 16 camadas com cache do Qwen3.8-27B. Para o modelo escolhido de 3 a 4 bilhões de parâmetros, derive os bytes de KV como camadas vezes KV heads vezes dimensão de cabeça vezes dois tensors vezes bytes por elemento, e só então multiplique por 8.192 tokens. Um alvo sóbrio é, portanto, um modelo na faixa de 3 a 4 bilhões de parâmetros, que é precisamente o que a lição 6.11 constrói: um irmão destilado, uma rede genuinamente menor treinada contra as saídas do modelo grande, herdando comportamento em vez de pesos. Quantização reduz bytes por parâmetro e chega a um fundo; destilação reduz a contagem de parâmetros, que é o único termo que atravessa a porta.

A bandwidth confirma o veredito de forma independente, que é a parte tranquilizadora de um resultado negativo — dois argumentos não relacionados concordando. A bandwidth de LPDDR móvel é uma ordem de grandeza abaixo da unified memory de desktop e duas abaixo da HBM de data center; tome 60 GB/s como hipótese declarada de ordem de grandeza, e não como cotação de fabricante. Usando o tamanho do artefato apenas como proxy, a divisão da lição 9.1 dá cerca de 3,5 tokens por segundo para o artefato fixado de 17,1 GB e aproximadamente 30 para um de 2 GB. Mesmo numa fantasia em que o modelo grande coubesse, ele seria inutilizável.

Então o que o silício de fato oferece? A NPU Hexagon da Qualcomm é um acelerador de tendência a função fixa, ajustado para aritmética inteira quantizada em baixa potência, e a documentação para desenvolvedores da Qualcomm a expõe através do AI Engine Direct — a stack QNN — com o AI Hub como caminho de compilação e validação que mira uma família específica de dispositivos. O modelo mental que importa é este: a NPU é rápida e eficiente somente para grafos que ela suporta integralmente. NPUs preferem shapes estáticos, pesos quantizados e um conjunto fixo de operadores. Qualquer coisa fora desse conjunto cai para a CPU ou a GPU, e um grafo que cai para fallback num caminho quente gastou sua vantagem de potência mantendo o custo de integração. O Qwen3.8-27B é uma arquitetura híbrida cujas camadas de Gated DeltaNet são novas; cobertura de kernels do fabricante para operadores recém-lançados chega em releases específicas de toolchain, exatamente como a lição 7.12 alertou sobre runtimes locais. Verifique a cobertura de operadores no seu dispositivo alvo antes de se comprometer com uma arquitetura, não depois.

A lição durável é o formato da resposta. O dimensionamento produziu um não limpo e defensável, e o não apontou diretamente para o sim certo: implantação híbrida, em que um modelo pequeno destilado cuida do trabalho sensível a latência e offline na NPU Hexagon, e o 27B é chamado pela rede quando a tarefa genuinamente precisa dele. Essa divisão é uma decisão de custo e confiabilidade tanto quanto técnica, e a lição 9.10 lhe dá um preço.

02 · Analogia

Analogia

Uma banda em turnê não consegue levar o equipamento de estádio para um show de sala de estar — nem tirando caixas de som, nem baixando os amplificadores. A sala tem uma porta, um circuito elétrico e um pé-direito, e a resposta honesta é uma formação diferente escrita para aquela sala: acústica, três músicos, arranjada a partir das mesmas canções. Inferência na edge é a sala de estar. Encolher o equipamento de estádio é quantização, e ela se esgota; reescrever as canções para a banda pequena é destilação, e é o único movimento que de fato atravessa a porta.

03 · Explique de volta

Explique de volta

Mostre, com aritmética, por que o Qwen3.8-27B não pode ser implantado num celular nem com quantização agressiva, depois explique o que de fato vai para um aparelho e qual parte da toolchain faz aquilo rodar na NPU em vez da CPU.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Aguardando sua explicação.

Comparar com uma resposta-modelo

Tome um orçamento declarado de memória de aplicativo de cerca de 3 GB num aparelho topo de linha — o dispositivo pode ter mais DRAM, mas o sistema operacional recupera memória agressivamente e um único aplicativo não é dono da máquina. O artefato de texto Q4_K_M fixado tem 17,1 GB (15,93 GiB), mais de cinco vezes esse orçamento. Empurrar para 2 bits dá 27e9 vezes 0,25 bytes, cerca de 6,75 GB, ainda mais que o dobro do orçamento e bem além do ponto em que a curva de qualidade da lição 7.9 desaba. Resolvendo no sentido inverso, um orçamento de 3 GB a 4 bits comporta aproximadamente 6 bilhões de parâmetros antes de qualquer cache ou workspace, então realisticamente um modelo de 3 a 4 bilhões de parâmetros. A bandwidth diz o mesmo de forma independente: com um número de ordem de grandeza para celular perto de 60 GB/s, dividir 60 GB/s pelo artefato de 17,1 GB dá uma heurística de planejamento perto de 3,5 tok/s mesmo se ele fosse residente. O que de fato vai para o aparelho é, portanto, um irmão destilado no sentido da lição 6.11 — um modelo pequeno treinado contra as saídas do grande — e ele chega à NPU Hexagon através do AI Engine Direct da Qualcomm, o QNN, com o AI Hub usado para compilar e validar o grafo para um dispositivo específico. Se qualquer operador não tiver kernel de NPU, o runtime cai para CPU ou GPU e a vantagem de eficiência desaparece.

04 · Teste seu entendimento

Teste seu entendimento

01Usando a escada de quantização da lição 7.9, o que empurrar o Qwen3.8-27B de 4 bits para 2 bits de fato compra num aparelho celular?
Resposta e explicação

Uma estimativa ingênua de 6,75 GB de códigos empacotados em vez do artefato Q4_K_M fixado de 17,1 GB — ainda muito acima de um orçamento de tamanho de aplicativo, a um custo severo de qualidade — 27e9 parâmetros vezes 0,25 bytes são cerca de 6,75 GB antes das escalas e dos tensores de precisão mista; a lição 7.9 também mostrou a acurácia degradando bruscamente abaixo de 4 bits, então o movimento falha nos dois eixos.

02A lição 6.11 descreveu destilação como treinar um modelo pequeno contra o comportamento de um grande. Por que essa é a técnica que sustenta a implantação na edge, e não um item desejável?
Resposta e explicação

Ela muda a contagem de parâmetros, que é o termo que a quantização não consegue reduzir — Quantização reduz bytes por parâmetro e chega a um fundo; só treinar uma rede genuinamente menor muda a própria contagem de parâmetros, que é o que um orçamento de tamanho de celular exige.

Conclua o teach-back e acerte o quiz para finalizar a aula.

◎ · Marcador de evidência

Fontes

  1. Qualcomm Technologies, Inc. (2026). Qualcomm Developer — AI and Neural Processing.
  2. Qualcomm Technologies, Inc. (2026). Qualcomm AI Hub.
  3. Qwen Team (2026). Qwen3.8-27B Model Card.