Fronteira
Qualcomm Hexagon e a edge
Inferência classe celular dimensionada com honestidade: um modelo de 27B não cabe num aparelho com qualidade útil alguma, o que cabe é um irmão destilado, e o caminho de toolchain passa pelo AI Engine Direct.
Atualizada em
01 · Conceito
Conceito
Um gerente de produto faz a única pergunta que importa para um roadmap mobile: dá para embarcar o Qwen3.8-27B no aplicativo, de modo que ele rode no celular sem ida e volta pela rede? Esta lição responde que não, e a razão pela qual a resposta merece uma lição inteira é que chegar a um não bem fundamentado é um resultado de engenharia. A maior parte das decepções na edge vem de times que nunca fizeram essa aritmética e descobriram o teto três meses adentro de uma integração.
Comece pelo orçamento de memória, que não é o número da ficha técnica. Um aparelho topo de linha atual vem com algo na região de 12 a 16 GB de DRAM, mas um aplicativo não é dono dessa máquina. O sistema operacional, o compositor, a stack da câmera e todo aplicativo em segundo plano dividem isso, e o SO recupera memória de aplicativos em primeiro plano sob pressão. Um orçamento sustentado realista para os pesos de modelo de um aplicativo é de alguns gigabytes — tome 3 GB como hipótese de trabalho declarada para o resto desta lição, e ajuste-a para a sua própria plataforma. Agora traga a escada da lição 7.9 e os tamanhos de artefato da lição 7.12:
O desvio errado clássico chega de imediato: quantizar com mais força. Dois bits em vez de quatro, certamente, corta pela metade e traz para dentro. Faça a aritmética em vez da torcida:
antes das escalas de grupo e dos tensores de precisão mista que a lição 7.10 mostrou sempre virem junto, e portanto ainda mais que o dobro do orçamento. O movimento falha no tamanho, e falha com mais força na qualidade — a curva de degradação da lição 7.9 é suave de 16 para 8 para 4 bits e íngreme abaixo disso. Leve a lógica à sua conclusão e ela vira absurdo: encaixar 27 bilhões de parâmetros em 3 GB exige
menos de um bit por parâmetro, o que não é uma configuração de quantização e sim um programa de pesquisa.
Resolva a equação no outro sentido e ela vira um briefing de projeto. A 4 bits, um orçamento de 3 GB de pesos comporta cerca de 6 bilhões de parâmetros, e isso antes do KV cache, do workspace do runtime e do tokenizer. Não reutilize aqui os 64 KiB por token da lição 7.2: esse valor pertence às 16 camadas com cache do Qwen3.8-27B. Para o modelo escolhido de 3 a 4 bilhões de parâmetros, derive os bytes de KV como camadas vezes KV heads vezes dimensão de cabeça vezes dois tensors vezes bytes por elemento, e só então multiplique por 8.192 tokens. Um alvo sóbrio é, portanto, um modelo na faixa de 3 a 4 bilhões de parâmetros, que é precisamente o que a lição 6.11 constrói: um irmão destilado, uma rede genuinamente menor treinada contra as saídas do modelo grande, herdando comportamento em vez de pesos. Quantização reduz bytes por parâmetro e chega a um fundo; destilação reduz a contagem de parâmetros, que é o único termo que atravessa a porta.
A bandwidth confirma o veredito de forma independente, que é a parte tranquilizadora de um resultado negativo — dois argumentos não relacionados concordando. A bandwidth de LPDDR móvel é uma ordem de grandeza abaixo da unified memory de desktop e duas abaixo da HBM de data center; tome 60 GB/s como hipótese declarada de ordem de grandeza, e não como cotação de fabricante. Usando o tamanho do artefato apenas como proxy, a divisão da lição 9.1 dá cerca de 3,5 tokens por segundo para o artefato fixado de 17,1 GB e aproximadamente 30 para um de 2 GB. Mesmo numa fantasia em que o modelo grande coubesse, ele seria inutilizável.
Então o que o silício de fato oferece? A NPU Hexagon da Qualcomm é um acelerador de tendência a função fixa, ajustado para aritmética inteira quantizada em baixa potência, e a documentação para desenvolvedores da Qualcomm a expõe através do AI Engine Direct — a stack QNN — com o AI Hub como caminho de compilação e validação que mira uma família específica de dispositivos. O modelo mental que importa é este: a NPU é rápida e eficiente somente para grafos que ela suporta integralmente. NPUs preferem shapes estáticos, pesos quantizados e um conjunto fixo de operadores. Qualquer coisa fora desse conjunto cai para a CPU ou a GPU, e um grafo que cai para fallback num caminho quente gastou sua vantagem de potência mantendo o custo de integração. O Qwen3.8-27B é uma arquitetura híbrida cujas camadas de Gated DeltaNet são novas; cobertura de kernels do fabricante para operadores recém-lançados chega em releases específicas de toolchain, exatamente como a lição 7.12 alertou sobre runtimes locais. Verifique a cobertura de operadores no seu dispositivo alvo antes de se comprometer com uma arquitetura, não depois.
A lição durável é o formato da resposta. O dimensionamento produziu um não limpo e defensável, e o não apontou diretamente para o sim certo: implantação híbrida, em que um modelo pequeno destilado cuida do trabalho sensível a latência e offline na NPU Hexagon, e o 27B é chamado pela rede quando a tarefa genuinamente precisa dele. Essa divisão é uma decisão de custo e confiabilidade tanto quanto técnica, e a lição 9.10 lhe dá um preço.
02 · Analogia
Analogia
Uma banda em turnê não consegue levar o equipamento de estádio para um show de sala de estar — nem tirando caixas de som, nem baixando os amplificadores. A sala tem uma porta, um circuito elétrico e um pé-direito, e a resposta honesta é uma formação diferente escrita para aquela sala: acústica, três músicos, arranjada a partir das mesmas canções. Inferência na edge é a sala de estar. Encolher o equipamento de estádio é quantização, e ela se esgota; reescrever as canções para a banda pequena é destilação, e é o único movimento que de fato atravessa a porta.
03 · Explique de volta
Explique de volta
Mostre, com aritmética, por que o Qwen3.8-27B não pode ser implantado num celular nem com quantização agressiva, depois explique o que de fato vai para um aparelho e qual parte da toolchain faz aquilo rodar na NPU em vez da CPU.
Comparar com uma resposta-modelo
Tome um orçamento declarado de memória de aplicativo de cerca de 3 GB num aparelho topo de linha — o dispositivo pode ter mais DRAM, mas o sistema operacional recupera memória agressivamente e um único aplicativo não é dono da máquina. O artefato de texto Q4_K_M fixado tem 17,1 GB (15,93 GiB), mais de cinco vezes esse orçamento. Empurrar para 2 bits dá 27e9 vezes 0,25 bytes, cerca de 6,75 GB, ainda mais que o dobro do orçamento e bem além do ponto em que a curva de qualidade da lição 7.9 desaba. Resolvendo no sentido inverso, um orçamento de 3 GB a 4 bits comporta aproximadamente 6 bilhões de parâmetros antes de qualquer cache ou workspace, então realisticamente um modelo de 3 a 4 bilhões de parâmetros. A bandwidth diz o mesmo de forma independente: com um número de ordem de grandeza para celular perto de 60 GB/s, dividir 60 GB/s pelo artefato de 17,1 GB dá uma heurística de planejamento perto de 3,5 tok/s mesmo se ele fosse residente. O que de fato vai para o aparelho é, portanto, um irmão destilado no sentido da lição 6.11 — um modelo pequeno treinado contra as saídas do grande — e ele chega à NPU Hexagon através do AI Engine Direct da Qualcomm, o QNN, com o AI Hub usado para compilar e validar o grafo para um dispositivo específico. Se qualquer operador não tiver kernel de NPU, o runtime cai para CPU ou GPU e a vantagem de eficiência desaparece.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Qualcomm Technologies, Inc. (2026). Qualcomm Developer — AI and Neural Processing.
- Qualcomm Technologies, Inc. (2026). Qualcomm AI Hub.
- Qwen Team (2026). Qwen3.8-27B Model Card.