Avançado
Serving na nuvem
Endpoints gerenciados cobrados por token e precificados por milhão: uma conta mensal trabalhada para o Qwen3.8-27B no Cloudflare Workers AI, por que os tokens de saída dominam a fatura e a aritmética que decide quando alugar vence comprar.
Atualizada em
01 · Conceito
Conceito
Tudo nesta track até aqui supôs que você detém os pesos. Você escolheu um degrau de quantization, dimensionou um KV cache, escolheu um engine e aceitou que alguém do seu time é dono do processo. Existe um arranjo diferente: o modelo roda nos aceleradores de outra pessoa atrás de um endpoint HTTP, e você é cobrado por token. O Qwen3.8-27B está disponível assim — o Cloudflare Workers AI o expõe como @cf/qwen/qwen3.8-27b com visão, raciocínio e function calling, precificado, em agosto de 2026, a USD 0,45 por milhão de tokens de entrada e USD 3,20 por milhão de tokens de saída. A pergunta de engenharia não é se isso é barato. É quanto custa a você, para o seu tráfego, comparado à alternativa — e isso exige aritmética de verdade.
Tome uma carga concreta. Um assistente de atendimento ao cliente atende 30.000 conversas por mês. Cada requisição carrega um system prompt de 700 tokens com a política do produto mais um turno de usuário e contexto recuperado de 500 tokens, então 1.200 tokens de entrada, e produz uma resposta de 400 tokens. Trabalhe isso em passos visíveis.
Volume de entrada: 30.000 requisições vezes 1.200 tokens são 36.000.000 tokens, ou 36 milhões. Volume de saída: 30.000 vezes 400 são 12.000.000, ou 12 milhões. Custo de entrada: 36 vezes USD 0,45 dão USD 16,20. Custo de saída: 12 vezes USD 3,20 dão USD 38,40. O custo bruto pelas taxas por token é de USD 54,60 antes da franquia diária gratuita. O Workers AI inclui 10.000 neurons grátis por dia, então a fatura também depende de como o tráfego se distribui entre dias UTC; o total mensal de tokens não basta para determiná-la exatamente.
Sente-se com o formato desse número em vez de com o seu tamanho. A saída são 12 dos 48 milhões de tokens — um quarto do volume — e USD 38,40 de USD 54,60, pouco mais de setenta por cento do custo. A assimetria de preço é consistente com a assimetria entre prefill e decode da lição 7.3: o prefill processa todos os 1.200 tokens de entrada como uma operação matricial paralela e densa em computação, enquanto o decode produz 400 tokens estritamente um de cada vez, cada passo relendo os pesos residentes e o KV cache que cresce. A geração ocupa a máquina por muito mais tempo por token do que a ingestão, mas a Cloudflare não publica esse mecanismo como derivação causal da razão de preços.
A virada errada clássica é orçar com uma taxa combinada. O raciocínio: 48 milhões de tokens por mês, o preço é mais ou menos meio dólar por milhão, então chame de USD 21,60 e siga. Isso fica duas vezes e meia abaixo da conta real, e falha exatamente na direção que dói, porque o erro cresce justamente quando um produto tem sucesso em gerar mais. Nunca combine. Preveja os dois fluxos separadamente, porque eles respondem a decisões de produto diferentes — um system prompt mais longo mexe no número barato, um assistente mais falante mexe no caro.
Essa assimetria tem uma consequência afiada para este modelo em particular. O Qwen3.8-27B traz um thinking mode como comportamento padrão, e pensar significa que o modelo emite tokens de raciocínio antes da resposta. Esses são tokens de saída, cobrados a preço de saída. Suponha que ligá-lo acrescente 800 tokens de raciocínio por requisição. O volume de saída vai de 12 milhões para 36 milhões, o custo de saída de USD 38,40 para USD 115,20, e a conta total de USD 54,60 para USD 131,40 — 2,4 vezes mais, a partir de uma única flag de configuração, com o lado da entrada intocado. Isso não é um argumento contra o thinking mode; é um argumento para decidir por rota se uma requisição merece raciocínio, e para saber que a configuração enable_thinking do model card é uma linha de fatura tanto quanto um controle de qualidade.
Agora a comparação alugar contra comprar, feita com honestidade e sem inventar preços de hardware. Acima da franquia gratuita de cada dia, o custo gerenciado é linear em tokens: dobre o tráfego faturado, dobre o custo, sem desembolso de capital, sem escala de ops, sem risco de capacidade e sem engenheiro acordado porque uma atualização de driver quebrou um kernel. Um deployment dedicado — um acelerador da classe 80 GB rodando o stack vLLM da lição 8.4 — é fixo em custo e limitado em throughput: você paga pela máquina quer ela sirva uma requisição ou um milhão, até o teto que o seu orçamento de KV permite, e paga de novo no tempo de engenharia que a mantém saudável. Se a opção dedicada custa C por mês tudo incluído, o cruzamento é C dividido pelo custo gerenciado da sua carga. A um custo bruto de USD 54,60 antes da franquia diária, essencialmente nenhum deployment dedicado compete; você estaria comprando um acelerador para mantê-lo ocioso. Escale o mesmo padrão de tráfego cem vezes e o custo bruto gerenciado é de USD 5.460 por mês, ponto em que uma placa e um operador competente plausivelmente vencem — desde que a sua utilização seja alta e estável, porque a economia de uma máquina dedicada vive inteiramente da utilização.
Três fatores movem esse cruzamento e nenhum deles aparece numa tabela de preços. Utilização: tráfego irregular desperdiça capacidade própria e não custa nada a mais num medidor. Capacidade de ops: um time de três pessoas entregando produto tem um custo real diferente para rodar inferência do que um time de plataforma de quinze. E eficiência de tokens, que é onde a lição 1.4 ganha seu lugar como pré-requisito — o mesmo assistente atendendo usuários em português fatura mais por conversa que um atendendo usuários em inglês, porque o BPE em nível de bytes fragmenta texto sub-representado em mais tokens para significado idêntico. Num endpoint medido, comportamento de tokenizer é uma linha de fatura.
A lição 8.12 põe esta opção ao lado de todo stack local e auto-hospedado da track e dá a você um único framework para escolher entre eles.
02 · Analogia
Analogia
Eletricidade da rede custa mais por quilowatt-hora que eletricidade de um gerador próprio — e quase ninguém compra um gerador. O medidor cobra só pelo que você puxa, outra pessoa absorve a manutenção, e a capacidade está lá na noite em que você precisa de dez vezes a sua média. Você compra o gerador quando o seu consumo é grande, constante e previsível o bastante para que o custo fixo se divida em algo menor que o medidor. Essa comparação, e não um preço unitário, é a decisão.
03 · Explique de volta
Explique de volta
Calcule a conta mensal no Workers AI para uma carga declarada do Qwen3.8-27B, explique por que os tokens de saída a dominam e enuncie a condição geral sob a qual um deployment dedicado fica mais barato.
Comparar com uma resposta-modelo
Tome 30.000 requisições por mês com 1.200 tokens de entrada e 400 de saída cada. A entrada são 36 milhões de tokens, a saída são 12 milhões. Em agosto de 2026 o preço do Cloudflare Workers AI para este modelo é USD 0,45 por milhão de tokens de entrada e USD 3,20 por milhão de saída, então a entrada custa USD 16,20, a saída custa USD 38,40 e o custo bruto de tabela é USD 54,60 antes da franquia diária gratuita. A saída é um quarto dos tokens e cerca de setenta por cento do custo, porque a geração é sequencial e limitada por memória enquanto o prefill é uma operação matricial paralela — a assimetria de preço espelha a assimetria da máquina. O thinking mode multiplica exatamente a metade cara: acrescentar 800 tokens de raciocínio por requisição leva a saída a 36 milhões e o custo bruto de tabela a cerca de USD 131, um aumento de 2,4 vezes vindo de uma única flag de configuração. Alugar é linear em tokens e capacidade dedicada é fixa, então o cruzamento é simplesmente o custo mensal do deployment dedicado dividido pelo custo gerenciado por requisição — abaixo desse volume você está pagando por silício ocioso, acima dele você está pagando margem em cada token.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Cloudflare (2026). Cloudflare Workers AI.
- Qwen Team (2026). Qwen3.8-27B Model Card.