Fronteira
Custo por token
O fecho do curso: uma carga de trabalho precificada de três formas — um endpoint gerenciado por token, uma GPU de data center alugada e hardware Apple próprio — com o raciocínio de ponto de equilíbrio e as hipóteses que vão invalidar cada resposta.
Atualizada em
01 · Conceito
Conceito
Você tem um produto. Ele envia ao Qwen3.8-27B cerca de 200 milhões de tokens de entrada e recebe cerca de 40 milhões de tokens de saída por mês — um assistente de suporte com uso real, cinco partes de prompt e contexto para uma parte de resposta. Alguém precisa decidir como ele será servido, e todo argumento naquela reunião será um substituto para um número que ninguém calculou. Esta lição o calcula de três formas, e a disciplina que ela ensina importa mais que o vencedor: declare cada hipótese ali mesmo, de modo que, quando um preço ou um número de throughput mudar, o leitor consiga refazer a conta inteira sem você.
Opção um, o endpoint gerenciado por token. O Cloudflare Workers AI lista o modelo como oferta de primeira parte, e em agosto de 2026 seus preços publicados são USD 0,45 por milhão de tokens de entrada e USD 3,20 por milhão de tokens de saída.
Note o formato tanto quanto o tamanho: a conta é proporcional ao tráfego, então um mês parado custa quase nada e uma semana viral custa proporcionalmente mais. Não há capacidade a planejar, nem caminho de upgrade a negociar, nem superfície operacional alguma — que é o argumento da lição 8.12 reenunciado como fatura.
Opção dois, uma GPU de data center alugada rodando vLLM. Duas hipóteses, ambas declaradas em vez de cotadas: uma instância classe 80 GB a USD 2,50 por hora, e uma taxa agregada sustentada de 800 tokens de saída por segundo sob continuous batching. Nenhuma das duas é cotação de fabricante; substitua pelas suas, de uma página real de provedor e de um benchmark real.
Aqui está o desvio errado clássico, e é a razão de esta lição existir. O engenheiro divide aluguel por capacidade, obtém
compara com USD 3,20, anuncia uma economia de 3,7 vezes e propõe assumir a stack de serving. A aritmética está correta e a conclusão está errada, porque você não aluga tokens, aluga segundos. A carga precisa de 40 milhões de tokens de saída, então a instância roda a
aproximadamente catorze vezes o preço do endpoint. A economia era real, mas pertencia a uma carga oito vezes maior que esta. Encontre o cruzamento explicitamente: uma unidade de carga de 5 milhões de entrada mais 1 milhão de saída custa no endpoint
então a GPU alugada vence acima de aproximadamente 1,7 bilhão de tokens de entrada e 335 milhões de saída por mês — o que, tranquilizadoramente, é apenas cerca de 16 por cento da capacidade assumida, então a configuração é viável em vez de autocontraditória. O orçamento de memória da lição 9.3 é o que torna essa alegação de capacidade verificável afinal: 54 GB de pesos contra uma placa de 80 GB deixam espaço para um número limitado de sequências concorrentes a 64 KiB por token em cache, e a concorrência é precisamente o que transforma um orçamento de memória no número de throughput do denominador.
Opção três, hardware Apple próprio. Assuma um Mac grande de unified memory a USD 6.000, amortizado de forma linear em 36 meses, consumindo 150 watts em média ao longo do mês ligado, a USD 0,25 por quilowatt-hora.
A lição 9.6 fornece apenas uma heurística pelo tamanho do artefato perto de 47 tokens por segundo, que não prova capacidade. Assuma aqui 25 tokens sustentados por segundo medidos: 65,7 milhões por mês, com a carga usando cerca de 61 por cento, desde que as requisições não cheguem em rajadas que uma máquina de fluxo único não consiga absorver.
Alinhe os três e o resultado é genuinamente instrutivo: USD 218 brutos no gerenciado antes da franquia diária, USD 1.825 alugado, USD 194 próprio. O endpoint gerenciado e o Mac próprio ficam a doze por cento um do outro, um erro de arredondamento diante da diferença em todo o resto, enquanto a GPU alugada perde por uma ordem de grandeza puramente por utilização.
A forma geral vale memorizar porque sobrevive a toda mudança de preço: custo por token é o custo de sistema por unidade de tempo dividido pelos tokens produzidos por unidade de tempo, e toda lição desta track alimentou um desses dois termos. A bandwidth e o roofline fixam a taxa atingível; o orçamento do KV cache fixa a concorrência, que fixa a taxa agregada; a quantização move os dois; o interconnect decide se chips extras de fato acrescentam throughput; e a utilização — o termo que ninguém coloca num slide — decide se custos fixos são uma pechincha ou um passivo.
Este é o fim do curso. Você começou com uma função de contexto para uma distribuição sobre 248.320 tokens e agora consegue traçar essa função de ponta a ponta: como texto vira vetores, como attention e Gated DeltaNet os misturam, por que 16 de 64 camadas fazem cache de 64 KiB por token enquanto as outras 48 mantêm 144 MiB planos no caminho float32 de referência, como os pesos foram treinados e alinhados, como uma stack de serving os escalona, qual silício os lê mais rápido, e quanto custa um mês disso. Mais útil ainda, você agora consegue dimensionar uma implantação que nunca viu — ler um arquivo de config, derivar suas demandas de memória e bandwidth, escolher uma stack, escolher hardware e defender a escolha com aritmética em vez de slides de fabricante. Essa habilidade sobrevive a este modelo, e o próximo estará esperando por ela.
02 · Analogia
Analogia
Três jeitos de mover mercadoria pela cidade. Um motoboy cobra por encomenda e você não paga nada num dia parado. Uma van alugada custa o mesmo cheia ou parada no pátio, então ela só vence depois que você tem encomendas suficientes para enchê-la quase todos os dias. Comprar uma van acrescenta uma compra que você precisa diluir por anos mais combustível, e também faz de você o mecânico. Ninguém discute qual é a mais barata no abstrato; eles medem quantas encomendas de fato mandam, e a resposta vira num volume que dá para calcular antes de assinar qualquer coisa.
03 · Laboratório
Laboratório
04 · Explique de volta
Explique de volta
Precifique uma carga de 200 milhões de tokens de entrada e 40 milhões de tokens de saída por mês num endpoint gerenciado por token, numa GPU alugada rodando vLLM e em hardware Apple próprio — declarando cada hipótese — e depois encontre o volume no qual a GPU alugada fica mais barata que o endpoint.
Comparar com uma resposta-modelo
No Workers AI, a USD 0,45 por milhão de entrada e USD 3,20 por milhão de saída em agosto de 2026, a conta é 200 vezes 0,45 igual a USD 90,00 mais 40 vezes 3,20 igual a USD 128,00, ou USD 218,00 brutos antes da franquia diária gratuita, e ela cai a zero num mês sem tráfego. Numa GPU alugada classe 80 GB, assuma USD 2,50 por hora e uma instância rodando continuamente: 2,50 vezes 730 horas são USD 1.825,00 por mês independentemente do tráfego. Assuma ainda uma taxa agregada sustentada de 800 tokens de saída por segundo sob continuous batching, o que dá uma capacidade mensal de cerca de 2.102 milhões de tokens de saída; a carga usa 40 milhões deles, uma utilização de 1,9 por cento, então o preço efetivo é 1825 dividido por 40, cerca de USD 45,63 por milhão de tokens de saída — aproximadamente catorze vezes o endpoint. Hardware próprio: assuma um Mac grande de unified memory a USD 6.000 amortizado em 36 meses, USD 166,67 por mês, mais 150 watts de consumo médio por 730 horas a USD 0,25 por quilowatt-hora, cerca de USD 27,38, totalizando aproximadamente USD 194 por mês, com uma taxa sustentada medida assumida em 25 tokens de saída por segundo, dando cerca de 65,7 milhões de tokens de saída de capacidade mensal. A heurística de cerca de 47 tok/s da lição 9.6 não prova nem limita rigidamente essa taxa; ela só orienta o planejamento pelo tamanho do artefato. O ponto de equilíbrio da GPU alugada vem do aluguel fixo dividido pelo preço de endpoint de uma unidade de carga: 5 milhões de entrada mais 1 milhão de saída custam 5 vezes 0,45 mais 3,20, ou USD 5,45, e 1825 dividido por 5,45 são cerca de 335 unidades, então aproximadamente 1,7 bilhão de tokens de entrada e 335 milhões de saída por mês — cerca de oito vezes a carga assumida.
05 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- Cloudflare, Inc. (2026). Cloudflare Workers AI.
- vLLM Project (2026). vLLM Documentation.
- Qwen Team (2026). Qwen3.8-27B Model Card.