Avançado

Quanto custa um pretraining real

Um budget confiável separa FLOPs ideais de tempo realizado, experimentos, falhas, dados, pessoas, storage e impacto ambiental.

Atualizada em

1

Conceito

Uma estimativa de pretraining precisa ser reproduzível, não um número dramático em dólares sem hipóteses. Comece pelo trabalho algorítmico, transforme-o em tempo medido de hardware e adicione o restante do programa. Cada fronteira responde a outra pergunta: “o que a run final consumiu?” não é “quanto custou desenvolver o modelo?”.

Para um decoder denso, uma aproximação é

Ftrain6ND,F_{train}\approx6ND,

onde NN são parâmetros sem embedding e DD são tokens. O fator aproxima forward e backward; attention, embeddings, sparsity, recomputação e arquitetura o alteram. Uma estimativa melhor soma operações pelos shapes reais e comprimento. Rotule toda aproximação.

Converta FLOPs em device-hours:

H=FtrainPpeaku3600,H=\frac{F_{train}}{P_{peak}\,u\,3600},

onde PpeakP_{peak} é o pico aplicável e uu a utilização medida. Não use o pico de um dtype se a receita usa outro. Utilização inclui eficiência de kernel e ociosidade, mas definições variam. Use telemetria de pilotos na topologia pretendida.

Preço precisa de data e modelo de compra. Cloud on-demand, capacidade reservada, cluster negociado e hardware próprio geram taxas diferentes. Em ownership, amortize hardware, rede, instalações, manutenção, financiamento e utilização esperada. Acelerador ocioso ainda tem custo de capital; aluguel inclui margem. Apresente faixa em vez de misturar tudo com falsa precisão.

A run final é uma linha. Some scaling pilots, data ablations, tokenizer experiments, falhas, avaliação, post-training e reruns. O artigo de planejamento do BLOOM, de 2022, enquadrou a escolha em uma alocação de um milhão de A100-GPU-hours, mostrando por que o portfólio experimental acompanha a run-alvo. Use o número apenas como evidência daquele projeto e data, não como preço atual.

Categorias não compute incluem aquisição e governança de dados, deduplicação, filtragem, storage, transferência, réplicas de checkpoints, evaluation infrastructure, observabilidade, segurança e engenharia. Opportunity cost importa quando capacidade escassa atrasa outro trabalho. Contingência deve refletir falha e preemption observadas nos pilotos.

Energia é potência integrada no tempo mais outros equipamentos. Power usage effectiveness inclui refrigeração e overhead. Carbono depende de onde e quando a eletricidade foi gerada; fator global esconde localização. O estudo de carbono do BLOOM de 2022 separa consumo dinâmico de fronteiras de ciclo de vida, lembrando que totais dependem de escopo.

Uma calculadora recebe variáveis, não preço atual hardcoded: parâmetros, tokens, fator arquitetural, peak throughput, faixa de utilização, device count, preço horário datado, retries, storage, equipe e contingência. Saídas incluem device-hours, elapsed time, compute direto, faixa total e sensibilidade. Mudar devices idealmente muda tempo, não device-hours, até a scaling efficiency mudar.

Reconcilie após a run. Compare tokens, utilização, horas, falhas e gasto planejados versus reais. Explique variação e atualize o próximo budget. Modelo de custo nunca reconciliado é aritmética de marketing.

A lição durável é disciplina contábil. FLOPs estimam trabalho; utilização mapeia trabalho a tempo; preço mapeia tempo a dinheiro; escopo adiciona o necessário para executar; impacto ambiental soma energia e emissões. Todo headline só tem sentido com data, hipóteses e fronteira.

2

Como explicar para uma criança de cinco anos

Estimar uma ponte só pelas toneladas de aço ignora topografia, guindastes parados pelo clima, soldas rejeitadas, vias de acesso, inspeção, financiamento e manutenção. FLOPs são o aço: essenciais e contáveis, mas não a fatura. Um budget real reconcilia material teórico com utilização, retries, preparação, pessoas e a fronteira contábil.

3

Ensine de volta

Construa um modelo transparente de custo, dos tokens e parâmetros até o programa total, indicando as hipóteses dominantes.

Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.

Salvo somente neste dispositivo.

Ver uma resposta-modelo

Estime FLOPs de treinamento pela arquitetura e tokens; divida por peak FLOPs do acelerador vezes utilização medida para obter device-hours; multiplique por preço datado de aluguel ou custo amortizado. Some pilotos, runs descartadas, aquisição e processamento de dados, storage, rede, checkpoints, evals, engenharia e contingência. Calcule energia pela potência medida e overhead; carbono por intensidade local e datada; reporte faixas para utilização, preço e retries.

4

Teste seu entendimento

1. Por que peak FLOPs não equivalem a throughput realizado?
Resposta e explicação

Comunicação, memória, shapes, bubbles e falhas reduzem utilização — Custo real depende de model FLOPs utilization e eficiência operacional, não do máximo de marketing.

2. Que custo costuma sumir quando se cita só a run final?
Resposta e explicação

Pilotos e tentativas falhas — O custo do programa inclui experimentação necessária para escolher e estabilizar a configuração.

Conclua o teach-back e acerte o quiz para finalizar a aula.

Fontes

  1. Teven Le Scao et al. (2022). What Language Model to Train if You Have One Million GPU Hours?.
  2. Alexandra Sasha Luccioni, Sylvain Viguier e Anne-Laure Ligozat (2022). Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model.