Trilha de aprendizagem
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
advanced · 12 aulas disponíveis
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- O que realmente acontece quando você aperta enviar
- O KV cache
- Prefill e decode: duas máquinas diferentes
- Sampling: temperature, top-k, top-p e min-p
- Beam search, speculative decoding e Medusa
- MQA, GQA e MLA
- FlashAttention e IO-awareness
- PagedAttention e continuous batching
- Quantização I: int8, int4 e fundamentos
- Quantização II: GPTQ, AWQ, GGUF e QAT
- Serving stacks: vLLM, SGLang e TensorRT-LLM
- Executando modelos localmente