Trilha de aprendizagem
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- 08.01O que realmente acontece quando você aperta enviar→
- 08.02O KV cache→
- 08.03Prefill vs decode: duas máquinas diferentes→
- 08.04Sampling: temperature, top-k, top-p e min-p→
- 08.05Beam search, speculative decoding e Medusa→
- 08.06MQA, GQA e MLA→
- 08.07FlashAttention e IO-awareness→
- 08.08PagedAttention e continuous batching→
- 08.09Quantization I: int8, int4, o básico→
- 08.10Quantization II: GPTQ, AWQ, GGUF, QAT→
- 08.11Serving stacks: vLLM, SGLang, TensorRT-LLM→
- 08.12Rodando modelos localmente→
- 08.13Escolhendo e julgando um quant da comunidade→