Fronteira
TensorRT-LLM
O TensorRT-LLM atual usa apenas o backend PyTorch: checkpoints Hugging Face carregam diretamente, enquanto kernels, scheduling, cache e paralelismo continuam especializados para NVIDIA.
Atualizada em
01 · Conceito
Conceito
Seu deployment em vLLM funciona, e você quer outro stack especializado em NVIDIA. A documentação atual muda a premissa: em agosto de 2026 o TensorRT-LLM removeu o backend de engines TensorRT serializados. PyTorch agora é o único backend, e AutoDeploy permanece sobre ele.
Não há conversão separada nem etapa trtllm-build. O comando atual é trtllm-serve apontado diretamente para um checkpoint Hugging Face. Isso não é PyTorch eager: o runtime ainda fornece kernels NVIDIA, in-flight batching, KV paginado, quantization, speculative decoding e paralelismo. Fixe checkpoint e runtime, configure memória e scheduling e meça o workload real; não mantenha uma matriz de engines por shape congelado.
A quantization ainda pode liberar capacidade relevante de serving ao encolher os pesos residentes e, quando o runtime suporta um formato de KV em baixa precisão validado, também o cache. Não deduza um multiplicador apenas pela largura em bits: a lição 7.2 é dona da derivação de KV específica do modelo, e a lição 9.3 é dona do orçamento completo do acelerador, incluindo reserva de runtime e estado recorrente. Refaça a conta ali com o artefato e a configuração de runtime exatos e exija o canário de corretude da lição 8.1 antes de tratar a capacidade recuperada como utilizável.
O serving é, no mais, familiar. In-flight batching é o nome que o TensorRT-LLM dá ao escalonamento em nível de iteração da lição 7.8: requisições entram e saem entre passos de decode em vez de esperar um batch fixo esvaziar. KV paginado, chunked prefill e speculative decoding têm contrapartes aqui. A interface do servidor e a configuração diferem do vLLM, mas os conceitos transferem intactos, razão pela qual esta lição pode gastar seu espaço nas partes que não transferem.
A conta operacional agora é uma matriz de compatibilidade e configuração, não de engines serializados. Uma atualização de runtime pode mudar kernels, memória ou cobertura de operadores; uma nova precisão pode mudar qualidade; um novo perfil de tráfego pode pedir outro scheduling. Fixe versões, preserve canários de corretude, registre a capacidade de KV realizada e revalide cada mudança material.
O TensorRT-LLM atual oferece um runtime NVIDIA especializado sem engine AOT separado. O preço é dependência do ecossistema NVIDIA e validação por versão, precisão, modelo e workload. A escolha correta passa os mesmos canários e entrega mais goodput dentro do SLO.
02 · Analogia
Analogia
Uma oficina especializada aceita a mesma planta padrão das concorrentes, mas opera máquinas, gabaritos e escalonamento próprios para NVIDIA. Você já não funde um engine separado antes de abrir as portas; entrega um checkpoint Hugging Face ao runtime atual. A especialização ainda pode render throughput, mas mudar modelo, precisão, runtime ou perfil de tráfego exige revalidar toda a linha de produção.
03 · Explique de volta
Explique de volta
Explique a remoção do backend TensorRT, como um checkpoint Hugging Face é servido hoje e o que ainda deve ser validado.
Comparar com uma resposta-modelo
O backend de engines TensorRT serializados foi removido em agosto de 2026. PyTorch agora é o único backend, com AutoDeploy sobre ele. Não há conversão nem trtllm-build: trtllm-serve carrega diretamente um checkpoint Hugging Face. Kernels NVIDIA, in-flight batching, KV paginado, quantization, speculative decoding e paralelismo permanecem. Revisão, runtime, precisão, memória, contexto e cobertura dos operadores Gated DeltaNet ainda exigem validação.
04 · Teste seu entendimento
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
◎ · Marcador de evidência
Fontes
- NVIDIA (2026). TensorRT-LLM Documentation.
- NVIDIA (2026). TensorRT-LLM backend removal.
- NVIDIA (2026). NVIDIA Data Center Technologies.
- NVIDIA (2026). CUDA Toolkit Documentation.
- Qwen Team (2026). Qwen3.8-27B Model Card.