Pular para o conteúdo
● ONLINE
Arquivo

Tag: KEDA

Autoscaling de IA no Kubernetes: KEDA, vLLM e adeus HPA por CPU

Em workloads de inferência, CPU e memória nem sempre mostram quando a capacidade está saturada. Veja como combinar métricas do vLLM e KEDA para escalar pods com base em fila e latência, considerando também o tempo de carregamento do modelo.

↑