vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

Se você já rodou um LLM local com Ollama ou llama.cpp, sabe que funciona muito bem — para uma ou duas pessoas. Quando a demanda vira uma API que precisa atender dezenas de requisições simultâneas, o jogo muda: a GPU fica ociosa esperando, a memória se fragmenta e a vazão despenca. É exatamente esse problema … Read more