Cerebras CS-4: IA em wafer-scale, história e investidores

Cerebras CS-4: IA a escala de oblea, historia e inversores

Quando uma aplicação de IA precisa raciocinar, chamar ferramentas e responder para muitas pessoas ao mesmo tempo, não basta contar FLOPS: a latência para gerar cada token, a memória e a comunicação entre aceleradores passam a definir a experiência. O vídeo abaixo apresenta o Cerebras CS-4, sistema de rack baseado em processadores do tamanho de … Read more

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

Se você já rodou um LLM local com Ollama ou llama.cpp, sabe que funciona muito bem — para uma ou duas pessoas. Quando a demanda vira uma API que precisa atender dezenas de requisições simultâneas, o jogo muda: a GPU fica ociosa esperando, a memória se fragmenta e a vazão despenca. É exatamente esse problema … Read more