vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

Se você já rodou um LLM local com Ollama ou llama.cpp, sabe que funciona muito bem — para uma ou duas pessoas. Quando a demanda vira uma API que precisa atender dezenas de requisições simultâneas, o jogo muda: a GPU fica ociosa esperando, a memória se fragmenta e a vazão despenca. É exatamente esse problema … Read more

A história da NVIDIA

A história da NVIDIA

Em 1993, três engenheiros se reuniram numa lanchonete Denny’s na Califórnia para fundar uma empresa de chips gráficos num mercado que já tinha dezenas de concorrentes. Trinta anos depois, aquela empresa se tornaria — por vários momentos — a mais valiosa do planeta. Esta é a história da NVIDIA: dos flops que quase a mataram … Read more

A história da AMD

A história da AMD

Nenhuma empresa de tecnologia morreu e renasceu tantas vezes quanto a AMD. Fundada em 1969 para viver à sombra da Intel, ela passou cinco décadas alternando golpes de gênio (o Athlon, o x86-64, o Zen) com beiras de abismo — até que uma engenheira chamada Lisa Su transformou uma ação de US$ 2 na maior … Read more

AMD vence a Nvidia em todas as especificações — e mesmo assim perde

AMD vence a Nvidia em todas as especificações — e mesmo assim perde

Resumo em vídeo: este artigo é um resumo detalhado do vídeo “AMD Beats Nvidia On Every Spec And Still Loses”, do canal The Stack. URL do vídeo: https://www.youtube.com/watch?v=bOHhUVSDmrw No papel, a disputa nem deveria existir: o acelerador AMD MI300X carrega 192 GB de memória contra 80 GB do Nvidia H100, move 5,3 TB/s de banda … Read more

Google TPUs: arquitetura, gerações e modelos

Google TPUs: arquitetura, gerações e modelos

Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usuário Android usasse o comando de voz da Busca por três minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers só para inferência. GPU de consumo ainda era placa de jogo adaptada. A resposta foi … Read more

Servidor de IA recondicionado com 64 GB de VRAM

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Read more

Como funcionam as placas de vídeo

Como funcionam as placas de vídeo

Quantos cálculos uma placa de vídeo faz por segundo para desenhar um frame de Cyberpunk ou para treinar uma rede? O canal Branch Education desmontou uma RTX 3090 — no sentido literal — e reconstruiu o die GA102 em 3D. Este texto segue o vídeo How do Graphics Cards Work? Exploring GPU Architecture. A geração … Read more

GPU vs TPU: como os chips de IA funcionam

GPU vs TPU: how AI chips work

Por trás de cada token do ChatGPT, de cada frame do Sora e de cada LLM que você roda no Ollama, tem um acelerador fazendo a mesma conta trilhões de vezes: multiplicação de matrizes. Os dois jeitos de fazer isso em silício — GPU (NVIDIA) e TPU (Google) — partem de filosofias opostas. Este texto … Read more