Tesla V100 32 GB: a GPU NVIDIA mais barata para IA local

Capa: mascote do LinuxPro conectando uma Tesla V100 a um dock eGPU numa bancada, com ventilador improvisado e chat de IA no monitor

Rodar modelos de IA de 27 bilhões de parâmetros em casa costuma esbarrar no mesmo muro: o preço de uma GPU com VRAM de sobra. Mas há um atalho vindo direto dos datacenters: a NVIDIA Tesla V100 de 32 GB, aposentada em massa das nuvens e vendida usada por uma fração do preço original — hoje é a GPU de 32 GB mais barata do mercado. O canal Lon.TV colocou uma dessas para trabalhar num desktop comum e o resultado é um belo projeto de fim de semana para quem quer IA local.

Resumo em vídeo: este artigo comenta e complementa o vídeo “The Cheapest 32GB Nvidia GPU You Can Buy for Local AI (Tesla V100)”, do canal Lon.TV (Lon Seidman).
URL do vídeo: https://www.youtube.com/watch?v=3P6m_QBIgAo

O que é a Tesla V100

Lançada em 2017, a V100 foi a GPU de datacenter mais avançada da sua época — e a primeira da NVIDIA com Tensor Cores, os núcleos dedicados a deep learning que hoje definem o mercado de IA. A ficha técnica ainda impressiona: arquitetura Volta (chip GV100 em 12 nm), 5.120 CUDA cores, 640 Tensor Cores, e memória HBM2 de 16 ou 32 GB com 900 GB/s de banda — largura de banda que muitas placas atuais de consumo não alcançam. Foi essa GPU que treinou boa parte da primeira onda de modelos modernos de IA nas nuvens de 2018 a 2022.

Com a chegada das gerações Ampere, Hopper e Blackwell, os datacenters aposentaram as V100 aos milhares — e elas desaguaram no mercado usado. A versão de 32 GB é encontrada na faixa de US$ 500-700 (no Brasil, os anúncios variam bastante; pesquise), enquanto qualquer GeForce nova com essa VRAM custa várias vezes isso.

O experimento do vídeo: V100 num desktop comum

A V100 é uma placa de servidor: não tem saída de vídeo, não tem ventoinha (o resfriamento vinha do fluxo de ar do chassi) e usa conector de energia próprio. O Lon resolveu tudo com engenhosidade de maker:

  • Dock eGPU via OcuLink ligando a placa a um mini PC — a V100 vira uma “GPU externa”;
  • Adaptador de energia para o conector EPS da placa;
  • Ventilação improvisada: um duto com ventilador apontado para o dissipador passivo — sem isso a placa esquenta em segundos;
  • Linux como sistema (a experiência no Windows com placas Tesla é bem mais chata), com direito a configuração assistida por IA no terminal.

Funcionando, a placa rodou com folga modelos recentes de porte médio — nos testes do vídeo, um Qwen de 27B e um Gemma MoE responderam em velocidade confortável de uso, e até modelos de difusão de imagem e vídeo rodaram, algo que placas de 8-12 GB simplesmente não seguram. É a vantagem bruta dos 32 GB de HBM2: modelos inteiros na VRAM, sem offload para a RAM.

A letra miúda: suporte em fim de linha

Antes de correr para o carrinho, o outro lado da moeda — e este é o detalhe que mais importa em 2026:

  • Drivers: a NVIDIA confirmou que a série R580 é a última com suporte às arquiteturas Maxwell, Pascal e Volta. O branch vira “legado”: segue recebendo correções (inclusive compatibilidade com kernels novos) por um tempo, mas sem otimizações novas;
  • CUDA: o CUDA 12.x é a última versão compatível com Volta — o CUDA 13 já não enxerga a placa. Frameworks que exigirem CUDA 13+ no futuro vão deixar a V100 para trás;
  • Consumo e ruído: 250 W de placa + ventilação forçada não é setup silencioso;
  • Sem saída de vídeo: você precisa de outra GPU (ou vídeo integrado) para o monitor.

Na prática, para inferência local hoje — llama.cpp, Ollama, ComfyUI e afins com CUDA 12 — a V100 segue excelente e deve funcionar por anos. Mas é uma compra de custo-benefício imediato, não um investimento de longo prazo.

Vale a pena?

Se a sua meta é rodar modelos de 20-30B quantizados, experimentar difusão de imagem e aprender IA local gastando pouco, os 32 GB de HBM2 por preço de placa intermediária são um argumento fortíssimo — sabendo do trabalho de adaptação (energia, ventilação, eGPU ou servidor) e do horizonte de suporte. Aqui no blog já montamos um servidor de IA recondicionado com 64 GB de VRAM usando exatamente essa lógica de hardware de datacenter aposentado — leitura complementar obrigatória. E para o lado do software, veja como rodar IA local no Linux com Ollama.

Fontes: Lon.TV (vídeo original) · Datasheet oficial da Tesla V100 (NVIDIA) · Wikipedia — arquitetura Volta · Phoronix — driver R580 é o último para Volta