{"id":426,"date":"2026-09-05T22:11:32","date_gmt":"2026-09-06T01:11:32","guid":{"rendered":"https:\/\/www.linuxpro.com.br\/2026\/09\/servidor-ia-recondicionado-64gb-vram-v100-p100-mi25\/"},"modified":"2026-09-08T05:23:38","modified_gmt":"2026-09-08T08:23:38","slug":"servidor-ia-recondicionado-64gb-vram-v100-p100-mi25","status":"publish","type":"post","link":"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/servidor-ia-recondicionado-64gb-vram-v100-p100-mi25\/","title":{"rendered":"Servidor de IA recondicionado com 64 GB de VRAM"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" alt=\"Mascote do LinuxPro instalando GPU no servidor de IA\" src=\"\/wp-content\/uploads\/2026\/09\/servidor-ia-v3.webp\" width=\"1052\" height=\"652\" \/><\/p>\n<p>VRAM dita o modelo. Qwen denso 27B\u201332B, Llama 70B quantizado, Mixtral 8\u00d77B \u2014 isso pede 32 a 64 GB, n\u00e3o os 24 GB de uma 4090. O engenheiro <strong>Donato Capitella<\/strong>, com a <strong>Bargain Hardware<\/strong>, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de \u00a32.000 e mediu V100, P100 e MI25 no mesmo chassi. Este texto segue o v\u00eddeo <a href=\"https:\/\/www.youtube.com\/watch?v=zp8j4vO-wz0\">Refurbished 64GB VRAM AI Server for Local AI<\/a>.<\/p>\n<p><!-- more --><\/p>\n<div style=\"position:relative;padding-bottom:56.25%;height:0;overflow:hidden;margin:1.5em 0\">\n<iframe src=\"https:\/\/www.youtube.com\/embed\/zp8j4vO-wz0\" title=\"Refurbished 64GB VRAM AI Server for Local AI \u2014 Donato Capitella\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" allowfullscreen style=\"position:absolute;top:0;left:0;width:100%;height:100%;border:0\"><\/iframe>\n<\/div>\n<p>Quem j\u00e1 roda <a href=\"\/en\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">Ollama<\/a> no desktop bate no teto da placa de consumo. Aqui a aposta \u00e9 outra: chassi de servidor, placa passiva, llama.cpp compilado para a arquitetura certa. O porqu\u00ea dos Tensor Cores da V100 ganharem da P100 est\u00e1 no post <a href=\"\/en\/2026\/09\/como-funcionam-placas-de-video\/\">How graphics cards work<\/a> e no <a href=\"\/en\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU<\/a>.<\/p>\n<h2>O chassi: Supermicro de 12\u00aa gera\u00e7\u00e3o<\/h2>\n<p>A base do v\u00eddeo \u00e9 um servidor empresarial Supermicro (torre\/rack 4U\u20135U, fam\u00edlia CSE-747) pensado para HPC, n\u00e3o para ficar embaixo da mesa:<\/p>\n<pre data-no-translation=\"\"><code class=\"language-text\" data-no-translation=\"\">2\u00d7 Intel Xeon Gold 6150     36 n\u00facleos \/ 72 threads\n64 GB DDR4 ECC Registered   4\u00d7 16 GB @ 2666 MHz\n2\u00d7 SSD SATA 480 GB + NVMe U.2\n4\u00d7 PCIe 3.0 x16             full-height, dual-slot\n2\u00d7 10GbE na placa-m\u00e3e\nturbinas frontais           ar for\u00e7ado nas aletas\nfontes redundantes          1600\u20132000 W\n<\/code><\/pre>\n<p>Tesla e Instinct de datacenter s\u00e3o <strong>passivas<\/strong>: n\u00e3o t\u00eam ventoinha na placa. Quem empurra o ar s\u00e3o as turbinas do chassi, a milhares de RPM, atrav\u00e9s das aletas de cobre. Desktop gamer com 4\u00d7 V100 cozinha as placas \u2014 e o PSU dom\u00e9stico n\u00e3o aguenta o pico.<\/p>\n<h2>V100 vs P100 vs MI25<\/h2>\n<p>Tr\u00eas jogos de quatro placas de 16 GB (64 GB no total):<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>Tesla V100 16 GB<\/th>\n<th>Tesla P100 16 GB<\/th>\n<th>Instinct MI25 16 GB<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Arquitetura<\/td>\n<td>Volta 12 nm (sm_70)<\/td>\n<td>Pascal 16 nm (sm_60)<\/td>\n<td>Vega 10 14 nm (gfx900)<\/td>\n<\/tr>\n<tr>\n<td>Mem\u00f3ria<\/td>\n<td>16 GB HBM2, 900 GB\/s<\/td>\n<td>16 GB HBM2, 720\u2013900 GB\/s<\/td>\n<td>16 GB HBM2, 484 GB\/s<\/td>\n<\/tr>\n<tr>\n<td>Tensor Cores<\/td>\n<td>sim (1\u00aa gera\u00e7\u00e3o, 640)<\/td>\n<td>n\u00e3o<\/td>\n<td>n\u00e3o<\/td>\n<\/tr>\n<tr>\n<td>Precis\u00f5es<\/td>\n<td>FP16\/32\/64, INT8<\/td>\n<td>FP16\/32\/64<\/td>\n<td>FP16\/32<\/td>\n<\/tr>\n<tr>\n<td>BF16 \/ FP8<\/td>\n<td>n\u00e3o nativo<\/td>\n<td>n\u00e3o nativo<\/td>\n<td>n\u00e3o nativo<\/td>\n<\/tr>\n<tr>\n<td>Stack<\/td>\n<td>CUDA \/ llama.cpp<\/td>\n<td>CUDA \/ llama.cpp<\/td>\n<td>ROCm \/ Vulkan \/ llama.cpp<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>O divisor \u00e9 o Tensor Core. LLM \u00e9 MatMul; a V100 faz a matriz em lote. P100 e MI25 fazem o mesmo caminho no CUDA core \/ SIMD da Vega \u2014 mais lento, mais barato. Nenhuma das tr\u00eas fala BF16 nativo: o runtime converte para FP16.<\/p>\n<p>Detalhe de 2026 que o v\u00eddeo j\u00e1 antecipa na pr\u00e1tica: o <strong>CUDA 13 tirou o sm_70<\/strong>. A V100 \u00e9 a \u00faltima arquitetura com suporte de primeira classe no CUDA 12.x. Os containers do Donato pinam <strong>CUDA 12.6.3<\/strong> e compilam llama.cpp com <code data-no-translation=\"\">-DCMAKE_CUDA_ARCHITECTURES=70<\/code>. Toolkit 13 no host = bin\u00e1rio que n\u00e3o gera c\u00f3digo para a placa.<\/p>\n<h2>Software: llama.cpp, n\u00e3o vLLM<\/h2>\n<p>Donato publica toolboxes (Toolbx\/Podman) com llama.cpp j\u00e1 compilado para cada die:<\/p>\n<ul>\n<li><a href=\"https:\/\/github.com\/kyuz0\/nvidia-v100-ai-toolboxes\">nvidia-v100-ai-toolboxes<\/a> \u2014 CUDA 12.6.3, sm_70<\/li>\n<li><a href=\"https:\/\/github.com\/kyuz0\/nvidia-p100-ai-toolboxes\">nvidia-p100-ai-toolboxes<\/a> \u2014 sm_60<\/li>\n<li><a href=\"https:\/\/github.com\/kyuz0\/mi25-gfx900-ai-toolboxes\">mi25-gfx900-ai-toolboxes<\/a> \u2014 gfx900, ROCm\/Vulkan<\/li>\n<\/ul>\n<pre data-no-translation=\"\"><code class=\"language-bash\" data-no-translation=\"\"># V100: toolbox com llama.cpp CUDA sm_70\ntoolbox create -c llama-v100-cuda \n  --image docker.io\/kyuz0\/nvidia-v100-ai-toolboxes:latest\ntoolbox enter llama-v100-cuda\nllama-cli --list-devices   # precisa ver as 4\u00d7 16 GB\n<\/code><\/pre>\n<p>Na hora de servir, llama.cpp ganha: GGUF maduro (Q4_K_M, Q4_K_XL, Q8_0), split autom\u00e1tico das camadas nas 4 GPUs (<code data-no-translation=\"\">-ngl 99<\/code>), overhead pequeno. vLLM \u00e9 o padr\u00e3o de produ\u00e7\u00e3o em Hopper\/Blackwell; em Volta\/Pascal recai para SDPA do PyTorch, AWQ quase n\u00e3o cola, e o load pelo PCIe 3.0 d\u00f3i.<\/p>\n<pre data-no-translation=\"\"><code class=\"language-bash\" data-no-translation=\"\">llama-server \n  -m \/models\/qwen-27b-instruct-q4_k_xl.gguf \n  -ngl 99 \n  -c 32768 \n  -fa on \n  --host 0.0.0.0 --port 8080\n<\/code><\/pre>\n<p>Quem j\u00e1 usa o fluxo GGUF sem o daemon do Ollama tem o <a href=\"\/en\/2026\/09\/llama-model-cli\/\">llama-model<\/a> no mesmo esp\u00edrito: um bin\u00e1rio, um servidor, sem camada a mais. O <a href=\"\/en\/2017\/08\/curso-de-docker-gratis\/\">curso de Docker<\/a> cobre o Podman\/Toolbx se o host ainda n\u00e3o tem.<\/p>\n<h2>N\u00fameros: Qwen 27B Q4<\/h2>\n<p>Modelo denso, quantiza\u00e7\u00e3o 4 bits, o recorte que o v\u00eddeo usa como assistente de c\u00f3digo. N\u00fameros do pr\u00f3prio Donato (llama.cpp, NGL=99, flash attention):<\/p>\n<pre data-no-translation=\"\"><code class=\"language-text\" data-no-translation=\"\">gera\u00e7\u00e3o (tokens\/s)     Qwen 27B Q4\n4\u00d7 V100 16 GB          ~31\u201334   (ainda ~28 com contexto 32k)\n4\u00d7 P100 16 GB          ~18\u201322\n4\u00d7 MI25 16 GB          ~14\u201317\n\nprompt processing V100\ncurto:  ~852 tok\/s\n32k:    ~620 tok\/s\n<\/code><\/pre>\n<p>31 tok\/s \u00e9 conversa interativa. 20 tok\/s da P100 serve agente em background. MI25 carrega o modelo pelo menor pre\u00e7o de entrada \u2014 banda de 484 GB\/s e zero acelerador de matriz pesam. MoE grande (Qwen 122B-A10B Q3 no README das toolboxes) cabe nos 64 GB; a vaz\u00e3o cai, a VRAM \u00e9 o que importa.<\/p>\n<h2>O que d\u00f3i no dia a dia<\/h2>\n<ul>\n<li><strong>Ru\u00eddo 60\u201375 dB.<\/strong> Quatro passivas de 250\u2013300 W cada. N\u00e3o vai para o quarto nem para debaixo da mesa. Rack, por\u00e3o, garagem, sala de servidor.<\/li>\n<li><strong>PCIe 3.0.<\/strong> ~16 GB\/s por slot x16. Load de um GGUF de 30\u201350 GB: 1 a 3 minutos. NVLink de V100 existe, mas s\u00f3 em chassi\/SXM espec\u00edfico \u2014 a torre t\u00edpica de Bargain Hardware \u00e9 PCIe solto.<\/li>\n<li><strong>BF16 vira FP16.<\/strong> Modelo moderno pr\u00e9-treinado em bfloat16 perde um pouco de faixa de expoente. Quantiza\u00e7\u00e3o bem calibrada (Unsloth Q4_K_XL etc.) reduz a dor.<\/li>\n<li><strong>Energia.<\/strong> 4\u00d7 GPU + 2\u00d7 Xeon 150 W + turbinas: 800\u20131.200 W cont\u00ednuos. Circuito e PSU redundante n\u00e3o s\u00e3o opcionais.<\/li>\n<li><strong>CUDA 13.<\/strong> N\u00e3o \u201catualize o toolkit e pronto\u201d. Fique no 12.6 das toolboxes, ou o bin\u00e1rio ignora a V100.<\/li>\n<\/ul>\n<h2>Vale a pena em 2026?<\/h2>\n<p>Se a meta \u00e9 <strong>64 GB de VRAM local<\/strong> para 27B\u201332B denso ou MoE, e o or\u00e7amento \u00e9 \u00a32.000\u20133.000, <strong>4\u00d7 V100<\/strong> ainda \u00e9 o melhor retorno do lote: Tensor Core de verdade, llama.cpp est\u00e1vel, m\u00e1quina pronta com fonte industrial. P100 \u00e9 o meio-termo. MI25 \u00e9 a porta de entrada AMD, ciente da banda.<\/p>\n<p>N\u00e3o \u00e9 silencioso, n\u00e3o \u00e9 PCIe 5.0, n\u00e3o \u00e9 BF16 nativo. \u00c9 soberania de dado: o modelo n\u00e3o sai do rack. Uma 4090\/5090 nova continua ganhando em tok\/s por watt e em software (vLLM, FP8) \u2014 e continua sem os 64 GB.<\/p>\n<h2>References<\/h2>\n<ul>\n<li><a href=\"https:\/\/www.youtube.com\/watch?v=zp8j4vO-wz0\">Donato Capitella \u2014 Refurbished 64GB VRAM AI Server<\/a><\/li>\n<li><a href=\"https:\/\/github.com\/kyuz0\/nvidia-v100-ai-toolboxes\">Toolboxes V100 (CUDA 12.6.3 \/ sm_70)<\/a><\/li>\n<li><a href=\"https:\/\/github.com\/kyuz0\/nvidia-p100-ai-toolboxes\">Toolboxes P100 (sm_60)<\/a><\/li>\n<li><a href=\"https:\/\/github.com\/kyuz0\/mi25-gfx900-ai-toolboxes\">Toolboxes MI25 (gfx900)<\/a><\/li>\n<li><a href=\"\/en\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">IA local no Linux com Ollama<\/a><\/li>\n<li><a href=\"\/en\/2026\/09\/llama-model-cli\/\">llama-model: GGUF e llama-server sem o daemon<\/a><\/li>\n<li><a href=\"\/en\/2026\/09\/como-funcionam-placas-de-video\/\">Como funcionam as placas de v\u00eddeo<\/a><\/li>\n<li><a href=\"\/en\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU<\/a><\/li>\n<\/ul>\n<p>Quatro V100 num chassi barulhento n\u00e3o viram uma H100. Viram 64 GB de VRAM que uma placa de consumo ainda n\u00e3o vende \u2014 e um llama.cpp que, compilado para sm_70, conversa em 30 tokens por segundo sem mandar o prompt para a nuvem.<\/p>","protected":false},"excerpt":{"rendered":"<p>VRAM dita o modelo. Qwen denso 27B\u201332B, Llama 70B quantizado, Mixtral 8\u00d77B \u2014 isso pede 32 a 64 GB, n\u00e3o os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de \u00a32.000 e mediu V100, P100 &#8230; <a title=\"Servidor de IA recondicionado com 64 GB de VRAM\" class=\"read-more\" href=\"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/servidor-ia-recondicionado-64gb-vram-v100-p100-mi25\/\" aria-label=\"Read more about Servidor de IA recondicionado com 64 GB de VRAM\">Read more<\/a><\/p>","protected":false},"author":0,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[115,2,120],"tags":[153,134,116,128,152],"class_list":["post-426","post","type-post","status-publish","format-standard","hentry","category-ia","category-linux","category-servidores","tag-cuda","tag-gpu","tag-ia","tag-llm","tag-nvidia"],"_links":{"self":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/426","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/comments?post=426"}],"version-history":[{"count":2,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/426\/revisions"}],"predecessor-version":[{"id":1136,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/426\/revisions\/1136"}],"wp:attachment":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/media?parent=426"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/categories?post=426"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/tags?post=426"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}