NVIDIA B300: o servidor BIZON X9000 G5 com 8 GPUs para IA

Mascote LinuxPro ao lado de um servidor de IA com oito GPUs e um cachorro caramelo em um data center

Um servidor com oito GPUs NVIDIA B300 não é uma “máquina com placa de vídeo”: é infraestrutura de data center para servir modelos de IA muito grandes a muitos usuários ao mesmo tempo. Neste vídeo, a BIZON mostra o X9000 G5, com oito GPUs NVIDIA B300 em uma plataforma HGX B300, executando o Kimi K3 com vLLM e medindo a vazão de 1 a 128 usuários concorrentes. A demonstração é interessante, mas também é uma boa oportunidade para separar arquitetura, servidor comercial e benchmark de marketing.

Resumo em vídeo: “NVIDIA B300 Server Review: 8 GPUs, 128 Users, AI Benchmarks”, do canal BIZON, publicado em 7 de setembro de 2026. O fabricante apresenta o BIZON X9000 G5 com oito GPUs NVIDIA B300 em uma plataforma HGX B300 e resultados de inferência com Kimi K3 e vLLM. Assistir no YouTube.

O que é NVIDIA B300, HGX B300 e BIZON X9000 G5?

Os nomes parecem parecidos, mas descrevem camadas diferentes da solução:

  • NVIDIA B300: GPU da geração Blackwell Ultra voltada a IA, HPC e inferência em data center.
  • NVIDIA HGX B300: plataforma/baseboard de oito GPUs B300 conectadas por NVLink e NVSwitch.
  • BIZON X9000 G5: servidor do fabricante BIZON que integra a plataforma HGX B300 em um chassi próprio.
  • NVIDIA DGX B300: outro produto: um sistema NVIDIA completo. Ele não é o X9000 G5 e não deve ser tratado como se fosse a mesma máquina.

Essa distinção importa ao comparar CPU, memória de sistema, rede, fontes, suporte e software. Duas máquinas podem usar HGX B300, mas continuar sendo produtos diferentes, com escolhas de integração e suporte diferentes.

O que a plataforma HGX B300 entrega

Na arquitetura de referência da NVIDIA, um nó HGX B300 reúne oito GPUs Blackwell Ultra. Cada GPU tem 288 GB de HBM3e, chegando a 2,30 TB de memória HBM3e no nó. A documentação também indica até 8 TB/s de largura de banda de memória por GPU e 64 TB/s no agregado do conjunto de GPUs.

Para modelos grandes, capacidade de memória não basta: as GPUs precisam trocar ativações, pesos particionados e dados de comunicação sem transformar a rede externa em gargalo. Por isso o HGX B300 usa NVLink de quinta geração e NVSwitch. A NVIDIA informa 1,8 TB/s de comunicação GPU-a-GPU e 14,4 TB/s agregados no domínio de oito GPUs. Para escalar além de um nó, a referência traz oito SuperNICs ConnectX-8, com até 800 Gb/s por adaptador.

É a diferença entre colocar muitas GPUs independentes em um servidor e construir um domínio acelerado que consegue cooperar ao servir um LLM. Para entender por que memória, interconexão e formato numérico pesam tanto em IA, veja também GPU vs TPU: como os chips de IA funcionam.

O que o BIZON X9000 G5 adiciona ao conjunto

O X9000 G5 é a integração da BIZON em formato 8U. Na configuração AMD listada pelo fabricante, há suporte a dois processadores EPYC 9005/9004, até 3 TB de DDR5 ECC, oito baias frontais NVMe Gen5 hot-swap e quatro slots PCIe Gen5 x16. A página também lista opções de rede com oito portas OSFP de 800 Gb/s para InfiniBand XDR ou dois links Ethernet de 400 Gb/s por ConnectX-8.

Há também uma variante Intel listada pela BIZON, com dois Xeon 6500/6700 e até 4 TB de DDR5. Portanto, não faz sentido falar em “a” quantidade de RAM de CPU do X9000 G5 sem dizer qual configuração está sendo cotada. Itens como CPU, RAM, armazenamento, adaptadores e contrato de suporte fazem parte do projeto, não são detalhes de rodapé.

O benchmark do vídeo: Kimi K3 com vLLM

A BIZON usa o vLLM como servidor de inferência e afirma carregar o Kimi K3 no conjunto de oito GPUs. A métrica central divulgada é vazão agregada, em tokens por segundo, conforme o número de usuários simultâneos aumenta:

Usuários concorrentes Vazão agregada divulgada
1 99,8 tokens/s
32 2.058,7 tokens/s
64 3.013,4 tokens/s
128 4.508,8 tokens/s

Esses valores são resultados reportados pelo fabricante no vídeo para uma única carga de trabalho; não são 4.508,8 tokens/s para cada pessoa e não medem automaticamente a experiência de qualquer aplicação. Ainda assim, eles ilustram uma característica importante de servidores de inferência: sob concorrência, o agendamento em lote contínuo pode elevar muito a quantidade total de tokens produzidos por segundo.

Por que tokens por segundo não bastam

Uma tabela de throughput é só uma parte do teste. Para decidir se uma plataforma atende um chatbot, uma API de agentes ou uma equipe interna, é preciso medir também time to first token (TTFT), latência por token, percentis P95/P99, taxa de erro, comprimento de contexto, tamanho de entrada e saída, política de fila e consumo real.

O vídeo não publica detalhes suficientes para uma reprodução independente: versão e quantização exatas do modelo, versão e parâmetros do vLLM, prompts, limite de saída, método de concorrência, TTFT e percentis de latência não estão documentados na descrição. Por isso, a leitura correta é: uma demonstração de capacidade do conjunto BIZON + HGX B300 + carga escolhida, e não uma classificação universal entre GPUs ou uma promessa de capacidade para todo modelo.

Quanto custa o BIZON X9000 G5 e cada B300?

Preço de hardware de IA corporativo é pouco transparente: não há uma tabela pública de varejo para B300 nas referências consultadas, e OEMs e integradores comercializam esses sistemas por cotação. Por isso, o valor correto para planejamento é uma faixa de referência, seguida de uma cotação para a configuração exata.

Na consulta feita em 11 de setembro de 2026, a página da BIZON mostrava o X9000 G5 a partir de US$ 496.728. É preço inicial de um servidor completo, não de oito GPUs avulsas: CPU, memória de sistema, NVMe, rede, chassi, fontes, integração e suporte também compõem a proposta. Frete, impostos, importação e serviços locais podem mudar o custo final.

Como referência de mercado, o AI Hardware Price Index registrou em 31 de agosto de 2026 uma mediana de US$ 544.280 por nó novo HGX B300 com oito GPUs, equivalente a US$ 68.035 por GPU na métrica do índice. Naquele levantamento, os anúncios variavam de US$ 399.999 a US$ 682.000 por nó.

Esse número de US$ 68.035 não é MSRP nem preço de uma B300 solta: é a divisão do preço anunciado de sistemas completos de oito GPUs. O próprio índice ressalta que trabalha com preços pedidos por vendedores, não com vendas concluídas, e não padroniza CPU, RAM, armazenamento ou garantia. Já o preço inicial de US$ 496.728 da BIZON corresponde a cerca de US$ 62.091 por GPU apenas se o custo total do servidor for dividido igualmente por oito — um cálculo de comparação, não o preço de compra de cada acelerador.

Em resumo: as referências consultadas indicam US$ 496.728 como preço inicial do X9000 G5 e US$ 544.280 como mediana de anúncios de nós HGX B300. No levantamento do índice, a faixa observada foi de US$ 399.999 a US$ 682.000 por nó — cerca de US$ 50 mil a US$ 85.250 por GPU apenas como base de comparação do sistema. Para uma decisão de compra, peça cotação formal com a lista de componentes, modalidade de suporte, prazo, entrega e custos fiscais aplicáveis ao país de destino.

Outros servidores BIZON para IA e LLMs

O X9000 G5 é a opção de topo baseada em HGX B300, mas não é a única linha da BIZON para IA. No catálogo consultado em 11 de setembro de 2026, há servidores HGX com gerações anteriores e linhas PCIe configuráveis. A tabela abaixo resume as famílias; disponibilidade, GPU exata, RAM, CPU e rede precisam ser confirmadas na cotação.

Linha BIZON Formato e aceleradores listados Onde se encaixa
X9000 G5 HGX B300 com 8 GPUs B300 Nó de data center para modelos muito grandes, inferência compartilhada, treinamento e HPC.
X9000 G4 HGX B200 com 8 GPUs B200 Alternativa Blackwell anterior, também com NVLink/NVSwitch para cargas distribuídas entre oito GPUs.
X9000 G3 HGX H200 ou H100 com 8 GPUs Plataforma Hopper para LLMs, treinamento e inferência em data center.
G9000 Configurações de 4 ou 8 GPUs A100, H100 ou H200 Servidor GPU de data center configurável para IA, deep learning e computação paralela.
X7000 (G3) / G7000 G5 Até 8 GPUs PCIe; o X7000 é listado com RTX PRO 6000 Blackwell, A100, H100 e H200. O G7000 G5 lista RTX PRO 4000/4500/5000/6000 Blackwell, A100, H100 NVL e H200 NVL. Treinamento, inferência e serviços de LLM quando a flexibilidade de GPUs PCIe é mais importante que uma base HGX.
X8000 / G8000 Até 4 GPUs PCIe; as páginas listam RTX PRO 6000 Blackwell, A100, H100 e H200 Inferência, ajuste fino e equipes que não precisam de oito aceleradores no mesmo nó.
Z9000 / ZX9000 Linhas de servidor com refrigeração líquida e GPUs NVIDIA configuráveis Ambientes em que ruído, temperatura e carga sustentada influenciam a escolha do projeto.

Para uma implantação menor ou para LLMs locais, a BIZON também anuncia workstations multi-GPU, como a ZX5500. Não se deve, porém, comparar apenas a quantidade de GPUs: B300/HGX usa uma interconexão de data center diferente de placas PCIe. Memória por GPU, interconexão, contexto do modelo, latência desejada, energia e suporte devem guiar a seleção.

Segundo a própria BIZON, o BizonOS é baseado em Ubuntu 24.04 e vem com componentes como CUDA, Docker, PyTorch, TensorFlow, vLLM, Ollama, Hugging Face Transformers, Jupyter e RAPIDS. É uma oferta de software do fabricante; antes de contratar, confirme quais versões, imagens de contêiner e níveis de suporte fazem parte da configuração escolhida.

Infraestrutura: o servidor é apenas uma parte do projeto

Um nó 8U com oito aceleradores de data center exige planejamento de rack, energia, refrigeração, ruído, rede e operação. A BIZON lista doze fontes redundantes de 3.000 W e ambiente operacional de 10 °C a 30 °C; essa capacidade das fontes não é uma medição de consumo do equipamento. Em sua própria página, o fabricante apresenta como exemplo uma faixa de 2.700 a 2.900 W para uma configuração específica com oito B300 e dois EPYC 9335, em carga de 100%.

Antes de comprar ou implantar, valide com fornecedor, eletricista e time de data center: circuitos e redundância elétrica, tipo de rack, capacidade térmica, fluxo de ar, rede de baixa latência, armazenamento, firmware, drivers, observabilidade e plano de manutenção. Isso está muito além do cenário de uma estação de trabalho ou de IA local com uma única GPU — para esse outro perfil, compare com nosso guia de servidor de IA recondicionado com 64 GB de VRAM.

Onde uma máquina assim faz sentido

  • Inferência compartilhada: servir um modelo grande para muitos usuários, APIs ou agentes simultâneos.
  • RAG corporativo: concentrar um modelo de linguagem grande no ambiente da empresa, desde que a arquitetura inclua controle de acesso e dados.
  • Treino e ajuste fino: fluxos que se beneficiam de grande memória agregada e comunicação rápida entre GPUs.
  • HPC e pesquisa: simulações e pipelines acelerados que cabem no ecossistema CUDA.

Para operar esse tipo de serviço, monitore tanto a aplicação quanto a infraestrutura: filas, latência, falhas de requisição, uso de GPU, temperatura, energia e rede. O guia de OpenObserve para logs, métricas e traces é um ponto de partida para pensar na telemetria, e o artigo sobre Prometheus e Node Exporter cobre a base do host Linux.

Checklist técnico antes de avaliar uma proposta

  • Qual modelo, versão, contexto, quantização e SLA de latência precisam ser atendidos?
  • O teste informa TTFT, P95/P99, prompts, taxa de erro e versão do servidor de inferência?
  • A configuração é AMD ou Intel? Quanta RAM, NVMe e rede estão incluídos?
  • O rack, a energia, o resfriamento e a acústica suportam a implantação?
  • Como serão observados GPU, host, rede, API e fila? Qual é o plano de incidentes?
  • Quais são as condições de suporte, substituição de peças, firmware e drivers?

Conclusão

O BIZON X9000 G5 mostra o que a classe HGX B300 foi desenhada para fazer: concentrar oito GPUs Blackwell Ultra, muita memória HBM3e e interconexão rápida em um nó para IA em escala. O vídeo é útil por trazer números de concorrência, mas eles devem ser lidos como o resultado de uma demonstração específica. A decisão séria começa depois do vídeo: reproduzir a carga real, medir latência além do throughput e desenhar toda a infraestrutura ao redor do servidor.

Fontes