
Um servidor com oito GPUs NVIDIA B300 não é uma “máquina com placa de vídeo”: é infraestrutura de data center para servir modelos de IA muito grandes a muitos usuários ao mesmo tempo. Neste vídeo, a BIZON mostra o X9000 G5, com oito GPUs NVIDIA B300 em uma plataforma HGX B300, executando o Kimi K3 com vLLM e medindo a vazão de 1 a 128 usuários concorrentes. A demonstração é interessante, mas também é uma boa oportunidade para separar arquitetura, servidor comercial e benchmark de marketing.
Resumo em vídeo: “NVIDIA B300 Server Review: 8 GPUs, 128 Users, AI Benchmarks”, do canal BIZON, publicado em 7 de setembro de 2026. O fabricante apresenta o BIZON X9000 G5 com oito GPUs NVIDIA B300 em uma plataforma HGX B300 e resultados de inferência com Kimi K3 e vLLM. Assistir no YouTube.
O que é NVIDIA B300, HGX B300 e BIZON X9000 G5?
Os nomes parecem parecidos, mas descrevem camadas diferentes da solução:
- NVIDIA B300: GPU da geração Blackwell Ultra voltada a IA, HPC e inferência em data center.
- NVIDIA HGX B300: plataforma/baseboard de oito GPUs B300 conectadas por NVLink e NVSwitch.
- BIZON X9000 G5: servidor do fabricante BIZON que integra a plataforma HGX B300 em um chassi próprio.
- NVIDIA DGX B300: outro produto: um sistema NVIDIA completo. Ele não é o X9000 G5 e não deve ser tratado como se fosse a mesma máquina.
Essa distinção importa ao comparar CPU, memória de sistema, rede, fontes, suporte e software. Duas máquinas podem usar HGX B300, mas continuar sendo produtos diferentes, com escolhas de integração e suporte diferentes.
O que a plataforma HGX B300 entrega
Na arquitetura de referência da NVIDIA, um nó HGX B300 reúne oito GPUs Blackwell Ultra. Cada GPU tem 288 GB de HBM3e, chegando a 2,30 TB de memória HBM3e no nó. A documentação também indica até 8 TB/s de largura de banda de memória por GPU e 64 TB/s no agregado do conjunto de GPUs.
Para modelos grandes, capacidade de memória não basta: as GPUs precisam trocar ativações, pesos particionados e dados de comunicação sem transformar a rede externa em gargalo. Por isso o HGX B300 usa NVLink de quinta geração e NVSwitch. A NVIDIA informa 1,8 TB/s de comunicação GPU-a-GPU e 14,4 TB/s agregados no domínio de oito GPUs. Para escalar além de um nó, a referência traz oito SuperNICs ConnectX-8, com até 800 Gb/s por adaptador.
É a diferença entre colocar muitas GPUs independentes em um servidor e construir um domínio acelerado que consegue cooperar ao servir um LLM. Para entender por que memória, interconexão e formato numérico pesam tanto em IA, veja também GPU vs TPU: como os chips de IA funcionam.
O que o BIZON X9000 G5 adiciona ao conjunto
O X9000 G5 é a integração da BIZON em formato 8U. Na configuração AMD listada pelo fabricante, há suporte a dois processadores EPYC 9005/9004, até 3 TB de DDR5 ECC, oito baias frontais NVMe Gen5 hot-swap e quatro slots PCIe Gen5 x16. A página também lista opções de rede com oito portas OSFP de 800 Gb/s para InfiniBand XDR ou dois links Ethernet de 400 Gb/s por ConnectX-8.
Há também uma variante Intel listada pela BIZON, com dois Xeon 6500/6700 e até 4 TB de DDR5. Portanto, não faz sentido falar em “a” quantidade de RAM de CPU do X9000 G5 sem dizer qual configuração está sendo cotada. Itens como CPU, RAM, armazenamento, adaptadores e contrato de suporte fazem parte do projeto, não são detalhes de rodapé.
O benchmark do vídeo: Kimi K3 com vLLM
A BIZON usa o vLLM como servidor de inferência e afirma carregar o Kimi K3 no conjunto de oito GPUs. A métrica central divulgada é vazão agregada, em tokens por segundo, conforme o número de usuários simultâneos aumenta:
| Usuários concorrentes | Vazão agregada divulgada |
|---|---|
| 1 | 99,8 tokens/s |
| 32 | 2.058,7 tokens/s |
| 64 | 3.013,4 tokens/s |
| 128 | 4.508,8 tokens/s |
Esses valores são resultados reportados pelo fabricante no vídeo para uma única carga de trabalho; não são 4.508,8 tokens/s para cada pessoa e não medem automaticamente a experiência de qualquer aplicação. Ainda assim, eles ilustram uma característica importante de servidores de inferência: sob concorrência, o agendamento em lote contínuo pode elevar muito a quantidade total de tokens produzidos por segundo.
Por que tokens por segundo não bastam
Uma tabela de throughput é só uma parte do teste. Para decidir se uma plataforma atende um chatbot, uma API de agentes ou uma equipe interna, é preciso medir também time to first token (TTFT), latência por token, percentis P95/P99, taxa de erro, comprimento de contexto, tamanho de entrada e saída, política de fila e consumo real.
O vídeo não publica detalhes suficientes para uma reprodução independente: versão e quantização exatas do modelo, versão e parâmetros do vLLM, prompts, limite de saída, método de concorrência, TTFT e percentis de latência não estão documentados na descrição. Por isso, a leitura correta é: uma demonstração de capacidade do conjunto BIZON + HGX B300 + carga escolhida, e não uma classificação universal entre GPUs ou uma promessa de capacidade para todo modelo.
Quanto custa o BIZON X9000 G5 e cada B300?
Preço de hardware de IA corporativo é pouco transparente: não há uma tabela pública de varejo para B300 nas referências consultadas, e OEMs e integradores comercializam esses sistemas por cotação. Por isso, o valor correto para planejamento é uma faixa de referência, seguida de uma cotação para a configuração exata.
Na consulta feita em 11 de setembro de 2026, a página da BIZON mostrava o X9000 G5 a partir de US$ 496.728. É preço inicial de um servidor completo, não de oito GPUs avulsas: CPU, memória de sistema, NVMe, rede, chassi, fontes, integração e suporte também compõem a proposta. Frete, impostos, importação e serviços locais podem mudar o custo final.
Como referência de mercado, o AI Hardware Price Index registrou em 31 de agosto de 2026 uma mediana de US$ 544.280 por nó novo HGX B300 com oito GPUs, equivalente a US$ 68.035 por GPU na métrica do índice. Naquele levantamento, os anúncios variavam de US$ 399.999 a US$ 682.000 por nó.
Esse número de US$ 68.035 não é MSRP nem preço de uma B300 solta: é a divisão do preço anunciado de sistemas completos de oito GPUs. O próprio índice ressalta que trabalha com preços pedidos por vendedores, não com vendas concluídas, e não padroniza CPU, RAM, armazenamento ou garantia. Já o preço inicial de US$ 496.728 da BIZON corresponde a cerca de US$ 62.091 por GPU apenas se o custo total do servidor for dividido igualmente por oito — um cálculo de comparação, não o preço de compra de cada acelerador.
Em resumo: as referências consultadas indicam US$ 496.728 como preço inicial do X9000 G5 e US$ 544.280 como mediana de anúncios de nós HGX B300. No levantamento do índice, a faixa observada foi de US$ 399.999 a US$ 682.000 por nó — cerca de US$ 50 mil a US$ 85.250 por GPU apenas como base de comparação do sistema. Para uma decisão de compra, peça cotação formal com a lista de componentes, modalidade de suporte, prazo, entrega e custos fiscais aplicáveis ao país de destino.
Outros servidores BIZON para IA e LLMs
O X9000 G5 é a opção de topo baseada em HGX B300, mas não é a única linha da BIZON para IA. No catálogo consultado em 11 de setembro de 2026, há servidores HGX com gerações anteriores e linhas PCIe configuráveis. A tabela abaixo resume as famílias; disponibilidade, GPU exata, RAM, CPU e rede precisam ser confirmadas na cotação.
| Linha BIZON | Formato e aceleradores listados | Onde se encaixa |
|---|---|---|
| X9000 G5 | HGX B300 com 8 GPUs B300 | Nó de data center para modelos muito grandes, inferência compartilhada, treinamento e HPC. |
| X9000 G4 | HGX B200 com 8 GPUs B200 | Alternativa Blackwell anterior, também com NVLink/NVSwitch para cargas distribuídas entre oito GPUs. |
| X9000 G3 | HGX H200 ou H100 com 8 GPUs | Plataforma Hopper para LLMs, treinamento e inferência em data center. |
| G9000 | Configurações de 4 ou 8 GPUs A100, H100 ou H200 | Servidor GPU de data center configurável para IA, deep learning e computação paralela. |
| X7000 (G3) / G7000 G5 | Até 8 GPUs PCIe; o X7000 é listado com RTX PRO 6000 Blackwell, A100, H100 e H200. O G7000 G5 lista RTX PRO 4000/4500/5000/6000 Blackwell, A100, H100 NVL e H200 NVL. | Treinamento, inferência e serviços de LLM quando a flexibilidade de GPUs PCIe é mais importante que uma base HGX. |
| X8000 / G8000 | Até 4 GPUs PCIe; as páginas listam RTX PRO 6000 Blackwell, A100, H100 e H200 | Inferência, ajuste fino e equipes que não precisam de oito aceleradores no mesmo nó. |
| Z9000 / ZX9000 | Linhas de servidor com refrigeração líquida e GPUs NVIDIA configuráveis | Ambientes em que ruído, temperatura e carga sustentada influenciam a escolha do projeto. |
Para uma implantação menor ou para LLMs locais, a BIZON também anuncia workstations multi-GPU, como a ZX5500. Não se deve, porém, comparar apenas a quantidade de GPUs: B300/HGX usa uma interconexão de data center diferente de placas PCIe. Memória por GPU, interconexão, contexto do modelo, latência desejada, energia e suporte devem guiar a seleção.
Segundo a própria BIZON, o BizonOS é baseado em Ubuntu 24.04 e vem com componentes como CUDA, Docker, PyTorch, TensorFlow, vLLM, Ollama, Hugging Face Transformers, Jupyter e RAPIDS. É uma oferta de software do fabricante; antes de contratar, confirme quais versões, imagens de contêiner e níveis de suporte fazem parte da configuração escolhida.
Infraestrutura: o servidor é apenas uma parte do projeto
Um nó 8U com oito aceleradores de data center exige planejamento de rack, energia, refrigeração, ruído, rede e operação. A BIZON lista doze fontes redundantes de 3.000 W e ambiente operacional de 10 °C a 30 °C; essa capacidade das fontes não é uma medição de consumo do equipamento. Em sua própria página, o fabricante apresenta como exemplo uma faixa de 2.700 a 2.900 W para uma configuração específica com oito B300 e dois EPYC 9335, em carga de 100%.
Antes de comprar ou implantar, valide com fornecedor, eletricista e time de data center: circuitos e redundância elétrica, tipo de rack, capacidade térmica, fluxo de ar, rede de baixa latência, armazenamento, firmware, drivers, observabilidade e plano de manutenção. Isso está muito além do cenário de uma estação de trabalho ou de IA local com uma única GPU — para esse outro perfil, compare com nosso guia de servidor de IA recondicionado com 64 GB de VRAM.
Onde uma máquina assim faz sentido
- Inferência compartilhada: servir um modelo grande para muitos usuários, APIs ou agentes simultâneos.
- RAG corporativo: concentrar um modelo de linguagem grande no ambiente da empresa, desde que a arquitetura inclua controle de acesso e dados.
- Treino e ajuste fino: fluxos que se beneficiam de grande memória agregada e comunicação rápida entre GPUs.
- HPC e pesquisa: simulações e pipelines acelerados que cabem no ecossistema CUDA.
Para operar esse tipo de serviço, monitore tanto a aplicação quanto a infraestrutura: filas, latência, falhas de requisição, uso de GPU, temperatura, energia e rede. O guia de OpenObserve para logs, métricas e traces é um ponto de partida para pensar na telemetria, e o artigo sobre Prometheus e Node Exporter cobre a base do host Linux.
Checklist técnico antes de avaliar uma proposta
- Qual modelo, versão, contexto, quantização e SLA de latência precisam ser atendidos?
- O teste informa TTFT, P95/P99, prompts, taxa de erro e versão do servidor de inferência?
- A configuração é AMD ou Intel? Quanta RAM, NVMe e rede estão incluídos?
- O rack, a energia, o resfriamento e a acústica suportam a implantação?
- Como serão observados GPU, host, rede, API e fila? Qual é o plano de incidentes?
- Quais são as condições de suporte, substituição de peças, firmware e drivers?
Conclusão
O BIZON X9000 G5 mostra o que a classe HGX B300 foi desenhada para fazer: concentrar oito GPUs Blackwell Ultra, muita memória HBM3e e interconexão rápida em um nó para IA em escala. O vídeo é útil por trazer números de concorrência, mas eles devem ser lidos como o resultado de uma demonstração específica. A decisão séria começa depois do vídeo: reproduzir a carga real, medir latência além do throughput e desenhar toda a infraestrutura ao redor do servidor.
Fontes
- BIZON — NVIDIA B300 Server Review: 8 GPUs, 128 Users, AI Benchmarks
- BIZON — X9000 G5
- NVIDIA — HGX AI Factory: componentes e especificações do HGX B300
- NVIDIA Developer Blog — Blackwell Ultra
- NVIDIA — Introdução ao DGX B300
- Hashrate Index — AI Hardware Price Index (preços pedidos de nós HGX B300)
- BIZON — servidores NVIDIA para IA, treinamento, inferência e LLMs
- BIZON — BizonOS e stack de IA baseado em Ubuntu 24.04