NVIDIA B300: el servidor BIZON X9000 G5 con 8 GPUs para IA

Mascote LinuxPro ao lado de um servidor de IA com oito GPUs e um cachorro caramelo em um data center

Un servidor con ocho GPUs NVIDIA B300 no es una “máquina con tarjeta gráfica”: es infraestructura de centro de datos para servir modelos de IA muy grandes a muchos usuarios al mismo tiempo. En este vídeo, BIZON muestra el X9000 G5, con ocho GPUs NVIDIA B300 en una plataforma HGX B300, ejecutando Kimi K3 con vLLM y midiendo el rendimiento de 1 a 128 usuarios concurrentes. La demostración es interesante, pero también es una buena oportunidad para separar arquitectura, servidor comercial y benchmark de marketing.

Resumen en vídeo: “NVIDIA B300 Server Review: 8 GPUs, 128 Users, AI Benchmarks”, del canal BIZON, publicado el 7 de septiembre de 2026. El fabricante presenta el BIZON X9000 G5 con ocho GPUs NVIDIA B300 en una plataforma HGX B300 y resultados de inferencia con Kimi K3 y vLLM. Ver en YouTube.

¿Qué es NVIDIA B300, HGX B300 y BIZON X9000 G5?

Los nombres parecen parecidos, pero describen capas diferentes de la solución:

  • NVIDIA B300: GPU de la generación Blackwell Ultra orientada a IA, HPC e inferencia en centro de datos.
  • NVIDIA HGX B300: plataforma/baseboard de ocho GPUs B300 conectadas mediante NVLink y NVSwitch.
  • BIZON X9000 G5: servidor del fabricante BIZON que integra la plataforma HGX B300 en un chasis propio.
  • NVIDIA DGX B300: otro producto: un sistema NVIDIA completo. No es el X9000 G5 y no debe tratarse como si fuera la misma máquina.

Esta distinción importa al comparar CPU, memoria de sistema, red, fuentes, soporte y software. Dos máquinas pueden usar HGX B300 y aun así ser productos diferentes, con distintas elecciones de integración y soporte.

Qué aporta la plataforma HGX B300

En la arquitectura de referencia de NVIDIA, un nodo HGX B300 reúne ocho GPUs Blackwell Ultra. Cada GPU tiene 288 GB de HBM3e, llegando a 2,30 TB de memoria HBM3e en el nodo. La documentación también indica hasta 8 TB/s de ancho de banda de memoria por GPU y 64 TB/s en el agregado del conjunto de GPUs.

Para modelos grandes, la capacidad de memoria no basta: las GPUs necesitan intercambiar activaciones, pesos particionados y datos de comunicación sin convertir la red externa en un cuello de botella. Por eso el HGX B300 utiliza NVLink de quinta generación y NVSwitch. NVIDIA informa 1,8 TB/s de comunicación GPU-a-GPU y 14,4 TB/s agregados en el dominio de ocho GPUs. Para escalar más allá de un nodo, la referencia incluye ocho SuperNICs ConnectX-8, con hasta 800 Gb/s por adaptador.

Es la diferencia entre colocar muchas GPUs independientes en un servidor y construir un dominio acelerado que consigue cooperar al servir un LLM. Para entender por qué la memoria, la interconexión y el formato numérico pesan tanto en IA, consulta también GPU vs TPU: cómo funcionan los chips de IA.

Qué añade el BIZON X9000 G5 al conjunto

O X9000 G5 es la integración de BIZON en formato 8U. En la configuración AMD listada por el fabricante, hay soporte para dos procesadores EPYC 9005/9004, hasta 3 TB de DDR5 ECC, ocho bahías frontales NVMe Gen5 hot-swap y cuatro slots PCIe Gen5 x16. La página también lista opciones de red con ocho puertos OSFP de 800 Gb/s para InfiniBand XDR o dos enlaces Ethernet de 400 Gb/s por ConnectX-8.

También hay una variante Intel listada por BIZON, con dos Xeon 6500/6700 y hasta 4 TB de DDR5. Por lo tanto, no tiene sentido hablar de “la” cantidad de RAM de CPU del X9000 G5 sin decir qué configuración se está cotizando. Elementos como CPU, RAM, almacenamiento, adaptadores y contrato de soporte forman parte del proyecto, no son detalles al pie.

El benchmark del vídeo: Kimi K3 con vLLM

BIZON utiliza vLLM como servidor de inferencia y afirma cargar Kimi K3 en el conjunto de ocho GPUs. La métrica central divulgada es throughput agregado, en tokens por segundo, a medida que aumenta el número de usuarios simultáneos:

Usuarios concurrentes Throughput agregado divulgado
1 99,8 tokens/s
32 2.058,7 tokens/s
64 3.013,4 tokens/s
128 4.508,8 tokens/s

Estos valores son resultados comunicados por el fabricante en el vídeo para una única carga de trabajo; no son 4.508,8 tokens/s por persona y no miden automáticamente la experiencia de ninguna aplicación. Aun así, ilustran una característica importante de los servidores de inferencia: bajo concurrencia, la planificación por lotes continuos puede elevar mucho la cantidad total de tokens producidos por segundo.

Por qué los tokens por segundo no bastan

Una tabla de rendimiento es solo una parte de la prueba. Para decidir si una plataforma satisface a un chatbot, una API de agentes o un equipo interno, hay que medir también time to first token (TTFT), latencia por token, percentiles P95/P99, tasa de error, longitud de contexto, tamaño de entrada y salida, política de colas y consumo real.

El vídeo no publica suficientes detalles para una reproducción independiente: la versión y cuantización exactas del modelo, la versión y parámetros de vLLM, los prompts, el límite de salida, el método de concurrencia, el TTFT y los percentiles de latencia no están documentados en la descripción. Por eso, la lectura correcta es: una demostración de capacidad del conjunto BIZON + HGX B300 + carga elegida, y no una clasificación universal entre GPUs ni una promesa de capacidad para todo modelo.

¿Cuánto cuesta el BIZON X9000 G5 y cada B300?

El precio del hardware de IA empresarial es poco transparente: no hay una tabla pública de venta al público para B300 en las referencias consultadas, y los OEM e integradores comercializan estos sistemas mediante cotización. Por eso, el valor correcto para planificación es un rango de referencia, seguido de una cotización para la configuración exacta.

En la consulta realizada el 11 de septiembre de 2026, la página de BIZON mostraba el X9000 G5 desde US$ 496.728. Es precio inicial de un servidor completo, no de ocho GPUs sueltas: CPU, memoria de sistema, NVMe, red, chasis, fuentes, integración y soporte también componen la propuesta. El envío, impuestos, importación y servicios locales pueden cambiar el coste final.

Como referencia de mercado, el AI Hardware Price Index registró el 31 de agosto de 2026 una mediana de US$ 544.280 por nodo nuevo HGX B300 con ocho GPUs, equivalente a US$ 68.035 por GPU en la métrica del índice. En aquel relevamiento, los anuncios oscilaban entre US$ 399.999 y US$ 682.000 por nodo.

Esa cifra de US$ 68.035 no es MSRP ni precio de una B300 suelta: es el resultado de dividir el precio anunciado de sistemas completos de ocho GPUs. El propio índice señala que trabaja con precios solicitados por vendedores, no con ventas cerradas, y no estandariza CPU, RAM, almacenamiento ni garantía. Por su parte, el precio inicial de US$ 496.728 de BIZON equivale a unos US$ 62.091 por GPU solo si el coste total del servidor se reparte a partes iguales entre ocho, un cálculo comparativo, no el precio de compra de cada acelerador.

En resumen: las referencias consultadas indican US$ 496.728 como precio inicial del X9000 G5 e US$ 544.280 como mediana de anuncios de nodos HGX B300. En el relevamiento del índice, el rango observado fue de US$ 399.999 a US$ 682.000 por nodo — cerca de US$ 50 mil a US$ 85.250 por GPU apenas como base de comparação del sistema. Para una decisión de compra, solicite cotización formal con la lista de componentes, modalidad de soporte, plazo, entrega y costes fiscales aplicables al país de destino.

Otros servidores BIZON para IA y LLMs

El X9000 G5 es la opción de gama alta basada en HGX B300, pero no es la única línea de BIZON para IA. En el catálogo consultado en 11 de septiembre de 2026, hay servidores HGX con generaciones anteriores y líneas PCIe configurables. La tabla siguiente resume las familias; la disponibilidad, GPU exacta, RAM, CPU y red deben confirmarse en la cotización.

Línea BIZON Formato y aceleradores listados Dónde encaja
X9000 G5 HGX B300 con 8 GPUs B300 Nodo de centro de datos para modelos muy grandes, inferencia compartida, entrenamiento y HPC.
X9000 G4 HGX B200 con 8 GPUs B200 Alternativa Blackwell anterior, también con NVLink/NVSwitch para cargas distribuidas entre ocho GPUs.
X9000 G3 HGX H200 o H100 con 8 GPUs Plataforma Hopper para LLMs, entrenamiento e inferencia en centro de datos.
G9000 Configuraciones de 4 o 8 GPUs A100, H100 o H200 Servidor GPU de centro de datos configurable para IA, deep learning y computación paralela.
X7000 (G3) / G7000 G5 Hasta 8 GPUs PCIe; el X7000 aparece listado con RTX PRO 6000 Blackwell, A100, H100 y H200. El G7000 G5 lista RTX PRO 4000/4500/5000/6000 Blackwell, A100, H100 NVL y H200 NVL. Entrenamiento, inferencia y servicios de LLM cuando la flexibilidad de GPUs PCIe es más importante que una base HGX.
X8000 / G8000 Hasta 4 GPUs PCIe; las páginas enumeran RTX PRO 6000 Blackwell, A100, H100 y H200 Inferencia, ajuste fino y equipos que no necesitan ocho aceleradores en el mismo nodo.
Z9000 / ZX9000 Líneas de servidor con refrigeración líquida y GPUs NVIDIA configurables Entornos en los que el ruido, la temperatura y la carga sostenida influyen en la elección del diseño.

Para una implantación menor o para LLMs locales, BIZON también anuncia workstations multi-GPU, como la ZX5500. Sin embargo, no se debe comparar solo la cantidad de GPUs: B300/HGX utiliza una interconexión de centro de datos diferente a la de las placas PCIe. La memoria por GPU, la interconexión, el contexto del modelo, la latencia deseada, la energía y el soporte deben guiar la selección.

Según la propia BIZON, BizonOS está basado en Ubuntu 24.04 e incluye componentes como CUDA, Docker, PyTorch, TensorFlow, vLLM, Ollama, Hugging Face Transformers, Jupyter y RAPIDS. Es una oferta de software del fabricante; antes de contratar, confirme qué versiones, imágenes de contenedor y niveles de soporte forman parte de la configuración elegida.

Infraestructura: el servidor es solo una parte del proyecto

Un nodo 8U con ocho aceleradores de centro de datos requiere planificación de rack, energía, refrigeración, ruido, red y operación. BIZON enumina doce fuentes redundantes de 3.000 W y un entorno operativo de 10 °C a 30 °C; esa capacidad de las fuentes no es una medición del consumo del equipo. En su propia página, el fabricante presenta como ejemplo un rango de 2.700 a 2.900 W para una configuración específica con ocho B300 y dos EPYC 9335, a una carga del 100%.

Antes de comprar o implantar, valide con el proveedor, el electricista y el equipo del centro de datos: circuitos y redundancia eléctrica, tipo de rack, capacidad térmica, flujo de aire, red de baja latencia, almacenamiento, firmware, drivers, observabilidad y plan de mantenimiento. Esto va mucho más allá del escenario de una estación de trabajo o de IA local con una sola GPU — para ese otro perfil, compare con nuestra guía de servidor de IA reacondicionado con 64 GB de VRAM.

Dónde tiene sentido una máquina así

  • Inferencia compartida: servir un modelo grande para muchos usuarios, API o agentes simultáneos.
  • RAG corporativo: concentrar un modelo de lenguaje grande en el entorno de la empresa, siempre que la arquitectura incluya control de acceso y datos.
  • Entrenamiento y ajuste fino: flujos que se benefician de una gran memoria agregada y comunicación rápida entre GPUs.
  • HPC e investigación: simulaciones y pipelines acelerados que encajan en el ecosistema CUDA.

Para operar este tipo de servicio, supervise tanto la aplicación como la infraestructura: colas, latencia, fallos de petición, uso de GPU, temperatura, energía y red. La guía de OpenObserve para logs, métricas y traces es un punto de partida para pensar en la telemetría, y el artículo sobre Prometheus y Node Exporter cubre la base del host Linux.

Lista de comprobación técnica antes de evaluar una propuesta

  • ¿Qué modelo, versión, contexto, cuantización y SLA de latencia deben cumplirse?
  • ¿La prueba indica TTFT, P95/P99, prompts, tasa de error y versión del servidor de inferencia?
  • ¿La configuración es AMD o Intel? ¿Cuánta RAM, NVMe y red se incluyen?
  • ¿El rack, la energía, la refrigeración y la acústica soportan el despliegue?
  • ¿Cómo se observarán la GPU, el host, la red, la API y la cola? ¿Cuál es el plan de incidentes?
  • ¿Cuáles son las condiciones de soporte, sustitución de piezas, firmware y drivers?

Conclusión

El BIZON X9000 G5 muestra para qué fue diseñada la clase HGX B300: concentrar ocho GPUs Blackwell Ultra, mucha memoria HBM3e e interconexión rápida en un nodo para IA a escala. El vídeo es útil por aportar cifras de rendimiento, pero deben leerse como el resultado de una demostración concreta. La decisión seria comienza después del vídeo: reproducir la carga real, medir la latencia más allá del throughput y diseñar toda la infraestructura alrededor del servidor.

Fuentes