
Cuando una aplicación de IA necesita razonar, llamar a herramientas y responder a muchas personas a la vez, no basta con contar FLOPS: la latencia para generar cada token, la memoria y la comunicación entre aceleradores pasan a definir la experiencia. El siguiente vídeo presenta el Cerebras CS-4, un sistema de rack basado en procesadores del tamaño de una oblea de silicio. La propuesta es ambiciosa, pero las cifras deben leerse como lo que son: resultados y comparaciones divulgados por el fabricante para escenarios específicos.
Resumen en vídeo: el canal Evolving AI explica el WSE-3 Turbo, el rack CS-4, la plataforma Nexus y por qué Cerebras apuesta por la inferencia de baja latencia en lugar de simplemente agrupar más GPUs.
Vídeo del canal Evolving AI: Cerebras’s New 900,000-Core AI Beast Chip That Made NVIDIA AI Servers Look Like a JOKE!.
CS-4: un rack, tres obleas
El CS-4 no es una tarjeta PCIe para instalar en un servidor común. Es una solución de rack que reúne tres procesadores Wafer-Scale Engine 3 Turbo (WSE-3T). En el anuncio de 18 de agosto de 2026, Cerebras declara hasta 750 PFLOPS de computación para IA, 129,6 PB/s de ancho de banda de memoria y 7,2 Tb/s de E/S por sistema CS-4. Son especificaciones de infraestructura de centro de datos, no una alternativa para un laboratorio doméstico.
El punto central de la arquitectura es reducir el coste de coordinar muchas unidades pequeñas. Un modelo grande normalmente se reparte entre aceleradores; en cada etapa, los datos y los estados deben cruzar memoria, placas y red. Cerebras concentra mucha más computación en una oblea y luego acerca las obleas en el mismo diseño de rack. Para comparar familias de aceleradores y sus compromisos, consulte también GPU vs. TPU: cómo funcionan los chips de IA e cómo funcionan las tarjetas gráficas.
WSE-3 Turbo: ¿por qué usar toda la oblea?
En la fabricación convencional, una oblea de silicio se corta en varios dies. La familia Wafer-Scale Engine sigue una ruta diferente: convierte casi toda la oblea en un procesador. Según Cerebras, el WSE-3 Turbo ocupa 46.225 mm², integra 4 billones de transistores, 900 mil núcleos optimizados para IA e 44 GB de SRAM en la propia oblea. La versión Turbo alcanza 250 PFLOPS y 43,2 PB/s de ancho de banda de memoria por oblea.
Una lámina grande inevitablemente contiene defectos de fabricación. La salida de Cerebras es diseñar redundancia de núcleos y de enrutamiento: las regiones defectuosas pueden desactivarse y rodearse. Esto no vuelve al silicio mágicamente perfecto; es una decisión de arquitectura, prueba y software para que un wafer con fallos aún pueda convertirse en producto.
Nexus, Wafer-Scale Backpack y enlaces directos
El CS-4 inaugura la plataforma de rack Nexus, separada en módulos de computación, energía y E/S. Cada Wafer-Scale Backpack combina un wafer, conversión de energía, refrigeración líquida directa, E/S de alta velocidad y electrónica de control. Al desacoplar estos módulos, la empresa busca simplificar la producción, el mantenimiento y las actualizaciones del rack.
Para la red, el sistema combina RoCE v2 sobre Ethernet con Direct Wafer Links. El primero facilita la integración con infraestructura Ethernet; el segundo conecta wafers dentro o entre racks sin conmutador en la ruta directa. La empresa declara una latencia de wafer a wafer de hasta 2 microsegundos. En modelos distribuidos, este tipo de latencia puede ser tan importante como la potencia bruta, porque cada generación de token requiere sincronización de estado.
Prefill y decode: donde aparece la velocidad
La inferencia de LLM no es una sola etapa. En el prefill, el sistema procesa todo el prompt y construye el estado inicial; en el decode, produce token a token. La estrategia propuesta por Cerebras es la inferencia desagregada: una GPU o ASIC puede hacer el prefill y el CS-4 puede asumir el decode de baja latencia. El estado entre las etapas aún debe transportarse de forma eficiente, por eso la interconexión y la E/S forman parte de la propuesta, no son solo accesorios.
Esto ayuda a explicar el interés en aplicaciones agénticas. Un agente puede alternar generación, llamada a herramientas, lectura del resultado y nueva generación varias veces. Unos tokens más rápidos reducen el tiempo de espera de cada ciclo, pero no resuelven por sí solos la calidad de las herramientas, la seguridad, las pruebas ni la observabilidad. La arquitectura heterogénea también aparece en iniciativas como el Project Rainier de AWS.
Qué significa “hasta 30× más rápido”
Cerebras ha comunicado más de 4.400 tokens por segundo por usuario en GPT-OSS-120B, con prompts idénticos, y una ventaja de hasta 30× sobre soluciones GPU. La nota al pie del anuncio es clave: el throughput real varía según la arquitectura del modelo, el tamaño del contexto, la precisión y la configuración del servicio. Además, “GPU” no es una única configuración comparable.
Por tanto, no es correcto concluir que cualquier carga de IA será 30 veces más rápida. La lectura útil es que, para el decode interactivo en modelos grandes, una SRAM cercana al procesador, ancho de banda y baja latencia entre aceleradores pueden cambiar de forma relevante el resultado. Siguen siendo necesarios benchmarks independientes, precio, disponibilidad, consumo y rendimiento en distintos modelos antes de tomar una decisión de compra.
2015–2026: la historia de Cerebras
La propia línea de tiempo de la empresa sitúa su fundación en 2015. Andrew Feldman, Gary Lauterbach, Michael James, Sean Lie y Jean-Philippe Fricker crearon Cerebras para hacer viable la computación a escala de oblea en centros de datos, una idea que parecía difícil de producir económicamente porque los chips grandes sufren más defectos.
- 2019: llegan el WSE-1 y el sistema CS-1.
- 2021: WSE-2 y CS-2 entran en escena; la empresa también destaca resultados de investigación del NETL con el sistema.
- 2022: investigadores del Argonne National Laboratory reciben el Gordon Bell Special Prize por su trabajo sobre variantes de COVID-19 con un clúster CS-2.
- 2023: Cerebras y G42 anuncian la red de supercomputadores Condor Galaxy; el CG-1 se presentó con 4 exaFLOPS FP16 y 54 millones de núcleos.
- 2024: la generación WSE-3/CS-3 llega al mercado.
- 2025: la empresa amplía su oferta de inferencia e integraciones en la nube; su línea de tiempo cita socios como Meta, Perplexity, Mistral, Hugging Face y OpenRouter.
- 2026: la página corporativa informa de la cotización en Nasdaq bajo el ticker CBRS en mayo y del lanzamiento del CS-4 en agosto.
Quién ha invertido en Cerebras
Financiación y colaboración comercial no son lo mismo. Para evitar mezclarlas, conviene separar los inversores nombrados por la empresa en las rondas recientes de los acuerdos estratégicos.
- Serie G (septiembre de 2025): ronda de $ 1,1 mil millones de dólares, con una valoración post-money de $ 8,1 mil millones de dólares. Fue liderada por Fidelity Management & Research Company e Atreides Management; participaron Tiger Global, Valor Equity Partners y 1789 Capital, además de los inversores existentes Altimeter, Alpha Wave Global y Benchmark.
- Serie H (febrero de 2026): ronda de $ 1 mil millones de dólares, con una valoración post-money aproximada de $ 23 mil millones de dólares. El liderazgo fue de Tiger Global; la empresa cita a Benchmark, Fidelity Management & Research Company, Atreides Management, Alpha Wave Global, Altimeter, AMD, Coatue y 1789 Capital, entre otros participantes.
- G42: es sobre todo un socio estratégico de Cerebras en la red Condor Galaxy. En el registro S-1 del 2024, la empresa también describió un acuerdo para que una filial de G42 compre $ 335 millones de dólares en acciones preferentes, sujeto a condiciones y aprobaciones regulatorias. Este acuerdo no debe confundirse automáticamente con las listas de inversores de las Series G y H.
Ese historial muestra por qué Cerebras es más que un chip aislado: hay capital para fabricar hardware, operar centros de datos y competir en el mercado de inferencia. Al mismo tiempo, la concentración de clientes, la ejecución de los centros de datos, la energía, el suministro y la competencia con plataformas de GPU y otros ASIC siguen siendo riesgos relevantes — puntos que la propia empresa enumera en sus comunicaciones a inversores.
Qué cambia para quienes usan Linux e IA
El usuario de Linux difícilmente instalará un CS-4 en casa. El efecto práctico tiende a llegar vía APIs y servicios: respuestas más rápidas, generación de código con menor latencia y agentes que completan más etapas en el mismo tiempo. Para uso local, la ruta sigue siendo software y hardware accesibles, como en ejecutar IA local con Ollama en Linux.
Cerebras representa una apuesta importante: rediseñar el acelerador, el rack y el interconector al mismo tiempo. El vídeo es útil para visualizar esa arquitectura; la decisión técnica, sin embargo, debe partir de mediciones reproducibles, coste total, disponibilidad y compatibilidad de tu carga de trabajo.
Fuentes primarias: línea de tiempo y fundadores de Cerebras · WSE-3 Turbo · anuncio y especificaciones del CS-4 · arquitectura Nexus e inferencia desagregada · Serie G · Serie H · registro S-1 sobre G42.