{"id":1488,"date":"2026-09-08T20:18:01","date_gmt":"2026-09-08T23:18:01","guid":{"rendered":"https:\/\/www.linuxpro.com.br\/2026\/09\/cerebras-cs-4-inferencia-ia-video\/"},"modified":"2026-09-11T00:43:13","modified_gmt":"2026-09-11T03:43:13","slug":"cerebras-cs-4-inferencia-ia-video","status":"publish","type":"post","link":"https:\/\/www.linuxpro.com.br\/es\/2026\/09\/cerebras-cs-4-inferencia-ia-video\/","title":{"rendered":"Cerebras CS-4: IA a escala de oblea, historia e inversores"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" src=\"\/wp-content\/uploads\/2026\/09\/cerebras-cs4-inferencia-ia-v2.webp\" alt=\"Mascote LinuxPro instalando um m\u00f3dulo wafer-scale em um rack de infer\u00eancia de IA\" width=\"1486\" height=\"856\" \/><\/p>\n<p>Cuando una aplicaci\u00f3n de IA necesita razonar, llamar a herramientas y responder a muchas personas a la vez, no basta con contar FLOPS: la latencia para generar cada token, la memoria y la comunicaci\u00f3n entre aceleradores pasan a definir la experiencia. El siguiente v\u00eddeo presenta el <strong>Cerebras CS-4<\/strong>, un sistema de rack basado en procesadores del tama\u00f1o de una oblea de silicio. La propuesta es ambiciosa, pero las cifras deben leerse como lo que son: resultados y comparaciones divulgados por el fabricante para escenarios espec\u00edficos.<\/p>\n<blockquote>\n<p><strong>Resumen en v\u00eddeo:<\/strong> el canal Evolving AI explica el WSE-3 Turbo, el rack CS-4, la plataforma Nexus y por qu\u00e9 Cerebras apuesta por la inferencia de baja latencia en lugar de simplemente agrupar m\u00e1s GPUs.<\/p>\n<p>V\u00eddeo del canal <a href=\"https:\/\/www.youtube.com\/@EvolviingAI\">Evolving AI<\/a>: <a href=\"https:\/\/www.youtube.com\/watch?v=BnuK6eKiGZ4\">Cerebras&#8217;s New 900,000-Core AI Beast Chip That Made NVIDIA AI Servers Look Like a JOKE!<\/a>.<\/p>\n<\/blockquote>\n<div class=\"video-container\" style=\"position:relative;padding-bottom:56.25%;height:0;overflow:hidden;margin:1.5em 0;\"><iframe src=\"https:\/\/www.youtube.com\/embed\/BnuK6eKiGZ4\" title=\"Cerebras CS-4 y WSE-3 Turbo: v\u00eddeo del canal Evolving AI\" loading=\"lazy\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen style=\"position:absolute;top:0;left:0;width:100%;height:100%;\"><\/iframe><\/div>\n<h2>CS-4: un rack, tres obleas<\/h2>\n<p>El CS-4 no es una tarjeta PCIe para instalar en un servidor com\u00fan. Es una soluci\u00f3n de rack que re\u00fane <strong>tres procesadores Wafer-Scale Engine 3 Turbo (WSE-3T)<\/strong>. En el anuncio de 18 de agosto de 2026, Cerebras declara hasta <strong>750 PFLOPS<\/strong> de computaci\u00f3n para IA, <strong>129,6 PB\/s<\/strong> de ancho de banda de memoria y <strong>7,2 Tb\/s<\/strong> de E\/S por sistema CS-4. Son especificaciones de infraestructura de centro de datos, no una alternativa para un laboratorio dom\u00e9stico.<\/p>\n<p>El punto central de la arquitectura es reducir el coste de coordinar muchas unidades peque\u00f1as. Un modelo grande normalmente se reparte entre aceleradores; en cada etapa, los datos y los estados deben cruzar memoria, placas y red. Cerebras concentra mucha m\u00e1s computaci\u00f3n en una oblea y luego acerca las obleas en el mismo dise\u00f1o de rack. Para comparar familias de aceleradores y sus compromisos, consulte tambi\u00e9n <a href=\"\/es\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs. TPU: c\u00f3mo funcionan los chips de IA<\/a> e <a href=\"\/es\/2026\/09\/como-funcionam-placas-de-video\/\">c\u00f3mo funcionan las tarjetas gr\u00e1ficas<\/a>.<\/p>\n<h2>WSE-3 Turbo: \u00bfpor qu\u00e9 usar toda la oblea?<\/h2>\n<p>En la fabricaci\u00f3n convencional, una oblea de silicio se corta en varios <em>dies<\/em>. La familia Wafer-Scale Engine sigue una ruta diferente: convierte casi toda la oblea en un procesador. Seg\u00fan Cerebras, el WSE-3 Turbo ocupa <strong>46.225 mm\u00b2<\/strong>, integra <strong>4 billones de transistores<\/strong>, <strong>900 mil n\u00facleos optimizados para IA<\/strong> e <strong>44 GB de SRAM<\/strong> en la propia oblea. La versi\u00f3n Turbo alcanza 250 PFLOPS y 43,2 PB\/s de ancho de banda de memoria por oblea.<\/p>\n<p>Una l\u00e1mina grande inevitablemente contiene defectos de fabricaci\u00f3n. La salida de Cerebras es dise\u00f1ar redundancia de n\u00facleos y de enrutamiento: las regiones defectuosas pueden desactivarse y rodearse. Esto no vuelve al silicio m\u00e1gicamente perfecto; es una decisi\u00f3n de arquitectura, prueba y software para que un wafer con fallos a\u00fan pueda convertirse en producto.<\/p>\n<h2>Nexus, Wafer-Scale Backpack y enlaces directos<\/h2>\n<p>El CS-4 inaugura la plataforma de rack <strong>Nexus<\/strong>, separada en m\u00f3dulos de computaci\u00f3n, energ\u00eda y E\/S. Cada <em>Wafer-Scale Backpack<\/em> combina un wafer, conversi\u00f3n de energ\u00eda, refrigeraci\u00f3n l\u00edquida directa, E\/S de alta velocidad y electr\u00f3nica de control. Al desacoplar estos m\u00f3dulos, la empresa busca simplificar la producci\u00f3n, el mantenimiento y las actualizaciones del rack.<\/p>\n<p>Para la red, el sistema combina <strong>RoCE v2 sobre Ethernet<\/strong> con <em>Direct Wafer Links<\/em>. El primero facilita la integraci\u00f3n con infraestructura Ethernet; el segundo conecta wafers dentro o entre racks sin conmutador en la ruta directa. La empresa declara una latencia de wafer a wafer de hasta <strong>2 microsegundos<\/strong>. En modelos distribuidos, este tipo de latencia puede ser tan importante como la potencia bruta, porque cada generaci\u00f3n de token requiere sincronizaci\u00f3n de estado.<\/p>\n<h2>Prefill y decode: donde aparece la velocidad<\/h2>\n<p>La inferencia de LLM no es una sola etapa. En el <strong>prefill<\/strong>, el sistema procesa todo el prompt y construye el estado inicial; en el <strong>decode<\/strong>, produce token a token. La estrategia propuesta por Cerebras es la inferencia desagregada: una GPU o ASIC puede hacer el prefill y el CS-4 puede asumir el decode de baja latencia. El estado entre las etapas a\u00fan debe transportarse de forma eficiente, por eso la interconexi\u00f3n y la E\/S forman parte de la propuesta, no son solo accesorios.<\/p>\n<p>Esto ayuda a explicar el inter\u00e9s en aplicaciones ag\u00e9nticas. Un agente puede alternar generaci\u00f3n, llamada a herramientas, lectura del resultado y nueva generaci\u00f3n varias veces. Unos tokens m\u00e1s r\u00e1pidos reducen el tiempo de espera de cada ciclo, pero no resuelven por s\u00ed solos la calidad de las herramientas, la seguridad, las pruebas ni la observabilidad. La arquitectura heterog\u00e9nea tambi\u00e9n aparece en iniciativas como el <a href=\"\/es\/2026\/09\/project-rainier-aws-data-center-sem-nvidia\/\">Project Rainier de AWS<\/a>.<\/p>\n<h2>Qu\u00e9 significa \u201chasta 30\u00d7 m\u00e1s r\u00e1pido\u201d<\/h2>\n<p>Cerebras ha comunicado m\u00e1s de <strong>4.400 tokens por segundo por usuario<\/strong> en GPT-OSS-120B, con prompts id\u00e9nticos, y una ventaja de hasta 30\u00d7 sobre soluciones GPU. La nota al pie del anuncio es clave: el throughput real var\u00eda seg\u00fan la arquitectura del modelo, el tama\u00f1o del contexto, la precisi\u00f3n y la configuraci\u00f3n del servicio. Adem\u00e1s, \u201cGPU\u201d no es una \u00fanica configuraci\u00f3n comparable.<\/p>\n<p>Por tanto, no es correcto concluir que cualquier carga de IA ser\u00e1 30 veces m\u00e1s r\u00e1pida. La lectura \u00fatil es que, para el decode interactivo en modelos grandes, una SRAM cercana al procesador, ancho de banda y baja latencia entre aceleradores pueden cambiar de forma relevante el resultado. Siguen siendo necesarios benchmarks independientes, precio, disponibilidad, consumo y rendimiento en distintos modelos antes de tomar una decisi\u00f3n de compra.<\/p>\n<h2>2015\u20132026: la historia de Cerebras<\/h2>\n<p>La propia l\u00ednea de tiempo de la empresa sit\u00faa su fundaci\u00f3n en <strong>2015<\/strong>. Andrew Feldman, Gary Lauterbach, Michael James, Sean Lie y Jean-Philippe Fricker crearon Cerebras para hacer viable la computaci\u00f3n a escala de oblea en centros de datos, una idea que parec\u00eda dif\u00edcil de producir econ\u00f3micamente porque los chips grandes sufren m\u00e1s defectos.<\/p>\n<ul>\n<li><strong>2019:<\/strong> llegan el WSE-1 y el sistema CS-1.<\/li>\n<li><strong>2021:<\/strong> WSE-2 y CS-2 entran en escena; la empresa tambi\u00e9n destaca resultados de investigaci\u00f3n del NETL con el sistema.<\/li>\n<li><strong>2022:<\/strong> investigadores del Argonne National Laboratory reciben el Gordon Bell Special Prize por su trabajo sobre variantes de COVID-19 con un cl\u00faster CS-2.<\/li>\n<li><strong>2023:<\/strong> Cerebras y G42 anuncian la red de supercomputadores Condor Galaxy; el CG-1 se present\u00f3 con 4 exaFLOPS FP16 y 54 millones de n\u00facleos.<\/li>\n<li><strong>2024:<\/strong> la generaci\u00f3n WSE-3\/CS-3 llega al mercado.<\/li>\n<li><strong>2025:<\/strong> la empresa ampl\u00eda su oferta de inferencia e integraciones en la nube; su l\u00ednea de tiempo cita socios como Meta, Perplexity, Mistral, Hugging Face y OpenRouter.<\/li>\n<li><strong>2026:<\/strong> la p\u00e1gina corporativa informa de la cotizaci\u00f3n en Nasdaq bajo el ticker <strong>CBRS<\/strong> en mayo y del lanzamiento del CS-4 en agosto.<\/li>\n<\/ul>\n<h2>Qui\u00e9n ha invertido en Cerebras<\/h2>\n<p>Financiaci\u00f3n y colaboraci\u00f3n comercial no son lo mismo. Para evitar mezclarlas, conviene separar los inversores nombrados por la empresa en las rondas recientes de los acuerdos estrat\u00e9gicos.<\/p>\n<ul>\n<li><strong>Serie G (septiembre de 2025):<\/strong> ronda de $ 1,1 mil millones de d\u00f3lares, con una valoraci\u00f3n post-money de $ 8,1 mil millones de d\u00f3lares. Fue liderada por <strong>Fidelity Management &amp; Research Company<\/strong> e <strong>Atreides Management<\/strong>; participaron Tiger Global, Valor Equity Partners y 1789 Capital, adem\u00e1s de los inversores existentes Altimeter, Alpha Wave Global y Benchmark.<\/li>\n<li><strong>Serie H (febrero de 2026):<\/strong> ronda de $ 1 mil millones de d\u00f3lares, con una valoraci\u00f3n post-money aproximada de $ 23 mil millones de d\u00f3lares. El liderazgo fue de <strong>Tiger Global<\/strong>; la empresa cita a Benchmark, Fidelity Management &amp; Research Company, Atreides Management, Alpha Wave Global, Altimeter, <strong>AMD<\/strong>, Coatue y 1789 Capital, entre otros participantes.<\/li>\n<li><strong>G42:<\/strong> es sobre todo un socio estrat\u00e9gico de Cerebras en la red Condor Galaxy. En el registro S-1 del 2024, la empresa tambi\u00e9n describi\u00f3 un acuerdo para que una filial de G42 compre $ 335 millones de d\u00f3lares en acciones preferentes, sujeto a condiciones y aprobaciones regulatorias. Este acuerdo no debe confundirse autom\u00e1ticamente con las listas de inversores de las Series G y H.<\/li>\n<\/ul>\n<p>Ese historial muestra por qu\u00e9 Cerebras es m\u00e1s que un chip aislado: hay capital para fabricar hardware, operar centros de datos y competir en el mercado de inferencia. Al mismo tiempo, la concentraci\u00f3n de clientes, la ejecuci\u00f3n de los centros de datos, la energ\u00eda, el suministro y la competencia con plataformas de GPU y otros ASIC siguen siendo riesgos relevantes \u2014 puntos que la propia empresa enumera en sus comunicaciones a inversores.<\/p>\n<h2>Qu\u00e9 cambia para quienes usan Linux e IA<\/h2>\n<p>El usuario de Linux dif\u00edcilmente instalar\u00e1 un CS-4 en casa. El efecto pr\u00e1ctico tiende a llegar v\u00eda APIs y servicios: respuestas m\u00e1s r\u00e1pidas, generaci\u00f3n de c\u00f3digo con menor latencia y agentes que completan m\u00e1s etapas en el mismo tiempo. Para uso local, la ruta sigue siendo software y hardware accesibles, como en <a href=\"\/es\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">ejecutar IA local con Ollama en Linux<\/a>.<\/p>\n<p>Cerebras representa una apuesta importante: redise\u00f1ar el acelerador, el rack y el interconector al mismo tiempo. El v\u00eddeo es \u00fatil para visualizar esa arquitectura; la decisi\u00f3n t\u00e9cnica, sin embargo, debe partir de mediciones reproducibles, coste total, disponibilidad y compatibilidad de tu carga de trabajo.<\/p>\n<p><strong>Fuentes primarias:<\/strong> <a href=\"https:\/\/www.cerebras.ai\/company\">l\u00ednea de tiempo y fundadores de Cerebras<\/a> \u00b7 <a href=\"https:\/\/www.cerebras.ai\/chip\">WSE-3 Turbo<\/a> \u00b7 <a href=\"https:\/\/investors.cerebras.ai\/news-releases\/news-release-details\/cerebras-unveils-cs-4-30-times-faster-gpu-based-solutions\">anuncio y especificaciones del CS-4<\/a> \u00b7 <a href=\"https:\/\/www.cerebras.ai\/blog\/introducing-cerebras-cs-4\">arquitectura Nexus e inferencia desagregada<\/a> \u00b7 <a href=\"https:\/\/www.cerebras.ai\/press-release\/series-g\">Serie G<\/a> \u00b7 <a href=\"https:\/\/investors.cerebras.ai\/node\/6551\/pdf\">Serie H<\/a> \u00b7 <a href=\"https:\/\/investors.cerebras.ai\/static-files\/e7841424-b8ca-41c5-982c-bbeca7873429\">registro S-1 sobre G42<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Quando uma aplica\u00e7\u00e3o de IA precisa raciocinar, chamar ferramentas e responder para muitas pessoas ao mesmo tempo, n\u00e3o basta contar FLOPS: a lat\u00eancia para gerar cada token, a mem\u00f3ria e a comunica\u00e7\u00e3o entre aceleradores passam a definir a experi\u00eancia. O v\u00eddeo abaixo apresenta o Cerebras CS-4, sistema de rack baseado em processadores do tamanho de &#8230; <a title=\"Cerebras CS-4: IA a escala de oblea, historia e inversores\" class=\"read-more\" href=\"https:\/\/www.linuxpro.com.br\/es\/2026\/09\/cerebras-cs-4-inferencia-ia-video\/\" aria-label=\"Read more about Cerebras CS-4: IA em wafer-scale, hist\u00f3ria e investidores\">Read more<\/a><\/p>","protected":false},"author":0,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[115,25],"tags":[434,435,116,385,344,436],"class_list":["post-1488","post","type-post","status-publish","format-standard","hentry","category-ia","category-noticias","tag-cerebras","tag-cs-4","tag-ia","tag-inferencia","tag-video","tag-wse-3"],"_links":{"self":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/1488","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/comments?post=1488"}],"version-history":[{"count":3,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/1488\/revisions"}],"predecessor-version":[{"id":1535,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/1488\/revisions\/1535"}],"wp:attachment":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/media?parent=1488"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/categories?post=1488"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/tags?post=1488"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}