{"id":432,"date":"2026-09-05T22:33:52","date_gmt":"2026-09-06T01:33:52","guid":{"rendered":"https:\/\/www.linuxpro.com.br\/2026\/09\/google-tpus-guia-completo-arquitetura-e-modelos\/"},"modified":"2026-09-08T04:51:50","modified_gmt":"2026-09-08T07:51:50","slug":"google-tpus-guia-completo-arquitetura-e-modelos","status":"publish","type":"post","link":"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/google-tpus-guia-completo-arquitetura-e-modelos\/","title":{"rendered":"Google TPUs: arquitetura, gera\u00e7\u00f5es e modelos"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" alt=\"Mascote do LinuxPro apontando para pod TPU\" src=\"\/wp-content\/uploads\/2026\/09\/google-tpus-v3.webp\" width=\"1052\" height=\"652\" \/><\/p>\n<p>Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usu\u00e1rio Android usasse o comando de voz da Busca por tr\u00eas minutos ao dia, em CPU x86, a empresa teria de <strong>dobrar os data centers<\/strong> s\u00f3 para infer\u00eancia. GPU de consumo ainda era placa de jogo adaptada. A resposta foi um ASIC s\u00f3 de \u00e1lgebra linear: a <strong>TPU (Tensor Processing Unit)<\/strong>. Este texto \u00e9 o mapa do sil\u00edcio \u2014 MXU sist\u00f3lica, bfloat16, OCS \u2014 e das gera\u00e7\u00f5es at\u00e9 o <strong>TPU7x Ironwood<\/strong>, em disponibilidade geral desde 31 de mar\u00e7o de 2026. O recorte GPU vs TPU, lado a lado, est\u00e1 no post <a href=\"\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU<\/a>.<\/p>\n<p><!-- more --><\/p>\n<h2>Por que um ASIC, n\u00e3o uma GPU<\/h2>\n<p>CPU gasta transistor com preditor de desvio, cache e decodificador. GPU gasta com SIMT gen\u00e9rico. A TPU dedica o die a uma conta: <strong>MAC<\/strong> (multiply-accumulate). Quase todo o servi\u00e7o do Google \u2014 Busca, Tradutor, Fotos, YouTube, Cloud \u2014 e o treino de Transformer, BERT, AlphaFold, PaLM e Gemini passou por esse sil\u00edcio.<\/p>\n<pre><code class=\"language-text\">HBM  &lt;=&gt;  VMEM (SRAM on-die)\n              \u2502\n     \u250c\u2500\u2500\u2500\u2500\u2500\u2500\u2500\u2500\u2534\u2500\u2500\u2500\u2500\u2500\u2500\u2500\u2500\u2510\n     v                 v\n  MXU sist\u00f3lica     VPU\n  (MatMul pura)     (softmax, GELU, LayerNorm)\n  128\u00d7128 MACs\n  (16.384 c\u00e9lulas)\n<\/code><\/pre>\n<p>Nas gera\u00e7\u00f5es novas o SparseCore entra para embedding esparso (an\u00fancio, YouTube, Busca). v6e e Ironwood usam MXU <strong>256\u00d7256<\/strong>.<\/p>\n<h2>Arranjo sist\u00f3lico: o dado n\u00e3o volta para a HBM<\/h2>\n<p>Num processador comum, cada MAC intermedi\u00e1rio l\u00ea e grava registrador\/cache \u2014 o <em>memory wall<\/em> do post das <a href=\"\/2026\/09\/como-funcionam-placas-de-video\/\">placas de v\u00eddeo<\/a>. Na MXU:<\/p>\n<ol>\n<li><strong>Weight-stationary:<\/strong> os pesos da camada saem da HBM uma vez e estacionam na c\u00e9lula.<\/li>\n<li><strong>S\u00edstole:<\/strong> o vetor de entrada entra pela esquerda e anda uma coluna por ciclo.<\/li>\n<li><strong>Ac\u00famulo:<\/strong> cada c\u00e9lula multiplica entrada \u00d7 peso local, soma o que veio de cima, empurra para baixo.<\/li>\n<li><strong>Sa\u00edda:<\/strong> a coluna da matriz resultante escorre pela base.<\/li>\n<\/ol>\n<p>O n\u00famero pulsa de vizinho para vizinho. Energia vira conta, n\u00e3o tr\u00e2nsito. \u00c9 o oposto do KV cache gordo que o <a href=\"\/2026\/09\/como-deepseek-reescreveu-o-transformer-mla\/\">MLA da DeepSeek<\/a> tenta encolher na GPU.<\/p>\n<p>O efeito colateral aparece na conta de efici\u00eancia: numa matriz 128\u00d7128, um dado que entra pela borda participa de 128 multiplica\u00e7\u00f5es antes de sair, sem tocar em mem\u00f3ria nenhuma. Na CPU, cada uma dessas 128 opera\u00e7\u00f5es seria um par load\/store. \u00c9 da\u00ed que sai a diferen\u00e7a de watt por opera\u00e7\u00e3o \u2014 n\u00e3o de clock. A TPU nunca ganhou de GPU em frequ\u00eancia.<\/p>\n<h2>bfloat16: a faixa do FP32 na metade dos bits<\/h2>\n<p>FP32 gasta banda. FP16 IEEE corta o expoente para 5 bits e o treino de rede grande estoura (overflow\/underflow). O Google inventou o <strong>bfloat16<\/strong>:<\/p>\n<pre><code class=\"language-text\">FP32      1 sinal | 8 expoente | 23 mantissa\nFP16      1 sinal | 5 expoente | 10 mantissa   (faixa estreita)\nbfloat16  1 sinal | 8 expoente |  7 mantissa   (mesma faixa do FP32)\n<\/code><\/pre>\n<p>Metade do tr\u00e1fego, multiplicador menor, treino sem malabarismo de loss scaling. NVIDIA, Intel, AMD e ARM adotaram. Hoje \u00e9 o default de JAX, PyTorch e dos LLMs.<\/p>\n<p>A sacada \u00e9 entender o que a rede neural realmente precisa. Gradiente pequeno demais vira zero em FP16 e o treino trava; o que quase nunca importa \u00e9 o terceiro decimal do peso. O bfloat16 joga fora precis\u00e3o (mantissa) e preserva alcance (expoente) \u2014 exatamente na ordem em que a rede tolera a perda. Ironwood leva a l\u00f3gica adiante com <strong>FP8<\/strong>, onde a infer\u00eancia aceita ainda menos bits.<\/p>\n<h2>VPU, SparseCore, ICI e OCS<\/h2>\n<p>MatMul densa n\u00e3o \u00e9 o modelo inteiro. A <strong>VPU<\/strong> faz GELU, ReLU, softmax, LayerNorm\/RMSNorm. O <strong>SparseCore<\/strong> trata embedding esparso largo demais para a MXU \u2014 o suporte a embeddings em hardware apareceu na v4, e a documenta\u00e7\u00e3o do Cloud lista o bloco como SparseCore na v5p, na v6e e no TPU7x.<\/p>\n<p>O superpoder n\u00e3o \u00e9 o chip: \u00e9 o <strong>Pod<\/strong>.<\/p>\n<pre><code class=\"language-text\">chip &lt;== ICI (Inter-Chip Interconnect) ==&gt; chip\n         malha 2D ou 3D torus\n         OCS: espelhos MEMS desviam o laser\n              topologia reconfigur\u00e1vel em software\n<\/code><\/pre>\n<p><strong>ICI<\/strong> liga vizinhos sem TCP\/IP. <strong>Torus 3D<\/strong> fecha as bordas. <strong>OCS<\/strong> (v4, v5p, Ironwood): em vez de switch el\u00e9trico que converte luz\u2194el\u00e9tron, um microespelho aponta o feixe. Isola chip morto, muda o recorte (data \/ tensor \/ pipeline parallel) em milissegundos.<\/p>\n<p>Vale insistir no ponto do OCS porque ele \u00e9 o que n\u00e3o tem equivalente do outro lado: num cluster de GPU, trocar a topologia significa recabear rack. No pod, \u00e9 uma ordem para o espelho. Um chip que falha no meio de um treino de semanas n\u00e3o derruba o job \u2014 o pod se reconfigura em volta do buraco.<\/p>\n<h2>Gera\u00e7\u00f5es (n\u00fameros oficiais do Cloud TPU, 2026)<\/h2>\n<table>\n<thead>\n<tr>\n<th>Gera\u00e7\u00e3o<\/th>\n<th>Ano<\/th>\n<th>Foco<\/th>\n<th>Pico\/chip<\/th>\n<th>HBM<\/th>\n<th>Pod<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>v1<\/td>\n<td>2015<\/td>\n<td>s\u00f3 infer\u00eancia INT8<\/td>\n<td>~92 TOPS<\/td>\n<td>8 GB DDR3<\/td>\n<td>PCIe avulso<\/td>\n<\/tr>\n<tr>\n<td>v2<\/td>\n<td>2017<\/td>\n<td>treino + infer\u00eancia, BF16<\/td>\n<td>45 TFLOPS<\/td>\n<td>16 GB HBM<\/td>\n<td>256 chips (11,5 PFLOPS)<\/td>\n<\/tr>\n<tr>\n<td>v3<\/td>\n<td>2018<\/td>\n<td>l\u00edquido, escala<\/td>\n<td>~123 TFLOPS<\/td>\n<td>32 GB HBM2<\/td>\n<td>1.024 chips<\/td>\n<\/tr>\n<tr>\n<td>v4<\/td>\n<td>2021<\/td>\n<td>OCS, torus 3D<\/td>\n<td>275 TFLOPS<\/td>\n<td>32 GB HBM2<\/td>\n<td>4.096 (1,1 EFLOPS)<\/td>\n<\/tr>\n<tr>\n<td>v5e<\/td>\n<td>2023<\/td>\n<td>custo\/watt<\/td>\n<td>197 TFLOPS BF16<\/td>\n<td>16 GB HBM2e<\/td>\n<td>256 chips<\/td>\n<\/tr>\n<tr>\n<td>v5p<\/td>\n<td>2023<\/td>\n<td>LLM (Gemini)<\/td>\n<td>459 TFLOPS BF16<\/td>\n<td>95 GB HBM3<\/td>\n<td>8.960 chips<\/td>\n<\/tr>\n<tr>\n<td>v6e Trillium<\/td>\n<td>2024<\/td>\n<td>MXU 256\u00d7256<\/td>\n<td>918 TFLOPS BF16<\/td>\n<td>32 GB, 1.638 GB\/s<\/td>\n<td>256 chips<\/td>\n<\/tr>\n<tr>\n<td><strong>TPU7x Ironwood<\/strong><\/td>\n<td>2025 (GA 2026)<\/td>\n<td>dois chiplets, FP8<\/td>\n<td><strong>2.307 BF16 \/ 4.614 FP8<\/strong><\/td>\n<td><strong>192 GB, 7.380 GB\/s<\/strong><\/td>\n<td><strong>9.216 chips<\/strong><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Ironwood \u00e9 o primeiro TPU pensado com infer\u00eancia no centro: 2 TensorCores, 4 SparseCores por chip, ICI de 1.200 GB\/s bidirecional. Um superpod de 9.216 chips chega a <strong>42,5 EFLOPS em FP8<\/strong>. Foi anunciado em <strong>9 de abril de 2025<\/strong>, entrou em <em>preview<\/em> no Cloud em 24 de novembro de 2025 e chegou \u00e0 disponibilidade geral em <strong>31 de mar\u00e7o de 2026<\/strong>. No Cloud h\u00e1 um \u00fanico recorte de VM, a <code>tpu7x-standard-4t<\/code>: 4 chips, 768 GiB de HBM, 224 vCPUs e 960 GB de RAM no host. A v6e continua sendo o custo\/benef\u00edcio para Gemma, Llama e difus\u00e3o.<\/p>\n<h2>A oitava gera\u00e7\u00e3o j\u00e1 foi anunciada<\/h2>\n<p>Em <strong>22 de abril de 2026<\/strong>, no Cloud Next \u201926, o Google apresentou a gera\u00e7\u00e3o seguinte \u2014 e, pela primeira vez, dividida em duas pe\u00e7as com prop\u00f3sitos separados:<\/p>\n<ul>\n<li><strong>TPU 8t<\/strong>, para treino. Usa uma nova gera\u00e7\u00e3o de ICI para escalar at\u00e9 <strong>9.600 chips<\/strong> e <strong>2 PB de mem\u00f3ria de alta banda compartilhada<\/strong> num \u00fanico superpod. O Google fala em <strong>3\u00d7 o poder de processamento do Ironwood<\/strong> e at\u00e9 2\u00d7 mais desempenho por watt.<\/li>\n<li><strong>TPU 8i<\/strong>, para infer\u00eancia. Estreia a topologia <em>Boardfly<\/em>, que conecta diretamente <strong>1.152 chips<\/strong> num pod, e traz <strong>3\u00d7 mais SRAM no chip<\/strong> \u2014 o suficiente para manter KV caches inteiros no sil\u00edcio, sem ida \u00e0 HBM \u2014 mais um motor dedicado de coletivas. A promessa \u00e9 80% mais desempenho por d\u00f3lar em infer\u00eancia que a gera\u00e7\u00e3o anterior.<\/li>\n<\/ul>\n<p>Repare no que o 8i denuncia: o gargalo que a ind\u00fastria inteira persegue agora \u00e9 o KV cache, o mesmo que a DeepSeek atacou por software com o MLA. Um resolve com arquitetura de modelo, o outro com SRAM. At\u00e9 o fechamento deste texto as duas ainda n\u00e3o apareciam nas <em>release notes<\/em> do Cloud TPU \u2014 an\u00fancio n\u00e3o \u00e9 disponibilidade.<\/p>\n<h2>Software: XLA e JAX<\/h2>\n<p>Sem compilador o ASIC \u00e9 um tijolo. O <strong>XLA<\/strong> (Accelerated Linear Algebra) l\u00ea o grafo, funde ops num kernel s\u00f3, aloca VMEM e programa a s\u00edstole. O <strong>JAX<\/strong> \u00e9 a linguagem da DeepMind: Python \u2192 XLA, com <code>pmap<\/code> e <code>shard_map<\/code>. PyTorch\/XLA cobre quem j\u00e1 tem o modelo em PyTorch.<\/p>\n<p>Tem um detalhe que pega todo mundo na primeira vez: o XLA compila para <strong>forma fixa<\/strong>. Mudou o <em>shape<\/em> do tensor, recompila \u2014 e a recompila\u00e7\u00e3o custa segundos. C\u00f3digo que na GPU aceita batch vari\u00e1vel sem reclamar, na TPU vira um loop de recompila\u00e7\u00f5es que come o ganho inteiro. A regra pr\u00e1tica \u00e9 <em>padding<\/em> para um punhado de tamanhos fixos.<\/p>\n<h2>Colocando a m\u00e3o numa TPU<\/h2>\n<p>N\u00e3o d\u00e1 para comprar uma TPU e parafusar no gabinete: elas s\u00f3 existem dentro do Google. O que d\u00e1 \u00e9 alugar \u2014 e h\u00e1 caminho gratuito.<\/p>\n<p><strong>O jeito de gra\u00e7a:<\/strong> <a href=\"https:\/\/colab.research.google.com\/\">Google Colab<\/a> e <a href=\"https:\/\/www.kaggle.com\/code\">Kaggle Notebooks<\/a> oferecem runtime de TPU no plano gratuito (a gera\u00e7\u00e3o ofertada muda ao longo do tempo). No Colab \u00e9 <em>Ambiente de execu\u00e7\u00e3o \u2192 Alterar o tipo \u2192 TPU<\/em>. Serve para sentir o bicho sem cart\u00e3o de cr\u00e9dito.<\/p>\n<p><strong>O jeito de verdade,<\/strong> uma TPU VM no Google Cloud:<\/p>\n<pre><code class=\"language-bash\"># cria a VM com 8 chips v6e\ngcloud compute tpus tpu-vm create tpu-teste \n  --zone=us-central1-b \n  --accelerator-type=v6e-8 \n  --version=v2-alpha-tpuv6e\n\n# entra nela (\u00e9 uma VM Linux comum)\ngcloud compute tpus tpu-vm ssh tpu-teste --zone=us-central1-b\n<\/code><\/pre>\n<p>Dentro da VM, instale o JAX com o extra de TPU e confirme que o runtime enxergou o sil\u00edcio:<\/p>\n<pre><code class=\"language-bash\">pip install -U \"jax[tpu]\"\n\npython3 -c \"import jax; print(jax.devices()); print(jax.device_count())\"\n# [TpuDevice(id=0, ...), ...]   8\n<\/code><\/pre>\n<p>Um MatMul grande em bfloat16, que \u00e9 literalmente o trabalho da MXU:<\/p>\n<pre><code class=\"language-python\">import jax, jax.numpy as jnp\n\nx = jnp.ones((8192, 8192), dtype=jnp.bfloat16)\nmm = jax.jit(lambda a: a @ a.T)\ny = mm(x).block_until_ready()\n\nprint(y.shape, y.dtype)\nprint(jax.devices()[0].device_kind)\n<\/code><\/pre>\n<p>Duas ressalvas sobre a zona e a gera\u00e7\u00e3o. A v6e n\u00e3o existe em toda regi\u00e3o: a documenta\u00e7\u00e3o lista <code>us-central1-b<\/code>, <code>us-east1-d<\/code>, <code>us-east5-a<\/code>, <code>us-east5-b<\/code>, <code>europe-west4-a<\/code>, <code>asia-northeast1-b<\/code> e \u2014 o que interessa a quem est\u00e1 no Brasil \u2014 <code>southamerica-west1-a<\/code>, em Santiago. Pedir a zona errada faz o <code>create<\/code> falhar. E o fluxo <code>tpu-vm<\/code> acima vale para as gera\u00e7\u00f5es at\u00e9 a v6e; o TPU7x \u00e9 provisionado como inst\u00e2ncia do Compute Engine, com outro comando.<\/p>\n<p>O <code>block_until_ready()<\/code> n\u00e3o \u00e9 decora\u00e7\u00e3o: JAX \u00e9 ass\u00edncrono e, sem ele, voc\u00ea cronometra o despacho, n\u00e3o a conta. Quem j\u00e1 tem modelo em PyTorch usa o <a href=\"https:\/\/github.com\/pytorch\/xla\">PyTorch\/XLA<\/a>:<\/p>\n<pre><code class=\"language-bash\">pip install torch torch_xla[tpu]\npython3 -c \"import torch_xla; print(torch_xla.device())\"\n<\/code><\/pre>\n<p>E o aviso mais importante do post: <strong>TPU parada continua sendo cobrada.<\/strong> Terminou o teste, destrua:<\/p>\n<pre><code class=\"language-bash\">gcloud compute tpus tpu-vm delete tpu-teste --zone=us-central1-b\ngcloud compute tpus tpu-vm list --zone=us-central1-b   # confira que n\u00e3o sobrou nada\n<\/code><\/pre>\n<h2>E o Linux nisso<\/h2>\n<p>Toda TPU VM \u00e9 uma m\u00e1quina Linux. Voc\u00ea recebe um Debian com os chips pendurados no barramento, e o acesso \u00e9 o de sempre: SSH, <code>systemd<\/code>, <code>apt<\/code>, <code>pip<\/code>. Dentro dela:<\/p>\n<pre><code class=\"language-bash\">lspci | grep -i google    # os aceleradores no barramento\nls \/dev\/accel* 2>\/dev\/null; ls \/dev\/vfio\/ 2>\/dev\/null   # o n\u00f3 de dispositivo muda por gera\u00e7\u00e3o\npython3 -c \"import jax; print(jax.local_device_count())\"\n<\/code><\/pre>\n<p>A camada propriet\u00e1ria \u00e9 o <code>libtpu<\/code>, a biblioteca de runtime que o XLA carrega para falar com o chip \u2014 ela vem junto no <code>jax[tpu]<\/code> e n\u00e3o tem c\u00f3digo aberto. O andar de cima, por outro lado, \u00e9 todo livre: <a href=\"https:\/\/github.com\/jax-ml\/jax\">JAX<\/a> e <a href=\"https:\/\/github.com\/openxla\/xla\">OpenXLA<\/a> sob Apache 2.0, e o <a href=\"https:\/\/github.com\/pytorch\/xla\">PyTorch\/XLA<\/a> sob BSD 3-Clause.<\/p>\n<p>J\u00e1 a \u00fanica TPU que dava para ter na mesa \u2014 o <strong>Coral Edge TPU<\/strong>, aquele pendrive de US$ 60 que rodava MobileNet quantizado em INT8 e virou febre no Frigate e em projetos de Raspberry Pi \u2014 <strong>acabou<\/strong>. O reposit\u00f3rio <code>google-coral\/edgetpu<\/code> foi arquivado em abril de 2026, as bibliotecas pararam no TensorFlow 2.16 e o driver <code>gasket<\/code> das vers\u00f5es PCIe n\u00e3o compila mais em kernel recente sem remendo. Se voc\u00ea tem um funcionando, \u00f3timo; comprar em 2026 \u00e9 comprar d\u00edvida t\u00e9cnica. N\u00e3o houve an\u00fancio formal de fim de vida \u2014 o site simplesmente mudou de assunto: <code>coral.ai<\/code> hoje redireciona para uma plataforma nova, a <strong>CoralNPU<\/strong>, uma NPU de arquitetura <strong>RISC-V aberta<\/strong> com toolchain baseado em MLIR, que promete receber modelos de PyTorch, JAX ou LiteRT. Os reposit\u00f3rios contam a mesma hist\u00f3ria: todo o ecossistema Edge TPU est\u00e1 arquivado, e os \u00fanicos com commit recente s\u00e3o <code>coralnpu<\/code> e <code>coralnpu-compiler<\/code>. O Edge TPU acabou; a marca Coral, n\u00e3o. Para infer\u00eancia local hoje o caminho \u00e9 GPU com <a href=\"\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">Ollama<\/a>, <a href=\"\/2026\/09\/llama-cpp-primeiros-passos\/\">llama.cpp<\/a> ou uma NPU integrada ao processador.<\/p>\n<p>No Linux de casa, portanto, a TPU n\u00e3o aparece. GPU local continua CUDA\/ROCm \u2014 o post do <a href=\"\/2026\/09\/servidor-ia-recondicionado-64gb-vram-v100-p100-mi25\/\">servidor recondicionado<\/a> \u00e9 o outro lado da cerca.<\/p>\n<h2>O que nasceu nesse sil\u00edcio<\/h2>\n<pre><code class=\"language-text\">2017  Transformer     (\"Attention Is All You Need\") \u2014 8 GPUs NVIDIA P100\n2018  BERT            16 chips de Cloud TPU (Base) \/ 64 chips (Large)\n2021  AlphaFold 2     128 cores de TPU v3\n2022  PaLM 540 B      dois pods v4, via Pathways\n2023\u2013 Gemini          v4 e v5p; contexto de 1 a 2 M de tokens\n<\/code><\/pre>\n<p>Vale desfazer um mito que este blog ajudou a repetir: o <strong>Transformer n\u00e3o nasceu em TPU<\/strong>. O paper de 2017 \u00e9 expl\u00edcito \u2014 o modelo base foi treinado numa \u00fanica m\u00e1quina com <strong>oito GPUs NVIDIA P100<\/strong>. O que a TPU fez foi viabilizar tudo o que veio depois, quando o mesmo desenho precisou de escala.<\/p>\n<p>O BERT j\u00e1 \u00e9 hist\u00f3ria de TPU: 16 chips de Cloud TPU para o Base, 64 para o Large \u2014 o paper n\u00e3o nomeia a gera\u00e7\u00e3o. AlphaFold 2, publicado na Nature em 2021 (o CASP14 foi em 2020), treinou em 128 cores de TPU v3 e fechou o problema do enovelamento de prote\u00ednas. PaLM mostrou 540 B em dois pods v4 geograficamente ligados por Pathways. E o Gemini s\u00f3 abre janela de milh\u00e3o de tokens porque HBM3 + OCS partem o tensor sem o barramento virar fila \u2014 o mesmo problema que o <a href=\"\/2026\/09\/como-deepseek-reescreveu-o-transformer-mla\/\">MLA da DeepSeek<\/a> ataca no cache, do outro lado da ind\u00fastria.<\/p>\n<h2>Quem est\u00e1 comprando TPU em 2026<\/h2>\n<p>Durante uma d\u00e9cada a TPU foi sil\u00edcio de uso interno com uma ponta alugada no Cloud. Isso mudou. Em <strong>23 de outubro de 2025<\/strong>, Google e Anthropic anunciaram um acordo de dezenas de bilh\u00f5es de d\u00f3lares que d\u00e1 \u00e0 Anthropic acesso a <strong>at\u00e9 um milh\u00e3o de TPUs<\/strong> \u2014 o teto de toda a expans\u00e3o contratada no Google Cloud \u2014 e, nas palavras do an\u00fancio, a \u201cbem mais de um gigawatt\u201d de capacidade em 2026. Meses depois, com a Broadcom no meio, as duas empresas estenderam o contrato para m\u00faltiplos gigawatts adicionais a partir de 2027.<\/p>\n<p>O detalhe que interessa aqui \u00e9 estrat\u00e9gico: a Anthropic roda a fam\u00edlia Claude em tr\u00eas sil\u00edcios diferentes \u2014 TPU do Google, <a href=\"\/2026\/09\/project-rainier-aws-data-center-sem-nvidia\/\">Trainium da AWS<\/a> e GPU NVIDIA \u2014 distribuindo cada tipo de carga onde ela sai mais barata. \u00c9 a prova pr\u00e1tica de que o duop\u00f3lio CUDA j\u00e1 n\u00e3o \u00e9 o \u00fanico caminho para treinar modelo de fronteira, e de que a TPU deixou de ser curiosidade de Mountain View para virar produto que concorrente compra.<\/p>\n<h2>Linha do tempo<\/h2>\n<ul>\n<li><strong>2013<\/strong> \u2014 a conta do comando de voz mostra que infer\u00eancia em x86 exigiria dobrar os data centers.<\/li>\n<li><strong>2015<\/strong> \u2014 TPU v1 entra em produ\u00e7\u00e3o interna, s\u00f3 infer\u00eancia INT8.<\/li>\n<li><strong>18\/05\/2016<\/strong> \u2014 o Google revela publicamente a exist\u00eancia da TPU, no dia de abertura do Google I\/O.<\/li>\n<li><strong>2017<\/strong> \u2014 v2 traz treino e bfloat16; sai o paper <em>In-Datacenter Performance Analysis<\/em>; o Transformer nasce em pods v2.<\/li>\n<li><strong>2018<\/strong> \u2014 v3 com refrigera\u00e7\u00e3o l\u00edquida e pod de 1.024 chips; BERT.<\/li>\n<li><strong>2020<\/strong> \u2014 AlphaFold 2 resolve o enovelamento de prote\u00ednas em pods v3.<\/li>\n<li><strong>2021<\/strong> \u2014 v4 estreia o OCS e o torus 3D; pod de 4.096 chips passa de 1 EFLOPS.<\/li>\n<li><strong>2022<\/strong> \u2014 PaLM 540 B treina em dois pods v4 ligados por Pathways.<\/li>\n<li><strong>2023<\/strong> \u2014 v5e (custo\/watt) e v5p (LLM); Gemini 1.0.<\/li>\n<li><strong>2024<\/strong> \u2014 v6e Trillium, MXU 256\u00d7256 e 918 TFLOPS BF16 por chip.<\/li>\n<li><strong>out\/2025<\/strong> \u2014 Anthropic fecha acesso a at\u00e9 1 milh\u00e3o de TPUs e 1 GW de capacidade.<\/li>\n<li><strong>09\/04\/2025<\/strong> \u2014 TPU7x Ironwood \u00e9 anunciado: 4.614 TFLOPS FP8, 192 GB de HBM3E, superpod de 9.216 chips e 42,5 EFLOPS por pod.<\/li>\n<li><strong>24\/11\/2025<\/strong> \u2014 o TPU7x entra em <em>preview<\/em> no Google Cloud.<\/li>\n<li><strong>31\/03\/2026<\/strong> \u2014 Ironwood chega \u00e0 disponibilidade geral.<\/li>\n<li><strong>19\/04\/2026<\/strong> \u2014 o reposit\u00f3rio <code>google-coral\/edgetpu<\/code> \u00e9 arquivado, encerrando o ciclo do Edge TPU (o desmonte havia come\u00e7ado em julho de 2025, com o <code>pycoral<\/code>).<\/li>\n<li><strong>22\/04\/2026<\/strong> \u2014 no Cloud Next \u201926 o Google anuncia a oitava gera\u00e7\u00e3o, TPU 8t e TPU 8i.<\/li>\n<\/ul>\n<h2>Refer\u00eancias<\/h2>\n<ul>\n<li><a href=\"https:\/\/docs.cloud.google.com\/tpu\/docs\/tpu7x\">TPU7x (Ironwood) \u2014 especifica\u00e7\u00f5es oficiais<\/a><\/li>\n<li><a href=\"https:\/\/docs.cloud.google.com\/tpu\/docs\/v6e\">TPU v6e (Trillium)<\/a><\/li>\n<li><a href=\"https:\/\/docs.cloud.google.com\/tpu\/docs\/release-notes\">Cloud TPU \u2014 release notes<\/a> (datas de preview e GA)<\/li>\n<li><a href=\"https:\/\/docs.cloud.google.com\/tpu\/docs\/regions-zones\">Cloud TPU \u2014 regi\u00f5es e zonas<\/a><\/li>\n<li><a href=\"https:\/\/developers.google.com\/coral\">CoralNPU<\/a> \u2014 a NPU RISC-V que substituiu o Edge TPU<\/li>\n<li><a href=\"https:\/\/docs.cloud.google.com\/tpu\/docs\/run-calculation-jax\">Rodar um c\u00e1lculo numa Cloud TPU VM com JAX<\/a><\/li>\n<li><a href=\"https:\/\/arxiv.org\/abs\/1704.04760\">In-Datacenter Performance Analysis of a Tensor Processing Unit<\/a> (v1, Jouppi et al.)<\/li>\n<li><a href=\"https:\/\/www.anthropic.com\/news\/google-broadcom-partnership-compute\">Anthropic \u2014 expans\u00e3o da parceria com Google e Broadcom<\/a><\/li>\n<li><a href=\"https:\/\/github.com\/google-coral\/edgetpu\">google-coral\/edgetpu<\/a> (arquivado em abril de 2026)<\/li>\n<li><a href=\"\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU: como os chips de IA funcionam<\/a><\/li>\n<li><a href=\"\/2026\/09\/como-deepseek-reescreveu-o-transformer-mla\/\">Como a DeepSeek reescreveu o Transformer<\/a><\/li>\n<li><a href=\"\/2026\/09\/como-funcionam-placas-de-video\/\">Como funcionam as placas de v\u00eddeo<\/a><\/li>\n<li><a href=\"\/2026\/09\/o-que-e-uma-rede-neural\/\">O que \u00e9 uma rede neural?<\/a><\/li>\n<\/ul>\n<p>Enquanto o mercado disputa H100 e Blackwell, o Google colhe uma d\u00e9cada de ASIC, formato num\u00e9rico pr\u00f3prio, laser no pod e compilador. A TPU n\u00e3o \u00e9 \u201cGPU do Google\u201d. \u00c9 a prova de que, em treino e infer\u00eancia de tensor, especializar o sil\u00edcio ainda ganha da for\u00e7a bruta gen\u00e9rica \u2014 e, agora que a concorr\u00eancia aluga o pod por gigawatt, \u00e9 tamb\u00e9m a prova de que d\u00e1 para vender essa aposta.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usu\u00e1rio Android usasse o comando de voz da Busca por tr\u00eas minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers s\u00f3 para infer\u00eancia. GPU de consumo ainda era placa de jogo adaptada. A resposta foi &#8230; <a title=\"Google TPUs: arquitetura, gera\u00e7\u00f5es e modelos\" class=\"read-more\" href=\"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/google-tpus-guia-completo-arquitetura-e-modelos\/\" aria-label=\"Read more about Google TPUs: arquitetura, gera\u00e7\u00f5es e modelos\">Read more<\/a><\/p>","protected":false},"author":0,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[115,2],"tags":[134,116,128,151],"class_list":["post-432","post","type-post","status-publish","format-standard","hentry","category-ia","category-linux","tag-gpu","tag-ia","tag-llm","tag-tpu"],"_links":{"self":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/432","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/comments?post=432"}],"version-history":[{"count":3,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/432\/revisions"}],"predecessor-version":[{"id":1121,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/432\/revisions\/1121"}],"wp:attachment":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/media?parent=432"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/categories?post=432"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/tags?post=432"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}