A história de Elon Musk: do abismo ao império

Poucas figuras da tecnologia polarizam tanto quanto Elon Reeve Musk (Pretória, 28 de junho de 1971). Visionário de foguete reutilizável e carro elétrico para uns; gestor volátil e acionista-operador de um conglomerado (Tesla, SpaceX/SpaceXAI, Neuralink, X) para outros. Antes disso dormiu no chão de um escritório, perdeu o CEO do PayPal num avião e esteve … Read more

Google TPUs: arquitetura, gerações e modelos

Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usuário Android usasse o comando de voz da Busca por três minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers só para inferência. GPU de consumo ainda era placa de jogo adaptada. A resposta foi … Read more

Como a DeepSeek reescreveu o Transformer

Em janeiro de 2025 a DeepSeek soltou o R1 (e, semanas antes, o V3) competindo com o1 e GPT-4o em raciocínio — com uma fração do custo de treino e de inferência. Os pesos saíram abertos. O truque não é um truque de dataset: é uma reescrita do miolo do Transformer, o Multi-Head Latent Attention … Read more

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Read more

Como funcionam as placas de vídeo

Quantos cálculos uma placa de vídeo faz por segundo para desenhar um frame de Cyberpunk ou para treinar uma rede? O canal Branch Education desmontou uma RTX 3090 — no sentido literal — e reconstruiu o die GA102 em 3D. Este texto segue o vídeo How do Graphics Cards Work? Exploring GPU Architecture. A geração … Read more

Machine Learning de ponta a ponta

Programar é: dados + regras → resposta. Precificar casa, reconhecer cara, entender português — regras manuais não dão conta. O Machine Learning inverte a conta: dados + respostas de exemplo → o modelo (as regras). Este texto segue o curso How Machine Learning Works, End to End do KodeKloud: da planilha ao ChatGPT, o ciclo … Read more

O que é uma rede neural?

Reconhecer um 3 rabiscado em 28×28 pixels é instantâneo para você. Escrever um if/else que faça o mesmo — curva aqui, haste ali, e se estiver torto? — é um inferno. A rede neural do vídeo But what is a neural network?, do 3Blue1Brown (Grant Sanderson), desmonta isso: não é mágica, é uma função com … Read more

GPU vs TPU: como os chips de IA funcionam

Por trás de cada token do ChatGPT, de cada frame do Sora e de cada LLM que você roda no Ollama, tem um acelerador fazendo a mesma conta trilhões de vezes: multiplicação de matrizes. Os dois jeitos de fazer isso em silício — GPU (NVIDIA) e TPU (Google) — partem de filosofias opostas. Este texto … Read more

llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

Se você roda modelos de IA localmente com llama.cpp / llama-server, conhece a dor: baixar GGUF na mão, editar config, reiniciar serviço, torcer para o modelo subir. O llama-model resolve isso — uma CLI em Go, binário estático único, que gerencia o seu acervo de modelos e o serviço llama-server sem precisar do daemon do … Read more