Google TPUs: arquitetura, gerações e modelos

Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usuário Android usasse o comando de voz da Busca por três minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers só para inferência. GPU de consumo ainda era placa de jogo adaptada. A resposta foi … Read more

Como a DeepSeek reescreveu o Transformer

Em janeiro de 2025 a DeepSeek soltou o R1 (e, semanas antes, o V3) competindo com o1 e GPT-4o em raciocínio — com uma fração do custo de treino e de inferência. Os pesos saíram abertos. O truque não é um truque de dataset: é uma reescrita do miolo do Transformer, o Multi-Head Latent Attention … Read more

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Read more

Machine Learning de ponta a ponta

Programar é: dados + regras → resposta. Precificar casa, reconhecer cara, entender português — regras manuais não dão conta. O Machine Learning inverte a conta: dados + respostas de exemplo → o modelo (as regras). Este texto segue o curso How Machine Learning Works, End to End do KodeKloud: da planilha ao ChatGPT, o ciclo … Read more

Rodando IA local no Linux com Ollama

Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama, você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Neste howto mostro como instalar e usar. Por que rodar IA local? Privacidade: seus dados não saem da máquina — ótimo … Read more