Servidor de IA recondicionado com 64 GB de VRAM

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Read more

Como funcionam as placas de vídeo

Como funcionam as placas de vídeo

Quantos cálculos uma placa de vídeo faz por segundo para desenhar um frame de Cyberpunk ou para treinar uma rede? O canal Branch Education desmontou uma RTX 3090 — no sentido literal — e reconstruiu o die GA102 em 3D. Este texto segue o vídeo How do Graphics Cards Work? Exploring GPU Architecture. A geração … Read more

Machine Learning de ponta a ponta

Machine Learning de ponta a ponta

Programar é: dados + regras → resposta. Precificar casa, reconhecer cara, entender português — regras manuais não dão conta. O Machine Learning inverte a conta: dados + respostas de exemplo → o modelo (as regras). Este texto segue o curso How Machine Learning Works, End to End do KodeKloud: da planilha ao ChatGPT, o ciclo … Read more

Deep Learning para iniciantes

Deep Learning para iniciantes

O Deep Learning Crash Course for Beginners do Jason Dsouza no freeCodeCamp é o mapa do território: o que é DL, como a rede aprende, o vocabulário (loss, Adam, epoch) e as três famílias de arquitetura. Este texto compacta o curso. A conta por baixo — MatMul, GPU — está no GPU vs TPU; o … Read more

O que é uma rede neural?

O que é uma rede neural?

Reconhecer um 3 rabiscado em 28×28 pixels é instantâneo para você. Escrever um if/else que faça o mesmo — curva aqui, haste ali, e se estiver torto? — é um inferno. A rede neural do vídeo But what is a neural network?, do 3Blue1Brown (Grant Sanderson), desmonta isso: não é mágica, é uma função com … Read more

GPU vs TPU: como os chips de IA funcionam

GPU vs TPU: how AI chips work

Por trás de cada token do ChatGPT, de cada frame do Sora e de cada LLM que você roda no Ollama, tem um acelerador fazendo a mesma conta trilhões de vezes: multiplicação de matrizes. Os dois jeitos de fazer isso em silício — GPU (NVIDIA) e TPU (Google) — partem de filosofias opostas. Este texto … Read more

llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

Se você roda modelos de IA localmente com llama.cpp / llama-server, conhece a dor: baixar GGUF na mão, editar config, reiniciar serviço, torcer para o modelo subir. O llama-model resolve isso — uma CLI em Go, binário estático único, que gerencia o seu acervo de modelos e o serviço llama-server sem precisar do daemon do … Read more

Linux faz 35 anos: de hobby a fundação da internet e da IA

Linux faz 35 anos: de hobby a fundação da internet e da IA

No dia 25 de agosto de 2026 o Linux completou 35 anos. Em 1991, um estudante finlandês de 21 anos chamado Linus Torvalds postou no grupo comp.os.minix uma mensagem que viraria história: Olá a todos que usam minix – Estou fazendo um sistema operacional (livre) (é só um hobby, não vai ser grande e profissional … Read more

Rodando IA local no Linux com Ollama

Running local AI on Linux with Ollama

Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Este post conta de onde o projeto veio — a origem explica muita coisa do desenho dele — e mostra como … Read more