Como a DeepSeek reescreveu o Transformer

Como a DeepSeek reescreveu o Transformer

Em janeiro de 2025 a DeepSeek soltou o R1 (e, semanas antes, o V3) competindo com o1 e GPT-4o em raciocínio — com uma fração do custo de treino e de inferência. Os pesos saíram abertos. O truque não é um truque de dataset: é uma reescrita do miolo do Transformer, o Multi-Head Latent Attention … Leia mais

Servidor de IA recondicionado com 64 GB de VRAM

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Leia mais

Como funcionam as placas de vídeo

Como funcionam as placas de vídeo

Quantos cálculos uma placa de vídeo faz por segundo para desenhar um frame de Cyberpunk ou para treinar uma rede? O canal Branch Education desmontou uma RTX 3090 — no sentido literal — e reconstruiu o die GA102 em 3D. Este texto segue o vídeo How do Graphics Cards Work? Exploring GPU Architecture. A geração … Leia mais

Machine Learning de ponta a ponta

Machine Learning de ponta a ponta

Programar é: dados + regras → resposta. Precificar casa, reconhecer cara, entender português — regras manuais não dão conta. O Machine Learning inverte a conta: dados + respostas de exemplo → o modelo (as regras). Este texto segue o curso How Machine Learning Works, End to End do KodeKloud: da planilha ao ChatGPT, o ciclo … Leia mais

Deep Learning para iniciantes

Deep Learning para iniciantes

O Deep Learning Crash Course for Beginners do Jason Dsouza no freeCodeCamp é o mapa do território: o que é DL, como a rede aprende, o vocabulário (loss, Adam, epoch) e as três famílias de arquitetura. Este texto compacta o curso. A conta por baixo — MatMul, GPU — está no GPU vs TPU; o … Leia mais

O que é uma rede neural?

O que é uma rede neural?

Reconhecer um 3 rabiscado em 28×28 pixels é instantâneo para você. Escrever um if/else que faça o mesmo — curva aqui, haste ali, e se estiver torto? — é um inferno. A rede neural do vídeo But what is a neural network?, do 3Blue1Brown (Grant Sanderson), desmonta isso: não é mágica, é uma função com … Leia mais

GPU vs TPU: como os chips de IA funcionam

GPU vs TPU: como os chips de IA funcionam

Por trás de cada token do ChatGPT, de cada frame do Sora e de cada LLM que você roda no Ollama, tem um acelerador fazendo a mesma conta trilhões de vezes: multiplicação de matrizes. Os dois jeitos de fazer isso em silício — GPU (NVIDIA) e TPU (Google) — partem de filosofias opostas. Este texto … Leia mais

llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

Se você roda modelos de IA localmente com llama.cpp / llama-server, conhece a dor: baixar GGUF na mão, editar config, reiniciar serviço, torcer para o modelo subir. O llama-model resolve isso — uma CLI em Go, binário estático único, que gerencia o seu acervo de modelos e o serviço llama-server sem precisar do daemon do … Leia mais

Rodando IA local no Linux com Ollama

Rodando IA local no Linux com Ollama

Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Este post conta de onde o projeto veio — a origem explica muita coisa do desenho dele — e mostra como … Leia mais

Assistentes de IA no terminal Linux

Assistentes de IA no terminal Linux

A geração atual de assistentes de IA saiu do navegador e entrou no terminal — onde o sysadmin e o dev realmente trabalham. Eles leem arquivos, explicam erros, escrevem scripts e executam comandos com a sua aprovação. Este post é o mapa atualizado de setembro de 2026: o que existe, como instalar cada um e … Leia mais