llama.cpp: conhecendo, instalando e rodando IA local no Linux

llama.cpp: getting to know, installing and running local AI on Linux

Existe um projeto de que quase todo mundo depende sem saber. Quando você roda um modelo local com Ollama, com LM Studio, com Jan ou com aquele app de IA no celular, é bem provável que, lá embaixo, quem está fazendo a conta seja o llama.cpp — um motor de inferência escrito em C++ puro, … Read more

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

vLLM: servindo LLMs no Linux com alta vazão — história, instalação e primeiros passos

Se você já rodou um LLM local com Ollama ou llama.cpp, sabe que funciona muito bem — para uma ou duas pessoas. Quando a demanda vira uma API que precisa atender dezenas de requisições simultâneas, o jogo muda: a GPU fica ociosa esperando, a memória se fragmenta e a vazão despenca. É exatamente esse problema … Read more

Hermes Agent: o agente de IA que aprende com você

Hermes Agent: o agente de IA que aprende com você

Agentes de IA que vivem no seu terminal viraram commodity — mas um agente que aprende com a própria experiência ainda é raridade. O Hermes Agent, da Nous Research, é exatamente isso: um agente open source (MIT, escrito em Python) com um ciclo de aprendizado embutido — ele cria habilidades a partir das tarefas que … Read more

Google TPUs: arquitetura, gerações e modelos

Google TPUs: arquitetura, gerações e modelos

Por volta de 2013 o Google fez a conta que assustou Mountain View: se cada usuário Android usasse o comando de voz da Busca por três minutos ao dia, em CPU x86, a empresa teria de dobrar os data centers só para inferência. GPU de consumo ainda era placa de jogo adaptada. A resposta foi … Read more

Como a DeepSeek reescreveu o Transformer

Como a DeepSeek reescreveu o Transformer

Em janeiro de 2025 a DeepSeek soltou o R1 (e, semanas antes, o V3) competindo com o1 e GPT-4o em raciocínio — com uma fração do custo de treino e de inferência. Os pesos saíram abertos. O truque não é um truque de dataset: é uma reescrita do miolo do Transformer, o Multi-Head Latent Attention … Read more

Servidor de IA recondicionado com 64 GB de VRAM

Servidor de IA recondicionado com 64 GB de VRAM

VRAM dita o modelo. Qwen denso 27B–32B, Llama 70B quantizado, Mixtral 8×7B — isso pede 32 a 64 GB, não os 24 GB de uma 4090. O engenheiro Donato Capitella, com a Bargain Hardware, montou um Supermicro recondicionado com quatro GPUs de datacenter (64 GB no total) por cerca de £2.000 e mediu V100, P100 … Read more

Machine Learning de ponta a ponta

Machine Learning de ponta a ponta

Programar é: dados + regras → resposta. Precificar casa, reconhecer cara, entender português — regras manuais não dão conta. O Machine Learning inverte a conta: dados + respostas de exemplo → o modelo (as regras). Este texto segue o curso How Machine Learning Works, End to End do KodeKloud: da planilha ao ChatGPT, o ciclo … Read more

Rodando IA local no Linux com Ollama

Running local AI on Linux with Ollama

Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Este post conta de onde o projeto veio — a origem explica muita coisa do desenho dele — e mostra como … Read more