llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama

llama-model CLI gerenciando modelos GGUF no Linux

Se você roda modelos de IA localmente com llama.cpp / llama-server, conhece a dor: baixar GGUF na mão, editar config, reiniciar serviço, torcer para o modelo subir. O llama-model resolve isso — uma CLI em Go, binário estático único, que gerencia o seu acervo de modelos e o serviço llama-server sem precisar do daemon do Ollama. E está aberta para testes: queremos usuários!

O que ela faz

Comando Função
list Lista os modelos no disco (nome, tamanho, quantização)
pull <modelo> Baixa direto do registry do Ollama — sem daemon, com sha256 e retomada
set <modelo> Troca o modelo do llama-server, reinicia, valida /health e faz rollback se falhar
rm <modelo> Remove um modelo preservando blobs compartilhados
gpu list / gpu watch Telemetria das GPUs NVIDIA (temperatura, potência, clocks, throttle)
proxy Front-end com protocolo Anthropic para usar o Claude Code com o llama-server

Por que isso é interessante

  • Sem daemon: o pull fala HTTPS direto com o registry do Ollama. Blobs verificados por sha256 e download retomável — conexão caiu, roda de novo e continua de onde parou.
  • set com rede de segurança: edita /etc/default/llama-server, reinicia e espera o /health. Se o modelo não subir, restaura a config anterior sozinho. Ainda ajusta as configs do OpenCode e Hermes se existirem (com .bak de cada arquivo).
  • Telemetria que sobrevive a crash: o gpu watch registra picos de temperatura/potência, decodifica motivos de throttle e, se a placa cair do barramento, imprime a última leitura boa junto com as mensagens Xid do kernel — o que você precisa para separar problema térmico de problema de energia.
  • Claude Code + modelo local: o proxy corrige o protocolo Anthropic para o llama-server (templates como o do Qwen rejeitam certas mensagens system), com streaming funcionando.

Instalando (Linux amd64)

curl -sL https://github.com/jniltinho/llama-model/releases/latest/download/llama-model_$(curl -s https://api.github.com/repos/jniltinho/llama-model/releases/latest | grep -oP '"tag_name": "vK[^"]+')_linux_amd64.tar.gz | tar xz
sudo install -m0755 llama-model /usr/local/bin/

Ou compilando do fonte (Go 1.26+):

git clone https://github.com/jniltinho/llama-model
cd llama-model && make build && sudo make install

Começando em 2 minutos

llama-model list                    # o que já está no disco
sudo llama-model pull qwen3.8:27b   # baixa do ollama.com/library
sudo llama-model set qwen3.8:27b    # troca, reinicia e valida
llama-model gpu watch               # telemetria ao vivo das GPUs

E para plugar o Claude Code no seu modelo local:

llama-model proxy --listen 127.0.0.1:11436 --upstream http://127.0.0.1:11435
export ANTHROPIC_BASE_URL=http://127.0.0.1:11436

Queremos você testando! 🧪

O projeto é open source (MIT), com CI e releases no GitHub, e está na fase em que feedback de usuários reais vale ouro:

Rodar IA local no Linux está cada vez melhor — e ferramenta boa de operação é o que separa o brinquedo do servidor de verdade. Bora testar?