
Se você roda modelos de IA localmente com llama.cpp / llama-server, conhece a dor: baixar GGUF na mão, editar config, reiniciar serviço, torcer para o modelo subir. O llama-model resolve isso — uma CLI em Go, binário estático único, que gerencia o seu acervo de modelos e o serviço llama-server sem precisar do daemon do Ollama. E está aberta para testes: queremos usuários!
O que ela faz
| Comando | Função |
|---|---|
list |
Lista os modelos no disco (nome, tamanho, quantização) |
pull <modelo> |
Baixa direto do registry do Ollama — sem daemon, com sha256 e retomada |
set <modelo> |
Troca o modelo do llama-server, reinicia, valida /health e faz rollback se falhar |
rm <modelo> |
Remove um modelo preservando blobs compartilhados |
gpu list / gpu watch |
Telemetria das GPUs NVIDIA (temperatura, potência, clocks, throttle) |
proxy |
Front-end com protocolo Anthropic para usar o Claude Code com o llama-server |
Por que isso é interessante
- Sem daemon: o
pullfala HTTPS direto com o registry do Ollama. Blobs verificados por sha256 e download retomável — conexão caiu, roda de novo e continua de onde parou. setcom rede de segurança: edita/etc/default/llama-server, reinicia e espera o/health. Se o modelo não subir, restaura a config anterior sozinho. Ainda ajusta as configs do OpenCode e Hermes se existirem (com.bakde cada arquivo).- Telemetria que sobrevive a crash: o
gpu watchregistra picos de temperatura/potência, decodifica motivos de throttle e, se a placa cair do barramento, imprime a última leitura boa junto com as mensagens Xid do kernel — o que você precisa para separar problema térmico de problema de energia. - Claude Code + modelo local: o
proxycorrige o protocolo Anthropic para o llama-server (templates como o do Qwen rejeitam certas mensagens system), com streaming funcionando.
Instalando (Linux amd64)
curl -sL https://github.com/jniltinho/llama-model/releases/latest/download/llama-model_$(curl -s https://api.github.com/repos/jniltinho/llama-model/releases/latest | grep -oP '"tag_name": "vK[^"]+')_linux_amd64.tar.gz | tar xz
sudo install -m0755 llama-model /usr/local/bin/
Ou compilando do fonte (Go 1.26+):
git clone https://github.com/jniltinho/llama-model
cd llama-model && make build && sudo make install
Começando em 2 minutos
llama-model list # o que já está no disco
sudo llama-model pull qwen3.8:27b # baixa do ollama.com/library
sudo llama-model set qwen3.8:27b # troca, reinicia e valida
llama-model gpu watch # telemetria ao vivo das GPUs
E para plugar o Claude Code no seu modelo local:
llama-model proxy --listen 127.0.0.1:11436 --upstream http://127.0.0.1:11435
export ANTHROPIC_BASE_URL=http://127.0.0.1:11436
Queremos você testando! 🧪
O projeto é open source (MIT), com CI e releases no GitHub, e está na fase em que feedback de usuários reais vale ouro:
- Teste no seu setup (é um binário só, fácil de experimentar e de remover)
- Abra issues com bugs, dúvidas ou ideias: github.com/jniltinho/llama-model/issues
- Contribua com PRs — código Go direto, sem dependências exóticas
- Deixe uma estrela ⭐ se o projeto te ajudar: github.com/jniltinho/llama-model
Rodar IA local no Linux está cada vez melhor — e ferramenta boa de operação é o que separa o brinquedo do servidor de verdade. Bora testar?