{"id":291,"date":"2026-09-05T18:58:43","date_gmt":"2026-09-05T21:58:43","guid":{"rendered":"https:\/\/www.linuxpro.com.br\/2026\/09\/llama-model-cli\/"},"modified":"2026-09-10T22:57:20","modified_gmt":"2026-09-11T01:57:20","slug":"llama-model-cli","status":"publish","type":"post","link":"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/llama-model-cli\/","title":{"rendered":"llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" alt=\"Mascote do LinuxPro retirando um modelo da estante de arquivos GGUF, com a lhama observando\" src=\"\/wp-content\/uploads\/2026\/09\/llama-model-v4.webp\" width=\"1486\" height=\"856\" \/><\/p>\n<p>Se voc\u00ea roda modelos de IA localmente com <strong>llama.cpp \/ llama-server<\/strong>, conhece a dor: baixar GGUF na m\u00e3o, editar config, reiniciar servi\u00e7o, torcer para o modelo subir. O <strong>llama-model<\/strong> resolve isso \u2014 uma CLI em <strong>Go, bin\u00e1rio est\u00e1tico \u00fanico<\/strong>, que gerencia o seu acervo de modelos e o servi\u00e7o llama-server <strong>sem precisar do daemon do Ollama<\/strong>. E est\u00e1 aberta para testes: queremos usu\u00e1rios!<\/p>\n<h2>O que ela faz<\/h2>\n<table>\n<thead>\n<tr>\n<th>Comando<\/th>\n<th>Fun\u00e7\u00e3o<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><code>list<\/code><\/td>\n<td>Lista os modelos no disco (nome, tamanho, quantiza\u00e7\u00e3o)<\/td>\n<\/tr>\n<tr>\n<td><code>pull &lt;modelo&gt;<\/code><\/td>\n<td>Baixa direto do registry do Ollama \u2014 sem daemon, com sha256 e retomada<\/td>\n<\/tr>\n<tr>\n<td><code>set &lt;modelo&gt;<\/code><\/td>\n<td>Troca o modelo do llama-server, reinicia, valida <code>\/health<\/code> e faz <strong>rollback<\/strong> se falhar<\/td>\n<\/tr>\n<tr>\n<td><code>rm &lt;modelo&gt;<\/code><\/td>\n<td>Remove um modelo preservando blobs compartilhados<\/td>\n<\/tr>\n<tr>\n<td><code>gpu list<\/code> \/ <code>gpu watch<\/code><\/td>\n<td>Telemetria das GPUs NVIDIA (temperatura, pot\u00eancia, clocks, throttle)<\/td>\n<\/tr>\n<tr>\n<td><code>proxy<\/code><\/td>\n<td>Front-end com protocolo Anthropic para usar o <strong>Claude Code<\/strong> com o llama-server<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2>Por que isso \u00e9 interessante<\/h2>\n<ul>\n<li><strong>Sem daemon<\/strong>: o <code>pull<\/code> fala HTTPS direto com o registry do Ollama. Blobs verificados por sha256 e download <strong>retom\u00e1vel<\/strong> \u2014 conex\u00e3o caiu, roda de novo e continua de onde parou.<\/li>\n<li><strong><code>set<\/code> com rede de seguran\u00e7a<\/strong>: edita <code>\/etc\/default\/llama-server<\/code>, reinicia e espera o <code>\/health<\/code>. Se o modelo n\u00e3o subir, <strong>restaura a config anterior<\/strong> sozinho. Ainda ajusta as configs do OpenCode e Hermes se existirem (com <code>.bak<\/code> de cada arquivo).<\/li>\n<li><strong>Telemetria que sobrevive a crash<\/strong>: o <code>gpu watch<\/code> registra picos de temperatura\/pot\u00eancia, decodifica motivos de throttle e, se a placa cair do barramento, imprime a \u00faltima leitura boa junto com as mensagens Xid do kernel \u2014 o que voc\u00ea precisa para separar problema t\u00e9rmico de problema de energia.<\/li>\n<li><strong>Claude Code + modelo local<\/strong>: o <code>proxy<\/code> corrige o protocolo Anthropic para o llama-server (templates como o do Qwen rejeitam certas mensagens system), com streaming funcionando.<\/li>\n<\/ul>\n<h2>Instalando (Linux amd64)<\/h2>\n<pre><code class=\"language-bash\">curl -sL https:\/\/github.com\/jniltinho\/llama-model\/releases\/latest\/download\/llama-model_$(curl -s https:\/\/api.github.com\/repos\/jniltinho\/llama-model\/releases\/latest | grep -oP '&quot;tag_name&quot;: &quot;vK[^&quot;]+')_linux_amd64.tar.gz | tar xz\nsudo install -m0755 llama-model \/usr\/local\/bin\/\n<\/code><\/pre>\n<p>Ou compilando do fonte (Go 1.26+):<\/p>\n<pre><code class=\"language-bash\">git clone https:\/\/github.com\/jniltinho\/llama-model\ncd llama-model &amp;&amp; make build &amp;&amp; sudo make install\n<\/code><\/pre>\n<h2>Come\u00e7ando em 2 minutos<\/h2>\n<pre><code class=\"language-bash\">llama-model list                    # o que j\u00e1 est\u00e1 no disco\nsudo llama-model pull qwen3.8:27b   # baixa do ollama.com\/library\nsudo llama-model set qwen3.8:27b    # troca, reinicia e valida\nllama-model gpu watch               # telemetria ao vivo das GPUs\n<\/code><\/pre>\n<p>E para plugar o Claude Code no seu modelo local:<\/p>\n<pre><code class=\"language-bash\">llama-model proxy --listen 127.0.0.1:11436 --upstream http:\/\/127.0.0.1:11435\nexport ANTHROPIC_BASE_URL=http:\/\/127.0.0.1:11436\n<\/code><\/pre>\n<h2>Queremos voc\u00ea testando! \ud83e\uddea<\/h2>\n<p>O projeto \u00e9 <strong>open source (MIT)<\/strong>, com CI e releases no GitHub, e est\u00e1 na fase em que feedback de usu\u00e1rios reais vale ouro:<\/p>\n<ul>\n<li><strong>Teste<\/strong> no seu setup (\u00e9 um bin\u00e1rio s\u00f3, f\u00e1cil de experimentar e de remover)<\/li>\n<li><strong>Abra issues<\/strong> com bugs, d\u00favidas ou ideias: <a href=\"https:\/\/github.com\/jniltinho\/llama-model\/issues\">github.com\/jniltinho\/llama-model\/issues<\/a><\/li>\n<li><strong>Contribua<\/strong> com PRs \u2014 c\u00f3digo Go direto, sem depend\u00eancias ex\u00f3ticas<\/li>\n<li>Deixe uma <strong>estrela<\/strong> \u2b50 se o projeto te ajudar: <a href=\"https:\/\/github.com\/jniltinho\/llama-model\">github.com\/jniltinho\/llama-model<\/a><\/li>\n<\/ul>\n<p>Rodar IA local no Linux est\u00e1 cada vez melhor \u2014 e ferramenta boa de opera\u00e7\u00e3o \u00e9 o que separa o brinquedo do servidor de verdade. Bora testar?<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Se voc\u00ea roda modelos de IA localmente com llama.cpp \/ llama-server, conhece a dor: baixar GGUF na m\u00e3o, editar config, reiniciar servi\u00e7o, torcer para o modelo subir. O llama-model resolve isso \u2014 uma CLI em Go, bin\u00e1rio est\u00e1tico \u00fanico, que gerencia o seu acervo de modelos e o servi\u00e7o llama-server sem precisar do daemon do &#8230; <a title=\"llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama\" class=\"read-more\" href=\"https:\/\/www.linuxpro.com.br\/en\/2026\/09\/llama-model-cli\/\" aria-label=\"Read more about llama-model: gerencie modelos GGUF e o llama-server sem o daemon do Ollama\">Read more<\/a><\/p>","protected":false},"author":0,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[115,2,120],"tags":[135,8,133,31,134,116,132],"class_list":["post-291","post","type-post","status-publish","format-standard","hentry","category-ia","category-linux","category-servidores","tag-claude-code","tag-cli","tag-gguf","tag-golang","tag-gpu","tag-ia","tag-llama"],"_links":{"self":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/291","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/comments?post=291"}],"version-history":[{"count":6,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/291\/revisions"}],"predecessor-version":[{"id":1510,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/posts\/291\/revisions\/1510"}],"wp:attachment":[{"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/media?parent=291"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/categories?post=291"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/en\/wp-json\/wp\/v2\/tags?post=291"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}