Rodando IA local no Linux com Ollama

Ollama rodando IA local no Linux

Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama, você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Neste howto mostro como instalar e usar.

Por que rodar IA local?

  • Privacidade: seus dados não saem da máquina — ótimo para código e documentos internos.
  • Custo zero por uso: depois de baixar o modelo, rode quantas vezes quiser.
  • Funciona offline: útil em redes restritas e servidores isolados.

O requisito real é memória: modelos pequenos (3B–8B parâmetros) rodam bem com 8–16 GB de RAM; com uma GPU NVIDIA a resposta fica muito mais rápida.

Instalando o Ollama

Instalação em uma linha, direto do site oficial:

curl -fsSL https://ollama.com/install.sh | sh

O instalador cria o serviço systemd ollama e detecta GPU automaticamente. Confira:

systemctl status ollama
ollama --version

Baixando e rodando um modelo

# baixa e já abre o chat interativo
ollama run llama3.2

# só baixar, sem abrir o chat
ollama pull qwen2.5-coder

# listar modelos instalados
ollama list

Dica: para máquinas modestas, prefira as variantes menores (ex.: llama3.2:3b). Para programar, os modelos da família coder costumam se sair melhor.

Usando pela API

O Ollama sobe uma API HTTP local na porta 11434 — dá para integrar com qualquer script:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Explique o comando: tar czf backup.tar.gz /etc",
  "stream": false
}'

Removendo modelos

Modelos ocupam vários GB. Para limpar:

ollama rm llama3.2

Pronto: IA rodando 100% no seu Linux. Nos próximos posts vamos integrar o Ollama a fluxos de automação no servidor.