
Rodar modelos de IA localmente deixou de ser coisa de laboratório: com o Ollama, você baixa e executa LLMs no seu próprio Linux, sem enviar dados para a nuvem e sem pagar por token. Neste howto mostro como instalar e usar.
Por que rodar IA local?
- Privacidade: seus dados não saem da máquina — ótimo para código e documentos internos.
- Custo zero por uso: depois de baixar o modelo, rode quantas vezes quiser.
- Funciona offline: útil em redes restritas e servidores isolados.
O requisito real é memória: modelos pequenos (3B–8B parâmetros) rodam bem com 8–16 GB de RAM; com uma GPU NVIDIA a resposta fica muito mais rápida.
Instalando o Ollama
Instalação em uma linha, direto do site oficial:
curl -fsSL https://ollama.com/install.sh | sh
O instalador cria o serviço systemd ollama e detecta GPU automaticamente. Confira:
systemctl status ollama
ollama --version
Baixando e rodando um modelo
# baixa e já abre o chat interativo
ollama run llama3.2
# só baixar, sem abrir o chat
ollama pull qwen2.5-coder
# listar modelos instalados
ollama list
Dica: para máquinas modestas, prefira as variantes menores (ex.: llama3.2:3b). Para programar, os modelos da família coder costumam se sair melhor.
Usando pela API
O Ollama sobe uma API HTTP local na porta 11434 — dá para integrar com qualquer script:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Explique o comando: tar czf backup.tar.gz /etc",
"stream": false
}'
Removendo modelos
Modelos ocupam vários GB. Para limpar:
ollama rm llama3.2
Pronto: IA rodando 100% no seu Linux. Nos próximos posts vamos integrar o Ollama a fluxos de automação no servidor.