
VPS para Ollama: onde hospedar modelos locais e quanto custa
2 vCPU · 8 GB RAM · 100 GB NVMe — renova R$ 77,99.
Qual porte de Ollama você vai rodar?
Requisitos conferidos em 29/07/2026: Ollama Docs: FAQ oficial sobre modelos carregados em memória de sistema ou GPU, concorrência e controle de contexto · Ollama Docs: suporte oficial a hardware NVIDIA, AMD e Metal · Ollama Docs: contexto padrão por VRAM e efeito do contexto maior no consumo de memória · Catálogo oficial do Ollama: tamanho do modelo qwen3:latest (5,2 GB) · Hostinger: página oficial do template Docker do Ollama e planos KVM exibidos para a aplicação.


Preço promocional e de renovação conferidos manualmente em 22/07/2026. Internacionais em dólar (câmbio 5.50, sem IOF).
Ollama: principais recursos
Ollama é a peça de infraestrutura para quem quer que um app converse com um modelo local. Ele não substitui apenas um chat: pode ficar atrás de uma ferramenta de código, um agente, uma automação ou uma interface de documentos. A vantagem é controlar o endpoint e os modelos baixados. A contrapartida é objetiva: você passa a administrar disco, atualizações, acesso à API e a capacidade de inferência da máquina.
O erro mais caro é escolher VPS pelo nome do Ollama, como se ele tivesse um requisito fixo. O processo leve pode caber em CPU, mas o modelo permanece em memória durante o uso e o tamanho do contexto aumenta essa demanda. Um modelo com alguns gigabytes no catálogo não transforma automaticamente a mesma VPS em máquina para modelos grandes ou várias conversas paralelas. Comece pelo modelo que seu app realmente chama, acompanhe RAM, VRAM, disco e latência, e só então aumente o plano.
Instalando o Ollama na VPS (resumo)
- Escolha a VPS pelo modelo e pelo contexto que pretende usar; trate os planos da tabela como referências de porte, não como mínimo oficial do Ollama.
- Use o template Docker da Hostinger ou instale a imagem oficial ollama/ollama em uma VPS Linux com volume persistente para os modelos.
- Publique somente a API necessária e não deixe a porta do Ollama aberta à internet sem autenticação, proxy ou controle de rede.
- Baixe um único modelo inicial com ollama pull e teste uma conversa ou a integração que vai consumi-lo antes de carregar uma biblioteca inteira.
- Monitore RAM, VRAM, disco e latência; faça backup da configuração e revise o tamanho do contexto antes de aumentar a concorrência.
Perguntas frequentes
Ollama precisa de GPU?
Não. A documentação oficial mostra que o modelo pode ser carregado inteiramente na memória do sistema, inteiramente na GPU ou dividido entre as duas. GPU é uma escolha de desempenho e de capacidade de VRAM para a inferência local; ela não é requisito para instalar ou executar Ollama em CPU.
Qual é o requisito mínimo oficial do Ollama?
O projeto não publica um mínimo universal de vCPU, RAM e disco. Isso varia com o modelo carregado, o contexto e a concorrência. A página oficial da Hostinger para o template apresenta KVM 2 com 2 vCPUs, 8 GB de RAM e 100 GB de disco como o menor plano exibido, mas isso é uma referência comercial, não um mínimo declarado pelo Ollama.
Por que aumentar o contexto pode deixar a VPS sem memória?
O contexto é a quantidade de tokens que o modelo mantém disponível durante a conversa. As docs do Ollama informam que um contexto maior aumenta a memória necessária para executar o modelo. Antes de elevar esse valor, verifique a memória disponível e a VRAM, se houver GPU.
Quando não vale usar VPS para Ollama?
Não vale se você não quer administrar modelos, acesso de rede, atualizações e observabilidade, ou se o seu caso precisa de um modelo grande sem orçamento para a RAM ou GPU correspondente. Também pode ser mais simples usar uma API hospedada quando privacidade local e controle do endpoint não são requisitos.
Procurando outro software? Veja todos os apps e onde hospedar cada um.








