Ilustração do Ollama executando modelos de IA locais em um servidor VPS

VPS para Ollama: onde hospedar modelos locais e quanto custa

Melhor custo hoje · uso leve
R$ 42,99/mês · Hostinger KVM 2

2 vCPU · 8 GB RAM · 100 GB NVMe — renova R$ 77,99.

Ver oferta e cupom →

preços conferidos em 22/07/2026renovação inclusa4 provedores comparados
Ollama roda modelos de IA localmente e expõe uma API para seus apps, agentes e automações. Em uma VPS, o dimensionamento não começa pelo instalador: começa pelo modelo, pelo tamanho do contexto e pela escolha entre CPU e GPU. Aqui você compara as VPS e entende o que realmente ocupa memória e disco.

Qual porte de Ollama você vai rodar?

Requisitos conferidos em 29/07/2026: Ollama Docs: FAQ oficial sobre modelos carregados em memória de sistema ou GPU, concorrência e controle de contexto · Ollama Docs: suporte oficial a hardware NVIDIA, AMD e Metal · Ollama Docs: contexto padrão por VRAM e efeito do contexto maior no consumo de memória · Catálogo oficial do Ollama: tamanho do modelo qwen3:latest (5,2 GB) · Hostinger: página oficial do template Docker do Ollama e planos KVM exibidos para a aplicação.

KVM 2
⚙️ 2 vCPU🧠 8 GB RAM💾 100 GB NVMe🇧🇷 Brasil🎟️ cupom disponível
R$ 42,99/mês
renova R$ 77,99

Ver oferta

VPS Dev
⚙️ 4 vCPU🧠 16 GB RAM💾 100 GB NVMe🇧🇷 Brasil🎟️ cupom disponível
R$ 229,90/mês
sem pulo de renovação

Ver oferta

Basic 4vCPU/8GB
⚙️ 4 vCPU🧠 8 GB RAM💾 160 GB NVMe🌎 exterior
R$ 264,00/mês
US$ 48 × 5.50

Ver oferta

Rapid VPS III
⚙️ 6 vCPU🧠 8 GB RAM💾 200 GB NVMe🇧🇷 Brasil🎟️ cupom disponível
R$ 287,00/mês
sem pulo de renovação

Ver oferta

Preço promocional e de renovação conferidos manualmente em 22/07/2026. Internacionais em dólar (câmbio 5.50, sem IOF).

Ollama não publica um mínimo universal de vCPU, RAM ou disco, porque o servidor pode carregar modelos de tamanhos muito diferentes. A própria documentação mostra que um modelo pode ficar inteiro na memória do sistema, na GPU ou dividido entre ambas; também avisa que aumentar o contexto aumenta a memória necessária. Por isso, os três portes acima reproduzem os planos KVM exibidos na página oficial da Hostinger para Ollama, e não uma promessa do projeto. GPU não é obrigatória: Ollama pode rodar só em CPU. Ela passa a ser importante quando você quer inferência local mais rápida ou precisa manter modelos maiores na VRAM. Dimensione pelo modelo que será baixado, pelo contexto e pelo número de modelos ou requisições simultâneas.

Ollama: principais recursos

Modelos locais por comando
Baixa e executa modelos do catálogo com a CLI, sem depender de uma API de nuvem para a inferência.
API para aplicações
Expõe uma API REST para gerar texto, conversar e administrar modelos a partir de outros serviços.
CPU ou GPU
Pode usar memória de sistema, GPU ou uma combinação das duas, conforme o hardware e o modelo carregado.
Biblioteca de modelos
O catálogo oficial reúne famílias de modelos com tags e tamanhos diferentes para cada necessidade.
Contexto configurável
Permite definir o tamanho do contexto por configuração do servidor, CLI ou API, com impacto direto na memória.
Docker oficial
A imagem oficial do Docker permite persistir os modelos em volume e publicar a API na porta configurada.

Ollama é a peça de infraestrutura para quem quer que um app converse com um modelo local. Ele não substitui apenas um chat: pode ficar atrás de uma ferramenta de código, um agente, uma automação ou uma interface de documentos. A vantagem é controlar o endpoint e os modelos baixados. A contrapartida é objetiva: você passa a administrar disco, atualizações, acesso à API e a capacidade de inferência da máquina.

O erro mais caro é escolher VPS pelo nome do Ollama, como se ele tivesse um requisito fixo. O processo leve pode caber em CPU, mas o modelo permanece em memória durante o uso e o tamanho do contexto aumenta essa demanda. Um modelo com alguns gigabytes no catálogo não transforma automaticamente a mesma VPS em máquina para modelos grandes ou várias conversas paralelas. Comece pelo modelo que seu app realmente chama, acompanhe RAM, VRAM, disco e latência, e só então aumente o plano.

Instalando o Ollama na VPS (resumo)

  1. Escolha a VPS pelo modelo e pelo contexto que pretende usar; trate os planos da tabela como referências de porte, não como mínimo oficial do Ollama.
  2. Use o template Docker da Hostinger ou instale a imagem oficial ollama/ollama em uma VPS Linux com volume persistente para os modelos.
  3. Publique somente a API necessária e não deixe a porta do Ollama aberta à internet sem autenticação, proxy ou controle de rede.
  4. Baixe um único modelo inicial com ollama pull e teste uma conversa ou a integração que vai consumi-lo antes de carregar uma biblioteca inteira.
  5. Monitore RAM, VRAM, disco e latência; faça backup da configuração e revise o tamanho do contexto antes de aumentar a concorrência.

Perguntas frequentes

Ollama precisa de GPU?

Não. A documentação oficial mostra que o modelo pode ser carregado inteiramente na memória do sistema, inteiramente na GPU ou dividido entre as duas. GPU é uma escolha de desempenho e de capacidade de VRAM para a inferência local; ela não é requisito para instalar ou executar Ollama em CPU.

Qual é o requisito mínimo oficial do Ollama?

O projeto não publica um mínimo universal de vCPU, RAM e disco. Isso varia com o modelo carregado, o contexto e a concorrência. A página oficial da Hostinger para o template apresenta KVM 2 com 2 vCPUs, 8 GB de RAM e 100 GB de disco como o menor plano exibido, mas isso é uma referência comercial, não um mínimo declarado pelo Ollama.

Por que aumentar o contexto pode deixar a VPS sem memória?

O contexto é a quantidade de tokens que o modelo mantém disponível durante a conversa. As docs do Ollama informam que um contexto maior aumenta a memória necessária para executar o modelo. Antes de elevar esse valor, verifique a memória disponível e a VRAM, se houver GPU.

Quando não vale usar VPS para Ollama?

Não vale se você não quer administrar modelos, acesso de rede, atualizações e observabilidade, ou se o seu caso precisa de um modelo grande sem orçamento para a RAM ou GPU correspondente. Também pode ser mais simples usar uma API hospedada quando privacidade local e controle do endpoint não são requisitos.

Procurando outro software? Veja todos os apps e onde hospedar cada um.

Relacionados