Ilustração do DeepSeek R1 rodando em um servidor com GPU, com medidor de VRAM

DeepSeek R1

O modelo de raciocínio aberto que fez o mercado repensar o preço da inteligência — e que tem versão para quase qualquer hardware, do notebook ao cluster.

O DeepSeek R1 é um modelo de raciocínio: antes de responder, ele “pensa” num rascunho interno, o que o torna forte em matemática, lógica e código — e mais lento e gastador de tokens que um modelo comum. Foi o lançamento que derrubou a ideia de que raciocínio era exclusividade de API paga.

A pegadinha que quase nenhum tutorial explica: as versões pequenas não são o R1 de verdade. Do 1.5b ao 70b, o que você baixa são modelos Qwen e Llama destilados — treinados para imitar o R1. São úteis e rodam em máquina comum, mas o comportamento é de imitação. O R1 completo é o 671b, que não cabe em hardware doméstico de jeito nenhum. Para escolher a versão certa, a tabela abaixo mostra o que cada uma exige de verdade.

Roda no meu PC? Tabela por quantização

Tamanhos de download medidos no registry do Ollama em 14/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).

Versão (tag do Ollama) Download VRAM p/ rodar Roda em quê
ollama run deepseek-r1:1.5b 1.1 GB ~4 GB notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento)
ollama run deepseek-r1:7b 4.7 GB ~8 GB GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional
ollama run deepseek-r1:8b 5.2 GB ~8 GB GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional
ollama run deepseek-r1:14b 9.0 GB ~12 GB GPU de 16 GB (RTX 4080/4060 Ti 16 GB)
ollama run deepseek-r1:32b 19.9 GB ~24 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop
ollama run deepseek-r1:70b 42.5 GB ~49 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop
ollama run deepseek-r1:671b 404.4 GB ~447 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop

A licença é MIT — a mais permissiva possível: uso comercial liberado, sem atribuição obrigatória, sem cláusula de uso aceitável. Dos modelos grandes abertos, é a licença mais limpa que existe; você pode embutir num produto e vender sem pedir permissão a ninguém.

Não roda no seu hardware? O aluguel sai mais barato que a placa

Os destilados até 14b rodam em placa de consumo. Do 32b pra cima a conta muda: uma RTX 4090 usada passa de R$ 12 mil e ainda não roda o 70b confortavelmente em quantização alta. Alugar fecha a conta melhor:

Como rodar

O caminho mais simples é o Ollama (ollama run deepseek-r1) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.

Perguntas frequentes

Qual versão do DeepSeek R1 roda em um notebook comum?

Com 16 GB de RAM e sem GPU dedicada, o 1.5b e o 7b rodam via CPU no Ollama — funcionam, mas na faixa de poucos tokens por segundo. Com uma GPU de 8 GB, o 7b e o 8b ficam confortáveis. É o suficiente para testar raciocínio em português e tarefas curtas de código.

O deepseek-r1:7b é o mesmo modelo do site do DeepSeek?

Não. As versões de 1.5b a 70b são destilações — modelos Qwen e Llama treinados para imitar o R1. O modelo do site/API é o 671b completo. A qualidade das destilações é boa para o tamanho, mas não espere o mesmo nível de raciocínio do original.

Quanto custa rodar o DeepSeek R1 na nuvem?

Depende da versão. Um destilado de 14b (9 GB de download) roda numa VPS GPU nacional na faixa de R$ 360 a R$ 1.000 por mês, 24/7, com latência de Brasil. O 70b pede GPU de mais VRAM, que costuma sair melhor por hora — na DigitalOcean a RTX 4000 custa US$ 0,76/hora e há US$ 200 de crédito de teste, o que cobre semanas de experimento.

Posso usar o DeepSeek R1 comercialmente?

Pode. A licença MIT libera uso comercial sem atribuição e sem restrição de escala. Isso vale para o modelo em si; o que sai dele é seu. É diferente do Llama, que tem licença própria com condições, e do free tier de várias ferramentas SaaS que exigem crédito.

R1 ou um modelo comum (Qwen, Llama) para o meu caso?

Raciocínio custa tokens e tempo: o R1 pensa antes de responder, então é mais lento e verboso. Para chat, resumo e RAG simples, um modelo comum do mesmo tamanho responde mais rápido e gasta menos. Reserve o R1 para matemática, lógica encadeada, e código onde o caminho até a resposta importa.

Fontes

Conferidas em 14/08/2026:

Rodando DeepSeek R1 localmente

Logo oficial deepseek

DeepSeek R1