DeepSeek R1
- Lançamento: 2025-01-20
- Atualizado em: 2025-03-27
O modelo de raciocínio aberto que fez o mercado repensar o preço da inteligência — e que tem versão para quase qualquer hardware, do notebook ao cluster.
O DeepSeek R1 é um modelo de raciocínio: antes de responder, ele “pensa” num rascunho interno, o que o torna forte em matemática, lógica e código — e mais lento e gastador de tokens que um modelo comum. Foi o lançamento que derrubou a ideia de que raciocínio era exclusividade de API paga.
A pegadinha que quase nenhum tutorial explica: as versões pequenas não são o R1 de verdade. Do 1.5b ao 70b, o que você baixa são modelos Qwen e Llama destilados — treinados para imitar o R1. São úteis e rodam em máquina comum, mas o comportamento é de imitação. O R1 completo é o 671b, que não cabe em hardware doméstico de jeito nenhum. Para escolher a versão certa, a tabela abaixo mostra o que cada uma exige de verdade.
Roda no meu PC? Tabela por quantização
Tamanhos de download medidos no registry do Ollama em 14/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).
| Versão (tag do Ollama) | Download | VRAM p/ rodar | Roda em quê |
|---|---|---|---|
ollama run deepseek-r1:1.5b |
1.1 GB | ~4 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run deepseek-r1:7b |
4.7 GB | ~8 GB | GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional |
ollama run deepseek-r1:8b |
5.2 GB | ~8 GB | GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional |
ollama run deepseek-r1:14b |
9.0 GB | ~12 GB | GPU de 16 GB (RTX 4080/4060 Ti 16 GB) |
ollama run deepseek-r1:32b |
19.9 GB | ~24 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
ollama run deepseek-r1:70b |
42.5 GB | ~49 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
ollama run deepseek-r1:671b |
404.4 GB | ~447 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
A licença é MIT — a mais permissiva possível: uso comercial liberado, sem atribuição obrigatória, sem cláusula de uso aceitável. Dos modelos grandes abertos, é a licença mais limpa que existe; você pode embutir num produto e vender sem pedir permissão a ninguém.
Não roda no seu hardware? O aluguel sai mais barato que a placa
Os destilados até 14b rodam em placa de consumo. Do 32b pra cima a conta muda: uma RTX 4090 usada passa de R$ 12 mil e ainda não roda o 70b confortavelmente em quantização alta. Alugar fecha a conta melhor:
- Servla VPS GPU (NVIDIA L4, São Paulo) — R$ 360 a R$ 1.000/mês, 3 a 12 GB de VRAM garantida. Faz sentido para modelo de até ~10 GB rodando 24/7 com latência de Brasil.
- DigitalOcean GPU Droplets (RTX 4000+) — US$ 0,76/GPU/hora + US$ 200 de crédito, 20 GB+ por GPU. Faz sentido para modelo grande por poucas horas — o crédito cobre o teste inteiro.
Como rodar
O caminho mais simples é o Ollama (ollama run deepseek-r1) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.
Perguntas frequentes
Qual versão do DeepSeek R1 roda em um notebook comum?
Com 16 GB de RAM e sem GPU dedicada, o 1.5b e o 7b rodam via CPU no Ollama — funcionam, mas na faixa de poucos tokens por segundo. Com uma GPU de 8 GB, o 7b e o 8b ficam confortáveis. É o suficiente para testar raciocínio em português e tarefas curtas de código.
O deepseek-r1:7b é o mesmo modelo do site do DeepSeek?
Não. As versões de 1.5b a 70b são destilações — modelos Qwen e Llama treinados para imitar o R1. O modelo do site/API é o 671b completo. A qualidade das destilações é boa para o tamanho, mas não espere o mesmo nível de raciocínio do original.
Quanto custa rodar o DeepSeek R1 na nuvem?
Depende da versão. Um destilado de 14b (9 GB de download) roda numa VPS GPU nacional na faixa de R$ 360 a R$ 1.000 por mês, 24/7, com latência de Brasil. O 70b pede GPU de mais VRAM, que costuma sair melhor por hora — na DigitalOcean a RTX 4000 custa US$ 0,76/hora e há US$ 200 de crédito de teste, o que cobre semanas de experimento.
Posso usar o DeepSeek R1 comercialmente?
Pode. A licença MIT libera uso comercial sem atribuição e sem restrição de escala. Isso vale para o modelo em si; o que sai dele é seu. É diferente do Llama, que tem licença própria com condições, e do free tier de várias ferramentas SaaS que exigem crédito.
R1 ou um modelo comum (Qwen, Llama) para o meu caso?
Raciocínio custa tokens e tempo: o R1 pensa antes de responder, então é mais lento e verboso. Para chat, resumo e RAG simples, um modelo comum do mesmo tamanho responde mais rápido e gasta menos. Reserve o R1 para matemática, lógica encadeada, e código onde o caminho até a resposta importa.
Fontes
Conferidas em 14/08/2026:
Rodando DeepSeek R1 localmente
- Tem destilação para notebook; o R1 completo (671b) é só nuvem
- VRAM mínima: 4 GB (versão 1.5b destilada)
- Comando: ollama run deepseek-r1:14b

DeepSeek R1
- 13571
- 92009
- 141758
- 8044961
- Desenvolvedor: DeepSeek
- Parâmetros: 685 bilhões (671B MoE)
- Janela de contexto: 128k tokens
- Arquitetura: DeepseekV3ForCausalLM
- Tensores: BF16, F8_E4M3, F32
- inglês e chinês no treino; forte em PT na prática
- Licença: MIT
- Uso comercial: sim
- Categoria: texto
- Tarefa: geração de texto











