Qwen 3
- Lançamento: 2025-04-27
- Atualizado em: 2025-07-26
A família aberta mais baixada do HuggingFace — com um tamanho para cada hardware e o melhor multilíngue da categoria, o que inclui português de verdade.
O Qwen 3, da Alibaba, é hoje a família de modelos abertos mais baixada do HuggingFace — e a escada de tamanhos é o motivo: são oito versões do 0.6b ao 235b, todas com o mesmo comportamento híbrido de “pensar” (modo de raciocínio que você liga e desliga por prompt). Na prática, é uma família onde você escolhe o degrau que o seu hardware alcança, sem trocar de ecossistema.
Para quem trabalha em português, o Qwen 3 tem uma vantagem medível: o treino multilíngue cobre 119 idiomas e o desempenho em PT-BR está entre os melhores da categoria aberta — em geral acima de destilações de tamanho equivalente. O 8b é o ponto de equilíbrio: cabe numa GPU de 12 GB, responde rápido, e segura conversa, RAG e código do dia a dia. O 30b (mixture-of-experts, ativa só 3b por token) entrega qualidade de modelo grande gastando como um médio — é o segredo mais bem guardado da família.
Roda no meu PC? Tabela por quantização
Tamanhos de download medidos no registry do Ollama em 14/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).
| Versão (tag do Ollama) | Download | VRAM p/ rodar | Roda em quê |
|---|---|---|---|
ollama run qwen3:0.6b |
0.5 GB | ~3 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run qwen3:1.7b |
1.4 GB | ~4 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run qwen3:4b |
2.5 GB | ~5 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run qwen3:8b |
5.2 GB | ~8 GB | GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional |
ollama run qwen3:14b |
9.3 GB | ~13 GB | GPU de 16 GB (RTX 4080/4060 Ti 16 GB) |
ollama run qwen3:30b |
18.6 GB | ~23 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
ollama run qwen3:32b |
20.2 GB | ~25 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
ollama run qwen3:235b |
142.2 GB | ~159 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
A licença é Apache 2.0 em toda a família: uso comercial liberado, sem atribuição obrigatória e com concessão explícita de patente — mais protetora para empresa que a MIT. Pode embutir em produto e vender.
Não roda no seu hardware? O aluguel sai mais barato que a placa
Até o 14b, placa de consumo resolve. O 30b e o 32b pedem 24 GB de VRAM — território de RTX 3090/4090, acima de R$ 10 mil no Brasil. O 235b é só cluster ou nuvem. Alugar costuma fechar a conta melhor:
- Servla VPS GPU (NVIDIA L4, São Paulo) — R$ 360 a R$ 1.000/mês, 3 a 12 GB de VRAM garantida. Faz sentido para modelo de até ~10 GB rodando 24/7 com latência de Brasil.
- DigitalOcean GPU Droplets (RTX 4000+) — US$ 0,76/GPU/hora + US$ 200 de crédito, 20 GB+ por GPU. Faz sentido para modelo grande por poucas horas — o crédito cobre o teste inteiro.
Como rodar
O caminho mais simples é o Ollama (ollama run qwen3) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.
Perguntas frequentes
Qual Qwen 3 roda em um notebook sem GPU?
O 0.6b e o 1.7b rodam via CPU com 8 GB de RAM — são pequenos o bastante para latência aceitável. O 4b já pede paciência sem GPU. São versões boas para automação leve, classificação e rascunho; para conversa fluida em português, o degrau confortável começa no 8b com GPU.
Qwen 3 fala português bem?
Sim, e é um dos motivos para escolhê-lo: o treino cobre 119 idiomas e o desempenho em português está entre os melhores dos modelos abertos. Para RAG e atendimento em PT-BR, o 8b costuma superar destilações maiores de outras famílias.
O que é o modo de raciocínio (thinking) do Qwen 3?
Toda a família alterna entre resposta direta e um modo em que o modelo raciocina antes de responder, no estilo do DeepSeek R1 — você controla por prompt. Ligue para matemática, lógica e código difícil; desligue para chat e tarefas simples, porque o raciocínio gasta mais tokens e tempo.
Vale a pena o 30b em vez do 32b?
Na maioria dos casos, sim. O 30b é mixture-of-experts: tem 30 bilhões de parâmetros mas ativa cerca de 3 bilhões por token, então gera muito mais rápido que o 32b denso com qualidade próxima. O 32b denso ainda ganha em consistência para código longo. Os dois pedem GPU de 24 GB.
Quanto custa rodar o Qwen 3 na nuvem?
O 8b (5+ GB de download) roda numa VPS GPU nacional de R$ 360 a R$ 1.000/mês, 24/7 com latência de Brasil — o cenário típico de um agente ou chatbot em produção. Para o 30b/32b em uso pontual, GPU por hora sai melhor: na DigitalOcean a RTX 4000 custa US$ 0,76/hora, e os US$ 200 de crédito cobrem o experimento.
Fontes
Conferidas em 14/08/2026:
Rodando Qwen 3 localmente
- Família com um degrau para cada hardware — do notebook ao cluster
- VRAM mínima: roda até em CPU (0.6b); ~10 GB para o 8b
- Comando: ollama run qwen3:8b

Qwen 3
- 1295
- 27508
- 96682
- 16307008
- Desenvolvedor: Alibaba (Qwen)
- Parâmetros: 0,6 a 235 bilhões (família)
- Janela de contexto: 32k nativo; 128k com YaRN
- Arquitetura: Qwen3ForCausalLM
- Tensores: BF16
- 119 idiomas; um dos melhores em PT-BR da categoria aberta
- Licença: Apache-2.0
- Uso comercial: sim
- Categoria: texto
- Tarefa: geração de texto











