Ilustração da família Qwen 3, do notebook ao servidor em nuvem

Qwen 3

A família aberta mais baixada do HuggingFace — com um tamanho para cada hardware e o melhor multilíngue da categoria, o que inclui português de verdade.

O Qwen 3, da Alibaba, é hoje a família de modelos abertos mais baixada do HuggingFace — e a escada de tamanhos é o motivo: são oito versões do 0.6b ao 235b, todas com o mesmo comportamento híbrido de “pensar” (modo de raciocínio que você liga e desliga por prompt). Na prática, é uma família onde você escolhe o degrau que o seu hardware alcança, sem trocar de ecossistema.

Para quem trabalha em português, o Qwen 3 tem uma vantagem medível: o treino multilíngue cobre 119 idiomas e o desempenho em PT-BR está entre os melhores da categoria aberta — em geral acima de destilações de tamanho equivalente. O 8b é o ponto de equilíbrio: cabe numa GPU de 12 GB, responde rápido, e segura conversa, RAG e código do dia a dia. O 30b (mixture-of-experts, ativa só 3b por token) entrega qualidade de modelo grande gastando como um médio — é o segredo mais bem guardado da família.

Roda no meu PC? Tabela por quantização

Tamanhos de download medidos no registry do Ollama em 14/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).

Versão (tag do Ollama) Download VRAM p/ rodar Roda em quê
ollama run qwen3:0.6b 0.5 GB ~3 GB notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento)
ollama run qwen3:1.7b 1.4 GB ~4 GB notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento)
ollama run qwen3:4b 2.5 GB ~5 GB notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento)
ollama run qwen3:8b 5.2 GB ~8 GB GPU de 12 GB (RTX 3060/4070) ou VPS GPU nacional
ollama run qwen3:14b 9.3 GB ~13 GB GPU de 16 GB (RTX 4080/4060 Ti 16 GB)
ollama run qwen3:30b 18.6 GB ~23 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop
ollama run qwen3:32b 20.2 GB ~25 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop
ollama run qwen3:235b 142.2 GB ~159 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop

A licença é Apache 2.0 em toda a família: uso comercial liberado, sem atribuição obrigatória e com concessão explícita de patente — mais protetora para empresa que a MIT. Pode embutir em produto e vender.

Não roda no seu hardware? O aluguel sai mais barato que a placa

Até o 14b, placa de consumo resolve. O 30b e o 32b pedem 24 GB de VRAM — território de RTX 3090/4090, acima de R$ 10 mil no Brasil. O 235b é só cluster ou nuvem. Alugar costuma fechar a conta melhor:

Como rodar

O caminho mais simples é o Ollama (ollama run qwen3) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.

Perguntas frequentes

Qual Qwen 3 roda em um notebook sem GPU?

O 0.6b e o 1.7b rodam via CPU com 8 GB de RAM — são pequenos o bastante para latência aceitável. O 4b já pede paciência sem GPU. São versões boas para automação leve, classificação e rascunho; para conversa fluida em português, o degrau confortável começa no 8b com GPU.

Qwen 3 fala português bem?

Sim, e é um dos motivos para escolhê-lo: o treino cobre 119 idiomas e o desempenho em português está entre os melhores dos modelos abertos. Para RAG e atendimento em PT-BR, o 8b costuma superar destilações maiores de outras famílias.

O que é o modo de raciocínio (thinking) do Qwen 3?

Toda a família alterna entre resposta direta e um modo em que o modelo raciocina antes de responder, no estilo do DeepSeek R1 — você controla por prompt. Ligue para matemática, lógica e código difícil; desligue para chat e tarefas simples, porque o raciocínio gasta mais tokens e tempo.

Vale a pena o 30b em vez do 32b?

Na maioria dos casos, sim. O 30b é mixture-of-experts: tem 30 bilhões de parâmetros mas ativa cerca de 3 bilhões por token, então gera muito mais rápido que o 32b denso com qualidade próxima. O 32b denso ainda ganha em consistência para código longo. Os dois pedem GPU de 24 GB.

Quanto custa rodar o Qwen 3 na nuvem?

O 8b (5+ GB de download) roda numa VPS GPU nacional de R$ 360 a R$ 1.000/mês, 24/7 com latência de Brasil — o cenário típico de um agente ou chatbot em produção. Para o 30b/32b em uso pontual, GPU por hora sai melhor: na DigitalOcean a RTX 4000 custa US$ 0,76/hora, e os US$ 200 de crédito cobrem o experimento.

Fontes

Conferidas em 14/08/2026:

Rodando Qwen 3 localmente

Logo oficial qwen

Qwen 3