Gemma 3
- Lançamento: 2025-03-01
- Atualizado em: 2025-03-21
A família aberta do Google que enxerga: os tamanhos de 4B pra cima aceitam imagem na entrada — e o 4B é possivelmente o melhor modelo com visão que roda em notebook hoje.
O Gemma 3 é a família aberta do Google derivada da tecnologia do Gemini — e o diferencial que o separa de Qwen e Llama é que ele é multimodal de fábrica: do 4B para cima, o modelo aceita imagem junto com o texto. Descrever foto, ler print de tela, extrair dado de documento escaneado — casos que antes pediam um modelo especializado — rodam no mesmo modelo que conversa.
A escada tem quatro degraus: 1B (só texto, roda em qualquer máquina), 4B, 12B e 27B. O 4B é o ponto fora da curva: visão + 128k de contexto cabendo numa GPU de 8 GB ou até em CPU com paciência — é provavelmente a maior capacidade por giga de VRAM disponível hoje. O 27B compete com modelos bem maiores e ainda cabe numa GPU de 24 GB.
Roda no meu PC? Tabela por quantização
Tamanhos de download medidos no registry do Ollama em 15/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).
| Versão (tag do Ollama) | Download | VRAM p/ rodar | Roda em quê |
|---|---|---|---|
ollama run gemma3:1b |
0.8 GB | ~3 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run gemma3:4b |
3.3 GB | ~6 GB | notebook com GPU de 8 GB (ou CPU com 16 GB de RAM, mais lento) |
ollama run gemma3:12b |
8.1 GB | ~11 GB | GPU de 16 GB (RTX 4080/4060 Ti 16 GB) |
ollama run gemma3:27b |
17.4 GB | ~22 GB | GPU de 24 GB (RTX 3090/4090) ou GPU na nuvem |
A licença é a Gemma Terms of Use do Google: uso comercial liberado, incluindo embutir em produto e vender, com uma política de uso proibido anexa (conteúdo ilegal, dano etc.) e a obrigação de repassar essas restrições a quem receber derivados. Menos limpa que Apache, mais permissiva que “não-comercial” — para produto brasileiro típico, funciona.
Não roda no seu hardware? O aluguel sai mais barato que a placa
Até o 12B, placa de consumo resolve. O 27B pede 24 GB — RTX 3090/4090, acima de R$ 10 mil. Para servir visão 24/7 ou testar o 27B sem comprar placa:
- Servla VPS GPU (NVIDIA L4, São Paulo) — R$ 360 a R$ 1.000/mês, 3 a 12 GB de VRAM garantida. Faz sentido para modelo de até ~10 GB rodando 24/7 com latência de Brasil.
- DigitalOcean GPU Droplets (RTX 4000+) — US$ 0,76/GPU/hora + US$ 200 de crédito, 20 GB+ por GPU. Faz sentido para modelo grande por poucas horas — o crédito cobre o teste inteiro.
Como rodar
O caminho mais simples é o Ollama (ollama run gemma3) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.
Perguntas frequentes
O Gemma 3 realmente entende imagem?
Do 4B para cima, sim — nativamente. Você manda uma foto, um print ou um documento escaneado junto com a pergunta e ele responde sobre o conteúdo. O 1B é a exceção: só texto. Para OCR de documento e descrição de imagem em português, o 12B já entrega resultado de produção.
Qual Gemma 3 roda em um notebook?
O 1B roda em praticamente qualquer máquina via CPU. O 4B — que já tem visão — fica confortável numa GPU de 8 GB, e roda em CPU com 16 GB de RAM aceitando latência maior. É o melhor custo-benefício da família para uso pessoal.
Posso usar o Gemma 3 comercialmente?
Pode, incluindo embutir em produto pago. A Gemma Terms of Use do Google exige seguir a política de uso proibido e repassar essas condições em derivados — diferente de Apache, mas sem limite de faturamento nem exigência de atribuição em produto. Para o caso de uso típico, é sim.
Gemma 3 ou Qwen 3 para português?
Os dois são fortes em PT-BR. A escolha prática: precisa de visão (imagem na entrada)? Gemma 3, porque o Qwen 3 base é só texto. É só texto e você quer o modo de raciocínio ligável? Qwen 3. Em tamanho equivalente, a qualidade de texto puro é próxima o bastante para o desempate ser esse.
Quanto custa rodar o Gemma 3 na nuvem?
O 12B (com visão) roda numa VPS GPU nacional na faixa de R$ 360 a R$ 1.000/mês, 24/7 com latência de Brasil — cenário típico de um serviço que processa documento ou imagem o dia todo. O 27B em uso pontual sai melhor por hora: RTX 4000 na DigitalOcean a US$ 0,76/hora, com US$ 200 de crédito para o experimento.
Fontes
Conferidas em 15/08/2026:
Rodando Gemma 3 localmente
- O multimodal que cabe no seu hardware — do notebook (4B com visão) à GPU de 24 GB (27B)
- VRAM mínima: 1B roda em CPU; visão a partir do 4B com GPU de 8 GB
- Comando: ollama run gemma3:4b

Gemma 3
- 2006
- 5657
- 64396
- 767801
- Desenvolvedor: Google
- Parâmetros: 1 a 27 bilhões (família)
- Janela de contexto: 128k tokens (32k no 1B)
- Arquitetura: Gemma3ForConditionalGeneration
- Tensores: BF16
- treino em 140+ idiomas; PT-BR forte
- Licença: Gemma
- Uso comercial: condicional
- Categoria: visão
- Tarefa: visão (imagem + texto)











