Llama 3.3
- Lançamento: 2024-11-26
- Atualizado em: 2024-12-21
O modelo aberto da Meta que entrega desempenho de classe 405B num pacote de 70B — mas 70B continua sendo um tamanho que muda a conversa sobre hardware.
O Llama 3.3 é diferente das outras famílias desta lista num ponto que muda tudo: só existe em 70 bilhões de parâmetros. Não há versão de 8B ou 3B — para essas, a Meta aponta para o Llama 3.1 e 3.2. A promessa do 3.3 é entregar a qualidade do gigantesco 405B num modelo quatro vezes menor, e os benchmarks da própria Meta sustentam a proximidade em instrução, código e multilíngue.
Na prática, isso o coloca numa categoria própria: é o modelo aberto “de produção” mais usado como referência — mas não é um modelo de notebook. Quantizado em 4 bits são ~43 GB só de download, o que significa GPU de 48 GB ou duas de 24 GB. É o caso de uso onde alugar GPU por hora deixa de ser alternativa e vira o caminho padrão.
Roda no meu PC? Tabela por quantização
Tamanhos de download medidos no registry do Ollama em 15/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).
| Versão (tag do Ollama) | Download | VRAM p/ rodar | Roda em quê |
|---|---|---|---|
ollama run llama3.3:70b |
42.5 GB | ~49 GB | múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop |
A licença é a Llama 3.3 Community License da Meta: uso comercial liberado para praticamente todo mundo, com duas condições que valem conhecer — quem tinha mais de 700 milhões de usuários mensais na data do lançamento precisa de licença especial (isso mira Google e OpenAI, não você), e produtos derivados devem exibir “Built with Llama”. Não é Apache, mas na prática não trava projeto brasileiro nenhum.
Não roda no seu hardware? O aluguel sai mais barato que a placa
Uma única RTX 4090 (24 GB) não segura o 70B nem em Q4. O hardware mínimo realista custa mais de R$ 25 mil — e é exatamente o cenário em que alugar vence comprar:
- Servla VPS GPU (NVIDIA L4, São Paulo) — R$ 360 a R$ 1.000/mês, 3 a 12 GB de VRAM garantida. Faz sentido para modelo de até ~10 GB rodando 24/7 com latência de Brasil.
- DigitalOcean GPU Droplets (RTX 4000+) — US$ 0,76/GPU/hora + US$ 200 de crédito, 20 GB+ por GPU. Faz sentido para modelo grande por poucas horas — o crédito cobre o teste inteiro.
Como rodar
O caminho mais simples é o Ollama (ollama run llama3.3) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.
Perguntas frequentes
O Llama 3.3 roda em uma RTX 4090?
Sozinha, não. O download em Q4 tem ~43 GB e o consumo passa de 48 GB com contexto — precisa de uma GPU de 48 GB (A6000, L40S) ou duas de 24 GB com offload. Com uma 4090 só, o jeito é quantização agressiva com perda visível ou offload para RAM, que derruba a velocidade a níveis de teste, não de uso.
Por que não existe Llama 3.3 de 8B?
Decisão da Meta: o 3.3 é um refinamento só do 70B, focado em entregar qualidade de 405B em tamanho menor. Para portes menores, as opções da casa são o Llama 3.1 8B e os 3.2 de 1B e 3B — ou famílias concorrentes como Qwen 3 e Gemma 3, que cobrem a escada inteira.
Posso usar o Llama 3.3 comercialmente?
Pode, salvo dois detalhes da licença da Meta: o limite dos 700 milhões de usuários mensais (que só atinge big techs) e a exigência de exibir “Built with Llama” em produtos derivados. Para SaaS, agência e produto brasileiro típico, é sim na prática.
Quanto custa rodar o Llama 3.3 na nuvem?
Como ele pede mais VRAM que as GPUs da faixa nacional de entrada, o caminho é GPU por hora: na DigitalOcean, RTX 4000 Ada a partir de US$ 0,76/hora — e os US$ 200 de crédito de teste cobrem dezenas de horas de experimento com o 70B em configuração multi-GPU ou uma L40S.
Llama 3.3 ou Qwen 3 32B para o meu caso?
Se o seu hardware para em 24 GB de VRAM, a pergunta se responde sozinha: o Qwen 3 32B cabe, o Llama 3.3 não. Tendo VRAM de sobra, o Llama 3.3 tende a ganhar em seguir instrução longa e em consistência multilíngue; o ecossistema de ferramentas em torno do Llama também é o mais maduro.
Fontes
Conferidas em 15/08/2026:
Rodando Llama 3.3 localmente
- Não é modelo de desktop: é o caso clássico de GPU na nuvem por hora
- VRAM mínima: ~49 GB em Q4 — GPU de 48 GB ou 2× 24 GB
- Comando: ollama run llama3.3:70b

Llama 3.3
- 2952
- 7678
- 84483
- 320776
- Desenvolvedor: Meta
- Parâmetros: 70 bilhões
- Janela de contexto: 128k tokens
- Arquitetura: LlamaForCausalLM
- Tensores: BF16
- 8 idiomas oficiais, incluindo português
- Licença: Llama
- Uso comercial: condicional
- Categoria: texto
- Tarefa: geração de texto











