Ilustração do Llama 3.3 70B exigindo múltiplas GPUs em um servidor de nuvem

Llama 3.3

O modelo aberto da Meta que entrega desempenho de classe 405B num pacote de 70B — mas 70B continua sendo um tamanho que muda a conversa sobre hardware.

O Llama 3.3 é diferente das outras famílias desta lista num ponto que muda tudo: só existe em 70 bilhões de parâmetros. Não há versão de 8B ou 3B — para essas, a Meta aponta para o Llama 3.1 e 3.2. A promessa do 3.3 é entregar a qualidade do gigantesco 405B num modelo quatro vezes menor, e os benchmarks da própria Meta sustentam a proximidade em instrução, código e multilíngue.

Na prática, isso o coloca numa categoria própria: é o modelo aberto “de produção” mais usado como referência — mas não é um modelo de notebook. Quantizado em 4 bits são ~43 GB só de download, o que significa GPU de 48 GB ou duas de 24 GB. É o caso de uso onde alugar GPU por hora deixa de ser alternativa e vira o caminho padrão.

Roda no meu PC? Tabela por quantização

Tamanhos de download medidos no registry do Ollama em 15/08/2026. VRAM calculada como download × 1,1 + 2 GB de contexto (KV-cache de 4-8k tokens).

Versão (tag do Ollama) Download VRAM p/ rodar Roda em quê
ollama run llama3.3:70b 42.5 GB ~49 GB múltiplas GPUs ou GPU na nuvem por hora — inviável em desktop

A licença é a Llama 3.3 Community License da Meta: uso comercial liberado para praticamente todo mundo, com duas condições que valem conhecer — quem tinha mais de 700 milhões de usuários mensais na data do lançamento precisa de licença especial (isso mira Google e OpenAI, não você), e produtos derivados devem exibir “Built with Llama”. Não é Apache, mas na prática não trava projeto brasileiro nenhum.

Não roda no seu hardware? O aluguel sai mais barato que a placa

Uma única RTX 4090 (24 GB) não segura o 70B nem em Q4. O hardware mínimo realista custa mais de R$ 25 mil — e é exatamente o cenário em que alugar vence comprar:

Como rodar

O caminho mais simples é o Ollama (ollama run llama3.3) com a interface do Open WebUI por cima. Os dois rodam em Docker numa VPS — a página de cada um mostra os requisitos e onde hospedar.

Perguntas frequentes

O Llama 3.3 roda em uma RTX 4090?

Sozinha, não. O download em Q4 tem ~43 GB e o consumo passa de 48 GB com contexto — precisa de uma GPU de 48 GB (A6000, L40S) ou duas de 24 GB com offload. Com uma 4090 só, o jeito é quantização agressiva com perda visível ou offload para RAM, que derruba a velocidade a níveis de teste, não de uso.

Por que não existe Llama 3.3 de 8B?

Decisão da Meta: o 3.3 é um refinamento só do 70B, focado em entregar qualidade de 405B em tamanho menor. Para portes menores, as opções da casa são o Llama 3.1 8B e os 3.2 de 1B e 3B — ou famílias concorrentes como Qwen 3 e Gemma 3, que cobrem a escada inteira.

Posso usar o Llama 3.3 comercialmente?

Pode, salvo dois detalhes da licença da Meta: o limite dos 700 milhões de usuários mensais (que só atinge big techs) e a exigência de exibir “Built with Llama” em produtos derivados. Para SaaS, agência e produto brasileiro típico, é sim na prática.

Quanto custa rodar o Llama 3.3 na nuvem?

Como ele pede mais VRAM que as GPUs da faixa nacional de entrada, o caminho é GPU por hora: na DigitalOcean, RTX 4000 Ada a partir de US$ 0,76/hora — e os US$ 200 de crédito de teste cobrem dezenas de horas de experimento com o 70B em configuração multi-GPU ou uma L40S.

Llama 3.3 ou Qwen 3 32B para o meu caso?

Se o seu hardware para em 24 GB de VRAM, a pergunta se responde sozinha: o Qwen 3 32B cabe, o Llama 3.3 não. Tendo VRAM de sobra, o Llama 3.3 tende a ganhar em seguir instrução longa e em consistência multilíngue; o ecossistema de ferramentas em torno do Llama também é o mais maduro.

Fontes

Conferidas em 15/08/2026:

Rodando Llama 3.3 localmente

Logo llama

Llama 3.3