Jogos e desempenho

IA local em placa de 8GB: o Gemma 4 do Google mudou o jogo

Google lancou o Gemma 4: IA de alto nivel rodando numa placa de 8GB de VRAM. Veja o que muda, o que voce precisa e como testar hoje.

Voltar ao blogIA local em placa de 8GB: o Gemma 4 do Google mudou o jogo

Faz pouco tempo que mostramos aqui que uma RTX 3060 de 12 GB já era suficiente pra rodar inteligência artificial local de verdade: modelo bom, resposta rápida, tudo dentro da sua própria máquina. Essa barreira acabou de cair de novo. Com o Gemma 4, o modelo aberto que o Google anunciou em 5 de junho, dá pra rodar IA de alto nível em uma placa de vídeo com 8 GB de VRAM. Ou seja: RTX 3060, 3070, 4060 — exatamente as placas mais comuns nos PCs gamer brasileiros.

E o detalhe que chama atenção é que dessa vez o salto não veio de um laboratório chinês. Veio do Google, e veio com números na mesa.

Por que a VRAM sempre foi o gargalo da IA local

Rodar IA localmente não é novidade. Desde 2023 já dá pra baixar modelos e executá-los no seu computador, sem depender de nuvem, sem mensalidade e sem mandar um byte dos seus dados pra ninguém. O problema é que, por muito tempo, os modelos que cabiam numa máquina doméstica eram ruins o bastante pra ninguém querer usar de verdade.

A explicação é direta. Um modelo de IA é, no fundo, uma lista gigantesca de números — os parâmetros, que são os pesos aprendidos durante o treinamento. Pra o modelo responder rápido, esses números precisam caber na VRAM, a memória ultrarrápida soldada na placa de vídeo. Quanto maior o modelo, mais parâmetros; quanto mais parâmetros, mais VRAM. Quando não cabe, o modelo transborda pra memória RAM do sistema, que é bem mais lenta, e a resposta vira aquela tortura de uma palavra por segundo.

Foi por isso que, durante anos, "IA local decente" significou "placa de 12, 16 ou 24 GB". Hardware que a maioria das pessoas simplesmente não tem em casa — e que, no Brasil, custa caro demais pra ser comprado só pra brincar de IA.

O truque do Gemma 4 se chama QAT

A sigla é Quantization Aware Training, ou treinamento ciente de quantização. Pra entender o que ela resolve, primeiro vale entender como se encolhia um modelo até agora.

O caminho tradicional é a quantização pura e simples: você pega o modelo já treinado, com todos os pesos em alta precisão, e comprime esses números pra que ocupem menos espaço. Funciona — o modelo passa a caber em placas menores —, só que tem preço. Nesse aperto, o modelo perde qualidade. Ele fica, na prática, um pouco mais burro: erra mais, alucina mais, se perde em raciocínios longos.

O que o Google fez com o Gemma 4 foi inverter a ordem. Em vez de comprimir depois de pronto, o modelo é treinado já fingindo que está comprimido o tempo todo. Ele aprende a ser inteligente dentro daquele espaço apertado, em vez de aprender solto e depois ser espremido à força. O resultado, segundo o próprio Google, é um corte de 72% da memória ocupada praticamente sem perda de inteligência.

Os números que o Google colocou na mesa

Promessa de fabricante a gente sempre lê com desconfiança, então vale olhar o que foi divulgado:

  • O Gemma 4 aparece como o sexto melhor modelo aberto do mundo num ranking que mede inteligência pura.
  • Acerta 88% numa prova de matemática de nível olimpíada.
  • Entrega 97% da qualidade do irmão grande da família gastando 8 vezes menos processamento.

Esse último número é o que mais interessa pra quem monta PC. Não se trata de um modelo pequeno e limitado que "dá pro gasto": é uma versão que chega perto do topo consumindo uma fração dos recursos. É a diferença entre rodar IA local por curiosidade e rodar IA local como ferramenta de trabalho.

O que você precisa ter na máquina

Na prática, o modelo de 26 bilhões de parâmetros passa a rodar numa placa de 8 GB de VRAM. Isso coloca dentro do jogo boa parte do parque instalado: RTX 3060 de 8 GB, RTX 3070, RTX 4060.

Tem um detalhe importante, porém, que muita gente ignora e depois reclama que ficou lento: você também vai precisar de uns 16 GB de RAM no sistema. Parte do modelo fica na memória principal, não só na VRAM. Se sua máquina tem 8 GB de RAM, esse é o primeiro upgrade a fazer — e, felizmente, é o mais barato dos dois.

Somando as duas coisas, o resumo é bem simples: qualquer PC gamer intermediário atual já roda essa IA. Se você não tem certeza do que está montado na sua máquina ou quer planejar uma configuração pensando nesse tipo de uso, dá uma olhada nas nossas builds recomendadas ou fale com a gente sobre upgrades — trocar um pente de memória costuma resolver mais do que trocar de placa de vídeo.

Como testar hoje mesmo

Não precisa de terminal, nem de Python, nem de compilar nada. O caminho mais curto é o LM Studio:

  1. Baixe e instale o LM Studio no seu PC.
  2. Procure o Gemma 4 na lista de modelos sugeridos — ele costuma aparecer logo nas primeiras opções.
  3. Faça o download da versão quantizada e mande a primeira mensagem.

A partir daí é sua IA particular, rodando na sua placa de vídeo. Nada sai da sua máquina, nenhum dado vai pra servidor de ninguém e, depois que o modelo está baixado, você nem precisa de internet pra conversar com ele.

Por que isso importa pra quem monta PC

Tem uma leitura maior aqui. Nos últimos dois anos, o discurso era que IA de verdade só existia na nuvem, e que placa de vídeo boa servia pra jogar. O que o QAT mostra é que dá pra ganhar muito com software: o mesmo hardware que você já tem em casa passa a fazer algo que, meses atrás, exigiria uma placa profissional.

Pra quem está montando ou pensando em atualizar a máquina, a conclusão prática é que VRAM e quantidade de RAM voltaram a ser critérios de escolha tão relevantes quanto FPS em jogo. E a boa notícia é que a régua está baixando, não subindo.

Se você quer montar uma máquina que dê conta de jogo e de IA local sem exagero no orçamento, a gente monta, testa e entrega configurada. Passe na nossa loja ou fale com a gente que ajudamos a dimensionar o que faz sentido pro seu uso — sem empurrar peça cara à toa.

Fontes

Temas deste artigo

Com esse problema no seu PC?

Tela azul, travando, lento ou não liga? A gente diagnostica de graça em Moema, conserta com garantia de 1 ano e você acompanha online — sem compromisso.

Blog

Mais sobre Jogos e desempenho

Ver o tema
IA local em placa de 8GB: o Gemma 4 do Google mudou o jogo | PC Builder