---
title: "Google AI lança DiffusionGemma modelo aberto de 26 bilhões de parâmetros"
author: "Gabriela P. Torres"
date: "2026-06-11 08:00:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/06/11/google-ai-lanca-diffusiongemma-modelo-aberto-de-26-bilhoes-de-parametros/md"
---

## Resumo
- Google AI e DeepMind lançaram o DiffusionGemma, modelo aberto de 26 bilhões de parâmetros.
- O modelo usa difusão textual em vez de geração autoregressiva tradicional.
- A promessa é geração de texto até quatro vezes mais rápida.
- Como modelo aberto, qualquer pessoa pode baixar, estudar e modificar os pesos.
- Arquitetura Mixture-of-Experts pode permitir execução mais eficiente em hardware comum.
- Usuários devem testar a velocidade real em seus próprios benchmarks antes de adotar.

---

O Google AI, incluindo pesquisadores do DeepMind, lançou o DiffusionGemma, um modelo experimental aberto de 26 bilhões de parâmetros para geração de texto que usa difusão textual e promete geração até quatro vezes mais rápida.

## O que muda na prática com difusão textual

Modelos de linguagem tradicionais geram texto token por token, prevendo a próxima palavra com base nas anteriores. Se o DiffusionGemma realmente aplica difusão textual, ele trata o texto como um processo de ruído reverso, refinando todo o conteúdo de uma vez em etapas sucessivas. Isso, se comprovado, pode explicar a alegação de velocidade até quatro vezes superior, pois evita a dependência sequencial que limita a maioria dos modelos autoregressivos.

## Por que o tamanho de 26 bilhões de parâmetros importa

Um modelo de 26 bilhões de parâmetros costuma equilibrar capacidade e custo computacional. Se for uma arquitetura Mixture-of-Experts, como sugere o anúncio, apenas parte dos parâmetros é ativada por token, reduzindo o consumo de memória durante a inferência. Caso essa estrutura seja confirmada nos pesos abertos, desenvolvedores poderão executar versões otimizadas em hardware mais acessível, embora precisem aceitar um declínio de cerca de 10% na qualidade de escrita geral em relação à versão autoregressiva padrão.

## Como acessar e testar o DiffusionGemma hoje

Por ser um modelo aberto, os pesos e o código devem estar disponíveis em repositórios públicos. Se você já trabalha com Hugging Face ou bibliotecas semelhantes, o próximo passo lógico é baixar o checkpoint oficial e comparar a latência com modelos autoregressivos do mesmo tamanho. Se a geração realmente for quatro vezes mais rápida em benchmarks padronizados, o ganho aparece imediatamente em tarefas como resumo longo ou geração de código iterativa.

## O que ainda precisa ser verificado

O anúncio promete até quatro vezes mais velocidade e detalha que os testes de alta performance ocorreram em ambiente de lote único (batch size 1) com GPU NVIDIA H100, onde o ganho do processamento paralelo é máximo. No entanto, como o ganho real pode variar em setups locais de consumo ou em diferentes tamanhos de lote, a abordagem mais segura é rodar os próprios experimentos com o modelo aberto e medir tokens por segundo em seu ambiente antes de adotá-lo em produção.