---
title: "Google testa o Gemini sem precisar enxergar as perguntas do exame"
author: "Lígia Lemos Maia"
date: "2026-08-28 09:30:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/08/28/google-testa-o-gemini-sem-precisar-enxergar-as-perguntas-do-exame/md"
---

## Resumo
- O Google DeepMind iniciou um piloto para a primeira avaliação duplo-cega de um modelo de IA de fronteira, usando o Gemini 2.5 Flash Lite.
- A proposta combate a contaminação de benchmarks, que ocorre quando modelos são treinados inadvertidamente com perguntas de teste.
- O Google Cloud Confidential Space isola o modelo e as questões em um ambiente de execução confiável.
- O Google não vê as perguntas, enquanto os avaliadores não acessam os pesos do modelo.
- GPUs NVIDIA H100 Confidential, criptografia Intel TDX, controle de código e atestado remoto reforçam a proteção do teste.
- O sistema retorna apenas as métricas acordadas e busca criar um padrão mais confiável para avaliações externas de IA.

---

O **Google DeepMind** iniciou um piloto para realizar a primeira avaliação “duplo-cega” de um modelo de IA de fronteira, o **Gemini 2.5 Flash Lite**, usando computação confidencial para impedir que desenvolvedor e avaliador acessem os dados sensíveis um do outro. Na prática, a empresa tenta medir o desempenho do sistema sem olhar as perguntas, enquanto a equipe responsável pelo exame não vê os pesos do modelo, os parâmetros internos que orientam suas respostas. A proposta enfrenta um problema que ameaça transformar exames de inteligência artificial em provas com gabarito conhecido: a contaminação de benchmarks. Ao separar as duas pontas, o teste desloca a discussão da promessa de pontuação para a pergunta mais incômoda: o resultado mede capacidade ou familiaridade com as questões?

## O bug que pode inflar a nota da inteligência artificial

O problema que dá sentido ao experimento é a **contaminação de benchmarks**. A contaminação acontece quando um modelo é treinado, ainda que inadvertidamente, com as perguntas reservadas para o teste, o que pode inflar sua pontuação. Benchmark é o nome usado para o conjunto de questões e critérios que permite comparar o desempenho de um sistema, mas a comparação perde valor quando o modelo já encontrou aquelas perguntas durante o treinamento. Em vez de funcionar como um exame novo, a avaliação passa a medir também o quanto o sistema reconhece padrões que já viu. A preocupação não é apenas estatística: ela atinge a confiança de quem usa esses resultados para entender as capacidades de uma IA.

Essa possibilidade expõe uma tensão difícil de resolver em uma avaliação tradicional. Em uma auditoria tradicional, o modelo precisa ser entregue ou a pergunta precisa ser revelada ao avaliador. O primeiro caminho pode expor os parâmetros internos do sistema, enquanto o segundo abre espaço para que as questões protegidas circulem além do grupo que as criou. A análise técnica que descreve o projeto apresenta o enclave, uma área computacional isolada, como uma caixa-preta capaz de manter as duas informações separadas durante o exame. O desafio, portanto, não é somente fazer perguntas melhores, mas preservar a independência entre quem pergunta e quem responde.

## Como funciona a caixa-preta do teste

Para romper esse impasse, o **Google Cloud Confidential Space** cria um ambiente de execução confiável, conhecido pela sigla TEE, no qual os dados são processados de forma isolada. A tecnologia funciona como uma sala fechada dentro da infraestrutura de computação: o modelo entra por uma porta, as perguntas entram por outra, e o processamento ocorre sem que as partes responsáveis tenham acesso direto ao conteúdo protegido. Um [relato técnico sobre a avaliação](https://thenewstack.io/google-double-blind-evaluation) descreve justamente essa arquitetura como o mecanismo que permite testar um sistema de fronteira sem entregar os pesos ao avaliador ou revelar o exame ao desenvolvedor. A metáfora da sala é útil porque traduz uma operação que, para o leitor, aparece apenas como uma sequência de entradas e resultados.

Uma vez dentro desse ambiente, o modelo e as perguntas do benchmark são carregados juntos, mas cada lado continua impedido de acessar o segredo do outro. O Gemini recebe as questões para produzir suas respostas, enquanto o grupo que preparou o exame não enxerga os pesos do modelo, isto é, os parâmetros que armazenam parte do aprendizado usado para gerar cada saída. O objetivo é fazer com que a resposta seja produzida sem a “cola” das perguntas e sem a abertura do sistema que está sendo avaliado. Ao final, o que interessa não é permitir uma inspeção irrestrita, mas registrar o desempenho dentro de regras combinadas antes do teste.

## Hardware e código também entram na proteção

A separação depende de uma camada física dedicada. O sistema utiliza GPUs **NVIDIA H100 Confidential** e criptografia de memória **Intel TDX** para manter os dados protegidos durante o processamento. A GPU é o componente responsável por executar grande parte dos cálculos de um modelo de inteligência artificial, enquanto a criptografia de memória transforma os dados armazenados temporariamente em conteúdo ilegível para quem não possui a autorização adequada. Nesse arranjo, a proteção não fica restrita a uma promessa administrativa de sigilo, pois a própria área de execução recebe mecanismos destinados a impedir o acesso aos dados enquanto a tarefa acontece. É essa combinação que sustenta a separação entre perguntas, respostas e parâmetros internos.

Essa proteção também passa pelo software que controla a operação. O **OpenMined PySyft** auxilia no controle de código para evitar vazamentos de dados, e a verificação é feita por **atestado remoto**, procedimento que confirma à distância se o ambiente que vai executar o teste corresponde às condições acordadas. O controle de código reduz a possibilidade de que uma instrução indevida copie informações durante a avaliação, enquanto o atestado oferece uma forma de verificar o ambiente antes de confiar nele. Não se trata de tornar a caixa-preta invisível a qualquer fiscalização, mas de permitir que sua configuração seja conferida sem abrir os dados que ela foi criada para proteger. A confiança passa, então, a depender tanto do isolamento quanto da capacidade de demonstrar que o isolamento está ativo.

## O que o resultado realmente revela

Com as duas pontas protegidas, os únicos dados devolvidos são as **métricas de desempenho acordadas**, e o ambiente é destruído após o teste. Essa escolha limita o resultado ao que foi combinado previamente, evitando que perguntas, pesos ou outros elementos sensíveis saiam do espaço protegido junto com o relatório. Para quem lê uma tabela de desempenho, a mudança pode parecer discreta, mas ela altera a origem da confiança: a pontuação não depende apenas da palavra de uma das organizações, e sim de um procedimento que tenta impedir que qualquer participante veja o material reservado ao outro. O exame deixa de ser uma vitrine aberta e passa a funcionar como uma experiência controlada, cujo relatório final é menor do que os dados usados para produzi-lo.

Esse desenho tem também um custo técnico delimitado. Uma análise sobre a arquitetura relata que o **overhead computacional**, ou seja, o trabalho adicional exigido pela proteção, ficou abaixo de **5%**. Os maiores desafios apontados atualmente são os acordos legais e a revisão de código entre as organizações participantes. A informação ajuda a separar duas discussões que muitas vezes aparecem misturadas: a tecnologia pode acrescentar uma carga computacional relativamente pequena, mas a cooperação entre instituições ainda precisa definir responsabilidades, permissões e formas de auditoria. Em outras palavras, fechar a sala é uma tarefa de engenharia; decidir quem pode construir, verificar e operar essa sala é uma tarefa institucional.

## Por que a avaliação duplo-cega importa para a IA

Além de enfrentar a contaminação de benchmarks, o piloto foi desenhado para avaliações externas em que a privacidade das informações precisa ser preservada. O **Google DeepMind** iniciou a iniciativa em parceria com o **Singapore AI Safety Institute**, e o projeto se concentra em testes de segurança, incluindo avaliações identificadas pela sigla CBRNE e testes de cibersegurança. Nesses casos, a proteção das perguntas pode ser tão relevante quanto a proteção dos pesos, porque a divulgação do exame comprometeria avaliações futuras e a exposição do modelo poderia revelar elementos que os avaliadores não deveriam receber. A proposta tenta resolver os dois riscos na mesma operação, sem transformar a busca por transparência em uma obrigação de abrir todos os dados.

É nesse ponto que a tecnologia ganha uma dimensão que ultrapassa a disputa por notas entre modelos. A iniciativa busca criar um **padrão na indústria** para avaliações externas privadas e confiáveis, algo que permitiria comparar sistemas sem exigir que uma organização entregue seus segredos à outra. Se esse formato for adotado em mais testes, a pergunta “qual modelo pontuou mais?” poderá vir acompanhada de outra, menos vistosa e talvez mais decisiva: “em que condições essa pontuação foi obtida?”. A resposta não elimina a necessidade de examinar os critérios do benchmark, a qualidade das perguntas ou os acordos entre os participantes, mas oferece uma maneira de proteger o exame contra um tipo específico de interferência.

## O limite entre confiança e caixa-preta

Por trás da expressão “duplo-cega” existe uma questão quase literária sobre conhecimento: é possível confiar em uma resposta quando ninguém vê completamente o caminho que levou até ela? O piloto não propõe uma máquina transparente em todos os sentidos; ele propõe uma máquina protegida durante uma avaliação delimitada, na qual os participantes concordam com as métricas que serão devolvidas. Essa diferença importa. O método reduz o acesso cruzado entre perguntas e pesos, mas a confiança ainda depende das regras estabelecidas, do código revisado e da verificação remota do ambiente. Como em uma obra de ficção científica, a sala fechada protege o experimento, mas também nos obriga a perguntar quem escreveu suas regras e quais perguntas ficaram do lado de fora.

Essa ambiguidade não diminui o valor do experimento, mas impede que ele seja confundido com uma solução universal para todos os problemas das avaliações de IA. A análise técnica aponta que os acordos legais e a revisão de código continuam entre os desafios, enquanto a cobertura sobre a metodologia descreve a busca por uma forma mais confiável e privada de testar modelos. O avanço, portanto, está menos em esconder a tecnologia do que em tornar explícito o que cada participante pode ou não pode conhecer. Quando uma avaliação protege simultaneamente o exame e o modelo, ela também torna mais visível a arquitetura de confiança que normalmente permanece escondida atrás de uma pontuação.

## O próximo passo é transformar o piloto em referência

No fim, o próximo passo indicado pelas fontes é fazer o piloto avançar como referência para avaliações externas de inteligência artificial, especialmente em testes de segurança. A iniciativa busca estabelecer um padrão de confiança e integridade para a indústria, mantendo as perguntas protegidas, preservando os pesos do modelo e devolvendo somente as métricas combinadas. Para o leitor que acompanha anúncios de desempenho, a caixa de ferramentas é simples: olhar não apenas para a nota, mas também para a origem das perguntas, para o risco de contaminação e para as condições em que o exame foi realizado. O Google não está apenas testando o Gemini sem enxergar a prova; está testando se a própria indústria consegue medir inteligência artificial sem entregar o gabarito antes da hora.