---
title: "A Anthropic descreve um sistema de IA que melhora outro modelo em dez testes de alinhamento"
author: "Gabriela P. Torres"
date: "2026-08-30 06:00:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/08/30/a-anthropic-descreve-um-sistema-de-ia-que-melhora-outro-modelo-em-dez-testes-de-alinhamento/md"
---

## Resumo
- A Anthropic publicou em 28 de agosto de 2026 o estudo "Automated Researchers Can Reliably Mitigate Alignment Failures".
- Agentes baseados no Claude Opus 4.8 buscaram literatura, propuseram métodos, treinaram modelos e avaliaram os resultados em ciclos de cerca de 30 minutos.
- O sistema melhorou o desempenho em dez categorias de falhas de alinhamento, incluindo fraude, sicofancia e jailbreaks.
- As técnicas continuaram eficazes em modelos de até 4,7 vezes o tamanho dos modelos-alvo usados durante o treinamento.
- Na comparação relatada, 28 pesquisadores humanos tiveram oito horas cada, enquanto os agentes superaram a melhor proposta humana em 20% no teste de fraude.
- O custo informado foi de US$ 4 por hora para os agentes, contra US$ 150 por hora de pesquisadores humanos.
- A Anthropic disponibilizou o código do AAR harness, mas o estudo não demonstra autoaperfeiçoamento ilimitado de capacidades gerais.

---

Em 28 de agosto de 2026, a **Anthropic** publicou um estudo no qual agentes baseados no Claude Opus 4.8 pesquisaram métodos de treinamento, aplicaram essas técnicas a outro modelo e avaliaram os resultados em dez testes de falhas de alinhamento. A empresa relata que o sistema melhorou comportamentos associados a fraude, sicofancia e jailbreaks sem degradar as capacidades gerais dos modelos analisados, além de superar pesquisadores humanos em uma comparação específica. O detalhe que precisa ser desbugado está no alcance da promessa: o trabalho automatiza etapas da pesquisa de alinhamento de outros modelos, mas não demonstra uma IA que aperfeiçoa ilimitadamente as próprias capacidades gerais.

## O que a Anthropic realmente demonstrou

Publicado sob o título ["Automated Researchers Can Reliably Mitigate Alignment Failures"](https://alignment.anthropic.com/2026/automated-alignment-researchers/), o estudo foi liderado por **Chen Yueh-Han** e apresenta os chamados Automated Alignment Researchers, ou AARs. Em termos simples, alinhamento é o trabalho de ajustar o comportamento de um modelo para reduzir respostas problemáticas nos testes definidos pela pesquisa. O sistema recebeu a tarefa de investigar soluções, em vez de apenas executar uma instrução fixa, e percorreu uma sequência que combinava consulta à literatura, criação de propostas, treinamento e avaliação. Se a expressão "IA que se aprimora" for usada para descrever esse resultado, então ela precisa vir acompanhada dessa delimitação: o objeto aprimorado era outro modelo avaliado pelos agentes.

Essa distinção muda a leitura do anúncio porque separa a automação de um processo de pesquisa da criação de uma máquina com capacidade geral de autoaperfeiçoamento. A própria descrição consolidada do estudo trata o trabalho como uma prova de conceito para automatizar pesquisas de alinhamento, e a análise comparativa disponível afirma que o experimento foi sobre a correção de alinhamento de outros modelos. Portanto, a conclusão permitida pelos dados é específica: agentes de IA encontraram e testaram intervenções para reduzir falhas comportamentais em modelos-alvo. A conclusão que os dados não sustentam é a de que o Claude Opus 4.8 tenha passado a melhorar indefinidamente a própria inteligência, uma diferença pequena na manchete e enorme na interpretação.

## Como funciona o ciclo de pesquisa automatizado

O processo descrito pela **Anthropic** funciona como um circuito de tentativa, medição e seleção. Primeiro, os agentes consultam trabalhos da literatura; depois, propõem métodos de treinamento para o modelo-alvo; em seguida, executam essas ideias e medem o efeito nos testes. A sequência é repetida para que abordagens ineficazes sejam descartadas, enquanto as que apresentam resultado positivo permanecem no processo. A palavra "agente" designa aqui um sistema que realiza várias etapas encadeadas da tarefa, e não uma entidade independente com objetivos próprios, distinção que impede transformar uma rotina automatizada em uma narrativa de autonomia ilimitada.

O detalhamento técnico disponível acrescenta que cada ciclo inclui uma etapa de teste de aproximadamente **30 minutos** no modelo-alvo. Nesse intervalo, o agente revisa métodos, experimenta uma abordagem e decide, a partir da avaliação, se deve abandoná-la ou preservá-la para a próxima rodada. O projeto foi conduzido por Chen Yueh-Han, em colaboração com **Jiaxin Wen**, da UC Berkeley, e **Jan Hendrik Kirchner**, da Anthropic. Essa estrutura importa porque mostra onde está o trabalho automatizado: formular hipóteses, executar intervenções e verificar métricas, sempre dentro dos testes e dos modelos definidos pelo experimento.

## Dez categorias, custo menor e comparação humana

Os resultados relatados abrangem **dez categorias de falhas de alinhamento**, entre elas fraude, sicofancia e jailbreaks. Fraude, neste contexto, corresponde ao benchmark chamado "deception"; sicofancia descreve o comportamento de concordância indevida procurado pelo teste; e jailbreaks são tentativas de contornar as restrições do modelo. Segundo a Anthropic, os métodos encontrados pelos agentes melhoraram o desempenho dos modelos nesses benchmarks sem reduzir suas capacidades gerais. A empresa também informa que as técnicas continuaram eficazes em modelos de até **4,7 vezes** o tamanho dos modelos-alvo usados durante o treinamento, mas esse resultado continua limitado às categorias e às condições avaliadas.

A comparação com humanos acrescenta uma medida concreta, embora não autorize uma conclusão universal. O estudo colocou os agentes diante de propostas produzidas por **28 pesquisadores humanos**, que tiveram oito horas cada para trabalhar, enquanto a IA obteve resultados superiores aos humanos após cerca de seis horas de trabalho. No benchmark de fraude, a melhor proposta dos agentes superou em **20%** a melhor proposta humana, segundo a análise disponível. O custo operacional informado foi de **US$ 4 por hora**, contra US$ 150 por hora de pesquisadores humanos. Se a pergunta for eficiência dentro desse experimento, os números favorecem os agentes; se a pergunta for substituição geral de pesquisadores, os dados apresentados não respondem a isso.

## Onde a promessa termina

A palavra "superou" precisa permanecer presa ao método de comparação usado. Os pesquisadores humanos receberam um período definido, os agentes trabalharam por ciclos e o desempenho foi medido em benchmarks específicos de alinhamento. Isso permite comparar propostas dentro das regras do estudo, mas não permite concluir que a IA seja superior em toda atividade de pesquisa ou que resolva problemas de alinhamento ainda não incluídos nos testes. A [reportagem sobre o estudo](https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai) chama atenção para a ideia de uma IA que melhora outros modelos, mas o próprio recorte dos resultados exige manter a formulação mais precisa.

A análise comparativa também aponta limitações específicas: faltam benchmarks para questões emergentes, e o estudo pode carregar viés político. Esses pontos não anulam os resultados divulgados, mas definem o que ainda não foi medido. Um benchmark é uma bateria de testes criada para comparar desempenho sob condições determinadas; melhorar nessa bateria não equivale automaticamente a resolver todos os problemas possíveis fora dela. Assim, a afirmação mais segura é que o sistema encontrou intervenções úteis nas avaliações disponíveis. A afirmação de que ele produz uma inteligência artificial capaz de se aperfeiçoar sem limites seria maior do que as evidências apresentadas.

## O próximo passo é permitir auditoria externa

A Anthropic disponibilizou o código-fonte do **AAR harness**, nome dado à ferramenta que organiza o trabalho dos pesquisadores automatizados. Em linguagem direta, um harness é a estrutura que conecta as etapas de pesquisa, treinamento e avaliação para que o procedimento possa ser executado e examinado por terceiros. A abertura do código permite que outros grupos auditem a ferramenta e apliquem as técnicas em seus próprios modelos, de acordo com a descrição oficial. Esse é o próximo passo concreto anunciado: tirar o método do experimento descrito pela empresa e colocá-lo à disposição de verificações independentes.

Para o leitor, a caixa de ferramentas fica dividida em três perguntas objetivas: qual modelo os agentes estão tentando ajustar, quais falhas os benchmarks medem e que capacidades permanecem fora do teste? Neste caso, as respostas são, respectivamente, modelos-alvo de alinhamento, dez categorias de comportamentos problemáticos e a capacidade geral de uma IA se aprimorar sem limites. Os números de custo, tempo e comparação humana ajudam a medir eficiência, enquanto as limitações impedem exagerar o alcance. O resultado merece atenção por automatizar uma parte difícil da pesquisa, mas a descrição tecnicamente correta continua sendo a de um sistema automatizado de alinhamento, não a de uma inteligência artificial autossuficiente em evolução contínua.