---
title: "Claude lidera teste de agentes que constroem outros agentes mas passa em menos de um quarto"
author: "Gustavo Ramos O. Klein"
date: "2026-09-10 06:00:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/09/10/claude-lidera-teste-de-agentes-que-constroem-outros-agentes-mas-passa-em-menos-de-um-quarto/md"
---

## Resumo
- O Hyper-τ-bench foi lançado pela Sierra em setembro de 2026 para avaliar agentes que constroem outros agentes.
- O Claude Opus 5 no Claude Code teve o melhor desempenho, com aprovação de 23,9%.
- Nenhum modelo superou 25% de sucesso, enquanto a referência humana com IA alcançou 82,2%.
- A avaliação reúne 53 tarefas, sendo 35 no setor bancário, em domínios variados.
- O teste ocorre em uma sandbox isolada, com gerenciamento de arquivos, APIs e bases de conhecimento.
- A pontuação é registrada por meio de pull request em um leaderboard público.
- As principais falhas envolvem pesquisa profunda, requisitos ausentes e pouca exploração de arquiteturas alternativas.

---

O **Hyper-τ-bench**, benchmark de código aberto lançado pela **Sierra** em setembro de **2026**, colocou o **Claude Opus 5 no Claude Code** no topo da avaliação de agentes capazes de construir outros agentes. O resultado, porém, vem com um limite claro: a configuração passou em **23,9% dos testes**, enquanto nenhuma das opções avaliadas superou 25% e a referência formada por uma pessoa e um modelo de IA chegou a **82,2%**. A pergunta que o teste ajuda a desbugar é direta: quando uma IA recebe interfaces e uma base de conhecimento, ela consegue montar sozinha um agente funcional? Os dados permitem separar a demonstração de capacidade da autonomia completa, e é nessa diferença que a avaliação ganha valor para quem projeta software conectado.

## O que o Hyper-τ-bench realmente mede

Para medir essa capacidade, a **Sierra** avalia o caminho percorrido pelo sistema até a entrega, e não somente uma resposta isolada. O benchmark verifica como modelos de IA e harnesses de codificação constroem agentes de atendimento ao cliente em ambientes simulados de aviação, varejo, telecomunicações e bancos. Um harness de codificação é a camada que reúne as ferramentas e o fluxo usados pelo modelo para trabalhar no código; ele funciona como uma ponte entre a instrução recebida e os arquivos e serviços que o agente precisa organizar. Esse recorte desloca a pergunta de "qual modelo escreve melhor?" para "qual combinação consegue entregar um agente conectado a fontes e regras de um domínio?" A resposta depende da integração entre as peças, e o próximo passo da metodologia mostra o tamanho dessa cobrança.

Esse recorte foi formalizado em um artigo de **41 páginas**, publicado em **4 de setembro de 2026** por pesquisadores da Sierra. A bateria usa **53 tarefas** em domínios variados, das quais **35 pertencem ao setor bancário**, deixando esse domínio com a maior fatia da avaliação. A presença de tarefas diferentes impede que a medição seja lida como um teste genérico de programação, porque cada domínio exige que o agente organize informações e regras próprias. Para comparar sistemas com seriedade, o leitor precisa observar a tarefa executada e os recursos oferecidos, em vez de transformar uma taxa geral em promessa universal.

## A liderança do Claude vem com uma ressalva grande

A liderança do **Claude Opus 5 no Claude Code** terminou com **23,9% de aprovação**, a maior taxa entre as configurações testadas, segundo os [resultados divulgados sobre o benchmark](https://thenewstack.io/claude-build-agents-benchmark). Em uma leitura simples, isso significa que pouco menos de um em cada quatro testes atingiu o critério de aprovação. O número não descreve um agente incapaz de programar; descreve uma tarefa composta, na qual ele precisa pesquisar, escolher uma arquitetura, operar ferramentas e entregar o agente final dentro das condições da avaliação. A régua mede a coordenação entre modelo e ambiente, por isso a liderança convive com uma taxa de conclusão ainda baixa.

A distância para a referência humana deixa essa limitação ainda mais visível. A comparação formada por **um humano e um modelo de IA** alcançou **82,2%**, enquanto nenhum dos modelos testados ultrapassou 25% de sucesso. Essa referência não elimina o valor do Claude como melhor resultado entre as configurações avaliadas, mas mostra quanto a orientação de uma pessoa altera a construção de um agente em domínios ricos em informação. Na prática, o teste sugere que fornecer contexto, revisar decisões e questionar lacunas continua tendo peso direto no resultado, e essa participação humana aparece como parte da própria capacidade de construir sistemas conectados.

## A ponte entre código, APIs e conhecimento

O ambiente de teste é uma **sandbox isolada**, sem acesso irrestrito à internet, onde o agente deve gerenciar **arquivos** para construir o agente final. Sandbox é um espaço controlado, separado de sistemas externos, criado para que a execução seja observada dentro de limites definidos. Essa escolha reduz a possibilidade de o sistema buscar qualquer informação na internet e força a execução a acontecer com os recursos disponíveis na avaliação. O resultado se aproxima de uma prova de integração: o modelo precisa transformar instruções em uma estrutura funcional sem contar com uma pesquisa aberta e ilimitada, o que ajuda a explicar por que a autonomia completa é uma exigência tão alta.

Dentro dessa área controlada, as **APIs**, interfaces que permitem a troca de dados e comandos entre serviços, fazem a ligação entre o código e as **bases de conhecimento**, que armazenam as informações usadas pelo agente. O teste exige que o sistema gerencie esses elementos enquanto constrói o produto final, colocando a interoperabilidade no centro da tarefa. Em vez de conversar com uma única ferramenta, o agente precisa organizar conexões e fontes diferentes, como se cada serviço tivesse de seguir um protocolo comum para participar do mesmo diálogo. É justamente nessa passagem entre instrução, informação e execução que uma resposta correta pode deixar de ser suficiente.

A entrega também tem um formato verificável: a pontuação é feita por meio de um **pull request** em um **leaderboard público**, conforme a [descrição da metodologia publicada pela Sierra](https://www.unite.ai/sierra-open-sources-hyper-tau-bench-a-benchmark-for-agent-construction/). Pull request é uma proposta formal para incorporar mudanças de código, enquanto leaderboard é uma tabela pública que organiza os resultados de uma avaliação. A escolha desse processo aproxima o teste do trabalho real de desenvolvimento, no qual uma alteração precisa ser apresentada e examinada antes de entrar no projeto. O benchmark, portanto, observa tanto a construção do agente quanto a forma como o resultado é entregue para avaliação.

## Onde a autonomia ainda quebra

Os resultados apontam quatro limitações recorrentes na atuação autônoma. A avaliação identificou dificuldade para realizar **pesquisas profundas**, pouca iniciativa para questionar **requisitos ausentes** e uma tendência a não explorar arquiteturas alternativas, concentrando-se em designs únicos. Essas falhas atingem momentos diferentes do processo: buscar informação, descobrir o que não foi especificado e comparar caminhos de implementação. Um sistema pode produzir código e ainda assim escolher uma estrutura inadequada ou aceitar uma instrução incompleta sem pedir esclarecimento. O problema, portanto, aparece na tomada de decisões que antecede a entrega, e não apenas na escrita de linhas de código.

A leitura mais direta do número de **23,9%** é que o melhor resultado atual ainda está distante da autonomia total medida pelo teste. Para equipes que pretendem usar agentes construtores, a referência de **82,2% com participação humana** oferece um parâmetro concreto: a supervisão, o contexto e a revisão precisam continuar dentro do fluxo enquanto os sistemas não demonstram desempenho próximo desse patamar por conta própria. O Hyper-τ-bench transforma essa diferença em uma pergunta prática para cada projeto: quais decisões podem ser delegadas e quais exigem uma pessoa capaz de investigar, questionar requisitos e comparar arquiteturas antes de aprovar a entrega?