---
title: "Anthropic cria ferramenta que deixa Claude operar navegador pela árvore de acessibilidade"
author: "André Iglesias"
date: "2026-08-23 10:30:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/08/23/anthropic-cria-ferramenta-que-deixa-claude-operar-navegador-pela-arvore-de-acessibilidade/md"
---

## Resumo
- A Anthropic colocou o Browser Use em disponibilidade geral em 20 de agosto de 2026.
- A ferramenta permite que Claude interaja com links, botões e campos pela árvore de acessibilidade.
- O Browser Use usa referências estruturadas, enquanto o Computer Use opera um sandbox completo do sistema operacional.
- Ações em lote permitem reunir múltiplos comandos em uma única chamada do modelo, reduzindo a latência.
- O viewport é controlado pela aplicação do desenvolvedor, que mantém os limites de dados e conformidade.
- A atualização também inclui Skills API, Files API, elegibilidade HIPAA para Computer Use e verificações de segurança em planos Enterprise.

---

Em **20 de agosto de 2026**, a Anthropic promoveu à Disponibilidade Geral, ou GA, um conjunto de ferramentas para agentes de inteligência artificial, e o Browser Use virou a peça mais interessante para quem tenta automatizar tarefas na web sem transformar cada clique em um palpite. Em vez de depender apenas de coordenadas retiradas de screenshots, o recurso permite que o Claude leia a estrutura de uma página e encontre links, botões e campos de texto por referências organizadas. O resultado é uma abordagem mais próxima de navegar por um menu estruturado de videogame do que de apontar para uma imagem e torcer para acertar. Neste artigo, você vai entender o que muda na prática, por que as ações em lote importam e onde ficam os limites dessa automação.

## Da imagem da tela para a estrutura da página

O Browser Use funciona a partir da chamada **árvore de acessibilidade**, uma representação organizada dos elementos que uma página oferece para interação. Em vez de analisar somente a aparência de uma tela, o Claude recebe referências estruturadas para localizar componentes específicos, como um link de navegação, um botão de confirmação ou um campo destinado à entrada de texto. Essa diferença parece discreta, mas altera a pergunta feita pelo agente: ele deixa de tentar descobrir em qual ponto da imagem está o alvo e passa a trabalhar com a identidade do elemento descrito na página. A Anthropic afirma que esse modelo aumenta a confiabilidade das interações quando comparado à técnica anterior, baseada em coordenadas de pixels, criando uma fundação mais clara para automações repetitivas.

Essa separação também ajuda a entender por que o Browser Use não é apenas uma versão com outro nome do **Computer Use**. A ferramenta de navegador se concentra em elementos web, enquanto o Computer Use foi desenhado para operar um sandbox completo do sistema operacional, isto é, um ambiente isolado no qual o agente pode lidar com a área de trabalho. A própria Browser Use não exige que o desenvolvedor hospede um navegador inteiro: ela utiliza um viewport controlado pela aplicação, que funciona como a janela e os limites da experiência. Para quem acompanhou a primeira fase do [Computer Use da Anthropic](https://desbugados.com.br/post/2024/10/31/ia-manipulando-o-pc-do-usuario-claude-35-sonnet-em-acao), a mudança é parecida com trocar um controle baseado em coordenadas por uma interface que informa ao agente o nome e a função de cada comando disponível.

## O ganho mais direto está nas ações em lote

A novidade não está apenas na forma como o Claude identifica os elementos, mas também na capacidade de realizar **ações em lote**, conceito conhecido como batching. Antes de uma ação ser executada, um agente costuma precisar observar a página, decidir o próximo passo, enviar um comando e aguardar uma nova resposta do modelo. O lançamento permite reunir múltiplos comandos em um único turno de chamada, reduzindo a quantidade de idas e vindas entre a aplicação e o modelo. Em uma automação de navegador, essa mudança pode ser entendida como trocar uma sequência de apertos individuais por um combo programado: o agente ainda precisa saber o que fazer, mas não precisa interromper o fluxo a cada clique ou tecla.

Imagine, como exemplo hipotético, uma rotina que precise localizar um formulário, preencher um campo e acionar um botão de confirmação. O Browser Use oferece os tipos de elementos necessários para que o Claude reconheça cada etapa pela estrutura da página, enquanto o batching permite agrupar comandos compatíveis no mesmo turno. Isso não transforma qualquer processo em uma operação mágica nem elimina a necessidade de a aplicação definir o que o agente pode acessar, mas reduz o espaço entre uma decisão e sua execução. Para equipes que criam automações, a consequência prática é poder desenhar fluxos mais compactos, com menos chamadas intermediárias e uma leitura mais transparente do que aconteceu em cada etapa.

## Browser Use é parte de uma arquitetura maior

A disponibilidade geral não ficou restrita ao controle de páginas, pois a Anthropic também colocou a **Skills API** em uma etapa voltada ao uso em produção. A interface permite carregar e versionar pastas com instruções e scripts, que passam a rodar em um sandbox gerenciado pela própria Anthropic. Em termos simples, uma equipe pode separar a inteligência geral do Claude das regras específicas de uma tarefa, como se entregasse ao agente um manual operacional que pode ser atualizado sem reescrever todo o sistema. Essa lógica se conecta ao que já explicamos no artigo sobre [Skills do Claude](https://desbugados.com.br/post/2025/10/19/claude-a-ia-da-anthropic-agora-tem-skills-para-aprender-truques-novos-e-finalmente-preencher-aquele-pdf-chato), mas agora aparece integrada ao pacote de ferramentas para agentes, aproximando instruções próprias e execução controlada.

Na mesma atualização, a **Files API** passou a oferecer uma camada dedicada ao armazenamento e ao manuseio de documentos. A estrutura inclui **1 TB por organização**, limites de taxa cinco vezes maiores e expiração automática de arquivos. O detalhe da expiração importa porque estabelece um ciclo de vida para os dados, em vez de tratar cada documento enviado como um arquivo permanente sem prazo definido. Quando essa capacidade é combinada com uma automação de navegador, o agente pode trabalhar em tarefas que envolvem informação armazenada e ações realizadas em páginas, embora cada função continue tendo uma responsabilidade diferente. A Browser Use interage com a web; a Files API cuida do espaço destinado aos arquivos.

## O controle continua nas mãos da aplicação

A arquitetura do Browser Use deixa um limite bem visível: o agente não recebe autorização abstrata para navegar por toda a internet sem restrições. O desenvolvedor controla o **viewport**, que é a área de visualização e interação fornecida à ferramenta, e mantém sob sua responsabilidade os limites de conformidade e de dados. Essa escolha evita confundir automação com autonomia total. A Anthropic entrega a capacidade de interpretar elementos web, mas a aplicação decide qual ambiente será apresentado, quais páginas estarão disponíveis e quais informações poderão circular naquele fluxo. Para uma empresa, essa distinção é tão relevante quanto a precisão dos cliques, porque define o espaço em que a automação pode operar antes mesmo de o primeiro comando ser enviado.

O outro limite aparece na divisão entre web e desktop. O Browser Use foi descrito como uma ferramenta especializada em elementos de páginas, enquanto o **Computer Use** continua direcionado ao sandbox completo do sistema operacional. Essa fronteira funciona como uma escolha de ferramenta, não como uma promessa de que um único agente resolverá qualquer tarefa digital. Se o trabalho envolve um botão, um formulário ou um link dentro de uma página, a estrutura web é o caminho mais direto; se exige operar o ambiente completo do computador, a ferramenta de desktop ocupa esse papel. A comparação lembra jogos em que um personagem tem habilidades diferentes conforme o mapa: saber qual interface está diante do agente evita esperar de uma ferramenta aquilo que pertence à outra.

## Segurança e conformidade entram na mesma entrega

A mudança para disponibilidade geral também veio acompanhada de uma ampliação das condições de uso corporativo. O **Computer Use** passou a ser elegível para cargas de trabalho classificadas como HIPAA sob o BAA da Anthropic, duas referências associadas às exigências de conformidade para determinados dados e operações. O anúncio não transforma toda automação em uma atividade automaticamente autorizada, mas registra que a ferramenta de desktop pode ser considerada dentro desse tipo de enquadramento contratual. Para quem projeta agentes, a lição é direta: escolher o recurso não depende apenas de ele conseguir clicar ou preencher um campo, porque o tipo de dado processado e o acordo aplicável também entram na decisão técnica.

Além dessa frente de conformidade, a Anthropic implementou **escaneamento de segurança** para habilidades e plugins de terceiros em planos Enterprise, com o objetivo de detectar conteúdos maliciosos. A medida trata um risco específico da personalização: quanto mais instruções e extensões externas um agente consegue carregar, maior é a necessidade de verificar o material antes que ele seja usado em uma rotina. O controle não aparece como uma promessa de que todo conteúdo perigoso desaparecerá, mas como uma etapa de análise dentro dos planos corporativos. A empresa também apresentou o Claude in Chrome como um painel lateral que funciona como uma sessão de Claude Cowork, aproximando essa lógica de automação do navegador da interface usada diretamente pelo usuário.

## O que muda para quem constrói agentes

O lançamento em GA muda o ponto de partida para desenvolvedores que antes avaliavam essas ferramentas como experimentos. Browser Use, Computer Use, Skills API e Files API deixaram a fase beta em uma atualização que a Anthropic posicionou para uso em produção, e cada peça resolve uma parte diferente do fluxo. O Browser Use organiza a interação com páginas; o Computer Use cobre o desktop; a Skills API armazena instruções e scripts versionados; a Files API mantém documentos dentro de uma estrutura de armazenamento. Em vez de pensar em um chatbot que responde a perguntas, o desenvolvedor passa a montar uma sequência de capacidades, com fronteiras definidas entre leitura, ação, instrução e arquivo.

Essa mudança também altera a forma de medir o desempenho de uma automação. A pergunta deixa de ser apenas se o Claude consegue realizar uma tarefa e passa a incluir quantas chamadas são necessárias, quais elementos ele consegue identificar diretamente e qual parte do ambiente fica sob controle da aplicação. A combinação entre **referências estruturadas** e ações em lote oferece uma resposta concreta para dois problemas recorrentes: localizar o alvo certo e evitar interrupções excessivas entre comandos. O ganho, portanto, não está em fazer a IA parecer um personagem de filme futurista, mas em tornar o fluxo técnico mais legível para quem precisa construir, testar e manter a automação.

## A caixa de ferramentas para decidir sem cair no hype

Para usar a novidade com clareza, o primeiro passo é separar a tarefa em três perguntas: o agente precisa operar uma página web ou o computador inteiro, os comandos podem ser agrupados no mesmo turno e quais dados estarão disponíveis durante a execução? A resposta à primeira pergunta orienta a escolha entre **Browser Use** e Computer Use. A segunda aponta onde o batching pode reduzir as idas e vindas do modelo. A terceira leva ao viewport controlado pela aplicação, às regras de conformidade e ao tratamento de arquivos. Esse método é menos cinematográfico do que imaginar uma IA assumindo o computador, mas entrega algo mais útil: um mapa de permissões e responsabilidades antes que a automação seja colocada para funcionar.

O próximo passo anunciado já está disponível: testar as ferramentas em suas modalidades de **Disponibilidade Geral**, começando por um fluxo web limitado e observável, com os elementos que o agente pode acessar claramente definidos. A Anthropic oferece a estrutura para que o Claude leia páginas por referências, agrupe comandos em uma chamada e trabalhe ao lado de capacidades de instrução e arquivos, mas o desenho da experiência continua nas mãos de quem integra o recurso. O futuro dos agentes não aparece aqui como uma máquina invisível que faz tudo sozinha; ele surge como uma interface mais organizada, na qual cada clique tem um endereço, cada ação tem um limite e cada automação pode ser examinada antes de crescer.