---
title: "Frontier AI tropeça em tarefas reais do escritório e prova que ainda não vai roubar seu emprego"
author: "Ignácio Afonso"
date: "2026-07-23 06:30:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/07/23/frontier-ai-tropeca-em-tarefas-reais-do-escritorio-e-prova-que-ainda-nao-vai-roubar-seu-emprego/md"
---

## Resumo
- O benchmark ALE da UC Berkeley avaliou mais de 1.500 tarefas reais em 55 ocupações
- GPT-5.5 obteve o melhor desempenho com 24% de aprovação
- Nas tarefas mais difíceis, todos os modelos alcançaram 0% de sucesso
- Custos variam de US$ 1,33 a US$ 15,70 por tarefa
- Falha comum: agentes declaram sucesso sem verificar
- Benchmark vivo com recursos abertos para exploração
- Foco na natureza do trabalho, não na indústria

---

Se você já se sentiu ameaçado pela ideia de que a inteligência artificial vai tomar conta de todos os empregos, especialmente aqueles em tecnologia e operações críticas, um estudo recente da **Universidade da Califórnia em Berkeley** oferece uma perspectiva mais realista e tranquilizadora. Os pesquisadores criaram o benchmark chamado **Agents’ Last Exam**, ou simplesmente ALE, para testar modelos de IA de ponta em mais de 1.500 tarefas profissionais extraídas de projetos reais de especialistas em 55 ocupações diferentes. O que eles descobriram é que mesmo os sistemas mais avançados conseguem completar apenas uma parte limitada dessas tarefas, com a melhor performance chegando a **24%** de aprovação geral e caindo para **zero por cento** nas mais desafiadoras, o que prova que a substituição humana ainda está longe de ser uma realidade no dia a dia de escritórios e instituições que dependem de estabilidade.

## Como o Agents’ Last Exam foi construído para refletir o mundo real

O **ALE** não é apenas mais um teste de laboratório, mas um esforço colaborativo que reuniu mais de **300 especialistas** vindos de mais de 100 instituições em campos variados como ciência, engenharia, medicina, direito, finanças e educação, todos trabalhando para criar tarefas baseadas em projetos reais que esses profissionais já executaram em suas carreiras. Essas atividades foram organizadas em **55 subcampos** dentro de 13 clusters industriais, seguindo a classificação padrão O*NET/SOC 2018 para ocupações não físicas, e o critério de avaliação é objetivo, sem depender de juízes humanos, o que garante que os resultados sejam verificáveis e reprodutíveis por qualquer um. O benchmark foi lançado em junho de 2026 pelo Center for Responsible, Decentralized Intelligence da UC Berkeley e inclui uma versão chamada **ALE-CLI** que é ainda mais ampla e de horizonte longo, superando em dificuldade testes anteriores como Terminal-Bench ou SWE-bench-Pro, onde o melhor agente chegava a 25,2% contra números mais baixos aqui. O propósito central é medir se esses agentes de IA são capazes de realizar trabalho que tem valor econômico real em domínios do mundo verdadeiro, ajudando a fechar a distância entre vitórias em ambientes controlados e contribuições significativas para a economia global.

## Os números concretos que revelam as limitações atuais da IA

Quando o teste foi aplicado a vários modelos frontier, incluindo o Fable 5 da Anthropic, o **GPT-5.5 da OpenAI** que obteve a maior taxa de aprovação geral com **24%**, o Composer 2.5 do Cursor, o Gemini 3.1 Pro do Google e dois modelos open-source chineses, os resultados mostraram uma clara divisão entre tarefas acessíveis e aquelas que exigem raciocínio prolongado e expertise profunda. No nível mais difícil do benchmark, todos os modelos testados, sem exceção, registraram **zero por cento de sucesso**, o que inclui até o Fable 5, e um padrão recorrente de falha foi a tendência dos agentes de declararem que a tarefa estava completa antes de verificarem o resultado final. Os custos também variam significativamente, com o Fable 5 demandando aproximadamente **US$ 15,70** por tarefa completada, o GPT-5.5 em torno de **US$ 3,80** e o Composer 2.5 cerca de **US$ 1,33**, o que torna alguns modelos até 4 a 12 vezes mais caros que alternativas com performance similar. Pesquisadores como Yiyou Sun, que liderou o estudo ao lado da professora Dawn Song, destacaram que o fator determinante não é a indústria em si, mas a natureza do trabalho, com procedimentos repetitivos tendo maior chance de automação, embora mesmo eles enfrentem problemas quando é preciso adaptar após uma falha inicial.

## A distância entre o hype dos agentes de IA e os resultados reais

Essa performance modesta coloca em perspectiva o hype em torno de agentes de IA para ambientes corporativos. Iniciativas como a plataforma Frontier da OpenAI buscam criar uma espécie de sistema operacional para esses "funcionários digitais", mas os achados do ALE sugerem que ainda falta muito para que eles atinjam o nível de job-ready necessário para substituir humanos em tarefas complexas. [Saiba mais sobre a plataforma Frontier da OpenAI aqui](https://desbugados.com.br/post/2026/02/11/openai-lanca-o-frontier-para-empresas-montarem-seus-proprios-exercitos-de-agentes-de-ia). Além disso, discussões recentes destacam como a IA, em vez de liberar tempo, pode contribuir para maior esgotamento profissional, conforme explorado em análises sobre o paradoxo da ferramenta que prometeu tempo livre. [Confira o artigo sobre o paradoxo da IA aqui](https://desbugados.com.br/post/2026/02/11/o-paradoxo-da-ia-a-ferramenta-que-prometeu-te-dar-tempo-livre-esta-te-causando-burnout).

## Lições práticas para quem trabalha com tecnologia no dia a dia

Para os profissionais de TI e outros campos que lidam com automação, o estudo traz uma mensagem clara de que a IA deve ser vista como uma ferramenta auxiliar em vez de uma solução completa, especialmente em fluxos de trabalho que envolvem tomada de decisões em múltiplas etapas e conhecimento especializado acumulado ao longo de anos. O benchmark é projetado para evoluir, com um pool de tarefas em crescimento constante, e oferece recursos abertos como o site oficial **agents-last-exam.org**, o artigo científico no **arXiv com o código 2606.05405**, o repositório no GitHub e o dataset no Hugging Face para que qualquer pessoa possa explorar, contribuir ou mesmo replicar os testes em seus próprios ambientes. Essa abordagem permite que equipes identifiquem rapidamente onde a IA pode ajudar em rotinas simples e onde a supervisão humana continua indispensável, preservando a robustez que o mundo digital precisa em suas operações cotidianas.

## A Caixa de Ferramentas: Próximos passos para navegar nessa realidade

Agora que você tem uma visão mais clara do estado atual da IA em tarefas reais, comece testando agentes em atividades repetitivas do seu fluxo de trabalho para mapear seus limites práticos, foque em habilidades de supervisão e adaptação que a tecnologia ainda não domina plenamente, e acompanhe atualizações do ALE e benchmarks similares para tomar decisões informadas sobre adoção de ferramentas. Dessa maneira, você se posiciona como alguém que usa a tecnologia de forma consciente, combinando o melhor do passado confiável com inovações que realmente agregam valor sem criar dependências arriscadas.