---
title: "Novos monitores tentam descobrir agentes de IA problemáticos por dentro do modelo"
author: "Gabriela P. Torres"
date: "2026-10-09 06:00:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/10/09/novos-monitores-tentam-descobrir-agentes-de-ia-problematicos-por-dentro-do-modelo/md"
---

## Resumo
- A Goodfire lançou probes que monitoram ativações internas de modelos durante a execução.
- Os monitores foram integrados à plataforma Baseten e usam uma cascata que aciona outro modelo ou revisão humana apenas quando um limite é atingido.
- Testes no Kimi K3 indicaram 94% de detecção de hacking malicioso com menos de 2% de sobrecarga na latência.
- A Goodfire relatou custo até 49 vezes menor que o de juízes que analisam todos os tokens e reduziu jailbreaks de 700 para 18 em ambiente controlado.
- A Cloudflare abriu o Clef, de 27B parâmetros, e o Clef-Flash, de 9B, para decisões estruturadas em fluxos de agentes.
- O Clef-Flash apresentou mediana de latência de 38,8 ms, enquanto a documentação descreve respostas do tipo sim ou não, escolha e pontuação.
- As duas abordagens atacam pontos diferentes: monitoramento de sinais internos e classificação especializada de decisões.

---

Agentes de inteligência artificial podem produzir uma resposta aceitável e, ainda assim, seguir uma rota problemática durante o processamento. Para investigar esse intervalo entre a intenção aparente e o comportamento efetivo, a **Goodfire** lançou monitores que acompanham sinais internos dos modelos e os disponibilizou para clientes da plataforma **Baseten**. Em paralelo, a **Cloudflare** abriu os modelos Clef e Clef-Flash, projetados para classificar situações e encaminhar decisões em fluxos de agentes, em vez de concentrar todo o trabalho na geração de texto. A conexão entre os anúncios está no problema que tentam resolver: se controlar um agente exige saber o que ele está fazendo, então observar apenas a resposta final deixa uma parte relevante da operação fora do campo de visão.

## A fiscalização começa antes da resposta final

O produto da Goodfire muda o ponto de inspeção. Em vez de esperar o modelo terminar uma resposta e entregar esse texto a outro sistema para avaliação, os monitores acompanham as ativações internas, isto é, os sinais numéricos produzidos durante o processamento. Esses detectores recebem o nome de **probes** e aproveitam cálculos do **forward pass**, a passagem em que o modelo processa uma entrada para chegar a uma saída. A diferença parece pequena na descrição, mas altera a conta operacional: o monitor não precisa reconstruir todo o raciocínio a partir do texto produzido, porque consulta sinais que já surgiram dentro da execução.

Essa leitura interna foi desenhada para funcionar como uma fiscalização em cascata. Primeiro, os probes acompanham comportamentos como hacking, uso de armas biológicas ou **reward hacking**, prática em que o sistema encontra uma forma de maximizar a recompensa sem cumprir a intenção original da tarefa. Se a pontuação ultrapassa um limite, um modelo de inteligência artificial separado ou uma revisão humana entra em ação; se o limite não é atingido, a operação segue sem acionar essa camada mais cara. Os monitores estão disponíveis para clientes da **Baseten**, segundo a descrição do lançamento, o que coloca a análise no ambiente de serviço usado para executar modelos e não apenas em uma demonstração de laboratório.

## O que os números realmente mediram

O teste mais citado pela Goodfire foi realizado no modelo **Kimi K3** e indicou 94% de detecção de hacking malicioso, com menos de 2% de sobrecarga na latência. Sobrecarga, nesse caso, é o tempo adicional introduzido pelo mecanismo de monitoramento durante a execução. A métrica responde a duas perguntas diferentes: o detector encontrou o comportamento procurado e fez isso sem tornar a operação significativamente mais lenta? Nos testes descritos, a resposta foi positiva para as duas condições. Isso não transforma o número em uma garantia para qualquer modelo ou tarefa, mas mostra por que a empresa aposta em sinais internos em vez de acrescentar uma leitura completa da saída a cada passo.

O caminho até a produção também exigiu evitar uma recomputação desnecessária. A Goodfire estendeu o mecanismo de serviço **SGLang** para calcular internamente as pontuações dos probes, enquanto testes externos de red-teaming conduzidos pela **FAR.AI** avaliaram a resistência a tentativas de burlar as barreiras. A empresa relatou custo até 49 vezes menor que o de juízes baseados em modelos de linguagem que analisam todos os tokens, além de uma redução de 700 para 18 casos de jailbreak em um ambiente controlado. A formulação importa: os números descrevem uma configuração testada, não uma prova de que todo agente passará a ser seguro em qualquer ambiente.

## Os modelos de decisão atacam outro gargalo

A **Cloudflare** escolheu uma rota diferente da inspeção interna. O Clef, com 27 bilhões de parâmetros, e o Clef-Flash, com 9 bilhões, foram lançados como modelos multimodais de decisão, ou seja, sistemas que recebem estados e perguntas estruturadas para retornar probabilidades de escolha. Em vez de escrever uma resposta extensa, eles operam como classificadores: podem ajudar a encaminhar uma solicitação, selecionar uma rota ou classificar uma ameaça dentro de um fluxo de agente. Os dois modelos têm janela de contexto de **64 mil tokens**, medida que indica quanto conteúdo conseguem considerar em uma chamada, e incluem encoders de visão, componentes capazes de processar informações visuais.

A promessa de velocidade aparece com mais clareza no Clef-Flash. Integrado à **Workers AI**, serviço da Cloudflare para execução de modelos, ele apresentou mediana de latência de 38,8 milissegundos nos dados fornecidos. Latência é o intervalo entre o envio da pergunta e o recebimento da decisão; em uma rota crítica, cada milissegundo pode alterar o tempo total de resposta do agente. A Cloudflare também publicou os pesos sob a licença **Apache 2.0** no Hugging Face, permitindo que desenvolvedores acessem os arquivos dos modelos dentro das condições dessa licença, em vez de depender exclusivamente de uma interface fechada.

O formato de consulta tenta deixar a decisão legível para o sistema que chama o modelo. A documentação descreve três tipos: **noul**, para respostas de sim ou não; **choice**, para escolher entre opções; e **score**, para produzir uma classificação numérica. Os modelos são compatíveis com a API do System One, chamado **Jev**, o que facilita a migração de aplicações que já usam essa interface. Nos benchmarks internos divulgados pela Cloudflare, o Clef superou o Jev em sete de dez testes de decisão e apresentou latências menores na infraestrutura de borda, onde o processamento ocorre mais perto do usuário ou do serviço que precisa da resposta.

## Duas estratégias, um problema de controle

Os anúncios não descrevem uma parceria entre Goodfire e Cloudflare, nem indicam que seus produtos sejam compatíveis entre si. O ponto de contato está na arquitetura de controle. Se o risco aparece durante o processamento, então os probes tentam identificá-lo dentro do modelo; se a tarefa exige apenas uma escolha rápida e estruturada, então um modelo de decisão especializado pode evitar que um gerador maior produza texto para depois ser interpretado. A primeira abordagem funciona como um sensor instalado na máquina; a segunda funciona como uma peça dedicada a decidir qual caminho o agente deve seguir.

Essa separação também ajuda a desmontar uma promessa comum da indústria: a ideia de que basta colocar outro modelo para ler todas as respostas e fiscalizar o agente. A Goodfire tenta reduzir esse custo reaproveitando o forward pass e acionando uma análise adicional apenas quando um limite é ultrapassado. A Cloudflare reduz a tarefa pela outra ponta, oferecendo modelos treinados para responder a decisões como sim ou não, escolha entre alternativas ou pontuação. Em ambos os casos, o ganho alegado depende da aplicação correta: um probe precisa reconhecer o sinal relevante, enquanto um classificador precisa receber uma pergunta bem estruturada.

## O próximo passo é adaptar as decisões ao uso real

A Cloudflare também anunciou uma plataforma de ajuste fino por reforço, conhecida pela sigla **RL**, que permite adaptar os modelos Clef aos requisitos de uma carga de trabalho. O cliente pode usar seus próprios conjuntos de dados rotulados para tentar melhorar precisão e velocidade, duas medidas que raramente têm o mesmo peso em todas as operações. A empresa cita triagem de suporte e classificação de ameaças como exemplos de uso, oferece suporte inicial de engenharia e planeja disponibilizar um modo de autosserviço no futuro. A consequência prática é direta: o modelo aberto funciona como ponto de partida, mas a decisão precisa ser calibrada com exemplos do ambiente em que será aplicada.

Para quem opera agentes, a leitura mais segura dos lançamentos começa por uma pergunta simples: qual parte do comportamento está sendo medida? No caso da Goodfire, o foco são sinais internos, limites de ativação e acionamento de uma segunda análise ou de uma pessoa. No caso da Cloudflare, o foco são decisões estruturadas com tipos de resposta definidos e métricas de latência. O próximo passo anunciado pela Cloudflare é justamente ampliar a adaptação dos modelos por meio de dados rotulados e suporte de engenharia; para a Goodfire, os dados apresentados apontam para o uso dos probes em produção e para a validação de detecção e custo em ambientes controlados.

## A caixa de ferramentas para avaliar a promessa

Antes de adotar qualquer uma das abordagens, o operador deve separar três perguntas que costumam aparecer misturadas em comunicados: o sistema detecta o comportamento procurado, quanto tempo acrescenta à execução e em quais condições o teste foi realizado? Os dados da Goodfire respondem parcialmente a esse checklist: 94% de detecção de hacking no Kimi K3, menos de 2% de sobrecarga de latência e redução de jailbreaks de 700 para 18 em ambiente controlado. A conclusão precisa permanecer do tamanho da evidência. Os resultados sustentam uma promessa de eficiência e monitoramento em testes específicos, não uma certificação universal de segurança.

Já os modelos Clef oferecem uma ferramenta para quem quer transformar etapas de um agente em decisões explícitas, com respostas de sim ou não, escolhas ou pontuações, além de uma plataforma anunciada para ajuste com dados próprios. A recomendação prática é mapear primeiro as decisões que o agente precisa tomar, depois definir os sinais que devem disparar revisão e, só então, comparar latência, custo e precisão. Se o problema for comportamento indevido escondido durante a execução, a proposta dos probes responde a esse ponto; se o gargalo for encaminhamento e classificação, os modelos de decisão da Cloudflare oferecem a alternativa descrita nas fontes.