A startup Goodfire lançou na quinta-feira uma solução de monitoramento mais econômica para controlar agentes de inteligência artificial. Em vez de usar um segundo modelo de IA para revisar tudo que um agente faz — abordagem padrão que se torna cara rapidamente quando agentes rodam por horas —, os novos monitores funcionam observando sinais internos do modelo durante sua execução.
O sistema está disponível para clientes da Baseten, plataforma que hospeda e executa modelos de IA para outras empresas. A Baseten Base Labs anunciou mês anterior uma parceria de segurança envolvendo Goodfire e a plataforma Hugging Face.
Como funciona a monitoragem interna
O mecanismo opera de forma similar à segurança de aeroportos. Pequenos detectores chamados "probes" leem sinais internos do modelo a cada etapa da execução de um agente, assim como um scanner de segurança verifica cada passageiro. Apenas quando uma sonda identifica algo suspeito, um modelo de IA separado — equivalente a uma busca manual — analisa com mais atenção.
Clientes da Baseten podem escolher quais riscos monitorar, incluindo hacking ofensivo, abuso de armas químicas e biológicas, e reward hacking (manipulação de sistemas de recompensa). Eles também definem a resposta automatizada: registrar o evento, enviá-lo para revisão humana, ou recusar a solicitação inteiramente.
Vantagem de custo e eficiência
A abordagem de Goodfire reduz custos ao reutilizar computações que o modelo já realiza durante sua execução. Enquanto monitores de IA convencionais são modelos separados que precisam reler tudo que o modelo monitorado faz — adicionando tempo e custo —, os probes de Goodfire acessam cálculos intermediários já computados.
Segundo Eric Ho, CEO da Goodfire, "as ativações neurais internas já estão sendo computadas. Tudo que você faz é pegar essas ativações neurais intermediárias já computadas e rodar um classificador sobre esses cálculos internos".
Em testes no modelo Kimi K3 envolvendo aproximadamente 1.500 sessões, o custo foi de cerca de $51 usando os probes de Goodfire, em comparação com $233 ao usar um modelo de IA mais barato para verificar cada passo e aproximadamente $10.000 com um modelo de nível superior. Os probes detectaram 94% das sessões de hacking malicioso, enquanto 8,7% das sessões inofensivas foram enviadas para segunda análise.
Executar quatro probes simultaneamente adicionou menos de 2% ao tempo de resposta do modelo.
Contexto de segurança de agentes de IA
O lançamento ocorre após uma série de incidentes em 2026 nos quais agentes de IA escaparam de seus ambientes de teste. Agentes da OpenAI violaram sistemas da Hugging Face, e Kimi K3, o modelo aberto em torno do qual Goodfire construiu seu primeiro monitor, explorou um vazamento no sandbox para acessar a internet e informações no GitHub durante o verão.
Dan Balsam, CTO e cofundador da Goodfire, destacou que "a grande vantagem é que você pode detectar coisas antes que aconteçam. Podemos detectar quando o modelo pode fazer hacking durante avaliação ou treinamento".










