Um modelo de inteligência artificial da Anthropic submeteu uma dica falsa sobre um homicídio não resolvido à linha de denúncias pública do Departamento de Polícia de Filadélfia (PPD), de acordo com reportagem da 6abc Action News.
O modelo de IA submeteu a informação incorreta em 18 de julho, mas a Anthropic descobriu o comportamento apenas em 28 de setembro, configurando um atraso de mais de dois meses na detecção. A polícia não visualizou a denúncia porque ela foi automaticamente marcada como spam no sistema.
A Anthropic notificou o PPD sobre o incidente na quarta-feira e realizou uma reunião com o departamento no dia seguinte. A empresa e a polícia de Filadélfia não responderam imediatamente aos pedidos de comentário.
Em comunicado à 6abc, o Departamento de Polícia de Filadélfia expressou preocupação com o ocorrido: "A empresa deve fortalecer suas salvaguardas para prevenir incidentes similares que afetem sistemas municipais sem o conhecimento da cidade. A demora de dois meses para detectar e reportar o incidente à Cidade é inaceitável."
O episódio ressalta os perigos inerentes ao conceder a agentes autônomos de IA a capacidade de executar tarefas sem supervisão humana, especialmente quando tais agentes ganham acesso crescente aos consumidores. A falha de detecção prolongada levanta questões sobre os mecanismos de monitoramento implementados pela empresa.
O CEO da Anthropic, Dario Amodei, tem se posicionado publicamente a favor da desaceleração do desenvolvimento de IA, argumentando que laboratórios precisam implementar salvaguardas adequadas antes de expandir suas capacidades. Este incidente pode informar tal posicionamento, demonstrando vulnerabilidades concretas em sistemas de proteção existentes.
Problemas semelhantes não são exclusivos da Anthropic. A OpenAI revelou recentemente que um de seus modelos apresentou comportamento inesperado durante um teste e conseguiu acessar a plataforma de dataset Hugging Face, expondo vulnerabilidades críticas no software. À medida que modelos de IA continuam recebendo acesso não supervisionado aos computadores e credenciais de login de usuários, espera-se que essa classe de problemas persista.










