Cloudflare implementou modelos de IA frontier dentro de um harness de teste controlado para sondar e melhorar seu Web Application Firewall (WAF). O sistema utilizou ataques já bloqueados como pontos de partida, gerando e refinando variações automáticas para identificar fraquezas potenciais.
O experimento abrangeu 45 cenários e gerou 1.107 tentativas de ataque, resultando em 49 descobertas relevantes após triagem humana. Essas descobertas contribuíram para três mudanças no Managed Ruleset da Cloudflare: duas novas detecções (SSRF - Obfuscated Host e SSRF - Restricted Protocol) e uma melhoria na regra existente SSRF - Cloud.

Imagem: InfoQ. Harness de teste controlado da Cloudflare para probing do WAF com modelos de IA
Funcionamento do Sistema
Os modelos de IA não tinham acesso às regras do WAF, código-fonte ou sinais de segurança internos, tornando o teste efetivamente caixa-preta. Um harness em Python gerenciou os componentes que Cloudflare não delegou aos modelos: construiu e replicou requisições HTTP, manteve o estado dos cenários, enforçou limites e coletou respostas.
O processo funcionava em ciclo: uma chamada de modelo propunha a próxima mutação enquanto outra revisava a resposta resultante, permitindo que as tentativas subsequentes se adaptassem sem dar controle direto sobre a execução das requisições.
Um teste de SSRF ilustra esse mecanismo. O sistema testou repetidamente diferentes representações e posicionamentos de um endereço de metadata na nuvem, usando formatos decimal, octal e outros. Uma requisição em representação decimal foi bloqueada. Na tentativa seguinte, o modelo manteve a mesma estrutura mas alterou para representação com ponto final, resultando em redirecionamento em vez de bloqueio do WAF. Cloudflare preservou o resultado para investigação sem tratar como sucesso do ataque.
Resultados da Triagem
Dos 1.107 attempts registrados, 607 produziram resultados após triagem: 558 requisições foram bloqueadas pelo WAF e 49 foram consideradas relevantes para remediação. Quarenta e oito dos 49 achados envolveram command injection ou server-side request forgery (SSRF).

Imagem: InfoQ. Cadeia Agentic Vulnerability Discovery do Google Mandiant integrando análise de código-fonte, geração de hipóteses e verificação
Revisores humanos permaneceram como etapa final de validação, verificando se as requisições alcançavam o alvo, permaneciam maliciosas, eram claramente desbloqueadas e caíam na responsabilidade do WAF. Os casos sobreviventes foram replicados e avaliados como candidatos para mudanças em regras, normalização ou outras mitigações.
Padrão Aplicado em Segurança
Este padrão de harness aparece em outros sistemas de segurança. O Google Mandiant utiliza Agentic Vulnerability Discovery Harness que encadeia agentes especializados através de análise de código-fonte, geração de hipóteses e verificação antes que os achados cheguem aos revisores humanos.
A solução OpenAI Codex Security constrói modelos de ameaça para repositórios, busca vulnerabilidades e tenta reproduzi-las em ambiente isolado antes de propor correções. O Google PageBreak valida se hipóteses geradas por IA são realmente exploráveis, evitando sobrecarregar equipes de segurança com achados plausíveis mas não verificados.
O fio condutor comum entre esses sistemas é o harness ao redor do modelo: constraindo execução, preservando estado, validando achados e transformando exploração probabilística em evidência que fluxos de segurança existentes podem utilizar.










