Durante sua "Birthday Week", a Cloudflare anunciou Clef, um conjunto de modelos de IA de peso aberto especificamente projetados para escolher entre opções predefinidas, diferenciando-se de modelos tradicionais que geram texto livre.
A empresa disponibilizou duas versões: Clef-27B, um modelo multimodal completo, e Clef-Flash, uma versão menor com 9B parâmetros otimizada para decisões sensíveis à latência. O Clef-27B processa múltiplos tipos de entrada—texto, JSON, imagens e vídeo—e retorna probabilidades para cada opção permitida em uma única passagem direta, sem gerar texto livre nem exigir análise de saída.
/filters:no_upscale()/news/2026/10/clef-decision-models/en/resources/1clef0-1791184076532.jpg)
Imagem: InfoQ. Cloudflare - Benchmarking Clef
Os modelos de decisão classificam entradas e retornam resultados tipados com probabilidades, permitindo que agentes de IA utilizem essas saídas para determinar ações, como encaminhamento de solicitações de suporte, escalação ou deferência para análise humana. A API da Cloudflare é compatível com o modelo Jev System One da Typesafe AI.
/filters:no_upscale()/news/2026/10/clef-decision-models/en/resources/1clef1-1791184076532.jpg)
Imagem: InfoQ. Cloudflare - Modelos de Decisão
Os benchmarks da Cloudflare mostram latência mediana de 38,8 ms para Clef-Flash e 209,3 ms para Clef-27B. Os modelos são hospedados na infraestrutura da Cloudflare com GPUs na borda, resultando em baixa latência de rede. Conforme explicam Michelle Chen (gerente de produto), Alex Reneau (engenheiro de machine learning principal) e Kevin Flansburg (gerente de engenharia sênior): "Por estarem hospedados em nossa infraestrutura, conseguimos aproveitar nossas GPUs na borda, resultando em baixa latência de rede e decisões mais rápidas. Isso significa que você poderia usar Clef no caminho crítico para agentes tomarem decisões e combinar com um de nossos LLMs em Workers AI para executar ações."
Clef diferencia-se de outras soluções por incluir um codificador de visão que permite classificar conteúdo visual—capacidade ausente no Jev, que atua apenas com texto. Além disso, possui uma janela de contexto de 64k tokens, comparada aos 32k do Jev, permitindo processar mais estado de entrada para classificação.
Os modelos foram disponibilizados via Workers AI e como pesos baixáveis no Hugging Face, com convite à comunidade de desenvolvedores para experimentar e fornecer feedback. A Cloudflare planeja fine-tuning para casos específicos, como triagem de suporte e classificação de bots. Um serviço de fine-tuning foi anunciado com suporte inicial de engenheiros Cloudflare, com plataforma self-service prevista para lançamento posterior, embora sem data firme confirmada.










