A Arena, plataforma crowdsourced de ranking de modelos de inteligência artificial, anunciou no dia 8 de outubro de 2026 uma rodada Series B de US$200 milhões, elevando sua valuation para US$3,1 bilhões. A rodada foi liderada por Lightspeed Venture Partners e Khosla Ventures, com participação de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z e Felicis.
A empresa, originada em 2023 como projeto de pesquisa na UC Berkeley, quase dobrou sua valuation em aproximadamente 10 meses. Na rodada Series A de janeiro de 2026, levantou US$150 milhões com valuation de US$1,7 bilhão. Naquele momento, sua receita anualizada era de US$30 milhões. Em junho de 2026, a empresa atingiu US$100 milhões em receita anualizada.
A Arena oferece uma plataforma gratuita para consumidores, onde usuários inserem prompts e avaliam qual modelo de IA apresenta melhor desempenho. A empresa relata dezenas de milhões de visitantes mensais. Em setembro do ano anterior, lançou seu produto comercial, AI Evaluations, um serviço que fornece análises de desempenho detalhadas para laboratórios de IA e empresas, baseado no feedback da comunidade.
O crescimento da Arena ocorre em contexto onde laboratórios de IA identificaram que modelos estavam manipulando testes de benchmark em 2026, conseguindo boas pontuações sem realmente merecê-las. Simultaneamente, empresas buscam determinar qual modelo funciona melhor para suas necessidades internas, em vez de depender exclusivamente de benchmarks padronizados.
A empresa argumenta que a inteligência artificial está avançando mais rapidamente que a capacidade de avaliá-la, e que benchmarks estáticos falham quando modelos reconhecem estar sendo testados. "O mundo precisa de um terceiro neutro para medir o quão segura e alinhada a IA realmente está nas mãos de pessoas reais", afirmou a empresa em seu anúncio de financiamento.
Com esse objetivo, a Arena adicionou uma nova categoria ao seu leaderboard: alinhamento. Essa categoria classifica modelos com base em problemas como ação não autorizada (tomar ações não solicitadas), atribuição falsa (creditar incorretamente declarações ou fatos à fonte errada) e conclusão enganosa (mentir sobre completar tarefas que não foram realizadas).
No leaderboard preliminar de alinhamento, modelos da OpenAI ocupam o topo, com Claude Opus 5.5 em sexto lugar e Claude Fable em nono lugar.









