Apesar dos bilhões investidos em startups de inteligência artificial por voz e do lançamento semanal de novos modelos que prometem soar humanizados, executivos de empresas do setor consideram que a tecnologia ainda não atingiu seu "ChatGPT moment" — aquele ponto de ruptura que definiria sua adoção em massa.
Shawn Wen, diretor de tecnologia da PolyAI, plataforma de voz para enterprise, aponta que embora modelos full-duplex — capazes de falar enquanto escutam o usuário — já tenham sido desenvolvidos, o próximo desafio é fundamental: fazer o raciocínio acontecer muito rapidamente para que as conversas soem naturais e as respostas cheguem sem delay. "Precisamos que os modelos busquem respostas rapidamente para que a conversa pareça natural", disse em palestra na conferência HumanX.
Para agentes de voz em atendimento ao cliente, a confiança é essencial. Wen ressalta que os assistentes não devem soar robóticos e precisam dar aos clientes segurança de que conseguem resolver problemas. Ele projeta que, quando a qualidade da voz for suficiente e o cliente estiver disposto a engajar nos primeiros turnos de conversa, começará a ganhar confiança — e poderá preferir interagir com o agente de IA a falar com um humano, se o problema for resolvido.
Desafios de entendimento e transparência
Alex Gay, diretor de marketing da Otter, plataforma de notas de reunião com IA, identificou speaker identification, captura de intenção e integração com conhecimento organizacional como passos-chave para habilitar automação. A Otter trabalha em digital twins — representações de pessoas em reuniões — e Gay destaca que essas representações devem reproduzir expressões emocionais genuínas. "Se você não conseguir ter debate e discussões estratégicas com um avatar, ele vira apenas um chatbot de perguntas e respostas", argumentou.
Um problema crítico permeia o setor: modelos de reconhecimento automático de fala (ASR) frequentemente perdem palavras-chave importantes, comprometendo a captura de contexto e causando falhas em todo o pipeline de processamento. Gay concordou com essa avaliação e explicou que quando a transcrição inicial não tem a acurácia necessária, todas as ações downstream ficam comprometidas. "Se você começa com uma transcrição errada, as ações que virão depois serão erradas. Você perde a confiança na plataforma. É crítico continuarmos melhorando o modelo ASR porque os impactos posteriores são significativos", afirmou. A linguagem também foi identificada como área que precisa melhorar em modelos de voz.
Transparência emerge como requisito fundamental. Ferramentas devem declarar aos usuários se estão gravando ou se estão conversando com IA. Otter notifica todos os participantes em chat quando uma reunião está sendo gravada para manter confiança. PolyAI também defende que seja explicitamente estabelecido em chamadas enterprise que a pessoa está falando com uma IA.
Investidores continuam injetando bilhões em startups de voice AI que atuam em áreas como desenvolvimento de modelos, atendimento ao cliente enterprise, ferramentas de notas de reunião e dictação com IA, apostando que voz será a próxima grande interface de usuário.










