Novo Gemini raciocina enquanto conversa por voz com usuário

O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usuário por voz e executar tarefas em segundo plano sem interromper o diálogo. O Gemini 3.8 Live já está disponível no Search Live e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o serviço e o plano contratado. Os modelos também já estão disponíveis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em prévia privada para empresas no Gemini Enterprise.

No Google Workspace, o Docs Live está disponível para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. As integrações permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário.

A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza interações rápidas, escala e custo-benefício, e o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento. Os dois contam com suporte visual em tempo real e detecção automática de idiomas, além de conseguirem alternar entre 97 idiomas durante uma mesma conversa.

gemini (1)

Gemini consegue raciocinar durante a conversa por voz

Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar uma tarefa, o Gemini pode reconhecer uma solicitação, iniciar uma ação em segundo plano e continuar o diálogo enquanto o processo é concluído. A função pode ser usada, por exemplo, para consultar informações, criar códigos ou realizar uma reserva.

No Gemini 3.8 Live Extended Thinking, o sistema também utiliza frases curtas para sinalizar que está trabalhando em uma solicitação, como “deixe-me verificar isso para você”. A proposta é evitar longos períodos de silêncio durante o processamento e manter o diálogo mais próximo de uma conversa natural. Em tarefas com várias etapas, a IA ainda pode informar o andamento do processo enquanto executa as ações necessárias.

A interação também pode combinar voz e imagem. Com o uso da câmera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informações para responder ao usuário. Entre os exemplos apresentados pelo Google estão o auxílio durante uma partida de xadrez e a orientação de novos funcionários durante um processo de integração.

Apps do Gemini

Os modelos também foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no τ-Voice, que mede a conclusão de tarefas por agentes de voz, e 35,1% no τ-Voice-banking, voltado a tarefas do setor financeiro. Já o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz.

Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d'água imperceptível por meio do SynthID. A tecnologia foi desenvolvida pelo Google para facilitar a detecção de conteúdo criado por inteligência artificial e aumentar a transparência sobre a origem das gravações.

Se você gostou do conteúdo, talvez também se interesse por conferir “4 ajustes para fazer antes de migrar do ChatGPT para o Gemini”. 

{{WHATSAPP_CHANNEL}}