O Google anunciou os novos modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, voltados à geração de voz por inteligência artificial. As ferramentas trazem recursos para criar vozes personalizadas e mais expressivas, incluindo a reprodução de uma voz existente a partir de uma amostra de apenas 30 segundos. A tecnologia também consegue interpretar instruções de atuação e adicionar elementos, como risadas, sussurros e suspiros, às falas.
O Gemini 3.8 Flash TTS tem foco em criação de vozes expressivas e personalizadas, com aplicações em audiobooks, podcasts e vozes para personagens de jogos. O modelo também cria vozes do zero a partir de comandos em texto, com descrições de papel, sotaque e outras características da persona vocal. As falas podem receber instruções de atuação frase por frase, com elementos, como sussurros, risadas, suspiros e interjeições.
O Flash TTS também consegue encenar diálogos entre duas vozes diferentes a partir de um único roteiro, o que atende a produções narrativas e outros conteúdos com múltiplos personagens ou narradores. Nos conteúdos de longa duração, o modelo busca manter a qualidade, o timbre e o tom da voz ao longo de horas de áudio, reduzindo o chamado speaker drift. A característica é especialmente útil em audiobooks e podcasts, nos quais alterações na voz podem ficar mais perceptíveis.
Já o Gemini 3.8 Flash-Lite TTS foi desenvolvido para dublagem e localização de conteúdo em alta escala, com suporte a mais de 100 idiomas e dialetos. A lista inclui português brasileiro, francês do Quebec e espanhol mexicano. O modelo também atende à criação de agentes de voz interativos, com interjeições como “mhm” e “yeah” durante conversas, além de narrações automatizadas.
:quality(85)/bdc06da0-0714-4caa-bbad-1e18aad4f7e7.jpeg)
Para quem preferir, o catálogo dos dois modelos já oferece mais de 2.000 vozes prontas para produção. Ainda, o Google prepara uma opção para personalizar as vozes da biblioteca com instruções em texto. A ferramenta deverá permitir ajustes de timbre, tom, ritmo e sotaque sem a necessidade de criar uma voz do zero.
Para ambos modelos, o Google solicita uma gravação de consentimento verbal correspondente ao locutor de referência antes da reprodução de uma voz existente. Os áudios gerados pelos modelos Gemini Audio também recebem o SynthID, uma marca d'água imperceptível incorporada ao conteúdo para ajudar na identificação de material sintético, e credenciais C2PA, que registram informações sobre a origem e a autenticidade do conteúdo.
A clonagem de voz pelo Google AI Studio tem algumas restrições regionais. A função não está disponível no Reino Unido, Espaço Econômico Europeu (EEE), Suíça, Índia e nos estados americanos de Illinois e Texas.
:quality(85)/7959b5fa-bef0-473c-a9b3-6662703746f4.jpg)
Onde usar os novos modelos de voz do Gemini?
O Gemini 3.8 Flash TTS será integrado ao Gemini Notebook e o Gemini 3.8 Flash-Lite TTS chegará ao Google Vids para gerar narrações e dublagens em apresentações e outros conteúdos em vídeo.
Para desenvolvedores, os modelos já estão disponíveis na Gemini API e no Google AI Studio, que oferece um playground de áudio para testar a geração de voz e criar diálogos entre múltiplos personagens.
O Google também prevê disponibilizar os modelos para clientes do Gemini Enterprise, mas ainda não detalhou todos os recursos que estarão disponíveis nessa versão.
Se você gostou do conteúdo, talvez também se interesse por conferir “7 comandos de voz do Gemini para se manter produtivo e informado”.
{{WHATSAPP_CHANNEL}}