O Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) é o principal modelo criativo de conversão de texto em voz do Google, criado para fidelidade de voz com qualidade de estúdio, atuação expressiva, sotaques regionais autênticos e estabilidade de longo prazo multiturno.
Visão geral e recursos
O Gemini 3.8 Flash TTS estabelece um novo padrão para a geração de áudio expressivo:
- Alta fidelidade acústica e nuances de atuação:oferece uma rica variedade emocional, cadência natural e adesão precisa às instruções de
stylepor turno e eventos vocais inline (<laugh>,<sigh>,<short pause>). - Estabilidade multiturno de formato longo: mantém a identidade da voz, o timbre, o volume e o tom acústico da sala consistentes em diálogos longos e narrações de vários minutos sem desvio de voz.
- Pronúncia e sotaques regionais autênticos:compatível com sotaques regionais, dialetos minoritários e substituições inline do Alfabeto Fonético Internacional (IPA).
- Suporte completo ao ecossistema de voz:funciona perfeitamente com vozes pré-criadas, a biblioteca de vozes estendida (
GET /v1beta/voices), personas de design de voz personalizadas e replicação de voz (vozes armazenadas persistentes por padrão, além de chaves sem estado opcionais). Você também pode criar e replicar vozes de forma interativa no Google AI Studio.
Acesse o guia Text-to-Speech para conferir a cobertura completa de recursos, práticas recomendadas de solicitação e exemplos de código.
Quando usar cada modelo de TTS
Os dois modelos de TTS do Gemini 3.8 compartilham o mesmo esquema de API e estrutura de comandos. Escolha o modelo adequado para sua carga de trabalho:
| Recurso / carga de trabalho | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Ponto forte principal | Máxima fidelidade de voz, nuances de atuação e cobertura de dialetos | Alta capacidade de processamento, baixa latência e eficiência de custos |
| Melhores casos de uso | Audiolivros, narração em estúdio, diálogos complexos com vários falantes, atuação com forte explosão vocal, pronúncia difícil, dialetos regionais | Produção de alto volume, agentes de voz em tempo real, recursos de leitura em voz alta, replicação de voz, geração de voz única para o dia a dia |
| Idiomas aceitos | 130 idiomas | 101 idiomas |
| Substituição recomendada para | Novo nível de criativo principal | gemini-3.1-flash-tts-preview |
Guia de migração
Se você estiver migrando do gemini-3.1-flash-tts-preview ou de modelos anteriores do Gemini TTS, atualize suas solicitações para o esquema do Gemini 3.8 TTS:
- Mova as instruções de nível de turno para
speech_metadata:o Gemini 3.8 TTS trata o texto de entrada estritamente como uma transcrição literal. As orientações de texto inline, como"Say cheerfully: Hello!"ou"Speaker 1: Hello!", podem ser lidas em voz alta. Mova as instruções de entrega contínua (style) e os identificadores de locutor (speaker) para metadados estruturados:- API Interactions:anexe uma anotação com
"type": "speech_metadata","speaker"e"style"a cada bloco de conteúdo de texto. - API GenerateContent:anexe
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API Interactions:anexe uma anotação com
- Use tags inline com colchetes angulares apenas para eventos vocais em um determinado momento:mantenha
vocalizações e pausas momentâneas sem fala inline na transcrição usando
colchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>ou<short pause>). Coloque estilos de fala como sussurros emspeech_metadata.style. - Especifique
speakerem cada vez em solicitações com vários participantes:cada vez em uma solicitação com vários participantes precisa incluir explicitamentespeakeremspeech_metadata, correspondendo a um dos participantes configurados. - Crie personas de design com o Voice Design:substitua os blocos longos de perfil de áudio / observações do diretor por uma voz personalizada criada no Voice Design e transmita esse ID
voice_...nas suas solicitações de TTS com stringsstylemínimas ou vazias. - Considerar a saída WAV padrão (
audio/wav) em solicitações unárias:ao contrário dogemini-3.1-flash-tts-previewe de modelos de TTS anteriores (que retornavam PCM brutoaudio/l16sem cabeçalho por padrão), o Gemini 3.8 TTS retorna áudio WAV (audio/wav/AUDIO_WAV) com um cabeçalho RIFF padrão por padrão para solicitações unárias.- Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo
wavedo Python ouffmpeg), remova o wrapper de cabeçalho manual e grave os bytes retornados diretamente em um arquivo.wav. - Se o pipeline exigir áudio PCM bruto sem cabeçalho, mu-law ou A-law, defina explicitamente
response_formatcomo"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") ou"audio/alaw"("AUDIO_ALAW"). Consulte Formatos de saída de áudio.
- Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo
gemini-3.8-flash-tts
| Propriedade | Descrição |
|---|---|
| Código do modelo | gemini-3.8-flash-tts |
| Tipos de dados aceitos |
Entradas (link em inglês) Texto Saída Áudio |
| Limites de token[*] |
Limite de tokens de entrada 8.192 Limite de token de saída 16.384 |
| Recursos | Compatível Compatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível |
| Opções de consumo |
Compatível Compatível Compatível |
| Versões do |
|
| Última atualização | Julho de 2026 |
Idiomas compatíveis
O gemini-3.8-flash-tts detecta o idioma de entrada automaticamente e é compatível com 130 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Achém (escrita árabe) | Grego | Nepalês (idioma individual) |
| Africâner | Guarani | Fulfulde nigeriano |
| Akan | Gujarati | Azerbaijano do norte |
| Amárico | Crioulo haitiano | Soto do norte |
| Armênio | Halh mongol | Uzbeque do norte |
| Assamês | Hauçá | Bokmål norueguês |
| Awadhi | Hebraico | Norueguês (Nynorsk) |
| Balinês | Hindi | Nianja |
| Bengali | Húngaro | Occitânico |
| Banjar (escrita árabe) | Islandês | Odia (idioma individual) |
| Banjar (alfabeto latino) | Igbo | Língua pangasiana |
| Bashkir | Iloko | Persa (Afeganistão) |
| Basco | Indonésio | Polonês |
| Bielorrusso | Persa iraniano | Português |
| Bemba | Italiano | Punjabi |
| Boiapuri | Japonês | Romeno |
| Bósnio | Javanês | Russo |
| Buguinês | Kabyle | Santali |
| Búlgaro | Kamba | Sérvio |
| Birmanês | Canarês | Sindi |
| Cantonês | Caxemira (escrita árabe) | Cingalês |
| Catalão | Caxemira (escrita deva) | Eslovaco |
| Cebuano | Cazaque | Esloveno |
| Sorâni | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Azerbaijão do Sul |
| Chinês (escrita Hans) | Quiniaruanda | Pashto meridional |
| Chinês (script Hant) | Quicongo | Soto do sul |
| Tártaro da Crimeia | Coreano | Espanhol |
| Croata | Quirguiz | Árabe padrão (escrita árabe) |
| Tcheco | Laosiano | Árabe padrão (alfabeto latino) |
| Dinamarquês | Latgaliano | Letão padrão |
| Holandês | Lingala | Malaio padrão |
| Diúla | Lituano | Suaíli (idioma individual) |
| Dzonga | Luxemburguês | Swati |
| Árabe egípcio | Macedônio | Sueco |
| Inglês | Magahi | Tadjique |
| Estoniano | Maithili | Tâmil |
| Filipino | Malaiala | Télugo |
| Finlandês | Maltês | Tailandês |
| Francês | Manipuri | Tigrínia |
| Galego | Marati | Albanês Tosk |
| Ganda | Minangkabau (escrita árabe) | Uigur |
| Georgiano | Minangkabau (alfabeto latino) | — |
| Alemão | Mizo | — |