Gemini 3.8 Flash TTS

O Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) é o principal modelo criativo de conversão de texto em voz do Google, criado para fidelidade de voz com qualidade de estúdio, atuação expressiva, sotaques regionais autênticos e estabilidade de longo prazo multiturno.

Visão geral e recursos

O Gemini 3.8 Flash TTS estabelece um novo padrão para a geração de áudio expressivo:

  • Alta fidelidade acústica e nuances de atuação:oferece uma rica variedade emocional, cadência natural e adesão precisa às instruções de style por turno e eventos vocais inline (<laugh>, <sigh>, <short pause>).
  • Estabilidade multiturno de formato longo: mantém a identidade da voz, o timbre, o volume e o tom acústico da sala consistentes em diálogos longos e narrações de vários minutos sem desvio de voz.
  • Pronúncia e sotaques regionais autênticos:compatível com sotaques regionais, dialetos minoritários e substituições inline do Alfabeto Fonético Internacional (IPA).
  • Suporte completo ao ecossistema de voz:funciona perfeitamente com vozes pré-criadas, a biblioteca de vozes estendida (GET /v1beta/voices), personas de design de voz personalizadas e replicação de voz (vozes armazenadas persistentes por padrão, além de chaves sem estado opcionais). Você também pode criar e replicar vozes de forma interativa no Google AI Studio.

Acesse o guia Text-to-Speech para conferir a cobertura completa de recursos, práticas recomendadas de solicitação e exemplos de código.

Quando usar cada modelo de TTS

Os dois modelos de TTS do Gemini 3.8 compartilham o mesmo esquema de API e estrutura de comandos. Escolha o modelo adequado para sua carga de trabalho:

Recurso / carga de trabalho Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Ponto forte principal Máxima fidelidade de voz, nuances de atuação e cobertura de dialetos Alta capacidade de processamento, baixa latência e eficiência de custos
Melhores casos de uso Audiolivros, narração em estúdio, diálogos complexos com vários falantes, atuação com forte explosão vocal, pronúncia difícil, dialetos regionais Produção de alto volume, agentes de voz em tempo real, recursos de leitura em voz alta, replicação de voz, geração de voz única para o dia a dia
Idiomas aceitos 130 idiomas 101 idiomas
Substituição recomendada para Novo nível de criativo principal gemini-3.1-flash-tts-preview

Guia de migração

Se você estiver migrando do gemini-3.1-flash-tts-preview ou de modelos anteriores do Gemini TTS, atualize suas solicitações para o esquema do Gemini 3.8 TTS:

  1. Mova as instruções de nível de turno para speech_metadata:o Gemini 3.8 TTS trata o texto de entrada estritamente como uma transcrição literal. As orientações de texto inline, como "Say cheerfully: Hello!" ou "Speaker 1: Hello!", podem ser lidas em voz alta. Mova as instruções de entrega contínua (style) e os identificadores de locutor (speaker) para metadados estruturados:
    • API Interactions:anexe uma anotação com "type": "speech_metadata", "speaker" e "style" a cada bloco de conteúdo de texto.
    • API GenerateContent:anexe "speech_metadata": {"speaker": "...", "style": "..."} a cada part.
  2. Use tags inline com colchetes angulares apenas para eventos vocais em um determinado momento:mantenha vocalizações e pausas momentâneas sem fala inline na transcrição usando colchetes angulares (como <laugh>, <sigh>, <cough>, <breath> ou <short pause>). Coloque estilos de fala como sussurros em speech_metadata.style.
  3. Especifique speaker em cada vez em solicitações com vários participantes:cada vez em uma solicitação com vários participantes precisa incluir explicitamente speaker em speech_metadata, correspondendo a um dos participantes configurados.
  4. Crie personas de design com o Voice Design:substitua os blocos longos de perfil de áudio / observações do diretor por uma voz personalizada criada no Voice Design e transmita esse ID voice_... nas suas solicitações de TTS com strings style mínimas ou vazias.
  5. Considerar a saída WAV padrão (audio/wav) em solicitações unárias:ao contrário do gemini-3.1-flash-tts-preview e de modelos de TTS anteriores (que retornavam PCM bruto audio/l16 sem cabeçalho por padrão), o Gemini 3.8 TTS retorna áudio WAV (audio/wav / AUDIO_WAV) com um cabeçalho RIFF padrão por padrão para solicitações unárias.
    • Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo wave do Python ou ffmpeg), remova o wrapper de cabeçalho manual e grave os bytes retornados diretamente em um arquivo .wav.
    • Se o pipeline exigir áudio PCM bruto sem cabeçalho, mu-law ou A-law, defina explicitamente response_format como "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") ou "audio/alaw" ("AUDIO_ALAW"). Consulte Formatos de saída de áudio.

gemini-3.8-flash-tts

Propriedade Descrição
Código do modelo gemini-3.8-flash-tts
Tipos de dados aceitos

Entradas (link em inglês)

Texto

Saída

Áudio

Limites de token[*]

Limite de tokens de entrada

8.192

Limite de token de saída

16.384

Recursos

Geração de áudio

Compatível

Armazenamento em cache

Compatível

Execução de código

incompatível

Pesquisa de arquivos

incompatível

Chamada de função

incompatível

Embasamento com o Google Maps

incompatível

Geração de imagens

incompatível

API Live

incompatível

Embasamento da pesquisa

incompatível

Respostas estruturadas

incompatível

Raciocínio

incompatível

Contexto do URL

incompatível

Opções de consumo

API em lote

Compatível

Inferência flexível

Compatível

Inferência de prioridade

Compatível

Versões do
Leia os padrões de versão do modelo para mais detalhes.
  • gemini-3.8-flash-tts
Última atualização Julho de 2026

Idiomas compatíveis

O gemini-3.8-flash-tts detecta o idioma de entrada automaticamente e é compatível com 130 idiomas:

Idioma Idioma Idioma
Achém (escrita árabe) Grego Nepalês (idioma individual)
Africâner Guarani Fulfulde nigeriano
Akan Gujarati Azerbaijano do norte
Amárico Crioulo haitiano Soto do norte
Armênio Halh mongol Uzbeque do norte
Assamês Hauçá Bokmål norueguês
Awadhi Hebraico Norueguês (Nynorsk)
Balinês Hindi Nianja
Bengali Húngaro Occitânico
Banjar (escrita árabe) Islandês Odia (idioma individual)
Banjar (alfabeto latino) Igbo Língua pangasiana
Bashkir Iloko Persa (Afeganistão)
Basco Indonésio Polonês
Bielorrusso Persa iraniano Português
Bemba Italiano Punjabi
Boiapuri Japonês Romeno
Bósnio Javanês Russo
Buguinês Kabyle Santali
Búlgaro Kamba Sérvio
Birmanês Canarês Sindi
Cantonês Caxemira (escrita árabe) Cingalês
Catalão Caxemira (escrita deva) Eslovaco
Cebuano Cazaque Esloveno
Sorâni Khmer Somali
Chhattisgarhi Kikuyu Azerbaijão do Sul
Chinês (escrita Hans) Quiniaruanda Pashto meridional
Chinês (script Hant) Quicongo Soto do sul
Tártaro da Crimeia Coreano Espanhol
Croata Quirguiz Árabe padrão (escrita árabe)
Tcheco Laosiano Árabe padrão (alfabeto latino)
Dinamarquês Latgaliano Letão padrão
Holandês Lingala Malaio padrão
Diúla Lituano Suaíli (idioma individual)
Dzonga Luxemburguês Swati
Árabe egípcio Macedônio Sueco
Inglês Magahi Tadjique
Estoniano Maithili Tâmil
Filipino Malaiala Télugo
Finlandês Maltês Tailandês
Francês Manipuri Tigrínia
Galego Marati Albanês Tosk
Ganda Minangkabau (escrita árabe) Uigur
Georgiano Minangkabau (alfabeto latino)
Alemão Mizo