Gemini 3.8 Flash-Lite TTS

O Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) é o modelo de conversão de texto em voz rápido e econômico do Google, criado para substituir o gemini-3.1-flash-tts-preview em cargas de trabalho de produção de alta taxa de transferência.

Visão geral e recursos

O Gemini 3.8 Flash-Lite TTS combina baixa latência com fala expressiva e natural:

  • Eficiência de alta capacidade:otimizado para produção em massa, cascatas de agentes de voz conversacionais, recursos de leitura em voz alta e geração de fala de um único falante em vários idiomas.
  • Compatibilidade de esquema de substituição:compartilha o mesmo esquema de API e formato de comando estruturado que gemini-3.8-flash-tts, permitindo que você troque de modelo com uma única mudança de parâmetro.
  • Suporte completo ao ecossistema de voz:compatível com vozes pré-criadas, a Biblioteca de voz estendida (GET /v1beta/voices), personas de design de voz personalizadas e replicação de voz (vozes armazenadas persistentes por padrão, além de chaves sem estado opcionais). Você também pode criar e replicar vozes de forma interativa no Google AI Studio.

Acesse o guia Text-to-Speech para conferir a cobertura completa de recursos, práticas recomendadas de solicitação e exemplos de código.

Quando usar cada modelo de TTS

Os dois modelos de TTS do Gemini 3.8 compartilham o mesmo esquema de API e estrutura de comandos. Escolha o modelo adequado para sua carga de trabalho:

Recurso / carga de trabalho Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Ponto forte principal Alta capacidade de processamento, baixa latência e eficiência de custos Máxima fidelidade de voz, nuances de atuação e cobertura de dialetos
Melhores casos de uso Produção de alto volume, agentes de voz em tempo real, recursos de leitura em voz alta, replicação de voz, geração de voz única para o dia a dia Audiolivros, narração em estúdio, diálogos complexos com vários falantes, atuação com forte explosão vocal, pronúncia difícil, dialetos regionais
Idiomas aceitos 101 idiomas 130 idiomas
Substituição recomendada para gemini-3.1-flash-tts-preview Novo nível de criativo principal

Guia de migração

Se você estiver fazendo upgrade do gemini-3.1-flash-tts-preview para o gemini-3.8-flash-lite-tts, atualize suas solicitações para o esquema de TTS do Gemini 3.8:

  1. Mova as instruções de nível de turno para speech_metadata:o Gemini 3.8 TTS trata o texto de entrada estritamente como uma transcrição literal. As orientações de texto inline, como "Say cheerfully: Hello!" ou "Speaker 1: Hello!", podem ser faladas em voz alta. Mova as instruções de entrega contínua (style) e os identificadores de locutor (speaker) para metadados estruturados:
    • API Interactions:anexe uma anotação com "type": "speech_metadata", "speaker" e "style" a cada bloco de conteúdo de texto.
    • API GenerateContent:anexe "speech_metadata": {"speaker": "...", "style": "..."} a cada part.
  2. Use tags inline com colchetes angulares apenas para eventos vocais em um determinado momento:mantenha vocalizações e pausas momentâneas sem fala inline na transcrição usando colchetes angulares (como <laugh>, <sigh>, <cough>, <breath> ou <short pause>). Coloque estilos de fala como sussurros em speech_metadata.style.
  3. Especifique speaker em cada vez em solicitações com vários participantes:cada vez em uma solicitação com vários participantes precisa incluir explicitamente speaker em speech_metadata, correspondendo a um dos participantes configurados.
  4. Crie personas antecipadamente com o Voice Design:substitua os blocos longos de perfil de áudio / observações do diretor por uma voz personalizada criada no Voice Design e transmita esse ID voice_... nas suas solicitações de TTS com strings style mínimas ou vazias.
  5. Considerar a saída WAV padrão (audio/wav) em solicitações unárias:ao contrário do gemini-3.1-flash-tts-preview e de modelos de TTS anteriores (que retornavam PCM bruto audio/l16 sem cabeçalho por padrão), o Gemini 3.8 TTS retorna áudio WAV (audio/wav / AUDIO_WAV) com um cabeçalho RIFF padrão por padrão para solicitações unárias.
    • Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo wave do Python ou ffmpeg), remova o wrapper de cabeçalho manual e grave os bytes retornados diretamente em um arquivo .wav.
    • Se o pipeline exigir áudio PCM bruto sem cabeçalho, mu-law ou A-law, defina explicitamente response_format como "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") ou "audio/alaw" ("AUDIO_ALAW"). Consulte Formatos de saída de áudio.

gemini-3.8-flash-lite-tts

Propriedade Descrição
Código do modelo gemini-3.8-flash-lite-tts
Tipos de dados aceitos

Entradas (link em inglês)

Texto

Saída

Áudio

Limites de token[*]

Limite de tokens de entrada

8.192

Limite de token de saída

16.384

Recursos

Geração de áudio

Compatível

Armazenamento em cache

Compatível

Execução de código

incompatível

Pesquisa de arquivos

incompatível

Chamada de função

incompatível

Embasamento com o Google Maps

incompatível

Geração de imagens

incompatível

API Live

incompatível

Embasamento da pesquisa

incompatível

Respostas estruturadas

incompatível

Raciocínio

incompatível

Contexto do URL

incompatível

Opções de consumo

API em lote

Compatível

Inferência flexível

Compatível

Inferência de prioridade

Compatível

Versões do
Leia os padrões de versão do modelo para mais detalhes.
  • gemini-3.8-flash-lite-tts
Última atualização Julho de 2026

Idiomas compatíveis

O gemini-3.8-flash-lite-tts detecta o idioma de entrada automaticamente e oferece suporte a 101 idiomas:

Idioma Idioma Idioma
Achém (escrita árabe) Georgiano Maltês
Africâner Alemão Manipuri
Akan Grego Marati
Amárico Gujarati Minangkabau (escrita árabe)
Armênio Crioulo haitiano Mizo
Assamês Halh mongol Nepalês (idioma individual)
Awadhi Hauçá Fulfulde nigeriano
Balinês Hebraico Azerbaijano do norte
Bengali Hindi Soto do norte
Banjar (alfabeto latino) Húngaro Uzbeque do norte
Basco Islandês Bokmål norueguês
Bielorrusso Iloko Norueguês (Nynorsk)
Boiapuri Indonésio Nianja
Bósnio Persa iraniano Odia (idioma individual)
Buguinês Italiano Persa (Afeganistão)
Búlgaro Japonês Polonês
Cantonês Javanês Português
Catalão Kamba Punjabi
Cebuano Canarês Romeno
Sorâni Caxemira (escrita árabe) Russo
Chhattisgarhi Caxemira (escrita deva) Santali
Chinês (escrita Hans) Cazaque Sérvio
Chinês (script Hant) Khmer Cingalês
Croata Kikuyu Eslovaco
Tcheco Quiniaruanda Azerbaijão do Sul
Dinamarquês Quicongo Pashto meridional
Holandês Coreano Espanhol
Árabe egípcio Quirguiz Árabe padrão (escrita árabe)
Inglês Laosiano Árabe padrão (alfabeto latino)
Estoniano Lingala Letão padrão
Filipino Macedônio Malaio padrão
Francês Magahi Tâmil
Galego Maithili Télugo
Ganda Malaiala