Gemini 3.8 Flash-Lite TTS

O Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) é o modelo de conversão de texto em voz rápido e econômico do Google, criado para substituir o gemini-3.1-flash-tts-preview em cargas de trabalho de produção de alta taxa de transferência.

Visão geral e recursos

O Gemini 3.8 Flash-Lite TTS combina baixa latência com fala expressiva e natural:

  • Eficiência de alta capacidade:otimizado para produção em massa, cascatas de agentes de voz conversacionais, recursos de leitura em voz alta e geração de fala de um único falante em vários idiomas.
  • Compatibilidade de esquema de substituição:compartilha o mesmo esquema de API e formato de comando estruturado que gemini-3.8-flash-tts, permitindo que você troque de modelo com uma única mudança de parâmetro.
  • Suporte completo ao ecossistema de voz:compatível com vozes pré-criadas, a Biblioteca de voz estendida (GET /v1beta/voices), personas de design de voz personalizadas e replicação de voz (vozes armazenadas persistentes por padrão, além de chaves sem estado opcionais). Você também pode criar e replicar vozes de forma interativa no Google AI Studio.

Acesse o guia Text-to-Speech para conferir a cobertura completa de recursos, práticas recomendadas de solicitação e exemplos de código.

Quando usar cada modelo de TTS

Os dois modelos de TTS do Gemini 3.8 compartilham o mesmo esquema de API e estrutura de comandos. Escolha o modelo adequado para sua carga de trabalho:

Recurso / carga de trabalho Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Ponto forte principal Alta capacidade de processamento, baixa latência e eficiência de custos Máxima fidelidade de voz, nuances de atuação e cobertura de dialetos
Melhores casos de uso Produção de alto volume, agentes de voz em tempo real, recursos de leitura em voz alta, replicação de voz, geração de voz única para o dia a dia Audiolivros, narração em estúdio, diálogos complexos com vários falantes, atuação com forte explosão vocal, pronúncia difícil, dialetos regionais
Idiomas aceitos 101 idiomas 130 idiomas
Substituição recomendada para gemini-3.1-flash-tts-preview Novo nível de criativo principal

Guia de migração

Se você estiver fazendo upgrade do gemini-3.1-flash-tts-preview para o gemini-3.8-flash-lite-tts, atualize suas solicitações para o esquema de TTS do Gemini 3.8:

  1. Mova as instruções de nível de turno para speech_metadata:o Gemini 3.8 TTS trata o texto de entrada estritamente como uma transcrição literal. As orientações de texto inline, como "Say cheerfully: Hello!" ou "Speaker 1: Hello!", podem ser lidas em voz alta. Mova as instruções de entrega contínua (style) e os identificadores de locutor (speaker) para metadados estruturados:
    • API Interactions:anexe uma anotação com "type": "speech_metadata", "speaker" e "style" a cada bloco de conteúdo de texto.
    • API GenerateContent:anexe "speech_metadata": {"speaker": "...", "style": "..."} a cada part.
  2. Use tags inline com colchetes angulares apenas para eventos vocais em um determinado momento:mantenha vocalizações e pausas momentâneas sem fala inline na transcrição usando colchetes angulares (como <laugh>, <sigh>, <cough>, <breath> ou <short pause>). Coloque estilos de fala como sussurros em speech_metadata.style.
  3. Especifique speaker em cada vez em solicitações com vários participantes:cada vez em uma solicitação com vários participantes precisa incluir explicitamente speaker em speech_metadata, correspondendo a um dos participantes configurados.
  4. Crie personas de design com o Voice Design:substitua os blocos longos de perfil de áudio / observações do diretor por uma voz personalizada criada no Voice Design e transmita esse ID voice_... nas suas solicitações de TTS com strings style mínimas ou vazias.
  5. Considerar a saída WAV padrão (audio/wav) em solicitações unárias:ao contrário do gemini-3.1-flash-tts-preview e de modelos de TTS anteriores (que retornavam PCM bruto audio/l16 sem cabeçalho por padrão), o Gemini 3.8 TTS retorna áudio WAV (audio/wav / AUDIO_WAV) com um cabeçalho RIFF padrão por padrão para solicitações unárias.
    • Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo wave do Python ou ffmpeg), remova o wrapper de cabeçalho manual e grave os bytes retornados diretamente em um arquivo .wav.
    • Se o pipeline exigir áudio PCM bruto sem cabeçalho, mu-law ou A-law, defina explicitamente response_format como "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") ou "audio/alaw" ("AUDIO_ALAW"). Consulte Formatos de saída de áudio.

gemini-3.8-flash-lite-tts

Propriedade Descrição
Código do modelo gemini-3.8-flash-lite-tts
Tipos de dados aceitos

Entradas (link em inglês)

Texto

Saída

Áudio

Limites de tokens [*]

Limite de tokens de entrada

8.192

Limite de token de saída

16.384 (limite de veiculação da API Gemini)

Recursos

Geração de áudio

Compatível

Armazenamento em cache

Compatível

Execução de código

incompatível

Pesquisa de arquivos

incompatível

Chamada de função

incompatível

Embasamento com o Google Maps

incompatível

Geração de imagens

incompatível

API Live

incompatível

Embasamento da pesquisa

incompatível

Respostas estruturadas

incompatível

Raciocínio

incompatível

Contexto do URL

incompatível

Opções de consumo

API em lote

Compatível

Inferência flexível

Compatível

Inferência de prioridade

Compatível

Versões do
Leia os padrões de versão do modelo para mais detalhes.
  • gemini-3.8-flash-lite-tts
Última atualização Setembro de 2026

Idiomas compatíveis

O gemini-3.8-flash-lite-tts detecta o idioma de entrada automaticamente e é compatível com mais de 100 idiomas:

Idioma Idioma Idioma
Achém (escrita árabe) Alemão Manipuri
Africâner Grego Marati
Akan Gujarati Minangkabau (escrita árabe)
Amárico Crioulo haitiano Mizo
Armênio Halh mongol Nepalês (idioma individual)
Assamês Hauçá Fulfulde nigeriano
Awadhi Hebraico Azerbaijano do norte
Balinês Hindi Soto do norte
Bengali Húngaro Uzbeque do norte
Banjar (alfabeto latino) Islandês Bokmål norueguês
Basco Iloko Norueguês (Nynorsk)
Bielorrusso Indonésio Nianja
Boiapuri Persa iraniano Odia (idioma individual)
Bósnio Italiano Persa (Afeganistão)
Buguinês Japonês Polonês
Búlgaro Javanês Português
Cantonês Kamba Punjabi
Catalão Canarês Romeno
Cebuano Caxemira (escrita árabe) Russo
Sorâni Caxemira (escrita deva) Santali
Chhattisgarhi Cazaque Sérvio
Chinês (escrita Hans) Khmer Cingalês
Chinês (script Hant) Kikuyu Eslovaco
Croata Quiniaruanda Azerbaijão do Sul
Tcheco Quicongo Pashto meridional
Dinamarquês Coreano Espanhol
Holandês Quirguiz Árabe padrão (escrita árabe)
Árabe egípcio Laosiano Árabe padrão (alfabeto latino)
Inglês Lingala Letão padrão
Estoniano Macedônio Malaio padrão
Filipino Magahi Tâmil
Francês Maithili Télugo
Galego Malaiala Turco
Ganda Maltês Vietnamita
Georgiano — —