O Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) é o modelo de conversão de texto em voz rápido e econômico do Google, criado para substituir o gemini-3.1-flash-tts-preview em cargas de trabalho de produção de alta taxa de transferência.
Visão geral e recursos
O Gemini 3.8 Flash-Lite TTS combina baixa latência com fala expressiva e natural:
- Eficiência de alta capacidade:otimizado para produção em massa, cascatas de agentes de voz conversacionais, recursos de leitura em voz alta e geração de fala de um único falante em vários idiomas.
- Compatibilidade de esquema de substituição:compartilha o mesmo esquema de API e formato de comando estruturado que
gemini-3.8-flash-tts, permitindo que você troque de modelo com uma única mudança de parâmetro. - Suporte completo ao ecossistema de voz:compatível com vozes pré-criadas, a Biblioteca de voz estendida (
GET /v1beta/voices), personas de design de voz personalizadas e replicação de voz (vozes armazenadas persistentes por padrão, além de chaves sem estado opcionais). Você também pode criar e replicar vozes de forma interativa no Google AI Studio.
Acesse o guia Text-to-Speech para conferir a cobertura completa de recursos, práticas recomendadas de solicitação e exemplos de código.
Quando usar cada modelo de TTS
Os dois modelos de TTS do Gemini 3.8 compartilham o mesmo esquema de API e estrutura de comandos. Escolha o modelo adequado para sua carga de trabalho:
| Recurso / carga de trabalho | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Ponto forte principal | Alta capacidade de processamento, baixa latência e eficiência de custos | Máxima fidelidade de voz, nuances de atuação e cobertura de dialetos |
| Melhores casos de uso | Produção de alto volume, agentes de voz em tempo real, recursos de leitura em voz alta, replicação de voz, geração de voz única para o dia a dia | Audiolivros, narração em estúdio, diálogos complexos com vários falantes, atuação com forte explosão vocal, pronúncia difícil, dialetos regionais |
| Idiomas aceitos | 101 idiomas | 130 idiomas |
| Substituição recomendada para | gemini-3.1-flash-tts-preview |
Novo nível de criativo principal |
Guia de migração
Se você estiver fazendo upgrade do gemini-3.1-flash-tts-preview para o gemini-3.8-flash-lite-tts, atualize suas solicitações para o esquema de TTS do Gemini 3.8:
- Mova as instruções de nível de turno para
speech_metadata:o Gemini 3.8 TTS trata o texto de entrada estritamente como uma transcrição literal. As orientações de texto inline, como"Say cheerfully: Hello!"ou"Speaker 1: Hello!", podem ser faladas em voz alta. Mova as instruções de entrega contínua (style) e os identificadores de locutor (speaker) para metadados estruturados:- API Interactions:anexe uma anotação com
"type": "speech_metadata","speaker"e"style"a cada bloco de conteúdo de texto. - API GenerateContent:anexe
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API Interactions:anexe uma anotação com
- Use tags inline com colchetes angulares apenas para eventos vocais em um determinado momento:mantenha
vocalizações e pausas momentâneas sem fala inline na transcrição usando
colchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>ou<short pause>). Coloque estilos de fala como sussurros emspeech_metadata.style. - Especifique
speakerem cada vez em solicitações com vários participantes:cada vez em uma solicitação com vários participantes precisa incluir explicitamentespeakeremspeech_metadata, correspondendo a um dos participantes configurados. - Crie personas antecipadamente com o Voice Design:substitua os blocos longos de perfil de áudio / observações do diretor por uma voz personalizada criada no Voice Design e transmita esse ID
voice_...nas suas solicitações de TTS com stringsstylemínimas ou vazias. - Considerar a saída WAV padrão (
audio/wav) em solicitações unárias:ao contrário dogemini-3.1-flash-tts-previewe de modelos de TTS anteriores (que retornavam PCM brutoaudio/l16sem cabeçalho por padrão), o Gemini 3.8 TTS retorna áudio WAV (audio/wav/AUDIO_WAV) com um cabeçalho RIFF padrão por padrão para solicitações unárias.- Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo
wavedo Python ouffmpeg), remova o wrapper de cabeçalho manual e grave os bytes retornados diretamente em um arquivo.wav. - Se o pipeline exigir áudio PCM bruto sem cabeçalho, mu-law ou A-law, defina explicitamente
response_formatcomo"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") ou"audio/alaw"("AUDIO_ALAW"). Consulte Formatos de saída de áudio.
- Se o código anteriormente encapsulava bytes PCM brutos em um cabeçalho WAV (por exemplo, usando o módulo
gemini-3.8-flash-lite-tts
| Propriedade | Descrição |
|---|---|
| Código do modelo | gemini-3.8-flash-lite-tts |
| Tipos de dados aceitos |
Entradas (link em inglês) Texto Saída Áudio |
| Limites de token[*] |
Limite de tokens de entrada 8.192 Limite de token de saída 16.384 |
| Recursos | Compatível Compatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível incompatível |
| Opções de consumo |
Compatível Compatível Compatível |
| Versões do |
|
| Última atualização | Julho de 2026 |
Idiomas compatíveis
O gemini-3.8-flash-lite-tts detecta o idioma de entrada automaticamente e oferece suporte a 101 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Achém (escrita árabe) | Georgiano | Maltês |
| Africâner | Alemão | Manipuri |
| Akan | Grego | Marati |
| Amárico | Gujarati | Minangkabau (escrita árabe) |
| Armênio | Crioulo haitiano | Mizo |
| Assamês | Halh mongol | Nepalês (idioma individual) |
| Awadhi | Hauçá | Fulfulde nigeriano |
| Balinês | Hebraico | Azerbaijano do norte |
| Bengali | Hindi | Soto do norte |
| Banjar (alfabeto latino) | Húngaro | Uzbeque do norte |
| Basco | Islandês | Bokmål norueguês |
| Bielorrusso | Iloko | Norueguês (Nynorsk) |
| Boiapuri | Indonésio | Nianja |
| Bósnio | Persa iraniano | Odia (idioma individual) |
| Buguinês | Italiano | Persa (Afeganistão) |
| Búlgaro | Japonês | Polonês |
| Cantonês | Javanês | Português |
| Catalão | Kamba | Punjabi |
| Cebuano | Canarês | Romeno |
| Sorâni | Caxemira (escrita árabe) | Russo |
| Chhattisgarhi | Caxemira (escrita deva) | Santali |
| Chinês (escrita Hans) | Cazaque | Sérvio |
| Chinês (script Hant) | Khmer | Cingalês |
| Croata | Kikuyu | Eslovaco |
| Tcheco | Quiniaruanda | Azerbaijão do Sul |
| Dinamarquês | Quicongo | Pashto meridional |
| Holandês | Coreano | Espanhol |
| Árabe egípcio | Quirguiz | Árabe padrão (escrita árabe) |
| Inglês | Laosiano | Árabe padrão (alfabeto latino) |
| Estoniano | Lingala | Letão padrão |
| Filipino | Macedônio | Malaio padrão |
| Francês | Magahi | Tâmil |
| Galego | Maithili | Télugo |
| Ganda | Malaiala | — |