Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) es el modelo de texto a voz rápido y rentable de Google, creado para reemplazar a gemini-3.1-flash-tts-preview en cargas de trabajo de producción de alto rendimiento.
Descripción general y capacidades
Gemini 3.8 Flash-Lite TTS combina una baja latencia con una voz expresiva y natural:
- Eficiencia de alto rendimiento: Optimizado para la producción masiva, las cascadas de agentes de voz conversacionales, las funciones de lectura en voz alta y la generación de voz de un solo orador para el uso diario en los principales idiomas.
- Compatibilidad con el esquema de reemplazo: Comparte el mismo esquema de API y formato de instrucciones estructuradas que
gemini-3.8-flash-tts, lo que te permite cambiar de modelo con un solo cambio de parámetro. - Compatibilidad total con el ecosistema de voz: Admite voces prediseñadas, la Biblioteca de voces extendida (
GET /v1beta/voices), arquetipos de diseño de voz personalizados y replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.
Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.
Cuándo usar cada modelo de TTS
Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:
| Función o carga de trabajo | TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) |
TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts) |
|---|---|---|
| Principal fortaleza | Alta capacidad de procesamiento, baja latencia y rentabilidad | Máxima fidelidad de voz, matices de actuación y cobertura de dialectos |
| Mejores casos de uso | Producción de gran volumen, agentes de voz en cascada en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador | Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales |
| Idiomas compatibles | 101 idiomas | 130 idiomas |
| Reemplazo recomendado para | gemini-3.1-flash-tts-preview |
Nuevo nivel de creatividad principal |
Guía de migración
Si actualizas de gemini-3.1-flash-tts-preview a gemini-3.8-flash-lite-tts, actualiza tus solicitudes para el esquema de TTS de Gemini 3.8:
- Mueve las instrucciones a nivel de turno a
speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las instrucciones de texto intercaladas, como"Say cheerfully: Hello!"o"Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a metadatos estructurados:- API de Interactions: Adjunta una anotación con
"type": "speech_metadata","speaker"y"style"a cada bloque de contenido de texto. - API de GenerateContent: Adjunta
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API de Interactions: Adjunta una anotación con
- Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Coloca los estilos de entrega, como susurrar, enspeech_metadata.style. - Especifica
speakeren cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícitaspeakerdentro despeech_metadata, que coincida con uno de los interlocutores configurados. - Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Perfil de audio o Notas del director con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de
voice_...a través de tus solicitudes de TTS con cadenas destylemínimas o vacías. - Ten en cuenta la salida WAV predeterminada (
audio/wav) en las solicitudes unarias: A diferencia degemini-3.1-flash-tts-previewy los modelos de TTS anteriores (que mostraban PCM sin procesar y sin encabezadoaudio/l16de forma predeterminada), Gemini 3.8 TTS muestra audio WAV (audio/wav/AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
waveoffmpegde Python), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo.wav. - Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, configura
response_formatde forma explícita como"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") o"audio/alaw"("AUDIO_ALAW"). Consulta Formatos de salida de audio.
- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
gemini-3.8-flash-lite-tts
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-3.8-flash-lite-tts |
| Tipos de datos admitidos |
Entradas Texto Resultado Audio |
| Límites de tokens[*] |
Límite de tokens de entrada 8,192 Límite de tokens de salida 16,384 |
| Funciones | Admitido Admitido No compatible No compatible No compatible Fundamentación con Google Maps No compatible No compatible No compatible Fundamentación con la Búsqueda No compatible No compatible No compatible No compatible |
| Opciones de consumo |
Admitido Admitido Admitido |
| Versiones |
|
| Última actualización | Julio de 2026 |
Idiomas admitidos
gemini-3.8-flash-lite-tts detecta automáticamente el idioma de entrada y admite 101 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Acehnés (escritura árabe) | Georgiano | Maltés |
| Afrikaans | Alemán | Manipuri |
| Akan | Griego | Maratí |
| Amárico | Gujarati | Minangkabau (escritura árabe) |
| Armenio | Criollo haitiano | Mizo |
| Asamés | Mongol de Halh | Nepalí (idioma individual) |
| Awadhi | Hausa | Fulfulde nigeriano |
| Balinés | Hebreo | Azerí del norte |
| Bengalí | Hindi | Sotho norteño |
| Banjar (alfabeto latino) | Húngaro | Uzbeko del norte |
| Euskara | Islandés | Bokmål |
| Bielorruso | Ilocano | Noruego (Nynorsk) |
| Bhojpuri | Indonesio | Nyanja |
| Bosnio | Persa iraní | Oriya (idioma individual) |
| Buginés | Italiano | Persa (Afganistán) |
| Búlgaro | Japonés | Polaco |
| Cantonés | Javanés | Portugués |
| Catalán | Kamba | Punyabí |
| Cebuano | Canarés | Rumano |
| Kurdo | Cachemir (alfabeto árabe) | Ruso |
| Chatisgarí | Cachemir (alfabeto devanagari) | Santali |
| Chino (escritura Han) | Kazajo | Serbio |
| Chino (secuencia de comandos Hant) | Jemer | Cingalés |
| Croata | Kikuyu | Eslovaco |
| Checo | Kiñarwanda | Azerí del sur |
| Danés | Congo | Pastún meridional |
| Holandés | Coreano | Español |
| Árabe egipcio | Kirguís | Árabe estándar (alfabeto árabe) |
| Inglés | Laosiano | Árabe estándar (alfabeto latino) |
| Estonio | Lingala | Letón estándar |
| Filipino | Macedonio | Malayo estándar |
| Francés | Magahi | Tamil |
| Gallego | Maithili | Telugu |
| luganda | Malayalam | — |