Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) es el modelo de texto a voz rápido y rentable de Google, creado para reemplazar a gemini-3.1-flash-tts-preview en cargas de trabajo de producción de alto rendimiento.
Descripción general y capacidades
Gemini 3.8 Flash-Lite TTS combina una latencia baja con una voz expresiva y natural:
- Eficiencia de alto rendimiento: Optimizado para la producción masiva, las cascadas de agentes de voz conversacionales, las funciones de lectura en voz alta y la generación de voz de un solo orador en los principales idiomas.
- Compatibilidad con el esquema de reemplazo: Comparte el mismo esquema de API y formato de instrucciones estructuradas que
gemini-3.8-flash-tts, lo que te permite cambiar de modelo con un solo cambio de parámetro. - Compatibilidad total con el ecosistema de voz: Admite voces prediseñadas, la Biblioteca de voces extendida (
GET /v1beta/voices), arquetipos de diseño de voz personalizados y replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.
Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.
Cuándo usar cada modelo de TTS
Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:
| Función o carga de trabajo | TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) |
TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts) |
|---|---|---|
| Principal fortaleza | Alta capacidad de procesamiento, baja latencia y rentabilidad | Máxima fidelidad de voz, matices de actuación y cobertura de dialectos |
| Mejores casos de uso | Producción de gran volumen, cascadas de agentes de voz en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador | Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales |
| Idiomas compatibles | 101 idiomas | 130 idiomas |
| Reemplazo recomendado para | gemini-3.1-flash-tts-preview |
Nuevo nivel de creatividad principal |
Guía de migración
Si actualizas de gemini-3.1-flash-tts-preview a gemini-3.8-flash-lite-tts, actualiza tus solicitudes para el esquema de Gemini 3.8 TTS:
- Mueve las indicaciones a nivel de giros hacia
speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las indicaciones de texto intercaladas, como"Say cheerfully: Hello!"o"Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a los metadatos estructurados:- API de Interactions: Adjunta una anotación con
"type": "speech_metadata","speaker"y"style"a cada bloque de contenido de texto. - API de GenerateContent: Adjunta
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API de Interactions: Adjunta una anotación con
- Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Coloca los estilos de entrega, como susurrar, enspeech_metadata.style. - Especifica
speakeren cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícitaspeakerdentro despeech_metadata, que coincida con uno de los interlocutores configurados. - Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Audio Profile o Director's Notes con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de
voice_...a través de tus solicitudes de TTS con cadenas destylemínimas o vacías. - Ten en cuenta la salida WAV predeterminada (
audio/wav) en las solicitudes unarias: A diferencia degemini-3.1-flash-tts-previewy los modelos de TTS anteriores (que mostraban PCM sin procesar y sin encabezadoaudio/l16de forma predeterminada), Gemini 3.8 TTS muestra audio WAV (audio/wav/AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
wavede Python offmpeg), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo.wav. - Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, establece
response_format.mime_typede forma explícita en"audio/l16","audio/mulaw"o"audio/alaw"(por ejemplo,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}en la API de Interactions, oAUDIO_L16,AUDIO_MULAWoAUDIO_ALAWengenerateContent). Consulta Formatos de salida de audio.
- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
gemini-3.8-flash-lite-tts
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-3.8-flash-lite-tts |
| Tipos de datos admitidos |
Entradas Texto Resultado Audio |
| Límites de tokens[*] |
Límite de tokens de entrada 8,192 Límite de tokens de salida 16,384 (límite de servicio de la API de Gemini) |
| Funciones | Admitido No compatible No compatible No compatible No compatible Fundamentación con Google Maps No compatible No compatible No compatible Fundamentación con la Búsqueda No compatible No compatible No compatible No compatible |
| Opciones de consumo |
Admitido Admitido Admitido |
| Versiones |
|
| Última actualización | Septiembre de 2026 |
Idiomas admitidos
gemini-3.8-flash-lite-tts detecta automáticamente el idioma de entrada y admite más de 100 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Acehnés (alfabeto árabe) | Alemán | Manipuri |
| Afrikaans | Griego | Maratí |
| Akan | Gujarati | Minangkabau (escritura árabe) |
| Amárico | Criollo haitiano | Mizo |
| Armenio | Mongol de Halh | Nepalí (idioma individual) |
| Asamés | Hausa | Fulfulde nigeriano |
| Awadhi | Hebreo | Azerí del norte |
| Balinés | Hindi | Sotho norteño |
| Bengalí | Húngaro | Uzbeko del norte |
| Banjar (alfabeto latino) | Islandés | Bokmål |
| Euskara | Ilocano | Noruego (Nynorsk) |
| Bielorruso | Indonesio | Nyanja |
| Bhojpuri | Persa iraní | Odia (idioma individual) |
| Bosnio | Italiano | Persa (Afganistán) |
| Buginés | Japonés | Polaco |
| Búlgaro | Javanés | Portugués |
| Cantonés | Kamba | Punyabí |
| Catalán | Canarés | Rumano |
| Cebuano | Cachemir (alfabeto árabe) | Ruso |
| Kurdo | Cachemir (alfabeto Deva) | Santali |
| Chatisgarí | Kazajo | Serbio |
| Chino (secuencia de comandos Hans) | Jemer | Cingalés |
| Chino (secuencia de comandos Hant) | Kikuyu | Eslovaco |
| Croata | Kiñarwanda | Azerí del sur |
| Checo | Congo | Pastún meridional |
| Danés | Coreano | Español |
| Holandés | Kirguís | Árabe estándar (alfabeto árabe) |
| Árabe egipcio | Laosiano | Árabe estándar (alfabeto latino) |
| Inglés | Lingala | Letón estándar |
| Estonio | Macedonio | Malayo estándar |
| Filipino | Magahi | Tamil |
| Francés | Maithili | Telugu |
| Gallego | Malayalam | Turco |
| luganda | Maltés | Vietnamita |
| Georgiano | — | — |