TTS de Gemini 3.8 Flash-Lite

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) es el modelo de texto a voz rápido y rentable de Google, creado para reemplazar a gemini-3.1-flash-tts-preview en cargas de trabajo de producción de alto rendimiento.

Descripción general y capacidades

Gemini 3.8 Flash-Lite TTS combina una baja latencia con una voz expresiva y natural:

  • Eficiencia de alto rendimiento: Optimizado para la producción masiva, las cascadas de agentes de voz conversacionales, las funciones de lectura en voz alta y la generación de voz de un solo orador para el uso diario en los principales idiomas.
  • Compatibilidad con el esquema de reemplazo: Comparte el mismo esquema de API y formato de instrucciones estructuradas que gemini-3.8-flash-tts, lo que te permite cambiar de modelo con un solo cambio de parámetro.
  • Compatibilidad total con el ecosistema de voz: Admite voces prediseñadas, la Biblioteca de voces extendida (GET /v1beta/voices), arquetipos de diseño de voz personalizados y replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.

Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.

Cuándo usar cada modelo de TTS

Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:

Función o carga de trabajo TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts)
Principal fortaleza Alta capacidad de procesamiento, baja latencia y rentabilidad Máxima fidelidad de voz, matices de actuación y cobertura de dialectos
Mejores casos de uso Producción de gran volumen, agentes de voz en cascada en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales
Idiomas compatibles 101 idiomas 130 idiomas
Reemplazo recomendado para gemini-3.1-flash-tts-preview Nuevo nivel de creatividad principal

Guía de migración

Si actualizas de gemini-3.1-flash-tts-preview a gemini-3.8-flash-lite-tts, actualiza tus solicitudes para el esquema de TTS de Gemini 3.8:

  1. Mueve las instrucciones a nivel de turno a speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las instrucciones de texto intercaladas, como "Say cheerfully: Hello!" o "Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a metadatos estructurados:
    • API de Interactions: Adjunta una anotación con "type": "speech_metadata", "speaker" y "style" a cada bloque de contenido de texto.
    • API de GenerateContent: Adjunta "speech_metadata": {"speaker": "...", "style": "..."} a cada part.
  2. Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como <laugh>, <sigh>, <cough>, <breath> o <short pause>). Coloca los estilos de entrega, como susurrar, en speech_metadata.style.
  3. Especifica speaker en cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícita speaker dentro de speech_metadata, que coincida con uno de los interlocutores configurados.
  4. Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Perfil de audio o Notas del director con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de voice_... a través de tus solicitudes de TTS con cadenas de style mínimas o vacías.
  5. Ten en cuenta la salida WAV predeterminada (audio/wav) en las solicitudes unarias: A diferencia de gemini-3.1-flash-tts-preview y los modelos de TTS anteriores (que mostraban PCM sin procesar y sin encabezado audio/l16 de forma predeterminada), Gemini 3.8 TTS muestra audio WAV (audio/wav / AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.
    • Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo wave o ffmpeg de Python), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo .wav.
    • Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, configura response_format de forma explícita como "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") o "audio/alaw" ("AUDIO_ALAW"). Consulta Formatos de salida de audio.

gemini-3.8-flash-lite-tts

Propiedad Descripción
Código del modelo gemini-3.8-flash-lite-tts
Tipos de datos admitidos

Entradas

Texto

Resultado

Audio

Límites de tokens[*]

Límite de tokens de entrada

8,192

Límite de tokens de salida

16,384

Funciones

Generación de audio

Admitido

Almacenamiento en caché

Admitido

Ejecución de código

No compatible

Búsqueda de archivos

No compatible

Llamada a función

No compatible

Fundamentación con Google Maps

No compatible

Generación de imágenes

No compatible

API de Live

No compatible

Fundamentación con la Búsqueda

No compatible

Resultados estructurados

No compatible

Pensamiento

No compatible

Contexto de la URL

No compatible

Opciones de consumo

API de Batch

Admitido

Inferencia Flex

Admitido

Inferencia de prioridad

Admitido

Versiones
Lee los patrones de versiones del modelo para obtener más detalles.
  • gemini-3.8-flash-lite-tts
Última actualización Julio de 2026

Idiomas admitidos

gemini-3.8-flash-lite-tts detecta automáticamente el idioma de entrada y admite 101 idiomas:

Idioma Idioma Idioma
Acehnés (escritura árabe) Georgiano Maltés
Afrikaans Alemán Manipuri
Akan Griego Maratí
Amárico Gujarati Minangkabau (escritura árabe)
Armenio Criollo haitiano Mizo
Asamés Mongol de Halh Nepalí (idioma individual)
Awadhi Hausa Fulfulde nigeriano
Balinés Hebreo Azerí del norte
Bengalí Hindi Sotho norteño
Banjar (alfabeto latino) Húngaro Uzbeko del norte
Euskara Islandés Bokmål
Bielorruso Ilocano Noruego (Nynorsk)
Bhojpuri Indonesio Nyanja
Bosnio Persa iraní Oriya (idioma individual)
Buginés Italiano Persa (Afganistán)
Búlgaro Japonés Polaco
Cantonés Javanés Portugués
Catalán Kamba Punyabí
Cebuano Canarés Rumano
Kurdo Cachemir (alfabeto árabe) Ruso
Chatisgarí Cachemir (alfabeto devanagari) Santali
Chino (escritura Han) Kazajo Serbio
Chino (secuencia de comandos Hant) Jemer Cingalés
Croata Kikuyu Eslovaco
Checo Kiñarwanda Azerí del sur
Danés Congo Pastún meridional
Holandés Coreano Español
Árabe egipcio Kirguís Árabe estándar (alfabeto árabe)
Inglés Laosiano Árabe estándar (alfabeto latino)
Estonio Lingala Letón estándar
Filipino Macedonio Malayo estándar
Francés Magahi Tamil
Gallego Maithili Telugu
luganda Malayalam —