Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) es el modelo insignia de texto a voz creativo de Google, diseñado para ofrecer una fidelidad de voz con calidad de estudio, actuación expresiva, acentos regionales auténticos y una estabilidad sólida en conversaciones de varios turnos de formato largo.
Descripción general y capacidades
Gemini 3.8 Flash TTS establece un nuevo parámetro de referencia para la generación de audio expresivo:
- Alta fidelidad acústica y matices de actuación: Ofrece un amplio rango emocional, una cadencia natural y una adhesión precisa a las indicaciones de
styley los eventos vocales intercalados (<laugh>,<sigh>,<short pause>). - Estabilidad de varias respuestas de formato largo: Mantiene la identidad de voz, el timbre, el volumen y el tono acústico de la sala coherentes en diálogos extensos y narraciones de varios minutos sin desviación de la voz.
- Pronunciación y acentos regionales auténticos: Admite acentos regionales, dialectos minoritarios y reemplazos del Alfabeto Fonético Internacional (IPA) intercalados.
- Compatibilidad total con el ecosistema de voz: Funciona sin problemas con voces prediseñadas, la Biblioteca de voces extendida (
GET /v1beta/voices), arquetipos de diseño de voz personalizados y la replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.
Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.
Cuándo usar cada modelo de TTS
Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:
| Función o carga de trabajo | TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts) |
TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Principal fortaleza | Máxima fidelidad de voz, matices de actuación y cobertura de dialectos | Alta capacidad de procesamiento, baja latencia y rentabilidad |
| Mejores casos de uso | Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales | Producción de gran volumen, agentes de voz en cascada en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador |
| Idiomas compatibles | 130 idiomas | 101 idiomas |
| Reemplazo recomendado para | Nuevo nivel de creatividad principal | gemini-3.1-flash-tts-preview |
Guía de migración
Si migras desde gemini-3.1-flash-tts-preview o modelos anteriores de Gemini TTS, actualiza tus solicitudes para el esquema de Gemini TTS 3.8:
- Mueve las instrucciones a nivel de turno a
speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las instrucciones de texto intercaladas, como"Say cheerfully: Hello!"o"Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a metadatos estructurados:- API de Interactions: Adjunta una anotación con
"type": "speech_metadata","speaker"y"style"a cada bloque de contenido de texto. - API de GenerateContent: Adjunta
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API de Interactions: Adjunta una anotación con
- Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Coloca los estilos de entrega, como susurrar, enspeech_metadata.style. - Especifica
speakeren cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícitaspeakerdentro despeech_metadata, que coincida con uno de los interlocutores configurados. - Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Perfil de audio o Notas del director con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de
voice_...a través de tus solicitudes de TTS con cadenas destylemínimas o vacías. - Ten en cuenta la salida WAV predeterminada (
audio/wav) en las solicitudes unarias: A diferencia degemini-3.1-flash-tts-previewy los modelos de TTS anteriores (que mostraban PCM sin procesar y sin encabezadoaudio/l16de forma predeterminada), Gemini 3.8 TTS muestra audio WAV (audio/wav/AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
waveoffmpegde Python), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo.wav. - Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, configura
response_formatde forma explícita como"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") o"audio/alaw"("AUDIO_ALAW"). Consulta Formatos de salida de audio.
- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
gemini-3.8-flash-tts
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-3.8-flash-tts |
| Tipos de datos admitidos |
Entradas Texto Resultado Audio |
| Límites de tokens[*] |
Límite de tokens de entrada 8,192 Límite de tokens de salida 16,384 |
| Funciones | Admitido Admitido No compatible No compatible No compatible Fundamentación con Google Maps No compatible No compatible No compatible Fundamentación con la Búsqueda No compatible No compatible No compatible No compatible |
| Opciones de consumo |
Admitido Admitido Admitido |
| Versiones de |
|
| Última actualización | Julio de 2026 |
Idiomas admitidos
gemini-3.8-flash-tts detecta automáticamente el idioma de entrada y admite 130 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Acehnés (escritura árabe) | Griego | Nepalí (idioma individual) |
| Afrikaans | Guaraní | Fulfulde nigeriano |
| Akan | Gujarati | Azerí del norte |
| Amárico | Criollo haitiano | Sotho norteño |
| Armenio | Mongol de Halh | Uzbeko del norte |
| Asamés | Hausa | Bokmål |
| Awadhi | Hebreo | Noruego (Nynorsk) |
| Balinés | Hindi | Nyanja |
| Bengalí | Húngaro | Occitano |
| Banjar (escritura árabe) | Islandés | Oriya (idioma individual) |
| Banjar (alfabeto latino) | Igbo | Pangasinán |
| Baskir | Ilocano | Persa (Afganistán) |
| Euskara | Indonesio | Polaco |
| Bielorruso | Persa iraní | Portugués |
| Bemba | Italiano | Punyabí |
| Bhojpuri | Japonés | Rumano |
| Bosnio | Javanés | Ruso |
| Buginés | Kabyle | Santali |
| Búlgaro | Kamba | Serbio |
| Birmano | Canarés | Sindhi |
| Cantonés | Cachemir (alfabeto árabe) | Cingalés |
| Catalán | Cachemir (alfabeto devanagari) | Eslovaco |
| Cebuano | Kazajo | Esloveno |
| Kurdo | Jemer | Somalí |
| Chatisgarí | Kikuyu | Azerí del sur |
| Chino (escritura Han) | Kiñarwanda | Pastún meridional |
| Chino (secuencia de comandos Hant) | Congo | Sesoto meridional |
| Tártaro de Crimea | Coreano | Español |
| Croata | Kirguís | Árabe estándar (alfabeto árabe) |
| Checo | Laosiano | Árabe estándar (alfabeto latino) |
| Danés | Latgaliano | Letón estándar |
| Holandés | Lingala | Malayo estándar |
| Diula | Lituano | Suajili (idioma individual) |
| Dzongkha | Luxemburgués | Suazi |
| Árabe egipcio | Macedonio | Sueco |
| Inglés | Magahi | Tayiko |
| Estonio | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finlandés | Maltés | Tailandés |
| Francés | Manipuri | Tigrinya |
| Gallego | Maratí | Albanés tosk |
| luganda | Minangkabau (escritura árabe) | Uigur |
| Georgiano | Minangkabau (alfabeto latino) | — |
| Alemán | Mizo | — |