Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) es el modelo insignia de texto a voz creativo de Google, diseñado para ofrecer una fidelidad de voz con calidad de estudio, actuación expresiva, acentos regionales auténticos y una estabilidad sólida de varias respuestas en formato largo.
Descripción general y capacidades
Gemini 3.8 Flash TTS establece un nuevo parámetro de referencia para la generación de audio expresivo:
- Alta fidelidad acústica y matices de actuación: Ofrece un amplio rango emocional, una cadencia natural y una adhesión precisa a las indicaciones de giro
styley a los eventos vocales intercalados (<laugh>,<sigh>,<short pause>). - Estabilidad de varias respuestas de formato largo: Mantiene la identidad de voz, el timbre, el volumen y el tono acústico de la sala coherentes en diálogos extensos y narraciones de varios minutos sin desviación de la voz.
- Acentos y pronunciación regionales auténticos: Admite acentos regionales y dialectos minoritarios.
- Compatibilidad total con el ecosistema de voz: Funciona sin problemas con voces prediseñadas, la Biblioteca de voces extendida (
GET /v1beta/voices), arquetipos de diseño de voz personalizados y la replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.
Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.
Cuándo usar cada modelo de TTS
Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:
| Función o carga de trabajo | TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts) |
TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Principal fortaleza | Máxima fidelidad de voz, matices de actuación y cobertura de dialectos | Alta capacidad de procesamiento, baja latencia y rentabilidad |
| Mejores casos de uso | Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales | Producción de gran volumen, cascadas de agentes de voz en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador |
| Idiomas compatibles | 130 idiomas | 101 idiomas |
| Reemplazo recomendado para | Nuevo nivel de creatividad principal | gemini-3.1-flash-tts-preview |
Guía de migración
Si migras desde gemini-3.1-flash-tts-preview o modelos anteriores de Gemini TTS, actualiza tus solicitudes para el esquema de Gemini 3.8 TTS:
- Mueve las indicaciones a nivel de giros hacia
speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las indicaciones de texto intercaladas, como"Say cheerfully: Hello!"o"Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a los metadatos estructurados:- API de Interactions: Adjunta una anotación con
"type": "speech_metadata","speaker"y"style"a cada bloque de contenido de texto. - API de GenerateContent: Adjunta
"speech_metadata": {"speaker": "...", "style": "..."}a cadapart.
- API de Interactions: Adjunta una anotación con
- Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Coloca los estilos de entrega, como susurrar, enspeech_metadata.style. - Especifica
speakeren cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícitaspeakerdentro despeech_metadata, que coincida con uno de los interlocutores configurados. - Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Audio Profile o Director's Notes con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de
voice_...a través de tus solicitudes de TTS con cadenas destylemínimas o vacías. - Ten en cuenta la salida WAV predeterminada (
audio/wav) en las solicitudes unarias: A diferencia degemini-3.1-flash-tts-previewy los modelos de TTS anteriores (que devolvían PCM sin procesar y sin encabezadoaudio/l16de forma predeterminada), Gemini 3.8 TTS devuelve audio WAV (audio/wav/AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
wavede Python offmpeg), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo.wav. - Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, establece
response_format.mime_typede forma explícita en"audio/l16","audio/mulaw"o"audio/alaw"(por ejemplo,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}en la API de Interactions, oAUDIO_L16,AUDIO_MULAWoAUDIO_ALAWengenerateContent). Consulta Formatos de salida de audio.
- Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo
gemini-3.8-flash-tts
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-3.8-flash-tts |
| Tipos de datos admitidos |
Entradas Texto Resultado Audio |
| Límites de tokens[*] |
Límite de tokens de entrada 8,192 Límite de tokens de salida 16,384 (límite de publicación de la API de Gemini) |
| Funciones | Admitido No compatible No compatible No compatible No compatible Fundamentación con Google Maps No compatible No compatible No compatible Fundamentación con la Búsqueda No compatible No compatible No compatible No compatible |
| Opciones de consumo |
Admitido Admitido Admitido |
| Versiones |
|
| Última actualización | Septiembre de 2026 |
Idiomas admitidos
gemini-3.8-flash-tts detecta automáticamente el idioma de entrada y admite más de 130 idiomas:
| Idioma | Idioma | Idioma |
|---|---|---|
| Acehnés (alfabeto árabe) | Griego | Nepalí (idioma individual) |
| Afrikaans | Guaraní | Fulfulde nigeriano |
| Akan | Gujarati | Azerí del norte |
| Amárico | Criollo haitiano | Sotho norteño |
| Armenio | Mongol de Halh | Uzbeko del norte |
| Asamés | Hausa | Bokmål |
| Awadhi | Hebreo | Noruego (Nynorsk) |
| Balinés | Hindi | Nyanja |
| Bengalí | Húngaro | Occitano |
| Banjar (escritura árabe) | Islandés | Odia (idioma individual) |
| Banjar (alfabeto latino) | Igbo | Pangasinán |
| Baskir | Ilocano | Persa (Afganistán) |
| Euskara | Indonesio | Polaco |
| Bielorruso | Persa iraní | Portugués |
| Bemba | Italiano | Punyabí |
| Bhojpuri | Japonés | Rumano |
| Bosnio | Javanés | Ruso |
| Buginés | Kabyle | Santali |
| Búlgaro | Kamba | Serbio |
| Birmano | Canarés | Sindhi |
| Cantonés | Cachemir (alfabeto árabe) | Cingalés |
| Catalán | Cachemir (alfabeto Deva) | Eslovaco |
| Cebuano | Kazajo | Esloveno |
| Kurdo | Jemer | Somalí |
| Chatisgarí | Kikuyu | Azerí del sur |
| Chino (secuencia de comandos Hans) | Kiñarwanda | Pastún meridional |
| Chino (secuencia de comandos Hant) | Congo | Sesoto meridional |
| Tártaro de Crimea | Coreano | Español |
| Croata | Kirguís | Árabe estándar (alfabeto árabe) |
| Checo | Laosiano | Árabe estándar (alfabeto latino) |
| Danés | Latgaliano | Letón estándar |
| Holandés | Lingala | Malayo estándar |
| Diula | Lituano | Suajili (idioma individual) |
| Dzongkha | Luxemburgués | Suazi |
| Árabe egipcio | Macedonio | Sueco |
| Inglés | Magahi | Tayiko |
| Estonio | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finlandés | Maltés | Tailandés |
| Francés | Manipuri | Tigrinya |
| Gallego | Maratí | Albanés tosk |
| luganda | Minangkabau (escritura árabe) | Turco |
| Georgiano | Minangkabau (alfabeto latino) | Uigur |
| Alemán | Mizo | Vietnamita |