TTS de Gemini 3.8 Flash

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) es el modelo insignia de texto a voz creativo de Google, diseñado para ofrecer una fidelidad de voz con calidad de estudio, actuación expresiva, acentos regionales auténticos y una estabilidad sólida en conversaciones de varios turnos de formato largo.

Descripción general y capacidades

Gemini 3.8 Flash TTS establece un nuevo parámetro de referencia para la generación de audio expresivo:

  • Alta fidelidad acústica y matices de actuación: Ofrece un amplio rango emocional, una cadencia natural y una adhesión precisa a las indicaciones de style y los eventos vocales intercalados (<laugh>, <sigh>, <short pause>).
  • Estabilidad de varias respuestas de formato largo: Mantiene la identidad de voz, el timbre, el volumen y el tono acústico de la sala coherentes en diálogos extensos y narraciones de varios minutos sin desviación de la voz.
  • Pronunciación y acentos regionales auténticos: Admite acentos regionales, dialectos minoritarios y reemplazos del Alfabeto Fonético Internacional (IPA) intercalados.
  • Compatibilidad total con el ecosistema de voz: Funciona sin problemas con voces prediseñadas, la Biblioteca de voces extendida (GET /v1beta/voices), arquetipos de diseño de voz personalizados y la replicación de voz (voces almacenadas persistentes de forma predeterminada, además de claves sin estado opcionales). También puedes diseñar y replicar voces de forma interactiva en Google AI Studio.

Visita la guía de Text-to-Speech para obtener una cobertura completa de las funciones, las prácticas recomendadas para las instrucciones y los ejemplos de código.

Cuándo usar cada modelo de TTS

Ambos modelos de Gemini 3.8 TTS comparten el mismo esquema de API y estructura de instrucciones. Elige el modelo que se adapte a tu carga de trabajo:

Función o carga de trabajo TTS de Gemini 3.8 Flash (gemini-3.8-flash-tts) TTS de Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts)
Principal fortaleza Máxima fidelidad de voz, matices de actuación y cobertura de dialectos Alta capacidad de procesamiento, baja latencia y rentabilidad
Mejores casos de uso Audiolibros, narración de estudio, diálogos complejos con varios interlocutores, actuación con muchos fragmentos vocales, pronunciación difícil, dialectos regionales Producción de gran volumen, agentes de voz en cascada en tiempo real, funciones de lectura en voz alta, replicación de voz, generación cotidiana de un solo orador
Idiomas compatibles 130 idiomas 101 idiomas
Reemplazo recomendado para Nuevo nivel de creatividad principal gemini-3.1-flash-tts-preview

Guía de migración

Si migras desde gemini-3.1-flash-tts-preview o modelos anteriores de Gemini TTS, actualiza tus solicitudes para el esquema de Gemini TTS 3.8:

  1. Mueve las instrucciones a nivel de turno a speech_metadata: Gemini 3.8 TTS trata el texto de entrada estrictamente como una transcripción literal. Las instrucciones de texto intercaladas, como "Say cheerfully: Hello!" o "Speaker 1: Hello!", se pueden leer en voz alta. Mueve las instrucciones de entrega sostenida (style) y las etiquetas de interlocutor (speaker) a metadatos estructurados:
    • API de Interactions: Adjunta una anotación con "type": "speech_metadata", "speaker" y "style" a cada bloque de contenido de texto.
    • API de GenerateContent: Adjunta "speech_metadata": {"speaker": "...", "style": "..."} a cada part.
  2. Usa etiquetas intercaladas con corchetes angulares solo para eventos vocales puntuales: Mantén las vocalizaciones y las pausas momentáneas que no sean de voz intercaladas en la transcripción con corchetes angulares (como <laugh>, <sigh>, <cough>, <breath> o <short pause>). Coloca los estilos de entrega, como susurrar, en speech_metadata.style.
  3. Especifica speaker en cada turno de las solicitudes con varios interlocutores: Cada turno de una solicitud con varios interlocutores debe incluir de forma explícita speaker dentro de speech_metadata, que coincida con uno de los interlocutores configurados.
  4. Diseña arquetipos con anticipación con Diseño de voz: Reemplaza los bloques largos heredados de Perfil de audio o Notas del director con una voz personalizada creada en Diseño de voz y, luego, lleva ese ID de voice_... a través de tus solicitudes de TTS con cadenas de style mínimas o vacías.
  5. Ten en cuenta la salida WAV predeterminada (audio/wav) en las solicitudes unarias: A diferencia de gemini-3.1-flash-tts-preview y los modelos de TTS anteriores (que mostraban PCM sin procesar y sin encabezado audio/l16 de forma predeterminada), Gemini 3.8 TTS muestra audio WAV (audio/wav / AUDIO_WAV) con un encabezado RIFF estándar de forma predeterminada para las solicitudes unarias.
    • Si tu código anteriormente encapsulaba bytes de PCM sin procesar en un encabezado WAV (por ejemplo, con el módulo wave o ffmpeg de Python), quita el encapsulador de encabezado manual y escribe los bytes devueltos directamente en un archivo .wav.
    • Si tu canalización requiere audio PCM sin procesar, mu-law o A-law sin encabezado, configura response_format de forma explícita como "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") o "audio/alaw" ("AUDIO_ALAW"). Consulta Formatos de salida de audio.

gemini-3.8-flash-tts

Propiedad Descripción
Código del modelo gemini-3.8-flash-tts
Tipos de datos admitidos

Entradas

Texto

Resultado

Audio

Límites de tokens[*]

Límite de tokens de entrada

8,192

Límite de tokens de salida

16,384

Funciones

Generación de audio

Admitido

Almacenamiento en caché

Admitido

Ejecución de código

No compatible

Búsqueda de archivos

No compatible

Llamada a función

No compatible

Fundamentación con Google Maps

No compatible

Generación de imágenes

No compatible

API de Live

No compatible

Fundamentación con la Búsqueda

No compatible

Resultados estructurados

No compatible

Pensamiento

No compatible

Contexto de la URL

No compatible

Opciones de consumo

API de Batch

Admitido

Inferencia Flex

Admitido

Inferencia de prioridad

Admitido

Versiones de
Lee los patrones de versiones del modelo para obtener más detalles.
  • gemini-3.8-flash-tts
Última actualización Julio de 2026

Idiomas admitidos

gemini-3.8-flash-tts detecta automáticamente el idioma de entrada y admite 130 idiomas:

Idioma Idioma Idioma
Acehnés (escritura árabe) Griego Nepalí (idioma individual)
Afrikaans Guaraní Fulfulde nigeriano
Akan Gujarati Azerí del norte
Amárico Criollo haitiano Sotho norteño
Armenio Mongol de Halh Uzbeko del norte
Asamés Hausa Bokmål
Awadhi Hebreo Noruego (Nynorsk)
Balinés Hindi Nyanja
Bengalí Húngaro Occitano
Banjar (escritura árabe) Islandés Oriya (idioma individual)
Banjar (alfabeto latino) Igbo Pangasinán
Baskir Ilocano Persa (Afganistán)
Euskara Indonesio Polaco
Bielorruso Persa iraní Portugués
Bemba Italiano Punyabí
Bhojpuri Japonés Rumano
Bosnio Javanés Ruso
Buginés Kabyle Santali
Búlgaro Kamba Serbio
Birmano Canarés Sindhi
Cantonés Cachemir (alfabeto árabe) Cingalés
Catalán Cachemir (alfabeto devanagari) Eslovaco
Cebuano Kazajo Esloveno
Kurdo Jemer Somalí
Chatisgarí Kikuyu Azerí del sur
Chino (escritura Han) Kiñarwanda Pastún meridional
Chino (secuencia de comandos Hant) Congo Sesoto meridional
Tártaro de Crimea Coreano Español
Croata Kirguís Árabe estándar (alfabeto árabe)
Checo Laosiano Árabe estándar (alfabeto latino)
Danés Latgaliano Letón estándar
Holandés Lingala Malayo estándar
Diula Lituano Suajili (idioma individual)
Dzongkha Luxemburgués Suazi
Árabe egipcio Macedonio Sueco
Inglés Magahi Tayiko
Estonio Maithili Tamil
Filipino Malayalam Telugu
Finlandés Maltés Tailandés
Francés Manipuri Tigrinya
Gallego Maratí Albanés tosk
luganda Minangkabau (escritura árabe) Uigur
Georgiano Minangkabau (alfabeto latino) —
Alemán Mizo —