Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.
Обзор и возможности
Gemini 3.8 Flash TTS sets a new benchmark for expressive audio generation:
- Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям
styleи вокальным переходам (<laugh>,<sigh>,<short pause>). - Long-form multi-turn stability: Maintains consistent voice identity, timbre, volume, and acoustic room tone across extended dialogues and multi-minute narrations without voice drift.
- Authentic regional accents and pronunciation: Supports regional accents and minority dialects.
- Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов (
GET /v1beta/voices), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Visit the Text-to-speech guide for full coverage of features, prompting best practices, and code examples.
Когда использовать ту или иную модель синтеза речи
Both Gemini 3.8 TTS models share the same API schema and prompting structure. Choose the model that fits your workload:
| Функция / рабочая нагрузка | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| Основная сила | Maximum voice fidelity, acting nuance, and dialect coverage | High throughput, low latency, and cost efficiency |
| Наилучшие варианты использования | Audiobooks, studio narration, complex multi-speaker dialogue, heavy vocal-burst acting, difficult pronunciation, regional dialects | High-volume production, real-time voice agent cascades, read-aloud features, voice replication, everyday single-speaker generation |
| Поддерживаемые языки | 130 languages | 101 язык |
| Рекомендуемая замена для | Новый флагманский креативный уровень | gemini-3.1-flash-tts-preview |
Руководство по миграции
If you are migrating from gemini-3.1-flash-tts-preview or earlier Gemini TTS models, update your requests for the Gemini 3.8 TTS schema:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- Interactions API: Attach an annotation with
"type": "speech_metadata","speaker", and"style"to each text content block. - GenerateContent API: Attach
"speech_metadata": {"speaker": "...", "style": "..."}to eachpart.
- Interactions API: Attach an annotation with
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - Specify
speakeron every turn in multi-speaker requests: Every turn in a multi-speaker request must explicitly includespeakerinsidespeech_metadatamatching one of the configured speakers. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16 384 (лимит обслуживания API Gemini) |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts detects the input language automatically and supports over 130 languages :
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабский алфавит) | греческий | Непальский (отдельный язык) |
| африкаанс | Гуарани | Нигерийский Фульфульде |
| Акан | гуджарати | North Azerbaijani |
| амхарский | гаитянский креольский | Северный Сото |
| армянский | Халх Монгольский | Northern Uzbek |
| ассамский | Хауса | норвежский букмол |
| Авадхи | иврит | Норвежский Нюнорск |
| балийский | хинди | Ньянджа |
| Бенгальский | венгерский | окситанский |
| Banjar (Arab script) | исландский | Одиа (отдельный язык) |
| Banjar (Latn script) | Игбо | Пангасинан |
| Башкир | Iloko | Persian (Afghanistan) |
| Баскский | индонезийский | польский |
| белорусский | иранский персидский | португальский |
| Бемба | итальянского | Пенджаби |
| Бходжпури | японский | румынский |
| боснийский | яванский | Русский |
| Buginese | Кабиль | Сантали |
| болгарский | Камба | сербский |
| бирманский | Каннада | Синдхи |
| кантонский | Kashmiri (Arab script) | сингальский |
| каталанский | Kashmiri (Deva script) | словацкий |
| Себуано | казахский | словенский |
| Центральный Курдский | кхмерский | сомалийский |
| Чхаттисгархи | Кикую | South Azerbaijani |
| Chinese (Hans script) | Киньяруанда | Southern Pashto |
| Chinese (Hant script) | Конго | Южный Сото |
| Крымский татарин | корейский | испанский |
| хорватский | кыргызы | Standard Arabic (Arab script) |
| чешский | Лао | Standard Arabic (Latn script) |
| датский | Latgalian | Standard Latvian |
| Голландский | Лингала | Standard Malay |
| Дьюла | литовский | Swahili (individual language) |
| Дзонгкха | люксембургский | Свати |
| Egyptian Arabic | македонский | шведский |
| Английский | Магахи | Таджик |
| эстонский | Майтхили | тамильский |
| филиппинский | Малаялам | телугу |
| финский | мальтийский | Тайский |
| Французский | Манипури | тигринья |
| галисийский | маратхи | Tosk Albanian |
| Ганда | Minangkabau (Arab script) | турецкий |
| грузинский | Minangkabau (Latn script) | уйгурский |
| немецкий | Mizo | вьетнамский |
Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.
Overview and capabilities
Gemini 3.8 Flash TTS sets a new benchmark for expressive audio generation:
- Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям
styleи вокальным переходам (<laugh>,<sigh>,<short pause>). - Long-form multi-turn stability: Maintains consistent voice identity, timbre, volume, and acoustic room tone across extended dialogues and multi-minute narrations without voice drift.
- Authentic regional accents and pronunciation: Supports regional accents and minority dialects.
- Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов (
GET /v1beta/voices), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Visit the Text-to-speech guide for full coverage of features, prompting best practices, and code examples.
When to use which TTS model
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Feature / workload | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| Primary strength | Maximum voice fidelity, acting nuance, and dialect coverage | High throughput, low latency, and cost efficiency |
| Best use cases | Audiobooks, studio narration, complex multi-speaker dialogue, heavy vocal-burst acting, difficult pronunciation, regional dialects | High-volume production, real-time voice agent cascades, read-aloud features, voice replication, everyday single-speaker generation |
| Поддерживаемые языки | 130 языков | 101 язык |
| Recommended replacement for | Новый флагманский креативный уровень | gemini-3.1-flash-tts-preview |
Руководство по миграции
Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите свои запросы для схемы Gemini 3.8 TTS:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
"type": "speech_metadata","speaker"и"style". - GenerateContent API: Attach
"speech_metadata": {"speaker": "...", "style": "..."}to eachpart.
- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - Specify
speakeron every turn in multi-speaker requests: Every turn in a multi-speaker request must explicitly includespeakerinsidespeech_metadatamatching one of the configured speakers. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16 384 (лимит обслуживания API Gemini) |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает более 130 языков :
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабский алфавит) | греческий | Непальский (отдельный язык) |
| африкаанс | Гуарани | Нигерийский Фульфульде |
| Акан | гуджарати | Северный Азербайджан |
| амхарский | гаитянский креольский | Северный Сото |
| армянский | Халх Монгольский | Северный узбек |
| ассамский | Хауса | норвежский букмол |
| Авадхи | иврит | Норвежский Нюнорск |
| балийский | хинди | Ньянджа |
| Бенгальский | венгерский | окситанский |
| Банджар (арабская письменность) | исландский | Одиа (отдельный язык) |
| Банджар (лат.) | Игбо | Пангасинан |
| Башкир | Илоко | Персидский (Афганистан) |
| Баскский | индонезийский | польский |
| белорусский | Iranian Persian | португальский |
| Бемба | итальянского | Пенджаби |
| Бходжпури | японский | румынский |
| боснийский | яванский | Русский |
| Бугинский | Кабиль | Сантали |
| болгарский | Камба | сербский |
| бирманский | Каннада | Синдхи |
| кантонский | Kashmiri (Arab script) | сингальский |
| каталанский | Кашмирский (письмо Дева) | словацкий |
| Себуано | казахский | словенский |
| Центральный Курдский | кхмерский | сомалийский |
| Чхаттисгархи | Кикую | Южный Азербайджан |
| Китайский (Гансовский алфавит) | Киньяруанда | Южный пушту |
| Китайский (хантийский алфавит) | Конго | Южный Сото |
| Крымский татарин | корейский | испанский |
| хорватский | кыргызы | Стандартный арабский язык (арабская письменность) |
| чешский | Лао | Стандартный арабский язык (лат. алфавит) |
| датский | Латгальский | Стандартный латышский |
| Голландский | Лингала | Стандартный малайский |
| Дьюла | литовский | Суахили (отдельный язык) |
| Дзонгкха | люксембургский | Свати |
| египетский арабский | македонский | шведский |
| Английский | Магахи | Таджик |
| эстонский | Майтхили | тамильский |
| филиппинский | Малаялам | телугу |
| финский | мальтийский | Тайский |
| Французский | Манипури | тигринья |
| галисийский | маратхи | Тоск Албанский |
| Ганда | Минангкабау (арабская письменность) | турецкий |
| грузинский | Минангкабау (лат.) | уйгурский |
| немецкий | Мизо | вьетнамский |
Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.
Обзор и возможности
Gemini 3.8 Flash TTS устанавливает новый стандарт выразительного воспроизведения звука:
- Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям
styleи вокальным переходам (<laugh>,<sigh>,<short pause>). - Стабильность звучания на протяжении длительных диалогов и многоминутных повествований: обеспечивает сохранение неизменной идентичности голоса, тембра, громкости и акустического тона помещения на протяжении продолжительных диалогов и многоминутных закадровых текстов без смещения голоса.
- Аутентичные региональные акценты и произношение: Поддержка региональных акцентов и диалектов меньшинств.
- Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов (
GET /v1beta/voices), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .
Когда использовать ту или иную модель синтеза речи
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Функция / рабочая нагрузка | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| Основная сила | Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов. | Высокая пропускная способность, низкая задержка и экономичность. |
| Наилучшие варианты использования | Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты. | Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. |
| Поддерживаемые языки | 130 languages | 101 язык |
| Рекомендуемая замена для | Новый флагманский креативный уровень | gemini-3.1-flash-tts-preview |
Руководство по миграции
Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите свои запросы для схемы Gemini 3.8 TTS:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
"type": "speech_metadata","speaker"и"style". - GenerateContent API: Прикрепите
"speech_metadata": {"speaker": "...", "style": "..."}к каждойpart.
- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - В запросах с несколькими говорящими необходимо явно указывать
speakerв каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указыватьspeakerвspeech_metadataсоответствующего одному из настроенных говорящих. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16 384 (лимит обслуживания API Gemini) |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает более 130 языков :
| Язык | Язык | Язык |
|---|---|---|
| Acehnese (Arab script) | греческий | Nepali (individual language) |
| африкаанс | Гуарани | Нигерийский Фульфульде |
| Акан | гуджарати | Северный Азербайджан |
| амхарский | гаитянский креольский | Северный Сото |
| армянский | Халх Монгольский | Северный узбек |
| ассамский | Хауса | норвежский букмол |
| Авадхи | иврит | Норвежский Нюнорск |
| балийский | хинди | Ньянджа |
| Бенгальский | венгерский | окситанский |
| Банджар (арабская письменность) | исландский | Odia (individual language) |
| Банджар (лат.) | Игбо | Пангасинан |
| Башкир | Илоко | Персидский (Афганистан) |
| Баскский | индонезийский | польский |
| белорусский | Iranian Persian | португальский |
| Бемба | итальянского | Пенджаби |
| Бходжпури | японский | румынский |
| боснийский | яванский | Русский |
| Бугинский | Кабиль | Сантали |
| болгарский | Камба | сербский |
| бирманский | Каннада | Синдхи |
| кантонский | Кашмирский (арабский алфавит) | сингальский |
| каталанский | Kashmiri (Deva script) | словацкий |
| Себуано | казахский | словенский |
| Центральный Курдский | кхмерский | сомалийский |
| Chhattisgarhi | Кикую | South Azerbaijani |
| Chinese (Hans script) | Киньяруанда | Southern Pashto |
| Китайский (хантийский алфавит) | Конго | Южный Сото |
| Крымский татарин | корейский | испанский |
| хорватский | кыргызы | Standard Arabic (Arab script) |
| чешский | Лао | Standard Arabic (Latn script) |
| датский | Latgalian | Standard Latvian |
| Голландский | Лингала | Standard Malay |
| Дьюла | литовский | Swahili (individual language) |
| Дзонгкха | люксембургский | Свати |
| Egyptian Arabic | македонский | шведский |
| Английский | Магахи | Таджик |
| эстонский | Майтхили | тамильский |
| филиппинский | Малаялам | телугу |
| финский | мальтийский | Тайский |
| Французский | Манипури | тигринья |
| галисийский | маратхи | Tosk Albanian |
| Ганда | Minangkabau (Arab script) | турецкий |
| грузинский | Minangkabau (Latn script) | уйгурский |
| немецкий | Mizo | вьетнамский |
Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.
Overview and capabilities
Gemini 3.8 Flash TTS устанавливает новый стандарт выразительного воспроизведения звука:
- Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям
styleи вокальным переходам (<laugh>,<sigh>,<short pause>). - Стабильность звучания на протяжении длительных диалогов и многоминутных повествований: обеспечивает сохранение неизменной идентичности голоса, тембра, громкости и акустического тона помещения на протяжении продолжительных диалогов и многоминутных закадровых текстов без смещения голоса.
- Аутентичные региональные акценты и произношение: Поддержка региональных акцентов и диалектов меньшинств.
- Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов (
GET /v1beta/voices), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .
When to use which TTS model
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Feature / workload | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| Primary strength | Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов. | Высокая пропускная способность, низкая задержка и экономичность. |
| Best use cases | Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты. | Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. |
| Поддерживаемые языки | 130 languages | 101 язык |
| Recommended replacement for | New flagship creative tier | gemini-3.1-flash-tts-preview |
Руководство по миграции
Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите свои запросы для схемы Gemini 3.8 TTS:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
"type": "speech_metadata","speaker"и"style". - GenerateContent API: Прикрепите
"speech_metadata": {"speaker": "...", "style": "..."}к каждойpart.
- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - В запросах с несколькими говорящими необходимо явно указывать
speakerв каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указыватьspeakerвspeech_metadataсоответствующего одному из настроенных говорящих. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16 384 (лимит обслуживания API Gemini) |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает более 130 языков :
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабский алфавит) | греческий | Непальский (отдельный язык) |
| африкаанс | Гуарани | Нигерийский Фульфульде |
| Акан | гуджарати | Северный Азербайджан |
| амхарский | гаитянский креольский | Северный Сото |
| армянский | Халх Монгольский | Северный узбек |
| ассамский | Хауса | норвежский букмол |
| Авадхи | иврит | Норвежский Нюнорск |
| балийский | хинди | Ньянджа |
| Бенгальский | венгерский | окситанский |
| Банджар (арабская письменность) | исландский | Одиа (отдельный язык) |
| Банджар (лат.) | Игбо | Пангасинан |
| Башкир | Илоко | Персидский (Афганистан) |
| Баскский | индонезийский | польский |
| белорусский | иранский персидский | португальский |
| Бемба | итальянского | Пенджаби |
| Бходжпури | японский | румынский |
| боснийский | яванский | Русский |
| Бугинский | Кабиль | Сантали |
| болгарский | Камба | сербский |
| бирманский | Каннада | Синдхи |
| кантонский | Кашмирский (арабский алфавит) | сингальский |
| каталанский | Кашмирский (письмо Дева) | словацкий |
| Себуано | казахский | словенский |
| Центральный Курдский | кхмерский | сомалийский |
| Чхаттисгархи | Кикую | Южный Азербайджан |
| Китайский (Гансовский алфавит) | Киньяруанда | Южный пушту |
| Китайский (хантийский алфавит) | Конго | Южный Сото |
| Крымский татарин | корейский | испанский |
| хорватский | кыргызы | Стандартный арабский язык (арабская письменность) |
| чешский | Лао | Стандартный арабский язык (лат. алфавит) |
| датский | Latgalian | Стандартный латышский |
| Голландский | Лингала | Standard Malay |
| Дьюла | литовский | Суахили (отдельный язык) |
| Дзонгкха | люксембургский | Свати |
| Egyptian Arabic | македонский | шведский |
| Английский | Магахи | Таджик |
| эстонский | Майтхили | тамильский |
| филиппинский | Малаялам | телугу |
| финский | мальтийский | Тайский |
| Французский | Манипури | тигринья |
| галисийский | маратхи | Tosk Albanian |
| Ганда | Минангкабау (арабская письменность) | турецкий |
| грузинский | Minangkabau (Latn script) | уйгурский |
| немецкий | Mizo | вьетнамский |