Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.
Обзор и возможности
Gemini 3.8 Flash TTS устанавливает новый стандарт выразительного воспроизведения звука:
- Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям
styleи вокальным переходам (<laugh>,<sigh>,<short pause>). - Стабильность звучания на протяжении длительных диалогов и многоминутных повествований: обеспечивает сохранение неизменной идентичности голоса, тембра, громкости и акустического тона помещения на протяжении продолжительных диалогов и многоминутных закадровых текстов без смещения голоса.
- Аутентичные региональные акценты и произношение: Поддерживает региональные акценты, диалекты меньшинств и встроенные настройки Международного фонетического алфавита (IPA).
- Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов (
GET /v1beta/voices), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .
Когда использовать ту или иную модель синтеза речи
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Функция / рабочая нагрузка | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| Основная сила | Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов. | Высокая пропускная способность, низкая задержка и экономичность. |
| Наилучшие варианты использования | Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты. | Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. |
| Поддерживаемые языки | 130 языков | 101 язык |
| Рекомендуемая замена для | Новый флагманский креативный уровень | gemini-3.1-flash-tts-preview |
Руководство по миграции
Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите свои запросы для схемы Gemini 3.8 TTS:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
"type": "speech_metadata","speaker"и"style". - GenerateContent API: Прикрепите
"speech_metadata": {"speaker": "...", "style": "..."}к каждойpart.
- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - В запросах с несколькими говорящими необходимо явно указывать
speakerв каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указыватьspeakerвspeech_metadataсоответствующего одному из настроенных говорящих. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16,384 |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Июль 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает 130 языков :
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабский алфавит) | греческий | Непальский (отдельный язык) |
| африкаанс | Гуарани | Нигерийский Фульфульде |
| Акан | гуджарати | Северный Азербайджан |
| амхарский | гаитянский креольский | Северный Сото |
| армянский | Халх Монгольский | Северный узбек |
| ассамский | Хауса | норвежский букмол |
| Авадхи | иврит | Норвежский Нюнорск |
| балийский | хинди | Ньянджа |
| Бенгальский | венгерский | окситанский |
| Банджар (арабская письменность) | исландский | Одиа (отдельный язык) |
| Банджар (лат.) | Игбо | Пангасинан |
| Башкир | Илоко | Персидский (Афганистан) |
| Баскский | индонезийский | польский |
| белорусский | иранский персидский | португальский |
| Бемба | итальянский | Пенджаби |
| Бходжпури | японский | румынский |
| боснийский | яванский | Русский |
| Бугинский | Кабиль | Сантали |
| болгарский | Камба | сербский |
| бирманский | Каннада | Синдхи |
| кантонский | Кашмирский (арабский алфавит) | сингальский |
| каталанский | Кашмирский (письмо Дева) | словацкий |
| Себуано | казахский | словенский |
| Центральный Курдский | кхмерский | сомалийский |
| Чхаттисгархи | Кикую | Южный Азербайджан |
| Китайский (Гансовский алфавит) | Киньяруанда | Южный пушту |
| Китайский (хантийский алфавит) | Конго | Южный Сото |
| Крымский татарин | корейский | испанский |
| хорватский | кыргызы | Стандартный арабский язык (арабская письменность) |
| чешский | Лао | Стандартный арабский язык (лат. алфавит) |
| датский | Латгальский | Стандартный латышский |
| Голландский | Лингала | Стандартный малайский |
| Дьюла | литовский | Суахили (отдельный язык) |
| Дзонгкха | люксембургский | Свати |
| египетский арабский | македонский | шведский |
| Английский | Магахи | Таджик |
| эстонский | Майтхили | тамильский |
| филиппинский | Малаялам | телугу |
| финский | мальтийский | Тайский |
| Французский | Манипури | тигринья |
| галисийский | маратхи | Тоск Албанский |
| Ганда | Минангкабау (арабская письменность) | уйгурский |
| грузинский | Минангкабау (лат.) | — |
| немецкий | Мизо | — |