Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) – флагманская модель Google для преобразования текста в речь, разработанная для создания голоса студийного качества, выразительной речи, аутентичных региональных акцентов и стабильной работы с длинными текстами.
Обзор и возможности
Gemini 3.8 Flash TTS задает новый стандарт выразительности аудио:
- Высокое качество звука и нюансы актерской игры. Голос передает широкий спектр эмоций, звучит естественно и точно соответствует указаниям на уровне реплик
styleи встроенным вокальным событиям (<laugh>,<sigh>,<short pause>). - Стабильность при длительном многоходовом диалоге. Поддерживает постоянство голоса, тембра, громкости и акустического тона помещения в течение длительных диалогов и многоминутных повествований без отклонений.
- Аутентичные региональные акценты и произношение. Поддерживаются региональные акценты и диалекты.
- Поддержка всех голосовых экосистем. Бесперебойная работа с готовыми голосами, расширенной библиотекой голосов (
GET /v1beta/voices), персонализированными дизайнами голосов и репликацией голоса (по умолчанию используются сохраненные голоса, но можно также использовать ключи без сохранения состояния). Вы также можете создавать и воспроизводить голоса в интерактивном режиме в Google AI Studio.
Подробную информацию о функциях, рекомендации по составлению запросов и примеры кода можно найти в руководстве по преобразованию текста в речь.
Когда использовать ту или иную модель TTS
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру запросов. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Функция или рабочая нагрузка | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Основная сила | Максимальная точность передачи голоса, нюансов игры и диалектов | высокая пропускная способность, низкая задержка и экономичность; |
| Примеры использования | Аудиокниги, студийная озвучка, сложные диалоги с несколькими говорящими, эмоциональные реплики, сложное произношение, региональные диалекты. | Массовое производство, каскады голосовых агентов в реальном времени, функции озвучивания текста, копирование голоса, повседневная генерация речи одним говорящим |
| Поддерживаемые языки | 130 языков | 101 язык |
| Рекомендуемая замена | Новый уровень креативов | gemini-3.1-flash-tts-preview |
Руководство по переходу
Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите запросы в соответствии со схемой Gemini 3.8 TTS:
- Перенос пошаговых инструкций в
speech_metadata. Gemini 3.8 TTS воспринимает входной текст как дословную транскрипцию. Встроенные текстовые инструкции, например"Say cheerfully: Hello!"или"Speaker 1: Hello!", могут быть озвучены. Перенесите инструкции по непрерывной доставке (style) и ярлыки говорящих (speaker) в структурированные метаданные:- Interactions API. Добавьте аннотацию с помощью
"type": "speech_metadata","speaker"и"style"к каждому блоку текстового контента. - GenerateContent API: добавьте
"speech_metadata": {"speaker": "...", "style": "..."}к каждомуpart.
- Interactions API. Добавьте аннотацию с помощью
- Используйте встроенные теги в угловых скобках только для обозначения вокальных событий, происходящих в определенный момент времени. Кратковременные неречевые вокализации и паузы следует обозначать в тексте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стиль речи, например шепот, указывайте в тегахspeech_metadata.style. - Указывайте
speakerв каждом ответе на запрос с несколькими говорящими. Каждый ответ на запрос с несколькими говорящими должен явно содержатьspeakerвнутриspeech_metadata, соответствующий одному из настроенных говорящих. - Создайте персонажей с помощью функции "Дизайн голоса". Замените длинные блоки "Аудиопрофиль" или "Заметки режиссера" на пользовательский голос, созданный в Дизайне голоса, а затем передайте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте формат WAV (
audio/wav) по умолчанию для запросов с одним сообщением. В отличие от моделиgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM-файлaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает аудио в формате WAV (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для запросов с одним сообщением.- Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля
wavePython илиffmpeg), удалите оболочку заголовка и запишите возвращенные байты непосредственно в файл.wav. - Если для конвейера требуется аудио в формате PCM без заголовка, mu-law или A-law, явно задайте для параметра
response_format.mime_typeзначение"audio/l16","audio/mulaw"или"audio/alaw"(например,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}в Interactions API илиAUDIO_L16,AUDIO_MULAWилиAUDIO_ALAWвgenerateContent). Подробнее о форматах аудиовыхода…
- Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-tts |
| Поддерживаемые типы данных |
Входные данные Текст Выходные данные Аудио |
| Ограничения на количество токенов[*] |
Лимит на количество входных токенов 8192 Лимит на количество выходных токенов 16 384 (ограничение Gemini API) |
| Возможности | Что пользователь может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Находите информацию из надежных источников Чего пользователь не может Структурированные выходные данные Чего пользователь не может Чего пользователь не может Чего пользователь не может |
| Варианты просмотра |
Что пользователь может Что пользователь может Что пользователь может |
| Версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает более 130 языков:
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабская письменность) | Греческий | Непальский (отдельный язык) |
| Африкаанс | Гуарани | Фула (Нигерия) |
| Акан | Гуджарати | Североазербайджанский |
| Амхарский | Гаитянский креольский | Сото северный |
| Армянский | Халха-монгольский | Северный узбекский |
| Ассамский | Хауса | Норвежский букмол |
| Авадхи | Иврит | Норвежский (новонорвежский) |
| Балийский | хинди | Ньянджа |
| Бенгальский | Венгерский | Окситанский |
| Банджарский (арабская письменность) | Исландский | Одия (отдельный язык) |
| Банджарский (латиница) | Игбо | Пангасинанский |
| Башкирский | илоканский | Персидский (Афганистан) |
| Баскский | Индонезийский | Польский |
| Belarusian | Персидский (Иран) | Португальский |
| бемба | Итальянский | Пенджабский |
| Бходжпури | Японский | Румынский |
| Боснийский | Яванский | Русский |
| Бугийский | Кабильский | Сантали |
| Болгарский | Камба | Сербский |
| Бирманский | Каннада | Синдхи |
| Кантонский | Кашмири (арабское письмо) | Сингальский |
| Каталанский | Кашмири (деванагари) | Словацкий |
| Себуанский | Казахский | Словенский |
| Центральнокурдский | Кхмерский | Сомали |
| Чхаттисгархи | Кикуйю | Южноазербайджанский |
| Китайский (упрощенный) | Киньяруанда | Южный пушту |
| Китайский (традиционное письмо) | Конго | Южный сото |
| Крымско-татарский | Корейский | Испанский |
| Хорватский | Киргизский | Стандартный арабский (арабский шрифт) |
| Чешский | Лаосский | Стандартный арабский (латиница) |
| Датский | Латгальский | Стандартный латышский |
| Нидерландский | Лингала | Стандартный малайский |
| Дьюла | Литовский | Суахили (отдельный язык) |
| Дзонг-кэ | Люксембургский | Свати |
| арабский (Египет) | Македонский | Шведский |
| Английский | Магахи | Таджикский |
| Эстонский | Майтхили | Тамильский |
| Филиппинский | Малаялам | Телугу |
| Финский | Мальтийский | Тайский |
| Французский | Манипури | Тигринский |
| Галисийский | Маратхи | Тоскский (албанский) |
| Ganda | Минангкабау (арабское письмо) | Турецкий |
| Грузинский | Минангкабау (латиница) | Уйгурский |
| Немецкий | Мизо | Вьетнамский |