Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) – это быстрая и экономичная модель синтеза речи от Google, которая призвана заменить gemini-3.1-flash-tts-preview для рабочих нагрузок с высокой пропускной способностью.
Обзор и возможности
Gemini 3.8 Flash-Lite TTS сочетает низкую задержку с выразительной и естественной речью:
- Высокая эффективность. Оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи одним говорящим на основных языках.
- Совместимость со схемой. Использует ту же схему API и формат структурированных запросов, что и
gemini-3.8-flash-tts, поэтому вы можете переключаться между моделями, изменив всего один параметр. - Полная поддержка голосовой экосистемы. Поддерживаются встроенные голоса, расширенная библиотека голосов (
GET /v1beta/voices), персонализированные дизайны голосов и репликация голоса (по умолчанию используются сохраненные голоса, а также можно использовать ключи без сохранения состояния). Вы также можете создавать и воспроизводить голоса в интерактивном режиме в Google AI Studio.
Подробную информацию о функциях, рекомендации по составлению запросов и примеры кода можно найти в руководстве по преобразованию текста в речь.
Когда использовать ту или иную модель TTS
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру запросов. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Функция или рабочая нагрузка | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Основная сила | высокая пропускная способность, низкая задержка и экономичность; | Максимальная точность передачи голоса, нюансов игры и диалектов |
| Примеры использования | Массовое производство, каскады голосовых агентов в реальном времени, функции озвучивания текста, копирование голоса, повседневная генерация речи одним говорящим | Аудиокниги, студийная озвучка, сложные диалоги с несколькими говорящими, эмоциональные реплики, сложное произношение, региональные диалекты. |
| Поддерживаемые языки | 101 язык | 130 языков |
| Рекомендуемая замена | gemini-3.1-flash-tts-preview |
Новый уровень креативов |
Руководство по переходу
Если вы переходите с gemini-3.1-flash-tts-preview на gemini-3.8-flash-lite-tts, обновите запросы для схемы Gemini 3.8 TTS:
- Перенос пошаговых инструкций в
speech_metadata. Gemini 3.8 TTS воспринимает входной текст как дословную транскрипцию. Встроенные текстовые инструкции, например"Say cheerfully: Hello!"или"Speaker 1: Hello!", могут быть озвучены. Перенесите инструкции по непрерывной доставке (style) и ярлыки говорящих (speaker) в структурированные метаданные:- Interactions API. Добавьте аннотацию с помощью
"type": "speech_metadata","speaker"и"style"к каждому блоку текстового контента. - GenerateContent API: добавьте
"speech_metadata": {"speaker": "...", "style": "..."}к каждомуpart.
- Interactions API. Добавьте аннотацию с помощью
- Используйте встроенные теги в угловых скобках только для обозначения вокальных событий, происходящих в определенный момент времени. Кратковременные неречевые вокализации и паузы следует обозначать в тексте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стиль речи, например шепот, указывайте в тегахspeech_metadata.style. - Указывайте
speakerв каждом ответе на запрос с несколькими говорящими. Каждый ответ на запрос с несколькими говорящими должен явно содержатьspeakerвнутриspeech_metadata, соответствующий одному из настроенных говорящих. - Создайте персонажей с помощью функции "Дизайн голоса". Замените длинные блоки "Аудиопрофиль" или "Заметки режиссера" на пользовательский голос, созданный в Дизайне голоса, а затем передайте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте, что по умолчанию для запросов с одним ответом используется формат WAV (
audio/wav). В отличие от моделиgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанные данные PCM без заголовкаaudio/l16), модель Gemini 3.8 TTS по умолчанию возвращает аудио в формате WAV (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для запросов с одним ответом.- Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля
wavePython илиffmpeg), удалите оболочку заголовка и запишите возвращенные байты непосредственно в файл.wav. - Если для конвейера требуется аудио в формате headerless raw PCM, mu-law или A-law, явно задайте для параметра
response_format.mime_typeзначение"audio/l16","audio/mulaw"или"audio/alaw"(например,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}в Interactions API илиAUDIO_L16,AUDIO_MULAWилиAUDIO_ALAWвgenerateContent). Подробнее о форматах аудиовыхода…
- Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-lite-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-lite-tts |
| Поддерживаемые типы данных |
Входные данные Текст Выходные данные Аудио |
| Ограничения на количество токенов[*] |
Лимит на количество входных токенов 8192 Лимит на количество выходных токенов 16 384 (ограничение Gemini API) |
| Возможности | Что пользователь может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Чего пользователь не может Находите информацию из надежных источников Чего пользователь не может Структурированные выходные данные Чего пользователь не может Чего пользователь не может Чего пользователь не может |
| Варианты просмотра |
Что пользователь может Что пользователь может Что пользователь может |
| Версии |
|
| Последнее обновление | Сентябрь 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков:
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабская письменность) | Немецкий | Манипури |
| Африкаанс | Греческий | Маратхи |
| Акан | Гуджарати | Минангкабау (арабское письмо) |
| Амхарский | Гаитянский креольский | Мизо |
| Армянский | Халха-монгольский | Непальский (отдельный язык) |
| Ассамский | Хауса | Фула (Нигерия) |
| Авадхи | Иврит | Североазербайджанский |
| Балийский | хинди | Сото северный |
| Бенгальский | Венгерский | Северный узбекский |
| Банджарский (латиница) | Исландский | Норвежский букмол |
| Баскский | илоканский | Норвежский (новонорвежский) |
| Belarusian | Индонезийский | Ньянджа |
| Бходжпури | Персидский (Иран) | Одия (отдельный язык) |
| Боснийский | Итальянский | Персидский (Афганистан) |
| Бугийский | Японский | Польский |
| Болгарский | Яванский | Португальский |
| Кантонский | Камба | Пенджабский |
| Каталанский | Каннада | Румынский |
| Себуанский | Кашмири (арабское письмо) | Русский |
| Центральнокурдский | Кашмири (деванагари) | Сантали |
| Чхаттисгархи | Казахский | Сербский |
| Китайский (упрощенный) | Кхмерский | Сингальский |
| Китайский (традиционное письмо) | Кикуйю | Словацкий |
| Хорватский | Киньяруанда | Южноазербайджанский |
| Чешский | Конго | Южный пушту |
| Датский | Корейский | Испанский |
| Нидерландский | Киргизский | Стандартный арабский (арабский шрифт) |
| арабский (Египет) | Лаосский | Стандартный арабский (латиница) |
| Английский | Лингала | Стандартный латышский |
| Эстонский | Македонский | Стандартный малайский |
| Филиппинский | Магахи | Тамильский |
| Французский | Майтхили | Телугу |
| Галисийский | Малаялам | Турецкий |
| Ganda | Мальтийский | Вьетнамский |
| Грузинский | — | — |