Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) — это быстрая и экономичная модель преобразования текста в речь от Google, созданная для замены gemini-3.1-flash-tts-preview в высокопроизводительных производственных средах.
Обзор и возможности
Система преобразования текста в речь Gemini 3.8 Flash-Lite TTS сочетает в себе низкую задержку и выразительную, естественную речь:
- Высокая производительность: оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи от одного говорящего на основных языках.
- Совместимость со схемой без изменений: использует ту же самую схему API и формат структурированных запросов, что и
gemini-3.8-flash-tts, что позволяет переключаться между моделями с помощью изменения одного параметра. - Полная поддержка голосовой экосистемы: поддерживаются готовые голоса, расширенная библиотека голосов (
GET /v1beta/voices), пользовательские профили голосов и репликация голосов (по умолчанию — постоянно сохраненные голоса, а также дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .
Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .
Когда использовать ту или иную модель синтеза речи
Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:
| Функция / рабочая нагрузка | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) |
|---|---|---|
| Основная сила | Высокая пропускная способность, низкая задержка и экономичность. | Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов. |
| Наилучшие варианты использования | Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. | Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты. |
| Поддерживаемые языки | 101 язык | 130 языков |
| Рекомендуемая замена для | gemini-3.1-flash-tts-preview | Новый флагманский креативный уровень |
Руководство по миграции
Если вы обновляете gemini-3.1-flash-tts-preview до gemini-3.8-flash-lite-tts , обновите свои запросы для схемы Gemini 3.8 TTS:
- Переместите указания уровня реплики в
speech_metadata: Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как"Say cheerfully: Hello!"или"Speaker 1: Hello!"могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи (style) и метки говорящего (speaker) в структурированные метаданные:- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
"type": "speech_metadata","speaker"и"style". - GenerateContent API: Прикрепите
"speech_metadata": {"speaker": "...", "style": "..."}к каждойpart.
- API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры
- Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например,
<laugh>,<sigh>,<cough>,<breath>или<short pause>). Стили подачи, такие как шепот, следует указывать в файлеspeech_metadata.style. - В запросах с несколькими говорящими необходимо явно указывать
speakerв каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указыватьspeakerвspeech_metadataсоответствующего одному из настроенных говорящих. - Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор
voice_...в запросах TTS с минимальными или пустыми строкамиstyle. - Учитывайте вывод WAV-файлов по умолчанию (
audio/wav) при унарных запросах: в отличие отgemini-3.1-flash-tts-previewи более ранних моделей TTS (которые по умолчанию возвращали необработанный PCMaudio/l16без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы (audio/wav/AUDIO_WAV) со стандартным заголовком RIFF для унарных запросов.- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
waveв Python илиffmpeg), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл.wav. - Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите
response_formatв значение"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") или"audio/alaw"("AUDIO_ALAW"). См. раздел "Форматы вывода аудио" .
- Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля
gemini-3.8-flash-lite-tts
| Свойство | Описание |
|---|---|
| Код модели | gemini-3.8-flash-lite-tts |
| Поддерживаемые типы данных | Входные данные Текст Выход Аудио |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 8192 лимит выходных токенов 16,384 |
| Возможности | Поддерживается Поддерживается Не поддерживается Не поддерживается Не поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Не поддерживается Не поддерживается Структурированные выходные данные Не поддерживается Не поддерживается Не поддерживается |
| Варианты потребления | Поддерживается Поддерживается Поддерживается |
| версии |
|
| Последнее обновление | Июль 2026 г. |
Поддерживаемые языки
gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает 101 язык :
| Язык | Язык | Язык |
|---|---|---|
| Ачехский (арабский алфавит) | грузинский | мальтийский |
| африкаанс | немецкий | Манипури |
| Акан | греческий | маратхи |
| амхарский | гуджарати | Минангкабау (арабская письменность) |
| армянский | гаитянский креольский | Мизо |
| ассамский | Халх Монгольский | Непальский (отдельный язык) |
| Авадхи | Хауса | Нигерийский Фульфульде |
| балийский | иврит | Северный Азербайджан |
| Бенгальский | хинди | Северный Сото |
| Банджар (лат.) | венгерский | Северный узбек |
| Баскский | исландский | Норвежский букмол |
| белорусский | Илоко | Норвежский Нюнорск |
| Бходжпури | индонезийский | Ньянджа |
| боснийский | иранский персидский | Одиа (отдельный язык) |
| Бугинский | итальянский | Персидский (Афганистан) |
| болгарский | японский | польский |
| кантонский | яванский | португальский |
| каталанский | Камба | Пенджаби |
| Себуано | Каннада | румынский |
| Центральный Курдский | Кашмирский (арабский алфавит) | Русский |
| Чхаттисгархи | Кашмирский (письмо Дева) | Сантали |
| Китайский (Гансовский алфавит) | казахский | сербский |
| Китайский (хантийский алфавит) | кхмерский | сингальский |
| хорватский | Кикую | словацкий |
| чешский | Киньяруанда | Южный Азербайджан |
| датский | Конго | Южный пушту |
| Голландский | корейский | испанский |
| египетский арабский | кыргызы | Стандартный арабский язык (арабская письменность) |
| Английский | Лао | Стандартный арабский язык (лат. алфавит) |
| эстонский | Лингала | Стандартный латышский |
| филиппинский | македонский | Стандартный малайский |
| Французский | Магахи | тамильский |
| галисийский | Майтхили | телугу |
| Ганда | Малаялам | — |