Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) – это быстрая и экономичная модель синтеза речи от Google, которая призвана заменить gemini-3.1-flash-tts-preview для рабочих нагрузок с высокой пропускной способностью.

Обзор и возможности

Gemini 3.8 Flash-Lite TTS сочетает низкую задержку с выразительной и естественной речью:

  • Высокая эффективность. Оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи одним говорящим на основных языках.
  • Совместимость со схемой. Использует ту же схему API и формат структурированных запросов, что и gemini-3.8-flash-tts, поэтому вы можете переключаться между моделями, изменив всего один параметр.
  • Полная поддержка голосовой экосистемы. Поддерживаются встроенные голоса, расширенная библиотека голосов (GET /v1beta/voices), персонализированные дизайны голосов и репликация голоса (по умолчанию используются сохраненные голоса, а также можно использовать ключи без сохранения состояния). Вы также можете создавать и воспроизводить голоса в интерактивном режиме в Google AI Studio.

Подробную информацию о функциях, рекомендации по составлению запросов и примеры кода можно найти в руководстве по преобразованию текста в речь.

Когда использовать ту или иную модель TTS

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру запросов. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция или рабочая нагрузка Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Основная сила высокая пропускная способность, низкая задержка и экономичность; Максимальная точность передачи голоса, нюансов игры и диалектов
Примеры использования Массовое производство, каскады голосовых агентов в реальном времени, функции озвучивания текста, копирование голоса, повседневная генерация речи одним говорящим Аудиокниги, студийная озвучка, сложные диалоги с несколькими говорящими, эмоциональные реплики, сложное произношение, региональные диалекты.
Поддерживаемые языки 101 язык 130 языков
Рекомендуемая замена gemini-3.1-flash-tts-preview Новый уровень креативов

Руководство по переходу

Если вы переходите с gemini-3.1-flash-tts-preview на gemini-3.8-flash-lite-tts, обновите запросы для схемы Gemini 3.8 TTS:

  1. Перенос пошаговых инструкций в speech_metadata. Gemini 3.8 TTS воспринимает входной текст как дословную транскрипцию. Встроенные текстовые инструкции, например "Say cheerfully: Hello!" или "Speaker 1: Hello!", могут быть озвучены. Перенесите инструкции по непрерывной доставке (style) и ярлыки говорящих (speaker) в структурированные метаданные:
    • Interactions API. Добавьте аннотацию с помощью "type": "speech_metadata", "speaker" и "style" к каждому блоку текстового контента.
    • GenerateContent API: добавьте "speech_metadata": {"speaker": "...", "style": "..."} к каждому part.
  2. Используйте встроенные теги в угловых скобках только для обозначения вокальных событий, происходящих в определенный момент времени. Кратковременные неречевые вокализации и паузы следует обозначать в тексте с помощью угловых скобок (например, <laugh>, <sigh>, <cough>, <breath> или <short pause>). Стиль речи, например шепот, указывайте в тегах speech_metadata.style.
  3. Указывайте speaker в каждом ответе на запрос с несколькими говорящими. Каждый ответ на запрос с несколькими говорящими должен явно содержать speaker внутри speech_metadata, соответствующий одному из настроенных говорящих.
  4. Создайте персонажей с помощью функции "Дизайн голоса". Замените длинные блоки "Аудиопрофиль" или "Заметки режиссера" на пользовательский голос, созданный в Дизайне голоса, а затем передайте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style.
  5. Учитывайте, что по умолчанию для запросов с одним ответом используется формат WAV (audio/wav). В отличие от модели gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанные данные PCM без заголовка audio/l16), модель Gemini 3.8 TTS по умолчанию возвращает аудио в формате WAV (audio/wav / AUDIO_WAV) со стандартным заголовком RIFF для запросов с одним ответом.
    • Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля wave Python или ffmpeg), удалите оболочку заголовка и запишите возвращенные байты непосредственно в файл .wav.
    • Если для конвейера требуется аудио в формате headerless raw PCM, mu-law или A-law, явно задайте для параметра response_format.mime_type значение "audio/l16", "audio/mulaw" или "audio/alaw" (например, {"response_format": {"type": "audio", "mime_type": "audio/l16"}} в Interactions API или AUDIO_L16, AUDIO_MULAW или AUDIO_ALAW в generateContent). Подробнее о форматах аудиовыхода…

gemini-3.8-flash-lite-tts

Свойство Описание
Код модели gemini-3.8-flash-lite-tts
Поддерживаемые типы данных

Входные данные

Текст

Выходные данные

Аудио

Ограничения на количество токенов[*]

Лимит на количество входных токенов

8192

Лимит на количество выходных токенов

16 384 (ограничение Gemini API)

Возможности

Генератор аудио

Что пользователь может

Кеширование

Чего пользователь не может

Выполнение кода

Чего пользователь не может

Поиск файлов

Чего пользователь не может

Вызов функций

Чего пользователь не может

Обоснование с Google Картами

Чего пользователь не может

Генерирование изображений

Чего пользователь не может

Live API

Чего пользователь не может

Находите информацию из надежных источников

Чего пользователь не может

Структурированные выходные данные

Чего пользователь не может

Размышления

Чего пользователь не может

Контекст URL

Чего пользователь не может

Варианты просмотра

Batch API

Что пользователь может

Гибкий инференс

Что пользователь может

Определение приоритета

Что пользователь может

Версии
Подробнее о шаблонах версий моделей…
  • gemini-3.8-flash-lite-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков:

Язык Язык Язык
Ачехский (арабская письменность) Немецкий Манипури
Африкаанс Греческий Маратхи
Акан Гуджарати Минангкабау (арабское письмо)
Амхарский Гаитянский креольский Мизо
Армянский Халха-монгольский Непальский (отдельный язык)
Ассамский Хауса Фула (Нигерия)
Авадхи Иврит Североазербайджанский
Балийский хинди Сото северный
Бенгальский Венгерский Северный узбекский
Банджарский (латиница) Исландский Норвежский букмол
Баскский илоканский Норвежский (новонорвежский)
Belarusian Индонезийский Ньянджа
Бходжпури Персидский (Иран) Одия (отдельный язык)
Боснийский Итальянский Персидский (Афганистан)
Бугийский Японский Польский
Болгарский Яванский Португальский
Кантонский Камба Пенджабский
Каталанский Каннада Румынский
Себуанский Кашмири (арабское письмо) Русский
Центральнокурдский Кашмири (деванагари) Сантали
Чхаттисгархи Казахский Сербский
Китайский (упрощенный) Кхмерский Сингальский
Китайский (традиционное письмо) Кикуйю Словацкий
Хорватский Киньяруанда Южноазербайджанский
Чешский Конго Южный пушту
Датский Корейский Испанский
Нидерландский Киргизский Стандартный арабский (арабский шрифт)
арабский (Египет) Лаосский Стандартный арабский (латиница)
Английский Лингала Стандартный латышский
Эстонский Македонский Стандартный малайский
Филиппинский Магахи Тамильский
Французский Майтхили Телугу
Галисийский Малаялам Турецкий
Ganda Мальтийский Вьетнамский
Грузинский — —