Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) — это быстрая и экономичная модель преобразования текста в речь от Google, созданная для замены gemini-3.1-flash-tts-preview в высокопроизводительных производственных средах.

Обзор и возможности

Система преобразования текста в речь Gemini 3.8 Flash-Lite TTS сочетает в себе низкую задержку и выразительную, естественную речь:

  • Высокая производительность: оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи от одного говорящего на основных языках.
  • Совместимость со схемой без изменений: использует ту же самую схему API и формат структурированных запросов, что и gemini-3.8-flash-tts , что позволяет переключаться между моделями с помощью изменения одного параметра.
  • Полная поддержка голосовой экосистемы: поддерживаются готовые голоса, расширенная библиотека голосов ( GET /v1beta/voices ), пользовательские профили голосов и репликация голосов (по умолчанию — постоянно сохраненные голоса, а также дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .

Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .

Когда использовать ту или иную модель синтеза речи

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция / рабочая нагрузка Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts )
Основная сила Высокая пропускная способность, низкая задержка и экономичность. Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов.
Наилучшие варианты использования Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты.
Поддерживаемые языки 101 язык 130 языков
Рекомендуемая замена для gemini-3.1-flash-tts-preview Новый флагманский креативный уровень

Руководство по миграции

Если вы обновляете gemini-3.1-flash-tts-preview до gemini-3.8-flash-lite-tts , обновите свои запросы для схемы Gemini 3.8 TTS:

  1. Переместите указания уровня реплики в speech_metadata : Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как "Say cheerfully: Hello!" или "Speaker 1: Hello!" могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи ( style ) и метки говорящего ( speaker ) в структурированные метаданные:
    • API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры "type": "speech_metadata" , "speaker" и "style" .
    • GenerateContent API: Прикрепите "speech_metadata": {"speaker": "...", "style": "..."} к каждой part .
  2. Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например, <laugh> , <sigh> , <cough> , <breath> или <short pause> ). Стили подачи, такие как шепот, следует указывать в файле speech_metadata.style .
  3. В запросах с несколькими говорящими необходимо явно указывать speaker в каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указывать speaker в speech_metadata соответствующего одному из настроенных говорящих.
  4. Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style .
  5. Учитывайте вывод WAV-файлов по умолчанию ( audio/wav ) при унарных запросах: в отличие от gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы ( audio/wav / AUDIO_WAV ) со стандартным заголовком RIFF для унарных запросов.
    • Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля wave в Python или ffmpeg ), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл .wav .
    • Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите response_format в значение "audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) или "audio/alaw" ( "AUDIO_ALAW" ). См. раздел "Форматы вывода аудио" .

gemini-3.8-flash-lite-tts

Свойство Описание
Код модели gemini-3.8-flash-lite-tts
Поддерживаемые типы данных

Входные данные

Текст

Выход

Аудио

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

8192

лимит выходных токенов

16 384 (лимит обслуживания API Gemini)

Возможности

Генерация аудио

Поддерживается

Кэширование

Поддерживается

Выполнение кода

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Не поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Не поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Не поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Поддерживается

Приоритетный вывод

Поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • gemini-3.8-flash-lite-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков :

Язык Язык Язык
Ачехский (арабский алфавит) немецкий Манипури
африкаанс греческий маратхи
Акан гуджарати Минангкабау (арабская письменность)
амхарский гаитянский креольский Мизо
армянский Халх Монгольский Непальский (отдельный язык)
ассамский Хауса Нигерийский Фульфульде
Авадхи иврит Северный Азербайджан
балийский хинди Северный Сото
Бенгальский венгерский Северный узбек
Банджар (лат.) исландский Норвежский букмол
Баскский Илоко Норвежский Нюнорск
белорусский индонезийский Ньянджа
Бходжпури иранский персидский Одиа (отдельный язык)
боснийский итальянского Персидский (Афганистан)
Бугинский японский польский
болгарский яванский португальский
кантонский Камба Пенджаби
каталанский Каннада румынский
Себуано Кашмирский (арабский алфавит) Русский
Центральный Курдский Кашмирский (письмо Дева) Сантали
Чхаттисгархи казахский сербский
Китайский (ханьский алфавит) кхмерский сингальский
Китайский (хантийский алфавит) Кикую словацкий
хорватский Киньяруанда Южный Азербайджан
чешский Конго Южный пушту
датский корейский испанский
Голландский кыргызы Стандартный арабский язык (арабская письменность)
египетский арабский Лао Стандартный арабский язык (лат. алфавит)
Английский Лингала Стандартный латышский
эстонский македонский Стандартный малайский
филиппинский Магахи тамильский
Французский Майтхили телугу
галисийский Малаялам турецкий
Ганда мальтийский вьетнамский
грузинский — —
,

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) — это быстрая и экономичная модель преобразования текста в речь от Google, созданная для замены gemini-3.1-flash-tts-preview в высокопроизводительных производственных средах.

Обзор и возможности

Система преобразования текста в речь Gemini 3.8 Flash-Lite TTS сочетает в себе низкую задержку и выразительную, естественную речь:

  • Высокая производительность: оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи от одного говорящего на основных языках.
  • Совместимость со схемой без изменений: использует ту же самую схему API и формат структурированных запросов, что и gemini-3.8-flash-tts , что позволяет переключаться между моделями с помощью изменения одного параметра.
  • Полная поддержка голосовой экосистемы: поддерживаются готовые голоса, расширенная библиотека голосов ( GET /v1beta/voices ), пользовательские профили голосов и репликация голосов (по умолчанию — постоянно сохраненные голоса, а также дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .

Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .

Когда использовать ту или иную модель синтеза речи

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция / рабочая нагрузка Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts )
Основная сила Высокая пропускная способность, низкая задержка и экономичность. Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов.
Наилучшие варианты использования Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты.
Поддерживаемые языки 101 язык 130 языков
Рекомендуемая замена для gemini-3.1-flash-tts-preview Новый флагманский креативный уровень

Руководство по миграции

Если вы обновляете gemini-3.1-flash-tts-preview до gemini-3.8-flash-lite-tts , обновите свои запросы для схемы Gemini 3.8 TTS:

  1. Переместите указания уровня реплики в speech_metadata : Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как "Say cheerfully: Hello!" или "Speaker 1: Hello!" могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи ( style ) и метки говорящего ( speaker ) в структурированные метаданные:
    • API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры "type": "speech_metadata" , "speaker" и "style" .
    • GenerateContent API: Прикрепите "speech_metadata": {"speaker": "...", "style": "..."} к каждой part .
  2. Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например, <laugh> , <sigh> , <cough> , <breath> или <short pause> ). Стили подачи, такие как шепот, следует указывать в файле speech_metadata.style .
  3. В запросах с несколькими говорящими необходимо явно указывать speaker в каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указывать speaker в speech_metadata соответствующего одному из настроенных говорящих.
  4. Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style .
  5. Учитывайте вывод WAV-файлов по умолчанию ( audio/wav ) при унарных запросах: в отличие от gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы ( audio/wav / AUDIO_WAV ) со стандартным заголовком RIFF для унарных запросов.
    • Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля wave в Python или ffmpeg ), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл .wav .
    • Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите response_format в значение "audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) или "audio/alaw" ( "AUDIO_ALAW" ). См. раздел "Форматы вывода аудио" .

gemini-3.8-flash-lite-tts

Свойство Описание
Код модели gemini-3.8-flash-lite-tts
Поддерживаемые типы данных

Входные данные

Текст

Выход

Аудио

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

8192

лимит выходных токенов

16 384 (лимит обслуживания API Gemini)

Возможности

Генерация аудио

Поддерживается

Кэширование

Поддерживается

Выполнение кода

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Не поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Не поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Не поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Поддерживается

Приоритетный вывод

Поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • gemini-3.8-flash-lite-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков :

Язык Язык Язык
Ачехский (арабский алфавит) немецкий Манипури
африкаанс греческий маратхи
Акан гуджарати Минангкабау (арабская письменность)
амхарский гаитянский креольский Мизо
армянский Халх Монгольский Непальский (отдельный язык)
ассамский Хауса Нигерийский Фульфульде
Авадхи иврит Северный Азербайджан
балийский хинди Северный Сото
Бенгальский венгерский Северный узбек
Банджар (лат.) исландский Норвежский букмол
Баскский Илоко Норвежский Нюнорск
белорусский индонезийский Ньянджа
Бходжпури иранский персидский Одиа (отдельный язык)
боснийский итальянского Персидский (Афганистан)
Бугинский японский польский
болгарский яванский португальский
кантонский Камба Пенджаби
каталанский Каннада румынский
Себуано Кашмирский (арабский алфавит) Русский
Центральный Курдский Кашмирский (письмо Дева) Сантали
Чхаттисгархи казахский сербский
Китайский (ханьский алфавит) кхмерский сингальский
Китайский (хантийский алфавит) Кикую словацкий
хорватский Киньяруанда Южный Азербайджан
чешский Конго Южный пушту
датский корейский испанский
Голландский кыргызы Стандартный арабский язык (арабская письменность)
египетский арабский Лао Стандартный арабский язык (лат. алфавит)
Английский Лингала Стандартный латышский
эстонский македонский Стандартный малайский
филиппинский Магахи тамильский
Французский Майтхили телугу
галисийский Малаялам турецкий
Ганда мальтийский вьетнамский
грузинский — —
,

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) — это быстрая и экономичная модель преобразования текста в речь от Google, созданная для замены gemini-3.1-flash-tts-preview в высокопроизводительных производственных средах.

Обзор и возможности

Система преобразования текста в речь Gemini 3.8 Flash-Lite TTS сочетает в себе низкую задержку и выразительную, естественную речь:

  • Высокая производительность: оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи от одного говорящего на основных языках.
  • Совместимость со схемой без изменений: использует ту же самую схему API и формат структурированных запросов, что и gemini-3.8-flash-tts , что позволяет переключаться между моделями с помощью изменения одного параметра.
  • Полная поддержка голосовой экосистемы: поддерживаются готовые голоса, расширенная библиотека голосов ( GET /v1beta/voices ), пользовательские профили голосов и репликация голосов (по умолчанию — постоянно сохраненные голоса, а также дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .

Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .

Когда использовать ту или иную модель синтеза речи

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция / рабочая нагрузка Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts )
Основная сила Высокая пропускная способность, низкая задержка и экономичность. Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов.
Наилучшие варианты использования Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты.
Поддерживаемые языки 101 язык 130 языков
Рекомендуемая замена для gemini-3.1-flash-tts-preview Новый флагманский креативный уровень

Руководство по миграции

Если вы обновляете gemini-3.1-flash-tts-preview до gemini-3.8-flash-lite-tts , обновите свои запросы для схемы Gemini 3.8 TTS:

  1. Переместите указания уровня реплики в speech_metadata : Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как "Say cheerfully: Hello!" или "Speaker 1: Hello!" могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи ( style ) и метки говорящего ( speaker ) в структурированные метаданные:
    • API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры "type": "speech_metadata" , "speaker" и "style" .
    • GenerateContent API: Прикрепите "speech_metadata": {"speaker": "...", "style": "..."} к каждой part .
  2. Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например, <laugh> , <sigh> , <cough> , <breath> или <short pause> ). Стили подачи, такие как шепот, следует указывать в файле speech_metadata.style .
  3. В запросах с несколькими говорящими необходимо явно указывать speaker в каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указывать speaker в speech_metadata соответствующего одному из настроенных говорящих.
  4. Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style .
  5. Учитывайте вывод WAV-файлов по умолчанию ( audio/wav ) при унарных запросах: в отличие от gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы ( audio/wav / AUDIO_WAV ) со стандартным заголовком RIFF для унарных запросов.
    • Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля wave в Python или ffmpeg ), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл .wav .
    • Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите response_format в значение "audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) или "audio/alaw" ( "AUDIO_ALAW" ). См. раздел "Форматы вывода аудио" .

gemini-3.8-flash-lite-tts

Свойство Описание
Код модели gemini-3.8-flash-lite-tts
Поддерживаемые типы данных

Входные данные

Текст

Выход

Аудио

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

8192

лимит выходных токенов

16 384 (лимит обслуживания API Gemini)

Возможности

Генерация аудио

Поддерживается

Кэширование

Поддерживается

Выполнение кода

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Не поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Не поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Не поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Поддерживается

Приоритетный вывод

Поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • gemini-3.8-flash-lite-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков :

Язык Язык Язык
Ачехский (арабский алфавит) немецкий Манипури
африкаанс греческий маратхи
Акан гуджарати Минангкабау (арабская письменность)
амхарский гаитянский креольский Мизо
армянский Халх Монгольский Непальский (отдельный язык)
ассамский Хауса Нигерийский Фульфульде
Авадхи иврит Северный Азербайджан
балийский хинди Северный Сото
Бенгальский венгерский Северный узбек
Банджар (лат.) исландский Норвежский букмол
Баскский Илоко Норвежский Нюнорск
белорусский индонезийский Ньянджа
Бходжпури иранский персидский Одиа (отдельный язык)
боснийский итальянского Персидский (Афганистан)
Бугинский японский польский
болгарский яванский португальский
кантонский Камба Пенджаби
каталанский Каннада румынский
Себуано Кашмирский (арабский алфавит) Русский
Центральный Курдский Кашмирский (письмо Дева) Сантали
Чхаттисгархи казахский сербский
Китайский (ханьский алфавит) кхмерский сингальский
Китайский (хантийский алфавит) Кикую словацкий
хорватский Киньяруанда Южный Азербайджан
чешский Конго Южный пушту
датский корейский испанский
Голландский кыргызы Стандартный арабский язык (арабская письменность)
египетский арабский Лао Стандартный арабский язык (лат. алфавит)
Английский Лингала Стандартный латышский
эстонский македонский Стандартный малайский
филиппинский Магахи тамильский
Французский Майтхили телугу
галисийский Малаялам турецкий
Ганда мальтийский вьетнамский
грузинский — —
,

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) — это быстрая и экономичная модель преобразования текста в речь от Google, созданная для замены gemini-3.1-flash-tts-preview в высокопроизводительных производственных средах.

Обзор и возможности

Система преобразования текста в речь Gemini 3.8 Flash-Lite TTS сочетает в себе низкую задержку и выразительную, естественную речь:

  • Высокая производительность: оптимизировано для массового производства, каскадов разговорных голосовых агентов, функций чтения вслух и повседневной генерации речи от одного говорящего на основных языках.
  • Совместимость со схемой без изменений: использует ту же самую схему API и формат структурированных запросов, что и gemini-3.8-flash-tts , что позволяет переключаться между моделями с помощью изменения одного параметра.
  • Полная поддержка голосовой экосистемы: поддерживаются готовые голоса, расширенная библиотека голосов ( GET /v1beta/voices ), пользовательские профили голосов и репликация голосов (по умолчанию — постоянно сохраненные голоса, а также дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .

Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .

Когда использовать ту или иную модель синтеза речи

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция / рабочая нагрузка Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts )
Основная сила Высокая пропускная способность, низкая задержка и экономичность. Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов.
Наилучшие варианты использования Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего. Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты.
Поддерживаемые языки 101 язык 130 языков
Рекомендуемая замена для gemini-3.1-flash-tts-preview Новый флагманский креативный уровень

Руководство по миграции

Если вы обновляете gemini-3.1-flash-tts-preview до gemini-3.8-flash-lite-tts , обновите свои запросы для схемы Gemini 3.8 TTS:

  1. Переместите указания уровня реплики в speech_metadata : Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как "Say cheerfully: Hello!" или "Speaker 1: Hello!" могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи ( style ) и метки говорящего ( speaker ) в структурированные метаданные:
    • API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры "type": "speech_metadata" , "speaker" и "style" .
    • GenerateContent API: Прикрепите "speech_metadata": {"speaker": "...", "style": "..."} к каждой part .
  2. Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например, <laugh> , <sigh> , <cough> , <breath> или <short pause> ). Стили подачи, такие как шепот, следует указывать в файле speech_metadata.style .
  3. В запросах с несколькими говорящими необходимо явно указывать speaker в каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указывать speaker в speech_metadata соответствующего одному из настроенных говорящих.
  4. Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style .
  5. Учитывайте вывод WAV-файлов по умолчанию ( audio/wav ) при унарных запросах: в отличие от gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы ( audio/wav / AUDIO_WAV ) со стандартным заголовком RIFF для унарных запросов.
    • Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля wave в Python или ffmpeg ), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл .wav .
    • Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите response_format в значение "audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) или "audio/alaw" ( "AUDIO_ALAW" ). См. раздел "Форматы вывода аудио" .

gemini-3.8-flash-lite-tts

Свойство Описание
Код модели gemini-3.8-flash-lite-tts
Поддерживаемые типы данных

Входные данные

Текст

Выход

Аудио

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

8192

лимит выходных токенов

16 384 (лимит обслуживания API Gemini)

Возможности

Генерация аудио

Поддерживается

Кэширование

Поддерживается

Выполнение кода

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Не поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Не поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Не поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Поддерживается

Приоритетный вывод

Поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • gemini-3.8-flash-lite-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-lite-tts автоматически определяет язык ввода и поддерживает более 100 языков :

Язык Язык Язык
Ачехский (арабский алфавит) немецкий Манипури
африкаанс греческий маратхи
Акан гуджарати Минангкабау (арабская письменность)
амхарский гаитянский креольский Мизо
армянский Халх Монгольский Непальский (отдельный язык)
ассамский Хауса Нигерийский Фульфульде
Авадхи иврит Северный Азербайджан
балийский хинди Северный Сото
Бенгальский венгерский Северный узбек
Банджар (лат.) исландский Норвежский букмол
Баскский Илоко Норвежский Нюнорск
белорусский индонезийский Ньянджа
Бходжпури иранский персидский Одиа (отдельный язык)
боснийский итальянского Персидский (Афганистан)
Бугинский японский польский
болгарский яванский португальский
кантонский Камба Пенджаби
каталанский Каннада румынский
Себуано Кашмирский (арабский алфавит) Русский
Центральный Курдский Кашмирский (письмо Дева) Сантали
Чхаттисгархи казахский сербский
Китайский (ханьский алфавит) кхмерский сингальский
Китайский (хантийский алфавит) Кикую словацкий
хорватский Киньяруанда Южный Азербайджан
чешский Конго Южный пушту
датский корейский испанский
Голландский кыргызы Стандартный арабский язык (арабская письменность)
египетский арабский Лао Стандартный арабский язык (лат. алфавит)
Английский Лингала Стандартный латышский
эстонский македонский Стандартный малайский
филиппинский Магахи тамильский
Французский Майтхили телугу
галисийский Малаялам турецкий
Ганда мальтийский вьетнамский
грузинский — —