Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) — это флагманская модель преобразования текста в речь от Google, разработанная для обеспечения студийного качества звука, выразительной игры актеров, аутентичных региональных акцентов и исключительной стабильности при многократных оборотах.

Обзор и возможности

Gemini 3.8 Flash TTS устанавливает новый стандарт выразительного воспроизведения звука:

  • Высокая акустическая точность и актерская тонкость: демонстрирует богатый эмоциональный диапазон, естественную интонацию и точное следование указаниям style и вокальным переходам ( <laugh> , <sigh> , <short pause> ).
  • Стабильность звучания на протяжении длительных диалогов и многоминутных повествований: обеспечивает сохранение неизменной идентичности голоса, тембра, громкости и акустического тона помещения на протяжении продолжительных диалогов и многоминутных закадровых текстов без смещения голоса.
  • Аутентичные региональные акценты и произношение: Поддерживает региональные акценты, диалекты меньшинств и встроенные настройки Международного фонетического алфавита (IPA).
  • Полная поддержка голосовой экосистемы: бесперебойная работа с предустановленными голосами, расширенной библиотекой голосов ( GET /v1beta/voices ), пользовательскими профилями пользователей Voice и репликацией голосов (по умолчанию — постоянно сохраненные голоса, плюс дополнительные ключи без сохранения состояния). Вы также можете создавать и реплицировать голоса в интерактивном режиме в Google AI Studio .

Для получения полной информации о функциях, лучших практиках использования подсказок и примерах кода посетите руководство по преобразованию текста в речь .

Когда использовать ту или иную модель синтеза речи

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру подсказок. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция / рабочая нагрузка Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts )
Основная сила Максимальная точность воспроизведения голоса, тонкость актерской игры и охват диалектов. Высокая пропускная способность, низкая задержка и экономичность.
Наилучшие варианты использования Аудиокниги, студийное озвучивание, сложные диалоги с участием нескольких говорящих, интенсивная игра актеров с использованием голосовых всплесков, сложное произношение, региональные диалекты. Высокопроизводительное производство, каскады голосовых агентов в реальном времени, функции чтения вслух, репликация голоса, повседневное создание аудиоконтента от одного говорящего.
Поддерживаемые языки 130 языков 101 язык
Рекомендуемая замена для Новый флагманский креативный уровень gemini-3.1-flash-tts-preview

Руководство по миграции

Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите свои запросы для схемы Gemini 3.8 TTS:

  1. Переместите указания уровня реплики в speech_metadata : Gemini 3.8 TTS обрабатывает входной текст строго как дословную расшифровку. Встроенные текстовые указания, такие как "Say cheerfully: Hello!" или "Speaker 1: Hello!" могут быть произнесены вслух. Переместите инструкции по продолжительной подаче речи ( style ) и метки говорящего ( speaker ) в структурированные метаданные:
    • API для взаимодействия: Добавьте к каждому блоку текстового содержимого аннотацию, содержащую параметры "type": "speech_metadata" , "speaker" и "style" .
    • GenerateContent API: Прикрепите "speech_metadata": {"speaker": "...", "style": "..."} к каждой part .
  2. Используйте встроенные теги в угловых скобках только для отдельных голосовых событий: короткие неречевые вокализации и паузы следует размещать непосредственно в транскрипте с помощью угловых скобок (например, <laugh> , <sigh> , <cough> , <breath> или <short pause> ). Стили подачи, такие как шепот, следует указывать в файле speech_metadata.style .
  3. В запросах с несколькими говорящими необходимо явно указывать speaker в каждом раунде: в каждом раунде запроса с несколькими говорящими необходимо явно указывать speaker в speech_metadata соответствующего одному из настроенных говорящих.
  4. Создавайте профили пользователей заранее с помощью проектирования голоса: замените устаревшие блоки «Аудиопрофиль / Заметки режиссера» пользовательским голосом, созданным в процессе проектирования голоса , а затем используйте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style .
  5. Учитывайте вывод WAV-файлов по умолчанию ( audio/wav ) при унарных запросах: в отличие от gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает WAV-аудиофайлы ( audio/wav / AUDIO_WAV ) со стандартным заголовком RIFF для унарных запросов.
    • Если в вашем коде ранее необработанные PCM-байты были упакованы в заголовок WAV (например, с помощью модуля wave в Python или ffmpeg ), удалите эту ручную упаковку заголовка и запишите полученные байты непосредственно в файл .wav .
    • Если ваш конвейер обработки данных требует необработанного аудио в формате PCM, mu-law или A-law без заголовка, явно установите response_format в значение "audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) или "audio/alaw" ( "AUDIO_ALAW" ). См. раздел "Форматы вывода аудио" .

gemini-3.8-flash-tts

Свойство Описание
Код модели gemini-3.8-flash-tts
Поддерживаемые типы данных

Входные данные

Текст

Выход

Аудио

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

8192

лимит выходных токенов

16,384

Возможности

Генерация аудио

Поддерживается

Кэширование

Поддерживается

Выполнение кода

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Не поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Не поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Не поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Поддерживается

Приоритетный вывод

Поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • gemini-3.8-flash-tts
Последнее обновление Июль 2026 г.

Поддерживаемые языки

gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает 130 языков :

Язык Язык Язык
Ачехский (арабский алфавит) греческий Непальский (отдельный язык)
африкаанс Гуарани Нигерийский Фульфульде
Акан гуджарати Северный Азербайджан
амхарский гаитянский креольский Северный Сото
армянский Халх Монгольский Северный узбек
ассамский Хауса норвежский букмол
Авадхи иврит Норвежский Нюнорск
балийский хинди Ньянджа
Бенгальский венгерский окситанский
Банджар (арабская письменность) исландский Одиа (отдельный язык)
Банджар (лат.) Игбо Пангасинан
Башкир Илоко Персидский (Афганистан)
Баскский индонезийский польский
белорусский иранский персидский португальский
Бемба итальянский Пенджаби
Бходжпури японский румынский
боснийский яванский Русский
Бугинский Кабиль Сантали
болгарский Камба сербский
бирманский Каннада Синдхи
кантонский Кашмирский (арабский алфавит) сингальский
каталанский Кашмирский (письмо Дева) словацкий
Себуано казахский словенский
Центральный Курдский кхмерский сомалийский
Чхаттисгархи Кикую Южный Азербайджан
Китайский (Гансовский алфавит) Киньяруанда Южный пушту
Китайский (хантийский алфавит) Конго Южный Сото
Крымский татарин корейский испанский
хорватский кыргызы Стандартный арабский язык (арабская письменность)
чешский Лао Стандартный арабский язык (лат. алфавит)
датский Латгальский Стандартный латышский
Голландский Лингала Стандартный малайский
Дьюла литовский Суахили (отдельный язык)
Дзонгкха люксембургский Свати
египетский арабский македонский шведский
Английский Магахи Таджик
эстонский Майтхили тамильский
филиппинский Малаялам телугу
финский мальтийский Тайский
Французский Манипури тигринья
галисийский маратхи Тоск Албанский
Ганда Минангкабау (арабская письменность) уйгурский
грузинский Минангкабау (лат.) —
немецкий Мизо —