Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) – флагманская модель Google для преобразования текста в речь, разработанная для создания голоса студийного качества, выразительной речи, аутентичных региональных акцентов и стабильной работы с длинными текстами.

Обзор и возможности

Gemini 3.8 Flash TTS задает новый стандарт выразительности аудио:

  • Высокое качество звука и нюансы актерской игры. Голос передает широкий спектр эмоций, звучит естественно и точно соответствует указаниям на уровне реплик style и встроенным вокальным событиям (<laugh>, <sigh>, <short pause>).
  • Стабильность при длительном многоходовом диалоге. Поддерживает постоянство голоса, тембра, громкости и акустического тона помещения в течение длительных диалогов и многоминутных повествований без отклонений.
  • Аутентичные региональные акценты и произношение. Поддерживаются региональные акценты и диалекты.
  • Поддержка всех голосовых экосистем. Бесперебойная работа с готовыми голосами, расширенной библиотекой голосов (GET /v1beta/voices), персонализированными дизайнами голосов и репликацией голоса (по умолчанию используются сохраненные голоса, но можно также использовать ключи без сохранения состояния). Вы также можете создавать и воспроизводить голоса в интерактивном режиме в Google AI Studio.

Подробную информацию о функциях, рекомендации по составлению запросов и примеры кода можно найти в руководстве по преобразованию текста в речь.

Когда использовать ту или иную модель TTS

Обе модели Gemini 3.8 TTS используют одну и ту же схему API и структуру запросов. Выберите модель, которая подходит для вашей рабочей нагрузки:

Функция или рабочая нагрузка Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Основная сила Максимальная точность передачи голоса, нюансов игры и диалектов высокая пропускная способность, низкая задержка и экономичность;
Примеры использования Аудиокниги, студийная озвучка, сложные диалоги с несколькими говорящими, эмоциональные реплики, сложное произношение, региональные диалекты. Массовое производство, каскады голосовых агентов в реальном времени, функции озвучивания текста, копирование голоса, повседневная генерация речи одним говорящим
Поддерживаемые языки 130 языков 101 язык
Рекомендуемая замена Новый уровень креативов gemini-3.1-flash-tts-preview

Руководство по переходу

Если вы переходите с gemini-3.1-flash-tts-preview или более ранних моделей Gemini TTS, обновите запросы в соответствии со схемой Gemini 3.8 TTS:

  1. Перенос пошаговых инструкций в speech_metadata. Gemini 3.8 TTS воспринимает входной текст как дословную транскрипцию. Встроенные текстовые инструкции, например "Say cheerfully: Hello!" или "Speaker 1: Hello!", могут быть озвучены. Перенесите инструкции по непрерывной доставке (style) и ярлыки говорящих (speaker) в структурированные метаданные:
    • Interactions API. Добавьте аннотацию с помощью "type": "speech_metadata", "speaker" и "style" к каждому блоку текстового контента.
    • GenerateContent API: добавьте "speech_metadata": {"speaker": "...", "style": "..."} к каждому part.
  2. Используйте встроенные теги в угловых скобках только для обозначения вокальных событий, происходящих в определенный момент времени. Кратковременные неречевые вокализации и паузы следует обозначать в тексте с помощью угловых скобок (например, <laugh>, <sigh>, <cough>, <breath> или <short pause>). Стиль речи, например шепот, указывайте в тегах speech_metadata.style.
  3. Указывайте speaker в каждом ответе на запрос с несколькими говорящими. Каждый ответ на запрос с несколькими говорящими должен явно содержать speaker внутри speech_metadata, соответствующий одному из настроенных говорящих.
  4. Создайте персонажей с помощью функции "Дизайн голоса". Замените длинные блоки "Аудиопрофиль" или "Заметки режиссера" на пользовательский голос, созданный в Дизайне голоса, а затем передайте этот идентификатор voice_... в запросах TTS с минимальными или пустыми строками style.
  5. Учитывайте формат WAV (audio/wav) по умолчанию для запросов с одним сообщением. В отличие от модели gemini-3.1-flash-tts-preview и более ранних моделей TTS (которые по умолчанию возвращали необработанный PCM-файл audio/l16 без заголовка), Gemini 3.8 TTS по умолчанию возвращает аудио в формате WAV (audio/wav / AUDIO_WAV) со стандартным заголовком RIFF для запросов с одним сообщением.
    • Если ваш код ранее оборачивал необработанные байты PCM в заголовок WAV (например, с помощью модуля wave Python или ffmpeg), удалите оболочку заголовка и запишите возвращенные байты непосредственно в файл .wav.
    • Если для конвейера требуется аудио в формате PCM без заголовка, mu-law или A-law, явно задайте для параметра response_format.mime_type значение "audio/l16", "audio/mulaw" или "audio/alaw" (например, {"response_format": {"type": "audio", "mime_type": "audio/l16"}} в Interactions API или AUDIO_L16, AUDIO_MULAW или AUDIO_ALAW в generateContent). Подробнее о форматах аудиовыхода…

gemini-3.8-flash-tts

Свойство Описание
Код модели gemini-3.8-flash-tts
Поддерживаемые типы данных

Входные данные

Текст

Выходные данные

Аудио

Ограничения на количество токенов[*]

Лимит на количество входных токенов

8192

Лимит на количество выходных токенов

16 384 (ограничение Gemini API)

Возможности

Генератор аудио

Что пользователь может

Кеширование

Чего пользователь не может

Выполнение кода

Чего пользователь не может

Поиск файлов

Чего пользователь не может

Вызов функций

Чего пользователь не может

Обоснование с Google Картами

Чего пользователь не может

Генерирование изображений

Чего пользователь не может

Live API

Чего пользователь не может

Находите информацию из надежных источников

Чего пользователь не может

Структурированные выходные данные

Чего пользователь не может

Размышления

Чего пользователь не может

Контекст URL

Чего пользователь не может

Варианты просмотра

Batch API

Что пользователь может

Гибкий инференс

Что пользователь может

Определение приоритета

Что пользователь может

Версии
Подробнее о шаблонах версий моделей…
  • gemini-3.8-flash-tts
Последнее обновление Сентябрь 2026 г.

Поддерживаемые языки

gemini-3.8-flash-tts автоматически определяет язык ввода и поддерживает более 130 языков:

Язык Язык Язык
Ачехский (арабская письменность) Греческий Непальский (отдельный язык)
Африкаанс Гуарани Фула (Нигерия)
Акан Гуджарати Североазербайджанский
Амхарский Гаитянский креольский Сото северный
Армянский Халха-монгольский Северный узбекский
Ассамский Хауса Норвежский букмол
Авадхи Иврит Норвежский (новонорвежский)
Балийский хинди Ньянджа
Бенгальский Венгерский Окситанский
Банджарский (арабская письменность) Исландский Одия (отдельный язык)
Банджарский (латиница) Игбо Пангасинанский
Башкирский илоканский Персидский (Афганистан)
Баскский Индонезийский Польский
Belarusian Персидский (Иран) Португальский
бемба Итальянский Пенджабский
Бходжпури Японский Румынский
Боснийский Яванский Русский
Бугийский Кабильский Сантали
Болгарский Камба Сербский
Бирманский Каннада Синдхи
Кантонский Кашмири (арабское письмо) Сингальский
Каталанский Кашмири (деванагари) Словацкий
Себуанский Казахский Словенский
Центральнокурдский Кхмерский Сомали
Чхаттисгархи Кикуйю Южноазербайджанский
Китайский (упрощенный) Киньяруанда Южный пушту
Китайский (традиционное письмо) Конго Южный сото
Крымско-татарский Корейский Испанский
Хорватский Киргизский Стандартный арабский (арабский шрифт)
Чешский Лаосский Стандартный арабский (латиница)
Датский Латгальский Стандартный латышский
Нидерландский Лингала Стандартный малайский
Дьюла Литовский Суахили (отдельный язык)
Дзонг-кэ Люксембургский Свати
арабский (Египет) Македонский Шведский
Английский Магахи Таджикский
Эстонский Майтхили Тамильский
Филиппинский Малаялам Телугу
Финский Мальтийский Тайский
Французский Манипури Тигринский
Галисийский Маратхи Тоскский (албанский)
Ganda Минангкабау (арабское письмо) Турецкий
Грузинский Минангкабау (латиница) Уйгурский
Немецкий Мизо Вьетнамский