Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS(gemini-3.8-flash-lite-tts)は、高スループットの本番環境ワークロード向けに gemini-3.1-flash-tts-preview を置き換えるために構築された、高速で費用対効果の高い主力テキスト読み上げモデルです。

概要と機能

Gemini 3.8 Flash-Lite TTS は、低レイテンシと表現力豊かな自然な音声を組み合わせたものです。

  • 高スループットの効率性: 大量生産、会話型音声エージェント カスケード、読み上げ機能、主要言語での日常的な単一話者の音声生成向けに最適化されています。
  • ドロップイン スキーマの互換性: gemini-3.8-flash-tts とまったく同じ API スキーマと構造化プロンプト形式を共有するため、1 つのパラメータを変更するだけでモデルを切り替えることができます。
  • 音声エコシステムの完全なサポート: 事前構築済みの音声、拡張音声ライブラリ(GET /v1beta/voices)、カスタムの音声デザイン ペルソナ、音声の複製(デフォルトでは永続的に保存された音声、オプションでステートレス キー)をサポートします。Google AI Studio で、音声をインタラクティブに設計して複製することもできます。

機能、プロンプトのベスト プラクティス、コード例について詳しくは、テキスト読み上げガイドをご覧ください。

どの TTS モデルを使用するか

Gemini 3.8 TTS モデルはどちらも同じ API スキーマとプロンプト構造を共有しています。ワークロードに適したモデルを選択します。

機能 / ワークロード Gemini 3.8 Flash-Lite TTS(gemini-3.8-flash-lite-tts Gemini 3.8 Flash TTS(gemini-3.8-flash-tts
主な強み 高スループット、低レイテンシ、費用対効果 音声の忠実度、演技のニュアンス、方言のカバー率を最大化
最適なユースケース 大量の制作、リアルタイム音声エージェントのカスケード、読み上げ機能、ボイス レプリケーション、日常的な単一話者の生成 オーディオブック、スタジオ ナレーション、複数の話者による複雑な会話、激しいボーカル バースト演技、難しい発音、地域の方言
サポートされている言語 101 言語 130 言語
推奨される代替品 gemini-3.1-flash-tts-preview 新しいフラッグシップ クリエイティブ階層

移行ガイド

gemini-3.1-flash-tts-preview から gemini-3.8-flash-lite-tts にアップグレードする場合は、Gemini 3.8 TTS スキーマのリクエストを更新します。

  1. ターンレベルの指示を speech_metadata に移動: Gemini 3.8 TTS は、入力テキストを厳密に逐語録として扱います。"Say cheerfully: Hello!""Speaker 1: Hello!" などのインライン テキストの指示は、読み上げられることがあります。持続的な配信手順(style)とスピーカー ラベル(speaker)を構造化メタデータに移動します。
    • Interactions API: "type": "speech_metadata""speaker""style" を含むアノテーションを各テキスト コンテンツ ブロックに付加します。
    • GenerateContent API:part"speech_metadata": {"speaker": "...", "style": "..."} を付加します。
  2. 時点の音声イベントにのみ山かっこインライン タグを使用する: 一時的な発話以外の音声や一時停止は、山かっこ(<laugh><sigh><cough><breath><short pause> など)を使用して文字起こしでインラインに保持します。ささやきなどの話し方は speech_metadata.style に入れます。
  3. 複数話者のリクエストのすべてのターンで speaker を指定する: 複数話者のリクエストのすべてのターンで、構成された話者のいずれかに一致する speech_metadata 内に speaker を明示的に含める必要があります。
  4. 音声デザインでペルソナを事前に設計する: 長いレガシーの音声プロファイル / ディレクターズ ノートのブロックを、音声デザインで作成したカスタム音声に置き換え、その voice_... ID を TTS リクエストで style 文字列を最小限にするか空にして渡します。
  5. 単項リクエストのデフォルトの WAV(audio/wav)出力を考慮する: gemini-3.1-flash-tts-preview 以前の TTS モデル(デフォルトでヘッダーなしの未加工 PCM audio/l16 を返した)とは異なり、Gemini 3.8 TTS は、単項リクエストに対してデフォルトで標準 RIFF ヘッダー付きの WAV 音声(audio/wav / AUDIO_WAV)を返します。
    • 以前のコードで、未加工の PCM バイトを WAV ヘッダーでラップしていた場合(たとえば、Python の wave モジュールまたは ffmpeg を使用していた場合)、手動のヘッダー ラッパーを削除し、返されたバイトを .wav ファイルに直接書き込みます。
    • パイプラインでヘッダーレスの RAW PCM、μ-law、A-law のオーディオが必要な場合は、response_format"audio/l16""AUDIO_L16")、"audio/mulaw""AUDIO_MULAW")、または "audio/alaw""AUDIO_ALAW")に明示的に設定します。オーディオ出力形式をご覧ください。

gemini-3.8-flash-lite-tts

プロパティ 説明
モデルコード gemini-3.8-flash-lite-tts
でサポートされているデータ型

入力

テキスト

出力

音声

トークンの上限[*]

入力トークンの上限

8,192

出力トークンの上限

16,384

機能

音声生成

サポート対象

キャッシュ保存

サポート対象

コード実行

サポート対象外

ファイル検索

サポート対象外

関数呼び出し

サポート対象外

Google マップによるグラウンディング

サポート対象外

画像生成

サポート対象外

Live API

サポート対象外

検索によるグラウンディング

サポート対象外

構造化出力

サポート対象外

思考

サポート対象外

URL コンテキスト

サポート対象外

使用オプション

Batch API

サポート対象

Flex 推論

サポート対象

優先度推論

サポート対象

バージョン
詳しくは、モデル バージョンのパターンをご覧ください。
  • gemini-3.8-flash-lite-tts
最新の更新 2026 年 7 月

サポートされている言語

gemini-3.8-flash-lite-tts は入力言語を自動的に検出し、101 言語をサポートしています。

言語 言語 言語
アチェ語(アラビア文字) ジョージア語 マルタ語
アフリカーンス語 ドイツ語 マニプリ語
アカン語 ギリシャ語 マラーティー語
アムハラ語 グジャラート語 ミナンカバウ語(アラビア文字)
アルメニア語 ハイチ語 ミゾ語
アッサム語 ハルハ モンゴル語 ネパール語(個別の言語)
アワディー語 ハウサ語 ナイジェリアン フルフルディ語
バリ文字 ヘブライ語 北アゼルバイジャン語
ベンガル語 ヒンディー語 北ソト語
バンジャール語(ラテン文字) ハンガリー語 ウズベク語北部方言
バスク語 アイスランド語 ノルウェー語(ブークモール)
ベラルーシ語 イロカノ語 ノルウェー語(ニーノシク)
ボージュプリー語 インドネシア語 ニャンジャ語
ボスニア語 イランのペルシャ語 オディア語(個別の言語)
ブギス文字 イタリア語 ペルシャ語(アフガニスタン)
ブルガリア語 日本語 ポーランド語
広東語 ジャワ語 ポルトガル語
カタルーニャ語 カンバ語 パンジャブ語
セブアノ語 カンナダ語 ルーマニア語
中央クルド語 カシミール語(アラビア文字) ロシア語
チャッティースガリー語 カシミール語(デーヴァナーガリー文字) サンタル語
中国語(漢字) カザフ語 セルビア語
中国語(繁体字) クメール語 シンハラ語
クロアチア語 キクユ語 スロバキア語
チェコ語 キニヤルワンダ語 南アゼルバイジャン語
デンマーク語 コンゴ語 南部パシュトー語
オランダ語 韓国語 スペイン語
エジプト アラビア語 キルギス語 標準アラビア語(アラビア文字)
英語 ラオ語 標準アラビア語(ラテン文字)
エストニア語 リンガラ語 標準ラトビア語
フィリピン語 マケドニア語 標準マレー語
フランス語 マガヒー語 タミル語
ガリシア語 マイティリー語 テルグ語
ガンダ語 マラヤーラム語