Gemini Voices API

Voices API を使用すると、自然言語プロンプト(音声設計)または参照音声と話者の同意録音(音声複製)からカスタム音声を作成できるほか、Text-to-Speech(TTS)合成用のカスタム音声と事前構築済み音声のリスト表示、取得、管理を行うことができます。

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

自然言語プロンプト(`VOICE_TYPE_PROMPTED`)または参照音声録音と同意音声録音(`VOICE_TYPE_REPLICATED`)からカスタム音声を作成します。

リクエストの本文

リクエストの本文には、次の構造のデータが含まれます。

store boolean  (省略可)

省略可。作成された音声が Google によって保存および管理されるかどうか。* `true` の場合、Google は音声を保存し、`Voice.id`(`voice_abc123def456` など)を返します。これは、`GetVoice`、`ListVoices`、`DeleteVoice` で管理でき、合成リクエストで ID を参照できます。プロジェクトには、アクティブな保存済み音声の最大割り当てが適用されます。割り当てを超えると、`RESOURCE_EXHAUSTED` が返されます。 * `false`(デフォルト)の場合、音声は Google によって保存されず、クライアントサイドの保存と合成のために `Voice.key`(`voicekey_...` など)が返されます。`voice` のオプションの検出メタデータ フィールドは、`store` が `false` の場合、永続化されず、返されません。 * `voice.type` が `"prompted"` の場合、`true` である必要があります(そうでない場合、`INVALID_ARGUMENT` で失敗します)。

voice 音声  (必須)

必須。作成する音声。`voice.model` は省略可能です。省略すると、サービスはデフォルトの音声作成モデルを選択します。`Voice` の出力専用フィールド(`id`、`key`、`expire_time`、`usage`)は、設定されている場合は無視されます。

レスポンス

成功した場合、レスポンスの本文には次の構造のデータが含まれます。

アクセント 文字列  (省略可)

省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。

context 文字列  (省略可)

省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。

説明 文字列  (省略可)

省略可。声の音色、個性、トーンに関する説明的な要約。

display_name 文字列  (省略可)

省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。

expire_time 文字列  (省略可)

出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。

gender 文字列  (省略可)

省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。

id 文字列  (省略可)

出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。

key string  (省略可)

出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。

language_code 文字列  (省略可)

省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。

model 文字列  (省略可)

省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。

persona 文字列  (省略可)

省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。

pitch Pitch  (省略可)

省略可。声のピッチの分類。

有効な値

  • low

    低音の声。

  • medium

    中音域の声。

  • high

    高音の声。

prompted PromptedVoice  (省略可)

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

フィールド

input string  (省略可)

必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。

region_code 文字列  (省略可)

省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。

sample_audio AudioData  (省略可)

出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。

音声の作成に使用される音声ペイロード。

フィールド

data 文字列  (省略可)

必須。未加工の音声バイト。

mime_type 文字列  (省略可)

必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。

type VoiceType  (省略可)

必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` である必要があります。`ListVoices` レスポンスでは、`"prebuilt"` になることもあります。

有効な値

  • replicated

    参照音声サンプルと話者の同意録音から複製されたカスタム音声。

  • prompted

    自然言語のテキスト プロンプトから生成されたカスタム音声。

  • prebuilt

    Google の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。

usage Usage  (省略可)

出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。

インタラクション リクエストのトークン使用量に関する統計情報。

フィールド

cached_tokens_by_modality array (ModalityTokens)  (省略可)

キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

grounding_tool_count 配列(GroundingToolCount)  (省略可)

グラウンディング ツールの数。

接地ツールの数。

フィールド

count 整数  (省略可)

接地ツールの数。

type 列挙型(文字列)  (省略可)

カウントに関連付けられているグラウンディング ツールのタイプ。

有効な値:

  • google_search

    Google ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。

  • google_maps

    Google マップによるグラウンディング。

input_tokens_by_modality 配列(ModalityTokens)  (省略可)

入力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

output_tokens_by_modality array (ModalityTokens)  (省略可)

出力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

tool_use_tokens_by_modality array (ModalityTokens)  (省略可)

モダリティ別のツール使用トークンの使用量の内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

total_cached_tokens integer  (省略可)

プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。

total_input_tokens 整数  (省略可)

プロンプト(コンテキスト)内のトークン数。

total_output_tokens integer  (省略可)

生成されたすべてのレスポンスのトークンの合計数。

total_thought_tokens 整数  (省略可)

思考モデルの思考トークンの数。

total_tokens integer  (省略可)

インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。

total_tool_use_tokens 整数  (省略可)

ツール使用プロンプト内のトークン数。

返信の例

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

呼び出し元が所有するカスタム保存済み音声のリスト(新しい順)と、Google の音声カタログの事前構築済みシステム音声のリストを返します。

パス / クエリ パラメータ

accent 配列(文字列)  (省略可)

省略可。アクセントの説明(「アメリカ英語」、「イギリス英語」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値を指定すると、指定したアクセントのいずれかに一致する音声が検出されます(OR)。

context array(文字列)  (省略可)

省略可。意図するコンテキストまたはドメイン(「ニュース、商業」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合、指定されたコンテキストのいずれかに一致する音声が一致します(OR)。

gender 配列(文字列)  (省略可)

省略可。性別表現(「女性」、「男性」、「中性」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合は、指定された性別のいずれかの音声と一致します(OR)。

language_code 配列(文字列)  (省略可)

省略可。BCP-47 言語コード(例: 「en-US」)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合は、指定された言語コードのいずれかに一致する音声が返されます(OR)。

page_size 整数  (省略可)

省略可。ページごとに返す音声の最大数。サービスが返す値はこれよりも少ないことがあります。指定されていない場合、最大で 50 個の音声が返されます。最大値は 1,000 です。1,000 を超える値は 1,000 に強制変換されます。

page_token 文字列  (省略可)

省略可。前回の `ListVoices` 呼び出しから受け取ったページトークン。後続のページを取得するにはこれを指定します。ページネーションを行う場合、すべてのフィルタ クエリ パラメータ(`language_code`、`region_code`、`accent`、`persona`、`context`、`gender`、`pitch`、`type`、`search`)は、このトークンを返した呼び出しと一致する必要があります。一致しない場合、リクエストは `INVALID_ARGUMENT` で失敗します。`page_size` はページ間で変更できます。

persona 配列(文字列)  (省略可)

省略可。音声ペルソナ(「温かい、フレンドリー」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合、指定されたペルソナのいずれかに一致する音声(OR)が返されます。

pitch 配列(文字列)  (省略可)

省略可。声のピッチでフィルタします。「low」、「medium」、「high」、「PITCH_LOW」、「PITCH_MEDIUM」、「PITCH_HIGH」を指定できます(大文字と小文字は区別されません)。複数の値が指定されている場合は、指定されたピッチのいずれかに一致する音声が一致します(OR)。

region_code 配列(文字列)  (省略可)

省略可。ISO 3166-1 alpha-2 または UN M.49 地域コード(「US」、「001」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値を指定すると、指定したリージョン コードのいずれかに一致する音声が検出されます(OR)。

search 文字列  (省略可)

省略可。自由形式のテキストのサブストリング検索クエリは、`display_name` と `description` の両方に対して大文字と小文字を区別せずに照合されます。最大 2,048 バイト。

type array (string)  (省略可)

省略可。声の種類でフィルタします。「prebuilt」、「replicated」、「prompted」、「VOICE_TYPE_PREBUILT」、「VOICE_TYPE_REPLICATED」、「VOICE_TYPE_PROMPTED」を受け入れます(大文字と小文字は区別されません)。複数の値を指定すると、指定したタイプのいずれかの音声と一致します(OR)。

レスポンス

成功した場合、レスポンスの本文には次の構造のデータが含まれます。

next_page_token 文字列  (省略可)

次のページを取得するために `page_token` として送信できるトークン。空の場合、後続のページはありません。

voices 配列(Voice  (省略可)

指定されたコレクションの音声。

返信の例

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

リソース名でカスタム保存音声(`store = true`)を取得します。事前構築済みカタログ音声(`VOICE_TYPE_PREBUILT`)は `GetVoice` で取得できません。代わりに `ListVoices` を使用してください。

パス / クエリ パラメータ

voicesId 文字列  (必須)

必須。取得するカスタム保存済み音声のリソース名(例: `voices/voice_abc123def456`)。

レスポンス

成功した場合、レスポンスの本文には次の構造のデータが含まれます。

アクセント 文字列  (省略可)

省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。

context 文字列  (省略可)

省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。

説明 文字列  (省略可)

省略可。声の音色、個性、トーンに関する説明的な要約。

display_name 文字列  (省略可)

省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。

expire_time 文字列  (省略可)

出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。

gender 文字列  (省略可)

省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。

id 文字列  (省略可)

出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。

key string  (省略可)

出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。

language_code 文字列  (省略可)

省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。

model 文字列  (省略可)

省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。

persona 文字列  (省略可)

省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。

pitch Pitch  (省略可)

省略可。声のピッチの分類。

有効な値

  • low

    低音の声。

  • medium

    中音域の声。

  • high

    高音の声。

prompted PromptedVoice  (省略可)

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

フィールド

input string  (省略可)

必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。

region_code 文字列  (省略可)

省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。

sample_audio AudioData  (省略可)

出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。

音声の作成に使用される音声ペイロード。

フィールド

data 文字列  (省略可)

必須。未加工の音声バイト。

mime_type 文字列  (省略可)

必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。

type VoiceType  (省略可)

必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` である必要があります。`ListVoices` レスポンスでは、`"prebuilt"` になることもあります。

有効な値

  • replicated

    参照音声サンプルと話者の同意録音から複製されたカスタム音声。

  • prompted

    自然言語のテキスト プロンプトから生成されたカスタム音声。

  • prebuilt

    Google の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。

usage Usage  (省略可)

出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。

インタラクション リクエストのトークン使用量に関する統計情報。

フィールド

cached_tokens_by_modality array (ModalityTokens)  (省略可)

キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

grounding_tool_count 配列(GroundingToolCount)  (省略可)

グラウンディング ツールの数。

接地ツールの数。

フィールド

count 整数  (省略可)

接地ツールの数。

type 列挙型(文字列)  (省略可)

カウントに関連付けられているグラウンディング ツールのタイプ。

有効な値:

  • google_search

    Google ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。

  • google_maps

    Google マップによるグラウンディング。

input_tokens_by_modality 配列(ModalityTokens)  (省略可)

入力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

output_tokens_by_modality array (ModalityTokens)  (省略可)

出力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

tool_use_tokens_by_modality array (ModalityTokens)  (省略可)

モダリティ別のツール使用トークンの使用量の内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

total_cached_tokens integer  (省略可)

プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。

total_input_tokens 整数  (省略可)

プロンプト(コンテキスト)内のトークン数。

total_output_tokens integer  (省略可)

生成されたすべてのレスポンスのトークンの合計数。

total_thought_tokens 整数  (省略可)

思考モデルの思考トークンの数。

total_tokens integer  (省略可)

インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。

total_tool_use_tokens 整数  (省略可)

ツール使用プロンプト内のトークン数。

返信の例

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

削除 https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

リソース名でカスタム保存済み音声(`store = true`)を削除します。事前構築済みのカタログ音声(`VOICE_TYPE_PREBUILT`)は削除できません。

パス / クエリ パラメータ

voicesId 文字列  (必須)

必須。削除するカスタム保存済み音声のリソース名(例: `voices/voice_abc123def456`)。

レスポンス

成功すると、レスポンスは空になります。

リソース

音声

カスタム音声(`CreateVoice` で作成)または事前構築済みのシステム音声(`ListVoices` で返される)のいずれかを表す音声リソース。

フィールド

アクセント 文字列  (省略可)

省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。

context 文字列  (省略可)

省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。

説明 文字列  (省略可)

省略可。声の音色、個性、トーンに関する説明的な要約。

display_name 文字列  (省略可)

省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。

expire_time 文字列  (省略可)

出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。

gender 文字列  (省略可)

省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。

id 文字列  (省略可)

出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。

key string  (省略可)

出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。

language_code 文字列  (省略可)

省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。

model 文字列  (省略可)

省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。

persona 文字列  (省略可)

省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。

pitch Pitch  (省略可)

省略可。声のピッチの分類。

有効な値

  • low

    低音の声。

  • medium

    中音域の声。

  • high

    高音の声。

prompted PromptedVoice  (省略可)

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。

フィールド

input string  (省略可)

必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。

region_code 文字列  (省略可)

省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。

sample_audio AudioData  (省略可)

出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。

音声の作成に使用される音声ペイロード。

フィールド

data 文字列  (省略可)

必須。未加工の音声バイト。

mime_type 文字列  (省略可)

必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。

type VoiceType  (省略可)

必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` にする必要があります。`ListVoices` レスポンスでは、`"prebuilt"` にすることもできます。

有効な値

  • replicated

    参照音声サンプルと話者の同意録音から複製されたカスタム音声。

  • prompted

    自然言語のテキスト プロンプトから生成されたカスタム音声。

  • prebuilt

    Google の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。

usage Usage  (省略可)

出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。

インタラクション リクエストのトークン使用量に関する統計情報。

フィールド

cached_tokens_by_modality array (ModalityTokens)  (省略可)

キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

grounding_tool_count 配列(GroundingToolCount)  (省略可)

グラウンディング ツールの数。

接地ツールの数。

フィールド

count 整数  (省略可)

接地ツールの数。

type 列挙型(文字列)  (省略可)

カウントに関連付けられているグラウンディング ツールのタイプ。

有効な値:

  • google_search

    Google ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。

  • google_maps

    Google マップによるグラウンディング。

input_tokens_by_modality 配列(ModalityTokens)  (省略可)

入力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

output_tokens_by_modality array (ModalityTokens)  (省略可)

出力トークンの使用状況をモダリティ別に分類した内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

tool_use_tokens_by_modality array (ModalityTokens)  (省略可)

モダリティ別のツール使用トークンの使用量の内訳。

単一のレスポンス モダリティのトークン数。

フィールド

modality ResponseModality  (省略可)

トークン数に関連付けられたモダリティ。

有効な値

  • text

    モデルがテキストを返すことを示します。

  • image

    モデルが画像を返す必要があることを示します。

  • audio

    モデルが音声を返す必要があることを示します。

  • video

    モデルが動画を返す必要があることを示します。

  • document

    モデルがドキュメントを返す必要があることを示します。

トークン 整数  (省略可)

モダリティのトークン数。

total_cached_tokens integer  (省略可)

プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。

total_input_tokens 整数  (省略可)

プロンプト(コンテキスト)内のトークン数。

total_output_tokens integer  (省略可)

生成されたすべてのレスポンスのトークンの合計数。

total_thought_tokens 整数  (省略可)

思考モデルの思考トークンの数。

total_tokens integer  (省略可)

インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。

total_tool_use_tokens 整数  (省略可)

ツール使用プロンプト内のトークン数。