Voices API を使用すると、自然言語プロンプト(音声設計)または参照音声と話者の同意録音(音声複製)からカスタム音声を作成できるほか、Text-to-Speech(TTS)合成用のカスタム音声と事前構築済み音声のリスト表示、取得、管理を行うことができます。
CreateVoice
自然言語プロンプト(`VOICE_TYPE_PROMPTED`)または参照音声録音と同意音声録音(`VOICE_TYPE_REPLICATED`)からカスタム音声を作成します。
リクエストの本文
リクエストの本文には、次の構造のデータが含まれます。
省略可。作成された音声が Google によって保存および管理されるかどうか。* `true` の場合、Google は音声を保存し、`Voice.id`(`voice_abc123def456` など)を返します。これは、`GetVoice`、`ListVoices`、`DeleteVoice` で管理でき、合成リクエストで ID を参照できます。プロジェクトには、アクティブな保存済み音声の最大割り当てが適用されます。割り当てを超えると、`RESOURCE_EXHAUSTED` が返されます。 * `false`(デフォルト)の場合、音声は Google によって保存されず、クライアントサイドの保存と合成のために `Voice.key`(`voicekey_...` など)が返されます。`voice` のオプションの検出メタデータ フィールドは、`store` が `false` の場合、永続化されず、返されません。 * `voice.type` が `"prompted"` の場合、`true` である必要があります(そうでない場合、`INVALID_ARGUMENT` で失敗します)。
必須。作成する音声。`voice.model` は省略可能です。省略すると、サービスはデフォルトの音声作成モデルを選択します。`Voice` の出力専用フィールド(`id`、`key`、`expire_time`、`usage`)は、設定されている場合は無視されます。
レスポンス
成功した場合、レスポンスの本文には次の構造のデータが含まれます。
省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。
省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。
省略可。声の音色、個性、トーンに関する説明的な要約。
省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。
出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。
省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。
出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。
出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。
省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。
省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。
省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。
pitch Pitch (省略可)
省略可。声のピッチの分類。
有効な値
-
low低音の声。
-
medium中音域の声。
-
high高音の声。
prompted PromptedVoice (省略可)
プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。
フィールド
必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。
省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。
sample_audio AudioData (省略可)
出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。
フィールド
必須。未加工の音声バイト。
必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。
type VoiceType (省略可)
必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` である必要があります。`ListVoices` レスポンスでは、`"prebuilt"` になることもあります。
有効な値
-
replicated参照音声サンプルと話者の同意録音から複製されたカスタム音声。
-
prompted自然言語のテキスト プロンプトから生成されたカスタム音声。
-
prebuiltGoogle の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。
usage Usage (省略可)
出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。
フィールド
cached_tokens_by_modality array (ModalityTokens) (省略可)
キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
grounding_tool_count 配列(GroundingToolCount) (省略可)
グラウンディング ツールの数。
フィールド
接地ツールの数。
カウントに関連付けられているグラウンディング ツールのタイプ。
有効な値:
-
google_searchGoogle ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。
-
google_mapsGoogle マップによるグラウンディング。
input_tokens_by_modality 配列(ModalityTokens) (省略可)
入力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
output_tokens_by_modality array (ModalityTokens) (省略可)
出力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
tool_use_tokens_by_modality array (ModalityTokens) (省略可)
モダリティ別のツール使用トークンの使用量の内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。
プロンプト(コンテキスト)内のトークン数。
生成されたすべてのレスポンスのトークンの合計数。
思考モデルの思考トークンの数。
インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。
ツール使用プロンプト内のトークン数。
例
返信の例
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
呼び出し元が所有するカスタム保存済み音声のリスト(新しい順)と、Google の音声カタログの事前構築済みシステム音声のリストを返します。
パス / クエリ パラメータ
省略可。アクセントの説明(「アメリカ英語」、「イギリス英語」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値を指定すると、指定したアクセントのいずれかに一致する音声が検出されます(OR)。
省略可。意図するコンテキストまたはドメイン(「ニュース、商業」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合、指定されたコンテキストのいずれかに一致する音声が一致します(OR)。
省略可。性別表現(「女性」、「男性」、「中性」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合は、指定された性別のいずれかの音声と一致します(OR)。
省略可。BCP-47 言語コード(例: 「en-US」)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合は、指定された言語コードのいずれかに一致する音声が返されます(OR)。
省略可。ページごとに返す音声の最大数。サービスが返す値はこれよりも少ないことがあります。指定されていない場合、最大で 50 個の音声が返されます。最大値は 1,000 です。1,000 を超える値は 1,000 に強制変換されます。
省略可。前回の `ListVoices` 呼び出しから受け取ったページトークン。後続のページを取得するにはこれを指定します。ページネーションを行う場合、すべてのフィルタ クエリ パラメータ(`language_code`、`region_code`、`accent`、`persona`、`context`、`gender`、`pitch`、`type`、`search`)は、このトークンを返した呼び出しと一致する必要があります。一致しない場合、リクエストは `INVALID_ARGUMENT` で失敗します。`page_size` はページ間で変更できます。
省略可。音声ペルソナ(「温かい、フレンドリー」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値が指定されている場合、指定されたペルソナのいずれかに一致する音声(OR)が返されます。
省略可。声のピッチでフィルタします。「low」、「medium」、「high」、「PITCH_LOW」、「PITCH_MEDIUM」、「PITCH_HIGH」を指定できます(大文字と小文字は区別されません)。複数の値が指定されている場合は、指定されたピッチのいずれかに一致する音声が一致します(OR)。
省略可。ISO 3166-1 alpha-2 または UN M.49 地域コード(「US」、「001」など)でフィルタします。大文字と小文字を区別しない完全一致。複数の値を指定すると、指定したリージョン コードのいずれかに一致する音声が検出されます(OR)。
省略可。自由形式のテキストのサブストリング検索クエリは、`display_name` と `description` の両方に対して大文字と小文字を区別せずに照合されます。最大 2,048 バイト。
省略可。声の種類でフィルタします。「prebuilt」、「replicated」、「prompted」、「VOICE_TYPE_PREBUILT」、「VOICE_TYPE_REPLICATED」、「VOICE_TYPE_PROMPTED」を受け入れます(大文字と小文字は区別されません)。複数の値を指定すると、指定したタイプのいずれかの音声と一致します(OR)。
レスポンス
成功した場合、レスポンスの本文には次の構造のデータが含まれます。
次のページを取得するために `page_token` として送信できるトークン。空の場合、後続のページはありません。
指定されたコレクションの音声。
例
返信の例
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
リソース名でカスタム保存音声(`store = true`)を取得します。事前構築済みカタログ音声(`VOICE_TYPE_PREBUILT`)は `GetVoice` で取得できません。代わりに `ListVoices` を使用してください。
パス / クエリ パラメータ
必須。取得するカスタム保存済み音声のリソース名(例: `voices/voice_abc123def456`)。
レスポンス
成功した場合、レスポンスの本文には次の構造のデータが含まれます。
省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。
省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。
省略可。声の音色、個性、トーンに関する説明的な要約。
省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。
出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。
省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。
出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。
出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。
省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。
省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。
省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。
pitch Pitch (省略可)
省略可。声のピッチの分類。
有効な値
-
low低音の声。
-
medium中音域の声。
-
high高音の声。
prompted PromptedVoice (省略可)
プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。
フィールド
必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。
省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。
sample_audio AudioData (省略可)
出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。
フィールド
必須。未加工の音声バイト。
必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。
type VoiceType (省略可)
必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` である必要があります。`ListVoices` レスポンスでは、`"prebuilt"` になることもあります。
有効な値
-
replicated参照音声サンプルと話者の同意録音から複製されたカスタム音声。
-
prompted自然言語のテキスト プロンプトから生成されたカスタム音声。
-
prebuiltGoogle の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。
usage Usage (省略可)
出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。
フィールド
cached_tokens_by_modality array (ModalityTokens) (省略可)
キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
grounding_tool_count 配列(GroundingToolCount) (省略可)
グラウンディング ツールの数。
フィールド
接地ツールの数。
カウントに関連付けられているグラウンディング ツールのタイプ。
有効な値:
-
google_searchGoogle ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。
-
google_mapsGoogle マップによるグラウンディング。
input_tokens_by_modality 配列(ModalityTokens) (省略可)
入力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
output_tokens_by_modality array (ModalityTokens) (省略可)
出力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
tool_use_tokens_by_modality array (ModalityTokens) (省略可)
モダリティ別のツール使用トークンの使用量の内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。
プロンプト(コンテキスト)内のトークン数。
生成されたすべてのレスポンスのトークンの合計数。
思考モデルの思考トークンの数。
インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。
ツール使用プロンプト内のトークン数。
例
返信の例
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
リソース名でカスタム保存済み音声(`store = true`)を削除します。事前構築済みのカタログ音声(`VOICE_TYPE_PREBUILT`)は削除できません。
パス / クエリ パラメータ
必須。削除するカスタム保存済み音声のリソース名(例: `voices/voice_abc123def456`)。
レスポンス
成功すると、レスポンスは空になります。
例
リソース
音声
カスタム音声(`CreateVoice` で作成)または事前構築済みのシステム音声(`ListVoices` で返される)のいずれかを表す音声リソース。
フィールド
省略可。地域アクセント記述子(「アメリカ英語」、「イギリス英語」など)。
省略可。最適な使用コンテキストまたはドメイン(「会話」、「オーディオブック」、「ニュース」など)。
省略可。声の音色、個性、トーンに関する説明的な要約。
省略可。保存された音声のユーザー指定の表示名(`store = true`)、または事前構築済み音声のカタログ名。
出力専用。カスタム保存音声(`store = true`)または複製された音声キー(`store = false`)の有効期限が切れるタイムスタンプ。有効期限のないプリビルド カタログ音声(`"prebuilt"`)の場合は設定されません。
省略可。認識された音声の性別(「女性」、「男性」、「中性」など)。
出力専用。音声の一意の識別子。* Google 管理のカスタム音声(`store = true`)の場合、これは接頭辞 `voice_` を含む生成された ID です(例: `voice_abc123def456`)。`GetVoice` と `DeleteVoice` の `name` として `voices/{id}` を渡し、音声合成時に `{id}` を `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に直接渡します。* プリビルド カタログ音声(`ListVoices` によって返される `"prebuilt"`)の場合、これはスピーカー名(`Puck` や `Charon` など)です。 * `store = false` で `CreateVoice` が呼び出された場合は設定されません。
出力専用。クライアント管理のボイス レプリケーション キー(接頭辞 `voicekey_` を含む)。`type` が `"replicated"` で `store` が `false` の場合に `CreateVoice` によってのみ返されます。音声合成時にこのキーを `SpeechConfig.voice_config.voice`(または `SpeechConfig.voice`)に渡します。
省略可。プライマリ BCP-47 言語タグ(例: 「en-US」、「fr-FR」)。
省略可。音声の設計または複製に使用されるモデル。`CreateVoice` で省略すると、デフォルトでサポートされている最新の音声設計モデルになります。カスタム音声(`"prompted"` と `"replicated"`)の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。`"prebuilt"` 音声の場合は設定されません。作成した音声は、サポートされている任意の TTS 合成モデルで合成できます。
省略可。想定されるペルソナまたはキャラクターのアーキタイプ(「温かくフレンドリー」、「ナレーター」など)。
pitch Pitch (省略可)
省略可。声のピッチの分類。
有効な値
-
low低音の声。
-
medium中音域の声。
-
high高音の声。
prompted PromptedVoice (省略可)
プロンプト付き音声生成のパラメータ。`type` が `"prompted"` の場合、`CreateVoice` で必須です。プロンプト付き音声の `CreateVoice`、`GetVoice`、`ListVoices` レスポンスで返されます。
フィールド
必須。希望する声を表す自然言語のプロンプト(例: 「中年の巨大な邪悪なオーガの深くて響く男性の声」)。
省略可。ISO 3166-1 alpha-2 または UN M.49 の地理的地域コード(例: 「US」、「GB」、「001」)。
sample_audio AudioData (省略可)
出力専用。プロンプト音声用に生成されたサンプル音声(シンセサイザー プロンプト音声)。`type` が `"prompted"` の場合、`CreateVoice` レスポンスと `GetVoice` レスポンスでのみ入力されます。`ListVoices` レスポンスと、`"replicated"` または `"prebuilt"` の音声では設定されません。
フィールド
必須。未加工の音声バイト。
必須。音声データの IANA MIME タイプ(`audio/wav` や `audio/mpeg` など)。
type VoiceType (省略可)
必須。音声の種類。`CreateVoice` では、`"replicated"` または `"prompted"` にする必要があります。`ListVoices` レスポンスでは、`"prebuilt"` にすることもできます。
有効な値
-
replicated参照音声サンプルと話者の同意録音から複製されたカスタム音声。
-
prompted自然言語のテキスト プロンプトから生成されたカスタム音声。
-
prebuiltGoogle の音声カタログの組み込みシステム音声(`Puck`、`Charon` など)。レスポンスで返されます。`CreateVoice` でタイプとして指定することはできません。
usage Usage (省略可)
出力専用。音声作成リクエストのトークン使用量の統計情報。`type` が `"prompted"` の場合、`CreateVoice` のレスポンスでのみ入力されます。`"replicated"` の場合、`GetVoice` と `ListVoices` のレスポンスでは設定されません。
フィールド
cached_tokens_by_modality array (ModalityTokens) (省略可)
キャッシュに保存されたトークンの使用状況をモダリティ別に分類したものです。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
grounding_tool_count 配列(GroundingToolCount) (省略可)
グラウンディング ツールの数。
フィールド
接地ツールの数。
カウントに関連付けられているグラウンディング ツールのタイプ。
有効な値:
-
google_searchGoogle ウェブ検索と画像検索によるグラウンディング、エンタープライズ向けウェブ グラウンディング。
-
google_mapsGoogle マップによるグラウンディング。
input_tokens_by_modality 配列(ModalityTokens) (省略可)
入力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
output_tokens_by_modality array (ModalityTokens) (省略可)
出力トークンの使用状況をモダリティ別に分類した内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
tool_use_tokens_by_modality array (ModalityTokens) (省略可)
モダリティ別のツール使用トークンの使用量の内訳。
フィールド
modality ResponseModality (省略可)
トークン数に関連付けられたモダリティ。
有効な値
-
textモデルがテキストを返すことを示します。
-
imageモデルが画像を返す必要があることを示します。
-
audioモデルが音声を返す必要があることを示します。
-
videoモデルが動画を返す必要があることを示します。
-
documentモデルがドキュメントを返す必要があることを示します。
モダリティのトークン数。
プロンプトのキャッシュに保存された部分(キャッシュに保存されたコンテンツ)のトークン数。
プロンプト(コンテキスト)内のトークン数。
生成されたすべてのレスポンスのトークンの合計数。
思考モデルの思考トークンの数。
インタラクション リクエストのトークン数(プロンプト + レスポンス + その他の内部トークン)。
ツール使用プロンプト内のトークン数。