Voices API를 사용하면 자연어 프롬프트 (음성 디자인) 또는 참조 오디오 및 화자 동의 녹음 파일 (음성 복제)에서 커스텀 음성을 만들고, Text-to-Speech (TTS) 합성을 위한 커스텀 음성 및 사전 빌드된 음성을 나열, 검색, 관리할 수 있습니다.
CreateVoice
자연어 프롬프트(`VOICE_TYPE_PROMPTED`) 또는 참조 및 동의 오디오 녹음(`VOICE_TYPE_REPLICATED`)에서 맞춤 음성을 만듭니다.
요청 본문
요청 본문에는 다음과 같은 구조의 데이터가 포함됩니다.
선택사항입니다. 생성된 음성이 Google에 의해 유지되고 관리되는지 여부입니다. * `true`인 경우 Google은 음성을 저장하고 `Voice.id` (예: `voice_abc123def456`)를 반환합니다. 이 ID는 `GetVoice`, `ListVoices`, `DeleteVoice` 를 통해 관리할 수 있으며 합성 요청에서 ID로 참조할 수 있습니다. 프로젝트에는 최대 활성 저장 음성 할당량이 적용됩니다. 할당량을 초과하면 `RESOURCE_EXHAUSTED`가 반환됩니다. * `false` (기본값)인 경우 음성은 Google에 저장되지 않으며 클라이언트 측 저장 및 합성을 위해 `Voice.key`(예: `voicekey_…`)가 반환됩니다. `store` 가 `false` 인 경우 `voice`의 선택적 탐색 메타데이터 필드가 유지되거나 반환되지 않습니다. * `voice.type` 이 `"prompted"`인 경우 `true`여야 합니다(그렇지 않으면 `INVALID_ARGUMENT`로 실패함).
필수 항목입니다. 만들 음성입니다. `voice.model` 은 선택사항입니다. 생략하면 서비스에서 기본 음성 생성 모델을 선택합니다. `Voice`의 출력 전용 필드 (`id`, `key`, `expire_time`, `usage`)는 설정된 경우 무시됩니다.
응답
성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.
선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').
선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')
선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약
선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.
출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.
선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.
출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.
출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.
선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.
선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.
선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')
피치 피치 (선택사항)
선택사항입니다. 음성 음조 분류
가능한 값
-
low낮은 음성
-
medium중간 음조의 음성
-
high높은 음성
prompted PromptedVoice (선택사항)
프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.
필드
필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').
선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')
sample_audio AudioData (선택사항)
출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.
필드
필수 항목입니다. 원시 오디오 바이트입니다.
필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).
type VoiceType (선택사항)
필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.
가능한 값
-
replicated참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.
-
prompted자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.
-
prebuiltGoogle의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.
usage Usage (선택사항)
출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.
필드
cached_tokens_by_modality array (ModalityTokens) (optional)
모달리티별 캐시된 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
grounding_tool_count array (GroundingToolCount) (선택사항)
그라운딩 도구 수입니다.
필드
그라운딩 도구 수입니다.
개수와 연결된 그라운딩 도구 유형입니다.
가능한 값은 다음과 같습니다.
-
google_searchGoogle 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩
-
google_mapsGoogle 지도 기반 그라운딩
input_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 입력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
output_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 출력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
tool_use_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 도구 사용 토큰 사용량 분석
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.
프롬프트 (컨텍스트)의 토큰 수입니다.
생성된 모든 대답의 총 토큰 수입니다.
사고 모델의 사고 토큰 수입니다.
상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.
도구 사용 프롬프트에 있는 토큰 수입니다.
예
응답 예시
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
호출자가 소유한 맞춤 저장 음성 (최신순)과 Google의 음성 카탈로그에 있는 사전 빌드 시스템 음성을 나열합니다.
경로 / 쿼리 매개변수
선택사항입니다. 액센트 설명 (예: '미국', '영국')으로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 악센트 중 하나라도 있는 음성과 일치합니다 (OR).
선택사항입니다. 의도한 컨텍스트 또는 도메인 (예: '뉴스, 상업')으로 필터링합니다. 대소문자를 구분하지 않는 일치검색입니다. 값이 여러 개 지정된 경우 지정된 컨텍스트 중 하나와 음성이 일치합니다 (OR).
선택사항입니다. 성별 표현 (예: '여성', '남성', '중립')으로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 성별 중 하나와 일치하는 음성을 찾습니다 (OR).
선택사항입니다. BCP-47 언어 코드 (예: 'en-US')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 값이 여러 개 지정된 경우 지정된 언어 코드 중 하나와 음성이 일치합니다 (OR).
선택사항입니다. 페이지당 반환할 최대 음성 수입니다. 서비스가 이 값보다 더 적게 반환할 수 있습니다. 지정하지 않으면 최대 50개의 음성이 반환됩니다. 최댓값은 1,000이며, 1,000 이상의 값은 1,000으로 변환됩니다.
선택사항입니다. 이전 `ListVoices` 호출에서 수신된 페이지 토큰입니다. 후속 페이지를 가져오려면 이 값을 제공하세요. 페이지로 나눌 때는 모든 필터 쿼리 매개변수 (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, `search`)가 이 토큰을 반환한 호출과 일치해야 합니다. 그렇지 않으면 요청이 `INVALID_ARGUMENT`로 실패합니다. `page_size` 는 페이지 간에 변경될 수 있습니다.
선택사항입니다. 보컬 페르소나 (예: '따뜻하고 친근함')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 페르소나 중 하나와 일치하는 음성을 반환합니다 (OR).
선택사항입니다. 보컬 음높이로 필터링 'low', 'medium', 'high' 또는 'PITCH_LOW', 'PITCH_MEDIUM', 'PITCH_HIGH'를 허용합니다(대소문자 구분 안 함). 값이 여러 개 지정된 경우 지정된 음조 중 하나와 일치하는 음성을 일치시킵니다(OR).
선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지역 코드 (예: 'US', '001')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 값이 여러 개 지정된 경우 지정된 지역 코드 중 하나와 일치하는 음성을 찾습니다 (OR).
선택사항입니다. `display_name` 및 `description`에 대해 대소문자를 구분하지 않고 일치하는 자유 형식 텍스트 하위 문자열 검색어입니다. 최대 2,048바이트입니다.
선택사항입니다. 음성 유형별로 필터링합니다. 'prebuilt', 'replicated', 'prompted' 또는 'VOICE_TYPE_PREBUILT', 'VOICE_TYPE_REPLICATED', 'VOICE_TYPE_PROMPTED'를 허용합니다(대소문자 구분 안 함). 값이 여러 개 지정된 경우 지정된 유형 중 하나와 음성이 일치합니다 (OR).
응답
성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.
다음 페이지를 검색하기 위해 `page_token` 으로 전송할 수 있는 토큰입니다. 비어 있으면 후속 페이지가 없습니다.
지정된 컬렉션의 음성입니다.
예
응답 예시
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
리소스 이름으로 맞춤 저장 음성 (`store = true`)을 가져옵니다. 사전 빌드된 카탈로그 음성 (`VOICE_TYPE_PREBUILT`)은 `GetVoice`를 통해 가져올 수 없습니다. 대신 `ListVoices` 를 사용하세요.
경로 / 쿼리 매개변수
필수 항목입니다. 가져올 맞춤 저장 음성의 리소스 이름입니다(예: `voices/voice_abc123def456`).
응답
성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.
선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').
선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')
선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약
선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.
출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.
선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.
출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.
출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.
선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.
선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.
선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')
피치 피치 (선택사항)
선택사항입니다. 음성 음조 분류
가능한 값
-
low낮은 음성
-
medium중간 음조의 음성
-
high높은 음성
prompted PromptedVoice (선택사항)
프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.
필드
필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').
선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')
sample_audio AudioData (선택사항)
출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.
필드
필수 항목입니다. 원시 오디오 바이트입니다.
필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).
type VoiceType (선택사항)
필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.
가능한 값
-
replicated참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.
-
prompted자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.
-
prebuiltGoogle의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.
usage Usage (선택사항)
출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.
필드
cached_tokens_by_modality array (ModalityTokens) (optional)
모달리티별 캐시된 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
grounding_tool_count array (GroundingToolCount) (선택사항)
그라운딩 도구 수입니다.
필드
그라운딩 도구 수입니다.
개수와 연결된 그라운딩 도구 유형입니다.
가능한 값은 다음과 같습니다.
-
google_searchGoogle 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩
-
google_mapsGoogle 지도 기반 그라운딩
input_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 입력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
output_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 출력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
tool_use_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 도구 사용 토큰 사용량 분석
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.
프롬프트 (컨텍스트)의 토큰 수입니다.
생성된 모든 대답의 총 토큰 수입니다.
사고 모델의 사고 토큰 수입니다.
상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.
도구 사용 프롬프트에 있는 토큰 수입니다.
예
응답 예시
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
리소스 이름으로 맞춤 저장 음성 (`store = true`)을 삭제합니다. 사전 제작된 카탈로그 음성 (`VOICE_TYPE_PREBUILT`)은 삭제할 수 없습니다.
경로 / 쿼리 매개변수
필수 항목입니다. 삭제할 맞춤 저장 음성의 리소스 이름입니다(예: `voices/voice_abc123def456`).
응답
성공한 경우 응답은 비어 있습니다.
예
리소스
음성
맞춤 음성 (`CreateVoice`를 통해 생성됨) 또는 사전 빌드된 시스템 음성 (`ListVoices`에 의해 반환됨)을 나타내는 음성 리소스입니다.
필드
선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').
선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')
선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약
선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.
출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.
선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.
출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.
출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.
선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.
선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.
선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')
피치 피치 (선택사항)
선택사항입니다. 음성 음조 분류
가능한 값
-
low낮은 음성
-
medium중간 음조의 음성
-
high높은 음성
prompted PromptedVoice (선택사항)
프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.
필드
필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').
선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')
sample_audio AudioData (선택사항)
출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.
필드
필수 항목입니다. 원시 오디오 바이트입니다.
필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).
type VoiceType (선택사항)
필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.
가능한 값
-
replicated참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.
-
prompted자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.
-
prebuiltGoogle의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.
usage Usage (선택사항)
출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.
필드
cached_tokens_by_modality array (ModalityTokens) (optional)
모달리티별 캐시된 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
grounding_tool_count array (GroundingToolCount) (선택사항)
그라운딩 도구 수입니다.
필드
그라운딩 도구 수입니다.
개수와 연결된 그라운딩 도구 유형입니다.
가능한 값은 다음과 같습니다.
-
google_searchGoogle 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩
-
google_mapsGoogle 지도 기반 그라운딩
input_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 입력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
output_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 출력 토큰 사용량 분석입니다.
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
tool_use_tokens_by_modality array (ModalityTokens) (선택사항)
모달리티별 도구 사용 토큰 사용량 분석
필드
modality ResponseModality (선택사항)
토큰 수와 연결된 모달리티입니다.
가능한 값
-
text모델이 텍스트를 반환해야 함을 나타냅니다.
-
image모델이 이미지를 반환해야 함을 나타냅니다.
-
audio모델이 오디오를 반환해야 함을 나타냅니다.
-
video모델이 동영상을 반환해야 함을 나타냅니다.
-
document모델이 문서를 반환해야 함을 나타냅니다.
모달리티의 토큰 수입니다.
프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.
프롬프트 (컨텍스트)의 토큰 수입니다.
생성된 모든 대답의 총 토큰 수입니다.
사고 모델의 사고 토큰 수입니다.
상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.
도구 사용 프롬프트에 있는 토큰 수입니다.