Gemini Voices API

Voices API를 사용하면 자연어 프롬프트 (음성 디자인) 또는 참조 오디오 및 화자 동의 녹음 파일 (음성 복제)에서 커스텀 음성을 만들고, Text-to-Speech (TTS) 합성을 위한 커스텀 음성 및 사전 빌드된 음성을 나열, 검색, 관리할 수 있습니다.

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

자연어 프롬프트(`VOICE_TYPE_PROMPTED`) 또는 참조 및 동의 오디오 녹음(`VOICE_TYPE_REPLICATED`)에서 맞춤 음성을 만듭니다.

요청 본문

요청 본문에는 다음과 같은 구조의 데이터가 포함됩니다.

store boolean  (선택사항)

선택사항입니다. 생성된 음성이 Google에 의해 유지되고 관리되는지 여부입니다. * `true`인 경우 Google은 음성을 저장하고 `Voice.id` (예: `voice_abc123def456`)를 반환합니다. 이 ID는 `GetVoice`, `ListVoices`, `DeleteVoice` 를 통해 관리할 수 있으며 합성 요청에서 ID로 참조할 수 있습니다. 프로젝트에는 최대 활성 저장 음성 할당량이 적용됩니다. 할당량을 초과하면 `RESOURCE_EXHAUSTED`가 반환됩니다. * `false` (기본값)인 경우 음성은 Google에 저장되지 않으며 클라이언트 측 저장 및 합성을 위해 `Voice.key`(예: `voicekey_…`)가 반환됩니다. `store` 가 `false` 인 경우 `voice`의 선택적 탐색 메타데이터 필드가 유지되거나 반환되지 않습니다. * `voice.type` 이 `"prompted"`인 경우 `true`여야 합니다(그렇지 않으면 `INVALID_ARGUMENT`로 실패함).

voice Voice  (required)

필수 항목입니다. 만들 음성입니다. `voice.model` 은 선택사항입니다. 생략하면 서비스에서 기본 음성 생성 모델을 선택합니다. `Voice`의 출력 전용 필드 (`id`, `key`, `expire_time`, `usage`)는 설정된 경우 무시됩니다.

응답

성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.

강조 문자열  (선택사항)

선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').

context string  (선택사항)

선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')

설명 문자열  (선택사항)

선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약

display_name string  (선택사항)

선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.

expire_time string  (선택사항)

출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.

성별 문자열  (선택사항)

선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.

id string  (선택사항)

출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.

key string  (선택사항)

출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.

language_code string  (선택사항)

선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.

model string  (선택사항)

선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.

페르소나 문자열  (선택사항)

선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')

피치 피치  (선택사항)

선택사항입니다. 음성 음조 분류

가능한 값

  • low

    낮은 음성

  • medium

    중간 음조의 음성

  • high

    높은 음성

prompted PromptedVoice  (선택사항)

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

필드

input string  (선택사항)

필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').

region_code 문자열  (선택사항)

선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')

sample_audio AudioData  (선택사항)

출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.

음성 생성에 사용되는 오디오 페이로드입니다.

필드

data string  (선택사항)

필수 항목입니다. 원시 오디오 바이트입니다.

mime_type string  (선택사항)

필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).

type VoiceType  (선택사항)

필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.

가능한 값

  • replicated

    참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.

  • prompted

    자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.

  • prebuilt

    Google의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.

usage Usage  (선택사항)

출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.

상호작용 요청의 토큰 사용량에 관한 통계입니다.

필드

cached_tokens_by_modality array (ModalityTokens)  (optional)

모달리티별 캐시된 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

grounding_tool_count array (GroundingToolCount)  (선택사항)

그라운딩 도구 수입니다.

그라운딩 도구 수입니다.

필드

count 정수  (선택사항)

그라운딩 도구 수입니다.

type enum (string)  (선택사항)

개수와 연결된 그라운딩 도구 유형입니다.

가능한 값은 다음과 같습니다.

  • google_search

    Google 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩

  • google_maps

    Google 지도 기반 그라운딩

input_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 입력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

output_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 출력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

tool_use_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 도구 사용 토큰 사용량 분석

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

total_cached_tokens integer  (선택사항)

프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.

total_input_tokens integer  (선택사항)

프롬프트 (컨텍스트)의 토큰 수입니다.

total_output_tokens integer  (선택사항)

생성된 모든 대답의 총 토큰 수입니다.

total_thought_tokens integer  (선택사항)

사고 모델의 사고 토큰 수입니다.

total_tokens integer  (선택사항)

상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.

total_tool_use_tokens integer  (선택사항)

도구 사용 프롬프트에 있는 토큰 수입니다.

예

응답 예시

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

호출자가 소유한 맞춤 저장 음성 (최신순)과 Google의 음성 카탈로그에 있는 사전 빌드 시스템 음성을 나열합니다.

경로 / 쿼리 매개변수

accent array (string)  (선택사항)

선택사항입니다. 액센트 설명 (예: '미국', '영국')으로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 악센트 중 하나라도 있는 음성과 일치합니다 (OR).

context array (string)  (선택사항)

선택사항입니다. 의도한 컨텍스트 또는 도메인 (예: '뉴스, 상업')으로 필터링합니다. 대소문자를 구분하지 않는 일치검색입니다. 값이 여러 개 지정된 경우 지정된 컨텍스트 중 하나와 음성이 일치합니다 (OR).

성별 배열 (문자열)  (선택사항)

선택사항입니다. 성별 표현 (예: '여성', '남성', '중립')으로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 성별 중 하나와 일치하는 음성을 찾습니다 (OR).

language_code array (string)  (선택사항)

선택사항입니다. BCP-47 언어 코드 (예: 'en-US')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 값이 여러 개 지정된 경우 지정된 언어 코드 중 하나와 음성이 일치합니다 (OR).

page_size integer  (선택사항)

선택사항입니다. 페이지당 반환할 최대 음성 수입니다. 서비스가 이 값보다 더 적게 반환할 수 있습니다. 지정하지 않으면 최대 50개의 음성이 반환됩니다. 최댓값은 1,000이며, 1,000 이상의 값은 1,000으로 변환됩니다.

page_token string  (선택사항)

선택사항입니다. 이전 `ListVoices` 호출에서 수신된 페이지 토큰입니다. 후속 페이지를 가져오려면 이 값을 제공하세요. 페이지로 나눌 때는 모든 필터 쿼리 매개변수 (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, `search`)가 이 토큰을 반환한 호출과 일치해야 합니다. 그렇지 않으면 요청이 `INVALID_ARGUMENT`로 실패합니다. `page_size` 는 페이지 간에 변경될 수 있습니다.

persona array (string)  (선택사항)

선택사항입니다. 보컬 페르소나 (예: '따뜻하고 친근함')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 여러 값을 지정하면 지정된 페르소나 중 하나와 일치하는 음성을 반환합니다 (OR).

pitch array (string)  (선택사항)

선택사항입니다. 보컬 음높이로 필터링 'low', 'medium', 'high' 또는 'PITCH_LOW', 'PITCH_MEDIUM', 'PITCH_HIGH'를 허용합니다(대소문자 구분 안 함). 값이 여러 개 지정된 경우 지정된 음조 중 하나와 일치하는 음성을 일치시킵니다(OR).

region_code array (string)  (선택사항)

선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지역 코드 (예: 'US', '001')로 필터링합니다. 대소문자를 구분하지 않는 정확한 일치입니다. 값이 여러 개 지정된 경우 지정된 지역 코드 중 하나와 일치하는 음성을 찾습니다 (OR).

search string  (선택사항)

선택사항입니다. `display_name` 및 `description`에 대해 대소문자를 구분하지 않고 일치하는 자유 형식 텍스트 하위 문자열 검색어입니다. 최대 2,048바이트입니다.

type array (string)  (선택사항)

선택사항입니다. 음성 유형별로 필터링합니다. 'prebuilt', 'replicated', 'prompted' 또는 'VOICE_TYPE_PREBUILT', 'VOICE_TYPE_REPLICATED', 'VOICE_TYPE_PROMPTED'를 허용합니다(대소문자 구분 안 함). 값이 여러 개 지정된 경우 지정된 유형 중 하나와 음성이 일치합니다 (OR).

응답

성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.

next_page_token string  (선택사항)

다음 페이지를 검색하기 위해 `page_token` 으로 전송할 수 있는 토큰입니다. 비어 있으면 후속 페이지가 없습니다.

voices array (Voice)  (선택사항)

지정된 컬렉션의 음성입니다.

예

응답 예시

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

리소스 이름으로 맞춤 저장 음성 (`store = true`)을 가져옵니다. 사전 빌드된 카탈로그 음성 (`VOICE_TYPE_PREBUILT`)은 `GetVoice`를 통해 가져올 수 없습니다. 대신 `ListVoices` 를 사용하세요.

경로 / 쿼리 매개변수

voicesId string  (필수)

필수 항목입니다. 가져올 맞춤 저장 음성의 리소스 이름입니다(예: `voices/voice_abc123def456`).

응답

성공한 경우 응답 본문은 다음과 같은 구조의 데이터를 포함합니다.

강조 문자열  (선택사항)

선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').

context string  (선택사항)

선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')

설명 문자열  (선택사항)

선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약

display_name string  (선택사항)

선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.

expire_time string  (선택사항)

출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.

성별 문자열  (선택사항)

선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.

id string  (선택사항)

출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.

key string  (선택사항)

출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.

language_code string  (선택사항)

선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.

model string  (선택사항)

선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.

페르소나 문자열  (선택사항)

선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')

피치 피치  (선택사항)

선택사항입니다. 음성 음조 분류

가능한 값

  • low

    낮은 음성

  • medium

    중간 음조의 음성

  • high

    높은 음성

prompted PromptedVoice  (선택사항)

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

필드

input string  (선택사항)

필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').

region_code 문자열  (선택사항)

선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')

sample_audio AudioData  (선택사항)

출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.

음성 생성에 사용되는 오디오 페이로드입니다.

필드

data string  (선택사항)

필수 항목입니다. 원시 오디오 바이트입니다.

mime_type string  (선택사항)

필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).

type VoiceType  (선택사항)

필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.

가능한 값

  • replicated

    참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.

  • prompted

    자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.

  • prebuilt

    Google의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.

usage Usage  (선택사항)

출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.

상호작용 요청의 토큰 사용량에 관한 통계입니다.

필드

cached_tokens_by_modality array (ModalityTokens)  (optional)

모달리티별 캐시된 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

grounding_tool_count array (GroundingToolCount)  (선택사항)

그라운딩 도구 수입니다.

그라운딩 도구 수입니다.

필드

count 정수  (선택사항)

그라운딩 도구 수입니다.

type enum (string)  (선택사항)

개수와 연결된 그라운딩 도구 유형입니다.

가능한 값은 다음과 같습니다.

  • google_search

    Google 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩

  • google_maps

    Google 지도 기반 그라운딩

input_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 입력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

output_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 출력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

tool_use_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 도구 사용 토큰 사용량 분석

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

total_cached_tokens integer  (선택사항)

프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.

total_input_tokens integer  (선택사항)

프롬프트 (컨텍스트)의 토큰 수입니다.

total_output_tokens integer  (선택사항)

생성된 모든 대답의 총 토큰 수입니다.

total_thought_tokens integer  (선택사항)

사고 모델의 사고 토큰 수입니다.

total_tokens integer  (선택사항)

상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.

total_tool_use_tokens integer  (선택사항)

도구 사용 프롬프트에 있는 토큰 수입니다.

예

응답 예시

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

리소스 이름으로 맞춤 저장 음성 (`store = true`)을 삭제합니다. 사전 제작된 카탈로그 음성 (`VOICE_TYPE_PREBUILT`)은 삭제할 수 없습니다.

경로 / 쿼리 매개변수

voicesId string  (필수)

필수 항목입니다. 삭제할 맞춤 저장 음성의 리소스 이름입니다(예: `voices/voice_abc123def456`).

응답

성공한 경우 응답은 비어 있습니다.

예

리소스

음성

맞춤 음성 (`CreateVoice`를 통해 생성됨) 또는 사전 빌드된 시스템 음성 (`ListVoices`에 의해 반환됨)을 나타내는 음성 리소스입니다.

필드

액센트 문자열  (선택사항)

선택사항입니다. 지역 억양 설명자 (예: '미국', '영국').

context string  (선택사항)

선택사항입니다. 최적의 사용 컨텍스트 또는 도메인 (예: '대화형', '오디오북', '뉴스')

설명 문자열  (선택사항)

선택사항입니다. 보컬 음색, 성격, 어조에 대한 설명 요약

display_name string  (선택사항)

선택사항입니다. 저장된 음성 (`store = true`)의 사용자 제공 표시 이름 또는 사전 빌드된 음성의 카탈로그 이름입니다.

expire_time string  (선택사항)

출력 전용입니다. 맞춤 저장 음성 (`store = true`) 또는 복제된 음성 키 (`store = false`)가 만료되는 타임스탬프입니다. 만료되지 않는 사전 빌드 카탈로그 음성 (`"prebuilt"`)의 경우 설정되지 않습니다.

성별 문자열  (선택사항)

선택사항입니다. 인식된 음성 성별 표현 (예: '여성', '남성', '중립')입니다.

id string  (선택사항)

출력 전용입니다. 음성의 고유 식별자입니다. * Google 관리 맞춤 음성 (`store = true`)의 경우 `voice_` 접두사가 있는 생성된 ID입니다 (예: `voice_abc123def456`). `GetVoice` 및 `DeleteVoice` 에서 `voices/{id}`를 `name`으로 전달하고 음성 합성 중에 `{id}` 를 `SpeechConfig.voice_config.voice` (또는 `SpeechConfig.voice`)에 직접 전달합니다. * 사전 빌드된 카탈로그 음성 (`ListVoices`에서 `"prebuilt"` 반환)의 경우 화자 이름입니다 (예: `Puck` 또는 `Charon`). * `store = false` 로 `CreateVoice`가 호출되면 설정되지 않습니다.

key string  (선택사항)

출력 전용입니다. 클라이언트 관리 음성 복제 키 (접두사 `voicekey_` 사용). `type`이 `"replicated"`이고 `store`가 false인 경우 `CreateVoice`에 의해서만 반환됩니다. 음성 합성 중에 이 키를 `SpeechConfig.voice_config.voice`(또는 `SpeechConfig.voice`)에 전달합니다.

language_code string  (선택사항)

선택사항입니다. 기본 BCP-47 언어 태그 (예: 'en-US', 'fr-FR')입니다.

model string  (선택사항)

선택사항입니다. 음성을 설계하거나 복제하는 데 사용된 모델입니다. `CreateVoice`에서 생략된 경우 지원되는 최신 음성 디자인 모델이 기본값으로 사용됩니다. 맞춤 음성('prompted' 및 'replicated')의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다. 'prebuilt' 음성의 경우 설정되지 않습니다. 생성된 음성은 지원되는 TTS 합성 모델에서 합성할 수 있습니다.

페르소나 문자열  (선택사항)

선택사항입니다. 의도한 페르소나 또는 캐릭터 원형 (예: '따뜻하고 친근함', '내레이터')

피치 피치  (선택사항)

선택사항입니다. 음성 음조 분류

가능한 값

  • low

    낮은 음성

  • medium

    중간 음조의 음성

  • high

    높은 음성

prompted PromptedVoice  (선택사항)

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

프롬프트 기반 음성 생성을 위한 파라미터입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`에서 필수입니다. 프롬프트 음성의 경우 `CreateVoice`, `GetVoice`, `ListVoices` 응답에서 반환됩니다.

필드

input string  (선택사항)

필수 항목입니다. 원하는 음성을 설명하는 자연어 프롬프트입니다(예: '중년의 거대한 악마 오우거의 깊고 우렁찬 남성 음성').

region_code 문자열  (선택사항)

선택사항입니다. ISO 3166-1 alpha-2 또는 UN M.49 지리적 지역 코드 (예: 'US', 'GB', '001')

sample_audio AudioData  (선택사항)

출력 전용입니다. 프롬프트가 지정된 음성에 대해 생성된 샘플 오디오 (합성기 프롬프트 오디오)입니다. `type` 이 `"prompted"`인 경우 `CreateVoice` 및 `GetVoice` 응답에서만 채워집니다. `ListVoices` 응답 및 `"replicated"` 또는 `"prebuilt"` 음성의 경우 설정되지 않습니다.

음성 생성에 사용되는 오디오 페이로드입니다.

필드

data string  (선택사항)

필수 항목입니다. 원시 오디오 바이트입니다.

mime_type string  (선택사항)

필수 항목입니다. 오디오 데이터의 IANA MIME 유형입니다 (예: `audio/wav` 또는 `audio/mpeg`).

type VoiceType  (선택사항)

필수 항목입니다. 음성 유형입니다. `CreateVoice`에서는 `"replicated"` 또는 `"prompted"`여야 합니다. `ListVoices` 응답에서는 `"prebuilt"`일 수도 있습니다.

가능한 값

  • replicated

    참조 오디오 샘플 및 화자 동의 녹음에서 복제된 맞춤 음성입니다.

  • prompted

    자연어 텍스트 프롬프트에서 생성된 맞춤 음성입니다.

  • prebuilt

    Google의 음성 카탈로그에 있는 내장 시스템 음성입니다 (예: `Puck`, `Charon`). 응답에 반환되며 `CreateVoice`에서 유형으로 지정할 수 없습니다.

usage Usage  (선택사항)

출력 전용입니다. 음성 생성 요청의 토큰 사용량 통계입니다. `type` 이 `"prompted"`인 경우 `CreateVoice`의 응답에서만 채워집니다. `"replicated"` 의 경우와 `GetVoice` 및 `ListVoices` 응답에서는 설정되지 않습니다.

상호작용 요청의 토큰 사용량에 관한 통계입니다.

필드

cached_tokens_by_modality array (ModalityTokens)  (optional)

모달리티별 캐시된 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

grounding_tool_count array (GroundingToolCount)  (선택사항)

그라운딩 도구 수입니다.

그라운딩 도구 수입니다.

필드

count 정수  (선택사항)

그라운딩 도구 수입니다.

type enum (string)  (선택사항)

개수와 연결된 그라운딩 도구 유형입니다.

가능한 값은 다음과 같습니다.

  • google_search

    Google 웹 검색 및 이미지 검색을 사용한 그라운딩, 엔터프라이즈용 웹 그라운딩

  • google_maps

    Google 지도 기반 그라운딩

input_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 입력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

output_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 출력 토큰 사용량 분석입니다.

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

tool_use_tokens_by_modality array (ModalityTokens)  (선택사항)

모달리티별 도구 사용 토큰 사용량 분석

단일 응답 모달리티의 토큰 수입니다.

필드

modality ResponseModality  (선택사항)

토큰 수와 연결된 모달리티입니다.

가능한 값

  • text

    모델이 텍스트를 반환해야 함을 나타냅니다.

  • image

    모델이 이미지를 반환해야 함을 나타냅니다.

  • audio

    모델이 오디오를 반환해야 함을 나타냅니다.

  • video

    모델이 동영상을 반환해야 함을 나타냅니다.

  • document

    모델이 문서를 반환해야 함을 나타냅니다.

토큰 정수  (선택사항)

모달리티의 토큰 수입니다.

total_cached_tokens integer  (선택사항)

프롬프트의 캐시된 부분 (캐시된 콘텐츠)의 토큰 수입니다.

total_input_tokens integer  (선택사항)

프롬프트 (컨텍스트)의 토큰 수입니다.

total_output_tokens integer  (선택사항)

생성된 모든 대답의 총 토큰 수입니다.

total_thought_tokens integer  (선택사항)

사고 모델의 사고 토큰 수입니다.

total_tokens integer  (선택사항)

상호작용 요청의 총 토큰 수 (프롬프트 + 대답 + 기타 내부 토큰)입니다.

total_tool_use_tokens integer  (선택사항)

도구 사용 프롬프트에 있는 토큰 수입니다.