Voices API cho phép bạn tạo giọng nói tuỳ chỉnh từ câu lệnh bằng ngôn ngữ tự nhiên (Thiết kế giọng nói) hoặc từ bản ghi âm tham chiếu và bản ghi âm sự đồng ý của người nói (Sao chép giọng nói), cũng như liệt kê, truy xuất và quản lý giọng nói tuỳ chỉnh và giọng nói được tạo sẵn để tổng hợp Văn bản thành lời nói (TTS).
CreateVoice
Tạo giọng nói tuỳ chỉnh từ một câu lệnh bằng ngôn ngữ tự nhiên (`VOICE_TYPE_PROMPTED`) hoặc từ bản ghi âm tham chiếu và bản ghi âm có sự đồng ý (`VOICE_TYPE_REPLICATED`).
Nội dung yêu cầu
Nội dung yêu cầu chứa dữ liệu với cấu trúc sau:
Không bắt buộc. Liệu giọng nói được tạo có được Google duy trì và quản lý hay không. * Khi giá trị là "true", Google sẽ lưu trữ giọng nói và trả về "Voice.id" (ví dụ: "voice_abc123def456"). Bạn có thể quản lý giọng nói này thông qua "GetVoice", "ListVoices" và "DeleteVoice", đồng thời tham chiếu theo mã nhận dạng trong các yêu cầu tổng hợp. Các dự án phải tuân theo hạn mức tối đa về số lượng giọng nói đang hoạt động được lưu trữ; nếu vượt quá hạn mức, hệ thống sẽ trả về `RESOURCE_EXHAUSTED`. * Khi giá trị là `false` (mặc định), giọng nói sẽ không được Google lưu trữ và `Voice.key` (ví dụ: `voicekey_...`) sẽ được trả về để lưu trữ và tổng hợp phía máy khách. Các trường siêu dữ liệu không bắt buộc để khám phá trên "voice" sẽ không được duy trì hoặc trả về khi "store" là "false". Bạn phải đặt giá trị này thành "true" khi "voice.type" là "prompted" (nếu không, yêu cầu sẽ thất bại với lỗi "INVALID_ARGUMENT").
Bắt buộc. Giọng nói để tạo. `voice.model` là không bắt buộc; nếu bạn bỏ qua, dịch vụ sẽ chọn mô hình tạo giọng nói mặc định. Các trường chỉ có đầu ra trên "Voice" ("id", "key", "expire_time", "usage") sẽ bị bỏ qua nếu được đặt.
Phản hồi
Nếu thành công, phần nội dung phản hồi sẽ chứa dữ liệu có cấu trúc sau:
Không bắt buộc. Bộ mô tả giọng địa phương (ví dụ: "Mỹ", "Anh").
Không bắt buộc. Bối cảnh hoặc miền sử dụng tối ưu (ví dụ: "Đàm thoại", "Sách nói", "Tin tức").
Không bắt buộc. Nội dung mô tả tóm tắt về âm sắc, cá tính và giọng điệu.
Không bắt buộc. Tên hiển thị do người dùng cung cấp cho giọng nói được lưu trữ (`store = true`), hoặc tên danh mục cho giọng nói được tạo sẵn.
Chỉ có đầu ra. Dấu thời gian mà khoá giọng nói tuỳ chỉnh được lưu trữ (`store = true`) hoặc khoá giọng nói được sao chép (`store = false`) hết hạn. Chưa đặt cho giọng nói trong danh mục được tạo sẵn ("prebuilt"), những giọng nói này không hết hạn.
Không bắt buộc. Giới tính giọng nói được nhận biết (ví dụ: "nữ", "nam", "trung tính").
Chỉ có đầu ra. Giá trị nhận dạng duy nhất của giọng nói. * Đối với giọng nói tuỳ chỉnh do Google quản lý ("store = true"), đây là một mã nhận dạng được tạo có tiền tố "voice_" (ví dụ: "voice_abc123def456"). Truyền "voices/{id}" làm "name" trong "GetVoice" và "DeleteVoice", đồng thời truyền "{id}" trực tiếp đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói. * Đối với giọng nói trong danh mục được tạo sẵn (`"prebuilt"` do `ListVoices` trả về), đây là tên người nói (ví dụ: `Puck` hoặc `Charon`). * Chưa đặt khi `CreateVoice` được gọi bằng `store = false`.
Chỉ có đầu ra. Khoá nhân bản giọng nói do khách hàng quản lý (có tiền tố "voicekey_"). Chỉ được trả về bởi "CreateVoice" khi "type" là "replicated" và "store" là "false". Truyền khoá này đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói.
Không bắt buộc. Thẻ ngôn ngữ BCP-47 chính (ví dụ: "en-US", "fr-FR").
Không bắt buộc. Mô hình được dùng để thiết kế hoặc sao chép giọng nói. Nếu bị bỏ qua trong "CreateVoice", thì mặc định sẽ là mô hình thiết kế giọng nói được hỗ trợ mới nhất. Trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói tuỳ chỉnh ("prompted" và"replicated"); không đặt cho giọng nói"prebuilt". Bạn có thể tổng hợp giọng nói đã tạo bằng bất kỳ mô hình tổng hợp TTS nào được hỗ trợ.
Không bắt buộc. Nhân cách hoặc hình mẫu nhân vật dự kiến (ví dụ: "Ấm áp, thân thiện", "Người kể chuyện").
pitch Pitch (không bắt buộc)
Không bắt buộc. Phân loại cao độ giọng nói.
Giá trị được phép
-
lowGiọng trầm hơn.
-
mediumGiọng trung.
-
highGiọng cao hơn.
prompted PromptedVoice (không bắt buộc)
Các tham số để tạo giọng nói theo câu lệnh. Bắt buộc trong `CreateVoice` khi `type` là `"prompted"`. Được trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói được nhắc.
Trường
Bắt buộc. Câu lệnh bằng ngôn ngữ tự nhiên mô tả giọng nói mong muốn, ví dụ: "Giọng nam trầm, vang dội của một yêu tinh độc ác to lớn ở độ tuổi trung niên".
Không bắt buộc. Mã khu vực địa lý theo tiêu chuẩn ISO 3166-1 alpha-2 hoặc UN M.49 (ví dụ: "US", "GB", "001").
sample_audio AudioData (không bắt buộc)
Chỉ có đầu ra. Âm thanh mẫu (âm thanh từ câu lệnh cho bộ tổng hợp) được tạo cho một giọng nói có câu lệnh. Chỉ được điền sẵn trong các phản hồi `CreateVoice` và `GetVoice` khi `type` là"prompted"; không được đặt trong các phản hồi `ListVoices` và cho giọng nói"replicated" hoặc"prebuilt".
Trường
Bắt buộc. Các byte âm thanh thô.
Bắt buộc. Loại MIME IANA của dữ liệu âm thanh (ví dụ: "audio/wav" hoặc "audio/mpeg").
type VoiceType (không bắt buộc)
Bắt buộc. Loại giọng nói. Trong `CreateVoice`, phải là `"replicated"` hoặc `"prompted"`. Trong các phản hồi `ListVoices`, cũng có thể là `"prebuilt"`.
Giá trị được phép
-
replicatedGiọng nói tuỳ chỉnh được sao chép từ một bản ghi âm mẫu tham chiếu và bản ghi âm đồng ý của người nói.
-
promptedGiọng nói tuỳ chỉnh được tạo từ câu lệnh văn bản bằng ngôn ngữ tự nhiên.
-
prebuiltMột giọng nói hệ thống được tích hợp sẵn trong danh mục giọng nói của Google (ví dụ: "Puck", "Charon"). Được trả về trong các phản hồi; không thể chỉ định làm loại trong CreateVoice.
usage Usage (không bắt buộc)
Chỉ có đầu ra. Số liệu thống kê về việc sử dụng mã thông báo cho yêu cầu tạo giọng nói. Chỉ được điền sẵn trong phản hồi của `CreateVoice` khi `type` là"prompted"; không được đặt cho"replicated" và trong các phản hồi `GetVoice` và `ListVoices`.
Trường
cached_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo được lưu vào bộ nhớ đệm theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
grounding_tool_count array (GroundingToolCount) (không bắt buộc)
Số lượng công cụ liên kết thực tế.
Trường
Số lượng công cụ tiếp đất.
Loại công cụ cơ sở liên kết với số lượng.
Các giá trị có thể có:
-
google_searchNeo bám bằng Google Tìm kiếm trên web và Tìm kiếm bằng hình ảnh, cũng như Neo bám trên web cho doanh nghiệp.
-
google_mapsNeo bám vào Google Maps.
input_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về mức sử dụng mã thông báo đầu vào theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
output_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về việc sử dụng mã thông báo đầu ra theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
tool_use_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo sử dụng công cụ theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
Số lượng mã thông báo trong phần được lưu vào bộ nhớ đệm của câu lệnh (nội dung được lưu vào bộ nhớ đệm).
Số lượng mã thông báo trong câu lệnh (ngữ cảnh).
Tổng số mã thông báo trong tất cả các câu trả lời được tạo.
Số lượng mã thông báo của suy nghĩ cho mô hình tư duy.
Tổng số token cho yêu cầu tương tác (câu lệnh + câu trả lời + các token nội bộ khác).
Số lượng mã thông báo có trong(các) câu lệnh sử dụng công cụ.
Ví dụ
Ví dụ về phản hồi
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Liệt kê các giọng nói tuỳ chỉnh do người gọi sở hữu (sắp xếp theo thứ tự mới nhất trước) theo sau là các giọng nói được tạo sẵn của hệ thống trong danh mục giọng nói của Google.
Tham số đường dẫn / truy vấn
Không bắt buộc. Lọc theo nội dung mô tả giọng (ví dụ: "Mỹ", "Anh"). Kiểu khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì giọng nói sẽ khớp với bất kỳ giọng nào được chỉ định (OR).
Không bắt buộc. Lọc theo bối cảnh hoặc miền dự kiến (ví dụ: "Tin tức, Thương mại"). Kiểu khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì giọng nói sẽ khớp với bất kỳ ngữ cảnh nào được chỉ định (OR).
Không bắt buộc. Lọc theo cách thể hiện giới tính (ví dụ: "nữ", "nam", "trung tính"). Khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì giọng nói sẽ khớp với bất kỳ giới tính nào được chỉ định (OR).
Không bắt buộc. Lọc theo mã ngôn ngữ BCP-47 (ví dụ: "en-US"). Kiểu khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì các giá trị đó sẽ khớp với giọng nói có bất kỳ mã ngôn ngữ nào được chỉ định (OR).
Không bắt buộc. Số lượng giọng nói tối đa được trả về trên mỗi trang. Dịch vụ có thể trả về ít hơn giá trị này. Nếu bạn không chỉ định, tối đa 50 giọng nói sẽ được trả về. Giá trị tối đa là 1.000; các giá trị trên 1.000 sẽ được chuyển đổi thành 1.000.
Không bắt buộc. Mã thông báo trang nhận được từ lệnh gọi `ListVoices` trước đó. Cung cấp thông tin này để truy xuất trang tiếp theo. Khi phân trang, tất cả các tham số truy vấn bộ lọc ("language_code", "region_code", "accent", "persona", "context", "gender", "pitch", "type" và "search") phải khớp với lệnh gọi trả về mã thông báo này; nếu không, yêu cầu sẽ không thành công với "INVALID_ARGUMENT". "page_size" có thể thay đổi giữa các trang.
Không bắt buộc. Lọc theo giọng điệu (ví dụ: "Ấm áp, thân thiện"). Kiểu khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì sẽ so khớp giọng nói với bất kỳ nhân vật nào được chỉ định (OR).
Không bắt buộc. Lọc theo cao độ giọng hát. Chấp nhận "low", "medium", "high" hoặc "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (không phân biệt chữ hoa chữ thường). Nếu bạn chỉ định nhiều giá trị, thì các giá trị đó sẽ khớp với giọng nói có bất kỳ cao độ nào được chỉ định (HOẶC).
Không bắt buộc. Lọc theo mã quốc gia ISO 3166-1 alpha-2 hoặc mã khu vực UN M.49 (ví dụ: "US", "001"). Kiểu khớp chính xác không phân biệt chữ hoa chữ thường. Nếu bạn chỉ định nhiều giá trị, thì giọng nói sẽ khớp với bất kỳ mã khu vực nào được chỉ định (HOẶC).
Không bắt buộc. Cụm từ tìm kiếm chuỗi con văn bản tự do được so khớp không phân biệt chữ hoa chữ thường với cả "display_name" và "description". Tối đa 2048 byte.
Không bắt buộc. Lọc theo loại giọng nói. Chấp nhận "prebuilt", "replicated", "prompted" hoặc "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (không phân biệt chữ hoa chữ thường). Nếu bạn chỉ định nhiều giá trị, thì sẽ khớp với giọng nói có bất kỳ loại nào được chỉ định (OR).
Phản hồi
Nếu thành công, phần nội dung phản hồi sẽ chứa dữ liệu có cấu trúc sau:
Một mã thông báo có thể được gửi dưới dạng "page_token" để truy xuất trang tiếp theo. Nếu trống, tức là không có trang nào tiếp theo.
Giọng nói trong bộ sưu tập được chỉ định.
Ví dụ
Ví dụ về phản hồi
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Lấy một giọng nói tuỳ chỉnh được lưu trữ (`store = true`) theo tên tài nguyên. Bạn không thể truy xuất các giọng nói trong danh mục được tạo sẵn (`VOICE_TYPE_PREBUILT`) thông qua "GetVoice"; thay vào đó, hãy sử dụng "ListVoices".
Tham số đường dẫn / truy vấn
Bắt buộc. Tên tài nguyên của giọng nói tuỳ chỉnh được lưu trữ cần truy xuất (ví dụ: "voices/voice_abc123def456").
Phản hồi
Nếu thành công, phần nội dung phản hồi sẽ chứa dữ liệu có cấu trúc sau:
Không bắt buộc. Bộ mô tả giọng địa phương (ví dụ: "Mỹ", "Anh").
Không bắt buộc. Bối cảnh hoặc miền sử dụng tối ưu (ví dụ: "Đàm thoại", "Sách nói", "Tin tức").
Không bắt buộc. Nội dung mô tả tóm tắt về âm sắc, cá tính và giọng điệu.
Không bắt buộc. Tên hiển thị do người dùng cung cấp cho giọng nói được lưu trữ (`store = true`), hoặc tên danh mục cho giọng nói được tạo sẵn.
Chỉ có đầu ra. Dấu thời gian mà khoá giọng nói tuỳ chỉnh được lưu trữ (`store = true`) hoặc khoá giọng nói được sao chép (`store = false`) hết hạn. Chưa đặt cho giọng nói trong danh mục được tạo sẵn ("prebuilt"), những giọng nói này không hết hạn.
Không bắt buộc. Giới tính giọng nói được nhận biết (ví dụ: "nữ", "nam", "trung tính").
Chỉ có đầu ra. Giá trị nhận dạng duy nhất của giọng nói. * Đối với giọng nói tuỳ chỉnh do Google quản lý ("store = true"), đây là một mã nhận dạng được tạo có tiền tố "voice_" (ví dụ: "voice_abc123def456"). Truyền "voices/{id}" làm "name" trong "GetVoice" và "DeleteVoice", đồng thời truyền "{id}" trực tiếp đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói. * Đối với giọng nói trong danh mục được tạo sẵn (`"prebuilt"` do `ListVoices` trả về), đây là tên người nói (ví dụ: `Puck` hoặc `Charon`). * Chưa đặt khi `CreateVoice` được gọi bằng `store = false`.
Chỉ có đầu ra. Khoá nhân bản giọng nói do khách hàng quản lý (có tiền tố "voicekey_"). Chỉ được trả về bởi "CreateVoice" khi "type" là "replicated" và "store" là "false". Truyền khoá này đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói.
Không bắt buộc. Thẻ ngôn ngữ BCP-47 chính (ví dụ: "en-US", "fr-FR").
Không bắt buộc. Mô hình được dùng để thiết kế hoặc sao chép giọng nói. Nếu bị bỏ qua trong "CreateVoice", thì mặc định sẽ là mô hình thiết kế giọng nói được hỗ trợ mới nhất. Trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói tuỳ chỉnh ("prompted" và"replicated"); không đặt cho giọng nói"prebuilt". Bạn có thể tổng hợp giọng nói đã tạo bằng bất kỳ mô hình tổng hợp TTS nào được hỗ trợ.
Không bắt buộc. Nhân cách hoặc hình mẫu nhân vật dự kiến (ví dụ: "Ấm áp, thân thiện", "Người kể chuyện").
pitch Pitch (không bắt buộc)
Không bắt buộc. Phân loại cao độ giọng nói.
Giá trị được phép
-
lowGiọng trầm hơn.
-
mediumGiọng trung.
-
highGiọng cao hơn.
prompted PromptedVoice (không bắt buộc)
Các tham số để tạo giọng nói theo câu lệnh. Bắt buộc trong `CreateVoice` khi `type` là `"prompted"`. Được trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói được nhắc.
Trường
Bắt buộc. Câu lệnh bằng ngôn ngữ tự nhiên mô tả giọng nói mong muốn, ví dụ: "Giọng nam trầm, vang dội của một yêu tinh độc ác to lớn ở độ tuổi trung niên".
Không bắt buộc. Mã khu vực địa lý theo tiêu chuẩn ISO 3166-1 alpha-2 hoặc UN M.49 (ví dụ: "US", "GB", "001").
sample_audio AudioData (không bắt buộc)
Chỉ có đầu ra. Âm thanh mẫu (âm thanh từ câu lệnh cho bộ tổng hợp) được tạo cho một giọng nói có câu lệnh. Chỉ được điền sẵn trong các phản hồi `CreateVoice` và `GetVoice` khi `type` là"prompted"; không được đặt trong các phản hồi `ListVoices` và cho giọng nói"replicated" hoặc"prebuilt".
Trường
Bắt buộc. Các byte âm thanh thô.
Bắt buộc. Loại MIME IANA của dữ liệu âm thanh (ví dụ: "audio/wav" hoặc "audio/mpeg").
type VoiceType (không bắt buộc)
Bắt buộc. Loại giọng nói. Trong `CreateVoice`, phải là `"replicated"` hoặc `"prompted"`. Trong các phản hồi `ListVoices`, cũng có thể là `"prebuilt"`.
Giá trị được phép
-
replicatedGiọng nói tuỳ chỉnh được sao chép từ một bản ghi âm mẫu tham chiếu và bản ghi âm đồng ý của người nói.
-
promptedGiọng nói tuỳ chỉnh được tạo từ câu lệnh văn bản bằng ngôn ngữ tự nhiên.
-
prebuiltMột giọng nói hệ thống được tích hợp sẵn trong danh mục giọng nói của Google (ví dụ: "Puck", "Charon"). Được trả về trong các phản hồi; không thể chỉ định làm loại trong CreateVoice.
usage Usage (không bắt buộc)
Chỉ có đầu ra. Số liệu thống kê về việc sử dụng mã thông báo cho yêu cầu tạo giọng nói. Chỉ được điền sẵn trong phản hồi của `CreateVoice` khi `type` là"prompted"; không được đặt cho"replicated" và trong các phản hồi `GetVoice` và `ListVoices`.
Trường
cached_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo được lưu vào bộ nhớ đệm theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
grounding_tool_count array (GroundingToolCount) (không bắt buộc)
Số lượng công cụ liên kết thực tế.
Trường
Số lượng công cụ tiếp đất.
Loại công cụ cơ sở liên kết với số lượng.
Các giá trị có thể có:
-
google_searchNeo bám bằng Google Tìm kiếm trên web và Tìm kiếm bằng hình ảnh, cũng như Neo bám trên web cho doanh nghiệp.
-
google_mapsNeo bám vào Google Maps.
input_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về mức sử dụng mã thông báo đầu vào theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
output_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về việc sử dụng mã thông báo đầu ra theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
tool_use_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo sử dụng công cụ theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
Số lượng mã thông báo trong phần được lưu vào bộ nhớ đệm của câu lệnh (nội dung được lưu vào bộ nhớ đệm).
Số lượng mã thông báo trong câu lệnh (ngữ cảnh).
Tổng số mã thông báo trong tất cả các câu trả lời được tạo.
Số lượng mã thông báo của suy nghĩ cho mô hình tư duy.
Tổng số token cho yêu cầu tương tác (câu lệnh + câu trả lời + các token nội bộ khác).
Số lượng mã thông báo có trong(các) câu lệnh sử dụng công cụ.
Ví dụ
Ví dụ về phản hồi
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Xoá một giọng nói tuỳ chỉnh đã lưu trữ (`store = true`) theo tên tài nguyên. Bạn không thể xoá các giọng nói trong danh mục được tạo sẵn (`VOICE_TYPE_PREBUILT`).
Tham số đường dẫn / truy vấn
Bắt buộc. Tên tài nguyên của giọng nói tuỳ chỉnh đã lưu trữ cần xoá (ví dụ: `voices/voice_abc123def456`).
Phản hồi
Nếu thành công, phản hồi sẽ trống.
Ví dụ
Tài nguyên
Voice
Một tài nguyên giọng nói đại diện cho giọng nói tuỳ chỉnh (được tạo thông qua "CreateVoice") hoặc giọng nói hệ thống được tạo sẵn (do "ListVoices" trả về).
Trường
Không bắt buộc. Bộ mô tả giọng địa phương (ví dụ: "Mỹ", "Anh").
Không bắt buộc. Bối cảnh hoặc miền sử dụng tối ưu (ví dụ: "Đàm thoại", "Sách nói", "Tin tức").
Không bắt buộc. Nội dung mô tả tóm tắt về âm sắc, cá tính và giọng điệu.
Không bắt buộc. Tên hiển thị do người dùng cung cấp cho giọng nói được lưu trữ (`store = true`), hoặc tên danh mục cho giọng nói được tạo sẵn.
Chỉ có đầu ra. Dấu thời gian mà khoá giọng nói tuỳ chỉnh được lưu trữ (`store = true`) hoặc khoá giọng nói được sao chép (`store = false`) hết hạn. Chưa đặt cho giọng nói trong danh mục được tạo sẵn ("prebuilt"), những giọng nói này không hết hạn.
Không bắt buộc. Giới tính giọng nói được nhận biết (ví dụ: "nữ", "nam", "trung tính").
Chỉ có đầu ra. Giá trị nhận dạng duy nhất của giọng nói. * Đối với giọng nói tuỳ chỉnh do Google quản lý ("store = true"), đây là một mã nhận dạng được tạo có tiền tố "voice_" (ví dụ: "voice_abc123def456"). Truyền "voices/{id}" làm "name" trong "GetVoice" và "DeleteVoice", đồng thời truyền "{id}" trực tiếp đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói. * Đối với giọng nói trong danh mục được tạo sẵn (`"prebuilt"` do `ListVoices` trả về), đây là tên người nói (ví dụ: `Puck` hoặc `Charon`). * Chưa đặt khi `CreateVoice` được gọi bằng `store = false`.
Chỉ có đầu ra. Khoá nhân bản giọng nói do khách hàng quản lý (có tiền tố "voicekey_"). Chỉ được trả về bởi "CreateVoice" khi "type" là "replicated" và "store" là "false". Truyền khoá này đến "SpeechConfig.voice_config.voice" (hoặc "SpeechConfig.voice") trong quá trình tổng hợp lời nói.
Không bắt buộc. Thẻ ngôn ngữ BCP-47 chính (ví dụ: "en-US", "fr-FR").
Không bắt buộc. Mô hình được dùng để thiết kế hoặc sao chép giọng nói. Nếu bị bỏ qua trong "CreateVoice", thì mặc định sẽ là mô hình thiết kế giọng nói được hỗ trợ mới nhất. Trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói tuỳ chỉnh ("prompted" và"replicated"); không đặt cho giọng nói"prebuilt". Bạn có thể tổng hợp giọng nói đã tạo bằng bất kỳ mô hình tổng hợp TTS nào được hỗ trợ.
Không bắt buộc. Nhân cách hoặc hình mẫu nhân vật dự kiến (ví dụ: "Ấm áp, thân thiện", "Người kể chuyện").
pitch Pitch (không bắt buộc)
Không bắt buộc. Phân loại cao độ giọng nói.
Giá trị được phép
-
lowGiọng trầm hơn.
-
mediumGiọng trung.
-
highGiọng cao hơn.
prompted PromptedVoice (không bắt buộc)
Các tham số để tạo giọng nói theo câu lệnh. Bắt buộc trong `CreateVoice` khi `type` là `"prompted"`. Được trả về trong các phản hồi `CreateVoice`, `GetVoice` và `ListVoices` cho giọng nói được nhắc.
Trường
Bắt buộc. Câu lệnh bằng ngôn ngữ tự nhiên mô tả giọng nói mong muốn, ví dụ: "Giọng nam trầm, vang dội của một yêu tinh độc ác to lớn ở độ tuổi trung niên".
Không bắt buộc. Mã khu vực địa lý theo tiêu chuẩn ISO 3166-1 alpha-2 hoặc UN M.49 (ví dụ: "US", "GB", "001").
sample_audio AudioData (không bắt buộc)
Chỉ có đầu ra. Âm thanh mẫu (âm thanh từ câu lệnh cho bộ tổng hợp) được tạo cho một giọng nói có câu lệnh. Chỉ được điền sẵn trong các phản hồi `CreateVoice` và `GetVoice` khi `type` là"prompted"; không được đặt trong các phản hồi `ListVoices` và cho giọng nói"replicated" hoặc"prebuilt".
Trường
Bắt buộc. Các byte âm thanh thô.
Bắt buộc. Loại MIME IANA của dữ liệu âm thanh (ví dụ: "audio/wav" hoặc "audio/mpeg").
type VoiceType (không bắt buộc)
Bắt buộc. Loại giọng nói. Trong `CreateVoice`, phải là `"replicated"` hoặc `"prompted"`. Trong các phản hồi `ListVoices`, cũng có thể là `"prebuilt"`.
Giá trị được phép
-
replicatedGiọng nói tuỳ chỉnh được sao chép từ một bản ghi âm mẫu tham chiếu và bản ghi âm đồng ý của người nói.
-
promptedGiọng nói tuỳ chỉnh được tạo từ câu lệnh văn bản bằng ngôn ngữ tự nhiên.
-
prebuiltMột giọng nói hệ thống được tích hợp sẵn trong danh mục giọng nói của Google (ví dụ: "Puck", "Charon"). Được trả về trong các phản hồi; không thể chỉ định làm loại trong CreateVoice.
usage Usage (không bắt buộc)
Chỉ có đầu ra. Số liệu thống kê về việc sử dụng mã thông báo cho yêu cầu tạo giọng nói. Chỉ được điền sẵn trong phản hồi của `CreateVoice` khi `type` là"prompted"; không được đặt cho"replicated" và trong các phản hồi `GetVoice` và `ListVoices`.
Trường
cached_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo được lưu vào bộ nhớ đệm theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
grounding_tool_count array (GroundingToolCount) (không bắt buộc)
Số lượng công cụ liên kết thực tế.
Trường
Số lượng công cụ tiếp đất.
Loại công cụ cơ sở liên kết với số lượng.
Các giá trị có thể có:
-
google_searchNeo bám bằng Google Tìm kiếm trên web và Tìm kiếm bằng hình ảnh, cũng như Neo bám trên web cho doanh nghiệp.
-
google_mapsNeo bám vào Google Maps.
input_tokens_by_modality mảng (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về mức sử dụng mã thông báo đầu vào theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
output_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Thông tin chi tiết về việc sử dụng mã thông báo đầu ra theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
tool_use_tokens_by_modality array (ModalityTokens) (không bắt buộc)
Bảng chi tiết về việc sử dụng mã thông báo sử dụng công cụ theo phương thức.
Trường
phương thức ResponseModality (không bắt buộc)
Phương thức liên kết với số token.
Giá trị được phép
-
textCho biết mô hình sẽ trả về văn bản.
-
imageCho biết mô hình sẽ trả về hình ảnh.
-
audioCho biết mô hình sẽ trả về âm thanh.
-
videoCho biết mô hình sẽ trả về video.
-
documentCho biết mô hình sẽ trả về các tài liệu.
Số lượng mã thông báo cho phương thức.
Số lượng mã thông báo trong phần được lưu vào bộ nhớ đệm của câu lệnh (nội dung được lưu vào bộ nhớ đệm).
Số lượng mã thông báo trong câu lệnh (ngữ cảnh).
Tổng số mã thông báo trong tất cả các câu trả lời được tạo.
Số lượng mã thông báo của suy nghĩ cho mô hình tư duy.
Tổng số token cho yêu cầu tương tác (câu lệnh + câu trả lời + các token nội bộ khác).
Số lượng mã thông báo có trong(các) câu lệnh sử dụng công cụ.