Gemini 3.5 Transcribe to model zamiany mowy na tekst oparty na możliwościach Gemini w zakresie rozumienia dźwięku. Zapewnia dokładną transkrypcję o niskim poziomie opóźnień z wykrywaniem języka na podstawie wypowiedzi, rozdzielaniem rozmówców, sygnaturami czasowymi na poziomie słów, inteligentną transkrypcją i rozpoznawaniem słów z uwzględnieniem kontekstu w przypadku słownictwa niestandardowego.
Dokumentacja
Gemini 3.5 Transcribe przekształca mowę z plików audio na tekst. Automatycznie wykrywa ponad 85 języków, obsługuje przełączanie kodu w wielu językach, identyfikuje poszczególnych rozmówców, podaje sygnatury czasowe na poziomie słów i dostosowuje się do terminów specyficznych dla danej dziedziny dzięki uwzględnianiu słownictwa niestandardowego.
Pełne omówienie funkcji, które nie są związane ze streamingiem, znajdziesz w przewodniku Transkrypcja dźwięku. Aby uzyskać transkrypcję strumieniową w czasie rzeczywistym z małym opóźnieniem przez WebSockets, zapoznaj się z przewodnikiem Transkrypcja na żywo, korzystając z gemini-3.5-transcribe-live. Szczegółowe informacje o cenach znajdziesz na stronie z cennikiem.
gemini-3.5-transcribe
| Właściwość | Opis |
|---|---|
| Kod modelu | gemini-3.5-transcribe |
| Obsługiwane typy danych |
Dane wejściowe Dźwięk (do 1 godziny) Dane wyjściowe Adnotacje tekstowe i słowne |
| Limity dotyczące dźwięku |
Limit audio w przypadku wywołań binarnych Do 1 godziny na żądanie (do 30 minut, gdy włączone jest rozdzielanie rozmówców lub sygnatury czasowe na poziomie słów) |
| Uprawnienia | Obsługiwane Obsługiwane Sygnatury czasowe na poziomie słów Obsługiwane Obsługiwane Obsługiwane Zapisywanie w pamięci podręcznej Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane |
| Opcje wykorzystania |
Nieobsługiwane Nieobsługiwane Nieobsługiwane |
| Wersje |
|
| Ostatnia aktualizacja | Sierpień 2026 r. |
Obsługa funkcji i ograniczenia
Gemini 3.5 Transcribe obsługuje te funkcje w ramach 2 punktów końcowych:
| Funkcja | Transmisja na żywo (gemini-3.5-transcribe-live) |
Przetwarzanie plików audio (gemini-3.5-transcribe) |
Uwagi i ograniczenia |
|---|---|---|---|
| Automatyczne wykrywanie języka | Obsługiwane (ponad 85 języków) | Obsługiwane (ponad 85 języków) | Obejmuje mieszanie kodu w trakcie sesji. |
| Sygnatury czasowe na poziomie słowa | Nieobsługiwane | Obsługiwane | obniża dokładność transkrypcji; |
| Ustalanie priorytetów dla słownictwa niestandardowego | Obsługiwane (maksymalnie 1000 terminów) | Obsługiwane (maksymalnie 1000 terminów) | Klienci zwykle uzyskują najlepsze wyniki w przypadku maksymalnie 100 słów. |
| Inteligentne dyktowanie i formatowanie | Obsługiwane | Obsługiwane | Obejmuje usuwanie wypełniaczy i formatowanie alfanumeryczne uwzględniające intencje. |
| Dzielenie na mówców | Nieobsługiwane | Obsługiwane (maksymalnie 8 głośników) | Atrybucja w przypadku co najmniej 3 głośników jest eksperymentalna. |
| Maksymalny czas trwania dźwięku | 10 minut na sesję. | Do 1 godziny | Przetwarzanie plików jest ograniczone do 30 minut, gdy włączone są funkcje takie jak podział na mówców czy sygnatury czasowe. |
Obsługiwane języki
Gemini 3.5 Transcribe obsługuje te języki i kody języków w standardzie BCP-47:
| Język | Kod BCP-47 | Język | Kod BCP-47 |
|---|---|---|---|
| afrikaans | af-ZA |
japoński | ja-JP |
| amharski | am-ET |
jawajski | jv-ID |
| arabski (Egipt) | ar-EG |
kabuverdianu | kea-CV |
| ormiański | hy-AM |
kannada | kn-IN |
| asamski | as-IN |
kazachski | kk-KZ |
| azerski | az-AZ |
koreański | ko-KR |
| białoruski | be-BY |
kirgiski | ky-KG |
| bengalski (Bangladesz) | bn-BD |
łotewski | lv-LV |
| bengalski (Indie) | bn-IN |
lingala | ln-CD |
| bośniacki | bs-BA |
litewski | lt-LT |
| bułgarski | bg-BG |
macedoński | mk-MK |
| bułgarski (arumuński), | rup-BG |
malajski | ms-MY |
| birmański | my-MM |
malajalam | ml-IN |
| kantoński (tradycyjny), | yue-Hant-HK |
maltański | mt-MT |
| kataloński | ca-ES |
chiński mandaryński (uproszczony), | cmn-Hans-CN |
| cebuański | ceb |
marathi | mr-IN |
| khmerski | km-KH |
mongolski | mn-MN |
| chorwacki | hr-HR |
nepalski | ne-NP |
| czeski | cs-CZ |
norweski | nb-NO |
| duński | da-DK |
orija | or-IN |
| niderlandzki | nl-NL |
polski | pl-PL |
| angielski (Wielka Brytania) | en-GB |
portugalski (Brazylia) | pt-BR |
| angielski (Indie) | en-IN |
portugalski (Portugalia) | pt-PT |
| angielski (USA) | en-US |
pendżabski | pa-IN |
| estoński | et-EE |
pendżabski (pismo gurmukhi), | pa-Guru-IN |
| perski | fa-IR |
rumuński | ro-RO |
| filipiński | fil-PH |
rosyjski | ru-RU |
| fiński | fi-FI |
serbski | sr-RS |
| francuski | fr-FR |
sindhi (alfabet arabski) | sd-Arab-IN |
| galicyjski | gl-ES |
słowacki | sk-SK |
| gruziński | ka-GE |
słoweński | sl-SI |
| niemiecki | de-DE |
hiszpański (Ameryka Łacińska) | es-419 |
| grecki | el-GR |
hiszpański (Stany Zjednoczone) | es-US |
| gudżarati | gu-IN |
suahili (Kenia) | sw-KE |
| hausa | ha-NG |
szwedzki | sv-SE |
| hebrajski | he-IL |
tadżycki | tg-TJ |
| hindi | hi-IN |
telugu | te-IN |
| węgierski | hu-HU |
tajski | th-TH |
| islandzki | is-IS |
turecki | tr-TR |
| indyjski angielski | en-IN |
ukraiński | uk-UA |
| indonezyjski | id-ID |
uzbecki | uz-UZ |
| włoski | it-IT |
wietnamski | vi-VN |