O Gemini 3.5 Transcribe é um modelo de conversão de voz em texto baseado nos recursos de compreensão de áudio do Gemini. Ele oferece transcrição precisa e de baixa latência com detecção de idioma baseada em enunciados, diarização de locutor, carimbos de data/hora no nível da palavra, transcrição inteligente e polarização de fala de vocabulário personalizado.
Documentação
O Gemini 3.5 Transcribe converte a fala em texto de arquivos de áudio. Ele detecta automaticamente mais de 85 idiomas, processa a troca de código em vários idiomas, identifica falantes individuais, gera carimbos de data/hora no nível da palavra e se adapta a termos específicos do domínio usando a inclusão de viés de vocabulário personalizado.
Acesse o guia de Transcrição de áudio para conferir a cobertura completa dos recursos que não são de streaming. Para transcrição de streaming em tempo real e de baixa latência por WebSockets, consulte o guia Transcrição instantânea usando gemini-3.5-transcribe-live. Para informações detalhadas sobre preços, consulte a página de preços.
gemini-3.5-transcribe
| Propriedade | Descrição |
|---|---|
| Código do modelo | gemini-3.5-transcribe |
| Tipos de dados aceitos |
Entradas (link em inglês) Áudio (até 1 hora) Saída Texto, anotações de palavras |
| Limites de áudio |
Limite de áudio unário Até 1 hora por solicitação (até 30 minutos quando a diarização de locutor ou os carimbos de data/hora no nível da palavra estão ativados) |
| Recursos | Compatível Compatível Carimbos de data/hora no nível da palavra Compatível Compatível Compatível incompatível incompatível incompatível incompatível incompatível incompatível |
| Opções de consumo |
incompatível incompatível incompatível |
| Versões |
|
| Última atualização | Agosto de 2026 |
Suporte e limitações dos recursos
O Gemini 3.5 Transcribe é compatível com os seguintes recursos nos dois endpoints:
| Recurso | Transmissão ao vivo (gemini-3.5-transcribe-live) |
Processamento de arquivos de áudio (gemini-3.5-transcribe) |
Observações / limitações |
|---|---|---|---|
| Detecção automática de idioma | Disponível em mais de 85 idiomas | Disponível em mais de 85 idiomas | Inclui a mistura de códigos no meio da sessão. |
| Carimbos de data/hora no nível da palavra | Incompatível | Compatível | Diminui a precisão da transcrição. |
| Tendência de vocabulário personalizado | Compatível (até 1.000 termos) | Compatível (até 1.000 termos) | Os clientes geralmente têm os melhores resultados com até 100 termos. |
| Formatação e ditado inteligente | Compatível | Compatível | Inclui remoção de palavras desnecessárias e formatação alfanumérica com reconhecimento de intenção. |
| Diarização de locutor | Incompatível | Compatível (até 8 alto-falantes) | A atribuição para três ou mais alto-falantes é experimental. |
| Duração máxima do áudio | 10 minutos por sessão. | Até 1 hora | O processamento de arquivos é limitado a 30 minutos quando recursos como diarização ou carimbos de data/hora estão ativados. |
Idiomas compatíveis
Os seguintes idiomas e códigos de idioma BCP-47 são compatíveis com o Gemini 3.5 Transcribe:
| Idioma | Código BCP-47 | Idioma | Código BCP-47 |
|---|---|---|---|
| Africâner | af-ZA |
Japonês | ja-JP |
| Amárico | am-ET |
Javanês | jv-ID |
| Árabe (Egito) | ar-EG |
Kabuverdianu | kea-CV |
| Armênio | hy-AM |
Canarês | kn-IN |
| Assamês | as-IN |
Cazaque | kk-KZ |
| Azerbaijano | az-AZ |
Coreano | ko-KR |
| Bielorrusso | be-BY |
Quirguiz | ky-KG |
| Bengali (Bangladesh) | bn-BD |
Letão | lv-LV |
| Bengali (Índia) | bn-IN |
Lingala | ln-CD |
| Bósnio | bs-BA |
Lituano | lt-LT |
| Búlgaro | bg-BG |
Macedônio | mk-MK |
| Búlgaro (aromaniano) | rup-BG |
Malaio | ms-MY |
| Birmanês | my-MM |
Malaiala | ml-IN |
| Cantonês (tradicional) | yue-Hant-HK |
Maltês | mt-MT |
| Catalão | ca-ES |
Chinês mandarim (simplificado) | cmn-Hans-CN |
| Cebuano | ceb |
Marati | mr-IN |
| Khmer central | km-KH |
Mongol | mn-MN |
| Croata | hr-HR |
Nepalês | ne-NP |
| Tcheco | cs-CZ |
Norueguês | nb-NO |
| Dinamarquês | da-DK |
Oriá | or-IN |
| Holandês | nl-NL |
Polonês | pl-PL |
| Inglês (Grã-Bretanha) | en-GB |
Português (Brasil) | pt-BR |
| Inglês (Índia) | en-IN |
Português (Portugal) | pt-PT |
| Inglês (EUA) | en-US |
Punjabi | pa-IN |
| Estoniano | et-EE |
Punjabi (script gurmukhi) | pa-Guru-IN |
| Farsi | fa-IR |
Romeno | ro-RO |
| Filipino | fil-PH |
Russo | ru-RU |
| Finlandês | fi-FI |
Sérvio | sr-RS |
| Francês | fr-FR |
Sindi (escrita árabe) | sd-Arab-IN |
| Galego | gl-ES |
Eslovaco | sk-SK |
| Georgiano | ka-GE |
Esloveno | sl-SI |
| Alemão | de-DE |
Espanhol (América Latina) | es-419 |
| Grego | el-GR |
Espanhol (Estados Unidos) | es-US |
| Gujarati | gu-IN |
Suaíli (Quênia) | sw-KE |
| Hauçá | ha-NG |
Sueco | sv-SE |
| Hebraico | he-IL |
Tadjique | tg-TJ |
| Hindi | hi-IN |
Télugo | te-IN |
| Húngaro | hu-HU |
Tailandês | th-TH |
| Islandês | is-IS |
Turco | tr-TR |
| Inglês indiano | en-IN |
Ucraniano | uk-UA |
| Indonésio | id-ID |
Usbeque | uz-UZ |
| Italiano | it-IT |
Vietnamita | vi-VN |