Gemini 3.5 Transcribe es un modelo de voz a texto basado en las capacidades de comprensión de audio de Gemini. Proporciona transcripciones precisas y de baja latencia con detección de idioma basada en segmentos, identificación de interlocutores, marcas de tiempo a nivel de palabra, transcripción inteligente y ponderación del habla con vocabulario personalizado.
Documentación
Gemini 3.5 Transcribe convierte la voz en texto a partir de archivos de audio. Detecta automáticamente más de 85 idiomas, controla el cambio de idioma, identifica a los interlocutores individuales, genera marcas de tiempo a nivel de palabras y se adapta a los términos específicos del dominio a través de la adaptación del vocabulario personalizado.
Visita la guía de transcripción de audio para obtener una cobertura completa de las funciones que no son de transmisión. Para obtener información sobre la transcripción de transmisión en tiempo real y con baja latencia a través de WebSockets, consulta la guía de transcripción instantánea con gemini-3.5-transcribe-live. Para obtener información detallada sobre los precios, consulta la página Precios.
gemini-3.5-transcribe
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-3.5-transcribe |
| Tipos de datos admitidos |
Entradas Audio (hasta 1 hora) Resultado Anotaciones de texto y palabras |
| Límites de audio de |
Límite de audio unario Hasta 1 hora por solicitud (hasta 30 minutos cuando se habilitan la diarización del interlocutor o las marcas de tiempo a nivel de la palabra) |
| Funciones | Admitido Identificación de interlocutores Admitido Marcas de tiempo a nivel de la palabra Admitido Admitido Admitido No compatible No compatible No compatible No compatible No compatible No compatible |
| Opciones de consumo |
No compatible No compatible No compatible |
| Versiones de |
|
| Última actualización | Agosto de 2026 |
Compatibilidad y limitaciones de las funciones
La función Transcribe de Gemini 3.5 admite las siguientes funciones en sus dos extremos:
| Función | Transmisión en vivo (gemini-3.5-transcribe-live) |
Procesamiento de archivos de audio (gemini-3.5-transcribe) |
Notas o limitaciones |
|---|---|---|---|
| Detección automática de idioma | Compatible (más de 85 idiomas) | Compatible (más de 85 idiomas) | Incluye la combinación de código durante la sesión. |
| Marcas de tiempo a nivel de la palabra | No compatible | Compatible | Disminuye la precisión de la transcripción. |
| Ajuste del vocabulario personalizado | Admitido (hasta 1,000 términos) | Admitido (hasta 1,000 términos) | Por lo general, los clientes obtienen los mejores resultados con hasta 100 términos. |
| Dictado y formato inteligentes | Compatible | Compatible | Incluye la eliminación de muletillas y el formato alfanumérico que tiene en cuenta la intención. |
| Identificación de interlocutores | No compatible | Admitido (hasta 8 bocinas) | La atribución para más de 3 bocinas es experimental. |
| Duración máxima del audio | 10 minutos por sesión | Hasta 1 hora | El procesamiento de archivos se limita a 30 minutos cuando se habilitan funciones como la diarización o las marcas de tiempo. |
Idiomas admitidos
Los siguientes idiomas y códigos de idioma BCP-47 son compatibles con Gemini 3.5 Transcribe:
| Idioma | Código BCP-47 | Idioma | Código BCP-47 |
|---|---|---|---|
| Afrikaans | af-ZA |
Japonés | ja-JP |
| Amárico | am-ET |
Javanés | jv-ID |
| Árabe (Egipto) | ar-EG |
Kabuverdianu | kea-CV |
| Armenio | hy-AM |
Canarés | kn-IN |
| Asamés | as-IN |
Kazajo | kk-KZ |
| Azerí | az-AZ |
Coreano | ko-KR |
| Bielorruso | be-BY |
Kirguís | ky-KG |
| Bengalí (Bangladés) | bn-BD |
Letón | lv-LV |
| Bengalí (India) | bn-IN |
Lingala | ln-CD |
| Bosnio | bs-BA |
Lituano | lt-LT |
| Búlgaro | bg-BG |
Macedonio | mk-MK |
| Búlgaro (arrumano) | rup-BG |
Malayo | ms-MY |
| Birmano | my-MM |
Malayalam | ml-IN |
| Cantonés (tradicional) | yue-Hant-HK |
Maltés | mt-MT |
| Catalán | ca-ES |
Chino mandarín (simplificado) | cmn-Hans-CN |
| Cebuano | ceb |
Maratí | mr-IN |
| Camboyano | km-KH |
Mongol | mn-MN |
| Croata | hr-HR |
Nepalí | ne-NP |
| Checo | cs-CZ |
Noruego | nb-NO |
| Danés | da-DK |
Oriya | or-IN |
| Holandés | nl-NL |
Polaco | pl-PL |
| Inglés (Gran Bretaña) | en-GB |
Portugués (Brasil) | pt-BR |
| Inglés (India) | en-IN |
Portugués (Portugal) | pt-PT |
| Inglés (Estados Unidos) | en-US |
Punyabí | pa-IN |
| Estonio | et-EE |
Panyabí (alfabeto gurmukhi) | pa-Guru-IN |
| Persa | fa-IR |
Rumano | ro-RO |
| Filipino | fil-PH |
Ruso | ru-RU |
| Finlandés | fi-FI |
Serbio | sr-RS |
| Francés | fr-FR |
Sindhi (alfabeto árabe) | sd-Arab-IN |
| Gallego | gl-ES |
Eslovaco | sk-SK |
| Georgiano | ka-GE |
Esloveno | sl-SI |
| Alemán | de-DE |
Español (Latinoamérica) | es-419 |
| Griego | el-GR |
Español (Estados Unidos) | es-US |
| Gujarati | gu-IN |
Suajili (Kenia) | sw-KE |
| Hausa | ha-NG |
Sueco | sv-SE |
| Hebreo | he-IL |
Tayiko | tg-TJ |
| Hindi | hi-IN |
Telugu | te-IN |
| Húngaro | hu-HU |
Tailandés | th-TH |
| Islandés | is-IS |
Turco | tr-TR |
| tu idioma o tu país | en-IN |
Ucraniano | uk-UA |
| Indonesio | id-ID |
Uzbeko | uz-UZ |
| Italiano | it-IT |
Vietnamita | vi-VN |