Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)는 스튜디오급 음성 충실도, 표현력 있는 연기, 실제 지역 억양, 안정적인 긴 형식의 멀티턴을 위해 설계된 Google의 대표적인 창작 텍스트 음성 변환 모델입니다.

개요 및 기능

Gemini 3.8 Flash TTS는 표현력이 풍부한 오디오 생성의 새로운 기준을 제시합니다.

  • 높은 음향 충실도 및 연기 뉘앙스: 풍부한 감정 범위, 자연스러운 운율, 턴 수준 style 지침 및 인라인 보컬 이벤트 (<laugh>, <sigh>, <short pause>)의 정확한 준수를 제공합니다.
  • 긴 형식의 다중 턴 안정성: 음성 변동 없이 긴 대화와 수 분 길이의 내레이션에서 일관된 음성 ID, 음색, 볼륨, 음향 공간 톤을 유지합니다.
  • 실제 지역 사투리 및 발음: 지역 사투리, 소수 언어 방언, 인라인 국제 음성 기호 (IPA) 재정의를 지원합니다.
  • 전체 음성 생태계 지원: 사전 빌드된 음성, 확장 음성 라이브러리 (GET /v1beta/voices), 맞춤 음성 디자인 페르소나, 음성 복제 (기본적으로 영구 저장된 음성, 선택적 상태 비저장 키)와 원활하게 작동합니다. Google AI Studio에서 대화형으로 음성을 디자인하고 복제할 수도 있습니다.

기능, 프롬프트 권장사항, 코드 예시를 자세히 알아보려면 텍스트 음성 변환 가이드를 참고하세요.

TTS 모델 사용 시기

두 Gemini 3.8 TTS 모델은 동일한 API 스키마와 프롬프트 구조를 공유합니다. 워크로드에 맞는 모델을 선택합니다.

기능 / 워크로드 Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
주요 강점 최대 음성 충실도, 연기 뉘앙스, 방언 지원 높은 처리량, 짧은 지연 시간, 비용 효율성
최적의 사용 사례 오디오북, 스튜디오 내레이션, 복잡한 다중 화자 대화, 과도한 보컬 버스트 연기, 어려운 발음, 지역 방언 대량 생산, 실시간 음성 에이전트 캐스케이드, 읽어주기 기능, 음성 복제, 일상적인 단일 화자 생성
지원되는 언어 130개 언어 101개 언어
다음의 대체 제품으로 추천 새로운 플래그십 광고 소재 등급 gemini-3.1-flash-tts-preview

이전 가이드

gemini-3.1-flash-tts-preview 또는 이전 Gemini TTS 모델에서 이전하는 경우 Gemini 3.8 TTS 스키마에 대한 요청을 업데이트하세요.

  1. 턴 수준 안내를 speech_metadata로 이동: Gemini 3.8 TTS는 입력 텍스트를 그대로의 스크립트로 엄격하게 취급합니다. "Say cheerfully: Hello!" 또는 "Speaker 1: Hello!"과 같은 인라인 텍스트 방향은 소리 내어 읽을 수 있습니다. 지속적인 전송 지침 (style)과 화자 라벨(speaker)을 구조화된 메타데이터로 이동합니다.
    • Interactions API: 각 텍스트 콘텐츠 블록에 "type": "speech_metadata", "speaker", "style"가 포함된 주석을 첨부합니다.
    • GenerateContent API:part"speech_metadata": {"speaker": "...", "style": "..."}를 첨부합니다.
  2. 특정 시점의 음성 이벤트에만 꺾쇠괄호 인라인 태그 사용: 꺾쇠괄호 (예: <laugh>, <sigh>, <cough>, <breath>, <short pause>)를 사용하여 스크립트에 순간적인 비음성 발화와 일시중지를 인라인으로 유지합니다. 속삭임과 같은 전달 스타일은 speech_metadata.style에 넣습니다.
  3. 다중 화자 요청의 모든 턴에 speaker 지정: 다중 화자 요청의 모든 턴에는 구성된 화자 중 하나와 일치하는 speech_metadata 내에 speaker가 명시적으로 포함되어야 합니다.
  4. 음성 디자인으로 미리 페르소나 디자인: 긴 기존 오디오 프로필 / 감독의 메모 블록을 음성 디자인에서 만든 맞춤 음성으로 바꾼 다음 최소한의 문자열 또는 빈 style 문자열을 사용하여 TTS 요청을 통해 해당 voice_... ID를 전달합니다.
  5. 단항 요청에서 기본 WAV (audio/wav) 출력 고려: gemini-3.1-flash-tts-preview 이하 TTS 모델 (기본적으로 헤더가 없는 원시 PCM audio/l16 반환)과 달리 Gemini 3.8 TTS는 단항 요청에 대해 기본적으로 표준 RIFF 헤더가 있는 WAV 오디오(audio/wav / AUDIO_WAV)를 반환합니다.
    • 이전에 코드가 원시 PCM 바이트를 WAV 헤더로 래핑한 경우 (예: Python의 wave 모듈 또는 ffmpeg 사용) 수동 헤더 래퍼를 삭제하고 반환된 바이트를 .wav 파일에 직접 씁니다.
    • 파이프라인에 헤더 없는 원시 PCM, mu-law 또는 A-law 오디오가 필요한 경우 response_format"audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") 또는 "audio/alaw" ("AUDIO_ALAW")로 명시적으로 설정합니다. 오디오 출력 형식을 참고하세요.

gemini-3.8-flash-tts

속성 설명
모델 코드 gemini-3.8-flash-tts
지원되는 데이터 유형

입력

텍스트

출력

오디오

토큰 한도[*]

입력 토큰 한도

8,192

출력 토큰 한도

16,384

기능

오디오 생성

지원됨

캐싱

지원됨

코드 실행

지원되지 않음

파일 검색

지원되지 않음

함수 호출

지원되지 않음

Google 지도 기반 그라운딩

지원되지 않음

이미지 생성

지원되지 않음

Live API

지원되지 않음

검색 그라운딩

지원되지 않음

구조화된 출력

지원되지 않음

사고

지원되지 않음

URL 컨텍스트

지원되지 않음

소비 옵션

Batch API

지원됨

Flex 추론

지원됨

우선순위 추론

지원됨

버전
자세한 내용은 모델 버전 패턴을 참고하세요.
  • gemini-3.8-flash-tts
최신 업데이트 2026년 7월

지원 언어

gemini-3.8-flash-tts는 입력 언어를 자동으로 감지하며 130개 언어를 지원합니다.

언어 언어 언어
아체어 (아랍어 스크립트) 그리스어 네팔어 (개별 언어)
아프리칸스어 과라니어 나이지리아 풀풀데어
아칸어 구자라트어 북아제르바이잔어
암하라어 아이티 크리올어 소토어(북부)
아르메니아어 할흐 몽골어 북부 우즈베크어
아삼어 하우사어 노르웨이어(보크말)
아와디어 히브리어 노르웨이어(뉘노르스크)
발리어 힌디어 니안자어
벵골어 헝가리어 오크어
반자르어 (아랍어 스크립트) 아이슬란드어 오리야어 (개별 언어)
반자르어 (라틴 문자) 이그보어 팡가시난어
바시키르어 일로카노어 페르시아어(아프가니스탄)
바스크어 인도네시아어 폴란드어
벨라루스어 이란 페르시아어 포르투갈어
벰바어 이탈리아어 펀자브어
보지푸리어 일본어 루마니아어
보스니아어 자바어 러시아어
부기어 커바일어 산탈어
불가리아어 캄바어 세르비아어
버마어 칸나다어 신드어
광둥어 카슈미르어 (아랍어 스크립트) 싱할라어
카탈로니아어 카슈미르어 (데바 문자) 슬로바키아어
세부아노어 카자흐어 슬로베니아어
소라니어 크메르어 소말리어
차티스가르어 키쿠유어 남아제르바이잔어
중국어 (한스 스크립트) 키냐르완다어 남부 파슈토어
중국어 (Hant 스크립트) 콩고어 소토어(남부)
크림 타타르어 한국어 스페인어
크로아티아어 키르기스어 표준 아랍어 (아랍어 스크립트)
체코어 라오어 표준 아랍어 (라틴 문자)
덴마크어 라트갈레어 표준 라트비아어
네덜란드어 링갈라어 표준 말레이어
드율라어 리투아니아어 스와힐리어 (개별 언어)
종카어 룩셈부르크어 스와티어
이집트 아랍어 마케도니아어 스웨덴어
영어 마가히어 타지크어
에스토니아어 마이틸리어 타밀어
필리핀어 말라얄람어 텔루구어
핀란드어 몰타어 태국어
프랑스어 마니푸르어 티그리냐어
갈리시아어 마라타어 토스크 알바니아어
간다어 미낭카바우어 (아랍어 스크립트) 위구르어
조지아어 미낭카바우어 (라틴 문자)
독일어 미조어