Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)는 높은 처리량의 프로덕션 워크로드에서 gemini-3.1-flash-tts-preview를 대체하기 위해 설계된 Google의 빠르고 비용 효율적인 워크호스 텍스트 음성 변환 모델입니다.

개요 및 기능

Gemini 3.8 Flash-Lite TTS는 짧은 지연 시간과 표현력이 풍부하고 자연스러운 음성을 결합합니다.

  • 높은 처리량 효율성: 대량 생산, 대화형 음성 에이전트 캐스케이드, 텍스트 음성 변환 기능, 주요 언어의 일상적인 단일 스피커 음성 생성에 최적화되어 있습니다.
  • 드롭인 스키마 호환성: gemini-3.8-flash-tts와 정확히 동일한 API 스키마와 구조화된 프롬프트 형식을 공유하므로 단일 파라미터 변경으로 모델을 전환할 수 있습니다.
  • 전체 음성 생태계 지원: 사전 빌드된 음성, 확장 음성 라이브러리 (GET /v1beta/voices), 맞춤 음성 디자인 페르소나, 음성 복제 (기본적으로 영구 저장된 음성, 선택적 상태 비저장 키)를 지원합니다. Google AI Studio에서 대화형으로 음성을 디자인하고 복제할 수도 있습니다.

기능, 프롬프트 권장사항, 코드 예시를 자세히 알아보려면 텍스트 음성 변환 가이드를 참고하세요.

TTS 모델 사용 시기

두 Gemini 3.8 TTS 모델은 동일한 API 스키마와 프롬프트 구조를 공유합니다. 워크로드에 맞는 모델을 선택합니다.

기능 / 워크로드 Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
주요 강점 높은 처리량, 짧은 지연 시간, 비용 효율성 최대 음성 충실도, 연기 뉘앙스, 방언 지원
최적의 사용 사례 대량 생산, 실시간 음성 에이전트 캐스케이드, 읽어주기 기능, 음성 복제, 일상적인 단일 화자 생성 오디오북, 스튜디오 내레이션, 복잡한 다중 화자 대화, 과도한 보컬 버스트 연기, 어려운 발음, 지역 방언
지원되는 언어 101개 언어 130개 언어
다음의 대체 제품으로 추천 gemini-3.1-flash-tts-preview 새로운 플래그십 광고 소재 등급

이전 가이드

gemini-3.1-flash-tts-preview에서 gemini-3.8-flash-lite-tts로 업그레이드하는 경우 Gemini 3.8 TTS 스키마에 대한 요청을 업데이트하세요.

  1. 턴 수준 안내를 speech_metadata로 이동: Gemini 3.8 TTS는 입력 텍스트를 그대로의 스크립트로 엄격하게 취급합니다. "Say cheerfully: Hello!" 또는 "Speaker 1: Hello!"과 같은 인라인 텍스트 방향은 소리 내어 읽을 수 있습니다. 지속적인 전송 지침 (style)과 화자 라벨(speaker)을 구조화된 메타데이터로 이동합니다.
    • Interactions API: 각 텍스트 콘텐츠 블록에 "type": "speech_metadata", "speaker", "style"가 포함된 주석을 첨부합니다.
    • GenerateContent API:part"speech_metadata": {"speaker": "...", "style": "..."}를 첨부합니다.
  2. 특정 시점의 음성 이벤트에만 꺾쇠괄호 인라인 태그 사용: 순간적인 비음성 발성 및 일시중지를 꺾쇠괄호 (예: <laugh>, <sigh>, <cough>, <breath>, <short pause>)를 사용하여 스크립트에 인라인으로 유지합니다. 속삭임과 같은 전달 스타일은 speech_metadata.style에 넣습니다.
  3. 다중 화자 요청의 모든 턴에 speaker 지정: 다중 화자 요청의 모든 턴에는 구성된 화자 중 하나와 일치하는 speech_metadata 내에 speaker가 명시적으로 포함되어야 합니다.
  4. 음성 디자인으로 미리 페르소나 디자인: 긴 기존 오디오 프로필 / 감독의 메모 블록을 음성 디자인에서 만든 맞춤 음성으로 바꾼 다음 style 문자열을 최소화하거나 비워 TTS 요청을 통해 해당 voice_... ID를 전달합니다.
  5. 단항 요청에서 기본 WAV (audio/wav) 출력 고려: gemini-3.1-flash-tts-preview 이하 TTS 모델 (기본적으로 헤더가 없는 원시 PCM audio/l16 반환)과 달리 Gemini 3.8 TTS는 단항 요청에 대해 기본적으로 표준 RIFF 헤더가 있는 WAV 오디오(audio/wav / AUDIO_WAV)를 반환합니다.
    • 이전에 코드가 원시 PCM 바이트를 WAV 헤더로 래핑한 경우 (예: Python의 wave 모듈 또는 ffmpeg 사용) 수동 헤더 래퍼를 삭제하고 반환된 바이트를 .wav 파일에 직접 씁니다.
    • 파이프라인에 헤더 없는 원시 PCM, mu-law 또는 A-law 오디오가 필요한 경우 response_format"audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") 또는 "audio/alaw" ("AUDIO_ALAW")로 명시적으로 설정합니다. 오디오 출력 형식을 참고하세요.

gemini-3.8-flash-lite-tts

속성 설명
모델 코드 gemini-3.8-flash-lite-tts
지원되는 데이터 유형

입력

텍스트

출력

오디오

토큰 한도[*]

입력 토큰 한도

8,192

출력 토큰 한도

16,384

기능

오디오 생성

지원됨

캐싱

지원됨

코드 실행

지원되지 않음

파일 검색

지원되지 않음

함수 호출

지원되지 않음

Google 지도 기반 그라운딩

지원되지 않음

이미지 생성

지원되지 않음

Live API

지원되지 않음

검색 그라운딩

지원되지 않음

구조화된 출력

지원되지 않음

사고

지원되지 않음

URL 컨텍스트

지원되지 않음

소비 옵션

Batch API

지원됨

Flex 추론

지원됨

우선순위 추론

지원됨

버전
자세한 내용은 모델 버전 패턴을 참고하세요.
  • gemini-3.8-flash-lite-tts
최신 업데이트 2026년 7월

지원 언어

gemini-3.8-flash-lite-tts는 입력 언어를 자동으로 감지하고 101개 언어를 지원합니다.

언어 언어 언어
아체어 (아랍어 스크립트) 조지아어 몰타어
아프리칸스어 독일어 마니푸르어
아칸어 그리스어 마라타어
암하라어 구자라트어 미낭카바우어 (아랍어 스크립트)
아르메니아어 아이티 크리올어 미조어
아삼어 할흐 몽골어 네팔어 (개별 언어)
아와디어 하우사어 나이지리아 풀풀데어
발리어 히브리어 북아제르바이잔어
벵골어 힌디어 소토어(북부)
반자르어 (라틴 문자) 헝가리어 북부 우즈베크어
바스크어 아이슬란드어 노르웨이어(보크말)
벨라루스어 일로카노어 노르웨이어(뉘노르스크)
보지푸리어 인도네시아어 니안자어
보스니아어 이란 페르시아어 오리야어 (개별 언어)
부기어 이탈리아어 페르시아어(아프가니스탄)
불가리아어 일본어 폴란드어
광둥어 자바어 포르투갈어
카탈로니아어 캄바어 펀자브어
세부아노어 칸나다어 루마니아어
소라니어 카슈미르어 (아랍어 스크립트) 러시아어
차티스가르어 카슈미르어 (데바 문자) 산탈어
중국어 (한스 스크립트) 카자흐어 세르비아어
중국어 (Hant 스크립트) 크메르어 싱할라어
크로아티아어 키쿠유어 슬로바키아어
체코어 키냐르완다어 남아제르바이잔어
덴마크어 콩고어 남부 파슈토어
네덜란드어 한국어 스페인어
이집트 아랍어 키르기스어 표준 아랍어 (아랍어 스크립트)
영어 라오어 표준 아랍어 (라틴 문자)
에스토니아어 링갈라어 표준 라트비아어
필리핀어 마케도니아어 표준 말레이어
프랑스어 마가히어 타밀어
갈리시아어 마이틸리어 텔루구어
간다어 말라얄람어