구글, Gemini 3.8 Flash TTS·Flash-Lite TTS 공개

구글, Gemini 3.8 Flash TTS·Flash-Lite TTS 공개

기사 이해를 돕기 위한 이미지

구글은 2026년 9월 23일 현지시각 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했다. 회사는 음성 맞춤화와 억양 구현을 핵심 특징으로 내세웠으며, 두 모델을 Gemini API와 Google AI Studio에서 제공하기 시작했다.

API·AI Studio와 구글 서비스로 제공

공개된 모델 ID는 각각 gemini-3.8-flash-tts와 gemini-3.8-flash-lite-tts다. Gemini Enterprise의 API 제공은 추후 시작될 예정이다. Gemini 3.8 Flash TTS는 모든 이용자가 Gemini Notebook에서, Flash-Lite TTS는 모든 이용자가 Google Vids에서 사용할 수 있다.

The Next Web는 두 모델이 100개 이상의 언어와 방언, 2,000개 이상의 사전 제작 음성을 지원한다고 보도했다. 또 Gemini 3.8 Flash TTS는 동의 확인 절차를 거쳐 30초 분량의 샘플로 음성을 복제할 수 있다고 전했다. Google AI Studio를 통한 음성 복제는 일리노이, 텍사스, 유럽경제지역, 영국, 스위스, 인도에서는 제공되지 않는다.

Gemini Audio 모델이 생성한 모든 오디오에는 AI 생성 음성을 식별할 수 있도록 SynthID 워터마크가 적용된다. 복제된 음성에는 C2PA 콘텐츠 자격 증명도 포함된다. 다만 RuntimeWire는 출시 시점에 음성 동의 확인 절차와 지연 시간·사용량 수치가 구체적으로 공개되지 않았고, 독립적인 검증도 없다고 보도했다.

회사 발표와 독립 평가의 차이

구글은 “Gemini 3.8 Flash TTS는 선도적인 음성 맞춤화 기능을 제공하며 Hume AI의 Voice Design Benchmark에서 종합 71.4로 1위, 억양 모델링에서도 60.8로 1위를 기록했다”고 밝혔다. 회사 발표에 따르면 Hume AI의 Overall Quality Index에서는 Flash TTS와 Flash-Lite TTS가 각각 1위와 2위를 차지했다. Voice Arena의 블라인드 선호도 평가에서는 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 부문에서 두 모델이 경쟁 모델 가운데 상위권을 기록했다.

RuntimeWire는 “구글의 Hume 벤치마크 주장은 구글이 발표한 것이며, 그 자체만으로 제품 간 비교를 확정하지는 않는다”고 지적했다. 이 매체는 전 Hume AI 최고경영자이자 현재 Google DeepMind 연구과학 디렉터인 Alan Cowen과 Leland Rechis가 이번 출시 작업에 참여했다고 전했다.

독립 평가인 Artificial Analysis Provider Voice 리더보드에서는 다른 순위가 집계됐다. Gemini 3.8 Flash TTS는 Elo 1260, 95% 신뢰구간 -17/17로 2위였고 Flash-Lite TTS는 Elo 1235, 95% 신뢰구간 -16/16으로 6위였다. Cartesia Sonic 3.6이 1,757개 표본과 Elo 1273으로 1위에 올라 Flash TTS보다 앞섰다. Alibaba Qwen-Audio-3.0-TTS-Plus는 Elo 1259로 3위, Inworld Realtime TTS-2는 Elo 1245로 4위였으며 ElevenLabs v3 Conversational은 Elo 1196, 95% 신뢰구간 -15/15로 12위였다.

발음 평가와 경쟁 모델 간 격차

Artificial Analysis Pronunciation Robustness Benchmark에서 Gemini 3.8 Flash TTS는 89.5%로 1위를 기록했다. 같은 벤치마크에서 이전 모델인 Gemini 3.1 Flash TTS의 점수는 88.2%였다.

OrcaRouter는 Artificial Analysis Provider Voice Arena에서 Gemini 3.8 Flash TTS가 1,999개 표본과 Elo 1,260, Qwen-Audio-3.0-TTS-Plus가 1,447개 표본과 Elo 1,259를 기록해 “Elo 점수 차이는 1점”이라고 설명했다. 또 넓은 신뢰구간을 고려하면 상위 3개 모델이 “하나의 범위”에 있다고 평가했다.

2026년까지 무료, 이후 요금 차등

표준 등급은 두 모델 모두 2026년 12월 31일까지 무료다. 2027년 1월 1일부터 100만 토큰당 Gemini 3.8 Flash TTS는 입력 1.00달러, 오디오 출력 18.00달러, 컨텍스트 캐싱 0.25달러가 적용된다. Flash-Lite TTS는 입력 1.00달러와 오디오 출력 12.00달러다.

Batch & Flex 요금은 100만 토큰당 Flash TTS가 입력 0.25~0.50달러, 출력 4.50~9.00달러이며 Flash-Lite TTS는 입력 0.25~0.50달러, 출력 3.00~6.00달러다. Priority 등급은 2026년까지 무료이고 이후 Flash TTS에 입력 1.80달러·출력 32.40달러, Flash-Lite TTS에 입력 1.80달러·출력 21.60달러가 부과된다.

참고 자료 바로가기

관련 기사 바로가기