구글은 23일(현지시간) '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS'를 출시했다고 밝혔다. TTS는 텍스트를 음성으로 바꾸는 기술이다. 이번 모델은 자연어 프롬프트만으로 새로운 목소리를 만들고, 대사의 속도와 감정, 억양 같은 표현을 조절할 수 있도록 설계됐다.
'제미나이 3.8 플래시 TTS'는 새로운 캐릭터 음성을 처음부터 만드는 데 초점을 둔다. 게임, 오디오북, 팟캐스트, 인터랙티브 미디어에 활용할 수 있고, 대사마다 연기 방식과 속도, 억양 변화를 세밀하게 조정할 수 있다. 반면 '제미나이 3.8 플래시-라이트 TTS'는 대규모 음성 생성 작업의 비용 효율성을 높이는 데 초점을 맞췄다. 대량 더빙과 오디오 콘텐츠 제작, 음성 에이전트에 사용할 수 있으며 톤과 속도, 표현 방식도 조절할 수 있다.
두 모델은 100개 이상의 언어를 지원한다. 장시간 음성을 만들 때도 목소리 특성과 자연스러운 속도를 유지하고, 하나의 대본 안에서 두 화자의 대화를 구분해 생성하는 기능도 제공한다. 개발자는 '구글 AI 스튜디오'와 '제미나이 API'를 통해 이 모델을 사용할 수 있고, 기업 고객은 향후 '제미나이 엔터프라이즈' API로 이용할 수 있다. 또 제미나이 3.8 플래시 TTS는 '제미나이 노트북'에, 제미나이 3.8 플래시-라이트 TTS는 '구글 비즈(Google Vids)'에 적용될 예정이다.
