구글은 제미나이 오디오 제품군에 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS'를 추가했다. 플래시 TTS는 창작자와 개발자가 캐릭터 음성을 처음부터 설계하고 세밀하게 연출하는 데 초점을 맞췄고, 플래시-라이트 TTS는 대규모 더빙이나 음성 콘텐츠 제작처럼 높은 처리량과 비용 효율성이 필요한 작업을 겨냥한다. 두 모델은 게임, 오디오북, 팟캐스트, 더빙, 음성 에이전트 같은 분야에서 맞춤형 음성을 만들 수 있도록 설계됐다.
기술적으로 눈에 띄는 부분은 자연어 프롬프트만으로 역할, 억양, 음색이 다른 새로운 목소리를 즉석에서 만들 수 있다는 점이다. 100개 이상의 언어와 방언을 자동 감지해 지원하고, 멕시코 스페인어·퀘벡 프랑스어·스코틀랜드 영어 같은 지역 억양도 구현한다. 또 2000개 이상의 상용급 기본 음성 라이브러리를 함께 제공해 바로 적용할 수 있도록 했다.
연출 기능도 세밀하다. 스크립트 안에 말하는 속도와 감정 변화는 물론, 웃음이나 한숨 같은 비언어 표현과 자연스러운 맞장구를 넣을 수 있다. 단일 스크립트로 두 명의 화자가 주고받는 대화 장면을 턴테이킹과 함께 구현할 수 있고, 긴 오디오를 생성할 때도 음질과 화자 특성을 안정적으로 유지하도록 했다. 앞으로는 기존 음성의 음색, 높낮이, 속도를 프롬프트로 재가공하는 '음성 리믹스'와 30초 샘플을 이용한 음성 복제 기능도 지원할 예정이다.
안전장치도 함께 적용됐다. 생성된 모든 음성에는 식별 가능한 워터마크 '신스ID(SynthID)'가 삽입되고, 복제 음성에는 C2PA 콘텐츠 인증 정보가 적용된다. 음성 복제는 본인이나 사용 권한을 보유한 음성만 가능하며, 음성 소유자의 동의 녹음을 확인해야 한다. 개발자는 구글 AI 스튜디오와 제미나이 API를 통해 두 모델을 사용할 수 있다.






