Представлены модели Gemini 3.8 TTS, которые могут клонировать голос

Google представила две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Они позволяют клонировать собственные голоса, управлять исполнением каждой реплики и генерировать выразительную озвучку для игр, подкастов, аудиокниг, дубляжа и голосовых ИИ-агентов. Gemini 3.8 Flash TTS ориентирована на более сложную творческую работу. Модель умеет создавать голос с нуля по текстовому описанию, задавая роль, акцент и характеристики голоса на более чем 100 языках и диалектах. Также доступно более 2000 готовых голосов, включая варианты с региональными особенностями, например мексиканским испанским, квебекским французским и шотландским английским.

Отдельно добавлено копирование голоса по 30-секундному аудиофрагменту, перед созданием которого система проверяет согласие владельца голоса, а сгенерированная речь получает водяной знак SynthID и учетные данные C2PA. Пользователь также может сохранять созданные голоса и использовать их в разных проектах, сохраняя единое звучание. Обе модели позволяют управлять исполнением построчно: задавать темп, интонацию, акцент, паузы и другие особенности подачи. Более легкая Gemini 3.8 Flash-Lite TTS подходит для дубляжа и создания аудиоконтента.

Gemini 3.8 Flash TTS заняла первое место в Voice Design Benchmark от компании Hume AI с результатом 71,4 балла, а обе новые модели заняли первое и второе места соответственно в тестах Overall Quality Index. Модели также показали высокие результаты в оценках пользователей на Voice Arena для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди. Модели уже доступны разработчикам в Google AI Studio, а также через Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids.

adwords145@gmail.com
наверх