Google научила Gemini копировать голос по 30-секундной записи
Google выпустила две модели Gemini TTS, одна из которых копирует голос по 30 секундам аудио после проверки согласия владельца.
Google выпустила две новые модели для генерации речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Они уже появляются в Gemini API и Google AI Studio.
Главная функция Flash TTS — создание копии голоса по 30-секундному аудиофрагменту. Для этого владелец голоса должен отдельно записать устное согласие. Система проверяет, совпадает ли человек на этой записи с голосом из исходного образца.
Сгенерированные аудиофайлы получают цифровую метку SynthID. Копии реальных голосов также снабжаются данными C2PA, которые помогают определить происхождение контента.
Flash TTS рассчитана на игры, аудиокниги и подкасты. Пользователь может описать нужный голос обычными словами — например, указать роль, акцент и характер речи. Модель работает более чем со 100 языками и диалектами. Доступна и библиотека из двух тысяч готовых голосов.
Подачу можно менять для каждой реплики. Сценарий поддерживает диалоги двух персонажей, смех, вздохи и короткие междометия. Модели также умеют создавать записи продолжительностью в несколько часов. В будущем Google обещает добавить настройку тембра, высоты, темпа и акцента уже готового голоса.
Flash-Lite TTS стала более дешёвой версией для массовой генерации. Google предлагает использовать её для дубляжа и голосовых ассистентов, где стоимость каждого аудиофрагмента особенно важна.
По данным Google, Flash TTS заняла первое место в тесте Voice Design Benchmark от Hume AI с результатом 71,4 балла. Обе модели также получили высокие оценки в слепых сравнениях на японском, хинди и мексиканском варианте испанского.
Новые модели уже интегрируют Figma, HeyGen и другие сервисы. Flash TTS появится в Gemini Notebook, а Flash-Lite TTS — в Google Vids. Google выводит клонирование голоса из отдельных демонстраций прямо в инструменты для массового производства контента.