Перейти к содержимому
Иван Полев

Qwen научили клонировать голоса и обгонять Gemini в синтезе речи

Alibaba выпустила Qwen-Audio-3.0-TTS — синтез речи с клонированием голоса, обошедший Gemini в рейтинге качества.

Qwen научили клонировать голоса и обгонять Gemini в синтезе речи

Alibaba выпустила новую модель синтеза речи Qwen-Audio-3.0-TTS. Она умеет клонировать голос: дать ей аудио-образец и текст — и модель прочитает этот текст чужим голосом.

Разработала модель команда Qwen из Tongyi Lab — исследовательского подразделения Alibaba. Релиз вышел 20 июля 2026 года.

Модель понимает 16 языков, включая английский, японский и китайский. Отдельно заявлена поддержка 20 китайских диалектов.

Есть ещё одна полезная функция — управление стилем речи обычным текстом. Можно попросить модель говорить тише, быстрее или с определённой интонацией, не разбираясь в технических параметрах. А для естественности добавлены теги для невербальных звуков — смеха, вздохов, пауз.

Qwen-Audio-3.0-TTS выпущена в двух версиях. Flash работает с задержкой около 300 миллисекунд — этого достаточно для живого диалога с голосовым ассистентом. Plus жертвует скоростью ради качества звучания.

Именно версия Plus попала в независимый рейтинг Artificial Analysis, где модели сравнивают вслепую. Там она обошла Gemini 3.1 Flash TTS от Google и заняла первое место среди всех протестированных систем синтеза речи.

Клонирование голоса по короткому образцу давно стало стандартной функцией у лидеров рынка — так уже умеют модели OpenAI и ElevenLabs. Но Alibaba показывает, что открытые китайские модели способны обгонять закрытые разработки Google не только в тексте, но и в звуке.

Иван Полев
Все статьи
Читайте также
Все статьи