Qwen научили клонировать голоса и обгонять Gemini в синтезе речи
Alibaba выпустила Qwen-Audio-3.0-TTS — синтез речи с клонированием голоса, обошедший Gemini в рейтинге качества.
Alibaba выпустила новую модель синтеза речи Qwen-Audio-3.0-TTS. Она умеет клонировать голос: дать ей аудио-образец и текст — и модель прочитает этот текст чужим голосом.
Разработала модель команда Qwen из Tongyi Lab — исследовательского подразделения Alibaba. Релиз вышел 20 июля 2026 года.
Модель понимает 16 языков, включая английский, японский и китайский. Отдельно заявлена поддержка 20 китайских диалектов.
Есть ещё одна полезная функция — управление стилем речи обычным текстом. Можно попросить модель говорить тише, быстрее или с определённой интонацией, не разбираясь в технических параметрах. А для естественности добавлены теги для невербальных звуков — смеха, вздохов, пауз.
Qwen-Audio-3.0-TTS выпущена в двух версиях. Flash работает с задержкой около 300 миллисекунд — этого достаточно для живого диалога с голосовым ассистентом. Plus жертвует скоростью ради качества звучания.
Именно версия Plus попала в независимый рейтинг Artificial Analysis, где модели сравнивают вслепую. Там она обошла Gemini 3.1 Flash TTS от Google и заняла первое место среди всех протестированных систем синтеза речи.
Клонирование голоса по короткому образцу давно стало стандартной функцией у лидеров рынка — так уже умеют модели OpenAI и ElevenLabs. Но Alibaba показывает, что открытые китайские модели способны обгонять закрытые разработки Google не только в тексте, но и в звуке.