Пока западные гиганты спорят о безопасности, китайцы из Alibaba выкатили Qwen3-TTS и буквально взорвали рынок синтеза речи. Новая модель умеет создавать голоса с нуля по текстовому описанию и клонировать чужую речь с пугающей скоростью. Это тот случай, когда технологии перешагнули черту между «похоже» и «неотличимо».
Главная фишка системы под названием VoiceDesign заключается в полном контроле через естественный язык. Вам больше не нужны готовые шаблоны — вы просто пишете промпт, описывая тембр, ритм, характер и даже уровень экспрессии. Хотите мощный баритон гиперэнергичного рекламного ведущего с быстрыми подъемами тона — нейронка соберет такой голос за мгновение. В тестах на ролевые сценарии этот алгоритм уже обходит GPT-4o и Gemini, выдавая гораздо более живой и эмоциональный результат.
Но настоящий шок вызывает функция VoiceClone. Системе достаточно всего три секунды вашего аудио, чтобы полностью скопировать голос и заговорить на десяти языках, включая русский. Разработчики заявляют, что они на пятнадцать процентов точнее ElevenLabs в многоязычных тестах. Нейронка идеально копирует интонации и специфические речевые паттерны, что делает подделку голоса практически идеальной.
Лично меня пугает и восхищает такая продуктивность. С одной стороны мы получаем невероятный инструмент для озвучки игр и кино, где можно создать уникального персонажа просто текстом. С другой стороны эпоха «голосовых подтверждений» в мессенджерах окончательно уходит в прошлое. Теперь любой звонок от «знакомого» может быть результатом работы трехсекундного клонирования.
Alibaba в очередной раз доказала, что в гонке ИИ-вооружений они не просто догоняют лидеров, а диктуют свои правила. Открытость и мощь их моделей делают их фаворитами для разработчиков по всему миру.
А вы готовы к тому, что через год отличить звонок реального человека от работы Qwen3 будет физически невозможно?











