Главная страница » Блог » Технологические новости​ » Новая нейросеть для озвучки подкастов

Новая нейросеть для озвучки подкастов

Хватит всего десяти секунд записи чужого голоса, чтобы новая нейросеть MisoTTS 8B скопировала его один в один. Модель получилась совсем небольшой, но на тестах она уже обогнала другие ИИ-генераторы речи по скорости и качеству.

Нейросеть синтезирует речь быстрее человека, выдавая результат с задержкой чуть больше одной десятой секунды. При этом она умеет довольно естественно передавать живые эмоции. Система отлично подходит для озвучивания длинных текстов, правда, пока работает исключительно с английским языком. Код проекта полностью открыт, а рабочую демку уже можно покрутить на Hugging Face. 🎧

https://github.com/MisoLabsAI/MisoTTS

https://huggingface.co/spaces/multimodalart/MisoTTS

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Прокрутить вверх