
Создатели TikTok выпустили нейросеть SeedAudio 1.0 для генерации реалистичной речи. Модель не просто клонирует чужие голоса, а создает целые аудиосцены с фоновыми шумами, окружением и музыкой за один проход.
Инструмент отлично справляется с многоголосыми диалогами. ИИ легко разделяет персонажей, удерживая эмоции, тембр и акцент каждого героя. В качестве референса для точного клонирования модель принимает аудиозаписи и обычные картинки.
Платформа fal.ai уже открыла доступ к тестированию. Для индустрии это большой шаг к автоматизации полноценной озвучки подкастов, игр и фильмов по текстовому описанию.
https://fal.ai/models/bytedance/seed-audio-1.0











