
Realtime TTS-2 теперь работает локально, а значит интернет для клонирования голоса больше не нужен. Технология позволяет скопировать чей-то тембр по кусочку записи в 15 секунд или собрать новый голос с нуля. Система поддерживает русский, понимает эмоции и выдает результат почти мгновенно с задержкой в 200 миллисекунд. Качественный синтез речи перестал зависеть от облаков, что делает его отличным конкурентом Eleven Labs.
Правда, халявы особо не ждите. Бесплатно дают всего 40 минут в месяц, а за серьезные объемы придется платить от 25 долларов. В свободном доступе также стоит ограничение на длину текста — за раз больше 2000 знаков не озвучить.
https://inworld.ai/on-device











