Стартап Inworld выпустил Realtime TTS-2, и это первый генератор речи, который действительно понимает, что такое разговор. Модель уже возглавила рейтинги Artificial Analysis, оставив позади ElevenLabs и гигантов вроде OpenAI. Главная фишка в том, что нейронка училась не на сухом чтении книг, а на реальных диалогах со всеми их заминками и эмоциями.
Система слышит контекст беседы и адаптирует ответ под ваше настроение, будто это настоящий собеседник. Если вы пошутили, она может ответить со смешинкой, а если попросить её говорить «уставшим голосом, как после работы» прямо в тексте — она так и сделает. При этом один голос без проблем переключается между сотней языков, включая русский, сохраняя свой уникальный тембр. Реакция почти мгновенная, а для клонирования вашего голоса модели хватает всего пятнадцати секунд записи. 🎙
https://inworld.ai/blog/realtime-tts-2











