
Inworld выпустила Realtime TTS-2
Модель вышла из исследовательского превью и заняла первое место в рейтинге Artificial Analysis. Задержка до начала генерации речи составляет около 100 мс.
Главная фишка Realtime TTS-2 в управлении голосом обычным текстом. Можно буквально написать, как именно произнести фразу, например говорить тепло, раздраженно, шепотом или сквозь зубы. Модель сама подстроит интонацию и подачу.
Поддерживается один и тот же голос более чем на 200 языках, профессиональное клонирование голоса, создание новых голосов по описанию и контекст нескольких реплик.
Параллельно вышла Realtime TTS-2 Flash. У нее задержка всего 25 мс до первого байта, а цена вдвое ниже основной модели.
По данным Inworld, Realtime TTS-2 уже используется в приложениях с сотнями миллионов пользователей, включая обучение языкам, игры, голосовых компаньонов, фитнес и поддержку клиентов.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.