
Alibaba выпустила одну из самых сильных TTS-моделей на рынке
Qwen Audio 3.0 TTS умеет не просто озвучивать текст, а практически играть роль. Достаточно написать обычную инструкцию вроде «говори шепотом», «смеясь», «взволнованно» или «как ведущий новостей» и модель сама передаст нужную интонацию.
Поддерживаются 16 языков, клонирование голоса, потоковая генерация с задержкой около 300 мс и более 80 специальных тегов для эмоций, пауз, смеха, вздохов и других эффектов. Даже если запись для клонирования сделана в шумном помещении, качество остается высоким.
Доступны две версии. Flash подходит для голосовых ассистентов и общения в реальном времени. Plus делает ставку на максимальное качество и уже занимает первое место в рейтинге Artificial Analysis среди коммерческих TTS-моделей.
Судя по демо, это один из самых естественно звучащих синтезаторов речи на сегодня.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.