
Tencent выпустила AuK — универсальную ИИ-модель на 1,5 млрд параметров для генерации, клонирования и редактирования голоса. Модель доступна под лицензией MIT и поддерживает работу в ComfyUI.
Компания Tencent представила AuK — новую мультимодальную модель для работы со звуком, которая объединяет функции генерации, клонирования и глубокого редактирования голоса в одном интерфейсе. Модель с 1,5 миллиардами параметров призвана решить проблему фрагментированности инструментов для работы с аудио: теперь задачи, которые раньше требовали использования нескольких нейросетей, выполняются в рамках единой системы. Релиз значим для индустрии благодаря открытому коду и гибкости настройки, позволяющей использовать ИИ в профессиональном продакшене и локальных рабочих процессах.
AuK позиционируется как «швейцарский нож» в мире аудио-технологий. Основное преимущество модели заключается в её способности воспринимать естественные текстовые команды для управления сложными акустическими параметрами. Пользователи могут не только озвучивать текст (TTS), используя короткий образец чужого голоса для клонирования, но и осуществлять глубокое редактирование уже существующих записей.
Функциональный набор AuK включает в себя:
Особого внимания заслуживает режим трансформации речи в шёпот, что открывает новые возможности для создания атмосферного контента в подкастах и видеоиграх.
В основе AuK лежит масштабное исследование данных: для обучения модели разработчики из Tencent использовали массив объёмом около 1,95 миллиона часов аудиозаписей. Чтобы научить нейросеть точно следовать запросам пользователя, была сформирована база из 3,03 миллиарда пар «инструкция — звук». Такая плотность данных позволяет модели корректно интерпретировать даже сложные творческие задачи, сохраняя естественность звучания.
Параллельно с основной версией была представлена оптимизированная модификация — AuK-Flash. Эта версия ориентирована на сценарии, где критически важна скорость отклика. AuK-Flash способна генерировать качественный результат всего за 4 шага, что делает её примерно в 4,5 раза быстрее базовой модели. Это критически важно для интеграции в real-time сервисы, такие как голосовые помощники или системы мгновенного перевода.
Tencent придерживается политики открытого доступа, поэтому исходный код и веса модели уже опубликованы на платформе Hugging Face. Лицензия MIT позволяет использовать технологию в коммерческих проектах, что делает AuK серьёзным конкурентом закрытым проприетарным сервисам.
Для сообщества энтузиастов и профессиональных дизайнеров уже реализована интеграция с ComfyUI, что упрощает встраивание инструментов AuK в привычные пайплайны генеративного искусства. Возможность локального запуска гарантирует приватность данных и независимость от облачных мощностей вендора. Учитывая универсальность модели и её способность работать с музыкой и речью одновременно, AuK может стать базовым стандартом для open-source инструментов обработки звука в ближайшее время.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.