
Tavus представила Griffin для живого видеобщения: 48% участников теста приняли Griffin-Lite за человека, а система заняла первое место в независимом бенчмарке NVIDIA VideoFDB.
Tavus представила Griffin — модель для живого видеобщения, которая одновременно анализирует речь и изображение пользователя, а также в реальном времени генерирует собственные голос, мимику и движения. В исследовании компании 48% участников приняли ИИ за настоящего человека, что показывает заметный прогресс в создании реалистичных видеособеседников.
Главное отличие Griffin от традиционной последовательной схемы общения заключается в непрерывном восприятии происходящего. Модель не прекращает слушать и смотреть во время собственного ответа, поэтому может учитывать изменения в разговоре в реальном времени.
Например, Griffin способна кивнуть во время речи собеседника, перебить в подходящий момент или остановиться, если перебили ее саму. Система также может заметить предмет в кадре и учитывать паузу, понимая ее как размышление, а не обязательно как завершение фразы. Решение о следующем действии пересматривается несколько раз в секунду.
Архитектура Griffin включает две основные части. Первая непрерывно анализирует аудио и видео и определяет, что системе следует сказать и как вести себя. Вторая в реальном времени создает голос и видеоряд.
При этом Griffin генерирует весь кадр целиком: не только лицо, но также тело, руки и фон. Такой подход позволяет системе воспроизводить более полноценное визуальное присутствие во время видеозвонка.
В исследовании Tavus 54 человека провели минутный видеозвонок с Griffin-Lite, не зная, кто находится на другой стороне. После разговора 26 участников, или 48%, решили, что общались с настоящим человеком.
Для предыдущей системы Tavus аналогичный показатель составлял 2,4%. Разница показывает, насколько изменилось восприятие реалистичности видеособеседника по сравнению с предыдущей системой компании.
Griffin также заняла первое место среди протестированных систем на независимом бенчмарке NVIDIA VideoFDB, оценивающем генерацию и восприятие во время общения лицом к лицу. При этом результаты модели все еще немного уступают человеческим записям.
На момент представления Griffin-Lite доступна только небольшой группе тестировщиков. Tavus отдельно отмечает необходимость дополнительных механизмов безопасности: технология уже способна убедить человека в том, что по другую сторону видеосвязи находится реальный собеседник.
Таким образом, развитие Griffin касается не только качества генерации речи и видео, но и самой модели взаимодействия человека с ИИ. Чем реалистичнее становится виртуальный собеседник, тем важнее становится возможность понимать, с кем именно пользователь разговаривает.
Подробности о Griffin компания Tavus публикует на странице проекта: Tavus Griffin.
Бесплатные промпты для нейросетей на русском, новости ИИ и уроки по генерации фото, видео и текста, доступные на всех площадках.