
Black Forest Labs показала новую модель FLUX 3
FLUX 3 учится воспринимать мир как единое пространство, где картинка, движение и звук связаны между собой. Благодаря этому модель лучше понимает физику объектов, причинно-следственные связи и происходящие события.
На одной архитектуре работают сразу несколько задач.
— Генерация видео со звуком до 20 секунд за один проход.
— Текст в видео, изображениях и на разных языках.
— Image-to-Video, Video-to-Video и продолжение уже существующих роликов.
— Генерация диалогов на нескольких языках.
— Создание длинных сцен из нескольких клипов с сохранением персонажей.
— Поддержка разных стилей, форматов и соотношений сторон.
По предварительным тестам FLUX 3 уже выглядит очень конкурентоспособно.
Модель выигрывала в пользовательских сравнениях у Runway Gen-4.5 в 77% случаев, у Luma Ray 3.2 в 93%, у Grok Imagine Video в 69%, у Kling v3 Pro в 60%, а также опережала Happy Horse, Seedance 2.0 и Gemini Omni Flash.
Отдельно разработчики отмечают сильную передачу эмоций на лицах, более естественную синхронизацию звука с происходящим в кадре и высокое качество многоязычных диалогов.
Также на базе FLUX 3 уже создают модели для робототехники. Вместе с mimic robotics компания разработала FLUX-mimic, которая использует ту же мультимодальную основу для предсказания действий роботов при работе с реальными объектами. Сейчас технология тестируется в производственных задачах Audi.
В ближайшие месяцы Black Forest Labs откроет доступ к генерации изображений, видео, аудио, моделям для робототехники и позже выпустит открытую мультимодальную базовую модель FLUX 3 Dev.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.