
Black Forest Labs выпустила мультимодальную модель FLUX 3. Она работает с изображениями, видео и аудио внутри одной архитектуры.
Модель создаёт видео по тексту, изображению или нескольким ключевым кадрам. За одну генерацию можно получить видео до 20 секунд с несколькими сценами и ракурсами.
Звук генерируется вместе с изображением. FLUX 3 поддерживает речь на разных языках, акценты, звуковые эффекты, атмосферу и синхронизацию губ.
Видео можно продолжать с последнего кадра. Модель сохраняет движение, композицию и логику сцены, поэтому отдельные клипы можно объединять в длинные истории.
Также появился Draft Mode. Сначала FLUX 3 быстро создаёт дешёвый черновик, а выбранный вариант затем рендерится в полном качестве.
Кроме видео модель умеет создавать изображения со сложными надписями и выполнять длинные запросы. В будущем та же архитектура будет использоваться для управления роботами.
Попробовать можно тут.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.