Flux 3 научили озвучивать видео — и заодно предсказывать физику
Black Forest Labs выпустила Flux 3 — первую свою модель, которая генерирует видео со встроенным звуком, длиной до 20 секунд.
Немецкая компания Black Forest Labs, основанная бывшими разработчиками Stable Diffusion, выпустила Flux 3 — новую модель для генерации видео. Главное отличие от предыдущих версий: она впервые умеет добавлять к видео звук, а не только картинку.
Ролики можно генерировать длиной до 20 секунд. Модель поддерживает text-to-video, image-to-video, video-to-video, переходы по ключевым кадрам, реплики на разных языках и склейку нескольких клипов в одну сцену.
BFL протестировала Flux 3 на людях: им показывали 10-секундные ролики в 720p и просили выбрать, какой лучше. Доля голосов за Flux 3: против Luma Ray 3.2 — 93%, против Runway Gen-4.5 — 77%, против Grok Imagine Video — 69%, против Kling v3 Pro — 60%, против Happy Horse v1 — 59%, против Happy Horse 1.1 — 57%, против Seedance 2.0 и Gemini Omni Flash — по 52% каждый.
Против лидеров рынка Flux 3 побеждает почти вничью. Сама BFL признаёт: тесты предварительные, независимой проверки пока нет.
Компания объясняет свой подход так: одна модальность — картинка, видео или звук — не описывает реальность полностью. Картинка даёт пространство, видео — движение во времени, звук — связь между механическим событием и его звуком. Обучение сразу на всех трёх, по словам BFL, даёт модели больше информации, чем раздельное обучение каждой.
Flux 3 Image, версия для генерации картинок, выйдет в ранний доступ в ближайшие недели. Вместе с компанией Mimic Robotics в Flux 3 добавили отдельный компонент, который предсказывает физические действия. Такую версию, Flux-mimic, уже тестируют на производстве Audi.
Компания также обещает открыть веса базовой модели под именем Flux 3 Dev.
BFL называет всё это шагом к модели, которая понимает физический мир достаточно, чтобы не просто рисовать его, а предсказывать, что в нём произойдёт дальше.