FLUX 3: одна модель для видео, звука, картинок и роботов
Black Forest Labs выпустила FLUX 3 — единую модель, которая генерирует 20-секундное видео со звуком и управляет роботами. Ранний доступ уже у Canva и Krea.

«Нельзя обмануть реальность. Модель, которая учится только на картинках, умеет генерировать только картинки. Но мир не состоит из стоп-кадров — он движется, звучит, меняется и отвечает». Так Робин Ромбах, CEO Black Forest Labs, объясняет главную идею FLUX 3 — первой модели немецкой лаборатории, которая вышла за пределы генерации изображений.
Что нового
FLUX 3, представленная 23 июля, — это не модель картинок с «прикрученным» видео. Компания из Фрайбурга, чьи основатели в своё время создали архитектуру латентной диффузии, лёгшую в основу Stable Diffusion, обучила один набор весов сразу на изображениях, видео и аудио, а затем расширила ту же архитектуру на предсказание действий роботов. В основе — метод Self-Flow, опубликованный BFL в марте 2026 года.
Практический результат: модель генерирует ролики до 20 секунд в 720p, где звук создаётся в том же проходе, что и картинка. По словам компании, совместная генерация даёт естественную причинную связь: звук удара совпадает с кадром касания, речь — с движением губ, фон — с содержанием сцены. Любопытная деталь из анонса: аудио занимает меньше 0,5% токенов при генерации 720p-видео — научившись предсказывать динамику мира, модель осваивает звук почти бесплатно.
Цифры ранних сравнений
В слепых сравнениях 10-секундных роликов 720p со звуком FLUX 3 выигрывает у конкурентов с заметным отрывом. Данные пока от самой BFL, поэтому воспринимать их стоит с поправкой:
| Соперник | Предпочтение FLUX 3 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
Сильные стороны, которые компания называет сама и которые отмечают ранние тестеры: человеческая мимика, привязка звуков к физическим событиям и работа с разными языками.
Источник: Black Forest Labs
Четыре продукта и очередь за доступом
Релиз разбит на четыре линейки, и доступность у них очень разная. FLUX 3 Video с опциональной генерацией звука открыта в раннем доступе — подать заявку может любой, но одобряет её BFL, публичного API пока нет. FLUX 3 Action — управление роботами, включая модель FLUX-mimic, — доступна избранным робототехническим партнёрам. FLUX 3 Image обещают «в ближайшие недели», а FLUX 3 Dev — открытые веса мультимодального бэкбона — позже в 2026 году.
Последний пункт самый интересный для сообщества: открытой модели, которая совместно генерирует видео, аудио и изображения в одной архитектуре, сегодня не существует в принципе. Если BFL действительно выложит веса, как делала со всеми поколениями FLUX, это станет первым таким релизом.
Среди ранних тестеров — Canva, Burda, Magnific (бывший Freepik), Krea и Picsart. На странице Krea модель уже значится со статусом «скоро» — запросы пока выполняет FLUX.2.
Что смущает
Ни цен, ни независимых бенчмарков, ни сроков general availability. VentureBeat отмечает, что разработчики, привыкшие получать локальную версию FLUX сразу после анонса, в этот раз останутся ждать: три из четырёх продуктов на день запуска публично недоступны. Сравнения с конкурентами компания проводила сама, на собственной выборке, и честно называет их предварительными.
И всё же направление понятно. BFL прямо говорит, что работает над следующим поколением, объединяющим восприятие, действие и язык в одной модели. Ставка лаборатории — на то, что «модель мира», выученная из видео и звука, окажется тем же фундаментом и для креативных инструментов, и для роботов на заводе. Через несколько месяцев, когда FLUX 3 Dev доберётся до открытых весов, эту гипотезу сможет проверить кто угодно.


