Flux 3 генерирует видео до 20 секунд с нативным аудио: что известно

Black Forest Labs представила Flux 3: модель создаёт видео со звуком до 20 секунд. Отделяем подтверждённые функции от ранних оценок компании.

Демонстрация генерации видео с нативным аудио моделью Flux 3

Факты проверены 23 июля 2026 года. Black Forest Labs открыла ранний доступ к FLUX 3 Video, части новой мультимодальной модели для изображений, видео и аудио. Она может создать ролик с нативным звуком длительностью до 20 секунд за одну генерацию.

Доступ пока открыт ограниченному кругу участников. Сравнения с Grok Imagine Video, Kling, Seedance, Runway и Luma провела сама Black Forest Labs. Независимых тестов, публичных цен и сроков общего запуска на момент публикации нет.

FLUX 3 — мультимодальная модель Black Forest Labs, которую обучали совместно на изображениях, видео и аудио. Звук и видеоряд она создаёт в одном процессе, без склейки результатов двух отдельных генераторов.

Параметр Что подтверждено Статус Чего это не доказывает Источник
Длительность До 20 секунд за одну генерацию Заявленная возможность FLUX 3 Video Что каждый ролик длится 20 секунд Black Forest Labs
Аудио Нативный звук во всех перечисленных видеорежимах Доступно в Early Access Идеальную синхронизацию речи и событий в каждом клипе Black Forest Labs
Входные данные Текст, изображения, видео, ключевые кадры, видео и аудио для продолжения Заявленные режимы модели Одинаковое качество и управляемость во всех режимах Black Forest Labs
Предварительное сравнение 10-секундные клипы 720p с аудио Собственная оценка BFL Качество 20-секундных роликов, 4K или лидерство в независимом рейтинге Black Forest Labs
Доступ Подача заявки на ограниченный Early Access Предрелизный доступ партиями, без гарантии приглашения Общую доступность, бесплатный тариф или открытый API Условия Early Access
API и веса API, частные веса и открытая мультимодальная основа входят в план запуска Следующие недели и месяцы Что их уже можно использовать или скачать Black Forest Labs

FLUX 3 Video: подтверждённые возможности

Black Forest Labs перечисляет пять основных способов работы с видео. Модель принимает текстовый запрос, оживляет стартовый кадр, использует изображение как визуальный ориентир, переносит элементы исходного видео в новую сцену и строит переход между заданными ключевыми кадрами. Ещё один режим продолжает входные видео и аудио.

Во всех этих сценариях FLUX 3 генерирует звук вместе с изображением. Компания также заявляет многоязычный диалог, разные стили и форматы кадра, а также связывание отдельных клипов в длинные многоракурсные последовательности. Последняя функция не увеличивает предел одной генерации: ролики по-прежнему собираются из отдельных отрезков.

Схема FLUX 3 с изображениями, видео, аудио и действиями в одном мультимодальном трансформере
Изображения, видео, аудио и действия подключены к общей мультимодальной основе FLUX 3. Схема: Black Forest Labs.

Архитектурный замысел шире видеогенератора. FLUX 3 обучали одновременно на изображениях, видео и аудио, чтобы одна модель учитывала форму объектов, движение и связанный с событием звук. Похожий переход к общей мультимодальной системе мы разбирали в материале о том, почему рынок движется к одной модели для понимания и генерации медиа.

Нативное аудио создаётся вместе с видеорядом

Нативное аудио в FLUX 3 означает совместную генерацию звука и видео внутри одной модели. Отдельный синтезатор не получает готовый ролик постфактум: движение, речь и звуковые события возникают из общего представления сцены.

Такой подход может убрать один этап из рабочего процесса. Создателю ролика не придётся отдельно подбирать шум удара, речь или фоновую дорожку к уже созданному изображению. Но демонстрации запуска не показывают, насколько стабильно модель синхронизирует губы, голоса и физические события на разных языках и в длинных сценах.

Предел 20 секунд не равен качеству 20-секундных роликов

Число 20 описывает верхнюю заявленную длительность одной генерации. Black Forest Labs не утверждает, что все ролики создаются с такой длиной или что качество не меняется по мере продолжения сцены.

Для собственного сравнения компания использовала другие условия: 10 секунд, разрешение 720p и звук. Поэтому опубликованные проценты нельзя переносить на 20-секундные клипы, 4K или монтаж из нескольких сцен. Разрешение 4K в официальном анонсе FLUX 3 Video вообще не указано.

Сравнения BFL остаются предварительными

По данным Black Forest Labs, участники ранних оценок предпочитали FLUX 3 модели Grok Imagine Video в доле до 69% сравнений, Kling v3 Pro в 60%, Seedance 2.0 и Gemini Omni Flash в 52%. Показатель против Runway Gen-4.5 составил 77%, против Luma Ray 3.2 — 93%.

Предварительная доля предпочтения FLUX 3 в сравнении с восемью видеомоделями
Доля оценщиков, предпочитавших раннюю версию FLUX 3 в собственном тесте компании. 50% означает равное число голосов. График: Black Forest Labs.

Эти числа описывают внутреннюю оценку BFL. Компания прямо пишет, что модель и стенд для тестирования ещё разрабатываются, а результаты могут измениться во время раннего доступа. Публичного набора запросов, роликов и полной методики, достаточной для воспроизведения вывода, в анонсе нет.

Поэтому формулировка «FLUX 3 лучше конкурентов» преждевременна. Для сравнения важны одинаковые запросы, число попыток, отбор результатов, состав оценщиков и критерии предпочтения. Ранее мы разбирали, как Grok Imagine Video вышла в API и с какими ограничениями; у FLUX 3 сопоставимых публичных данных о цене, скорости и лимитах пока нет.

Early Access не означает общий запуск

Пользоваться FLUX 3 Video сейчас могут участники раннего доступа, которых отбирает Black Forest Labs. На странице анонса есть форма заявки. В условиях программы сказано, что доступ дают ограниченно, могут открывать партиями с учётом вычислительных ресурсов и не гарантируют каждому заявителю.

Компания планирует выпускать возможности поэтапно в следующие недели и месяцы. В список входят генерация и редактирование видео с аудио через API и частные веса, изображительная модель FLUX 3 Image, направление для прогнозирования действий и открытая мультимодальная основа FLUX 3 Dev.

Этот план не раскрывает точные даты, цены, лимиты, системные требования или правила коммерческого использования будущих весов. Пока их нет на официальных страницах, сторонние сайты с кнопками «Generate», обещаниями бесплатного доступа или 4K нельзя считать сервисами Black Forest Labs. Посмотреть, какие нейросети для видео уже доступны пользователям, можно в отдельном обзоре Toolarium.

Главная ставка FLUX 3: единая модель для медиа

До FLUX 3 семейство Black Forest Labs ассоциировалось прежде всего с генерацией и редактированием изображений. Новая модель добавляет временную ось и звук, а общий обучающий подход компания также использует в FLUX-mimic для прогнозирования действий роботов. FLUX-mimic относится к соседнему направлению и ничего не доказывает о качестве видеогенерации.

Для создателей контента практический смысл проще: одна система потенциально может заменить подготовку кадра, анимацию, продолжение сцены и синтез звука. Реальную ценность определят независимые тесты, стабильность, скорость, стоимость и точность управления. Ранние демонстрации на эти вопросы пока не отвечают.

FLUX 3 Video уже показывает направление Black Forest Labs, но продуктовый запуск ещё впереди. До появления общего API и воспроизводимых сравнений корректный вывод один: компания заявила сильный набор режимов и нативный звук до 20 секунд, а доказательства стабильного преимущества только предстоит получить.

Читайте также

Telegram-канал @toolarium