adblock check

Представлена ИИ-модель Flux-3: одновременно работает с изображениями, видео и аудио

Одной из главных особенностей новой ИИ-модели стала возможность создания видеороликов длительностью 20 секунд с полноценным звуковым сопровождением
Обложка: Black Forest Labs

Компания Black Forest Labs представила FLUX 3 — новую мультимодальную модель, которая одновременно работает с изображениями, видео и аудио. В отличие от предыдущих версий, она обучается сразу на нескольких типах данных, что позволяет ей лучше понимать взаимосвязи между происходящими событиями, движением объектов и звуком, а не рассматривать каждую модальность отдельно.

Разработчики считают, что такой подход помогает модели формировать более целостное представление об окружающем мире. Изображения передают пространственную структуру сцены, видео добавляет информацию о движении и времени, а аудио помогает установить причинно-следственные связи между событиями. Благодаря совместному обучению FLUX 3 учитывает соответствие звука происходящему на экране, физику движения объектов и последовательность событий.

В основе модели лежит архитектура Self-Flow, предназначенная для объединения генерации и понимания мультимодальных данных. На её базе FLUX 3 способен создавать изображения, видео и аудио как по текстовым запросам, так и с использованием изображений или видеороликов в качестве исходных материалов.

Одной из главных возможностей модели стала генерация видеороликов продолжительностью до 20 секунд со встроенным звуковым сопровождением. FLUX 3 поддерживает создание видео по текстовому описанию, анимацию статичных изображений, продолжение существующих роликов, перенос персонажей и объектов между сценами, генерацию ключевых кадров, многоязычные диалоги и работу с различными стилями. Также модель позволяет объединять отдельные фрагменты в более длинные последовательности.

Представлена ИИ-модель Flux-3: одновременно работает с изображениями, видео и аудио

По данным разработчиков, в предварительных тестах FLUX 3 опередил ряд конкурирующих моделей, включая решения от Runway, Luma, Kling и Grok. FLUX 3 был предпочтительнее Grok Imagine Video в 69% сравнений, Kling v3 Pro — в 60%, Happy Horse v1 — в 59%, Happy Horse 1.1 — в 57%, Seedance 2.0 и Gemini Omni Flash — в 52%. Также FLUX 3 обошёл ИИ-модель Runway Gen-4.5 в 77% сравнений и Luma Ray 3.2 — в 93% сравнений. При этом компания отмечает, что модель всё ещё находится на стадии раннего доступа и её качество продолжит улучшаться.

Представлена ИИ-модель Flux-3: одновременно работает с изображениями, видео и аудио

Помимо генерации видео, FLUX 3 умеет создавать и редактировать изображения, включая сложные композиции и текст на разных языках. Отдельное направление разработки связано с прогнозированием действий для робототехники. В рамках этого проекта Black Forest Labs сотрудничает с компанией Mimic Robotics, которая использует возможности модели для обучения промышленных роботов.

В ближайшие месяцы компания планирует поэтапно открыть ранний доступ к инструментам для генерации видео, изображений и аудио через API, а также предоставить исследователям доступ к открытой версии архитектуры FLUX 3. Вместе с этим разработчики обещают опубликовать дополнительные технические подробности о модели.

Источник

ИИ ИИ
17,6K участников
Вступить
3 комментария по лайкам по дате
Оставьте комментарий...
Оставьте комментарий...
Robbyaak
Генерировал изобродения по рефенсу во всех flux 2 результат просто кринж. Посмотрим на что способная новая flux 3
smorodin
1 час
🇷🇺
Автор
А остались примеры того, что генерировал? Можно сюда закинуть?
Robbyaak
Не скачивал даже. Плохой результат изредка делает что-то путное.