Black Forest Labs презентувала FLUX 3: генерація зображень та 20-секундних відео зі звуком, але поки що обмеженим релізом

Black Forest Labs презентувала FLUX 3: генерація зображень та 20-секундних відео зі звуком, але поки що обмеженим релізом 1

Black Forest Labs (BFL) розширює свою лінійку FLUX за межі генерації зображень. Компанія представила FLUX 3 – мультимодальну модель, навчену розуміти та генерувати зображення, а також аудіо/відео кліпи тривалістю до 20 секунд за одним запитом. Крім того, ця ж архітектура може бути застосована для комп’ютерного зору та керування роботами.

Штаб-квартира BFL розташована у Фрайбурзі, Німеччина. Лабораторія стверджує, що FLUX 3 навчалася одночасно на різних типах даних, а не зібрана з окремих моделей зображень, відео та аудіо, об’єднаних спільним інтерфейсом.

Ця відмінність є ключовою у позиціонуванні компанії: BFL прагне, щоб підприємства розглядали генерацію креативного контенту, симуляцію, роботу з комп’ютерами та робототехніку як взаємопов’язані застосування єдиної можливості, яку вони називають “візуальним інтелектом” – моделями, “здатними сприймати, прогнозувати та діяти в фізичному та цифровому середовищі”. Цей реліз є першою публічною моделлю BFL для генерації відео.

FLUX 3 буде пропонуватися у чотирьох продуктових лініях: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action та майбутній відкритий FLUX 3 Dev. FLUX 3 Video з опціональною нативною генерацією аудіо, та FLUX 3 Action вже доступні для програми “Ранній Доступ” (Early Access), на яку може подати заявку будь-хто, але BFL залишає за собою право затвердження.

Наразі немає публічного доступу через API BFL або партнерські API. Однак компанія обіцяє, що FLUX 3 Image стане доступною протягом найближчих тижнів, а потім буде загальна доступність. Обмежений початковий випуск нагадує стратегії запуску нових моделей від інших провідних лабораторій США, включаючи Anthropic та OpenAI, хоча ті були обумовлені міркуваннями безпеки та запитами уряду.

Компанія поки не оголосила ціни, зобов’язання щодо рівня обслуговування (SLA), методологію оцінки, розміри вибірок, кількість оцінювачів чи будь-які бенчмарки моделей зображень. Тому корпоративні покупці не можуть поки що розрахувати повну вартість володіння або самостійно відтворити порівняння відео.

Ще одне помітне упущення: FLUX 3 не випускається з завантажуваними вагами (weights) або відкритою ліцензією. BFL обіцяє, що швидші версії з відкритими вагами з’являться пізніше цього року. Їхній технічний блог називає FLUX 3 Dev “відкритим доступом до мультимодального ядра для створення контенту (відео, аудіо та зображень) та прогнозування дій” — це значно ширше зобов’язання, ніж у будь-якому попередньому релізі FLUX Dev, які стосувалися лише зображень.

Але ця версія з’явиться в кінці черги. Розробникам, які звикли отримувати локально розгортану версію FLUX одночасно або незабаром після анонсу основної моделі, доведеться чекати. Ця затримка не знецінює зобов’язань компанії, але вона розчаровує, враховуючи роль, яку відкриті ваги відіграли у прийнятті FLUX досі.

Flux 3 оцінюється вище за конкурентів, але відсутність деталей щодо цін та бенчмарків може перешкодити швидкому впровадженню підприємствами

BFL опублікувала кілька порівнянь за бенчмарками, але вони позначені як попередні. Повні результати та методологія будуть опубліковані пізніше, під час загальної доступності.

У попередніх тестах на перевагу (head-to-head preference testing) 10-секундних відеокліпів 720p, створених за текстовим запитом з аудіо, BFL стверджує, що FLUX 3 перевершив Luma Ray 3.2 у 93% порівнянь, Runway Gen-4.5 — у 77%, Grok Imagine Video — у 69%, Kling v3 Pro — у 60%, Happy Horse v1 — у 59%, Happy Horse 1.1 — у 57%, а Seedance 2.0 та Gemini Omni Flash від Google — у 52%.

Black Forest Labs презентувала FLUX 3: генерація зображень та 20-секундних відео зі звуком, але поки що обмеженим релізом 2

Усі ці показники супроводжуються зауваженням від BFL. Таблиця з результатами позначена як “попереднє оцінювання раннього кандидата FLUX 3”, що означає, що цифри описують передрелізний стан, а не модель, яка зараз виходить на стадію раннього доступу. Це може бути як на користь, так і на шкоду: випущена модель може працювати краще, але наразі немає даних, які б вимірювали реальні результати для клієнтів.

Luma Ray 3.2 та Runway Gen-4.5, де FLUX 3 показав 93% та 77% відповідно, є найменш значущими порівняннями у списку. Це вже усталені продукти, але не ті моделі, що зараз лідирують у незалежних рейтингах відеогенерації. Натомість, реальні перемоги — це ті, що найменше впливають на вибір корпоративних клієнтів.

Seedance 2.0, з результатом 52%, є статистично еквівалентним порівняно з моделлю, яку більшість західних компаній наразі не можуть отримати. ByteDance безстроково відклала міжнародний випуск Seedance 2.0 після юридичних погроз від Netflix, Warner Bros., Disney, Paramount та Sony щодо нібито систематичного порушення авторських прав, і цей мораторій досі діє. “Нічия” з замороженим продуктом не є ані сильною, ані слабкою заявою.

Gemini Omni Flash, також з результатом 52%, має значно більшу вагу. Omni є найближчим аналогом від великої платформи до того, що намагається зробити FLUX 3 — мультимодальний вхід, створення відео та аудіо, діалогове редагування. І за власними вимірюваннями BFL, ці дві моделі не відрізняються за якістю 10-секундного відео, створеного за текстом.

Перевага Google у цьому протистоянні полягає в тому, що Omni загальнодоступний через API Gemini від Google за $0.10 за секунду згенерованого відео 720p, або приблизно за $1 за 10-секундний кліп.

Один регіональний нюанс важливий для домашнього ринку німецької компанії. Редагування завантаженого відео недоступне для користувачів Omni Flash в Європейській економічній зоні, Швейцарії та Великій Британії, хоча редагування відео, згенерованого самою моделлю, дозволено. Європейське підприємство, яке хоче обробити свої існуючі кадри за допомогою генеративного редагування, наразі не може зробити це на Omni Flash.

Ось приблизний посібник для підприємств, які розглядають, на які відеомоделі покладатися:

Модель

Макс. тривалість одного покоління

Макс. роздільна здатність

Ключові обмеження

Ціна за 10-сек. кліп (720p)

Ціна за 10-сек. кліп (1080p)

Ціна за 10-сек. кліп (4K)

FLUX 3 Video

20 секунд

Не вказано; оцінки проводилися в 720p

Ранній доступ; немає опублікованих SLA або цін

Не анонсовано

Не анонсовано

Не анонсовано

HappyHorse 1.1

15 секунд

1080p

Немає 4K; закриті ваги

Не опубліковано (ставка реселера v1.0 становить ~$1.82)

Не опубліковано (ставка реселера v1.0 становить ~$3.12)

н/д

Veo 3.1

Тариф за секунду

4K

Підтримує розширення кліпу; попередній перегляд

$4.00

$4.00

$6.00

Veo 3.1 Fast

Тариф за секунду

4K

Попередній перегляд

$1.00

$1.20

$3.00

Veo 3.1 Lite

Тариф за секунду

1080p

Немає 4K, немає розширення кліпу; попередній перегляд

$0.50

$0.80

н/д

Gemini Omni Flash

10 секунд (мін. 3с)

720p при 24 FPS

Попередній перегляд та відсутність доступу в ЄС

$1.00

н/д

н/д

Одна архітектура для медіагенерації та фізичних дій

FLUX 3 базується на Self-Flow — методі BFL для узгодження мультимодального розуміння та генерації в межах однієї архітектури, представленому в березні 2026 року.

Компанія стверджує, що значно збільшила обчислювальні потужності та обсяг даних для одночасного навчання на відео, зображеннях та аудіо. Тестування показало, що генерація відео та прогнозування дій не потребують окремих основ — та сама архітектура може бути розширена для прогнозування дій без шкоди для того, що було вивчено на відео.

“Ми ставимо зір в центр нашого підходу, оскільки це найбільш насичене сигналами середовище фізичного світу. Зображення передають структуру, зображення та відео вивчають просторові відносини, відео вивчає динаміку, а дії розкривають причинно-наслідкові зв’язки. Але одного лише зору недостатньо”, — заявив Робін Ромбах, співзасновник і генеральний директор BFL, у попередній заяві для VentureBeat. “Справжній інтелект означає сприйняття світу: прогнозування його змін, вчинення дій та навчання на результатах. Спільне навчання в рамках єдиної уніфікованої архітектури — це те, що дозволить нам досягти цього, оскільки кожен спосіб навчання посилює інші. Аудіо передає таймінг, інтонацію та фізичні події, які уникають зору. Мова передає цілі, абстракції та інструкції, які пікселі не можуть легко висловити.”

Він більш прямолінійно висловився в іншому місці анонсу: “Реальності не обдуриш. Модель, яка вивчає лише зображення, може генерувати лише зображення. Але світ не складається зі статичних кадрів. Він рухається, звучить, змінюється та реагує.”

BFL стверджує, що FLUX 3 націлена на креативні інструменти, медіа, дизайн, електронну комерцію та фізичний ШІ, підтримуючи генерацію відео із синхронізованим аудіо, точне редагування зображень, послідовність продуктів та матеріалів під час руху, багатомовну генерацію та прогнозування дій роботів. Вже проводяться тести з Canva, Burda, Magnific (раніше Freepik), Krea та Picsart.

Для компаній, що займаються програмним забезпеченням для творчості, привабливість полягає в консолідації. Єдина основа потенційно може підтримувати створення раскадровок, редагування зображень, рендеринг продуктів, варіації відео та локалізацію без необхідності постійного перекладу активів та інструкцій між роз’єднаними моделями.

Для команд робототехніки потенційна цінність полягає в ефективності даних. Моделі, які вже кодують рух, поведінку об’єктів та фізичні зміни, можуть потребувати менше специфічного для завдань навчання роботів, ніж системи, що починають з сирих демонстрацій.

Що насправді вміє FLUX 3 Video

Відео-рівень є найбільш конкретно описаною частиною запуску, і він розвіює чутки: FLUX 3 генерує кліпи тривалістю до 20 секунд з аудіо за однією генерацією.

Кожен відеовихід супроводжується нативним аудіо. Для порівняння, HappyHorse 1.0 генерує до 15 секунд відео 1080p із синхронізованим аудіо. Хоча BFL не вказала роздільну здатність для своїх 20-секундних кліпів, а опубліковані оцінки проводилися в 720p. Тим не менш, 20-секундний кліп з одного запиту є одним з найдовших на сьогодні, що відповідає припиненій моделі OpenAI Sora.

Список можливостей, опублікований BFL, включає:

  • Генерація відео за текстовим запитом.

  • Генерація відео із зображення, анімація зі стартового кадру або використання зображень як візуальних референсів.

  • Генерація відео з відео за референсним кліпом, перенесення елементів, таких як певний персонаж, у нову сцену чи контекст.

  • Генерація відео-аудіо продовження з наявного відео та аудіо входу.

  • Генерація відео за ключовими кадрами для контрольованих переходів між визначеними моментами.

  • Багатомовний діалог.

  • Широкий спектр візуальних стилів та співвідношень сторін, від аматорської зйомки на відеокамеру до анімації та кінематографії.

  • Генерація типографіки та анімаційного дизайну.

  • Ланцюгове виконання окремих кліпів агентами для створення довших послідовностей з багатьма сценами.

Останній пункт — це те, на що командам, які працюють з корпоративним відео, слід звернути особливу увагу. BFL стверджує, що ці можливості поєднуються для створення послідовностей тривалістю кілька хвилин, при цьому візуальні референси забезпечують послідовність персонажів у різних сценах. Якщо це підтвердиться в умовах виробництва, це вирішить проблему, яка перешкоджала використанню генеративного відео в більшості комерційних конвеєрів: не якість кліпу, а безперервність між кадрами.

Це також та функціональність, де конкуренція є найпрямішою. Головним оновленням HappyHorse 1.1 є R2V (Reference-to-Video), який приймає кілька зображень персонажа для збереження ідентичності в згенерованому відео — та сама проблема, вирішена на рівні входу, а не через ланцюгове з’єднання кліпів агентами. Alibaba також стверджує про синхронізацію губ без дрейфу і спеціально націлена на артефакти, які роблять комерційне ШІ-відео штучним, включаючи блиск обличчя та надмірну різкість. Послідовність персонажів — це те, де зараз змагається ця категорія, і обидві компанії це розуміють.

BFL стверджує, що FLUX 3 Video вже особливо сильний у зображенні людських емоцій, асоціації звуків з фізичними подіями та багатомовного виводу. З точки зору зображень, компанія зазначає, що попередні оцінки, проведені під час проміжного навчання, показують значне покращення порівняно з попередніми версіями FLUX у обробці складних запитів та генерації тексту, включаючи високоточний текст кількома мовами. Бенчмарків зображень чи показників перемог опубліковано не було.

Тести FLUX-mimic перевіряють, чи можуть відеомоделі стати моделями роботів

BFL застосовує свою тезу про уніфіковану архітектуру через FLUX-mimic — модель відео-дій, побудовану на основі FLUX 3 та розроблену спільно зі швейцарською компанією Mimic Robotics, одним з перших партнерів, що отримав ранній доступ.

Технічний блог описує два окремі шляхи до прогнозування дій: інтеграція нативного прогнозування дій безпосередньо в FLUX 3, масштабуючи початкову роботу Self-Flow; та використання попередньо навченого відео-ядра як основи, що розуміє динаміку, з якої спеціалізовані моделі дій можуть бути доналаштовані з обмеженими даними, специфічними для завдання. FLUX-mimic — це другий шлях: основа FLUX 3 у поєднанні з досвідом Mimic у навчанні роботів та виробничому розгортанні для точної маніпуляції.

FLUX-mimic призначений для загального маніпулювання роботами: допомога роботам у розумінні візуальної сцени, прогнозуванні наслідків дії та адаптації до нових завдань з набагато меншим обсягом даних, специфічних для завдання.

BFL та Mimic Robotics стверджують, що залежно від складності завдання, модель може бути доналаштована для конкретного завдання маніпулювання з лише 30 хвилинами даних від робота, тоді як попередні підходи вимагали 30 або більше годин.

“Найскладніша частина робототехніки — це дані”, — сказав Елвіс Нава, технічний директор Mimic Robotics, у заяві для VentureBeat. “Кожне нове завдання зазвичай означає години повторень роботом. Оскільки FLUX-mimic побудований на основі передових відеомоделей, які вже розуміють, як поводиться фізичний світ, він освоює нове завдання за хвилини, а не дні. Таким чином, ми можемо перевершити поточний стан справ у навчанні роботів.”

BFL стверджує, що модель, навчена лише на зображеннях, не може зрозуміти світ, який “рухається, звучить, змінюється та реагує”, і що фізичне розуміння є тим, що забезпечує переконливі згенеровані кадри. Google робить майже ідентичну заяву для Gemini Omni.

Документація для розробників цитує “знання світу”, яке поєднує “розуміння фізики” з розумінням Gemini історії, науки та культурного контексту. Їхній маркетинг ще більш прямолінійний: “Більшість ШІ-моделей просто прогнозують наступний піксель для побудови розповіді або зображення. Gemini Omni відрізняється”, — заявила компанія в червні, приписуючи моделі “інтуїтивне розуміння таких сил, як гравітація, кінетична енергія та гідродинаміка для більш реалістичних рухів, що відповідають логіці реального світу.”

Практичним наслідком для корпоративних покупців є те, що мова “світової моделі” не є відмінною рисою. Дві з трьох провідних відеосистем тепер позиціонують фізичне розуміння як свою центральну перевагу, і жодна з них не опублікувала бенчмарк, який би це вимірював.

Немає стандартного тесту, який би визначав, чи згенерована вода поводиться як вода, чи впаде об’єкт з правдоподібною швидкістю, чи звук лунає одночасно з ударом. Рейтинги людських переваг опосередковано охоплюють деякі аспекти. Нічого іншого запропонованого не охоплює це зовсім.

Відкриті ваги допомогли зробити FLUX галузевим стандартом

BFL офіційно запустилася влітку 2024 року і за останні два роки завоювала ім’я в індустрії ШІ завдяки своїй відданості відкритому вихідному коду високоякісних моделей генерації зображень, улюблених розробниками, креативними фахівцями та підприємствами.

Засновники компанії, включаючи Ромбаха, Андреаса Блатманна та Патріка Ессера, раніше брали участь у створенні VQGAN, latent diffusion та Stable Diffusion. Остання є технологією з відкритим вихідним кодом, яка започаткувала масові можливості ШІ-генерації і наразі використовується багатьма генераторами зображень та компаніями.

Цей охоплення призвело до комерційного розповсюдження. Моделі FLUX зараз використовуються в функціях генерації в Adobe Photoshop, Picsart та Hermes Agent від Nous Research, серед інших платформ. Компанія також згадує режисера Мартіна Скорсезе серед професійних користувачів.

Журнал Wired описав Black Forest Labs як відносно невелику компанію, яка, тим не менш, стала провідним конкурентом найбільших лабораторій ШІ Кремнієвої долини. Моделі FLUX посідають високі місця в бенчмарках зображень і стали одними з найбільш завантажуваних моделей “текст-до-зображення” на платформі спільноти розробників Hugging Face. Компанія стверджує, що зараз у ній працює команда зі 100 осіб у Фрайбурзі та Сан-Франциско.

FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev та пов’язані з ними моделі керування, випущені незабаром після запуску компанії, надали дослідникам та розробникам креативних інструментів доступ до завантажуваних контрольних точок, локального виведення та інтеграцій з такими фреймворками, як Hugging Face Diffusers та ComfyUI. Наприклад, FLUX.1 Kontext Dev був випущений як модель з відкритими вагами для досліджень та некомерційного використання, з дозволом на комерційне використання згенерованих результатів за відповідною ліцензією.

Компанія продовжила цю тенденцію з FLUX.2 Dev наприкінці 2025 року — модель з відкритими вагами та 32 мільярдами параметрів, що поєднує генерацію та редагування за кількома референсами. Black Forest Labs назвала її найпотужнішою на момент випуску моделлю генерації та редагування зображень з відкритими вагами, надавши ваги, референсний код виведення та оптимізовані реалізації для споживчих GPU Nvidia.

FLUX 3 Dev підвищує ставки в цій оцінці. Попередні версії Dev були моделями зображень. Ця ж описується як мультимодальне ядро, що охоплює прогнозування відео, аудіо, зображень та дій. Це означає, що одна ліцензія регулюватиме, чи може компанія локально розгорнути модель, яка стосується як виробництва контенту, так і фізичного обладнання. BFL ще не надала інформацію про свою ліцензію, кількість параметрів, квантування чи вимоги до обладнання.

Компанія розглядає відкриті ваги як функцію для підприємств, а не як жест на користь спільноти. Вона стверджує, що вони забезпечують безпечне розгортання з низькою затримкою для таких застосувань, як системи керування роботами, і дозволяють командам адаптувати FLUX 3 до власних даних, продуктів та робочих процесів.

Варто відзначити фінансову підтримку FLUX 3 поряд з технічними заявами. Оціночна вартість Black Forest Labs становить $3,25 мільярда, і компанія залучила понад $450 мільйонів від інвесторів, включаючи a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva та T.Capital від Deutsche Telekom.

Оригінал статті: venturebeat.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *