Перейти к содержанию
Публикация AiManual

FLUX 3 Action от BFL: что известно о новой 7B-модели для роботов

Black Forest Labs выпустила FLUX 3 Action, 7B-модель для управления действиями роботов. Собрали подтверждённые факты, технический контекст VLA-подходов, ориенти

Коротко

Что будет в материале

  1. 01

    Что такое FLUX 3 Action и что подтверждено официально

  2. 02

    Зачем генеративной AI-компании модель для роботов

  3. 03

    Как FLUX 3 Action соотносится с существующими подходами к управлению роботами

  4. 04

    Можно ли запустить FLUX 3 Action локально и какие требования к VRAM

Что такое FLUX 3 Action и что подтверждено официально

FLUX 3 Action: модель от Black Forest Labs (BFL) с 7 млрд параметров, заявленная для робототехники. О выпуске сообщило сообщество r/LocalLLaMA (публикация о релизе), страница продукта - bfl.ai/models/flux-3-action. Остальное пока неизвестно: в доступных материалах нет ни схемы архитектуры, ни описания обучающих данных, ни списка поддерживаемых ускорителей, ни условий лицензии.

Практический вывод для читателя простой. Сравнивать FLUX 3 Action с чем-либо прямо сейчас не получится: нет ни бенчмарков, ни заявленных требований к памяти, ни примеров кода. Таблицы вида «FLUX 3 Action против конкурентов», которые могут появиться в первые дни, будут построены на догадках о внутреннем устройстве модели.

Ключевые факты о FLUX 3 Action

  • Разработчик: Black Forest Labs (BFL).
  • Название: FLUX 3 Action.
  • Размер: 7 млрд параметров.
  • Назначение: робототехника, работа с действиями роботов.
  • Семейство: FLUX.
  • Страница продукта: bfl.ai/models/flux-3-action.

Список короткий, и это честная картина на 23 сентября 2026 года, а не недоработка. Цены, даты полного релиза, требования к железу и данные о качестве работы в материалах отсутствуют. Всё, что выходит за рамки этих шести пунктов, - версии.

Чем FLUX 3 Action отличается от генеративных FLUX

Линейку FLUX знают по моделям, которые рисуют и редактируют изображения: текст на входе, картинка на выходе. FLUX 3 Action меняет домен задачи. Вместо пикселей на выходе должно быть действие: управляющий сигнал для манипулятора или мобильной платформы, который переводит сцену из текущего состояния в нужное.

Это отдельная ветка семейства, и логика «то же имя, значит внутри то же самое» здесь не работает. Генерация изображения и генерация действия опираются на разные данные и оцениваются по разным метрикам: сходство картинки против успешности выполнения задачи в физическом мире. Насколько глубоко BFL переиспользовала наработки основной линейки, не сообщается.

Держать в голове скорость, с которой анонсы обрастают версиями, полезно: разбор анонса бывшего руководителя Qwen показал, сколько трактовок появляется вокруг одного поста без технических деталей. С FLUX 3 Action ситуация похожая, поэтому дальше речь идёт только о проверяемых данных.

Зачем генеративной AI-компании модель для роботов

Для команд, которые выросли на генеративном AI, робототехника выглядит логичным следующим рынком. Генерация изображений превратилась в плотную конкуренцию: много сильных открытых моделей, дешёвый инференс, давление на цену за картинку. Роботы предлагают другую экономику, где заказчик платит за работающее решение, а не за токены.

Судя по позиционированию, BFL переносит экспертизу в обучении больших генеративных моделей в область управления действиями. Общего между задачами больше, чем кажется: и там и там модель учится на больших массивах данных предсказывать целевую последовательность, будь то визуальные токены или траектория движения.

7B для робота - умеренный размер по меркам современных мультимодальных моделей. Вероятная причина в том, что таким сетям часто приходится работать рядом с железом: на бортовом компьютере, где важны миллисекунды задержки и энергопотребление. Держать в облаке модель, которая управляет движением, рискованно даже при хорошем канале связи. Это гипотеза о мотивах, а не заявление BFL: официальных данных о целевых платформах и задержках нет.

Как FLUX 3 Action соотносится с существующими подходами к управлению роботами

Исторически робота учили двигаться тремя путями: классическое планирование с ручной настройкой контроллеров, обучение с подражания (imitation learning) по демонстрациям оператора и обучение с подкреплением (reinforcement learning) в симуляторе с переносом политики на реальное железо. У каждого подхода своя инфраструктура: сбор демонстраций, проектирование наград, настройка симулятора под реальность.

VLA-модели: что это и почему о них говорят

VLA расшифровывается как vision-language-action: зрение, язык, действие. Модель получает изображение с камеры и текстовую инструкцию, например «возьми красную кружку», а на выходе формирует действие: положение схвата, углы суставов, команду захвата. Смысл подхода в том, что одна сеть связывает восприятие, понимание языка и моторику, поэтому робота не нужно отдельно программировать под каждую новую задачу.

К этому классу относят, среди других, RT-2 от Google DeepMind и открытую OpenVLA. У направления есть известные слабые места: задержка между наблюдением и действием, чувствительность к смене освещения и расположению объектов, потребность в больших объёмах демонстраций. FLUX 3 Action, судя по названию и позиционированию, относится к тому же классу задач, но подтверждений архитектуры нет, поэтому сравнивать её с конкретными VLA-моделями пока нельзя.

Чем 7B-модель для роботов отличается от 7B-LLM

7 млрд параметров говорят только о размере. LLM предсказывает следующий токен текста, модель для робота предсказывает действие в физическом мире. Отсюда другой набор требований: устойчивость к шуму сенсоров, предсказуемое время отклика, безопасное поведение при неуверенности. Ошибка в токене стоит одного неудачного абзаца, ошибка в действии - повреждённого оборудования или травмы.

Для управления движением часто выбирают компромисс: сеть меньше, зато с гарантированной задержкой и понятным поведением на границах. 7B подходит на роль такого компромисса, если удаётся уложиться в бюджет времени на бортовом железе. Это общее соображение о классе задач, а не измеренная характеристика FLUX 3 Action.

Можно ли запустить FLUX 3 Action локально и какие требования к VRAM

Прямой ответ: неизвестно. Ни доступность весов, ни поддерживаемые фреймворки, ни требования к памяти в материалах о релизе не упоминаются. Решать, держать модель на бортовом компьютере или обращаться к облаку, считать в FP16 или в 4 битах, придётся после публикации карточки модели и лицензии.

Прикинуть порядок цифр заранее можно. Для 7B-модели ориентиры по памяти такие.

ТочностьОриентир по VRAM под весаКомментарий
FP16 / BF16около 14-16 ГБПолная точность, практический минимум для карт на 16 ГБ и выше, нужен запас на активации
INT8примерно 7-9 ГБКомпромисс между качеством и памятью, подходит многим потребительским GPU
INT4около 4-6 ГБСамый экономный вариант, но качество на задачах управления может просесть

Это общие оценки для моделей такого размера, а не официальные требования FLUX 3 Action. К ним нужен запас: если модель обрабатывает кадры с камеры, к весам добавляется визуальный энкодер и память под визуальные токены, а при параллельной работе растёт KV-кэш. Для управления роботом важна и пропускная способность памяти: чем быстрее карта отдаёт данные, тем короче путь от кадра до действия. На слабой GPU модель может запуститься, но не уложиться в темп, который нужен желез��.

Ещё один фактор - скорость доступа к самой модели. Локальный запуск развивается потому, что зависимость от чужого API стоит денег и создаёт риски: разбор тренда на локальные AI-модели показывает, какие расчёты заставляют команды уходить от подписок.

Что нужно проверить на официальной странице модели

  • Веса: открытая загрузка, доступ по запросу или только облачный API.
  • Лицензия: разрешено ли коммерческое использование, что с производными моделями и обучением на выходах.
  • Железо: список поддерживаемых GPU, наличие сборок под edge-платформы, минимальный объём памяти, ориентиры по задержке.
  • Фреймворки: PyTorch, ONNX, готовые обвязки для робототехнических платформ.
  • Данные: доля симуляции в обучении, наборы реальных демонстраций, заявленные домены задач.
  • Код: референсный инференс, чекпоинты, форматы квантизации.

Открытые вопросы: лицензия, веса, данные и железо

  • Лицензия. От неё зависит, можно ли встроить модель в коммерческого робота или она останется инструментом для лабораторий. Для железных продуктов этот пункт решает больше, чем место в рейтинге на бенчмарке.
  • Доступность весов. Открытая загрузка означает, что модель можно запустить на своём железе или дообучить под свою задачу. Закрытые веса оставляют только облачный API с оплатой за вызовы.
  • Обучающие данные. Соотношение симуляции и реальных демонстраций определяет, насколько модель обобщает на новую обстановку и объекты, которых не было в обучении.
  • Поддерживаемое железо. Список GPU и edge-платформ покажет, реально ли ставить модель на борт робота и какой отклик она даёт.
  • Границы применимости. Исследовательская демонстрация и рабочий инструмент - разные вещи. Без данных о поведении модели на длинных сценариях и при отказах сенсоров говорить о промышленном использовании нечего.

Неопределённость на старте - обычный сюжет для AI-новостей, и разбирать её стоит по подтверждённым фактам. Как это выглядит на другом примере, показывает материал о Qwen3.8-Flash-Next: там тоже приходится отделять архитектурные идеи, которые модели приписывают, от того, что подтверждено.

Практическая применимость: кому и зачем это нужно уже сейчас

Исследователи робототехники и VLA-моделей: повод присмотреться. Модель от команды с сильной репутацией в генеративном AI расширяет список архитектур, которые можно будет сравнивать, как только появится техдок или веса.

Разработчики AI-продуктов: решений пока принимать не из чего. Нет лицензии, нет цен на API, нет данных о качестве. Планировать интеграцию на этой стадии означает поставить в роадмап пункт с неизвестной длительностью и неизвестным железом.

Энтузиасты локальных моделей: тему стоит держать в закладках. Ключевые вопросы - появятся ли веса и влезет ли модель в 16 или 24 ГБ видеопамяти, а также останется ли она работоспособной в 4-битной квантизации.

Предприниматели в робототехнике: сигнал о том, что крупные AI-команды смотрят в сторону физического мира. Это влияет на выбор стека, потому что через несколько лет выбор VLA-модели может стать таким же рутинным пунктом, как сегодня выбор LLM.

Общее правило одно: без деталей об архитектуре и лицензии говорить о практическом применении преждевременно, и никакие громкие формулировки в пресс-релизах этого не меняют.

Что это значит для читателей AI-Manual

FLUX 3 Action - пример того, как компании, известные генерацией контента, выходят за пределы текста и изображений в физический мир. Тренд касается не только робототехников: такие модели будут требовать локального инференса, памяти и быстрых GPU, а это ровно те темы, которые разбирает AI-Manual.

Что делать сейчас, до появления деталей:

  1. Добавить в закладки страницу bfl.ai/models/flux-3-action и проверять её на появление весов, лицензии и требований к железу.
  2. Оценивать релиз по понятным критериям, а не по хайпу: чек-лист для оценки новых AI-моделей помогает отделить заявленное качество от проверяемого.
  3. Заранее прикинуть своё железо: для 7B-модели в FP16 нужен ориентир в 14-16 ГБ VRAM, в INT8 - около 7-9 ГБ, в INT4 - примерно 4-6 ГБ.
  4. Не перестраивать рабочие процессы, пока нет ответов по лицензии, весам и задержке на кадр.

Итог простой: ставить FLUX 3 Action в продуктовые планы рано, а вот держать тему на радаре стоит. Как только появится карточка модели, решающими станут три цифры: объём памяти под инференс, задержка на кадр и условия лицензии.

Подписаться на канал