Что такое SenseNova-Vision-7B-MoT и зачем она нужна
SenseNova-Vision-7B-MoT - файнтюн модели Bagel от ByteDance. Это одна vision-language модель, которая закрывает сразу четыре задачи: детекцию объектов, распознавание текста (OCR), оценку глубины и сегментацию. У неё 14B общих параметров и 7B активных, то есть на каждом шаге инференса задействована примерно половина весов. Разбор релиза и ссылки на статью с README собраны в ветке r/LocalLLaMA.
Идея простая: вместо связки из трёх-четырёх специализированных сетей вы держите одну и прогоняете через неё все запросы по изображению. На практике это обещает меньше зависимостей, единый формат входа и одну точку обновления. Но именно на стыке обещания и реальности начинаются вопросы, и главный из них - запуск.
Разделение 14B на общие и 7B на активные параметры - наследие архитектуры Bagel, а не признак MoE в чистом виде. Механика активных параметров и то, как она отражается на требованиях к памяти, разобрана в материале про MoE-модели с 2B активных параметров и их поведение на GPU с 4-12 ГБ: активные веса определяют скорость, но не объём VRAM, потому что в памяти лежат все веса целиком.
Как устроен вывод: текст с координатами и генерируемые изображения
Модель отдаёт результаты в двух разных форматах. Детекция объектов и OCR приходят как обычный текст с координатами: боксы и рамки вокруг текста возвращаются числами в текстовом виде, например координатами углов. Глубина и маски возвращаются как изображения, которые модель генерирует.
Такой разброс означает, что после инференса нужны два разных постпроцессинга. Текстовый вывод придётся парсить: вытаскивать числа из ответа, приводить их к координатам, проверять, что модель не перепутала порядок цифр и не выдала бокс за пределами картинки. Графический вывод нужно переводить в тензоры: читать PNG, нормализовать значения, сопоставлять размеры с исходным изображением.
Специализированные модели глубины и сегментации обычно возвращают сразу массив чисел или бинарную маску в тех же координатах, что и вход. Здесь между вами и числом стоит шаг декодирования картинки. Плюс в том, что визуализация получается бесплатно: карту глубины можно посмотреть глазами и быстро понять, где модель наврала. Минус в лишнем слое кода и в потенциальных потерях при сжатии изображения.
Заявленные результаты: где модель выигрывает, а где уступает
Все цифры ниже взяты из статьи авторов и README, независимой проверки нет. Сравнение шло с конкретным набором моделей, который выбрали сами разработчики, поэтому первое место в таблице не означает первое место на рынке. Исходная публикация с результатами и обсуждением ограничений доступна здесь.
Детекция и OCR: первое место с оговорками
В статье модель занимает первое место по детекции объектов и OCR среди тех моделей, что попали в сравнение, с одной ничьей. Для практики это значит, что координаты боксов и текст она выдаёт достаточно точно, чтобы закрывать типовые задачи: разметка фотографий, поиск объектов на сцене, извлечение текста из скриншотов и документов.
Оговорок две. Первая - ограниченный список конкурентов: он собран авторами, а не независимой площадкой. Вторая - формат ответа. Текст с координатами удобно вставлять в LLM-пайплайн, поскольку модель сама текстовая, но неудобно сравнивать с готовыми детекторами, которые отдают тензоры. Если задача - отрисовать боксы поверх картинки, парсинг ответа добавляет код и точку отказа.
Глубина: обходит Depth Anything V2, но проигрывает MoGe-2
По глубине картина смешанная. SenseNova-Vision-7B-MoT превосходит Depth Anything V2 на всех наборах данных, которые использовали авторы, и при этом уступает MoGe-2 на большинстве из них. Заявление «лучшая модель глубины» не подтверждается, а заявление «лучше Depth Anything V2» - подтверждается.
Практический вывод: если в пайплайне стоит Depth Anything V2, замена на SenseNova может дать выигрыш в качестве. Если уже используется MoGe-2, менять нечего. И помните про формат: глубина приходит картинкой, а Depth Anything V2 и MoGe-2 отдают числовые карты, которые дальше идут в 3D-пайплайн без декодирования.
Сегментация: специализированные модели всё ещё впереди
В большинстве тестов на маски выигрывают специализированные модели сегментации. SenseNova-Vision-7B-MoT проигрывает им, хотя и умеет отдавать маски как изображения. Если сегментация - основная задача проекта, брать универсальную модель вместо профильной нет смысла: качество ниже, а инфраструктурных сложностей больше.
| Задача | Формат вывода | Позиция на фоне специализированных моделей |
|---|---|---|
| Детекция объектов | Текст с координатами | Первое место среди моделей из статьи, одна ничья |
| OCR | Текст с координатами | Первое место там же, с теми же оговорками |
| Оценка глубины | Генерируемое изображение | Лучше Depth Anything V2 на всех наборах, хуже MoGe-2 на большинстве |
| Сегментация | Генерируемое изображение | Специализированные модели выигрывают большинство тестов на маски |
Запуск локально: почему это главная проблема
Самое слабое место модели - не качество, а возможность её запустить. В README указана единственная проверенная конфигурация: одна A800 с 80 ГБ видеопамяти. Карты меньшего объёма полноценно не валидировались, и это честно зафиксировано в документации. В обсуждении релиза отдельно отмечено, что GGUF нет, а llama.cpp не умеет загружать Bagel.
Требования к VRAM и почему 24 ГБ может не хватить
14B общих параметров при 7B активных звучит обнадёживающе, но активные параметры определяют скорость, а не объём памяти. В памяти должны лежать все веса, а это уже про 14B и больше. Архитектура Bagel работает не только с текстом: она принимает изображение, кодирует его и генерирует картинку на выходе для глубины и масок. Визуальный энкодер, декодер изображений и промежуточные активации съедают дополнительную память, которую не видно по числу параметров.
На 24 ГБ VRAM запуск не подтверждён. Это не значит, что он невозможен: значит, что авторы не показали ни конфигурацию, ни замеры. Ориентироваться на 80 ГБ как на документированный минимум - единственный безопасный вариант, если планируется развёртывание. Прикидки по памяти для локальных моделей и таблицы требований к железу собраны в разборе про 9B-модели на 8 ГБ VRAM и 16 ГБ ОЗУ, хотя там речь о текстовых моделях, где картина предсказуемее.
Отсутствие GGUF и поддержки в llama.cpp
GGUF-версии нет. llama.cpp пока не умеет загружать Bagel. Эти два факта отрезают привычный путь запуска: llama.cpp, Ollama и инструменты, построенные вокруг GGUF, модель не подхватят. Остаётся оригинальный код и, скорее всего, Python-скрипты с ручной установкой зависимостей, что заметно поднимает порог входа.
Ситуация не уникальна: новые архитектуры отстают от инструментов на несколько недель или месяцев, и появление поддержки в llama.cpp обычно зависит от того, насколько активно сообщество портирует архитектуру. Свежие open-weights релизы 2026 года и скорость, с которой они получают поддержку в популярных раннерах, разобраны в обзоре про карусель открытых весов.
Лицензия: некоммерческие веса при Apache 2.0 у Bagel
Веса SenseNova-Vision-7B-MoT распространяются по некоммерческой лицензии. Базовая модель Bagel от ByteDance при этом идёт под Apache 2.0. Разница принципиальная: Apache 2.0 разрешает коммерческое использование, а лицензия файнтюна - нет.
Для команд это развилка. Если продукт коммерческий, придётся либо получать отдельное разрешение у правообладателя весов, либо оставаться на базовом Bagel и терять то, ради чего делался файнтюн: натренированные навыки детекции, OCR, глубины и сегментации в одном чекпоинте. Вариант «возьму Bagel и дообучу сам» существует, но это уже отдельный проект с собственными затратами на данные и вычисления.
Практическая ценность: одна модель против набора специализированных
Здесь всё зависит от того, что у вас уже есть в продакшене или в прототипе.
Когда одна модель действительно удобна
- Вы прототипируете мультимодальное приложение и не хотите тянуть три-четыре зависимости с разными форматами входов.
- Основные задачи - детекция и OCR, а глубина и маски нужны эпизодически.
- Есть доступ к GPU на 80 ГБ, своей или арендованной.
- Некоммерческая лицензия подходит: внутренние исследования, пет-проекты, учебные задачи.
Если совпадают три пункта из четырёх, модель стоит попробовать: один чекпоинт вместо трёх упрощает логирование, версионирование и обновления. Компромиссы универсальных моделей в узких задачах хорошо видны на примере компактных моделей на 7B для локального запуска.
Когда лучше оставить специализированные решения
- Качество сегментации критично: профильные модели выигрывают большинство тестов на маски, у SAM-подобных решений больше готовых интеграций.
- Нужна лучшая глубина: MoGe-2 обходит SenseNova на большинстве наборов, а Depth Anything V2 проще встроить, если важен числовой формат вывода.
- У вас 24 ГБ VRAM и меньше: запуск не подтверждён, GGUF отсутствует.
- Продукт коммерческий: некоммерческая лицензия весов закрывает вопрос сразу.
- Пайплайн уже работает: если связка Depth Anything + SAM + небольшая VLM отлажена, переход даст мало выигрыша и много работы.
Стоимость владения стоит считать не по числу моделей, а по числу незакрытых вопросов. Три отлаженных специализированных инструмента предсказуемее одного нового, у которого документирован только запуск на A800.
Итог: кому подходит SenseNova-Vision-7B-MoT
Модель интересна как демонстрация подхода «один чекпоинт на четыре задачи с разными форматами вывода». Заявленные результаты по детекции и OCR убедительны в рамках выбранного набора конкурентов; по глубине она обходит Depth Anything V2, но уступает MoGe-2; по маскам проигрывает профильным моделям сегментации.
Для практики сейчас есть три барьера: единственная протестированная конфигурация - A800 на 80 ГБ, GGUF отсутствует, llama.cpp не грузит Bagel. Добавьте некоммерческую лицензию весов. Получается, что для энтузиаста с мощной GPU и некоммерческой задачей модель - рабочий вариант, а для продукта на потребительском железе - пока нет.
Разумный сценарий: следить за появлением GGUF и поддержки в llama.cpp, а до этого держать рабочую связку из специализированных моделей. Если универсальность нужна прямо сейчас, смотрите на релизы, где запуск уже налажен, а не на перспективные архитектуры без квантованных сборок.
Вопрос к вам: если бы GGUF-сборка позволила запустить SenseNova-Vision-7B-MoT на 24 ГБ VRAM, вы бы взяли одну модель для всех четырёх задач или оставили Depth Anything, SAM и небольшую VLM по отдельности?