Перейти к содержанию
Публикация AiManual

Supra2-IMG: компактная text-to-image модель на 100M параметров. Обзор, локальный запуск и ограничения

SupraLabs выпустила Supra2-IMG: открытую DiT-модель на 100 млн параметров, которая генерирует изображения 256×256 и обучилась с нуля менее чем за 10 часов на од

Коротко

Что будет в материале

  1. 01

    Что такое Supra2-IMG и почему она привлекла внимание

  2. 02

    Как запустить Supra2-IMG локально: пошаговая инструкция

  3. 03

    Требования к железу и скорость генерации

  4. 04

    Качество генерации: что говорят примеры и заявление о SOTA

Supra2-IMG - открытая text-to-image модель на 100 млн параметров, построенная на архитектуре DiT (Diffusion Transformer). SupraLabs обучила её с нуля менее чем за 10 часов на одной GPU H100 в облаке Runpod и выложила веса вместе со скриптом инференса на Hugging Face, в репозитории SupraLabs/Supra2-IMG.

Модель генерирует изображения 256×256 и запускается локально: около 20 секунд на картинку на CPU и примерно 2 секунды на GPU. Для старта достаточно скачать inference.py и выполнить одну команду с параметрами prompt, seed, cfg, steps, n и out.

Заявленное качество - уровень SOTA для разрешения 256×256. Независимых бенчмарков в открытых материалах нет, поэтому проверять утверждение приходится глазами по опубликованным примерам: авторы настаивают, что не отбирали лучшие результаты, а сгенерировали все изображения при одинаковых настройках - seed 0, 50 шагов, cfg 3.0 (анонс релиза).

Что такое Supra2-IMG и почему она привлекла внимание

Это диффузионная модель генерации изображений по текстовому описанию. Внутри 100 млн параметров - по меркам 2026 года почти миниатюра, тогда как заметные text-to-image решения давно перешагнули миллиард. Архитектурный класс - DiT, то есть диффузия поверх трансформерного бэкбона, а не привычная UNet-схема.

Ключевая особенность релиза не в архитектуре, а в экономике обучения: одна GPU, меньше десяти часов, полностью с нуля. Такой бюджет делает эксперименты с text-to-image доступными небольшой команде или одиночному исследователю, а не только лаборатории с кластером.

Ключевые характеристики модели

ПараметрЗначение
РазработчикSupraLabs
Задачаtext-to-image
АрхитектураDiT (Diffusion Transformer)
Число параметров100 млн
Разрешение256×256
Обучениес нуля, менее 10 часов, одна GPU H100, Runpod
Заявленное качествоSOTA для 256×256 (утверждение авторов)
Скорость генерации~20 с на CPU, ~2 с на GPU (данные авторов)
Веса и скриптHugging Face, репозиторий SupraLabs/Supra2-IMG
Лицензияв доступных материалах не указана

Строки про лицензию, дату релиза и поддерживаемые форматы в исходном анонсе отсутствуют. Если планируете использовать веса в коммерческом продукте, эти пункты нужно уточнять в самом репозитории, а не по публикации.

Почему это интересно сообществу

Обучение на одной GPU за считанные часы снижает порог воспроизведения: чужой результат можно перепроверить, поменять датасет или часть архитектуры и снова прогнать эксперимент. Открытые веса позволяют изучать пайплайн изнутри, а не только отправлять запросы к закрытому API.

Второй момент - запуск без дискретной видеокарты. Модель на 100 млн параметров реально считает изображение на CPU, пусть и около 20 секунд на картинку. Для text-to-image это по-прежнему редкость: большинство открытых решений требуют GPU с заметным объёмом видеопамяти. Компактный размер также делает Supra2-IMG удобным учебным стендом: можно разобрать этапы денойзинга, сравнить влияние cfg и числа шагов, посмотреть, как ведёт себя DiT на малых данных.

Как запустить Supra2-IMG локально: пошаговая инструкция

Отдельного веб-интерфейса или готового приложения в материалах релиза нет. Сценарий один: скачать скрипт, выполнить команду в терминале, получить PNG-файл.

Скачивание и подготовка

Веса и inference.py лежат на Hugging Face в репозитории SupraLabs/Supra2-IMG. Для запуска достаточно скачать скрипт: в анонсе подготовка выглядит как создание рабочей папки и переход в неё.

mkdir Supra2-IMG
cd Supra2-IMG
# скачать inference.py из репозитория SupraLabs/Supra2-IMG на Hugging Face

Все остальные файлы модель подтянет сама при первом запуске. Дополнительных зависимостей авторы в публикации не перечисляют, поэтому сюрпризы на этом шаге возможны, и разумно смотреть README репозитория.

Параметры запуска и пример команды

Управление генерацией идёт через аргументы командной строки. Каждый отвечает за свой этап или формат вывода:

  • --prompt - текстовое описание того, что нужно нарисовать;
  • --seed - зерно генерации, фиксирует результат для повторяемости;
  • --cfg - масштаб classifier-free guidance, то есть насколько строго модель следует промпту;
  • --steps - число шагов денойзинга, влияет на детализацию и время генерации;
  • --n - сколько изображений сгенерировать за один прогон;
  • --out - имя выходного файла.

Рабочий пример из анонса:

python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

Значения seed 0, cfg 3.0 и steps 50 выбраны не случайно: именно с этими настройками авторы сгенерировали все опубликованные примеры, причём одинаково для каждого изображения. Если хотите сравнить свой результат с их картинками, начните с тех же чисел, а потом уже меняйте cfg и steps по вкусу.

Требования к железу и скорость генерации

H100 понадобилась для обучения, для инференса она не нужна. Заявленные авторами цифры выглядят так: около 20 секунд на изображение на CPU и примерно 2 секунды на GPU. Разница примерно в десять раз, и это ожидаемо для модели такого размера.

Запуск на CPU и GPU: чего ожидать

Обе оценки даны авторами без указания конкретных моделей процессора и видеокарты. Это значит, что на старом ноутбучном CPU 20 секунд легко превратятся в минуту, а на современном GPU с быстрой памятью результат может оказаться лучше заявленного. Единственный корректный способ узнать свою скорость - прогнать команду и замерить.

Требования к VRAM в материалах релиза не указаны. Логика подсказывает, что 100 млн параметров укладываются в скромный объём видеопамяти, но конкретные цифры авторы не приводили, поэтому обещать запуск на любой карте я не буду. Практический ориентир: если модель считает изображение на CPU, то дискретная GPU ей точно по силам.

Ограничение разрешения 256×256

Модель генерирует картинки только 256×256. По современным меркам это низкое разрешение: для превью, черновиков, мудбордов и демонстраций хватит, для печати или финальной графики нет. Информации об апскейле, тайлинге или дообучении на большем разрешении в анонсе нет, так что рассматривайте 256×256 как жёсткое ограничение версии, а не как временную настройку.

Качество генерации: что говорят примеры и заявление о SOTA

Формулировка «state-of-the-art quality» в публикации относится к разрешению 256×256. Она не подкреплена ни метриками вроде FID или CLIP score, ни сравнением с другими моделями в одинаковых условиях. Это утверждение разработчиков о собственном продукте.

Что означает «not cherry-picked» и почему это важно

Авторы прямо пишут, что примеры не отбирались: для всех изображений использовались одни и те же настройки - seed 0, 50 шагов, cfg 3.0. Такой подход убирает самый частый способ приукрасить релиз, когда в галерею попадают только удачные кадры из десятков прогонов.

Прозрачность в настройках не отменяет субъективности самой оценки. «Хорошо выглядит» у каждого своё, а подборка всё равно собирается человеком: он выбирает промпты, которые модель отрабатывает уверенно. Полноценная проверка требует прогнать свои промпты на своём железе и сравнить с тем, что уже есть под рукой.

Как интерпретировать заявление о SOTA

Заявление о SOTA стоит читать так: авторы считают результат на 256×256 competitively сильным для модели такого размера. Никаких независимых тестов, слепых сравнений или таблиц с конкурентами в предоставленных материалах нет. Если качество критично для задачи, ориентируйтесь на примеры в репозитории и на собственные прогоны, а не на прилагательное в заголовке.

Сравнение с другими text-to-image моделями

Прямое сравнение по метрикам провести не получится: для Supra2-IMG таких замеров нет. Зато можно сопоставить классы моделей по базовым параметрам, которые легко проверить.

Размер и требования к железу

Модель / семействоПорядок параметровТипичное разрешениеЛокальный запуск
Supra2-IMG100 млн256×256да, включая CPU
Stable Diffusion, SDXLмиллиарды512-1024да, нужна GPU с запасом VRAM
FLUXмиллиарды1024 и вышеда, требовательна к VRAM

Разница в порядке величин объясняет всё остальное: меньший размер даёт низкие требования к железу, быстрый инференс и возможность обучения на одной GPU. Обратная сторона - ограниченная ёмкость модели, которая напрямую влияет на детализацию и сложные сцены.

Разрешение и качество

Supra2-IMG уступает крупным моделям по разрешению почти в четыре раза, если сравнивать с 1024 пикселями. По качеству корректное сравнение невозможно: независимой оценки нет, а переносить чужие бенчмарки с больших моделей на эту нельзя. Модель решает другую задачу - быстрая генерация на слабом железе, а не замена продакшен-инструментов.

Кому и зачем нужна Supra2-IMG

Практическая ценность здесь не в максимальном качестве картинки, а в доступности технологии и возможности разобрать её по частям.

Для кого модель особенно полезна

  • Исследователи и студенты, которым нужно разобраться, как устроен DiT-пайплайн генерации изображений без аренды кластера.
  • Разработчики, которым нужна быстрая генерация превью прямо в коде и без обращений к внешним API.
  • Энтузиасты без мощной видеокарты: 100 млн параметров и работа на CPU делают локальный text-to-image реальным на обычном ноутбуке.
  • Команды, которым нужен дешёвый стенд для отработки пайплайнов: промпт-инжиниринг, автоматическое проставление seed, батч-генерация.

Когда лучше выбрать другую модель

Если нужен фотореализм, читаемый мелкий текст на картинке, разрешение 1024 и выше или стабильный результат в продакшене, Supra2-IMG не подойдёт. Задачи такого класса решают более крупные open-weight-модели, и переключаться на 100-миллионную модель ради экономии ресурсов в этом случае смысла нет. Разве что как на этапе прототипа, чтобы не гонять тяжёлые генерации на каждом шаге разработки.

Ограничения и что осталось за кадром

Отдельный раздел стоит посвятить не недостаткам архитектуры, а пробелам в информации о релизе.

Неизвестные параметры: лицензия, дата, форматы

В доступных материалах нет лицензии, точной даты релиза и полного списка поддерживаемых форматов и платформ. Для эксперимента дома это не критично, для коммерческого использования лицензия важна: от неё зависит, можно ли включать веса в продукт. Проверять нужно на странице репозитория, потому что анонсы часто обновляют уже после публикации.

Ограничения по качеству и разрешению

256×256, отсутствие независимо подтверждённых метрик и скорости, измеренные только авторами, - это осознанные компромиссы ради компактности. Модель не претендует на замену FLUX или SDXL и не позиционируется как таковая. Воспринимайте её как рабочий инструмент для экспериментов и обучения, где размер и скорость важнее пиксельной точности.

Итог: стоит ли пробовать Supra2-IMG

Краткое резюме

  • Supra2-IMG - открытая text-to-image модель на 100 млн параметров и архитектуре DiT, обученная с нуля менее чем за 10 часов на одной H100 в Runpod.
  • Запускается локально одной командой, около 20 секунд на CPU и примерно 2 секунды на GPU по данным авторов.
  • Разрешение ограничено 256×256, заявление о SOTA-качестве исходит от разработчиков и независимо не подтверждено.
  • Веса и скрипт inference.py доступны на Hugging Face в репозитории SupraLabs/Supra2-IMG.

Пробовать стоит, если вам интересна архитектура DiT, нужна быстрая генерация превью на недорогом железе или вы хотите воспроизвести обучение компактной модели собственными силами. Искать здесь продакшен-уровень графики не нужно: для этого есть более крупные модели. Самый короткий путь к решению - скачать скрипт, выполнить команду из примера и посмотреть на результат своими глазами.

Ссылки и ресурсы

Веса и скрипт: репозиторий SupraLabs/Supra2-IMG на Hugging Face. Обсуждение релиза, примеры генерации и детали обучения опубликованы в анонсе на Reddit. Авторы отдельно предлагают поделиться промптами, с которыми создавались примеры, и приглашают присылать обратную связь - если нужны исходные тексты запросов, их можно запросить прямо в той же ветке (источник).

Подписаться на канал