Перейти к содержанию
Публикация AiManual

Cosmos3 64B INT4: локальная генерация изображений и видео на CUDA и Apple Silicon

Разбираем, что известно о Cosmos3 64B INT4 для локальной генерации изображений и видео: требования к VRAM, запуск через CUDA и MLX, возможности Apple Silicon и

Коротко

Что будет в материале

  1. 01

    Cosmos3 64B INT4: что известно о локальной генерации изображений и видео

  2. 02

    Что означает INT4 для Cosmos3 64B и требований к VRAM

  3. 03

    Cosmos3 64B INT4: CUDA, MLX и Apple Silicon

  4. 04

    Как получить код и веса Cosmos3 64B INT4

Cosmos3 64B INT4: что известно о локальной генерации изображений и видео

Cosmos3 64B INT4 описывается как квантованная версия модели с 64 млрд параметров для локальной генерации изображений и видео. Для нее заявлены две аппаратные ветки: CUDA для видеокарт NVIDIA и MLX для компьютеров на Apple Silicon.

Короткий вывод такой: Cosmos3 64B INT4 может представлять интерес для владельцев систем с большим запасом VRAM или унифицированной памяти, но подтвержденных требований, универсального бенчмарка и полной инструкции для всех конфигураций пока недостаточно. В описании проекта упоминаются код на GitHub и веса INT4 на Hugging Face, однако конкретную версию репозитория, совместимый загрузчик и параметры тестов нужно проверять перед установкой.

Наблюдение о генерации одного клипа примерно за 5 минут на Mac с M4 Max и 128 ГБ памяти показывает потенциал локального запуска, но не дает универсальной оценки скорости. Без разрешения, длительности ролика, числа кадров и количества шагов этот результат нельзя напрямую переносить на другой Mac, NVIDIA GPU или облачный сервис вроде Grok.

Короткий ответ: что дает версия 64B INT4

INT4 хранит каждый параметр с разрядностью 4 бита. Для 64 млрд параметров простой расчет дает около 32 млрд байт, то есть примерно 32 ГБ в десятичном исчислении. Это теоретический объем самих упакованных значений без метаданных, масштабов квантования, служебных структур и дополнительных компонентов пайплайна.

Для сравнения, тот же набор параметров в FP16 потребовал бы около 128 ГБ только под значения весов. Квантование делает хранение и загрузку модели доступнее, но 64B-модель все равно остается крупной системой. Размер файла нельзя принимать за точный бюджет VRAM или оперативной памяти.

Во время генерации нужны активации, временные буферы, память загрузчика, компоненты обработки текста и изображения, а для видео еще и ресурсы под последовательность кадров. Фактический расход зависит от разрешения, длины клипа, количества кадров, batch size, числа шагов, режима offload и конкретного backend.

Что подтверждено, а что пока требует проверки

Сведения о Cosmos3 64B INT4 удобно разделить на несколько уровней достоверности:

  • Описание проекта. Сообщается о квантованных весах INT4, локальной генерации изображений и видео, поддержке CUDA и MLX, коде на GitHub и публикации весов на Hugging Face.
  • README и model card. Эти материалы должны подтвердить версии библиотек, команды запуска, формат тензоров, лицензию, требования к памяти и список поддерживаемых устройств. Без проверки конкретного commit наличие названия модели еще не подтверждает готовность сборки.
  • Практические тесты. Наблюдение о клипе за 5 минут на M4 Max с 128 ГБ памяти относится к отдельной конфигурации. Параметры клипа и режим измерения не указаны, поэтому результат нельзя считать полноценным сравнительным тестом.

Экспериментальный запуск DLSS 5 на MacBook Pro с M5 Pro относится к другой нейросетевой системе. В нем сообщалось примерно о 2,32 FPS и около 240 мс инференса при разрешении 1440p, но эти показатели ничего не доказывают о совместимости или скорости Cosmos3. У моделей, backend и вычислительных графов разные требования.

Что означает INT4 для Cosmos3 64B и требований к VRAM

INT4 - это размер весов, а не полный бюджет памяти

Квантование уменьшает разрядность весов. При INT4 четыре бита приходится на один параметр, поэтому теоретический объем весов в четыре раза меньше, чем у FP16. На практике файл может занимать больше расчетных 32 ГБ из-за групповых масштабов, таблиц, выравнивания, упаковки и нескольких файлов-шардов.

Инференс требует дополнительных областей памяти. В них попадают:

  • активации промежуточных слоев;
  • временные буферы операций квантования и деквантования;
  • память текстового энкодера и компонентов обработки изображения, если они входят в пайплайн;
  • латенты, карты признаков и тензоры кадров;
  • служебная память PyTorch, MLX или другого загрузчика;
  • буферы для offload между GPU, CPU и unified memory.

Видео увеличивает нагрузку на память по мере роста разрешения, длительности и количества кадров. Сценарий с коротким клипом и небольшой картинкой может потреблять заметно меньше ресурсов, чем генерация длинной последовательности в высоком разрешении. Точное поведение зависит от архитектуры Cosmos3 и конкретного кода загрузки.

Для оценки крупных квантованных моделей полезно разделять размер весов, пиковое потребление памяти и скорость после загрузки. Такой подход подробно разобран в материале о расчете веса и требований Hy4-preview.

Почему требования нельзя свести к одной цифре

Запись «64B INT4» не сообщает, сколько памяти понадобится конкретной системе. Для этого нужны как минимум размер файлов, формат квантования, типы вспомогательных тензоров, способ загрузки и параметры генерации.

Перед запуском нужно проверить:

  • полный размер всех файлов весов, а не только размер первого шарда;
  • пиковое потребление памяти во время загрузки и генерации;
  • поддерживает ли загрузчик CPU offload, GPU offload или смешанный режим;
  • какие компоненты остаются в FP16, BF16 или другом формате;
  • как разрешение изображения и длина видео меняют объем активаций;
  • сколько памяти требуется системе и другим приложениям.

На NVIDIA VRAM обычно представляет отдельный ограниченный ресурс. На Apple Silicon CPU и GPU используют общую unified memory, поэтому объем, занятый macOS и приложениями, уменьшает доступный запас для модели. Mac с 128 ГБ памяти дает больше пространства для эксперимента, но сам объем памяти не гарантирует высокую скорость.

Cosmos3 64B INT4: CUDA, MLX и Apple Silicon

Ветка CUDA для NVIDIA

Для CUDA нужно сверить версию драйвера, совместимость CUDA runtime, используемый фреймворк и поддержку архитектуры конкретной видеокарты. Отдельная проверка нужна для INT4-ядер: загрузчик может поддерживать сам формат весов, но не иметь эффективных ядер для каждой GPU.

Практический список проверок включает:

  • модель NVIDIA GPU и доступный объем VRAM;
  • версию драйвера и CUDA, указанную в README;
  • версию PyTorch или другого фреймворка;
  • поддерживаемый формат квантования и типы тензоров;
  • возможность перенести часть вычислений в системную память;
  • ограничения по разрешению, числу кадров и batch size.

Минимальную модель видеокарты нельзя назвать без фактического теста разработчиков. Даже одинаковый объем VRAM дает разный результат при разной пропускной способности памяти и разной поддержке квантованных операций. Методика проверки VRAM, KV cache и времени отдельных стадий хорошо видна в разборе локального запуска Qwen на NVIDIA, хотя переносить его цифры на Cosmos3 нельзя.

Ветка MLX для Apple Silicon

MLX создан для работы с чипами Apple и использует их unified memory. Вычисления могут распределяться между CPU и GPU через стек Apple, а конкретное поведение зависит от версии macOS, поколения чипа, объема памяти и кода модели.

Поддержка MLX дает отдельный путь запуска, а не универсальный пропуск для любого Mac. Система с небольшим объемом unified memory может не загрузить 64B-веса вместе с рабочими буферами. Более мощный чип с большим запасом памяти может запустить тот же пайплайн, но скорость все равно будет зависеть от MLX-ядер, memory bandwidth и количества операций, которые удалось выполнить на GPU.

Наблюдение на M4 Max с 128 ГБ памяти полезно как ориентир для верхнего сегмента Mac, но не описывает поведение M1, M2, M3, M4 или будущих конфигураций в целом. Даже два устройства с одинаковым чипом могут показать разное время первого запуска из-за прогрева, свободной памяти и настроек загрузчика.

Совместимость не равна производительности

Одна и та же INT4-модель может вести себя по-разному на CUDA и MLX. На результат влияют ядра деквантования, порядок операций, пропускная способность памяти, перенос тензоров между устройствами и наличие offload.

Нужно разделять три вопроса:

  • загружаются ли веса без ошибок;
  • получается ли приемлемое изображение или видео;
  • сколько времени и памяти требует один результат.

Эксперимент с DLSS 5 на M5 Pro нельзя использовать как доказательство производительности MLX для Cosmos3. У этих систем разные модели, графы вычислений и режимы обработки данных.

Как получить код и веса Cosmos3 64B INT4

Что проверить в GitHub-репозитории

Начинать нужно с репозитория, который указан в исходном описании Cosmos3. Название проекта и наличие файлов еще не доказывают, что сборка готова для повседневного запуска.

В README следует найти:

  • поддерживаемые backend, включая отдельные инструкции для CUDA и MLX;
  • точные версии Python, PyTorch, MLX и других библиотек;
  • способ загрузки INT4-весов;
  • команды подготовки окружения и запуска короткого теста;
  • ограничения по памяти, разрешению и длительности видео;
  • известные ошибки и открытые issues;
  • дату последнего обновления и рекомендуемый commit.

Если инструкция ссылается на старый формат весов, пример может перестать работать после обновления кода. Для воспроизводимости нужно зафиксировать commit репозитория и версии зависимостей.

Что проверить на Hugging Face

На странице модели нужно сопоставить название организации, имя репозитория и версию кода. Особое внимание стоит уделить следующим пунктам:

  • размеру и количеству файлов-шардов;
  • формату тензоров и способу упаковки INT4;
  • наличию конфигурации модели и tokenizer-файлов;
  • совместимости с загрузчиком из README;
  • лицензии и ограничениям использования;
  • дате обновления model card и идентификатору commit.

INT4-веса могут требовать специального загрузчика. Файл, который выглядит как обычная модель, не обязательно загрузится через универсальный pipeline. Несовпадение конфигурации, имен тензоров или формата шардов часто приводит к ошибке еще до начала генерации.

Минимальный чек-лист перед запуском

  1. Проверить точный репозиторий и актуальный commit.
  2. Сверить README с model card и убедиться, что код и веса рассчитаны друг на друга.
  3. Посчитать свободную VRAM или unified memory с запасом под macOS, драйвер и рабочие буферы.
  4. Освободить дополнительное дисковое пространство под загрузку, распаковку и временные файлы.
  5. Проверить версии драйвера NVIDIA или macOS, а затем установить нужный CUDA или MLX backend.
  6. Проверить лицензию и ограничения на использование модели.
  7. Запустить короткий тест с небольшим разрешением и ограниченным числом кадров.
  8. Зафиксировать время загрузки, пиковую память и чистое время генерации.

Команды запуска стоит брать из фактического README. Без проверенной инструкции безопаснее описывать порядок действий, а не подставлять предположительные параметры командной строки.

Практическая скорость: что означает клип за 5 минут на M4 Max с 128 ГБ памяти

Почему пять минут нельзя считать универсальной скоростью

Фраза «клип за 5 минут» не описывает полноценный бенчмарк. Неизвестны разрешение, длина видео, частота кадров, число итераций, размер исходного изображения, версия MLX и режим использования unified memory.

На результат могут повлиять:

  • время первой загрузки весов и компиляции ядер;
  • прогрев кэшей;
  • число кадров и их разрешение;
  • количество шагов генерации;
  • precision отдельных компонентов;
  • перенос части вычислений в CPU;
  • загрузка памяти другими приложениями;
  • запись готовых кадров на диск.

Чистое время инференса может сильно отличаться от времени, которое пользователь ждет до готового файла. Для первого запуска нужно отдельно учитывать скачивание, загрузку весов, подготовку графа и запись результата.

Как оформить воспроизводимое сравнение

Сравнение Cosmos3 на Mac и NVIDIA имеет смысл только при фиксированных параметрах. В отчет нужно включить аппаратную конфигурацию, версии программ и настройки генерации.

ПараметрЧто зафиксироватьЗачем это нужно
УстройствоM4 Max с объемом unified memory или точная модель NVIDIA GPU с объемом VRAMПоказывает вычислительный ресурс и доступный запас памяти
BackendMLX, CUDA и версии библиотекРазные ядра дают разную скорость даже на похожем железе
ГенерацияРазрешение, длина клипа, FPS и число кадровОпределяет объем промежуточных тензоров и общий объем работы
Параметры моделиЧисло шагов, seed, guidance и precisionПозволяет повторить тот же сценарий
ВремяЗагрузка, первый прогон, повторный прогон и чистый инференсРазделяет стартовые накладные расходы и скорость генерации
ПамятьПиковое потребление VRAM или unified memoryПоказывает, хватит ли ресурса для более тяжелого сценария

Для Apple Silicon полезно отдельно записывать поведение первого и повторного запуска. Практические нюансы измерения streaming-инференса на Mac разобраны в материале о сравнении моделей в streaming-режиме; его методику фиксации параметров можно применить как ориентир, но не как источник цифр для Cosmos3.

Cosmos3 64B INT4 и Grok: что можно сравнить корректно

Локальная модель и облачный сервис решают разные задачи

Сравнивать Cosmos3 64B INT4 с Grok нужно после уточнения конкретного продукта, режима и версии. Одного названия Grok недостаточно: разные режимы могут использовать разные ограничения, настройки и модели генерации.

Локальный запуск дает контроль над файлами, настройками и местом обработки данных. Пользователь сам отвечает за оборудование, обновление зависимостей, хранение весов и диагностику ошибок. Облачный сервис снимает часть нагрузки с локального железа, но требует доступности сервиса и не дает такого же контроля над вычислительным пайплайном.

Для сравнения нужно заранее определить, что важнее в конкретной задаче: приватность исходных данных, скорость получения результата, стоимость одного клипа, повторяемость, контроль параметров или возможность работать без внешнего сервиса. У Cosmos3 локальность выступает свойством всей системы, а не только самой модели.

Какие метрики использовать для сравнения

Корректный тест должен использовать одинаковые промпты, близкое разрешение, сопоставимую длину ролика и одинаковые критерии приемки. Субъективное впечатление от одного удачного клипа не заменяет серию повторных запусков.

  • Следование промпту. Сохраняются ли нужные объекты, действия, стиль и композиция.
  • Временная связность. Не меняются ли лицо, форма объекта и фон между кадрами.
  • Артефакты. Нужно фиксировать мерцание, деформации, разрывы движения и ошибки анатомии.
  • Стабильность. Повторяется ли качество при нескольких seed и перезапусках.
  • Скорость. Отдельно считать загрузку, первый результат и повторную генерацию.
  • Стоимость. Для локального запуска учитывать электроэнергию, амортизацию оборудования и время оператора, для сервиса - актуальную цену конкретного режима.
  • Управляемость. Проверять доступные параметры, контроль кадров и возможность встроить генерацию в свой пайплайн.

Пока нет одинакового тестового протокола, вывод «Cosmos3 лучше Grok» будет неподтвержденным. Корректнее говорить, какой вариант подходит для локальной обработки, а какой удобнее для быстрого получения результата в конкретном сценарии.

Ограничения Cosmos3 64B INT4 и кому подходит локальный запуск

Кому есть смысл пробовать Cosmos3 64B INT4

Эксперимент имеет смысл для пользователей, у которых есть заметный запас VRAM или unified memory и готовность самостоятельно настраивать окружение. В эту группу входят:

  • владельцы мощных NVIDIA-систем с поддерживаемым CUDA backend;
  • пользователи Mac с большим объемом unified memory;
  • разработчики, знакомые с MLX, Metal, CUDA и загрузчиками квантованных моделей;
  • исследователи локальной генерации изображений и видео;
  • команды, которым нужен контроль над данными и локальным пайплайном;
  • энтузиасты, готовые проверять совместимость, качество и скорость на своей конфигурации.

Главная ценность такого запуска состоит в возможности изучить крупную модель локально и проверить, насколько INT4 и аппаратный backend меняют практический порог входа. Это исследовательский сценарий, пока не опубликованы полные требования и воспроизводимые тесты.

Кому лучше подождать

Cosmos3 64B INT4 в текущем описании не подходит для ожидания запуска одной кнопкой. Осторожный подход нужен пользователям, у которых:

  • нет запаса памяти после загрузки весов и рабочих буферов;
  • нужен стабильный продакшен-пайплайн с зафиксированными версиями;
  • нет возможности самостоятельно читать README, model card и issues;
  • критична предсказуемая скорость каждого результата;
  • нужно сразу сравнить систему с облачным сервисом по прозрачным метрикам.

Квантование может менять качество, скорость и поведение отдельных операций. Конкретный эффект зависит от метода квантизации и загрузчика, поэтому его нужно измерять на реальных промптах, а не выводить из одной надписи INT4.

Вывод: стоит ли рассматривать Cosmos3 64B INT4 для локальной генерации

Cosmos3 64B INT4 стоит рассматривать как перспективный технический эксперимент для NVIDIA и Apple Silicon. Заявленная поддержка CUDA и MLX расширяет выбор оборудования, а INT4 теоретически уменьшает объем хранения весов примерно в четыре раза относительно FP16. При этом 64 млрд параметров требуют серьезного запаса памяти, а runtime-бюджет всегда выше размера файла.

Для Mac ориентиром остается наблюдение о клипе примерно за 5 минут на M4 Max с 128 ГБ памяти. Оно показывает возможность локальной генерации, но не заменяет тест с указанными разрешением, длиной видео, FPS, числом шагов и временем повторного запуска.

Перед установкой проверьте:

  • точный GitHub-репозиторий и commit;
  • соответствие весов на Hugging Face загрузчику из README;
  • формат INT4, размер шардов и лицензию;
  • свободную VRAM или unified memory;
  • версии CUDA, MLX, драйвера, macOS и других зависимостей;
  • параметры тестового клипа и способ измерения времени;
  • качество, стабильность и скорость на своей системе.

Владельцам мощного железа и разработчикам локальных AI-систем есть что проверять уже сейчас. Пользователям, которым нужна предсказуемая генерация без ручной настройки, разумнее дождаться более полной документации, стабильного загрузчика и воспроизводимых сравнений с Grok.

Подписаться на канал