Перейти к содержанию
Публикация AiManual

Локальные LLM для 3D-моделирования: насколько домашние модели отстают от облачных на примере RTX 5090

Пользователь с RTX 5090 сравнил локальные Qwen 3.8 и Qwen Flash с облачной Opus 5.5 в 3D-моделировании и получил неутешительный результат. Разбираем, почему мощ

Коротко

Что будет в материале

  1. 01

    Короткий ответ: локальные модели на RTX 5090 пока не конкурент облаку в 3D

  2. 02

    Что именно сравнивал пользователь: Qwen 3.8, Qwen Flash и Opus 5.5

  3. 03

    Почему RTX 5090 не спасает: реальные ограничения локальных LLM

  4. 04

    Какие задачи 3D-моделирования реально пробовать локально

Короткий ответ: локальные модели на RTX 5090 пока не конкурент облаку в 3D

Пользователь с RTX 5090 запускает Qwen 3.8 и Qwen Flash локально и сравнивает их с облачной Opus 5.5. Его вывод по 3D-моделированию прямой: локальные модели «не близки» к нужному уровню, а облачная ушла далеко вперёд. Обсуждение на r/LocalLLaMA

It's miles behind the latest Opus 5.5. With regards to 3D modeling, local models are not close at all.

Оговорка, которую нужно держать в голове: это субъективная оценка одного человека. В сообщении нет ни списка конкретных 3D-задач, ни метрик, ни условий запуска. Кейс работает как сигнал, а не как лабораторный замер.

Практический смысл для вас простой. Если нужна корректная геометрия, понимание пространственных отношений и работа со сложными сценами, локальная LLM на потребительской видеокарте пока не заменяет топовое облако. Для скриптов, текстов и рутины локальный запуск уже даёт результат. Граница применимости и способ её проверить на своей сборке важнее самого вердикта, и дальше речь пойдёт именно об этом.

Что именно сравнивал пользователь: Qwen 3.8, Qwen Flash и Opus 5.5

Установка простая: одна видеокарта RTX 5090, две локальные модели (Qwen 3.8 и Qwen Flash) и облачный эталон в виде Opus 5.5. Пользователь гоняет их на задачах 3D-моделирования и сравнивает результат.

Что осталось за кадром. В сообщении не названы конкретные задачи: генерация меша, ретопология, работа с UV, скрипты для Blender или что-то ещё. Нет данных о размере сцен, длине промптов, времени генерации и критериях оценки. Поэтому сравнение стоит читать как общий качественный вердикт, а не как измеримый эксперимент. Исходный кейс

Контекст железа. RTX 5090 - топовая потребительская видеокарта, а не серверный ускоритель с сотнями гигабайт памяти. Сравнение идёт не «локально против локально», а «домашний запуск против топового облака», где у модели куда больше параметров и другой бюджет обучения. Практический разбор производительности локальных LLM на RTX 5090 показывает, как движок, квантование и память меняют скорость, но не превращают домашнюю сборку в аналог облачной.

Opus 5.5 в этом кейсе выступает точкой отсчёта. Детально её никто не разбирает, она нужна как ориентир: вот уровень, который локальные Qwen 3.8 и Qwen Flash в 3D пока не догоняют.

Почему RTX 5090 не спасает: реальные ограничения локальных LLM

Мощный GPU ускоряет счёт, но не увеличивает число параметров и не повышает их точность. Ограничение сидит в трёх местах: размер весов, точность квантизации и длина рабочего контекста.

Размер модели и квантизация: где теряется качество

Чтобы модель поместилась в память, веса сжимают. Это и есть квантизация. Степень сжатия измеряют в BPW (bits per weight, бит на параметр). Чем ниже BPW, тем меньше модель занимает памяти и тем грубее округление чисел, которыми она считает.

Показательный пример - сборка AX-Qwen3.8-Flash-Next-MLX-AXQ-MXFP8-MTP для Apple Silicon. У неё измеренный показатель 8.30 BPW, то есть это смешанная точность, а не единый формат для всех слоёв. Языковой путь в этой сборке квантован, а голова multi-token-prediction (MTP) и vision tower сохранены в BF16. Карточка модели на Hugging Face

Что это значит на практике. 8.30 BPW сам по себе не приговор: для текста и кода такого уровня часто хватает. Смешанная точность означает компромисс, где часть компонентов урезана, а часть оставлена в высоком разрешении. Для 3D чувствительны и пространственные представления, и точность численных операций, и способность удерживать структуру сцены. Квантизация может ломать именно те способности, которые в 3D нужнее всего.

Контекст и VRAM: почему 262 144 токена не решают задачу

Максимальная длина контекста у сборки AX-Qwen3.8-Flash-Next-MLX-AXQ-MXFP8-MTP заявлена как 262 144 токена. Максимум в спецификации и рабочий контекст на вашем железе - разные вещи: практические ограничения зависят от объёма унифицированной памяти. Описание сборки

3D-задачи часто требуют держать в контексте большие объёмы: геометрию, скрипты, описания сцен, историю правок. Чем длиннее промпт, тем больше памяти уходит на KV-cache. На RTX 5090 доступный объём VRAM фиксирован, поэтому реальный рабочий контекст будет меньше технического максимума, и на длинных сценах модель начнёт либо тормозить, либо терять детали. Как устроен KV-cache и почему он съедает память, разобрано в материале про контекстное окно, KV-cache и стоимость инференса.

Какие задачи 3D-моделирования реально пробовать локально

Пайплайн 3D-моделирования разбивается на слои, и пригодность локальной модели в каждом своя.

Где локальная модель уже помогает: скрипты, тексты, рутина

Вспомогательные задачи: генерация и правка Python-скриптов для Blender, написание регулярных выражений для переименования объектов, процедурная генерация по шаблону, чек-листы проверки модели, черновики документации к ассетам. Здесь важнее качество кода и текста, чем глубина пространственного понимания.

Пользователь из кейса прямо говорит: даже частично работоспособная локальная модель стала бы для него большим подспорьем. Оценка автора кейса Во вспомогательных сценариях этот порог уже пройден: локальная модель закроет рутину, а данные останутся на вашей машине.

Структурные задачи локальной модели тоже по силам. В отдельном тесте локальную Qwen 3.8 27B сравнивали с фронтирными моделями, включая Opus 5, на воссоздании HTML-игры: там проверялось качество кода, а не геометрия. Тест Qwen 3.8 27B против фронтирных моделей Это хорошая иллюстрация того же принципа: локальная сборка тянет задачи, не требующие точной пространственной логики.

Где локальные модели пока пасуют: геометрия и пространственные задачи

Ядро 3D: генерация корректной геометрии, понимание пространственных отношений, работа со сложными сценами и удержание их в контексте. Здесь локальные модели на потребительском железе пока отстают от облачных.

Точные границы назвать сложно: в источнике нет деталей, какие именно 3D-задачи тестировались. Но ставку на то, что смена квантизации или рост контекста кардинально перевернут картину, делать не стоит. Это тюнинг, а не смена класса модели.

Как оценить пригодность локальной модели под свою задачу

Вместо того чтобы гадать, прогоните конкретную сборку по своему сценарию. Ниже порядок действий, который экономит время и диск.

Чек-лист: 5 шагов перед тем, как качать модель

  1. Определите тип задачи. Текст и код или пространственная и геометрическая логика. Для первой группы локальная модель подходит чаще, для второй шансы ниже.
  2. Проверьте требования к диску и памяти. Загрузка некоторых сборок занимает сотни гигабайт, и это без учёта квоты на кэш и временные файлы. Сверяйте объём с вашей VRAM и RAM до скачивания. Если вы ограничены памятью, логику выбора сборки под конкретный объём разбирает материал про запуск быстрых локальных моделей на 12 ГБ VRAM.
  3. Поищите опубликованные метрики. Качество, поведение на длинном контексте, скорость ядра, скорость MTP. Если их нет, это не значит «модель плохая», это значит «результат не гарантирован».
  4. Проведите свой тестовый прогон. 5-10 типовых задач из вашего пайплайна, один и тот же промпт на каждой. Записывайте время и качество ответа.
  5. Сравните с облачной моделью на тех же задачах. Разница покажет, где локальный запуск себя оправдывает, а где нет.

Отдельно проверяйте требования к софту. Использование MTP-головы требует специальной поддержки (oMLX или MTPLX), а стандартный MLX-LM не подхватывает sidecar автоматически. Технические детали сборки

Красные флаги в описании модели

  • Нет измеренных метрик качества.
  • Нет данных о поведении на длинном контексте.
  • Нет данных о скорости: ядра и MTP.
  • Требуется нестандартная поддержка, например oMLX или MTPLX для MTP-головы.
  • Заявлена мультимодальность, но vision sidecar отсутствует.

Пример по всем пунктам: пакет AX-Qwen3.8-Flash-Next-MLX-AXQ-MXFP8-MTP не публикует измеренных доказательств качества, длинного контекста, скорости ядра или скорости MTP. Его MTP sidecar содержит 31 тензор, 2,61 млрд параметров, 5,21 ГБ в формате BF16, а vision sidecar не включён. Для загрузки репозитория нужно не менее 189,24 ГБ свободного дискового пространства. Данные из карточки модели

Это не значит, что сборка плохая. Это значит, что заранее обещать результат под 3D нельзя: проверять придётся своими тестами.

Когда облако оправдано, а когда можно остаться локально

Решение зависит от четырёх вещей: сложности задачи, требований к приватности, бюджета и объёма работы.

Облако оправдано, когда задача упирается в геометрию и пространственную логику: генерация модели, корректные трансформации, сложные сцены. Тут разрыв между Opus 5.5 и локальными Qwen 3.8 и Qwen Flash настолько велик, что экономия не компенсирует брак и переделки.

Остаться локально имеет смысл на рутине: скрипты, тексты, черновики документации, простые операции с метаданными. Приватность добавляет отдельный аргумент: локальный запуск не отправляет ассеты и код наружу, а при работе с чужими проектами это часто решающий фактор.

Считайте не только токены, но и своё время. Если облачная модель делает задачу за один проход, а локальная выдаёт черновик, который вы правите полдня, дешёвый инференс оборачивается дорогой ручной доводкой.

Что должно измениться, чтобы локальные модели догнали облако в 3D

Смотреть стоит на четыре фактора: рост качества открытых моделей, квантизацию без потери качества, увеличение доступной VRAM и появление специализированных 3D-моделей. Пока сдвиг идёт по первым двум направлениям, а третий и четвёртый упираются в физику потребительского железа.

Текущий кейс - один субъективный опыт. Для полноценных выводов нужны независимые измерения на воспроизводимых задачах, где зафиксированы промпты, сцены и критерии оценки. Пока таких данных нет, любые прогнозы остаются прогнозами, а не планом.

Новые релизы сами по себе не убирают ограничение по памяти. Вопросы вроде «выйдет ли Qwen 3.8 27B и что там будет» разбираются отдельно, но новая версия в том же объёме VRAM упрётся в те же стены. Что известно о Qwen 3.8 27B перед релизом

Порог, который пока не достигнут в 3D, звучит скромно: модель должна работать частично, но работать. Пользователь с RTX 5090 ждёт именно такого результата, и он уже стал бы для него большим подспорьем. Сегодня локальные сборки держат эту планку во вспомогательных задачах, а ядро 3D-моделирования остаётся за облаком.

Подписаться на канал