Перейти к содержанию
Публикация AiManual

Почему локальные AI-модели бесплатны: экономика открытых весов и что это значит для пользователя

Открытые веса выкладывают бесплатно, но зарабатывают на облаках, API и поддержке. Разбираем, кто выпускает открытые модели, чем скачивание отличается от запуска

Коротко

Что будет в материале

  1. 01

    Кто выпускает открытые AI-модели и зачем

  2. 02

    Бесплатная модель не значит бесплатное использование

  3. 03

    Лицензии открытых моделей: что можно, а что нельзя

  4. 04

    Как компании зарабатывают на бесплатных весах

Веса вроде MiMo V2.6 Distill Qwen 9B лежат в открытом доступе: скачал, запустил, платить не надо. Этот факт и вызывает законный вопрос, который в сообществе r/LocalLLaMA сформулировали коротко: почему модели раздают бесплатно, кто эти «они» и почему бы просто не брать деньги за доступ (New to playing around with local ai. why are they free?).

Ответ держится на двух опорах. Первая: деньги в этой схеме зарабатывают вокруг весов, на облачных мощностях, API, поддержке и экосистеме, а сами файлы служат точкой входа. Вторая: бесплатная модель и бесплатное использование - разные вещи. Файл стоит ноль, а запуск требует GPU или Apple silicon с унифицированной памятью, электричества и времени на настройку.

Ниже разбор по порядку: кто выпускает открытые модели и с какой логикой, какие расходы прячутся за словом «бесплатно», что говорят лицензии и в каких сценариях локальный старт оправдан, а в каких дешевле заплатить за готовый сервис.

Кто выпускает открытые AI-модели и зачем

За бесплатными весами стоят четыре категории игроков: крупные лаборатории, инфраструктурные компании, небольшие продуктовые команды и исследовательские группы. Мотивы у них разные, и официально их почти никто не раскрывает. Дальше описаны типовые схемы, которые обсуждают в индустрии, а не подтверждённые заявления конкретных компаний.

Крупные лаборатории и инфраструктурные компании

Пример крупного игрока с открытой моделью: Xiaomi MiMo выпустила MiMo-V2.6-Distill-Qwen-9B. Это 9B агентная модель, созданная через supervised fine-tuning Qwen3.5-9B на данных, сгенерированных MiMo (карточка модели на Hugging Face). Лицензия MIT означает, что модель можно поставить локально бесплатно и без чужих ключей (обзор компактной агент-модели Xiaomi).

Зачем отдавать такую работу бесплатно? Практическая логика такая: модель приводит разработчиков в экосистему инструментов и облачных сервисов, где платят за вычисления, а не за файл. Компания получает поток тестов на реальных задачах, видит востребованные сценарии и продаёт инфраструктуру тем, кто на этих сценариях вырос.

Открытые веса обсуждают и на уровне политики. 14 марта Hugging Face подала ответ на запрос Белого дома (Office of Science and Technology Policy) в рамках White House AI Action Plan и предложила строить национальную AI-стратегию США на открытых исследованиях, открытом ПО и прозрачных моделях (AI Policy @ HF: Response to the White House AI Action Plan RFI). В блоге сформулированы три рекомендации: признать open source и open science фундаментальными для успеха AI; приоритизировать эффективность и надёжность; обеспечивать безопасность AI через открытые, отслеживаемые и прозрачные системы. Там же Hugging Face утверждает, что открытые подходы не только прозрачнее и адаптивнее, но и стабильно воспроизводят или превосходят производительность закрытых систем, приводя в пример OlympicCoder, превзошедшую Claude 3.7 на сложных задачах программирования. Это позиция Hugging Face, а не консенсус: полного текста документа, точных дат и реакции Белого дома по каждому тезису в доступных источниках нет, и как предложения повлияют на итоговый AI Action Plan, неизвестно.

Позиции других крупных игроков в подтверждённых источниках не раскрыты, поэтому приписывать конкретным людям аргументы за или против открытых весов здесь не будем. Спор идёт именно о мотивах и последствиях, поэтому трактовать чужие цели как факт нельзя.

Небольшие команды и исследовательские группы

Для команды из нескольких человек открытая модель это способ заявить о себе. Репутация конвертируется в заказы, приглашения на работу и гранты. Плюс обратная связь: сообщество находит баги и пограничные случаи быстрее, чем внутренний QA небольшой студии. Университетские группы публикуют веса как результат исследования, где публикация обязательная часть работы, а не маркетинг.

Бесплатная модель не значит бесплатное использование

Скачивание весов стоит ноль рублей. Дальше начинаются расходы. Нужны GPU или Apple silicon с унифицированной памятью, электричество и время на настройку окружения, выбор квантизации и отладку. Каталог YouRunAI перечисляет рабочие варианты железа: Windows или Linux PC с дискретной видеокартой, Apple silicon, связка из 1-4 систем NVIDIA, арендованная облачная машина (ExploreAImodels | YouRunAI).

Замеров энергопотребления в доступных источниках нет, поэтому киловатты не приводим. Считать разумно по паспортному TDP карты, реальной средней загрузке и своему тарифу на электричество.

Сколько VRAM нужно для локального запуска

Объём видеопамяти решает, какая модель вообще запустится. Показательный пример: семейство GeForce RTX 3060 включает варианты с 12 ГБ и 8 ГБ видеопамяти (GDDR6/GDDR6X) (GeForce RTX 3060 Family | NVIDIA). Разница в объёме памяти сужает или расширяет набор моделей, которые реально помещаются в карту, поэтому смотреть надо на маркировку конкретной карты, а не на название линейки ускорителя.

Квантование: как сэкономить память без потери качества

Квантование снижает разрядность весов и тем самым урезает требования к памяти. Градации, которые чаще всего встречаются в карточках моделей: Q4 снижает потребление памяти, Q8 даёт более высокое качество, FP16 хранит оригинальные веса. Q4 позволяет влезть в скромную VRAM, но качество может просесть на сложных задачах. FP16 сохраняет исходное поведение модели и требует больше всего памяти.

Лицензии открытых моделей: что можно, а что нельзя

Открытые веса и open source не одно и то же. Веса можно выложить и при этом запретить коммерческое использование или ограничить его масштабом компании. Каталог моделей приводит разные типы лицензий: MIT, Qwen Community License 1.0 и MiniMax H3 Community License Agreement (список лицензий в каталоге).

Разрешительные лицензии: MIT и аналоги

MIT это лицензия, одобренная Open Source Initiative (OSI-Approved License), со SPDX-идентификатором MIT (The MIT License – Open Source Initiative). Это разрешительная лицензия: она допускает коммерческое использование, модификацию и распространение. Полного текста с условиями о сохранении копирайта и текста лицензии в доступных источниках нет, поэтому перед использованием конкретной модели стоит открыть файл лицензии в её карточке и прочитать целиком. MiMo-V2.6-Distill-Qwen-9B распространяется именно под MIT. Для продукта это самый простой вариант: юридических препятствий минимум.

Community-лицензии: Qwen и MiniMax

Qwen Community License 1.0 и MiniMax H3 Community License Agreement это отдельные лицензии с собственными условиями. По Qwen Community License 1.0 подтверждено следующее: она разрешает широкий спектр использования, изменения, распространения, хостинга и дообучения, но содержит существенные условия. Для крупных коммерческих продуктов выше указанных в тексте порогов действует требование отображать имя модели. Коммерческие Model as a Service и AI Work Assistant, как они определены в лицензии, должны получить отдельную лицензию Qwen. Для закрытого внутреннего использования описано исключение при отсутствии доступа третьих лиц к модели, её результатам или возможностям. Текст MiniMax H3 Community License Agreement в доступных источниках не раскрыт, поэтому пересказывать его конкретные пункты про пороги выручки, атрибуцию или запреты нельзя. Практическое правило: перед коммерческим запуском откройте файл лицензии в карточке модели и прочитайте целиком. Если формулировка неоднозначна, вопрос стоит задать юристу, а не форуму.

Как компании зарабатывают на бесплатных весах

Бесплатные веса работают как вход в платную инфраструктуру. Схемы монетизации, которые обсуждают в индустрии, укладываются в три направления: API, облачные GPU и платные версии с поддержкой. Статистики по выручке этих схем в доступных источниках нет, поэтому оценивать их стоит как бизнес-логику, а не как подтверждённые цифры.

API и облачные GPU

API снимает расходы на железо, настройку и обслуживание. Клиент платит за токены и получает масштабирование и доступность без собственного стека. Аренда GPU это компромисс: контроль над моделью остаётся, но платить нужно за часы, а не за покупку карты. В каталоге YouRunAI это отражено буквально пунктом Local or rented GPU: приватную кодинг-модель предлагают запускать на арендованных ускорителях.

Платные версии и поддержка

Базовая модель открыта, а расширенные возможности, приоритетная поддержка и корпоративные договоры продаются отдельно. Компаниям нужны SLA, гарантии и понятная ответственность, за это они готовы платить. Открытость базовой версии такому сценарию не мешает: она расширяет воронку.

Кому и когда выгодны локальные модели

Выбор между своим сервером и внешним сервисом сводится к трём факторам: чувствительность данных, загрузка железа и требуемый уровень удобства.

Приватность и контроль

Если данные не должны покидать контур, локальный запуск становится основным вариантом. Типовые задачи в таком режиме: приватный чат-ассистент, кодинг-ассистент, генерация изображений на своей GPU, короткое видео в ComfyUI, транскрибация аудио и вопросы к собственным документам. Плюс контроль версий: обновление модели не ломает ваш пайплайн в тот момент, когда вендор решил поменять веса.

Когда проще заплатить за API

Обратная ситуация: нет подходящей GPU, нужна высокая доступность, резкий рост нагрузки или разовая задача. Здесь API дешевле и быстрее. Локальный сервер требует постоянной загрузки, иначе стоимость решённой задачи растёт вместе с простоем железа. Баланс между этими вариантами разобран в материале про отказ пользователей от подписок OpenAI и Anthropic (тренд на локальные модели вместо подписок).

Что это значит для пользователя: практические выводы

За открытыми весами стоит стратегия распространения: платят в итоге за вычисления, удобство и поддержку. Запуск на своём железе переносит расходы на электричество, амортизацию GPU и ваше время, поэтому считать надо не цену файла, а стоимость часа работы.

  • Проверьте лицензию в карточке модели: MIT даёт максимум свободы, community-лицензии вроде Qwen Community License 1.0 и MiniMax H3 Community License Agreement требуют чтения условий.
  • Оцените VRAM: если карта выпускалась в версиях на 12 ГБ и 8 ГБ, ориентируйтесь на маркировку своей.
  • Подберите квантизацию: Q4 для экономии памяти, Q8 для баланса, FP16 для оригинального качества.
  • Решите, критична ли приватность. Для работы с документами и приватной транскрибацией локальный запуск уместнее.
  • Посчитайте загрузку. При редких задачах API или аренда GPU обойдутся дешевле собственного сервера.

Начните с одной модели под свою VRAM, прогоните на ней реальную задачу из рабочего процесса и только после этого решайте, покупать ли карту, брать часы в облаке или платить за API.

Подписаться на канал