Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

FMLL: Новая попытка создать copyleft-лицензию для ИИ — разбор проблем, реакции FSF и перспективы

Детальный разбор Free Machine Learning License (FMLL) v1.0 — copyleft-лицензии, требующей раскрытия весов, датасетов и кода. Почему FSF отказала в признании, ка

Коротко

Что будет в материале

  1. 01

    Что такое FMLL и зачем нужна новая лицензия для ИИ

  2. 02

    Почему FSF отказалась признать FMLL свободной лицензией

  3. 03

    Дальнейшие шаги: OSI License Review и перспективы доработки

  4. 04

    Что FMLL означает для разработчиков и индустрии AI

Что такое FMLL и зачем нужна новая лицензия для ИИ

Free Machine Learning License (FMLL) v1.0 - это проект copyleft-лицензии, спроектированной специально для артефактов машинного обучения. Её цель: распространить требования свободы и открытости с исходного кода на всё, из чего состоит современная AI-модель. Авторы FMLL исходят из предпосылки, что традиционные open-source лицензии - GPL, MIT, Apache - создавались для программного кода и не покрывают специфику ML-пайплайнов. Код обвязки можно открыть под Apache 2.0, а веса модели оставить проприетарными. FMLL пытается закрыть эту лазейку.

Главное требование лицензии - обязательное раскрытие всех компонентов, необходимых для воспроизведения, модификации и распространения модели. Это не рекомендация, а жёсткое условие: если вы используете FMLL-модель в своём продукте или сервисе, вы обязаны предоставить доступ к полному набору артефактов. Такой подход продолжает логику GPL, но переносит её на принципиально иную почву - туда, где объект регулирования до сих пор не имеет чёткого юридического определения.

Потребность в подобной лицензии обострилась на фоне взрывного роста экосистемы открытых моделей. По состоянию на июль 2026 года Hugging Face Hub содержит более 2 миллионов моделей и 500 тысяч датасетов. При этом значительная часть «открытых» релизов публикуется без весов, с ограничениями на коммерческое использование или с усечённой документацией. FMLL - это попытка создать инструмент, который юридически обязывает авторов предоставлять полноценный «исходный код» модели в том виде, в каком его понимает ML-сообщество.

Какие компоненты охватывает FMLL

FMLL требует раскрытия пяти категорий артефактов. Первая - исходный код: весь софт, использованный для обучения, инференса и оценки модели, включая скрипты предобработки данных и конфигурационные файлы. Вторая - веса модели: обученные параметры в общепринятом формате (safetensors, pickle, checkpoint), которые позволяют воспроизвести поведение модели без повторного обучения. Третья - датасеты: полные наборы данных, на которых проводилось обучение, включая разметку, аугментации и сплиты. Четвёртая - инструменты обучения: описание аппаратной конфигурации, гиперпараметров, seed-значений и всех зависимостей, влияющих на воспроизводимость. Пятая - компоненты RAG: если модель использует retrieval-augmented generation, лицензия требует раскрытия индексов, эмбеддингов и конвейеров извлечения.

Этот охват делает FMLL одной из самых требовательных лицензий в AI-пространстве. Для сравнения: RAIL-лицензии фокусируются на ограничениях использования (этика, безопасность), но не требуют раскрытия датасетов. Apache 2.0 и MIT вообще не накладывают обязательств по публикации производных работ. FMLL же настаивает: если вы строите продукт на основе FMLL-модели, вы должны открыть всё.

Почему FSF отказалась признать FMLL свободной лицензией

Free Software Foundation рассмотрела FMLL и отказалась включить её в список свободных лицензий. Ответ юристов FSF автору лицензии содержит два ключевых аргумента. Первый: неопределённый статус ML-моделей как объектов авторского права. Второй: отсутствие сформулированных критериев, по которым лицензия может быть оценена как свободная. Оба пункта бьют в фундамент copyleft-подхода - если непонятно, что именно защищается авторским правом, невозможно определить, на что распространяются условия лицензии.

Позиция FSF не означает, что FMLL «плохая» или «бесполезная». Она означает, что с точки зрения философии свободного ПО лицензия опирается на юридически незрелый фундамент. FSF десятилетиями выстраивала критерии свободных лицензий вокруг понятия «исходный код программы». ML-модели в эту парадигму не вписываются: веса - это числа, полученные автоматически в результате оптимизационного процесса, а не текст, написанный человеком. В разных юрисдикциях (США, ЕС, Китай) подход к охраноспособности весов различается, и единого стандарта нет.

Проблема авторского права на ML-модели и веса

Корень проблемы - в природе обученных параметров. Веса модели - это результат применения алгоритма к данным. В классическом авторском праве охраняется творческий вклад человека. Когда разработчик пишет архитектуру модели - это код, он охраняется. Когда та же архитектура наполняется числами после сотен часов обучения на GPU - возникает вопрос: кто автор этих чисел? Программист, написавший скрипт обучения? Владелец датасета? Или сам оптимизатор?

Судебная практика по этому вопросу минимальна. Отдельные дела касались баз данных и сгенерированного контента, но прямых прецедентов по весам нейросетей как объекту авторского права на уровне высших судов нет. FSF, действуя консервативно, не может признать свободной лицензию, которая пытается регулировать то, что, возможно, вообще не подпадает под копирайт. Если суд впоследствии решит, что веса не охраняются, copyleft-условия FMLL потеряют юридическую силу - и требование раскрытия превратится в джентльменское соглашение.

Какие критерии нужны для признания лицензии свободной

FSF оценивает лицензии по четырём свободам: запуск, изучение, распространение, модификация. Для программного кода эти критерии операционализированы - есть определение исходного кода, есть понимание, что такое «предпочтительная форма для внесения изменений». Для ML-моделей аналогов нет. Что считать «исходным кодом» модели - веса, датасет, гиперпараметры или всё вместе? FMLL даёт свой ответ, но FSF считает, что этот ответ должен быть выработан сообществом и закреплён в виде объективных критериев, а не декларирован одной лицензией.

Автор FMLL в переписке с FSF получил чёткий сигнал: до тех пор, пока нет консенсуса о том, что такое «исходный код» ML-модели в юридическом смысле, FSF не будет сертифицировать подобные лицензии. Это ставит FMLL в положение экспериментального инструмента: использовать можно, но без печати «одобрено FSF». Для части сообщества, особенно корпоративных юристов, отсутствие такой печати - стоп-фактор.

Дальнейшие шаги: OSI License Review и перспективы доработки

Следующий этап для FMLL - прохождение OSI License Review. Open Source Initiative имеет собственный процесс оценки лицензий на соответствие Open Source Definition. В отличие от FSF, OSI в последние годы активнее вовлечена в дискуссию об AI-лицензиях и уже рассматривала RAIL и другие специализированные лицензии. Прохождение OSI-ревью даст FMLL статус формально признанной open-source лицензии, даже если FSF сохранит свою позицию.

Процесс OSI License Review включает публичное обсуждение, юридическую экспертизу и голосование совета директоров. Для FMLL критически важно будет продемонстрировать, что лицензия не дискриминирует пользователей и не ограничивает сферы применения - это обязательные пункты Open Source Definition. Авторам, вероятно, придётся доработать формулировки, касающиеся RAG и инструментов обучения, чтобы избежать размытых требований, которые могут быть истолкованы как скрытые ограничения.

Параллельно идёт работа над уточнением терминологии. Ожидается, что в версии 1.1 или 2.0 появятся более строгие определения «полного раскрытия» и «доступности» компонентов. Это прямой ответ на критику FSF: если нельзя опереться на авторское право в отношении весов, можно усилить контрактную составляющую лицензии, превратив её в явное лицензионное соглашение с чёткими условиями.

Что FMLL означает для разработчиков и индустрии AI

Появление FMLL - симптом зрелости индустрии. Когда открытые модели вроде Z.ai GLM 5.2 конкурируют с проприетарными при затратах в 4 раза ниже, вопрос лицензионной чистоты становится экономическим. Компании хотят понимать, могут ли они использовать модель в коммерческом продукте, не рискуя судебными исками. FMLL предлагает жёсткий, но прозрачный ответ: можете, если сами открываете всё.

Для разработчиков и ML-инженеров практическое значение FMLL двояко. С одной стороны, модели под FMLL гарантируют максимальную воспроизводимость - вы получаете не только веса, но и датасеты с кодом обучения. Это решает проблему, с которой столкнулось расследование фейковых заявлений Basalt Labs о рекордных 99.44% на HLE: когда модель - чёрный ящик, верификация невозможна. FMLL-модель по определению не может быть чёрным ящиком. С другой стороны, использование FMLL-модели в проприетарном продукте создаёт юридические риски, сравнимые с GPL в софтверном мире: вы «заражаете» свой продукт требованием открытости.

Сравнение с традиционными open-source лицензиями

FMLL занимает крайнюю позицию в спектре AI-лицензий. Apache 2.0 и MIT - пермиссивные: используйте как угодно, автор не несёт ответственности. GPL - copyleft для кода: производные работы должны быть под GPL. RAIL - этические ограничения: можно использовать, но не для определённых вредоносных целей. FMLL - copyleft для всего ML-стека: производные работы должны раскрыть код, веса, данные и инструменты.

Уникальность FMLL - в охвате данных. Даже GPL не требует публикации датасетов, на которых тестировалась программа. FMLL требует. Это создаёт коллизию с законодательством о персональных данных и коммерческой тайне: датасет может содержать информацию, которую компания не имеет права раскрывать. Авторы FMLL пока не предложили механизма разрешения таких конфликтов. Это одна из причин, почему крупные игроки вроде xAI выбирают Apache 2.0 для проектов уровня Grok Build - пермиссивная лицензия снимает вопрос обязательств.

Для выбора лицензии под AI-проект практическая рекомендация на июль 2026 года: FMLL стоит рассматривать, если ваша цель - максимальная открытость и воспроизводимость, и вы готовы раскрыть все компоненты, включая датасеты. Если вы строите коммерческий продукт и не можете открыть данные - выбирайте Apache 2.0 или MIT. Если важны этические ограничения - смотрите в сторону RAIL. FMLL пока остаётся нишевым инструментом для энтузиастов полной открытости, но её влияние на дискуссию о стандартах открытости в AI уже заметно. Дискуссия о том, что считать «исходным кодом» модели, которую FMLL вывела на уровень FSF и OSI, будет определять ландшафт AI-лицензий в ближайшие годы - независимо от того, получит ли сама FMLL широкое распространение.

Подписаться на канал