Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Проприетарные данные как основа LLM: юридические и этические риски использования интеллектуальной собственности

Разбираем юридические риски использования проприетарных данных в обучении LLM: судебные иски Getty Images, New York Times, стратегии минимизации рисков через ле

Коротко

Что будет в материале

  1. 01

    Что такое проприетарные данные в контексте LLM и почему это проблема

  2. 02

    Юридические риски для разработчиков и компаний: обзор текущих судебных исков

  3. 03

    Этическая дилемма: инновации против прав авторов

  4. 04

    Как минимизировать правовые последствия: практические стратегии

Что такое проприетарные данные в контексте LLM и почему это проблема

Современные большие языковые модели (LLM) работают не столько на проприетарных технологиях, сколько на проприетарных данных, которые часто представляют собой «украденную интеллектуальную собственность». Это утверждение, звучащее как провокация, отражает реальность: обучение моделей вроде GPT-4, Claude или Gemini требует триллионов токенов, и значительная их часть - контент, защищенный авторским правом.

Проблема в том, что сбор данных для обучения исторически происходил по принципу «все, что доступно в интернете, можно использовать». Common Crawl, один из крупнейших источников обучающих данных, содержит петабайты веб-страниц, среди которых - книги, научные статьи, новостные публикации и изображения с копирайтом. По оценкам исследователей, доля защищенного контента в популярных датасетах может достигать 60-70%.

Для разработчиков и продакт-менеджеров, оценивающих юридические риски AI-продуктов, это создает прямую угрозу: модель, обученная на сомнительных данных, может генерировать производные работы, нарушающие авторские права. Ответственность за это пока не устоялась в судебной практике, но первые прецеденты уже формируют контуры будущего регулирования.

Какие данные считаются проприетарными: от текстов до изображений

Проприетарные данные в контексте обучения LLM - это контент, защищенный авторским правом и используемый без разрешения правообладателя. Ключевой момент: общедоступность не означает свободу использования. То, что текст или изображение опубликованы в открытом доступе, не отменяет необходимости лицензии для коммерческого применения в обучении моделей.

Типы контента, подпадающие под защиту:

  • Литературные произведения - книги, статьи, эссе. Датасет Books3, содержащий около 196 тысяч книг, использовался для обучения LLaMA, Mistral и других моделей, что привело к групповым искам авторов против Meta.
  • Научные статьи - публикации в журналах, диссертации, техническая документация. Даже при открытом доступе многие из них защищены лицензиями, запрещающими коммерческое использование.
  • Программный код - репозитории на GitHub, фрагменты из Stack Overflow. Copilot от GitHub обучался на публичных репозиториях, что вызвало иск о нарушении условий open-source лицензий.
  • Изображения - фотографии, иллюстрации, скриншоты. Stable Diffusion обучалась на 12 миллионах изображений из Getty Images с водяными знаками, что стало основанием для иска на сумму до 1.8 миллиарда долларов.
  • Видео и музыка - пока менее затронуты в судебной практике, но юридические риски идентичны: обучение на защищенных аудиовизуальных произведениях без лицензии создает уязвимость.

Практический вывод: перед использованием датасета для обучения или файнтюнинга необходимо проверять не только его доступность, но и правовой статус каждого типа контента. Игнорирование этого этапа - прямой путь к судебным издержкам.

Юридические риски для разработчиков и компаний: обзор текущих судебных исков

Судебные процессы 2024-2026 годов превратили теоретические риски в реальные финансовые угрозы. Разработчики AI-продуктов больше не могут ссылаться на отсутствие прецедентов - они уже есть, и их количество растет.

Три категории исков формируют правовой ландшафт: прямые иски правообладателей против разработчиков моделей, иски о нарушении условий лицензий (особенно в open-source коде) и требования об удалении данных из обучения. Исходы этих дел определят, сможет ли индустрия сохранить текущий подход к сбору данных или будет вынуждена перейти на лицензионную модель.

Для компаний, использующих LLM в своих продуктах, риски не ограничиваются штрафами. Возможен запрет на коммерческое использование модели, требование переобучить её на легальных данных или отзыв продукта с рынка. Репутационные потери и потеря доверия пользователей - дополнительные факторы, которые сложно оценить в денежном выражении.

Кейс Getty Images vs Stability AI: прецедент для индустрии

В январе 2024 года Getty Images подала иск против Stability AI в Высоком суде Лондона. Суть претензий: Stable Diffusion обучалась на 12 миллионах изображений из фотобанка Getty без лицензии. На сгенерированных моделью изображениях иногда воспроизводился водяной знак Getty - прямое доказательство использования защищенного контента.

Ключевые детали дела:

  • Stability AI не заключала лицензионное соглашение с Getty, в отличие от конкурентов (OpenAI заключила сделку с Shutterstock).
  • Иск включает два нарушения: авторских прав на изображения и прав на товарный знак (водяной знак).
  • Требуемая компенсация - до 1.8 миллиарда долларов, что сопоставимо с годовым бюджетом крупной AI-компании.
  • Дело рассматривается в британской юрисдикции, где концепция fair use ограничена, что повышает шансы Getty на успех.

Значение этого процесса выходит за рамки одного ответчика. Решение суда может установить стандарт ответственности: если модель обучалась на защищенных данных, разработчик несет ответственность за все производные работы, которые она генерирует. Для индустрии это означает необходимость аудита каждого этапа обучения.

New York Times против OpenAI: когда текст становится объектом спора

В декабре 2024 года The New York Times подала иск против OpenAI и Microsoft, утверждая, что ChatGPT дословно воспроизводит фрагменты статей издания. Это первый крупный иск, касающийся текстовых данных в LLM, и он ближе к реальности большинства разработчиков, работающих с языковыми моделями.

Факты дела:

  • NYT предоставила примеры, где ChatGPT генерирует абзацы, практически идентичные оригинальным статьям.
  • Издание требует удаления своих данных из обучения и компенсацию «миллиардов долларов».
  • OpenAI утверждает, что дословное воспроизведение - редкий баг, а не системное поведение, и что обучение подпадает под fair use.

Для разработчиков этот кейс важен по двум причинам. Во-первых, он показывает, что даже крупные компании с сильными юридическими командами уязвимы. Во-вторых, он ставит вопрос о границе между обучением на паттернах и копированием: если модель способна восстановить исходный текст, является ли это нарушением?

Этическая дилемма: инновации против прав авторов

Юридические риски - лишь верхушка айсберга. Под ними лежит фундаментальный этический конфликт: технологический прогресс требует данных, а создатели этих данных не получают ни компенсации, ни признания. Разрешение этого конфликта определит, как будет выглядеть AI-индустрия через пять лет.

Концепция добросовестного использования (fair use) в США - центральный аргумент защиты AI-компаний. Согласно этой доктрине, использование защищенного контента допустимо, если оно трансформативно, не вредит рынку оригинального произведения и использует ограниченный объем материала. Обучение LLM, утверждают разработчики, трансформативно: модель не хранит копии, а извлекает статистические паттерны.

Против этого аргумента есть три контраргумента:

  1. Коммерческая выгода - OpenAI, Google и Meta извлекают прибыль из моделей, обученных на чужом труде, без какой-либо компенсации авторам.
  2. Рыночный вред - LLM могут генерировать контент, заменяющий оригинальные произведения. Зачем покупать книгу или подписку на издание, если модель перескажет содержание?
  3. Масштаб - fair use предполагает ограниченное использование, а не поглощение всей доступной информации человечества.

Этическая позиция разработчика должна учитывать оба измерения: стремление к инновациям и уважение к труду создателей контента. Практически это означает выбор в пользу прозрачности и, где возможно, компенсации.

Как минимизировать правовые последствия: практические стратегии

Минимизация рисков начинается с признания: полностью исключить юридические риски при использовании LLM невозможно. Текущее регулирование фрагментировано, судебная практика противоречива, а законы разных юрисдикций могут предъявлять взаимоисключающие требования. Реалистичная цель - снизить риски до приемлемого уровня через комбинацию технических и организационных мер.

Стратегия управления рисками должна охватывать три этапа жизненного цикла модели: сбор и подготовку данных, обучение и файнтюнинг, развертывание и использование в продукте. На каждом этапе есть свои инструменты и подходы.

Легальные датасеты и фильтрация: на чем можно обучать без риска

Первый и самый надежный способ снизить риски - использовать датасеты с подтвержденными открытыми лицензиями. Это не устраняет необходимость проверки, но радикально сужает поле потенциальных проблем.

Проверенные источники данных:

  • Wikipedia - лицензия CC BY-SA разрешает использование с указанием авторства, но требует распространения производных работ на тех же условиях.
  • Common Crawl с фильтрацией - сам по себе Common Crawl содержит защищенный контент, но инструменты вроде license classifiers позволяют отфильтровать страницы по типу лицензии.
  • The Pile (с удалением Books3) - после исключения спорного датасета Books3 оставшаяся часть The Pile остается одним из крупнейших легальных источников.
  • OpenWebText2 - альтернатива WebText, воспроизводящая методологию OpenAI, но с акцентом на открытый контент.
  • CulturaX - многоязычный датасет с прозрачной цепочкой лицензирования.

Практический алгоритм проверки датасета перед обучением: (1) получите полный список источников, (2) классифицируйте контент по типам лицензий с помощью автоматических инструментов, (3) вручную проверьте выборку из каждой категории, (4) задокументируйте процесс и результаты, (5) при малейших сомнениях исключайте данные из обучения.

Механизмы opt-out и лицензионные соглашения: как работать с правообладателями

Opt-out - это механизм, позволяющий правообладателям запретить использование своего контента для обучения AI. Google первым внедрил Google-Extended - расширение robots.txt, позволяющее веб-мастерам блокировать сбор данных для обучения моделей. OpenAI и другие компании последовали этому примеру.

Плюсы opt-out: снижение рисков без необходимости переговоров с каждым правообладателем, относительная простота внедрения. Минусы: механизм добровольный и не имеет юридической силы во многих юрисдикциях, многие правообладатели о нем не знают, а собранные до внедрения opt-out данные остаются в зоне риска.

Лицензионные соглашения - более надежный путь для коммерческих продуктов. Модель Shutterstock и OpenAI показывает работающий подход: платформа стоковых изображений получает фиксированную плату за использование своей библиотеки в обучении, а авторы - отчисления. Для текстовых данных аналогичные соглашения заключаются с издательствами и новостными агентствами.

Рекомендации для стартапов: начинайте с открытых данных, внедряйте opt-out с первого дня, а по мере роста бюджета переходите к лицензионным соглашениям с ключевыми правообладателями в вашей нише.

Будущее регулирования: что готовят законодатели

Регуляторный ландшафт в 2026 году напоминает лоскутное одеяло: разные юрисдикции движутся в разных направлениях с разной скоростью. EU AI Act, вступивший в силу в 2025 году, задает наиболее жесткие требования к прозрачности данных обучения. Разработчики моделей общего назначения обязаны раскрывать резюме использованных данных и соблюдать авторские права.

В США ситуация менее определенная: Copyright Office проводит консультации, но федерального закона об AI и авторском праве пока нет. Отдельные штаты вводят свои требования, что создает дополнительную сложность для компаний, работающих на национальном уровне.

Япония выбрала третий путь: в 2024 году страна разрешила использование любых данных для обучения AI, включая защищенные, что сделало её привлекательной юрисдикцией для AI-компаний. Этот подход критикуют правообладатели, но он стимулирует инновации.

Тренды, к которым стоит готовиться: обязательное раскрытие источников данных, введение компенсационных схем для авторов, дифференциация требований для коммерческого и некоммерческого использования. Практический совет: выстраивайте процессы compliance с запасом под ужесточение регулирования, а не под текущие минимальные требования.

Чек-лист для разработчика: как оценить риски вашего AI-продукта

Оценка рисков - не разовая акция, а непрерывный процесс. Этот чек-лист поможет структурировать подход и не упустить критически важные шаги.

  1. Определите источники данных для обучения и файнтюнинга. Составьте полный список датасетов, включая версии и даты получения. Если вы используете готовую модель, запросите у провайдера информацию об источниках данных - добросовестные компании предоставляют model card с этой информацией.
  2. Проверьте лицензии и наличие защищенного контента. Для каждого источника определите тип лицензии и наличие ограничений на коммерческое использование. Инструменты: Creative Commons License Classifier, собственные скрипты для анализа метаданных.
  3. Оцените, может ли модель генерировать контент, похожий на защищенный. Проведите red-teaming: целенаправленно пытайтесь получить от модели дословное воспроизведение известных текстов или изображений. Если это удается, риск высок.
  4. Внедрите механизмы фильтрации и opt-out. Настройте фильтры на этапе инференса, блокирующие генерацию контента, похожего на защищенные произведения. Реализуйте поддержку robots.txt для AI-краулеров.
  5. Проконсультируйтесь с юристом, специализирующимся на AI и интеллектуальной собственности. Это обязательный шаг перед коммерческим запуском. Юрист поможет оценить риски в конкретной юрисдикции и разработать стратегию защиты.
  6. Документируйте все шаги. Ведите журнал источников данных, результатов проверок, внедренных мер защиты. В случае судебного разбирательства документация станет доказательством добросовестности.

Пример заполнения чек-листа для гипотетического продукта - SaaS-сервиса для генерации маркетинговых текстов: модель файнтюнится на собственных данных клиента (риск минимален), базовая модель - Llama 3 (обучена на данных сомнительного происхождения, риск средний), внедрен фильтр запрещенных фраз из базы copyrighted-контента (риск снижен), юридическая консультация пройдена, документация собрана. Итоговая оценка: приемлемый уровень риска для старта.

Подписаться на канал