Перейти к содержанию
Публикация AiManual

Поддержка OpenAI правительством США: что это значит для обучения LLM на защищённых авторским правом данных

Разбираем, подтверждена ли поддержка OpenAI со стороны правительства США, как fair use применяют к обучению LLM и почему спор об авторских данных меняет правила

Коротко

Что будет в материале

  1. 01

    Что произошло: правительство США поддержало OpenAI в споре об обучении LLM

  2. 02

    Юридическая основа: fair use и трансформативное использование

  3. 03

    Почему это важно для всей AI-индустрии

  4. 04

    Что означает позиция правительства США: политический сигнал, а не решение суда

Утверждение о том, что администрация США поддержала OpenAI в конкретном споре об обучении LLM на книгах, статьях и других защищённых произведениях, не подтверждено предоставленными материалами. В них нет текста судебного документа, заявления ведомства, позиции Министерства юстиции США или amicus brief, который можно было бы связать с таким делом.

Поэтому воспринимать формулировку о поддержке как установленный факт нельзя. Если правительство США действительно высказывается в подобном процессе, это не заменяет судебное решение. Главный правовой вопрос остаётся прежним: подпадает ли обучение модели под доктрину fair use, то есть допустимое использование произведения без отдельной лицензии, и можно ли считать обучение трансформативным использованием.

Спор затрагивает всю индустрию генеративного AI. Его исход влияет на OpenAI, Anthropic, Google, Meta, разработчиков локальных LLM, издателей, авторов и бизнес, который строит продукты поверх API или собственных моделей.

Что произошло: правительство США поддержало OpenAI в споре об обучении LLM

На текущем наборе фактов корректная формулировка звучит так: возможная поддержка OpenAI со стороны правительства США требует документального подтверждения. Для этого нужны как минимум название дела, суд, дата подачи документа и полный текст позиции государства. Без этих деталей нельзя утверждать, что администрация заняла сторону OpenAI.

В делах об авторском праве государство может участвовать по-разному: подать мнение третьей стороны, опубликовать политический документ, выступить на слушании или инициировать законопроект. Эти действия имеют разный юридический вес. Пресс-релиз и судебный amicus brief нельзя ставить в один ряд.

Содержательная часть спора понятна и без подтверждённой позиции Белого дома. Разработчик LLM получает массивы текстов, преобразует их в токены и обучает нейросеть предсказывать следующий токен. Правообладатели возражают, что для этого копируются целые произведения. Компании-разработчики отвечают: модель извлекает статистические зависимости, а не публикует библиотеку исходных книг.

Юридическая основа: fair use и трансформативное использование

Fair use в США закреплён в разделе 107 Copyright Act. Это не автоматическое исключение для технологий, поиска или машинного обучения. Суд оценивает факты конкретного дела по четырём факторам, а затем сопоставляет их между собой.

Часто упоминают дело Authors Guild v. Google. Google оцифровал книги для полнотекстового поиска и показывал пользователям ограниченные фрагменты. Апелляционный суд второго округа США в 2015 году признал такое использование трансформативным. Этот прецедент полезен как аналогия, но он не даёт готового ответа для LLM: поисковый индекс и генеративная модель создают разные продукты и создают разные риски воспроизведения текста.

Четыре фактора fair use применительно к обучению LLM

ФакторАргумент разработчика LLMАргумент правообладателя
Цель и характер использованияТекст превращается в параметры модели для новой задачи: генерации, классификации, суммаризации или ответа на вопрос.Большинство крупных моделей продаются через подписки и API. Коммерческая цель усиливает претензии, особенно при конкуренции с исходным контентом.
Природа произведенияФактологические и ранее опубликованные материалы обычно получают более узкую защиту, чем неопубликованные рукописи.Романы, расследования, иллюстрации и авторские статьи содержат творческий вклад. Публикация не отменяет охрану авторского права.
Объём заимствованияПолное копирование может быть технически необходимо для обучения, как сканирование книги было необходимо для поискового индекса Google Books.Для обучения часто берут произведение целиком, включая самые ценные части. Это заметно отличается от цитирования короткого отрывка.
Влияние на рынокМодель не обязана заменять исходную книгу или статью. Новый инструмент может обслуживать другой спрос.Генерация пересказов, ответов и похожих текстов способна уменьшить трафик, продажи, доход от подписки и ценность будущих лицензий на AI-обучение.

Ни один фактор сам по себе не решает дело. Коммерческий характер использования не исключает fair use автоматически. Использование полного произведения тоже не делает иск предрешённым. Суд оценивает назначение копирования, свойства продукта, доступность альтернатив и фактический ущерб рынку.

Отдельная проблема касается происхождения датасета. Даже если обучение на законно полученном экземпляре в конкретном случае признают fair use, это не легализует скачивание пиратской библиотеки или обход технической защиты. В связанном материале AI-Manual о разбирательстве Anthropic и правовой неопределённости обучения AI разобрано именно это разделение: оценка обучения и оценка способа получения книг могут привести к разным выводам.

Почему обучение LLM может считаться трансформативным использованием

Во время предобучения модель не сохраняет документ в виде файла, доступного по названию и странице. Токенизатор разбивает текст на элементы, а алгоритм обновляет миллиарды параметров так, чтобы уменьшить ошибку предсказания следующего токена. Веса кодируют статистические связи между словами, фактами, стилями и структурами фраз.

Именно это преобразование лежит в основе аргумента о трансформативности. Входом служит текст, а результатом становится математическая система, способная продолжать фразу, переводить, извлекать структуру или писать код. Пользователь обычно не получает доступ к исходному датасету.

Однако аргумент не закрывает спор. Модель может запоминать редкие или часто повторённые фрагменты и при определённых запросах воспроизводить длинные последовательности. Чем ближе выход к защищённому оригиналу, тем слабее тезис о том, что продукт использует произведение лишь как статистический сигнал. Технические меры снижают риск: дедупликация корпусов, фильтрация известных защищённых текстов, ограничение выдачи длинных цитат и проверка на memorization.

Трансформативность обучения не означает, что любой результат генерации законен. У обучения, хранения копии в пайплайне, выдачи похожего текста и коммерческого распространения продукта могут быть разные правовые оценки.

Почему это важно для всей AI-индустрии

Прецедент по обучению LLM определит стоимость и доступность качественных корпусов данных. Крупные лаборатории могут заключать лицензионные договоры с издателями и владельцами каталогов. Для небольших команд такие сделки часто недоступны из-за цены, объёма переговоров и необходимости отслеживать права на каждый источник.

Жёсткое требование лицензировать весь тренировочный корпус подтолкнёт рынок к закрытым наборам данных, синтетическим данным и моделям, дообученным на узких легальных корпусах. Подтверждение fair use сохранит более широкий доступ к опубликованным материалам, но не снимет риски, связанные с незаконным получением файлов, персональными данными, коммерческой тайной и генерацией близких копий.

Влияние на разработчиков LLM и стартапы

Разработчики собственных моделей столкнутся с тремя практическими ограничениями: происхождением данных, условиями лицензий и риском выхода, слишком похожего на исходный текст. Open weights решают вопрос доступа к параметрам, но сами по себе ничего не говорят о чистоте тренировочного корпуса.

Стартап с RAG-системой должен разделять два сценария. Первый: он вызывает готовую модель через API. Второй: он индексирует собственные документы и передаёт найденные фрагменты в контекст. Во втором сценарии ответственность за права на загруженные документы, доступ сотрудников и срок хранения данных остаётся у владельца продукта.

Расходы могут вырасти через лицензии, аудит датасетов, юридическую экспертизу и фильтрацию выходов. Это не гарантирует рост цен на AI-сервисы, но создаёт такой экономический стимул. Компании, которые заранее документируют происхождение данных, получают более устойчивую позицию при переговорах с заказчиками и инвесторами.

Позиция правообладателей: издателей и авторов

Авторы и издатели указывают на прямой экономический конфликт. Если чат-бот отвечает на вопрос по материалам платного издания, делает подробный пересказ книги или имитирует узнаваемый стиль автора, пользователю может не понадобиться оригинальная публикация. Правообладатели требуют компенсации, контроля над включением произведений в датасеты и понятного механизма отказа.

Иск The New York Times против OpenAI стал заметным примером такого конфликта: издатель связывает использование его материалов с конкуренцией за аудиторию и рекламные доходы. Судебная оценка зависит не от общего тезиса о полезности AI, а от конкретных доказательств копирования, происхождения данных и влияния на рынок.

Для практической оценки рисков полезен материал AI-Manual о проприетарных данных и юридических рисках обучения LLM. В нём разобраны вопросы лицензирования, opt-out и документирования набора данных.

Что означает позиция правительства США: политический сигнал, а не решение суда

Даже подтверждённая поддержка OpenAI со стороны исполнительной власти не создаёт судебного прецедента. Судья применяет закон, существующую практику и доказательства сторон. Позиция государства может повлиять на дискуссию, но не обязывает суд принять её аргументы.

Политический сигнал имел бы значение в двух направлениях. Первое: он показывает, что государство считает широкий доступ к данным значимым для конкурентоспособности AI-индустрии. Второе: он может предвосхищать попытку Конгресса установить отдельные правила лицензирования, компенсаций или прозрачности тренировочных данных.

Amicus brief: как правительство участвует в судебных процессах

Amicus curiae, или друг суда, подаёт правовую позицию в деле, где сам не выступает истцом или ответчиком. В таком документе ведомство может объяснить, как оно толкует норму закона, какие публичные интересы видит в споре и какие последствия ожидает от одного из вариантов решения.

Amicus brief имеет значение только после подачи в конкретный суд. Проверяемое сообщение о позиции должно содержать реквизиты дела и сам документ. Формула вроде правительство поддержало AI без этих деталей описывает политическую интерпретацию, а не юридический факт.

Даже сильный amicus brief не снимает необходимость доказать каждый из четырёх факторов fair use. Суд может согласиться с частью логики государства, но отказать стороне по причинам, связанным с рынком, происхождением набора книг или способностью модели воспроизводить защищённые фрагменты.

Стратегический интерес США: лидерство в AI

AI стал предметом промышленной политики и конкуренции между странами. Сторонники более свободного режима обучения предупреждают: обязательное лицензирование каждого текста увеличит барьеры для американских лабораторий и даст преимущество юрисдикциям с менее строгими правилами. Их оппоненты отвечают, что рынок лицензий создаст предсказуемую основу для авторов и разработчиков.

Эта линия спора шире одного иска. Регулирование frontier-моделей, открытых весов, доступа к вычислительным ресурсам и авторского права часто обсуждают в одном политическом поле. Связанный материал о призывах сотрудников AI-компаний к правительству США показывает, насколько разные требования к государству могут исходить даже от людей из одной индустрии.

Конкуренция с Китаем не отменяет права авторов. Она влияет на баланс аргументов: государству приходится выбирать между скоростью технологического развития, защитой рынков контента и правовой предсказуемостью для бизнеса.

Практические выводы для разработчиков и бизнеса

Пользователям готовых LLM не нужно самостоятельно оценивать fair use тренировочного корпуса провайдера. Зато нужно проверить договорные условия, правила обработки передаваемых данных, запреты на использование сервиса в чувствительных задачах и порядок возмещения убытков, если провайдер его предлагает.

Командам, которые обучают, дообучают или собирают RAG-базы, нужна карта происхождения данных. В ней фиксируют источник, тип лицензии, дату получения, право на коммерческое использование, условия удаления и ответственного владельца. Такой реестр полезнее абстрактного утверждения, что данные были взяты из открытого доступа.

Открытая публикация текста в интернете не равна разрешению на обучение, массовое копирование или перепродажу датасета. Условия сайта, лицензия, технические ограничения и правовой режим страны могут менять оценку риска.

Как снизить риски при использовании LLM в своих проектах

  • Разделяйте инференс, RAG, fine-tuning и предобучение. У этих сценариев разный объём копирования и разные источники риска.
  • Выбирайте наборы данных с явной лицензией и сохраняйте подтверждение условий, действовавших на дату загрузки.
  • Не включайте в корпус пиратские библиотеки, утечки, закрытые клиентские данные и материалы с неясным происхождением.
  • Проверяйте лицензию весов, лицензию датасета и условия API по отдельности. Одна лицензия не заменяет другую.
  • Для RAG ограничивайте доступ по ролям, удаляйте документы по запросу правообладателя и не возвращайте пользователю длинные фрагменты без основания.
  • Добавляйте тесты на дословное воспроизведение: особенно для редких текстов, часто встречавшихся в корпусе, и документов, использованных при дообучении.
  • Фиксируйте версию модели, набор данных, параметры обучения и фильтры. Без этой информации сложно расследовать претензию или воспроизвести проблему.

Локальная LLM помогает контролировать обработку корпоративных данных, но не освобождает владельца системы от авторского права. Если компания дообучила модель на чужом закрытом архиве, запуск на собственном GPU не меняет происхождение данных.

Что дальше: возможные сценарии развития событий

Первый сценарий: суды признают обучение на законно приобретённых копиях трансформативным fair use, но отдельно наказывают за пиратское происхождение корпуса и за выдачу защищённых фрагментов. Он близок к логике, при которой этапы пайплайна оценивают раздельно.

Второй сценарий: суды увидят сформировавшийся рынок лицензий на AI-обучение и признают, что нелицензированное обучение существенно вмешивается в этот рынок. Тогда спрос на коммерческие датасеты и лицензионные сделки вырастет, а барьер входа для новых разработчиков станет выше.

Третий сценарий: Конгресс примет специальный режим для обучения AI. Возможные элементы такого режима: коллективные лицензии, выплаты правообладателям, обязательное раскрытие категорий данных, opt-out или opt-in для отдельных типов контента. Пока нет подтверждённого закона, эти варианты остаются сценариями, а не требованиями.

Четвёртый сценарий: рынок частично договорится без единого закона. Издатели будут продавать доступ к архивам, лаборатории будут покупать лицензии на качественные данные, а открытые проекты сосредоточатся на public domain, permissive-лицензиях и собственных корпусах. На практике вероятна смесь этих подходов, потому что книги, новости, код, изображения и научные публикации имеют разную экономику и разный правовой статус.

FAQ: часто задаваемые вопросы

Можно ли обучать свою LLM на книгах без разрешения?

Универсального разрешения нет. В США fair use оценивают по четырём факторам и по обстоятельствам конкретного проекта. Полное копирование книги, коммерческая цель, пиратское происхождение файла и способность модели выдавать близкие фрагменты повышают риск. Для продуктов, работающих в нескольких странах, нужно учитывать право каждой релевантной юрисдикции.

Что такое fair use?

Это американская доктрина, которая в отдельных случаях допускает использование защищённого произведения без согласия правообладателя. Суд сопоставляет цель использования, природу произведения, объём копирования и влияние на рынок. Fair use не работает как заранее выданная лицензия.

Подтверждена ли поддержка OpenAI правительством США?

Предоставленные материалы этого не подтверждают. До появления реквизитов дела и текста официального документа корректно говорить лишь о неподтверждённом утверждении или политической интерпретации.

Какие риски есть у бизнеса, который использует LLM?

Риск зависит от сценария. При работе через API важны условия провайдера и данные, которые сотрудники отправляют в модель. При RAG, дообучении и собственном предобучении добавляются права на корпус, контрактные ограничения, персональные данные, конфиденциальность и вероятность воспроизведения защищённого контента.

Повлияет ли спор на цену AI-сервисов?

Лицензирование качественных данных, аудит и юридические расходы могут увеличить себестоимость моделей. Это не означает обязательного роста цены каждого API или подписки: поставщики могут сокращать затраты на вычисления, менять тарифы или выбирать другие источники данных.

Подписаться на канал