Перейти к содержанию
Публикация AiManual

Иск NYT против OpenAI и Microsoft: что раскрыли внутренние документы о скрейпинге контента

Рассекреченные материалы по иску The New York Times против OpenAI и Microsoft: 91 692 копии произведений в промежуточных датасетах, более 2 млн документов nytim

Коротко

Что будет в материале

  1. 01

    Что происходит в деле NYT против OpenAI и Microsoft

  2. 02

    Масштабы скрейпинга: цифры из внутренних датасетов

  3. 03

    Падение переходов из Copilot: «петля гибели» для издателей

  4. 04

    Юридические риски: что это значит для тех, кто работает с обучающими данными

The New York Times судится с OpenAI и Microsoft около трёх лет, и всё это время публике доставались в основном процессуальные новости. Свежий пласт рассекреченных материалов показывает другое: во внутренней переписке топ-менеджеров практики обучения ИИ на чужом контенте называют «кражей» и «экзистенциальной угрозой» для издателей. Там же появляются цифры, которые в пресс-релизах не звучат: 91 692 копии произведений издателей в промежуточных датасетах OpenAI, больше 2 млн документов с nytimes.com в датасете на базе Common Crawl и падение переходов на сайт NYT из Copilot на 93% относительно обычного поиска Bing.

Ниже разбор без юридического тумана: что именно раскрыто, как читать эти фрагменты и что из них следует для тех, кто собирает датасеты, дообучает модели или строит продукты на LLM.

Что происходит в деле NYT против OpenAI и Microsoft

Иск подан издателем против разработчика моделей и его крупнейшего технологического партнёра. Разбирательство идёт около трёх лет, и новые рассекреченные фрагменты судебных материалов дают то, чего раньше не хватало: внутренние оценки, метрики и переписку, которую компании не собирались показывать.

Кто стороны и в чём суть претензий

Истец, The New York Times, это крупный американский издатель. Ответчики, OpenAI, разработчик моделей GPT и ChatGPT, и Microsoft, партнёр OpenAI и владелец Copilot и поиска Bing. Претензии касаются того, как материалы NYT попали в обучающие данные и что с ними сделали дальше: использование контента без разрешения, обход пейволлов, удаление уведомлений об авторских правах.

Microsoft в этой истории не сторонний наблюдатель. У компании доступ к моделям OpenAI, собственный поиск, ассистент Copilot и инфраструктура, на которой обучались модели. Именно поэтому внутренние метрики Microsoft по трафику на сайт NYT оказались в судебных материалах, а не остались во внутренней аналитике.

Оговорка, которая важна для всего дальнейшего текста: суд ещё не вынес решения. Всё, что известно из рассекреченных фрагментов, это позиции и оценки сторон в споре. Читать такие документы стоит как аргументы и признания внутри компаний, а не как установленные факты и тем более не как приговор.

Почему рассекреченные документы важны

Публичные комментарии компаний аккуратны: уважаем права авторов, используем общедоступные данные. Внутренние материалы показывают другую оптику. Топ-менеджеры обеих компаний называют практики обучения на чужом контенте «кражей» и «экзистенциальной угрозой» для издателей, то есть внутри понимали масштаб проблемы и её последствия, хотя публично тема подавалась иначе.

Это меняет рамку спора. Юридическая часть про fair use никуда не делась, но к ней добавляется вопрос осведомлённости: насколько компании отдавали себе отчёт в том, что делают, и как это соотносится с их публичной позицией. Фрагменты не дают полной картины переписки, но сама формулировка «кража» во внутреннем документе весит в суде иначе, чем абстрактные рассуждения о балансе интересов. Юридические риски работы с проприетарными данными разобраны отдельно в материале про проприетарные данные как основу обучения LLM, включая иски Getty Images и стратегии снижения рисков.

Масштабы скрейпинга: цифры из внутренних датасетов

Скрейпинг, то есть автоматический сбор страниц, сам по себе не редкость: так собирают почти все крупные текстовые корпуса. Вопрос в объёме и в том, что делают с собранным. В материалах дела фигурируют два числа, задающие масштаб.

Первое: только в промежуточных датасетах OpenAI обнаружено более 91 692 копий произведений издателей. Промежуточный датасет это не финальный корпус, а этап подготовки данных: сырые страницы чистят, режут на фрагменты, фильтруют от мусора, убирают дубли и лишнюю разметку. Речь о копиях, которые прошли отбор и остались в пайплайне, а не о случайных страницах, залетевших в архив по ошибке обходчика.

Второе: датасет на базе Common Crawl включал более 2 млн документов с nytimes.com. Это уже не выборочное копирование отдельных материалов, а почти сплошной срез публикаций издания.

ПоказательЗначениеЧто это значит на практике
Копии произведений издателей в промежуточных датасетах OpenAIболее 91 692Копии прошли очистку и отбор, то есть остались в пайплайне подготовки данных
Документы с nytimes.com в датасете на базе Common Crawlболее 2 млнРечь о срезе публикаций издания, а не о единичных статьях
Падение переходов на сайт NYT из Copilot относительно поиска Bingна 93%Измеренная потеря трафика в конкретном канале, а не прогноз
Срок разбирательстваоколо трёх летДело идёт давно, решения суда по существу пока нет

Что такое Common Crawl и почему он важен в этом деле

Common Crawl это открытый архив веб-страниц. Он регулярно обходит интернет, сохраняет страницы и отдаёт дампы всем желающим. На таких дампах обучали и продолжают обучать заметную часть LLM: собрать сопоставимый по объёму корпус самостоятельно дорого и долго.

Попадание сайта в Common Crawl не означает согласия на использование материалов. Архив собирает то, что технически доступно обходчику, и наличие страницы в дампе не превращает её в свободный контент. Что именно NYT разрешал или запрещал, из описания дела не следует, поэтому выводы об этом строить не на чем. Значимо другое: 2 млн документов с одного домена это системный сбор, а не техническая погрешность.

Обход пейволлов и удаление уведомлений об авторских правах

Пейволл это ограничение доступа к платному контенту: первые абзацы открыты всем, остальное доступно подписчику. Для поисковых систем издатели обычно делают исключение, чтобы статьи индексировались и приводили читателей. В судебных материалах описано, как этот механизм обходили, чтобы вытаскивать полные тексты, а не только видимую часть.

Отдельный пункт, это уведомления об авторских правах. Copyright notice это строка вида «© The New York Times» вместе с условиями использования, которая сообщает, кому принадлежит текст. В документах описано удаление таких уведомлений из обучающих данных. Смысл операции понятен: убрать из корпуса прямое указание на владельца. Оговорка та же: это описание практик в материалах дела, суд их пока не подтвердил, и конкретные технические методы в доступных фрагментах не детализированы.

Падение переходов из Copilot: «петля гибели» для издателей

Внутренние данные Microsoft показывают падение переходов на сайт NYT из Copilot на 93% по сравнению с обычным поиском Bing. Речь о разнице между двумя интерфейсами одной компании. В поиске пользователь видит список ссылок и кликает по ним. В ассистенте он получает готовый ответ и часто не идёт на сайт вообще.

Почему 93% - это критично

Для издания, которое живёт на рекламу и подписки, переход это деньги. Визит показывает рекламу, читатель видит предложение оформить подписку, работает бренд и узнаваемость. Когда канал схлопывается почти полностью, экономика этого канала перестаёт существовать. Сравнение идёт с Bing, то есть с уже работающим поисковым каналом, а не с гипотетическим максимумом.

Оговорка: 93% это падение в конкретном канале. Экстраполировать его на весь трафик NYT нельзя, для этого нужны данные по всем источникам, а их в описании нет.

Что такое «петля гибели» в контексте медиа и ИИ

Формулировка из внутренних материалов Microsoft. Логика такая: ассистент забирает переход, издатель теряет доход, редакции сокращаются и выпускают меньше качественного контента, а моделям для обучения и для актуальных ответов нужен свежий качественный контент. Получается замкнутый цикл, где выигрыш на коротком отрезке оборачивается дефицитом сырья на длинном.

Честная оговорка: трафик издателей падает по нескольким причинам одновременно, среди них изменения поисковой выдачи, привычки аудитории и соцсети. Но термин «петля гибели» описывает системный эффект, когда ИИ-ответы забирают именно тот трафик, который финансировал производство контента. Это не разовая просадка метрики, а изменение механики рынка.

Юридические риски: что это значит для тех, кто работает с обучающими данными

Иск NYT задаёт рамку для всех, кто собирает корпуса, дообучает модели или строит RAG по чужим материалам. Разберём ключевые понятия без жаргона и с практическими выводами.

Fair use и почему он не универсальная защита

Fair use, добросовестное использование, это доктрина американского права. Она при определённых условиях позволяет использовать защищённый контент без разрешения правообладателя. В деле NYT против OpenAI и Microsoft она один из центральных вопросов: защита на неё ссылается, издатель оспаривает.

Универсальной защитой fair use не работает. Суд оценивает набор факторов: цель использования, характер произведения, объём заимствования и влияние на рынок правообладателя. Массовое копирование полных текстов плохо укладывается в логику цитирования и учебного использования, а сбор обучающих данных внешне выглядит именно как массовое копирование. Ссылка на fair use не гарантирует ничего ни одной из сторон, и решение по делу станет ориентиром для всей индустрии. Как суды применяют эти четыре фактора к обучению LLM и почему спор об авторских данных меняет правила, разобрано в статье про fair use и обучение LLM на защищённых авторским правом данных.

Риски касаются не только обучения с нуля. Тот же иск Sony Music и Warner Music против Anthropic показывает, что претензии возникают и к сбору данных для конкретных моделей, и к способам их получения: разбор иска музыкальных лейблов против Anthropic поясняет, чем эта логика отличается от дел о книгах.

Практические шаги для снижения рисков

  • Аудит обучающих данных: составьте список источников и отметьте, какие взяты по лицензии, какие собраны скрейпингом, какие пришли из открытых архивов.
  • Документирование: храните версии датасетов, даты сбора и происхождение файлов. Без этого доказать, что вы не тащили в корпус чужие тексты, не получится.
  • Проверка условий сайтов: robots.txt и пользовательские соглашения. Игнорирование директив для обходчика работает как аргумент против вас, а не как техническая мелочь.
  • Лицензированный и открытый контент: корпуса с явными лицензиями, договоры с правообладателями, собственные данные. Дороже, зато предсказуемее.
  • Рабочий механизм удаления: если правообладатель просит убрать материалы, процедура должна выполняться, а не существовать в виде пункта в политике.

Это не юридическая консультация. Оценка рисков зависит от юрисдикции, объёма использования, коммерческой цели продукта и того, как именно данные попали в корпус. Общий вектор один: чем прозрачнее цепочка происхождения данных, тем меньше оснований для претензий.

Что это меняет для пользователей AI-инструментов и локальных LLM

Для рядового пользователя ChatGPT или Copilot практической разницы немного: инструмент работает как работал. Меняется другое, прозрачность источников становится критерием выбора, и особенно это заметно в корпоративном сегменте, где юридическая чистота вендора влияет на сделку.

На что смотреть при выборе AI-инструмента

  • Публичная политика по авторским правам: есть ли документ, где описано, как компания работает с чужим контентом.
  • Наличие лицензий на данные: названы ли партнёрства с издателями и правообладателями, или источники описываются общими словами.
  • Механизм жалоб и удаления контента: понятно ли, куда обращаться правообладателю и что происходит после обращения.
  • Для корпоративного использования: юридическая проверка вендора до интеграции в рабочие процессы.

Отдельный сюжет, насколько вообще стоит зависеть от закрытых платформ, чьи источники данных меняются без предупреждения. Про это и про аргументы за и против открытых моделей есть разбор в материале про заявления глав AI-компаний и будущее открытых моделей. Вопросы к тому, как закрытые модели формируют ответы и что из этого следует для пользователя, разобраны в статье о скрытом влиянии закрытых AI-моделей.

Риски при файнтюнинге и работе с датасетами

Разница между использованием готовой модели и её дообучением принципиальная. Когда вы просто запускаете чужие веса, вопросы к данным лежат на разработчике. Когда вы делаете файнтюнинг на собственном корпусе, ответственность за происхождение этих данных переходит к вам.

Датасет, собранный скрейпером, сохраняет все проблемы источника. Открытые датасеты тоже не гарантия чистоты: в них встречаются тексты без внятной лицензии, а иногда и материалы, выгруженные в обход условий сайта. Локальный запуск модели сам по себе работу чище не делает. Логика простая: проверьте, откуда взялись данные, есть ли на них права и что вы сможете предъявить, если придёт запрос.

Главное в трёх пунктах

  1. Масштаб копирования был системным: более 91 692 копий произведений издателей в промежуточных датасетах OpenAI и более 2 млн документов с nytimes.com в датасете на базе Common Crawl. Это копии, прошедшие очистку и отбор, а не случайный шум.
  2. Падение переходов из Copilot на 93% относительно поиска Bing это измеренная потеря трафика, которую внутри Microsoft называли «петлёй гибели» для экосистемы контента: меньше трафика у издателей означает меньше качественного контента для обучения и актуальных ответов.
  3. Для тех, кто работает с данными и AI-продуктами, сигнал практический: аудит источников, документирование происхождения датасетов, проверка лицензий и условий сайтов. Суд решение по делу ещё не вынес, но направление рисков уже видно.

Подписаться на канал