Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Иск против Anthropic: как спор о книгах меняет правила обучения AI

Детальный разбор иска против Anthropic за использование книг при обучении Claude. Аргументы сторон, анализ четырёх факторов fair use, сценарии для индустрии и п

Коротко

Что будет в материале

  1. 01

    Суть иска: что произошло и почему это важно

  2. 02

    Почему книги стали камнем преткновения для AI-компаний

  3. 03

    Анализ юридических аргументов: где проходит граница fair use

  4. 04

    Последствия для индустрии: что изменится после вердикта

Суть иска: что произошло и почему это важно

В июле 2026 года судебный процесс против Anthropic вышел на новую стадию. Группа авторов и издателей обвинила компанию в систематическом использовании защищённых авторским правом книг для обучения семейства моделей Claude. Истцы утверждают: Anthropic скопировала сотни тысяч произведений без лицензионных соглашений, включила их в тренировочные датасеты и извлекла коммерческую выгоду. Ответчик настаивает на доктрине добросовестного использования (fair use).

Этот кейс выходит за рамки рядового спора о копирайте. Решение суда определит границы допустимого для всей индустрии обучения больших языковых моделей. Если победят истцы, AI-компании столкнутся с многомиллиардными выплатами и необходимостью перестраивать пайплайны сбора данных. Победа Anthropic легитимизирует текущую практику и ускорит развитие моделей. Третьего пути нет - прецедент затронет каждого разработчика, работающего с LLM.

Истцы и их претензии: нарушение авторских прав на книги

В иске фигурируют несколько категорий правообладателей: индивидуальные авторы художественной и научно-популярной литературы, профессиональные писательские ассоциации и крупные издательские группы. Они утверждают, что Anthropic использовала полные тексты книг без разрешения - от бестселлеров последних десятилетий до узкоспециализированных технических изданий.

Механизм alleged нарушений выглядит так: книги в цифровом формате попали в тренировочные корпуса через публичные датасеты вроде Books3 и The Pile. Модели Claude обучались на этих текстах, извлекая лингвистические паттерны, фактологию и стилистические особенности. Истцы указывают на конкретные примеры: Claude способна генерировать развёрнутые пересказы сюжетов, воспроизводить уникальные авторские формулировки и выдавать фрагменты, близкие к оригиналу. Это, по их мнению, доказывает факт копирования и опровергает тезис о трансформативном использовании.

Отдельный пункт претензий - отсутствие прозрачности. Anthropic не раскрывает полный состав датасетов, на которых обучались Claude 3.5 и более ранние версии. Истцы настаивают: без аудита невозможно оценить реальный масштаб заимствований.

Позиция Anthropic: добросовестное использование и трансформативность

Защита Anthropic строится на доктрине fair use - ключевом механизме американского авторского права, допускающем ограниченное использование защищённых произведений без разрешения правообладателя. Суд оценивает четыре фактора.

Цель и характер использования. Юристы Anthropic утверждают: обучение LLM - трансформативное использование. Модель не хранит и не распространяет книги, она извлекает статистические закономерности языка. Claude не заменяет чтение книг - она генерирует новый текст на основе усвоенных паттернов. Это принципиально иная цель, чем та, ради которой создавались оригинальные произведения.

Природа защищённого произведения. Книги - творческие работы с высокой степенью защиты. Однако защита указывает: для обучения необходимы тексты всех типов, и ограничение только фактологическими или общественным достоянием сделает модели непригодными для широкого круга задач.

Объём и существенность заимствования. Anthropic признаёт использование полных текстов, но настаивает: это техническая необходимость. Фрагментарное обучение снижает качество языкового моделирования. При этом компания подчёркивает: модели не воспроизводят книги дословно, если только их специально не провоцировать на это через adversarial prompts.

Влияние на рынок. Ключевой аргумент: Claude не конкурирует с книжным рынком. Пользователи не обращаются к AI-ассистенту за чтением романов - они решают практические задачи. Более того, AI может стимулировать интерес к оригинальным произведениям через рекомендации и обсуждения.

Почему книги стали камнем преткновения для AI-компаний

Книги - стратегический ресурс для обучения LLM. Открытые веб-данные из Common Crawl содержат короткие, фрагментированные тексты с переменным качеством. Книги дают три критических компонента: длинные связные нарративы для обучения extended context windows, сложную аргументацию и логические цепочки для развития reasoning-способностей, стилистическое разнообразие от художественной прозы до технических руководств.

Модели, обученные только на веб-текстах, демонстрируют худшие показатели в задачах summarization длинных документов и генерации структурированных текстов. Исследования 2024-2025 годов подтверждают: исключение книжных корпусов из тренировочных данных снижает качество модели на 12-18% в бенчмарках, требующих понимания сложных текстов. Это техническая реальность, которую невозможно игнорировать при разработке state-of-the-art моделей.

От Books3 до The Pile: как книги попадают в датасеты

Books3 - датасет из 196 640 книг в формате plain text, собранный в рамках проекта The Pile. Он включает художественную литературу, научные работы, технические руководства и эссе. Датасет создан через парсинг пиратского ресурса Bibliotik, что делает его юридически уязвимым. Несмотря на это, Books3 использовался при обучении моделей Meta (LLaMA), EleutherAI (GPT-NeoX) и, предположительно, ранних версий Claude.

BookCorpus - другой популярный источник, изначально содержал 11 038 книг от независимых авторов, размещённых на Smashwords. Проблема в том, что условия использования Smashwords запрещают коммерческое копирование и перераспространение. OpenAI использовала BookCorpus для обучения GPT-2 и GPT-3, что стало предметом отдельного иска.

The Pile - агрегированный датасет от EleutherAI, включающий Books3, BookCorpus2 и другие книжные подмножества. Anthropic не раскрывает, использовала ли она The Pile напрямую, однако технические исследования показывают пересечения в поведении Claude с моделями, обученными на этом датасете. Проблема цепочки поставок данных остаётся нерешённой: даже если компания не скачивала пиратский контент сама, она могла использовать датасеты, скомпилированные третьими сторонами.

Анализ юридических аргументов: где проходит граница fair use

Доктрина fair use - не чёткое правило, а балансировочный тест. Суд взвешивает четыре фактора, ни один из которых не является определяющим. Применительно к обучению AI сложилась патовая ситуация: каждый фактор допускает аргументацию в обе стороны.

Прецедентное дело - Authors Guild против Google (2015). Google сканировала миллионы книг без разрешения для поискового сервиса Google Books. Суд признал это добросовестным использованием, поскольку Google показывала только сниппеты и не замещала рынок книг. Однако обучение LLM отличается: модель усваивает контент для генерации нового текста, потенциально конкурирующего с оригиналом. Суд может провести разграничение между поисковым сниппетом и генеративной моделью.

Другой релевантный кейс - HathiTrust (2014). Консорциум университетов оцифровал книги для полнотекстового поиска и accessibility-целей. Суд снова поддержал fair use, сославшись на трансформативность и общественную пользу. AI-компании активно ссылаются на эту логику: обучение моделей приносит общественное благо, ускоряет научный прогресс и демократизирует доступ к знаниям.

Фактор 1: Является ли обучение LLM трансформативным использованием?

Трансформативность - самый спорный аспект. Защита утверждает: модель не воспроизводит книги, она создаёт статистическую репрезентацию языка. Claude не помнит текст «Войны и мира», она помнит, что после слов «Все счастливые семьи» с высокой вероятностью следует «похожи друг на друга». Это математическая абстракция, а не копия.

Истцы возражают: если модель способна восстановить фрагмент книги по запросу, значит, копия существует в параметрах модели в сжатой форме. Технически это спорно - нейросеть хранит не тексты, а веса связей. Однако суды не всегда углубляются в технические детали. Показательны эксперименты с «утечкой» тренировочных данных: исследователи неоднократно демонстрировали, что LLM можно заставить воспроизвести значительные фрагменты обучающего корпуса через специфические промпты.

Решение суда по фактору 1 задаст тон всему анализу. Признание обучения LLM трансформативным фактически легитимизирует текущую практику. Отказ - потребует пересмотра всей парадигмы сбора данных.

Фактор 4: Влияние на рынок - угрожает ли AI продажам книг?

Экономический ущерб - четвёртый и часто решающий фактор. Истцы должны доказать, что Claude реально замещает покупку книг. Прямых доказательств массового замещения нет, однако есть тревожные сигналы.

Исследование The Authors Guild (2025) показало: 23% опрошенных читателей использовали AI-инструменты для получения summaries нон-фикшн книг вместо покупки. Для технической литературы показатель достигает 34%. Это косвенный, но измеримый ущерб.

Более серьёзная проблема - способность Claude генерировать контент в стиле конкретного автора. Если пользователь может попросить модель «напиши рассказ в стиле Стивена Кинга про говорящий холодильник», это создаёт прямую конкуренцию автору на рынке короткой прозы. Издатели называют это «цифровым плагиатом в промышленном масштабе».

Anthropic парирует: Claude имеет встроенные ограничения, предотвращающие генерацию текстов, имитирующих стиль конкретных ныне живущих авторов. Однако эти гардрейлы не абсолютны и обходятся через jailbreak-техники. Суд, вероятно, запросит техническую экспертизу эффективности этих ограничений.

Последствия для индустрии: что изменится после вердикта

Исход дела определит ландшафт AI-разработки на годы вперёд. Три сценария просматриваются уже сейчас.

Победа истцов. AI-компании обязаны получать лицензии на все защищённые произведения в датасетах. Это означает: ретроспективные выплаты за уже обученные модели, многократное удорожание обучения новых моделей, фрагментацию рынка данных по издателям и юрисдикциям. Стартапы без капитала на лицензирование окажутся в невыгодном положении. Возможен исход, при котором training data станет конкурентным преимуществом крупных корпораций, способных оплатить лицензии.

Победа Anthropic. Текущая практика признаётся законной. Компании продолжат использовать общедоступные данные, включая книги, без дополнительных затрат. Однако это не означает полной свободы: регуляторы (особенно в ЕС) могут ввести собственные ограничения через AI Act и смежное законодательство. Прозрачность датасетов станет добровольно-принудительной через рыночное давление.

Промежуточное решение. Суд может признать обучение на книгах fair use, но обязать компании внедрить механизмы opt-out для правообладателей и раскрывать состав датасетов. Этот сценарий выглядит наиболее вероятным, учитывая траекторию аналогичных дел против OpenAI и Meta.

Прозрачность датасетов: от добровольности к обязательности

Тренд на прозрачность усиливается независимо от исхода конкретного дела. EU AI Act, вступающий в силу поэтапно с 2025 по 2027 год, требует от разработчиков general-purpose AI раскрывать «достаточно детализированное резюме» тренировочных данных. Формулировка намеренно размыта, но вектор очевиден: эпоха закрытых датасетов заканчивается.

Индустриальные стандарты, такие как Model Cards (предложенные Google) и Data Sheets for Datasets, из академических рекомендаций превращаются в базовое требование. Крупнейшие AI-лаборатории уже начали публиковать технические отчёты с описанием источников данных - OpenAI для GPT-4o, Meta для LLaMA 3.1, Mistral для Large 2. Anthropic пока отстаёт в этом аспекте, что делает её уязвимой в суде.

Иск может ускорить стандартизацию. Если суд обяжет Anthropic раскрыть датасеты, это создаст прецедент для всей индустрии. Разработчикам придётся внедрять системы аудита и документирования источников на уровне пайплайнов обработки данных.

Новые бизнес-модели: лицензирование данных как конкурентное преимущество

Параллельно с судебными разбирательствами формируется рынок легальных тренировочных данных. OpenAI заключила соглашения с Axel Springer, Financial Times, Le Monde и другими издателями на сумму более $500 млн. Google лицензирует контент Reddit за $60 млн в год. Эти сделки - не благотворительность, а страховка от юридических рисков и способ получить качественные данные с чёткой цепочкой прав.

Для правообладателей открывается новый источник дохода. Крупные издатели создают специализированные лицензионные пакеты для AI-training. Агентства вроде Copyright Clearance Center разрабатывают коллективные схемы лицензирования, аналогичные тем, что работают в музыкальной индустрии. Экономика обучения моделей меняется: стоимость данных становится явной строкой бюджета, а не нулевой предпосылкой.

Для стартапов и исследовательских групп это создаёт барьер входа. Обучение конкурентоспособной модели с нуля на полностью легальных данных может стоить на 30-50% дороже. Альтернатива - использование синтетических данных и открытых корпусов, но это компромисс по качеству.

Практические выводы: как снизить риски для вашего AI-проекта

Независимо от исхода дела Anthropic, разработчикам и компаниям, внедряющим AI, пора выстраивать процессы комплаенса. Юридические риски использования моделей, обученных на непроверенных данных, растут. Ответственность может распространяться по цепочке: от провайдера модели к компании, использующей её в коммерческом продукте.

Практический подход включает три направления: due diligence датасетов при обучении собственных моделей, аудит источников данных при выборе сторонних моделей и документирование всех этапов работы с данными. Это не разовая акция, а непрерывный процесс, встроенный в ML-пайплайн.

Due diligence датасетов: что проверять перед обучением

Перед использованием любого датасета для обучения или fine-tuning необходимо провести четыре шага.

Аудит источников. Определите происхождение каждого компонента датасета. Для публичных датасетов вроде The Pile изучите документацию и историю сбора. Если источник - веб-скрапинг, проверьте robots.txt и условия использования сайтов на момент сбора данных. Отсутствие документации - красный флаг.

Оценка лицензионной чистоты. Классифицируйте данные по типам прав: общественное достояние (Project Gutenberg), открытые лицензии Creative Commons, данные с неясным правовым статусом. Датасеты, содержащие материалы из пиратских источников (Books3), несут максимальные риски.

Фильтрация copyrighted материалов. Внедрите инструменты детекции защищённого контента на этапе препроцессинга. Решения на основе хеширования и поиска по базам ISBN позволяют выявить книги до их попадания в тренировочный корпус. Это не даёт полной гарантии, но демонстрирует добросовестность.

Юридическая экспертиза. Привлеките юристов, специализирующихся на интеллектуальной собственности в AI, для оценки рисков конкретного датасета. Стоимость экспертизы несопоставима с потенциальными убытками от судебного иска.

Альтернативные источники данных: synthetic data и открытые корпуса

Технические решения для снижения зависимости от защищённых книг уже существуют.

Синтетические данные. Методология Self-Instruct и её развитие (Alpaca, Evol-Instruct) позволяют генерировать обучающие примеры с помощью сильных моделей. Современные подходы - Genstruct от Nous Research, Cosmopedia от Hugging Face - создают миллионы качественных инструкций и длинных текстов без использования copyrighted контента. Ограничение: синтетические данные наследуют ошибки и смещения порождающей модели, требуют тщательной фильтрации.

Открытые книжные корпуса. Project Gutenberg содержит более 70 000 книг в общественном достоянии. Wikisource, Standard Ebooks, открытые академические репозитории предоставляют легальные тексты для обучения. Проблема в том, что классическая литература не покрывает современный язык и тематики. Комбинирование открытых книг с синтетическими данными и лицензированным контентом - рабочий компромисс.

Human feedback. Reinforcement Learning from Human Feedback (RLHF) и Direct Preference Optimization (DPO) позволяют улучшать модели без дополнительных текстовых датасетов. Человеческие предпочтения, собранные через краудсорсинг, не нарушают авторские права. Это дороже автоматического сбора данных, но безопаснее юридически.

Документирование источников - обязательный элемент. Создайте Data Sheet для каждого датасета с указанием происхождения, лицензий, методов фильтрации и известных ограничений. При использовании сторонних моделей запрашивайте у провайдера информацию о тренировочных данных. Отсутствие прозрачности со стороны вендора - фактор риска, который нужно учитывать при выборе решения.

Подписаться на канал