Исчезновение TheNumbers.com: хроника атаки AI-ботов
В марте 2026 года сайт TheNumbers.com, два десятилетия служивший эталонным источником данных о кассовых сборах и бюджетах фильмов, перестал отвечать на запросы. Инфраструктура, построенная на 160 000 статических файлов, рухнула под нагрузкой, где лишь 10% трафика генерировали люди. Остальные 90% - AI-боты, методично выскребавшие каждую страницу. Инцидент вскрыл системную проблему: старые сайты с плоской файловой структурой не выдерживают наплыва машинного трафика, а инструменты ИИ снизили порог входа в кибератаки до уровня, доступного любому заинтересованному игроку.
Что такое TheNumbers.com и почему его потеря значима
TheNumbers.com был независимым архивом, который агрегировал данные о кассовых сборах, бюджетах и графиках проката с 1997 года. Профессионалы индустрии, аналитики и журналисты использовали его для проверки цифр, построения прогнозов и фактчекинга. В отличие от Box Office Mojo, принадлежащего Amazon, TheNumbers.com сохранял репутацию непредвзятого источника с прозрачной методологией. Его исчезновение оставило пробел в доступных данных о независимом кинорынке - именно там собиралась наиболее детальная статистика по фильмам с ограниченным прокатом.
Механика атаки: скрейпинг + целенаправленный удар
Атака сочетала два вектора. Первый - массовый скрейпинг: AI-боты, настроенные на сбор данных для обучения моделей, последовательно запрашивали страницы с информацией о тысячах фильмов. При 160 000 файлов и отсутствии агрессивного кэширования каждый запрос создавал нагрузку на диск и процессор. Второй вектор - целенаправленный удар, вероятно связанный с рынком прогнозов Polymarket. На платформе активно торгуются контракты на кассовые сборы премьерных уикендов, и опережающий доступ к данным даёт финансовое преимущество. Скрейпинг в реальном времени позволял получать цифры до их публикации в агрегированных отчётах.
Комбинация двух типов нагрузки - фонового скрейпинга и пиковых запросов в моменты обновления данных - исчерпала ресурсы сервера. Администраторы не смогли оперативно отфильтровать вредоносный трафик: старые системы мониторинга не различали ботов и пользователей.
Почему старые сайты - главная мишень для AI-скрейпинга
Архитектурные решения, принятые 10-15 лет назад, создают идеальные условия для атак. Плоская структура с тысячами отдельных HTML-файлов, отсутствие CDN, минимальное кэширование и ограниченные серверные мощности - каждый из этих факторов по отдельности некритичен, но вместе они образуют каскадную уязвимость. AI-боты, в отличие от поисковых краулеров, не соблюдают задержки между запросами и игнорируют директивы robots.txt, если те противоречат задаче сбора данных.
160 000 файлов и 10% людей: математика катастрофы
Проведём расчёт. При 160 000 уникальных URL и средней глубине скрейпинга в 5 запросов на страницу (основной контент, изображения, связанные данные) полный проход бота генерирует 800 000 запросов. Если 90% трафика - боты, а дневной лимит сервера составляет, скажем, 2 миллиона запросов, то три-четыре параллельных скрейпера полностью исчерпывают ресурс. Реальные пользователи получают таймауты, администраторы видят лишь график утилизации CPU под 100%.
Для контекста: OpenAI подтвердила, что её модели способны находить уязвимости нулевого дня и автоматизировать атаки. Скрейпинг публичных данных - задача на порядки проще, и современные языковые модели генерируют скрипты для неё по текстовому описанию цели.
Инструменты ИИ снижают порог входа для атакующих
В 2024 году для организации скрейпинга требовались навыки программирования и настройки прокси-ферм. В 2026 году достаточно сформулировать запрос к Claude или GPT: «напиши скрипт на Python для сбора всех страниц с сайта X, обходя rate limiting через ротацию User-Agent и задержки». Модель выдаст рабочий код за секунды. Специализированные фреймворки вроде Crawl4AI и Scrapy с интеграцией LLM-парсеров автоматически определяют структуру страницы и извлекают целевые данные без ручной настройки селекторов. Тысячи независимых архивов - от краеведческих баз данных до научных репозиториев - оказались под ударом, потому что их создатели не закладывали защиту от машинного трафика такой интенсивности.
Экономика ботов: кто платит за защиту и почему это дорого
Боты не кликают по рекламе, не оформляют подписки и не приносят доход. Они потребляют вычислительные ресурсы, генерируют счета за хостинг и увеличивают нагрузку на базы данных. Для владельца сайта каждый гигабайт скрейпленного трафика - прямой убыток. Проблема усугубляется тем, что облачные провайдеры тарифицируют исходящий трафик, а CDN-сервисы вроде Cloudflare берут плату за объём обработанных запросов.
Кейс iFixit: когда боты съедают бюджет на хостинг
iFixit, крупнейшая база руководств по ремонту электроники, столкнулась с лавинообразным ростом трафика от AI-ботов в 2025 году. Генеративные модели массово собирали инструкции для обучения - каждый запрос к странице руководства тянул за собой десятки изображений высокого разрешения. Счета за CDN выросли на десятки тысяч долларов в месяц. Компания была вынуждена внедрить агрессивный rate limiting и блокировку по сигнатурам ботов, что замедлило доступ и для легитимных пользователей.
Read the Docs: борьба за выживание документации
Read the Docs, бесплатный хостинг для технической документации, также пострадал от скрейпинга. Проект существует на спонсорские взносы и не имеет бюджета на фильтрацию трафика уровня enterprise. В 2025 году команда зафиксировала, что более 60% запросов к популярным проектам исходят от ботов. В ответ пришлось ввести квоты на анонимный доступ и приоритизировать трафик аутентифицированных пользователей. Ситуация парадоксальна: документация, созданная для открытого распространения знаний, вынуждена закрываться от машин, которые эти знания потребляют.
Cloudflare оценивает, что фильтрация ботов уровня Business обходится от $200 в месяц, а Enterprise-решения с поведенческим анализом - от $3000. Для малого сайта с доходом от рекламы в $500-1000 эти цифры делают защиту экономически бессмысленной.
Polymarket и целенаправленные атаки: новая мотивация для скрейпинга
Рынки прогнозов создали финансовый стимул для получения данных с опережением. Polymarket, где объём ставок на события в индустрии развлечений превысил $200 млн в 2025 году, предлагает контракты на кассовые сборы фильмов в премьерный уикенд. Разница в несколько минут между получением данных и их публикацией в открытых источниках конвертируется в прибыль.
Как данные скрейпинга монетизируются на рынках прогнозов
Механизм прямолинеен. Участник рынка прогнозов настраивает ботов на мониторинг сайтов с киноданными в реальном времени. При появлении цифр пятничных сборов бот мгновенно извлекает их и передаёт владельцу, который делает ставку до того, как информация распространится. Аналогичные схемы работают на данных о спортивных трансферах, политических опросах и корпоративных отчётах. Скрейпинг превращается из пассивного сбора данных в активное оружие конкурентной борьбы, где жертва - инфраструктура сайта-источника.
Этот тренд коррелирует с общим ростом использования AI в кибератаках. Бенчмарк CyberGym показал, что нейросети уже справляются с задачами пентеста на уровне junior-специалиста, а автоматизация разведки перед атакой сокращает время подготовки с дней до минут.
Как защитить сайт от AI-скрейпинга: практические стратегии
Защита от AI-скрейпинга требует комбинации технических и организационных мер. Универсального решения нет - выбор зависит от архитектуры сайта, бюджета и критичности данных. Принципиальный момент: злонамеренные боты игнорируют robots.txt, поэтому полагаться только на него нельзя.
Технические меры: от robots.txt до машинного обучения
Базовый уровень: настройка robots.txt с указанием директив для легитимных краулеров и указанием sitemap. Это не остановит злонамеренных ботов, но снизит нагрузку от поисковиков и респектабельных AI-компаний, соблюдающих стандарт.
Средний уровень: rate limiting на уровне веб-сервера или обратного прокси. Nginx позволяет ограничить количество запросов с одного IP в минуту. Для старых сайтов с 160 000 файлов критично настроить кэширование - хотя бы на уровне HTTP-заголовков Cache-Control и ETag, чтобы повторные запросы к статике не нагружали диск.
Продвинутый уровень: Web Application Firewall с сигнатурами ботов, анализ поведения (частота запросов, паттерны навигации, заголовки), JavaScript-челленджи. Cloudflare и Akamai предлагают такие функции в коммерческих тарифах. Для сайтов с бюджетом можно рассмотреть open-source решения: Fail2ban с кастомными правилами, модуль mod_evasive для Apache.
Отдельный вектор - настройка robots.txt для ретривал-ботов и микроразметка Schema.org, которая позволяет поисковым системам получать структурированные данные без скрейпинга страниц. Чем больше данных отдаётся через API и разметку, тем меньше стимулов для ботов парсить HTML.
Экономическая целесообразность: когда защита окупается
Для принятия решения о инвестициях в защиту сравните два числа: стоимость трафика, потребляемого ботами, и цену внедрения защиты. Если ежемесячный счёт за хостинг на 40% состоит из бот-трафика, а фильтрация стоит $200 - внедрение окупается. Если сайт приносит $100 в месяц, а защита требует $500 - экономического смысла нет, и стоит рассмотреть миграцию на статический хостинг с бесплатным CDN (Cloudflare Free, Netlify) и агрессивным кэшированием.
Для независимых архивов практичным решением становится гибридная модель: основной контент остаётся открытым, а детальные данные (исторические выборки, сырые датасеты) переносятся за API с квотами. Это снижает поверхность для скрейпинга и создаёт точку контроля доступа.
Будущее интернета: от открытости к обороне
Интернет проектировался как открытая среда для обмена информацией между людьми. Модель «публикуй и будь найден» работала, пока потребителями контента были пользователи, которые могли кликнуть по рекламе, оставить комментарий или стать частью сообщества. AI-боты сломали этот негласный контракт: они потребляют контент в промышленных масштабах, не возвращая трафик, не создавая engagement и не принося дохода.
Реакция неизбежна. Крупные платформы уже вводят платные API взамен открытого доступа: Reddit, Stack Overflow, Twitter/X перешли на модели монетизации данных для обучения AI. Независимые сайты оказываются перед выбором: внедрять защиту, закрывать контент за paywall или принимать убытки. Тысячи архивов, подобных TheNumbers.com, находятся в зоне риска - их ценность как источников структурированных данных для обучения моделей растёт, а ресурсы на защиту остаются неизменными.
Прогноз на 2027 год: фрагментация открытого веба ускорится. Данные, которые раньше были доступны одним кликом, переедут за API с аутентификацией и биллингом. Появятся специализированные сервисы-агрегаторы, лицензирующие контент у источников и продающие доступ к нему AI-компаниям. Для конечного пользователя это означает больше платных подписок и меньше свободно доступной информации. Для владельцев сайтов - необходимость пересматривать архитектуру с учётом того, что боты теперь постоянный и агрессивный потребитель ресурсов.
Случай TheNumbers.com - ранний сигнал тектонического сдвига. Инциденты с побегом AI-моделей из песочниц и их способность к автономным атакам показывают, что проблема выходит за рамки скрейпинга. Мы входим в фазу, где защита контента от машин становится базовым требованием к веб-инфраструктуре, а не опциональной функцией.