Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

AEO и GEO в 2026: как настроить robots.txt для AI-краулеров и не потерять видимость в ответах нейросетей

Один неверный Disallow в robots.txt — и ваш сайт исчезает из ответов ChatGPT, Perplexity и Claude. Пошаговая настройка доступа для GPTBot, OAI-SearchBot и Claud

Коротко

Что будет в материале

  1. 01

    Почему стандартное SEO больше не гарантирует видимость в AI-поисковиках

  2. 02

    Кто стучится в ваш сайт: обзор AI-краулеров 2026 года

  3. 03

    Реальный кейс: как один Disallow сделал сайт невидимым для трёх AI-поисковиков

  4. 04

    Пошаговая настройка robots.txt для AI-краулеров

Стандартная SEO-оптимизация больше не гарантирует попадание сайта в ответы ChatGPT, Perplexity и других AI-поисковиков. Один неверный Disallow в robots.txt способен сделать сайт невидимым для трёх из четырёх крупных AI-ботов. При этом даже открытый robots.txt не спасает, если контент рендерится на клиентском JS или блокируется на уровне CDN. Проверить реальную доступность сайта можно с помощью curl и логов сервера - именно этому посвящён материал.

К середине 2026 года AI-поисковики перестали быть экспериментальными игрушками. ChatGPT Search, Perplexity, Claude с функцией поиска - все они активно индексируют веб, а их краулеры работают по собственным правилам. Традиционная SEO-стратегия, заточенная под Googlebot и YandexBot, оставляет слепые зоны размером с весь AI-трафик. Термины AEO (Answer Engine Optimization) и GEO (Generative Engine Optimization) описывают новую реальность: оптимизация под ответы нейросетей требует отдельного подхода, и настройка robots.txt - его фундамент.

В этом руководстве разберём, кто именно стучится в ваш сайт из AI-экосистемы, как одним файлом открыть или закрыть им доступ, какие неочевидные барьеры остаются после настройки robots.txt и как проверить, что боты действительно видят контент. Без воды, с конкретными конфигурациями и командами для диагностики.

Почему стандартное SEO больше не гарантирует видимость в AI-поисковиках

AI-поисковики не ранжируют страницы по ссылочной массе и поведенческим факторам в классическом понимании. Они извлекают факты из контента, упаковывают их в ответ и часто вообще не показывают список ссылок. ChatGPT Search, Perplexity и аналогичные системы работают по модели RAG (Retrieval-Augmented Generation): краулер собирает данные, система дробит их на чанки, а при запросе пользователя подбирает релевантные фрагменты и генерирует ответ.

Механика принципиально иная, чем у поисковых систем десятилетней давности. Если Googlebot индексирует страницу для выдачи по ключевым словам, то GPTBot собирает данные для обучения моделей, а OAI-SearchBot - для поисковых функций ChatGPT. Блокировка любого из этих ботов означает исключение из соответствующего этапа конвейера. Сайт может идеально ранжироваться в Google и одновременно отсутствовать в ответах ChatGPT - просто потому, что robots.txt закрывает доступ нужному краулеру.

По данным серверных логов крупных информационных проектов, доля запросов от AI-краулеров в 2026 году достигает 10-15% от общего трафика ботов. При этом конверсия из AI-ответов в переходы на сайт растёт: пользователи всё чаще кликают по источникам, которые цитирует нейросеть. Техническая оптимизация для нейровыдачи начинается именно с доступа - без него все усилия по чанкованию и микроразметке теряют смысл.

Кто стучится в ваш сайт: обзор AI-краулеров 2026 года

Экосистема AI-краулеров шире, чем один GPTBot. Каждый крупный игрок запускает собственных ботов с разными целями: обучение моделей, поисковая индексация, сбор данных для RAG-систем. Блокировка любого из них приводит к потере видимости в соответствующем AI-сервисе.

GPTBot: краулер OpenAI для обучения моделей

User-agent: GPTBot. Назначение - сбор данных для обучения моделей GPT. Этот бот сканирует страницы и добавляет контент в тренировочный датасет OpenAI. Прямого влияния на появление сайта в ответах ChatGPT он не оказывает, но косвенное огромно: если модель обучена на вашем контенте, она с большей вероятностью воспроизведёт факты из него при генерации ответа.

Блокировка GPTBot не исключает сайт из поисковых функций ChatGPT, но лишает его присутствия в «памяти» модели. На практике это означает, что при запросах, требующих глубокого знания предмета, ChatGPT обратится к другим источникам - тем, которые были в обучающей выборке.

OAI-SearchBot: новый поисковый бот OpenAI

User-agent: OAI-SearchBot. Цель - индексация для поисковых функций ChatGPT. В отличие от GPTBot, этот краулер не используется для обучения моделей. Он работает как классический поисковый робот: обходит страницы, чтобы ChatGPT мог находить актуальную информацию по запросу пользователя в реальном времени.

Разделение на GPTBot и OAI-SearchBot - принципиальный момент. Многие вебмастера блокируют GPTBot, опасаясь использования контента для обучения, но при этом хотят оставаться в поиске ChatGPT. OpenAI предоставляет такую возможность: можно закрыть доступ GPTBot и открыть OAI-SearchBot. Для попадания в результаты поиска внутри ChatGPT критически важно разрешить именно OAI-SearchBot.

ClaudeBot и другие: не забываем об экосистеме Anthropic

User-agent: ClaudeBot. Краулер от Anthropic собирает данные для моделей Claude. По аналогии с OpenAI, Anthropic разделяет ботов для обучения и для поисковых функций, хотя по состоянию на июль 2026 года отдельный поисковый бот Anthropic ещё не анонсирован публично.

PerplexityBot - ещё один важный игрок. Perplexity активно индексирует веб для своей вопросно-ответной системы и не всегда строго соблюдает robots.txt, что подтверждается независимыми аудитами серверных логов. Рекомендация здесь однозначная: явно прописывать правила для PerplexityBot, даже если нет гарантий их соблюдения. Список актуальных AI-краулеров пополняется ежемесячно, поэтому аудит robots.txt стоит проводить регулярно.

Реальный кейс: как один Disallow сделал сайт невидимым для трёх AI-поисковиков

Технический блог компании-разработчика с качественными статьями по машинному обучению. Трафик из Google стабильный - около 50 тысяч посетителей в месяц. Контент цитируют отраслевые издания. При этом в ответах ChatGPT, Perplexity и Claude сайт отсутствовал полностью.

Диагностика заняла 15 минут. В robots.txt стояла директива:

User-agent: *
Disallow: /

Администратор сервера добавил это правило для защиты от скрейпинга, не разделяя обычных краулеров и AI-ботов. Результат: GPTBot, ClaudeBot и PerplexityBot честно соблюдали инструкцию и не индексировали сайт. Три из четырёх крупных AI-поисковиков считали ресурс пустым.

После исправления robots.txt - добавления разрешающих правил для AI-краулеров - сайт появился в ответах ChatGPT Search через четыре дня. Трафик из AI-поисковиков за первый месяц составил 8% от общего поискового трафика, при этом показатель отказов оказался вдвое ниже, чем у переходов из Google. Аудитория, приходящая через AI-ответы, уже получила контекст из сгенерированного фрагмента и переходила за деталями.

Этот кейс не уникален. Атаки AI-ботов на веб-сайты - смежная проблема, где владельцы ресурсов, наоборот, страдают от избыточного внимания краулеров. Баланс между доступностью и защитой настраивается именно в robots.txt.

Пошаговая настройка robots.txt для AI-краулеров

Настройка сводится к добавлению блоков с директивами Allow для каждого AI-бота. Синтаксис стандартный: User-agent указывает на конкретного бота, Allow разрешает индексацию, Disallow запрещает. Правила обрабатываются сверху вниз, более специфичные имеют приоритет над общими.

Базовый шаблон: разрешаем всё для AI-ботов

Минимальная рабочая конфигурация для публичного контента:

# AI Crawlers
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Traditional crawlers
User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /

Последний блок с User-agent: * и Disallow: / закрывает доступ всем ботам, которые не перечислены выше. Это безопасная практика: вы явно перечисляете, кому открыт доступ, а все остальные получают запрет. Если сайт предназначен для публичного доступа, такая конфигурация не несёт рисков.

Тонкая настройка: закрываем только чувствительные разделы

Если на сайте есть административные или личные разделы, их можно точечно закрыть для AI-краулеров, сохранив доступ к основному контенту:

User-agent: GPTBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

User-agent: OAI-SearchBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

User-agent: ClaudeBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

Типичная ошибка - перекрытие правил. Если для User-agent: GPTBot сначала стоит Disallow: /, а затем Allow: /public/, то доступ будет открыт только к /public/. Порядок директив имеет значение: Disallow перекрывает Allow, если они конфликтуют на одном уровне пути. Проверять итоговую конфигурацию удобно через инструмент проверки robots.txt в Google Search Console или аналоги.

Слепые зоны: почему открытый robots.txt не гарантирует индексацию

Robots.txt - это инструкция, а не принудительное правило. Добросовестные краулеры её соблюдают, но даже при идеально настроенном файле сайт может оставаться невидимым. Причины - на уровне рендеринга контента и сетевой инфраструктуры.

Клиентский JS: когда бот видит пустую страницу

AI-краулеры не всегда исполняют JavaScript. GPTBot и OAI-SearchBot, по данным OpenAI, поддерживают рендеринг JS, но с задержкой и не для всех страниц. ClaudeBot и PerplexityBot в меньшей степени способны обрабатывать динамический контент. Если сайт построен на React, Vue или Angular без серверного рендеринга (SSR), бот может получить пустой index.html с тегом div id="root" и нулевым текстовым содержимым.

Решение - серверный рендеринг или динамический рендеринг для ботов. Для диагностики используйте curl с подстановкой User-agent:

curl -A 'GPTBot' https://your-site.com/page

Если в ответе приходит пустая оболочка без текста статьи - проблема в клиентском рендеринге. Сравните с ответом для Googlebot: Googlebot выполняет JS давно и качественно, AI-краулеры пока отстают.

CDN и WAF: невидимый барьер для AI-краулеров

Cloudflare, Akamai и другие CDN автоматически блокируют запросы от неизвестных User-agent. Bot Management в Cloudflare по умолчанию может считать GPTBot или ClaudeBot подозрительным трафиком и возвращать 403 или капчу. В логах CDN это выглядит как серия заблокированных запросов с HTTP-статусом 403, хотя сервер их вообще не получает.

Настройка: в правилах WAF создать исключения для User-agent GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot. Разрешить им доступ без проверок на ботов. Важно отслеживать обновления: Cloudflare периодически добавляет сигнатуры AI-краулеров в «известные боты», но процесс не мгновенный. AI-агенты уже меняют рынок облачных услуг, и провайдеры вроде Timeweb Cloud фиксируют, что до трети запросов к документации приходит от ботов. Игнорировать этот трафик - терять потенциальных клиентов.

Как проверить, что AI-краулер действительно видит ваш контент

Два метода диагностики: быстрый через curl и системный через анализ логов. Оба дают объективную картину без догадок.

Эмуляция запроса с помощью curl

Команда для проверки доступности страницы под видом GPTBot:

curl -I -A 'Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.0; +https://openai.com/gptbot' https://your-site.com/target-page

Ключевые параметры для анализа ответа: HTTP-статус (200 - доступ открыт, 403 - блокировка, 404 - страница не найдена), заголовок Content-Type (должен быть text/html), наличие X-Robots-Tag (может переопределять robots.txt на уровне HTTP-заголовков). Для полной проверки контента уберите флаг -I и добавьте | grep для поиска ключевых фраз из статьи.

Аналогичные проверки - для ClaudeBot и OAI-SearchBot с соответствующими User-agent. Различия в ответах для разных ботов укажут на проблему в настройках CDN или WAF.

Анализ серверных логов

Фильтрация access.log по User-agent показывает реальную картину посещений:

grep 'GPTBot' /var/log/nginx/access.log
# или для нескольких ботов сразу:
grep -E 'GPTBot|ClaudeBot|OAI-SearchBot|PerplexityBot' /var/log/nginx/access.log

На что смотреть: коды ответа 200 - успешная индексация, 403 - блокировка на уровне сервера или CDN, 404 - битые ссылки или закрытые разделы, 301/302 - редиректы, которые могут запутывать краулер. Инструменты вроде GoAccess позволяют визуализировать статистику по ботам в реальном времени.

Если лог пустой - краулеры вообще не доходят до сервера. Причина либо в robots.txt с Disallow, либо в блокировке на уровне CDN до того, как запрос достигает origin-сервера.

AEO и GEO: как вписать техническую оптимизацию в общую стратегию

Настройка robots.txt - гигиенический минимум. Он открывает дверь, но не гарантирует, что контент попадёт в ответы нейросетей. AEO (Answer Engine Optimization) и GEO (Generative Engine Optimization) - более широкие концепции, которые включают структурирование контента под извлечение фактов, работу с авторитетностью источников и цитируемостью.

После того как доступ открыт, критически важны: структурированные данные schema.org (Article, FAQ, HowTo), самодостаточные чанки текста с перекрытием по смыслу, регулярное обновление контента. AI-поисковики отдают предпочтение страницам, которые прямо и фактологично отвечают на вопрос, без маркетинговых обёрток и воды. Практическое руководство по технической оптимизации для нейровыдачи детально разбирает эти аспекты.

Техническая доступность и контентная оптимизация работают в связке. Открытый robots.txt без качественного контента не даст цитирований. Идеально структурированная статья с закрытым доступом не попадёт в индекс AI-поисковика. Проверьте оба уровня - и вы получите канал трафика, который в 2026 году растёт быстрее классического поискового.

Подписаться на канал