Перейти к содержанию
Публикация AiManual

AEO и GEO в 2026: как настроить robots.txt для AI-краулеров и не потерять видимость в ответах нейросетей

Как настроить robots.txt для AI-краулеров: разрешить GPTBot, OAI-SearchBot, ClaudeBot и PerplexityBot, не открывая служебные разделы. Готовый конфиг, проверки ч

Коротко

Что будет в материале

  1. 01

    Почему стандартное SEO больше не гарантирует видимость в AI-поисковиках

  2. 02

    Кто стучится в ваш сайт: обзор AI-краулеров 2026 года

  3. 03

    Разбор типичной ошибки: как Disallow закрывает AI-поисковикам весь сайт

  4. 04

    Пошаговая настройка robots.txt для AI-краулеров

Стандартная SEO-оптимизация не гарантирует видимость сайта в ChatGPT, Perplexity и других AI-поисковиках. На практике сначала нужно проверить доступ краулеров: один неверный Disallow в robots.txt может закрыть публичные страницы, а открытый файл не поможет, если контент блокируется CDN или появляется только после выполнения клиентского JS.

Это руководство поможет настроить robots.txt для AI-краулеров, сохранить доступ к публичному контенту и закрыть чувствительные разделы. Здесь есть готовые конфигурации, проверки через curl и команды для анализа серверных логов.

Короткий итог: для публичных страниц обычно достаточно явно разрешить нужных AI-ботов через Allow: /. Для административных, личных и служебных путей используйте точечный Disallow. Сразу после изменения проверьте три вещи: ответ страницы через curl, отсутствие блокирующего X-Robots-Tag и записи в access.log со статусом 200.

БотНазначениеЧто разрешатьЧто проверять
GPTBotСбор данных для обучения моделей OpenAIAllow: / для публичного контента, либо точечные правилаcurl, 403/200, записи в логах
OAI-SearchBotПоисковые функции ChatGPTAllow: / для страниц, которые должны находиться в AI-поискеОтвет страницы и наличие текста в HTML
ClaudeBotСбор данных для моделей ClaudeДоступ к публичным разделам, служебные пути закрытьОтвет CDN/WAF и записи в access.log
PerplexityBotИндексация для PerplexityДоступ к публичным страницам по политике сайта403, редиректы и фактические запросы

Почему стандартное SEO больше не гарантирует видимость в AI-поисковиках

AI-поисковики не ограничиваются классическим ранжированием по ссылочной массе и поведенческим факторам. Они извлекают факты из контента, упаковывают их в ответ и иногда показывают только несколько источников. ChatGPT Search, Perplexity и аналогичные системы работают по модели RAG (Retrieval-Augmented Generation): краулер собирает данные, система дробит их на чанки, а при запросе пользователя подбирает релевантные фрагменты и генерирует ответ.

Механика отличается от привычной поисковой индексации. Если Googlebot индексирует страницу для выдачи по ключевым словам, то GPTBot собирает данные для обучения моделей, а OAI-SearchBot используется для поисковых функций ChatGPT. Блокировка одного из этих ботов закрывает соответствующий этап обработки. Сайт может хорошо ранжироваться в Google и при этом не появляться в ответах ChatGPT из-за правил robots.txt или сетевой блокировки.

Доля запросов от AI-краулеров и переходов из AI-ответов зависит от типа сайта, аудитории, настроек инфраструктуры и политики конкретного сервиса. Поэтому универсальные оценки вроде «10-15% трафика» без данных собственных логов использовать не стоит. Техническая оптимизация для нейровыдачи начинается с проверки доступа: без неё усилия по чанкованию и микроразметке могут не дать результата.

Кто стучится в ваш сайт: обзор AI-краулеров 2026 года

Экосистема AI-краулеров шире, чем один GPTBot. У разных сервисов могут быть разные боты для обучения моделей, поисковой индексации и сбора данных для RAG-систем. Перед блокировкой определите, какой тип доступа нужен вашему сайту: разрешение обучения не равно разрешению поисковой индексации.

GPTBot: краулер OpenAI для обучения моделей

User-agent: GPTBot. Назначение - сбор данных для обучения моделей GPT. Этот бот сканирует страницы и может использовать найденный контент в тренировочных наборах OpenAI. Сам по себе GPTBot не отвечает за появление страницы в результатах ChatGPT Search.

Блокировка GPTBot не исключает сайт из поисковых функций ChatGPT, но закрывает один из каналов использования контента для обучения. Если политика сайта запрещает такое использование, GPTBot можно заблокировать отдельно, оставив доступ OAI-SearchBot.

OAI-SearchBot: поисковый бот OpenAI

User-agent: OAI-SearchBot. Цель - индексация для поисковых функций ChatGPT. В отличие от GPTBot, этот краулер предназначен для поиска актуальной информации по запросу пользователя, а не для обучения моделей.

Разделение на GPTBot и OAI-SearchBot важно учитывать в robots.txt. Можно закрыть GPTBot и открыть OAI-SearchBot, если сайт должен сохранять видимость в ChatGPT Search, но не разрешать сбор данных для обучения. Для появления в результатах поиска внутри ChatGPT нужен доступ именно к поисковому конвейеру, однако одно разрешение в robots.txt не гарантирует цитирование страницы.

ClaudeBot и другие: экосистема Anthropic и Perplexity

User-agent: ClaudeBot. Краулер Anthropic собирает данные для моделей Claude. Отдельный поисковый бот Anthropic на момент подготовки материала публично не заявлен, поэтому правила для ClaudeBot следует связывать с выбранной политикой использования контента, а не с гарантией поисковых переходов.

PerplexityBot используется для индексации веба в системе Perplexity. Соблюдение robots.txt и фактическое поведение нужно проверять по документации сервиса и собственным логам, а не предполагать заранее. Список AI-краулеров меняется, поэтому robots.txt и правила CDN/WAF стоит периодически пересматривать.

Разбор типичной ошибки: как Disallow закрывает AI-поисковикам весь сайт

Типовая ситуация выглядит так: сайт хорошо доступен пользователям и индексируется Google, но его страницы не появляются в AI-поиске. Первое, что стоит проверить, - общий запрет в robots.txt:

User-agent: *
Disallow: /

Такое правило закрывает сайт для всех краулеров, включая GPTBot, OAI-SearchBot, ClaudeBot и PerplexityBot, если для них выше или отдельно не заданы более подходящие правила. Из-за этого ресурс может потерять доступность для соответствующих этапов AI-индексации. Точные сроки появления изменений и долю переходов заранее обещать нельзя: они зависят от частоты обхода, качества контента и работы самого сервиса.

Исправление состоит не в безусловном открытии всего сайта, а в явном выборе политики: разрешить публичные разделы нужным ботам и сохранить запрет для admin, personal, api и других чувствительных путей. Атаки AI-ботов на веб-сайты - смежная проблема, поэтому доступность нужно сопоставлять с защитой от избыточного скрейпинга.

Пошаговая настройка robots.txt для AI-краулеров

Настройка сводится к добавлению блоков с директивами Allow для каждого AI-бота и точечных Disallow для закрытых путей. User-agent указывает на конкретного бота, Allow разрешает обход, а Disallow запрещает его. Итоговое поведение зависит от сочетания групп и наиболее специфичных правил пути, поэтому конфликтующие директивы нужно проверять отдельно.

Базовый шаблон: разрешаем публичный контент AI-ботам

Минимальная конфигурация для сайта, где публичные страницы должны быть доступны перечисленным краулерам:

# AI Crawlers
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Traditional crawlers
User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /

Последний блок с User-agent: * и Disallow: / закрывает доступ ботам, которые не перечислены выше. Перед применением убедитесь, что это соответствует вашей политике: для публичного сайта такой вариант не является универсально безопасным, потому что неизвестные краулеры тоже не получат доступ.

Тонкая настройка: закрываем только чувствительные разделы

Если на сайте есть административные или личные разделы, их можно точечно закрыть для AI-краулеров, сохранив доступ к основному контенту:

User-agent: GPTBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

User-agent: OAI-SearchBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

User-agent: ClaudeBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

User-agent: PerplexityBot
Allow: /
Disallow: /admin/
Disallow: /personal/
Disallow: /api/

Типичная ошибка - перекрытие правил. Если для User-agent: GPTBot стоит Disallow: /, а затем ожидается, что Allow: /public/ автоматически откроет раздел, итог нужно проверить по правилам конкретного парсера robots.txt: при конфликте учитывается наиболее специфичный путь. Проверять конфигурацию удобно через инструмент проверки robots.txt в Google Search Console или аналоги.

Слепые зоны: почему открытый robots.txt не гарантирует индексацию

Robots.txt - это инструкция для добросовестных краулеров, а не принудительный механизм доступа. Даже при корректном файле сайт может оставаться невидимым из-за рендеринга контента, HTTP-заголовков или сетевой инфраструктуры.

Клиентский JS: когда бот видит пустую страницу

AI-краулеры не всегда исполняют JavaScript одинаково. GPTBot и OAI-SearchBot могут поддерживать рендеринг JS, но задержка и покрытие зависят от страницы и текущей реализации сервиса. ClaudeBot и PerplexityBot также могут хуже обрабатывать динамический контент. Если сайт построен на React, Vue или Angular без серверного рендеринга (SSR), бот может получить пустой index.html с тегом div id="root" и нулевым текстовым содержимым.

Решение - серверный рендеринг или динамический рендеринг для ботов, если это допустимо для архитектуры и политики сайта. Для диагностики используйте curl с подстановкой User-agent:

curl -A 'GPTBot' https://your-site.com/page

Если в ответе приходит пустая оболочка без текста статьи, проблема может быть в клиентском рендеринге. Сравните HTML для GPTBot, OAI-SearchBot и Googlebot и отдельно проверьте, не меняет ли CDN содержимое ответа.

CDN и WAF: невидимый барьер для AI-краулеров

Cloudflare, Akamai и другие CDN могут блокировать запросы по User-agent, IP-репутации или правилам Bot Management. В результате GPTBot или ClaudeBot получают 403 или капчу, хотя origin-сервер вообще не видит запроса.

В правилах WAF проверьте исключения для GPTBot, OAI-SearchBot, ClaudeBot и PerplexityBot. Разрешать им доступ без проверок на ботов стоит только в пределах выбранной политики безопасности и с учётом проверки источника запросов. Статус «известные боты» в панели CDN не заменяет анализ логов: правила и сигнатуры провайдера могут обновляться с задержкой. AI-агенты уже меняют рынок облачных услуг, поэтому доступ к документации и публичным страницам лучше контролировать отдельно.

Частые ошибки при настройке robots.txt для AI-краулеров

  • Перекрывающий Disallow. Общий запрет Disallow: / может закрыть нужному боту весь сайт, если правила для конкретного User-agent отсутствуют или составлены с конфликтом.
  • X-Robots-Tag. HTTP-заголовок может запретить индексацию или использование страницы независимо от robots.txt. Проверяйте его в ответе curl.
  • CDN/WAF. Страница может возвращать 403 на уровне Cloudflare, Akamai или другого CDN и не доходить до origin-сервера.
  • JS-only рендеринг. В robots.txt доступ открыт, но HTML содержит только оболочку React, Vue или Angular без текста статьи.
  • Редиректы и закрытые конечные URL. Цепочки 301/302, переход на авторизацию или итоговый 404 делают страницу недоступной для полноценного обхода.

Как проверить, что AI-краулер действительно видит ваш контент

Два метода диагностики - быстрый через curl и системный через анализ логов. Они позволяют проверить фактический HTTP-ответ, а не только содержимое robots.txt.

Эмуляция запроса с помощью curl

Команда для проверки доступности страницы под User-agent GPTBot:

curl -I -A 'Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.0; +https://openai.com/gptbot' https://your-site.com/target-page

Проверьте HTTP-статус: 200 означает, что запрос принят, 403 - блокировку, 404 - отсутствие страницы. Заголовок Content-Type для HTML обычно должен быть text/html. Наличие X-Robots-Tag может ограничивать обработку страницы на уровне HTTP-заголовков. Для проверки самого контента уберите флаг -I и добавьте | grep для поиска ключевых фраз из статьи.

Повторите проверку для ClaudeBot, OAI-SearchBot и PerplexityBot с соответствующими User-agent. Различия в ответах укажут на правила CDN, WAF, маршрутизацию или условную выдачу контента.

Анализ серверных логов

Фильтрация access.log по User-agent показывает, доходят ли запросы до origin-сервера:

grep 'GPTBot' /var/log/nginx/access.log
# или для нескольких ботов сразу:
grep -E 'GPTBot|ClaudeBot|OAI-SearchBot|PerplexityBot' /var/log/nginx/access.log

Смотрите на коды ответа: 200 - успешная отдача страницы, 403 - блокировка на уровне сервера или CDN, 404 - битая ссылка или отсутствующий путь, 301/302 - редирект. Инструменты вроде GoAccess помогают визуализировать статистику по ботам.

Если лог пустой, краулеры не дошли до сервера. Причина может быть в robots.txt, DNS или блокировке CDN до origin-сервера. Если в логах есть 403, ищите правило WAF или приложения; если есть 200, но HTML пустой, проверяйте JS-рендеринг.

AEO и GEO: как вписать техническую оптимизацию в общую стратегию

Настройка robots.txt - гигиенический минимум. Она открывает доступ, но не гарантирует, что контент попадёт в ответы нейросетей. AEO (Answer Engine Optimization) и GEO (Generative Engine Optimization) - более широкие концепции, включающие структурирование контента под извлечение фактов, работу с авторитетностью источников и цитируемостью.

После проверки доступа важны структурированные данные schema.org (Article, FAQ, HowTo), самодостаточные чанки текста с перекрытием по смыслу и регулярное обновление контента. AI-поисковики лучше обрабатывают страницы, которые прямо и фактологично отвечают на вопрос, без маркетинговых обёрток и воды. Практическое руководство по технической оптимизации для нейровыдачи детально разбирает эти аспекты.

Техническая доступность и контентная оптимизация работают в связке. Открытый robots.txt без качественного контента не гарантирует цитирования, а идеально структурированная статья с закрытым доступом не попадёт в индекс AI-поисковика. Проверьте оба уровня и оценивайте результат по собственным логам, переходам и появлению страниц в ответах ChatGPT и Perplexity.

Подписаться на канал