B2BPRO.KZ | Рекламное агентство в Алматы

Как проверить, видят ли ИИ-краулеры ваш сайт: GPTBot, ClaudeBot и PerplexityBot

3D-иллюстрация: SEO-специалист за ноутбуком, к странице сайта с замком подлетают роботы-краулеры

Чтобы понять, видят ли ИИ-краулеры ваш сайт, проверьте три вещи: что написано в robots.txt для ботов OpenAI, Anthropic и Perplexity, что отвечает сервер на запрос с их User-Agent и есть ли эти боты в логах за последние недели. Если все три проверки чистые, а страницы индексируются, доступ для ИИ-систем у вас открыт.

На проектах B2BPRO.KZ мы регулярно видим одну и ту же картину. Сайт нормально ранжируется в Google, владелец хочет попасть в ответы ChatGPT или Perplexity, а ботов не пускает защита хостинга или плагин безопасности, о котором давно никто не вспоминал. Проверка занимает около получаса и не требует разработчика.

Какие ИИ-краулеры приходят на сайт и чем они различаются

ИИ-краулеры делятся на три группы: боты для обучения моделей, боты для поиска и боты, которые заходят на страницу по запросу конкретного пользователя. Краулер: программа, которая обходит страницы сайта и скачивает их содержимое. От того, к какой группе относится бот, зависит, нужно ли ему открывать доступ.

Названия и назначение ботов мы сверили с официальными справками компаний: документация OpenAI по ботам, справка Anthropic о краулерах и страница Perplexity о своих ботах.

Бот Компания Для чего заходит Как относится к robots.txt
OAI-SearchBot OpenAI показ сайтов в поиске ChatGPT учитывает
GPTBot OpenAI сбор материалов, которые могут пойти на обучение моделей учитывает
ChatGPT-User OpenAI действия, которые запускает пользователь в ChatGPT правила robots.txt могут не применяться
ClaudeBot Anthropic сбор материалов, которые могут пойти на обучение учитывает
Claude-SearchBot Anthropic улучшение качества поиска Claude учитывает
Claude-User Anthropic доступ к странице, когда пользователь задаёт вопрос Claude учитывает
PerplexityBot Perplexity показ сайтов и ссылок в поиске Perplexity компания советует разрешить
Perplexity-User Perplexity заход на страницу по запросу пользователя как правило, игнорирует

Google стоит особняком. Отдельного ИИ-краулера для обычного поиска у него нет: за AI-обзоры отвечает тот же Googlebot, а токен Google-Extended в robots.txt управляет только использованием материалов для Gemini. Подробнее об этом ниже.

Как проверить robots.txt за пять минут

Откройте адрес вашдомен.kz/robots.txt в браузере и найдите в нём блоки для ИИ-ботов. Файл лежит в корне сайта, и его видит любой посетитель, поэтому ничего устанавливать не нужно.

  1. Убедитесь, что файл открывается с кодом 200, а не перенаправляет на другую страницу и не отдаёт ошибку.
  2. Найдите строки User-agent: с названиями GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot и Google-Extended.
  3. Посмотрите общий блок User-agent: *. Если в нём стоит Disallow: /, сайт закрыт для всех ботов, у которых нет собственного блока.
  4. Проверьте, что под Disallow не попали разделы, которые вы хотите показывать: каталог услуг, блог, страницы кейсов.

Если вы хотите попасть в поиск ChatGPT, но не отдавать материалы на обучение, файл выглядит так:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

Настройки OpenAI независимы: можно пускать OAI-SearchBot и закрывать GPTBot. Изменения в robots.txt вступают в силу не мгновенно: OpenAI и Perplexity пишут, что нужно до 24 часов.

Для примера: в robots.txt нашего сайта b2bpro.kz отдельных правил для ИИ-ботов нет. Действует общий блок, который закрывает служебные разделы вроде /wp-admin/ и /wp-json/, а всё остальное открыто. Для компании, которая продаёт услуги, это рабочая позиция по умолчанию.

Как проверить, что сервер отдаёт страницы ботам, а не только людям

Запросите страницу с User-Agent бота и посмотрите код ответа. Это самая быстрая проверка того, что защита сайта не режет незнакомых посетителей. В терминале команда выглядит так:

curl -I -A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" https://вашдомен.kz/

Код 200 означает, что страница доступна. Коды 403, 429 и 503 или ответ-заглушка с проверкой браузера говорят о том, что бота отсекают. Мы прогнали b2bpro.kz этим способом 10 октября 2026 года: запрос с User-Agent GPTBot вернул 200.

У такой проверки есть предел. Она ловит блокировки по User-Agent. Если защита сверяет IP-адрес с опубликованным списком адресов компании, ваш запрос с рабочего компьютера может пройти, а настоящий бот нет. Актуальные списки адресов публикуют сами компании: у OpenAI это файлы openai.com/searchbot.json, openai.com/gptbot.json и openai.com/chatgpt-user.json, у Perplexity perplexity.com/perplexitybot.json и perplexity.com/perplexity-user.json, у Anthropic claude.com/crawling/bots.json.

Где в логах искать ИИ-ботов

Откройте access-лог веб-сервера и отфильтруйте строки по названиям ботов. Если у вас обычный VPS, команда может быть такой:

grep -iE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|PerplexityBot" access.log | awk '{print $9}' | sort | uniq -c

Девятое поле в стандартном формате лога содержит код ответа, поэтому на выходе вы увидите, сколько раз каждый код получили боты. Много ответов 200 означает, что страницы читаются. Преобладание 403 и 429 означает блокировку. На виртуальном хостинге доступа к сырому логу часто нет, тогда ищите отчёты по посетителям в панели хостинга или запросите лог у поддержки.

Отсутствие ботов в логах само по себе ничего не доказывает. Возможно, на ваш сайт они просто не приходили, потому что на него мало внешних ссылок. Возможно, их остановили раньше, на уровне CDN или файрвола, и до сервера они не дошли. Поэтому логи читают вместе с проверкой из предыдущего раздела.

Ещё одна тонкость: User-Agent легко подделать, и в логах под именем GPTBot может оказаться кто угодно. Если решаете вопрос о блокировке или нагрузке, сверяйте адреса с опубликованными списками.

Что блокирует ботов, хотя в robots.txt всё открыто

Чаще всего ИИ-боты упираются не в robots.txt, а в защиту, которая стоит перед сайтом. По нашему опыту, это пять мест, которые стоит проверить по очереди.

  • CDN и файрвол. У Cloudflare есть настраиваемые политики для ИИ-ботов с отдельными пресетами для поиска, агентов и обучения, и их легко включить целиком, не заметив.
  • Плагины безопасности и антиспама на WordPress. Они иногда блокируют незнакомые User-Agent или ограничивают частоту запросов.
  • Защита хостинга от ботов. Хостинг-провайдеры включают её по умолчанию и не всегда сообщают об этом клиенту.
  • Ограничение по странам. Боты приходят с серверов за рубежом, и правило «только Казахстан» отсекает их вместе с вредоносным трафиком.
  • Закрытие индексации после разработки. Галочка «Попросить поисковые системы не индексировать сайт» в разделе «Чтение» настроек WordPress остаётся включённой чаще, чем кажется.

Если вы нашли блокировку, исправьте её точечно: добавьте правило-исключение для нужных User-Agent и адресов, а не отключайте защиту целиком.

Нужно ли отдельное разрешение для AI-обзоров Google?

Нет, отдельное разрешение не нужно. Согласно справке Google об AI-функциях в Поиске, страница должна быть проиндексирована и подходить для показа в Поиске со сниппетом, а других технических требований нет. Специальные файлы или разметку для этого создавать не нужно.

Токен Google-Extended устроен иначе. По описанию Google, у него нет собственного User-Agent: сканирование идёт теми же строками, а токен в robots.txt лишь управляет тем, можно ли использовать материалы для обучения будущих моделей Gemini и для grounding. На включение в Поиск и ранжирование он не влияет.

Практический вывод для проверки: чтобы убедиться, что Google видит сайт, достаточно отчётов Search Console и проверки индексации. Подробнее о типичных ошибках в служебных файлах мы писали в статье про robots.txt и sitemap.xml.

Нужно ли пускать ботов, которые собирают данные для обучения?

Решение зависит от того, что вы продаёте и чем готовы делиться. Поисковых ботов (OAI-SearchBot, Claude-SearchBot, PerplexityBot) компании, которые зарабатывают на услугах, обычно открывают: если сайт закрыт, вас не будет среди источников, из которых ассистент собирает ответ. Ботов для обучения (GPTBot, ClaudeBot) закрывают те, кому важно сохранить контроль над текстами.

Блокировка обучающих ботов не убирает вас ни из обычного поиска, ни из поиска ассистентов: у OpenAI это независимые настройки, а у Google токен Google-Extended на Поиск не влияет. Для казахстанского бизнеса это означает, что можно закрыть обучение и сохранить видимость.

Есть и промежуточный вариант: открыть доступ только к публичным разделам, где лежат услуги, кейсы и статьи, и закрыть служебные страницы, личные кабинеты и выгрузки. Для этого в robots.txt добавляют Disallow на нужные каталоги внутри блока конкретного бота. Так вы не отдаёте ничего лишнего, но и не лишаете ассистентов материалов, ради которых к вам приходят клиенты. Только не забудьте после правки повторить проверку из чек-листа ниже: ошибка в одном символе пути закрывает не тот раздел.

Если интересует следующий шаг, как попасть в ответы ассистентов, а не только дать им доступ, читайте материал про видимость в ответах ИИ и про файл llms.txt и разметку.

Видит ли бот текст страницы, а не пустой каркас

Бот может получить код 200 и всё равно не увидеть содержимое. Это случается, когда основной текст подгружается скриптами уже после загрузки страницы, а в ответе сервера лежит пустой каркас. Какие именно краулеры выполняют скрипты, официальные справки не уточняют, поэтому надёжнее исходить из худшего варианта и проверять сырой HTML.

Проверка простая: выполните curl без параметров и найдите в ответе заголовок своей услуги или абзац из первого экрана. Если текста нет, а в браузере он есть, значит, страница собирается на стороне посетителя. Для сайтов на WordPress и 1С-Битрикс с обычными шаблонами такое бывает редко, зато часто встречается у конструкторов, одностраничных лендингов и страниц, где каталог выводится через встроенный виджет. Тогда имеет смысл вынести ключевые тексты в обычную HTML-разметку или отдавать готовую версию страницы с сервера.

Как читать результаты: три типичных сценария

После проверок у вас на руках набор кодов и строк из логов. Чтобы не гадать, сопоставьте их с таблицей: она показывает, что чаще всего стоит за картиной и что делать первым.

Что вы видите Что это обычно значит Что делать
robots.txt открыт, curl отдаёт 200, в логах боты с ответами 200 доступ для ботов открыт перейти к содержанию: ответы на вопросы, структура, источники
robots.txt открыт, curl отдаёт 403 или 429 блокирует защита перед сайтом: CDN, файрвол, плагин или хостинг найти правило и добавить исключение для нужных ботов
robots.txt открыт, curl отдаёт 200, но в логах боты не появляются либо на сайт не ссылаются, либо блокировка стоит раньше сервера проверить настройки CDN и файрвола, затем наращивать внешние упоминания
В robots.txt стоит Disallow: / сайт закрыт намеренно или по недосмотру после разработки решить, кого вы хотите пускать, и переписать правила под цель

Третья строка заслуживает отдельного замечания. Если на сайт почти никто не ссылается, боты могут просто не знать о нём, и дело тогда не в блокировке, а в слабом внешнем присутствии. Это уже задача для SEO и упоминаний в отраслевых источниках, а не для настройки сервера.

Как выглядит проверка на практике: пример

Приведём иллюстрацию, а не реальный кейс клиента. Компания из Алматы продаёт оборудование, сайт сделан на WordPress, за год подключили плагин безопасности и CDN. Владелец замечает, что менеджеры не слышат от клиентов фразу «нашёл вас в ChatGPT», и просит проверить доступ.

Специалист открывает robots.txt: правил для ботов нет, общий блок закрывает только служебные разделы. Запрос curl -I с User-Agent GPTBot возвращает 403 и страницу с проверкой браузера. Значит, виновата не настройка robots.txt, а правило в защите: оно отсекает неизвестные User-Agent. В настройках находят это правило и добавляют исключение для OAI-SearchBot, Claude-SearchBot и PerplexityBot. Через сутки повторная проверка даёт 200, а в логах за неделю появляются записи этих ботов с ответами 200.

Заметьте, что на всю работу ушёл один рабочий день, из которого сама правка заняла минуты. Дольше всего искали, где именно лежит правило: в настройках плагина, у CDN или в панели хостинга.

Как держать доступ под контролем после проверки

Разовая проверка устаревает быстро: правила защиты меняются при обновлении плагинов, смене тарифа CDN или переезде на другой хостинг. Чтобы не обнаружить блокировку через полгода, закрепите проверку как регулярную процедуру.

  • Раз в месяц выгружайте из логов количество обращений каждого бота и коды ответов, чтобы увидеть, не пропал ли кто-то из них.
  • После любых изменений в хостинге, CDN или плагинах безопасности повторяйте curl с User-Agent поисковых ботов.
  • Храните в одном месте решение: каких ботов вы разрешили, каких закрыли и почему. Через год никто не вспомнит, зачем в файле стоит Disallow.
  • Следите за новыми названиями ботов в справках OpenAI, Anthropic и Perplexity: компании добавляют и переименовывают агентов.

Чек-лист на полчаса

  1. Откройте robots.txt и выпишите правила для GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended и общий блок *.
  2. Определите цель: попасть в поиск ассистентов, закрыть обучение или и то и другое. Поправьте файл под цель.
  3. Выполните curl -I с User-Agent каждого поискового бота и запишите коды ответов.
  4. Сверьте списки адресов компаний с правилами файрвола и CDN.
  5. Проверьте логи за последние две-три недели по названиям ботов и кодам ответов.
  6. Убедитесь, что в настройках WordPress выключено «Попросить поисковые системы не индексировать сайт».
  7. Через сутки после правок повторите проверки: изменения вступают в силу до 24 часов.

Если доступа к серверу нет или хочется, чтобы это проверил специалист, мы включаем такую проверку в SEO-аудит сайта вместе с анализом индексации и структуры.

Ошибки, из-за которых проверка вводит в заблуждение

Самая частая ошибка: смотреть только robots.txt. Файл показывает намерение владельца, но не то, пропускает ли сервер бота на самом деле. Вторая: путать GPTBot и OAI-SearchBot. Закрыв GPTBot, вы закрыли обучение, но поиск ChatGPT работает через другого бота и остаётся открытым.

Третья ошибка: пытаться заблокировать ботов по IP вместо robots.txt. Anthropic прямо предупреждает, что блокировка по IP может работать некорректно и не гарантирует отказ, и рекомендует robots.txt. Четвёртая: не дождаться эффекта. Правки применяются не сразу, и повторная проверка через час покажет старую картину.

Наконец, многие проверяют сайт один раз и забывают. После обновления плагина безопасности, смены хостинга или подключения CDN правила меняются, и проверку стоит повторять хотя бы раз в квартал.

Частые вопросы

Как понять, что ChatGPT видит мой сайт?

Проверьте три вещи. Во-первых, в robots.txt нет запрета для OAI-SearchBot. Во-вторых, запрос с его User-Agent возвращает код 200. В-третьих, в логах сервера этот бот получает ответы 200. Если всё сходится, доступ открыт. Попадание в конкретный ответ ассистента при этом не гарантировано: это зависит от запроса.

Нужно ли пускать GPTBot, если я хочу попасть в ответы ChatGPT?

Нет, для показа в поиске ChatGPT нужен OAI-SearchBot, а GPTBot отвечает за сбор данных для обучения моделей. По документации OpenAI, это независимые настройки: можно разрешить OAI-SearchBot и закрыть GPTBot. Если не хотите отдавать тексты на обучение, закрывайте GPTBot и оставляйте поисковому боту доступ.

Повлияет ли блокировка ИИ-ботов на позиции в Google?

Нет, блокировка GPTBot, ClaudeBot и других ИИ-ботов на позиции в Google не влияет. Токен Google-Extended, по описанию Google, не влияет на включение сайта в Поиск и не служит сигналом ранжирования. Googlebot настраивается отдельно, и именно он отвечает за индексацию для поиска и AI-обзоров.

Как быстро боты заметят изменения в robots.txt?

Обычно в течение суток. OpenAI и Perplexity в своих справках указывают, что изменения в robots.txt могут вступать в силу до 24 часов. Поэтому после правок не стоит проверять результат через несколько минут: подождите сутки и затем повторите проверку по логам и ответам сервера.

Можно ли заблокировать ИИ-ботов по IP вместо robots.txt?

Технически можно, но надёжным способом это не считается. Anthropic предупреждает, что блокировка по IP может работать некорректно и не гарантирует отказ, поэтому рекомендует robots.txt. Списки адресов компании публикуют для другого: чтобы вы могли убедиться, что запрос пришёл от настоящего бота, а не от подделки.

Прокрутить вверх