AI-краулеры: каких ботов пускать на сайт

AI-боты обучают модели, ведут поисковый индекс нейросетей и открывают страницы по запросу пользователя.
AI-боты обучают модели, ведут поисковый индекс нейросетей и открывают страницы по запросу пользователя.

Какие боты заходят на сайт и зачем

Под одним названием «AI-краулеры» ходят боты с разными задачами, и путаница между ними стоит дороже всего. Cloudflare в июле 2026 разделила их на три категории - Search, Agent и Training - и это деление удобно взять за рабочую рамку. От того, в какую группу попадает бот, зависит, что вы теряете при запрете и что получаете при разрешении. Общий контекст работы с нейровыдачей - в статье про GEO в 2026 году, здесь речь только про доступ.

Обучающие краулеры. GPTBot от OpenAI, ClaudeBot от Anthropic, CCBot от Common Crawl. Они забирают текст в обучающие наборы будущих моделей и не приносят переходов: бот скачал страницу и ушел. Common Crawl стоит особняком: его сборками пользуются разные команды, так что попадание туда отражается сразу на нескольких системах.

Google-Extended и Applebot-Extended в этой группе устроены иначе. Это не боты, а токены в robots.txt: отдельного user-agent, который стучится к вам на сервер, у них нет. Google-Extended управляет тем, можно ли использовать контент, уже скачанный Googlebot, для обучения Gemini и для ответов в продуктах Gemini и Vertex AI. Google отдельно указывает: на попадание в Поиск этот токен не влияет и в сигналы ранжирования не входит.

Яндекс держит свою пару. YandexBot - основной индексирующий робот, его трогать нельзя. За использование страниц в Нейро отвечает YandexAdditional: весной 2024 часть российских изданий прописала для него запрет, чтобы их материалы не уходили в нейроответы. Об этом писал Sostav. Запрет для YandexAdditional не выбивает сайт из обычной выдачи Яндекса.

Поисковый контур нейросетей. OAI-SearchBot ведет индекс для поиска ChatGPT, Claude-SearchBot - для поиска Claude, PerplexityBot - для Perplexity. Эти боты ходят по сайту, чтобы система могла назвать вас в ответе - со ссылкой и переходом. Механику попадания в ответы ChatGPT мы разбирали отдельно, но без открытого доступа она не работает вовсе.

Агенты, которые приходят по просьбе человека. ChatGPT-User, Claude-User и Perplexity-User открывают страницу в тот момент, когда пользователь в диалоге спрашивает про ваш сайт или дает ссылку. Ведут они себя ближе к браузеру. OpenAI в документации отмечает, что ChatGPT-User подчиняется robots.txt не так строго, как автоматические краулеры.

Anthropic в феврале 2026 переписала свою страницу про краулеры и развела три бота по разным строкам: ClaudeBot собирает обучающие данные, Claude-SearchBot ведет поисковый индекс, Claude-User ходит по просьбе человека. Каждому нужна своя директива, и запрет ClaudeBot не закрывает два других. На этом и спотыкаются те, кто копировал списки блокировки из статей 2024 года.

Есть еще скраперы. Они собирают данные и не дают взамен ничего: ни цитаты, ни перехода. Bytespider от ByteDance - самый заметный из них, к первому кварталу 2026 он попал в 4,23% запрещающих правил в анализе TechnologyChecker. Логика с ними другая: запрет ничего не стоит, терять нечего.

Трафик этот давно перестал быть мелочью. Cloudflare Radar считает его в двух разрезах, и путать их не стоит. По операторам за июнь 2026: на Google приходится 28,4% верифицированного бот-трафика, на Anthropic 13,2%, на OpenAI 7,2% - у каждой компании несколько ботов, доли сложены. По отдельным ботам расстановка другая: Googlebot 14,2%, сразу за ним Claude-User с 11,3%. То есть агент ассистента обходит сайты почти так же интенсивно, как основной поисковый робот Google. Доли скачут месяц к месяцу вслед за тренировочными прогонами лабораторий, поэтому читать их лучше как порядок величин, а не как рейтинг.

Закрыть обучение и оставить поиск - рабочая комбинация: модель не забирает ваш материал в наборы, но цитирует вас со ссылкой в ответе пользователю. Обратная настройка смысла не имеет: вы отдаете контент бесплатно и не получаете за это ни строчки в выдаче.

Пример robots.txt с директивами Allow и Disallow для AI-ботов
Пример правил: обучающие краулеры закрыты, поисковые открыты. Одна лишняя косая черта в Disallow убирает из выдачи весь сайт.

Почему сайт закрыт, хотя вы его не закрывали

Почти всегда блокировка - наследство, а не решение владельца. За два года практики мы ни разу не встретили случая, когда собственник осознанно закрыл GPTBot и помнил об этом.

Шаблоны и старые SEO-сборки. Правила писались до того, как эти боты появились, и часть готовых конфигураций запрещает все незнакомое одной строкой. Ahrefs в исследовании 2025 года обошел около 140 млн сайтов и насчитал 5,9% с закрытым GPTBot. Для большинства владельцев это новость.

CDN и его настройки по умолчанию. Это место мы проверяем первым: robots.txt часто оказывается чистым, а доступ закрыт выше. У Cloudflare есть переключатель, закрывающий доступ AI-ботам, и в ряде конфигураций он включен без участия владельца. С 15 сентября 2026 политика по умолчанию станет строже: краулеры категорий Training и Agent будут блокироваться на страницах с рекламой - на новых доменах, на новых сайтах существующих клиентов и на бесплатном тарифе. Там же появилось правило про смешанные краулеры: если владелец разрешил Search и запретил Training, бот с обеими функциями блокируется целиком. В анонсе к смешанным отнесены и краулеры больших поисковиков, включая Googlebot, - он и страницы для Поиска индексирует, и питает AI-функции Google. Как настройка отработает на вашем тарифе, лучше проверить до сентября.

Раздел управления доступом AI-ботов в панели Cloudflare
В панели Cloudflare доступ AI-ботам разведен по категориям. Про эту настройку забывают чаще, чем про robots.txt.

Плагины безопасности и WAF. Сетевой экран режет ботов на уровне, до которого robots.txt не доходит. Бот получает 403 или капчу, страница остается недоступной, а в robots.txt при этом стоит вежливое Allow. Штатные настройки защиты принимают плотную серию запросов за скрапинг, и формально это верно: бот и правда идет быстро.

Перенос сайта. На тестовом домене стоит глобальный Disallow, при переезде файл уезжает на прод вместе со всем остальным. Сайт исчезает из Google целиком, из нейросетей тоже.

Показательный случай разобрал Кевин Индиг (Kevin Indig): издание Everyday Health получало ноль цитирований в Perplexity, хотя текстов у него хватает на любую медицинскую тему. Причина оказалась в одной строке: PerplexityBot был закрыт в robots.txt.

Запреты распределены неравномерно. TechnologyChecker разобрал запрещающие правила robots.txt на сети Cloudflare за первый квартал 2026 - здесь считали не сайты, а сами директивы, поэтому цифры с выборкой Ahrefs напрямую не сравниваются. В запретах лидирует GPTBot с 5,52%, дальше CCBot 5,08%, ClaudeBot 4,88%, Google-Extended 4,44%. А вот PerplexityBot и ChatGPT-User чаще попадают в разрешающие правила, чем в запрещающие: их уже научились отличать как источник переходов.

Как проверить, кто к вам приходит

Полная проверка - полчаса, ни одного платного сервиса.

Прочитайте свой robots.txt глазами. Откройте адрес вида вашдомен.kz/robots.txt в браузере. Ищите две вещи: строку Disallow: / под именем любого AI-бота и общее правило для User-agent: * с запретом на разделы, где лежат ваши тексты. Отдельно проверьте, что файл отдается с кодом 200, а не редиректом.

Ответ сервера боту. robots.txt может быть чистым, а сервер при этом отвечает ботам 403. Запросите свою страницу от имени GPTBot или PerplexityBot и посмотрите на код ответа и на тело документа. Если сервер отвечает 200, но в теле пусто, проблема в другом месте: контент появляется только после выполнения скриптов. Это отдельная история, ей посвящен материал про сайты на JavaScript и нейросети.

Посмотрите логи сервера. Ищите по строкам GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, YandexAdditional. Логи покажут, кто к вам ходит и какие страницы забирает чаще. И какие разделы бот не посещал ни разу. Мертвые зоны - хороший ориентир для перелинковки.

Строки лога сервера с визитами GPTBot, ClaudeBot и PerplexityBot
Пример строк лога: по именам ботов видно, кто доходит до сайта и какие страницы забирает.

Имя в user-agent подделывается в одну строку, поэтому подозрительные визиты сверяют обратным DNS-запросом. OpenAI и Perplexity публикуют диапазоны своих адресов, Яндекс просит проверять, что имя хоста заканчивается на yandex.ru, yandex.net или yandex.com. Anthropic списка адресов не публикует и предлагает управлять доступом через robots.txt.

Инструменты вебмастеров. В Яндекс Вебмастере есть анализатор robots.txt: он показывает, какие директивы роботы Яндекса учтут, и подсвечивает строки, которые не смог разобрать. Ошибка синтаксиса встречается чаще, чем осознанный запрет: лишний пробел, кириллическая буква в имени бота, забытая пустая строка между секциями. В Search Console похожую задачу решает проверка URL - она отвечает, доступна ли страница для Googlebot.

Загляните в панель CDN. В Cloudflare есть отдельный раздел для доступа AI-ботов: с июля там три независимые категории вместо одного переключателя. Если сайт стоит за другим CDN, ищите похожий раздел с ботами.

Генеративные поверхности Google. robots.txt ими не управляет. AI Overviews и AI Mode берут материал из обычного индекса через Googlebot, поэтому запрет Google-Extended на них не влияет. Отключиться от них можно тегами nosnippet и max-snippet, но вместе с этим пропадет и обычный сниппет в выдаче. Летом 2026 в Search Console появился отдельный переключатель для генеративных поверхностей. Запуск ограниченный: сначала один регион и часть сайтов, о доступности для всех Google не объявлял. Прежде чем строить на нем планы, проверьте, есть ли он в вашем аккаунте.

Кого пускать, а кого закрывать: три сценария

Одного ответа для всех нет.

Обычный бизнес: услуги, товары, локальные сети. Пускайте всех. Тексты на сайте у вас не товар, деньги приносят клиенты, которые пришли по рекомендации системы. Каждый закрытый бот - это минус одна площадка, где вас могут назвать в ответ на вопрос «к кому обратиться». Логика тут ровно та же, что с обычным поиском двадцать лет назад: закрываться от Google ради экономии трафика никому в голову не приходило.

Компания с собственными исследованиями, методиками или платным контентом. Закрывайте обучение, оставляйте поиск. Такая настройка означает: забирать материал в обучающие наборы нельзя, а назвать его в ответе со ссылкой - пожалуйста. Тот же выбор делают издатели, которые отдельно договариваются о лицензировании: сначала техническое разграничение, потом переговоры. Наша позиция такая: закрывать обучение стоит там, где текст сам по себе товар. Остальным мы советуем открывать все три группы и тратить силы на то, чтобы было что цитировать.

Медиа и издатели. Здесь доступ давно стал предметом сделки, а не техники. Cloudflare переделывает свой Pay Per Crawl в Pay Per Use, где платят не за скачивание страницы, а за использование материала в ответе. Пока эта конструкция обкатывается, решение остается за редакцией и юристами, а robots.txt только фиксирует результат.

У любого из сценариев должен быть хозяин и срок пересмотра. Маркетинг тянет в сторону открытости, юристы - в сторону запрета, разработка правит файл при каждом обновлении CMS и иногда затирает то, о чем договорились. Мы предлагаем клиентам держать текущую версию robots.txt в репозитории с комментарием, кто и зачем добавил каждую секцию, и возвращаться к файлу раз в квартал. Имена ботов за последние два года менялись не раз: Anthropic отказалась от Claude-Web и anthropic-ai в пользу новых имен, OpenAI развела единый краулер на три бота. Список двухлетней давности сегодня закрывает не то, что нужно.

Сам файл тоже не всесилен. Он ведь держится на доброй воле, физической блокировки в нем нет: крупные компании его соблюдают, безымянные скраперы игнорируют. Если задача - закрыть контент, это уровень сервера: правила nginx, WAF, авторизация.

Файл управляет обходом, но не индексацией. Яндекс предупреждает, что закрытые в robots.txt страницы могут участвовать в поиске; чтобы убрать их из выдачи, нужен noindex в HTML, а бот прочитает его только при открытом доступе.

Готовые правила для robots.txt

Шаблоны под первые два сценария. Правила дописывайте в существующий файл, а не заменяйте его целиком: секции для Googlebot, Yandex и общий блок остаются на месте.

Шаблон «пустить всех»:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: CCBot
Allow: /

User-agent: Google-Extended
Allow: /

Sitemap: https://example.com/sitemap.xml

Шаблон «закрыть обучение, оставить поиск»:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://example.com/sitemap.xml

Для второго шаблона учтите предупреждение Cloudflare про смешанные краулеры. Связка «поиск разрешен, обучение запрещено» в новой схеме приводит к полной блокировке ботов, которые совмещают обе функции. Проверьте, как это отработает на вашем тарифе.

Как читаются пересекающиеся правила. Секция для конкретного бота отменяет для него все остальные: если в файле есть блок User-agent: GPTBot, то правила из User-agent: * этот бот не читает. Внутри одной секции выигрывает самое длинное совпадение пути. При равной длине приоритет у Allow. Пустая директива Disallow: открывает весь сайт, а Disallow: / с косой чертой - запрещает обход. Разница в один символ, цена ошибки - сайт целиком.

Чего не делать.

  • Закрывать CSS и JavaScript ради экономии краулингового бюджета. Системы рендерят страницу как браузер, без стилей и скриптов они видят сломанную верстку
  • Оставлять Disallow: / после переезда с тестового домена. Проверяйте файл в день запуска, а не через месяц по упавшему трафику
  • Прятать приватные разделы через robots.txt. Для этого есть авторизация, файл же публичен и читается кем угодно, включая тех, кто ищет ваш админский путь
  • Копировать чужой robots.txt целиком. В нем будут пути, которых у вас нет, и не будет ваших

Про llms.txt. Это соседний файл в корне, и путать его с robots.txt не стоит: тот управляет доступом, а llms.txt подсказывает структуру и говорит модели, что за компания перед ней и какие страницы главные. robots.txt работает всегда, а llms.txt пока поддерживается выборочно. Подробный разбор - в статье про llms.txt.

Нагрузка на сервер: убирать лишнее вместо блокировки

Разработчик возразит сразу: пустим всех - ляжет сервер. И он прав, цифры на его стороне.

В июне 2026 Cloudflare сообщила, что трафик ботов впервые превысил человеческий: гендиректор компании Мэттью Принс (Matthew Prince) отметил, что этого порога ждали только к концу 2027 года. Там же есть разбивка по назначению - по тем краулерам, чью цель Cloudflare смогла определить. За обучающими данными идет 52% запросов против 22% годом ранее, свыше 36% дают краулеры смешанного назначения, на чистый поиск остается примерно десятая часть.

Поисковый бот нейросети запрашивает страницу заново каждый раз, когда система собирается на нее сослаться, а не один раз при индексации. По оценке Cloudflare, больше половины краулингового трафика уходит на повторную загрузку страниц, которые с прошлого визита не менялись.

Краулинговый бюджет у AI-ботов жестче, чем у Google, который обходит веб с конца девяностых. Цепочки редиректов, мусорные URL от фильтров каталога, страницы пагинации и внутреннего поиска съедают лимит до того, как бот доберется до карточки услуги. Медленная отдача добивает: бот не ждет.

Отсюда и рецепт. Не блокировать целиком, а убирать лишнее: закрыть в robots.txt служебные разделы, корзину и параметрические URL, вычистить цепочки редиректов, ускорить отдачу HTML, дать актуальную карту сайта с датами изменений. Тогда бюджет уходит на страницы, которые вы хотите видеть в ответах.

Как замерить эффект правки

Сроки возврата у ботов разные. Поисковые краулеры нейросетей ходят постоянно и вернутся за неделю-две. Обучающие боты приходят волнами, вслед за очередным тренировочным прогоном. Ждать можно месяцами.

Перед правкой зафиксируйте точку отсчета. Без нее вы не отличите результат от случайных колебаний.

Что в нее входит:

  • таблица визитов по именам ботов, хотя бы помесячно
  • список из десяти-пятнадцати вопросов, которые ваш клиент задал бы нейросети перед покупкой, с сохраненными ответами на день замера
  • скриншот настроек CDN, чтобы потом было видно, что менялось

На сбор уходит час, зато следующий разговор с руководителем идет на цифрах.

Через месяц смотрите два показателя: появились ли в логах визиты ботов, которых раньше не было, и изменилась ли частота упоминаний в ответах. Как считать второе - в материале про замер видимости в нейросетях.

Коротко

  • Боты делятся на обучающие, поисковые и агентские. Закрывать обучение и оставлять поиск - рабочая стратегия, обратный вариант бессмыслен
  • По данным Ahrefs, 5,9% из 140 млн сайтов блокируют GPTBot, в основном по недосмотру
  • ClaudeBot, Claude-SearchBot и Claude-User требуют отдельных директив: запрет одного не закрывает остальных
  • Google-Extended управляет обучением Gemini, но не влияет ни на Поиск, ни на AI Overviews
  • За Нейро у Яндекса отвечает YandexAdditional, за обычную индексацию - YandexBot
  • С 15 сентября 2026 Cloudflare начнет по умолчанию блокировать обучающие и агентские краулеры на страницах с рекламой, поэтому панель CDN проверяется вместе с robots.txt
  • robots.txt решает, куда пустят бота, но не убирает страницы из индекса и не защищает текст от копирования

Об авторе

Марат Аксанов, сооснователь GEO-агентства HITZ.

Об агентстве

HITZ - первое GEO-агентство Центральной Азии. Работаем с видимостью брендов в ответах нейросетей и поисковых систем в Казахстане, Узбекистане и русскоязычном сегменте: GEO-продвижение, AEO, техническая подготовка сайта к обходу AI-краулерами, замеры упоминаний. Пишите в Telegram, посмотрим вашу ситуацию.

Частые вопросы

Если закрыть GPTBot, сайт пропадет из ChatGPT совсем?

Не полностью. GPTBot собирает данные для обучения моделей, а за поиск внутри ChatGPT отвечает OAI-SearchBot, за визиты по просьбе пользователя - ChatGPT-User. При запрете только GPTBot система все равно найдет вас через поисковый контур и назовет в ответе со ссылкой. Пропадете, только если закрыты все три или доступ режется на CDN. OpenAI отмечает, что GPTBot и OAI-SearchBot обмениваются информацией, чтобы не обходить сайт дважды, когда разрешены оба.

Блокировка AI-ботов защитит контент от копирования?

Нет. Запись в файле - это просьба к боту. Ее выполняют крупные компании, а безымянные скраперы читают robots.txt разве что для поиска интересных разделов. Плагиатчики копируют текст руками или парсером, который директивы не читает. Работающая защита - это уровень сервера и юридические инструменты. Блокировкой краулеров вы отсекаете тех, кто мог бы вас процитировать со ссылкой, и почти не мешаете тем, кто копирует.

Что будет с позициями в Google, если закрыть Google-Extended?

Ничего. Google указывает, что Google-Extended не влияет на включение сайта в Поиск и сигналом ранжирования не считается. Токен решает одно: пойдет ли ваш материал на обучение Gemini и в ответы продуктов Gemini и Vertex AI. AI Overviews и AI Mode работают через обычный индекс, поэтому запрет Google-Extended вас оттуда не уберет. Чтобы выйти из этих поверхностей, нужны теги nosnippet или max-snippet, которые заодно лишат вас обычного сниппета в выдаче.

Как понять, что сайт закрыт на уровне Cloudflare, а не robots.txt?

Сравните два ответа. Сначала прочитайте robots.txt: если запрещающих директив для AI-ботов там нет, файл ни при чем. Затем запросите любой адрес с подменой user-agent на GPTBot и посмотрите код ответа: 403, капча или страница проверки браузера означают, что бота остановил CDN или сетевой экран. Ищите настройку в панели Cloudflare, в разделе управления ботами: после июльского обновления доступ там разведен на Search, Agent и Training.

Нужен ли llms.txt, если robots.txt уже настроен?

Файлы решают разные задачи, и один другого не заменяет. robots.txt отвечает на вопрос «куда можно», llms.txt - на вопрос «что здесь главное»: краткое описание компании и список ключевых страниц для модели. Поддержка llms.txt пока выборочная, часть систем его игнорирует. Начинать стоит с доступа. Когда robots.txt в порядке, на llms.txt уходит час, и хуже он не сделает.

Через сколько после правки появятся первые упоминания?

Поисковые боты нейросетей вернутся в течение недели-двух, и после переобхода страница станет доступна для цитирования. Само упоминание появится позже: системе нужно, чтобы ваш материал попал в отбор по конкретному запросу, а тут работают уже другие факторы - авторитет домена, структура текста, внешние источники. Точную дату не назовет никто, сроки зависят от того, как часто систему спрашивают про вашу тему и есть ли на сайте что цитировать. Поэтому и нужна точка отсчета до правки: она покажет сдвиг, когда он случится.

Обсудить проект
+7 706 624 20 40