SEO (поисковое продвижение)ИИ

Кого не пускают ИИ-краулеры: сравнили ТОП-5 Яндекса и 325 сайтов обычного бизнеса

В сентябре мы проверили 325 сайтов и увидели, что доступ ИИ-краулерам часто закрыт не решением владельца, а настройками хостинга. Осталось два вопроса: так же ли это у тех, кто уже стоит в верхней части выдачи, и не завышает ли разовая проверка долю закрытых сайтов. Чтобы ответить, мы собрали вторую выборку — 447 сайтов из первой пятёрки Яндекса — и прогнали обе одной методикой в один день.

Александр, руководитель SEO-отделаОпубликовано 12 мин чтения

Главное за 30 секунд

  • У лидеров выдачи закрыто вдвое реже. Среди сайтов из ТОП-5 Яндекса отказ хотя бы одному ИИ-краулеру дали 14%, среди сайтов обычного бизнеса — 22,8%. Проверяли одной методикой в один день.
  • Осознанный запрет редок везде. Запрет ИИ-ботам в robots.txt стоит у 4,4% сайтов из ТОП-5 и у 1,8% в клиентской выборке. Решение «не пускать нейросети» принимают единицы.
  • Разница между этими числами и есть главная находка. У 13,4% сайтов в ТОП-5 и у 22,2% в клиентской выборке robots.txt разрешает, а сервер отказывает. Это не решение владельца, это настройки защиты, о которых он не знает.
  • Больше всех достаётся ClaudeBot — 11,9% отказов в ТОП-5 против 6,5% у GPTBot и 3,4% у PerplexityBot. Фильтры узнают популярные имена и пропускают, остальных режут.
  • Разовая проверка завышает долю закрытых. Перепроверив сентябрьскую выборку с правилом трёх попыток, мы получили по GPTBot 6,8% вместо 26%. Если проверяете свой сайт — повторяйте запрос трижды.

Что осталось непонятным после сентября

В сентябрьском исследовании мы запрашивали главную страницу 325 сайтов семью разными user-agent и увидели главное: отказы приходят с уровня сервера и группируются по хостингу, а не по решению владельца. Вывод подтвердился, но остались две дыры.

Первая — выборка. Это были живые сайты малого и среднего бизнеса, к которым у агентства есть доступ. Хорошая выборка, чтобы говорить с клиентом, но она ничего не говорит о тех, кто уже стоит в верхней части выдачи. А вопрос именно про них: нейросети берут в источники то, что поиск считает лучшим ответом. Если и там закрыто, картина ответов складывается не из лучших сайтов, а из тех, кто случайно оказался открыт.

Вторая — методика. Мы делали по одному запросу на бота. А хостинг при частых обращениях отвечает ошибкой кому угодно, включая браузер. Значит, часть «блокировок» могла быть обычным троттлингом.

Поэтому здесь две выборки, одна методика и один день проверки.

Две выборки, одна методика

  • Выборка А — лидеры выдачи. 150 коммерческих и около-коммерческих запросов в десяти нишах, с которыми мы работаем: автосалоны, интернет-магазины, медицина, недвижимость, образование, отели и базы отдыха, перевозки из Китая, рестораны, салоны красоты, санатории. По пятнадцать запросов на нишу, ТОП-5 Яндекса по каждому, регион Новосибирск. Получилось 447 уникальных сайтов.
  • Выборка Б — обычный бизнес. Те же 325 сайтов, что в сентябре, перепроверенные заново 8 октября.
  • Что делали с каждым сайтом. Запрашивали главную страницу четырьмя способами: обычным браузерным user-agent и тремя ИИ-краулерами — GPTBot, ClaudeBot, PerplexityBot. Читали robots.txt и разбирали правила для двенадцати известных ИИ-роботов. Проверяли наличие llms.txt.
Правило трёх попыток. Каждый код мы перепроверяли до трёх раз с паузой и засчитывали отказ только при устойчивом отказе на фоне рабочего браузерного запроса. Нестабильные ответы — 429, 503, обрыв соединения — считали отдельной категорией и в отказы не включали. Без этой поправки доля закрытых сайтов получается почти вдвое выше.

Из 447 сайтов выборки А ответить удалось 440, а браузерный запрос прошёл у 387 — на них и считаем. В выборке Б браузеру ответили 325 сайтов. Остальные не отвечают никому: закрыты, переехали или не пускают никого извне. О таком сайте нельзя сказать, пускает он ботов или нет.

Запрет в robots.txt — редкость в обеих выборках

Что написано в robots.txt. А — ТОП-5 Яндекса (387 сайтов), Б — обычный бизнес (325 сайтов)
Что видимА: ТОП-5Б: бизнес
robots.txt вообще отдаётся93,0%95,1%
в нём упомянут хотя бы один ИИ-робот8,8%4,0%
хотя бы одному ИИ-роботу запрещён весь сайт 4,4%1,8%

Четыре процента и два процента — это очень мало. Тема «нейросети воруют контент» обсуждается второй год, а до строчки в robots.txt она доходит у одного сайта из двадцати трёх в ТОП-5 и у одного из пятидесяти пяти в обычном бизнесе. Разница между выборками осмысленная: у лидеров выдачи чаще есть кто-то, кто вообще знает про эти боты.

Кого закрывают, когда всё-таки закрывают: чаще всего Bytespider (12 сайтов) и CCBot (10) — то есть краулеры, которые собирают данные для обучения. GPTBot запрещён у восьми, ClaudeBot — у пяти. Логика видна: закрывают тех, кто учится на контенте, а не тех, кто приводит людей.

Сервер отказывает в разы чаще, чем robots.txt

Теперь то же самое, но не по документам, а по факту: мы просто просили главную страницу.

Реальный ответ сервера на запрос ИИ-краулера
Что происходитА: ТОП-5Б: бизнес
не отдали страницу хотя бы одному из трёх 14,0%22,8%
не отдали ни одному из трёх2,8%0,3%
ответили нестабильно: 429, 503 или обрыв связи 10,6%15,7%
отдали всем трём75,5%76,9%

Сопоставим с предыдущей таблицей. В ТОП-5 запрет в robots.txt стоит у 4,4% сайтов, а реальный отказ получают 14%: разница в 13,4 процентных пункта — это сайты, где robots.txt разрешает, а сервер отказывает. В обычном бизнесе разрыв ещё шире: 1,8% против 22,8%, то есть 22,2 пункта.

Это и есть тихий запрет. Владелец сайта уверен, что открыт всем: он ничего не запрещал, в robots.txt чисто. А защита хостинга или антибот-сервис режет незнакомый user-agent раньше, чем запрос дойдёт до сайта. В админке хостинга такого правила не видно: оно обнаруживается только запросом от имени бота.

Чем именно отвечают: в выборке А это 80 раз 403 Forbidden — прямой отказ в доступе, 16 раз 503, по четыре раза 502 и 415. В выборке Б картина другая: 65 раз 403 и 34 раза 415 Unsupported Media Type — код, который на обычный запрос главной страницы не имеет смысла и выдаёт срабатывание фильтра.

У лидеров выдачи закрыто вдвое реже

Главная цифра исследования: 14,0% против 22,8%. Сайт из первой пятёрки Яндекса примерно вдвое реже отказывает ИИ-краулеру, чем сайт обычного бизнеса.

Объяснять это тем, что лидеры лучше понимают GEO, не получается — мы только что видели, что осознанных настроек почти нет ни там, ни там. Правдоподобнее другое: сайт в ТОП-5 по коммерческому запросу — это, как правило, сайт покрупнее, на выделенном сервере или на площадке с настроенной защитой, где исключения для известных роботов кто-то однажды прописал. Малый бизнес живёт на массовых тарифах, где антибот включён по умолчанию и настроен строго, на всякий случай.

Практический вывод для владельца сайта обратный ожидаемому: чем скромнее ваш хостинг, тем выше шанс, что вы закрыты от нейросетей и не знаете об этом. И тем дешевле это исправить — обычно одним обращением в поддержку.

Кому отказывают: ClaudeBot чаще всех

Доля сайтов, отказавших конкретному краулеру
КраулерА: ТОП-5Б: бизнес
ClaudeBot11,9%22,8%
GPTBot6,5%6,8%
PerplexityBot3,4%0,9%

Разброс почти в четыре раза, хотя запросы шли подряд, с одного адреса и отличались только строкой user-agent. Объяснение простое: списки исключений в защитных сервисах пополняются по мере того, как имя становится известным. GPTBot знают и чаще пропускают, остальных обрабатывает общее правило «незнакомый бот — отказать».

Обратите внимание: по GPTBot выборки практически не отличаются, 6,5% и 6,8%, а весь разрыв между ними даёт ClaudeBot — 11,9% против 22,8%. То есть дело не в общей закрытости малого бизнеса, а в конкретных правилах, которые на массовых хостингах ещё не обновили.

Для владельца сайта это значит, что проверять надо каждого робота отдельно. Пустили одного — не значит пустили всех.

По нишам: туризм закрыт, магазины открыты

Разрез по выборке А: 387 сайтов разложены по нишам, из которых брались запросы.

Доля сайтов, не пустивших хотя бы одного ИИ-краулера, по нишам
НишаСайтовНе пускаютЕсть llms.txt
Санатории4822,9%10,4%
Отели и базы отдыха5022,0%6,0%
Медицина5418,5%3,7%
Перевозки из Китая4316,3%20,9%
Недвижимость2615,4%7,7%
Автосалоны3710,8%13,5%
Образование478,5%10,6%
Салоны красоты517,8%5,9%
Рестораны437,0%7,0%
Интернет-магазины535,7%24,5%

Разрыв между крайними нишами — вчетверо. Объяснение, скорее всего, не в отношении к нейросетям, а в том, какой хостинг и какая защита типичны для отрасли. Санатории и базы отдыха живут на коробочных решениях с агрессивным антиботом по умолчанию, интернет-магазины — на площадках, где доступ роботов настраивают осознанно, потому что от него зависят товарные агрегаторы и прайс-площадки.

Обратите внимание на последний столбец: у интернет-магазинов и llms.txt встречается чаще всех. Там, где роботов пускают сознательно, им ещё и подсказывают, куда идти.

Оговорка про размер групп: в каждой нише от 26 до 54 сайтов, так что разница между соседними строками в пределах нескольких пунктов ничего не значит. Читать стоит только крайности: туризм и медицина против интернет-магазинов.

llms.txt: у каждого восьмого в ТОП-5

Файл /llms.txt — короткое текстовое оглавление сайта для языковых моделей. В выборке А он нашёлся у 48 сайтов из 387, это 12,4%, в выборке Б — у 24 из 325, это 7,4%. Для формата, которому нет и двух лет и который не является официальным стандартом, довольно много.

Здесь мы отдельно повозились с методикой, и это стоит рассказать. Первая версия проверки считала файл найденным, если адрес отдаёт 200 и в ответе не видно html-тегов. Так в выборку попали редиректы на главную и заглушки хостинга — примерно треть ложных срабатываний. Пришлось проверять строже: не идти по редиректам, смотреть тип содержимого и убеждаться, что внутри именно markdown-оглавление с заголовком и ссылками. После этого из 92 найденных файлов осталось 48.

Честная оговорка про сам формат: ни один крупный вендор пока не подтвердил, что читает llms.txt. Делать файл стоит — он занимает полчаса и ничему не мешает. Рассчитывать, что он уже сегодня приведёт вас в ответы нейросетей, не стоит.

Почему сентябрьские числа были выше

В сентябре мы писали, что ClaudeBot получает отказ на 36% сайтов, а GPTBot — на 26%. Перепроверка той же выборки с правилом трёх попыток даёт 22,8% и 6,8%. Разберём, откуда разница.

Одни и те же 325 сайтов: одна попытка в сентябре и три попытки 8 октября
КраулерСентябрь, одна попытка Октябрь, три попытки
ClaudeBot36%22,8%
GPTBot26%6,8%
PerplexityBot1%0,9%

По ClaudeBot вывод устоял: отказ воспроизводится при повторных запросах, это правило в защите. По GPTBot — нет: большая часть того, что мы приняли за блокировку, при повторе превращается в нормальный ответ. Это был троттлинг, реакция на частые запросы, а не правило про конкретного бота.

Вторая часть разницы в том, что за прошедшие десять дней списки исключений в защитных сервисах могли пополниться. Разделить два эффекта на наших данных нельзя, и мы этого не делаем. Можно сказать только одно: устойчивый отказ GPTBot сейчас получает 6,8% сайтов выборки, а не четверть.

Что из этого следует для любой такой проверки, включая вашу собственную: один запрос ничего не доказывает. Повторяйте трижды с паузой и сравнивайте с ответом браузеру в тот же момент. Сентябрьскую публикацию мы поправим, указав пересчитанные числа.

Как проверить свой сайт за пять минут

  • Откройте свой robots.txt и поищите строки с GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended, Bytespider. Если запретов нет — это ещё ничего не значит, переходите к следующему пункту.
  • Запросите главную страницу от имени бота. В терминале: curl -I -A "GPTBot" https://ваш-сайт.ру/. Повторите для ClaudeBot и PerplexityBot.
  • Сравните с обычным запросом от имени браузера. Если браузеру 200, а боту 403 — у вас тихий запрет.
  • Повторите три раза с паузой. Разовый 429 или 503 — это защита от частых запросов, а не блокировка. Именно на этом шаге отсеивается большая часть ложных тревог.
  • Если нашли устойчивый отказ — идите в поддержку хостинга или в настройки антибот-сервиса и просите добавить эти user-agent в исключения. Обычно это одно обращение.
  • Зафиксируйте позицию в robots.txt. Явное Allow для поисковых ботов нейросетей и запрет для обучающих — чтобы ваше решение не зависело от настроек хостинга.

Чего эти данные не доказывают

Мы стучались user-agent'ом, а не настоящим ботом. Это главное ограничение. Реальные ИИ-краулеры приходят с известных диапазонов адресов, и грамотная защита проверяет не только имя, но и обратный DNS. Часть отказов, которые мы увидели, могла быть защитой от подделок: нас приняли за бота-самозванца и не пустили, а настоящий GPTBot с правильного адреса прошёл бы.

Поэтому к 14% и 22,8% стоит относиться как к верхней границе. Нижняя граница — явные запреты в robots.txt, 4,4% и 1,8%. Истина между, и ближе к какому краю — зависит от того, насколько аккуратно настроена защита на конкретном сайте.

Две выборки собраны по-разному. Выборка А — ТОП-5 по коммерческим запросам в Новосибирске, выборка Б — живые сайты из клиентской базы по всей России. Это не случайные выборки из рунета вообще, и разницу в 14% против 22,8% правильно читать как «лидеры коммерческой выдачи против малого и среднего бизнеса», а не как закон природы.

Мы проверяли только главную страницу. Защита может работать по-разному на разных разделах: каталог и карточки часто закрыты строже.

Это снимок одного дня. Настройки защиты меняются, списки исключений пополняются — что мы и увидели на сентябрьской выборке. Через полгода картина будет другой, и мы пересчитаем.

Источники

Данные собраны 7–8 октября 2026 года. Выдача снята через Arsenkin, проверка доступа — собственным скриптом, каждый ответ перепроверялся до трёх раз.

  1. OpenAI: описание краулеров: какие имена и диапазоны адресов использует GPTBot
  2. Anthropic: ClaudeBot и правила обхода: какие имена использует Anthropic и как настроить доступ
  3. Perplexity: PerplexityBot: описание робота и рекомендации для владельцев сайтов
  4. llmstxt.org: описание формата llms.txt: как устроен файл-оглавление для языковых моделей

Поможем с этим

Услуги агентства, которые закрывают задачи из этого исследования.

Это продолжение сентябрьской проверки: там разобрано, как отказы группируются по хостингу и что с этим делать. Смотреть первое исследование.

Частые вопросы

Почему доли считаются от 387 и 325, а не от всех проверенных сайтов?

Потому что о сайте, который не ответил вообще никому, нельзя сказать, пускает он ботов или нет. В первой выборке из 447 сайтов ответили хоть как-то 440, а браузерный запрос прошёл у 387 — только на этой базе сравнение браузера и бота имеет смысл. Во второй выборке таких сайтов 325.

Значит, сентябрьское исследование было неверным?

Главный вывод — отказы идут с уровня сервера, а не из robots.txt — подтвердился на обеих выборках. Неверной оказалась одна цифра: доля отказов GPTBot. Разовый запрос принял за блокировку то, что было реакцией на частые обращения. Мы поправим публикацию и поставим в ней ссылку на этот пересчёт.

Может, сайты просто защищаются от нагрузки?

Такие случаи мы вынесли отдельно: 429, 503 и обрывы связи — это 10,6% в первой выборке и 15,7% во второй, и в число отказов они не вошли. В отказы попал в основном код 403, который означает «доступ запрещён», а не «приходите позже».

Если бот не прошёл, сайт совсем не попадёт в ответы нейросети?

Не обязательно. Система может знать о сайте из обучающих данных или из чужих материалов, где он упомянут. Но свежие сведения — цены, услуги, условия — она с закрытого сайта не возьмёт.

Стоит ли закрывать ИИ-краулеров?

Решение за владельцем, но цена понятна: закрытый сайт пропадает из ответов, а конкуренты в них остаются. Промежуточный вариант — закрыть обучающие краулеры вроде CCBot и Bytespider, оставив открытыми тех, кто приводит людей. Именно так и поступают те немногие, кто вообще что-то настраивает.

Как понять, что у меня стоит антибот-защита?

Косвенный признак — сайт на массовом тарифе хостинга с защитой из коробки или подключённый к сервису защиты от DDoS. Прямой — разница между ответом браузеру и ответом боту при одинаковых прочих условиях. Проверяется за пять минут по инструкции выше.

Вы будете это пересчитывать?

Да, планируем повторить через полгода на обеих выборках. Списки исключений в защитных сервисах пополняются, и доля тихих запретов должна снижаться — интересно посмотреть, насколько.

Э
Материал подготовил SEO-отдел агентства «Эверест»

Продвигаем сайты с 2014 года, более 300 выполненных проектов. О компании · Кейсы

Нужна помощь с сайтом?

Оставьте свои контакты:

Напишите, как к вам обращаться
Телефон нужен, чтобы перезвонить
Проверьте адрес почты

Что хотелось бы улучшить?