Главное за 30 секунд
- У лидеров выдачи закрыто вдвое реже. Среди сайтов из ТОП-5 Яндекса отказ хотя бы одному ИИ-краулеру дали 14%, среди сайтов обычного бизнеса — 22,8%. Проверяли одной методикой в один день.
- Осознанный запрет редок везде. Запрет ИИ-ботам в robots.txt стоит у 4,4% сайтов из ТОП-5 и у 1,8% в клиентской выборке. Решение «не пускать нейросети» принимают единицы.
- Разница между этими числами и есть главная находка. У 13,4% сайтов в ТОП-5 и у 22,2% в клиентской выборке robots.txt разрешает, а сервер отказывает. Это не решение владельца, это настройки защиты, о которых он не знает.
- Больше всех достаётся ClaudeBot — 11,9% отказов в ТОП-5 против 6,5% у GPTBot и 3,4% у PerplexityBot. Фильтры узнают популярные имена и пропускают, остальных режут.
- Разовая проверка завышает долю закрытых. Перепроверив сентябрьскую выборку с правилом трёх попыток, мы получили по GPTBot 6,8% вместо 26%. Если проверяете свой сайт — повторяйте запрос трижды.
Что осталось непонятным после сентября
В сентябрьском исследовании мы запрашивали главную страницу 325 сайтов семью разными user-agent и увидели главное: отказы приходят с уровня сервера и группируются по хостингу, а не по решению владельца. Вывод подтвердился, но остались две дыры.
Первая — выборка. Это были живые сайты малого и среднего бизнеса, к которым у агентства есть доступ. Хорошая выборка, чтобы говорить с клиентом, но она ничего не говорит о тех, кто уже стоит в верхней части выдачи. А вопрос именно про них: нейросети берут в источники то, что поиск считает лучшим ответом. Если и там закрыто, картина ответов складывается не из лучших сайтов, а из тех, кто случайно оказался открыт.
Вторая — методика. Мы делали по одному запросу на бота. А хостинг при частых обращениях отвечает ошибкой кому угодно, включая браузер. Значит, часть «блокировок» могла быть обычным троттлингом.
Поэтому здесь две выборки, одна методика и один день проверки.
Две выборки, одна методика
- Выборка А — лидеры выдачи. 150 коммерческих и около-коммерческих запросов в десяти нишах, с которыми мы работаем: автосалоны, интернет-магазины, медицина, недвижимость, образование, отели и базы отдыха, перевозки из Китая, рестораны, салоны красоты, санатории. По пятнадцать запросов на нишу, ТОП-5 Яндекса по каждому, регион Новосибирск. Получилось 447 уникальных сайтов.
- Выборка Б — обычный бизнес. Те же 325 сайтов, что в сентябре, перепроверенные заново 8 октября.
- Что делали с каждым сайтом. Запрашивали главную страницу четырьмя
способами: обычным браузерным user-agent и тремя ИИ-краулерами —
GPTBot,ClaudeBot,PerplexityBot. Читалиrobots.txtи разбирали правила для двенадцати известных ИИ-роботов. Проверяли наличиеllms.txt.
Из 447 сайтов выборки А ответить удалось 440, а браузерный запрос прошёл у 387 — на них и считаем. В выборке Б браузеру ответили 325 сайтов. Остальные не отвечают никому: закрыты, переехали или не пускают никого извне. О таком сайте нельзя сказать, пускает он ботов или нет.
Запрет в robots.txt — редкость в обеих выборках
| Что видим | А: ТОП-5 | Б: бизнес |
|---|---|---|
| robots.txt вообще отдаётся | 93,0% | 95,1% |
| в нём упомянут хотя бы один ИИ-робот | 8,8% | 4,0% |
| хотя бы одному ИИ-роботу запрещён весь сайт | 4,4% | 1,8% |
Четыре процента и два процента — это очень мало. Тема «нейросети воруют контент» обсуждается второй год, а до строчки в robots.txt она доходит у одного сайта из двадцати трёх в ТОП-5 и у одного из пятидесяти пяти в обычном бизнесе. Разница между выборками осмысленная: у лидеров выдачи чаще есть кто-то, кто вообще знает про эти боты.
Кого закрывают, когда всё-таки закрывают: чаще всего
Bytespider (12 сайтов) и CCBot (10) — то есть
краулеры, которые собирают данные для обучения. GPTBot
запрещён у восьми, ClaudeBot — у пяти. Логика видна: закрывают
тех, кто учится на контенте, а не тех, кто приводит людей.
Сервер отказывает в разы чаще, чем robots.txt
Теперь то же самое, но не по документам, а по факту: мы просто просили главную страницу.
| Что происходит | А: ТОП-5 | Б: бизнес |
|---|---|---|
| не отдали страницу хотя бы одному из трёх | 14,0% | 22,8% |
| не отдали ни одному из трёх | 2,8% | 0,3% |
| ответили нестабильно: 429, 503 или обрыв связи | 10,6% | 15,7% |
| отдали всем трём | 75,5% | 76,9% |
Сопоставим с предыдущей таблицей. В ТОП-5 запрет в robots.txt стоит у 4,4% сайтов, а реальный отказ получают 14%: разница в 13,4 процентных пункта — это сайты, где robots.txt разрешает, а сервер отказывает. В обычном бизнесе разрыв ещё шире: 1,8% против 22,8%, то есть 22,2 пункта.
Чем именно отвечают: в выборке А это 80 раз 403 Forbidden —
прямой отказ в доступе, 16 раз 503, по четыре раза
502 и 415. В выборке Б картина другая: 65 раз
403 и 34 раза 415 Unsupported Media Type — код,
который на обычный запрос главной страницы не имеет смысла и выдаёт
срабатывание фильтра.
У лидеров выдачи закрыто вдвое реже
Главная цифра исследования: 14,0% против 22,8%. Сайт из первой пятёрки Яндекса примерно вдвое реже отказывает ИИ-краулеру, чем сайт обычного бизнеса.
Объяснять это тем, что лидеры лучше понимают GEO, не получается — мы только что видели, что осознанных настроек почти нет ни там, ни там. Правдоподобнее другое: сайт в ТОП-5 по коммерческому запросу — это, как правило, сайт покрупнее, на выделенном сервере или на площадке с настроенной защитой, где исключения для известных роботов кто-то однажды прописал. Малый бизнес живёт на массовых тарифах, где антибот включён по умолчанию и настроен строго, на всякий случай.
Практический вывод для владельца сайта обратный ожидаемому: чем скромнее ваш хостинг, тем выше шанс, что вы закрыты от нейросетей и не знаете об этом. И тем дешевле это исправить — обычно одним обращением в поддержку.
Кому отказывают: ClaudeBot чаще всех
| Краулер | А: ТОП-5 | Б: бизнес |
|---|---|---|
ClaudeBot | 11,9% | 22,8% |
GPTBot | 6,5% | 6,8% |
PerplexityBot | 3,4% | 0,9% |
Разброс почти в четыре раза, хотя запросы шли подряд, с одного адреса
и отличались только строкой user-agent. Объяснение простое: списки
исключений в защитных сервисах пополняются по мере того, как имя становится
известным. GPTBot знают и чаще пропускают, остальных
обрабатывает общее правило «незнакомый бот — отказать».
Обратите внимание: по GPTBot выборки практически
не отличаются, 6,5% и 6,8%, а весь разрыв между ними даёт
ClaudeBot — 11,9% против 22,8%. То есть дело не в общей
закрытости малого бизнеса, а в конкретных правилах, которые на массовых
хостингах ещё не обновили.
Для владельца сайта это значит, что проверять надо каждого робота отдельно. Пустили одного — не значит пустили всех.
По нишам: туризм закрыт, магазины открыты
Разрез по выборке А: 387 сайтов разложены по нишам, из которых брались запросы.
| Ниша | Сайтов | Не пускают | Есть llms.txt |
|---|---|---|---|
| Санатории | 48 | 22,9% | 10,4% |
| Отели и базы отдыха | 50 | 22,0% | 6,0% |
| Медицина | 54 | 18,5% | 3,7% |
| Перевозки из Китая | 43 | 16,3% | 20,9% |
| Недвижимость | 26 | 15,4% | 7,7% |
| Автосалоны | 37 | 10,8% | 13,5% |
| Образование | 47 | 8,5% | 10,6% |
| Салоны красоты | 51 | 7,8% | 5,9% |
| Рестораны | 43 | 7,0% | 7,0% |
| Интернет-магазины | 53 | 5,7% | 24,5% |
Разрыв между крайними нишами — вчетверо. Объяснение, скорее всего, не в отношении к нейросетям, а в том, какой хостинг и какая защита типичны для отрасли. Санатории и базы отдыха живут на коробочных решениях с агрессивным антиботом по умолчанию, интернет-магазины — на площадках, где доступ роботов настраивают осознанно, потому что от него зависят товарные агрегаторы и прайс-площадки.
Обратите внимание на последний столбец: у интернет-магазинов и llms.txt встречается чаще всех. Там, где роботов пускают сознательно, им ещё и подсказывают, куда идти.
Оговорка про размер групп: в каждой нише от 26 до 54 сайтов, так что разница между соседними строками в пределах нескольких пунктов ничего не значит. Читать стоит только крайности: туризм и медицина против интернет-магазинов.
llms.txt: у каждого восьмого в ТОП-5
Файл /llms.txt — короткое текстовое оглавление сайта
для языковых моделей. В выборке А он нашёлся у 48 сайтов из 387, это 12,4%,
в выборке Б — у 24 из 325, это 7,4%. Для формата, которому нет и двух лет
и который не является официальным стандартом, довольно много.
Здесь мы отдельно повозились с методикой, и это стоит рассказать. Первая версия проверки считала файл найденным, если адрес отдаёт 200 и в ответе не видно html-тегов. Так в выборку попали редиректы на главную и заглушки хостинга — примерно треть ложных срабатываний. Пришлось проверять строже: не идти по редиректам, смотреть тип содержимого и убеждаться, что внутри именно markdown-оглавление с заголовком и ссылками. После этого из 92 найденных файлов осталось 48.
Честная оговорка про сам формат: ни один крупный вендор пока
не подтвердил, что читает llms.txt. Делать файл стоит — он
занимает полчаса и ничему не мешает. Рассчитывать, что он уже сегодня
приведёт вас в ответы нейросетей, не стоит.
Почему сентябрьские числа были выше
В сентябре мы писали, что ClaudeBot получает отказ
на 36% сайтов, а GPTBot — на 26%. Перепроверка той же выборки
с правилом трёх попыток даёт 22,8% и 6,8%. Разберём, откуда разница.
| Краулер | Сентябрь, одна попытка | Октябрь, три попытки |
|---|---|---|
ClaudeBot | 36% | 22,8% |
GPTBot | 26% | 6,8% |
PerplexityBot | 1% | 0,9% |
По ClaudeBot вывод устоял: отказ воспроизводится
при повторных запросах, это правило в защите. По GPTBot — нет:
большая часть того, что мы приняли за блокировку, при повторе превращается
в нормальный ответ. Это был троттлинг, реакция на частые запросы,
а не правило про конкретного бота.
Вторая часть разницы в том, что за прошедшие десять дней списки исключений
в защитных сервисах могли пополниться. Разделить два эффекта на наших
данных нельзя, и мы этого не делаем. Можно сказать только одно: устойчивый
отказ GPTBot сейчас получает 6,8% сайтов выборки,
а не четверть.
Как проверить свой сайт за пять минут
- Откройте свой robots.txt и поищите строки с
GPTBot,ClaudeBot,PerplexityBot,CCBot,Google-Extended,Bytespider. Если запретов нет — это ещё ничего не значит, переходите к следующему пункту. - Запросите главную страницу от имени бота. В терминале:
curl -I -A "GPTBot" https://ваш-сайт.ру/. Повторите дляClaudeBotиPerplexityBot. - Сравните с обычным запросом от имени браузера. Если браузеру 200, а боту 403 — у вас тихий запрет.
- Повторите три раза с паузой. Разовый 429 или 503 — это защита от частых запросов, а не блокировка. Именно на этом шаге отсеивается большая часть ложных тревог.
- Если нашли устойчивый отказ — идите в поддержку хостинга или в настройки антибот-сервиса и просите добавить эти user-agent в исключения. Обычно это одно обращение.
- Зафиксируйте позицию в robots.txt. Явное
Allowдля поисковых ботов нейросетей и запрет для обучающих — чтобы ваше решение не зависело от настроек хостинга.
Чего эти данные не доказывают
Мы стучались user-agent'ом, а не настоящим ботом. Это главное
ограничение. Реальные ИИ-краулеры приходят с известных диапазонов адресов,
и грамотная защита проверяет не только имя, но и обратный DNS. Часть
отказов, которые мы увидели, могла быть защитой от подделок: нас приняли
за бота-самозванца и не пустили, а настоящий GPTBot
с правильного адреса прошёл бы.
Поэтому к 14% и 22,8% стоит относиться как к верхней границе. Нижняя граница — явные запреты в robots.txt, 4,4% и 1,8%. Истина между, и ближе к какому краю — зависит от того, насколько аккуратно настроена защита на конкретном сайте.
Две выборки собраны по-разному. Выборка А — ТОП-5 по коммерческим запросам в Новосибирске, выборка Б — живые сайты из клиентской базы по всей России. Это не случайные выборки из рунета вообще, и разницу в 14% против 22,8% правильно читать как «лидеры коммерческой выдачи против малого и среднего бизнеса», а не как закон природы.
Мы проверяли только главную страницу. Защита может работать по-разному на разных разделах: каталог и карточки часто закрыты строже.
Это снимок одного дня. Настройки защиты меняются, списки исключений пополняются — что мы и увидели на сентябрьской выборке. Через полгода картина будет другой, и мы пересчитаем.
Источники
Данные собраны 7–8 октября 2026 года. Выдача снята через Arsenkin, проверка доступа — собственным скриптом, каждый ответ перепроверялся до трёх раз.
- OpenAI: описание краулеров: какие имена и диапазоны адресов использует GPTBot
- Anthropic: ClaudeBot и правила обхода: какие имена использует Anthropic и как настроить доступ
- Perplexity: PerplexityBot: описание робота и рекомендации для владельцев сайтов
- llmstxt.org: описание формата llms.txt: как устроен файл-оглавление для языковых моделей
Поможем с этим
Услуги агентства, которые закрывают задачи из этого исследования.
Это продолжение сентябрьской проверки: там разобрано, как отказы группируются по хостингу и что с этим делать. Смотреть первое исследование.
Частые вопросы
Почему доли считаются от 387 и 325, а не от всех проверенных сайтов?
Потому что о сайте, который не ответил вообще никому, нельзя сказать, пускает он ботов или нет. В первой выборке из 447 сайтов ответили хоть как-то 440, а браузерный запрос прошёл у 387 — только на этой базе сравнение браузера и бота имеет смысл. Во второй выборке таких сайтов 325.
Значит, сентябрьское исследование было неверным?
Главный вывод — отказы идут с уровня сервера, а не из robots.txt — подтвердился на обеих выборках. Неверной оказалась одна цифра: доля отказов GPTBot. Разовый запрос принял за блокировку то, что было реакцией на частые обращения. Мы поправим публикацию и поставим в ней ссылку на этот пересчёт.
Может, сайты просто защищаются от нагрузки?
Такие случаи мы вынесли отдельно: 429, 503 и обрывы связи — это 10,6% в первой выборке и 15,7% во второй, и в число отказов они не вошли. В отказы попал в основном код 403, который означает «доступ запрещён», а не «приходите позже».
Если бот не прошёл, сайт совсем не попадёт в ответы нейросети?
Не обязательно. Система может знать о сайте из обучающих данных или из чужих материалов, где он упомянут. Но свежие сведения — цены, услуги, условия — она с закрытого сайта не возьмёт.
Стоит ли закрывать ИИ-краулеров?
Решение за владельцем, но цена понятна: закрытый сайт пропадает из ответов, а конкуренты в них остаются. Промежуточный вариант — закрыть обучающие краулеры вроде CCBot и Bytespider, оставив открытыми тех, кто приводит людей. Именно так и поступают те немногие, кто вообще что-то настраивает.
Как понять, что у меня стоит антибот-защита?
Косвенный признак — сайт на массовом тарифе хостинга с защитой из коробки или подключённый к сервису защиты от DDoS. Прямой — разница между ответом браузеру и ответом боту при одинаковых прочих условиях. Проверяется за пять минут по инструкции выше.
Вы будете это пересчитывать?
Да, планируем повторить через полгода на обеих выборках. Списки исключений в защитных сервисах пополняются, и доля тихих запретов должна снижаться — интересно посмотреть, насколько.
Продвигаем сайты с 2014 года, более 300 выполненных проектов. О компании · Кейсы


