SEO (поисковое продвижение)ИИ

Почему сайт не попадает в ответы ИИ-поисковиков: проверили 325 сайтов

Мы запросили главную страницу 325 сайтов семью разными User-Agent и получили неожиданный результат: боту с выдуманным названием ответили все, а ИИ-краулеры получили отказ на трети сайтов. Почти всегда — без ведома владельца.

Александр, руководитель SEO-отделаОпубликовано 9 мин чтения

Главное за 30 секунд

  • Большая часть сайтов закрыта от ИИ-поисковиков — и не знает об этом. Мы запросили главную страницу 325 сайтов семью разными User-Agent. Обычному боту с выдуманным названием ответили все 325 сайтов, Яндексу — все, кроме 2. А вот ClaudeBot получил отказ на 36% сайтов, GPTBot — на 26%.
  • Это делает хостинг, а не владелец. В robots.txt ИИ-агенты упомянуты всего у 11 сайтов из 325 (3%). Отказы приходят с уровня сервера и почти идеально группируются по хостингу: среди сайтов с одним и тем же заголовком Server ClaudeBot блокируется у 100%.
  • Поисковые боты ИИ при этом почти везде открыты. OAI-SearchBot, который ходит за ответом для ChatGPT, не пустили только 5 сайта, PerplexityBot — 2. Закрывают в основном краулеры, которые собирают данные для обучения.
  • Цитировать по большей части нечего. Разметки Schema.org нет совсем у 64% сайтов, FAQPage есть у 4%, Organization — у 23%.
  • Проверяется это за пять минут одной командой curl. Ниже — что именно запускать и что делать с результатом.

Что такое GEO и чем оно отличается от SEO

GEO (generative engine optimization) — это работа над тем, чтобы сайт попадал в ответы ИИ-поисковиков: ChatGPT, Perplexity, обзоров от ИИ в Google, Алисы. Механика там другая, чем в классической выдаче: ИИ-поисковик не ранжирует страницы, он цитирует источники. Попасть в цитату — это новое «быть в ТОП-3», и попадание устроено иначе: важна не позиция, а то, насколько легко из страницы вытащить готовый факт.

При этом фундамент общий. Если страницы нет в индексе, если бот не может её получить, если факты зашиты в картинку, — цитировать нечего, какой бы хороший текст там ни был. Поэтому GEO-аудит всегда начинается не с текстов, а со скучного: пускают ли на сайт.

Что мы проверили и как

Мы взяли 325 живых сайтов, к которым у агентства есть доступ в Яндекс.Метрике: малый и средний бизнес России, разные ниши и хостинги. По каждому сделали одно и то же — запросили главную страницу семь раз подряд, меняя только заголовок User-Agent.

Это важная деталь методики. Все семь запросов уходят с одного адреса, в одну и ту же секунду, по одному и тому же URL. Отличается одна строка. Значит, любая разница в ответе — это реакция сервера именно на имя бота.

Среди семи агентов три контрольных: реальный браузер Safari, YandexBot и бот с выдуманным названием — обычный «вежливый» краулер, которого точно нет ни в одном списке. Контрольный бот нужен, чтобы отделить «сайт блокирует всех, кто не браузер» от «сайт блокирует именно ИИ».

Результат: ИИ-краулеры блокируют выборочно

Сколько сайтов из 325 не отдали главную страницу боту. Один и тот же адрес, один и тот же запрос, отличается только User-Agent. Браузеру ответили все 325.
Кто запрашивалНе ответилиДоля
Обычный бот с нашим названием — контроль00%
Googlebot — контроль10%
YandexBot — контроль21%
PerplexityBot21%
OAI-SearchBot (поиск ChatGPT)52%
GPTBot (OpenAI)8526%
ClaudeBot (Anthropic)11736%

Читается это однозначно. Сайты не закрываются от ботов вообще: выдуманный краулер получил страницу везде, Яндекс и Google — практически везде. Отказ получают конкретные ИИ-агенты, названные по имени.

Итог по ИИ-ботам: хотя бы один из двух крупных краулеров — GPTBot или ClaudeBot — не смог получить главную страницу у 137 сайтов из 325 (42%). Отказы выглядят по-разному: код 403, 503, 415 или разрыв соединения без ответа. Мы перепроверяли каждый случай дважды с чередованием браузерного агента — результат воспроизводится полностью.

Это настройка хостинга, а не решение владельца

Первое, что приходит в голову: владельцы сайтов сами закрылись от ИИ, чтобы контент не уходил в обучение. Это законная позиция, и мы её проверили. В robots.txt ИИ-агенты упомянуты всего у 11 сайтов из 325. То есть осознанное решение приняли единицы.

Дальше мы сгруппировали сайты по заголовку Server, который отдаёт веб-сервер. Картина оказалась почти бинарной.

Те же отказы в разрезе заголовка Server. Значение этого заголовка косвенно указывает на хостинг: у сайтов с одинаковым заголовком поведение почти одинаковое.
Заголовок ServerСайтовОтказ ClaudeBotОтказ GPTBot
nginx7155%52%
ddos-guard583%3%
nginx-reuseport/1.21.14810%44%
nginx/1.30.445100%0%
nginx/1.31.32085%85%
cloudflare1338%38%

Строка с nginx/1.30.4 — 45 сайтов, и ClaudeBot заблокирован ровно у всех сорока пяти, а GPTBot не заблокирован ни у одного. Это не может быть совпадением решений сорока пяти разных владельцев: это одно правило в конфигурации одного хостинга. Соседняя строка с другой версией даёт 85% по обоим ботам, а крупный сервис защиты от DDoS, наоборот, почти никого не блокирует.

Практический вывод: ваш сайт может быть закрыт от ИИ-поиска без вашего ведома и без единой строки в robots.txt. Это решил за вас хостинг или сервис защиты, и увидеть это в панели управления нельзя — только запросом.

Как проверить свой сайт за пять минут

Нужен только curl — он есть в macOS и в Windows 10 и новее. Команда запрашивает главную страницу от имени бота и печатает только код ответа:

curl -s -o /dev/null -w "%{http_code}\n" -A \ "Mozilla/5.0 (compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" \ https://example.ru/ curl -s -o /dev/null -w "%{http_code}\n" -A \ "Mozilla/5.0 (compatible; GPTBot/1.2; +https://openai.com/gptbot)" \ https://example.ru/ curl -s -o /dev/null -w "%{http_code}\n" -A \ "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" \ https://example.ru/

200 — всё в порядке, бот получает страницу. 403, 503, 415, 429 или пустой ответ — бот отсекается. Если ответы отличаются от того, что отдаётся браузеру, дело не в сайте, а в правиле на сервере.

Проверять robots.txt при этом тоже нужно, но он вторичен: блокировка на уровне сервера срабатывает раньше и сильнее. И наоборот — открытый robots.txt ничего не гарантирует, что и показывает наша выборка.

Что делать, если бот отсекается

Порядок действий простой, и почти всё делается руками хостинга.

  • Написать в поддержку хостинга. Формулировка: «на сервере есть правило, отбрасывающее запросы с User-Agent ClaudeBot и GPTBot; просим снять его для нашего домена». Как правило, это одна строка в конфигурации.
  • Проверить сервис защиты от DDoS и WAF, если он подключён. В Cloudflare это раздел с правилами для ботов, там ИИ-краулеры выделены отдельной категорией и часто включены в блокировку по умолчанию.
  • Отдельно решить вопрос про обучение. Это вопрос не технический, а владельческий: пускать ли краулеры, которые собирают данные для обучения моделей. Можно оставить открытыми только поисковые боты и закрыть обучающие — они разделены у большинства вендоров.
  • Прописать намерение явно в robots.txt, чтобы позиция была зафиксирована и не зависела от настроек хостинга:
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / Sitemap: https://example.ru/sitemap.xml

И честная оговорка, которую стоит проговаривать клиенту: директивы в robots.txt соблюдаются добровольно и защитой не являются. Кто не соблюдает — заберёт контент в любом случае. Robots.txt управляет видимостью, а не доступом.

Второй слой: цитировать в основном нечего

Допустим, бот на сайт зашёл. Дальше ему нужно вытащить факт, не разбирая вёрстку. Для этого существует разметка Schema.org, и с ней в выборке плохо.

  • Разметки нет вообще у 64% сайтов.
  • Organization — у 23%, WebSite — у 18%.
  • BreadcrumbList — у 10%, LocalBusiness — у 5%.
  • FAQPage — самый цитируемый формат, готовые пары «вопрос — ответ» — есть у 4%.

Отдельный сюжет — файл llms.txt: короткое текстовое описание сайта и его разделов для языковых моделей. Мы нашли его у 20 сайтов из 325, и почти все они — те, где его ставили специально. Стандарт пока неофициальный, и ни один крупный вендор не подтвердил, что читает его. Ставить имеет смысл: файл дешёвый и вреда не приносит. Ждать от него эффекта прямо сейчас — нет.

Третий слой: текст, который удобно цитировать

Здесь есть измеренные данные. В работе «GEO: Generative Engine Optimization» (arXiv 2311.09735, принята на KDD 2024) авторы проверили девять способов переписать страницу и замерили, как меняется её видимость в ответах генеративного поиска. Тестировали на Perplexity, английские тексты.

  • Ссылки на первоисточники — плюс до 40%. Для коммерческих тем это ГОСТы, техрегламенты, данные Росстата, отраслевые исследования. «Мы лидеры рынка» источником не является.
  • Конкретные числа вместо оценок — плюс до 37%. Не «значительно сокращает сроки», а «сокращает монтаж с 5 дней до 2».
  • Прямая речь эксперта с именем и должностью — плюс до 30%.
  • Утвердительный тон — плюс до 25%. Русские коммерческие тексты страдают обратным: «как правило», «в большинстве случаев», «обычно».
  • Переспам ключевых слов — минус 10%. Это измеренный вред, а не нейтральное явление.

Проценты получены на их бенчмарке и гарантией на конкретном сайте не являются — авторы сами отмечают, что эффект различается по тематикам. Но направление понятное, и оно совпадает с тем, что и так делает текст лучше.

К этому добавляется структура: прямой ответ в первом абзаце до первого подзаголовка, один H1 и честная иерархия дальше, абзацы по два-три предложения, вопросы в подзаголовках формулировкой пользователя, видимая дата обновления. Стены текста не цитируют — из них нечего достать одним фрагментом.

С чего начать

Порядок ровно такой, снизу вверх, и первые два шага дают больше, чем все остальные вместе.

  1. Проверить доступ ботов — тремя командами curl выше. Если отказ, написать хостингу. Это полчаса работы и единственный шаг, без которого всё остальное бессмысленно.
  2. Поставить разметку на главную, страницы услуг и контакты: Organization, LocalBusiness, BreadcrumbList, а на страницах с вопросами — FAQPage. Обязательно проверить валидность: битый JSON-LD молча игнорируется, и вы думаете, что разметка есть.
  3. Переписать первые абзацы ключевых страниц так, чтобы они отвечали на вопрос сразу, и добавить туда конкретные числа.
  4. Посмотреть, кого цитируют сейчас. Задайте ИИ-поисковику 3–5 вопросов, ответом на которые должен быть ваш сайт, и посмотрите, чьи страницы попали в источники. Это не метрика, а иллюстрация, но она хорошо показывает, с кем вы на самом деле конкурируете.

И чего делать не стоит: обещать себе или клиенту позиции в ответах ИИ. Гарантировать можно только устранение препятствий — чтобы сайт мог быть процитирован. Дальше решает модель.

Источники

Проверка выполнена силами агентства, методика описана полностью — её можно повторить.

  1. Проверка доступа: 325 сайтов, к которым у агентства есть доступ в Яндекс.Метрике. По каждому домену главная страница запрашивалась семью User-Agent подряд с одного адреса. Каждый отказ перепроверялся повторным прогоном с чередованием браузерного агента; в таблицу попали только воспроизводимые результаты. Данные собраны 28 сентября 2026 года.
  2. Разметка: типы Schema.org собраны из блоков application/ld+json на главных страницах тех же сайтов.
  3. GEO: Generative Engine Optimization, Aggarwal et al., arXiv:2311.09735, принята на KDD 2024 — источник данных по девяти методам и их измеренному эффекту.
  4. Документация OpenAI по ботам и описание агентов Anthropic — актуальные имена агентов и их назначение. Имена меняются, перед аудитом стоит сверяться с первоисточником.

Поможем с этим

Услуги агентства, которые закрывают задачи из этой статьи.

Пока ИИ-поиск набирает долю, основной трафик по-прежнему приходит из Яндекса — и за год он просел у большинства сайтов: смотреть исследование.

Частые вопросы

Как понять, закрыт ли мой сайт от ИИ-поисковиков?

Запросите главную страницу командой curl с User-Agent ClaudeBot, GPTBot и OAI-SearchBot и посмотрите код ответа. 200 — всё в порядке. 403, 503, 415, 429 или пустой ответ означают, что бота отсекают на уровне сервера. Проверка занимает пять минут, команды есть в статье.

Кто закрывает ИИ-ботов, если я этого не делал?

Чаще всего хостинг или сервис защиты от DDoS. В нашей выборке отказы почти идеально группируются по заголовку Server: среди сайтов на одной и той же сборке веб-сервера ClaudeBot заблокирован у 100%, а на соседней не заблокирован ни у кого. В robots.txt при этом ИИ-агенты упомянуты всего у 11 сайтов из 325.

Стоит ли пускать ИИ-ботов на сайт?

Поисковых — да, если вы хотите, чтобы сайт цитировали в ответах. Краулеры, которые собирают данные для обучения моделей, — вопрос владельца: у большинства вендоров они разделены, и можно открыть одни и закрыть другие. Важно понимать, что robots.txt соблюдается добровольно и защитой не является.

Нужен ли файл llms.txt?

Поставить можно: он дешёвый и вреда не приносит. Но стандарт пока неофициальный, ни один крупный вендор не подтвердил, что его читает, и ждать от него эффекта сейчас не стоит. Разметка Schema.org и доступ ботов важнее на порядок.

GEO заменит SEO?

Нет. Это второй контур поверх того же фундамента. Если страница не в индексе и бот не может её получить, цитировать нечего. В России при этом основной трафик по-прежнему даёт классическая выдача Яндекса, поэтому GEO разумно делать дополнительно, а не вместо.

Э
Материал подготовил SEO-отдел агентства «Эверест»

Продвигаем сайты с 2014 года, более 300 выполненных проектов. О компании · Кейсы

Нужна помощь с сайтом?

Оставьте свои контакты:

Напишите, как к вам обращаться
Телефон нужен, чтобы перезвонить
Проверьте адрес почты

Что хотелось бы улучшить?