Главное за 30 секунд
- Большая часть сайтов закрыта от ИИ-поисковиков — и не знает об этом. Мы запросили главную страницу 325 сайтов семью разными User-Agent. Обычному боту с выдуманным названием ответили все 325 сайтов, Яндексу — все, кроме 2. А вот ClaudeBot получил отказ на 36% сайтов, GPTBot — на 26%.
- Это делает хостинг, а не владелец. В
robots.txtИИ-агенты упомянуты всего у 11 сайтов из 325 (3%). Отказы приходят с уровня сервера и почти идеально группируются по хостингу: среди сайтов с одним и тем же заголовкомServerClaudeBot блокируется у 100%. - Поисковые боты ИИ при этом почти везде открыты. OAI-SearchBot, который ходит за ответом для ChatGPT, не пустили только 5 сайта, PerplexityBot — 2. Закрывают в основном краулеры, которые собирают данные для обучения.
- Цитировать по большей части нечего. Разметки Schema.org нет совсем у 64% сайтов,
FAQPageесть у 4%,Organization— у 23%. - Проверяется это за пять минут одной командой curl. Ниже — что именно запускать и что делать с результатом.
Что такое GEO и чем оно отличается от SEO
GEO (generative engine optimization) — это работа над тем, чтобы сайт попадал в ответы ИИ-поисковиков: ChatGPT, Perplexity, обзоров от ИИ в Google, Алисы. Механика там другая, чем в классической выдаче: ИИ-поисковик не ранжирует страницы, он цитирует источники. Попасть в цитату — это новое «быть в ТОП-3», и попадание устроено иначе: важна не позиция, а то, насколько легко из страницы вытащить готовый факт.
При этом фундамент общий. Если страницы нет в индексе, если бот не может её получить, если факты зашиты в картинку, — цитировать нечего, какой бы хороший текст там ни был. Поэтому GEO-аудит всегда начинается не с текстов, а со скучного: пускают ли на сайт.
Что мы проверили и как
Мы взяли 325 живых сайтов, к которым у агентства есть доступ в Яндекс.Метрике: малый и средний бизнес России, разные ниши и хостинги. По каждому сделали одно и то же — запросили главную страницу семь раз подряд, меняя только заголовок User-Agent.
Это важная деталь методики. Все семь запросов уходят с одного адреса, в одну и ту же секунду, по одному и тому же URL. Отличается одна строка. Значит, любая разница в ответе — это реакция сервера именно на имя бота.
Среди семи агентов три контрольных: реальный браузер Safari, YandexBot и бот с выдуманным названием — обычный «вежливый» краулер, которого точно нет ни в одном списке. Контрольный бот нужен, чтобы отделить «сайт блокирует всех, кто не браузер» от «сайт блокирует именно ИИ».
Результат: ИИ-краулеры блокируют выборочно
| Кто запрашивал | Не ответили | Доля |
|---|---|---|
| Обычный бот с нашим названием — контроль | 0 | 0% |
| Googlebot — контроль | 1 | 0% |
| YandexBot — контроль | 2 | 1% |
| PerplexityBot | 2 | 1% |
| OAI-SearchBot (поиск ChatGPT) | 5 | 2% |
| GPTBot (OpenAI) | 85 | 26% |
| ClaudeBot (Anthropic) | 117 | 36% |
Читается это однозначно. Сайты не закрываются от ботов вообще: выдуманный краулер получил страницу везде, Яндекс и Google — практически везде. Отказ получают конкретные ИИ-агенты, названные по имени.
Это настройка хостинга, а не решение владельца
Первое, что приходит в голову: владельцы сайтов сами закрылись от ИИ, чтобы контент не уходил в обучение. Это законная позиция, и мы её проверили. В robots.txt ИИ-агенты упомянуты всего у 11 сайтов из 325. То есть осознанное решение приняли единицы.
Дальше мы сгруппировали сайты по заголовку Server, который отдаёт веб-сервер. Картина оказалась почти бинарной.
| Заголовок Server | Сайтов | Отказ ClaudeBot | Отказ GPTBot |
|---|---|---|---|
| nginx | 71 | 55% | 52% |
| ddos-guard | 58 | 3% | 3% |
| nginx-reuseport/1.21.1 | 48 | 10% | 44% |
| nginx/1.30.4 | 45 | 100% | 0% |
| nginx/1.31.3 | 20 | 85% | 85% |
| cloudflare | 13 | 38% | 38% |
Строка с nginx/1.30.4 — 45 сайтов, и ClaudeBot заблокирован ровно у всех сорока пяти, а GPTBot не заблокирован ни у одного. Это не может быть совпадением решений сорока пяти разных владельцев: это одно правило в конфигурации одного хостинга. Соседняя строка с другой версией даёт 85% по обоим ботам, а крупный сервис защиты от DDoS, наоборот, почти никого не блокирует.
Практический вывод: ваш сайт может быть закрыт от ИИ-поиска без вашего ведома и без единой строки в robots.txt. Это решил за вас хостинг или сервис защиты, и увидеть это в панели управления нельзя — только запросом.
Как проверить свой сайт за пять минут
Нужен только curl — он есть в macOS и в Windows 10 и новее. Команда запрашивает главную страницу от имени бота и печатает только код ответа:
200 — всё в порядке, бот получает страницу. 403, 503, 415, 429 или пустой ответ — бот отсекается. Если ответы отличаются от того, что отдаётся браузеру, дело не в сайте, а в правиле на сервере.
Проверять robots.txt при этом тоже нужно, но он вторичен: блокировка на уровне сервера срабатывает раньше и сильнее. И наоборот — открытый robots.txt ничего не гарантирует, что и показывает наша выборка.
Что делать, если бот отсекается
Порядок действий простой, и почти всё делается руками хостинга.
- Написать в поддержку хостинга. Формулировка: «на сервере есть правило, отбрасывающее запросы с User-Agent ClaudeBot и GPTBot; просим снять его для нашего домена». Как правило, это одна строка в конфигурации.
- Проверить сервис защиты от DDoS и WAF, если он подключён. В Cloudflare это раздел с правилами для ботов, там ИИ-краулеры выделены отдельной категорией и часто включены в блокировку по умолчанию.
- Отдельно решить вопрос про обучение. Это вопрос не технический, а владельческий: пускать ли краулеры, которые собирают данные для обучения моделей. Можно оставить открытыми только поисковые боты и закрыть обучающие — они разделены у большинства вендоров.
- Прописать намерение явно в robots.txt, чтобы позиция была зафиксирована и не зависела от настроек хостинга:
И честная оговорка, которую стоит проговаривать клиенту: директивы в robots.txt соблюдаются добровольно и защитой не являются. Кто не соблюдает — заберёт контент в любом случае. Robots.txt управляет видимостью, а не доступом.
Второй слой: цитировать в основном нечего
Допустим, бот на сайт зашёл. Дальше ему нужно вытащить факт, не разбирая вёрстку. Для этого существует разметка Schema.org, и с ней в выборке плохо.
- Разметки нет вообще у 64% сайтов.
Organization— у 23%,WebSite— у 18%.BreadcrumbList— у 10%,LocalBusiness— у 5%.FAQPage— самый цитируемый формат, готовые пары «вопрос — ответ» — есть у 4%.
Отдельный сюжет — файл llms.txt: короткое текстовое описание сайта и его разделов для языковых моделей. Мы нашли его у 20 сайтов из 325, и почти все они — те, где его ставили специально. Стандарт пока неофициальный, и ни один крупный вендор не подтвердил, что читает его. Ставить имеет смысл: файл дешёвый и вреда не приносит. Ждать от него эффекта прямо сейчас — нет.
Третий слой: текст, который удобно цитировать
Здесь есть измеренные данные. В работе «GEO: Generative Engine Optimization» (arXiv 2311.09735, принята на KDD 2024) авторы проверили девять способов переписать страницу и замерили, как меняется её видимость в ответах генеративного поиска. Тестировали на Perplexity, английские тексты.
- Ссылки на первоисточники — плюс до 40%. Для коммерческих тем это ГОСТы, техрегламенты, данные Росстата, отраслевые исследования. «Мы лидеры рынка» источником не является.
- Конкретные числа вместо оценок — плюс до 37%. Не «значительно сокращает сроки», а «сокращает монтаж с 5 дней до 2».
- Прямая речь эксперта с именем и должностью — плюс до 30%.
- Утвердительный тон — плюс до 25%. Русские коммерческие тексты страдают обратным: «как правило», «в большинстве случаев», «обычно».
- Переспам ключевых слов — минус 10%. Это измеренный вред, а не нейтральное явление.
Проценты получены на их бенчмарке и гарантией на конкретном сайте не являются — авторы сами отмечают, что эффект различается по тематикам. Но направление понятное, и оно совпадает с тем, что и так делает текст лучше.
К этому добавляется структура: прямой ответ в первом абзаце до первого подзаголовка, один H1 и честная иерархия дальше, абзацы по два-три предложения, вопросы в подзаголовках формулировкой пользователя, видимая дата обновления. Стены текста не цитируют — из них нечего достать одним фрагментом.
С чего начать
Порядок ровно такой, снизу вверх, и первые два шага дают больше, чем все остальные вместе.
- Проверить доступ ботов — тремя командами curl выше. Если отказ, написать хостингу. Это полчаса работы и единственный шаг, без которого всё остальное бессмысленно.
- Поставить разметку на главную, страницы услуг и контакты:
Organization,LocalBusiness,BreadcrumbList, а на страницах с вопросами —FAQPage. Обязательно проверить валидность: битый JSON-LD молча игнорируется, и вы думаете, что разметка есть. - Переписать первые абзацы ключевых страниц так, чтобы они отвечали на вопрос сразу, и добавить туда конкретные числа.
- Посмотреть, кого цитируют сейчас. Задайте ИИ-поисковику 3–5 вопросов, ответом на которые должен быть ваш сайт, и посмотрите, чьи страницы попали в источники. Это не метрика, а иллюстрация, но она хорошо показывает, с кем вы на самом деле конкурируете.
И чего делать не стоит: обещать себе или клиенту позиции в ответах ИИ. Гарантировать можно только устранение препятствий — чтобы сайт мог быть процитирован. Дальше решает модель.
Источники
Проверка выполнена силами агентства, методика описана полностью — её можно повторить.
- Проверка доступа: 325 сайтов, к которым у агентства есть доступ в Яндекс.Метрике. По каждому домену главная страница запрашивалась семью User-Agent подряд с одного адреса. Каждый отказ перепроверялся повторным прогоном с чередованием браузерного агента; в таблицу попали только воспроизводимые результаты. Данные собраны 28 сентября 2026 года.
- Разметка: типы Schema.org собраны из блоков
application/ld+jsonна главных страницах тех же сайтов. - GEO: Generative Engine Optimization, Aggarwal et al., arXiv:2311.09735, принята на KDD 2024 — источник данных по девяти методам и их измеренному эффекту.
- Документация OpenAI по ботам и описание агентов Anthropic — актуальные имена агентов и их назначение. Имена меняются, перед аудитом стоит сверяться с первоисточником.
Поможем с этим
Услуги агентства, которые закрывают задачи из этой статьи.
Пока ИИ-поиск набирает долю, основной трафик по-прежнему приходит из Яндекса — и за год он просел у большинства сайтов: смотреть исследование.
Частые вопросы
Как понять, закрыт ли мой сайт от ИИ-поисковиков?
Запросите главную страницу командой curl с User-Agent ClaudeBot, GPTBot и OAI-SearchBot и посмотрите код ответа. 200 — всё в порядке. 403, 503, 415, 429 или пустой ответ означают, что бота отсекают на уровне сервера. Проверка занимает пять минут, команды есть в статье.
Кто закрывает ИИ-ботов, если я этого не делал?
Чаще всего хостинг или сервис защиты от DDoS. В нашей выборке отказы почти идеально группируются по заголовку Server: среди сайтов на одной и той же сборке веб-сервера ClaudeBot заблокирован у 100%, а на соседней не заблокирован ни у кого. В robots.txt при этом ИИ-агенты упомянуты всего у 11 сайтов из 325.
Стоит ли пускать ИИ-ботов на сайт?
Поисковых — да, если вы хотите, чтобы сайт цитировали в ответах. Краулеры, которые собирают данные для обучения моделей, — вопрос владельца: у большинства вендоров они разделены, и можно открыть одни и закрыть другие. Важно понимать, что robots.txt соблюдается добровольно и защитой не является.
Нужен ли файл llms.txt?
Поставить можно: он дешёвый и вреда не приносит. Но стандарт пока неофициальный, ни один крупный вендор не подтвердил, что его читает, и ждать от него эффекта сейчас не стоит. Разметка Schema.org и доступ ботов важнее на порядок.
GEO заменит SEO?
Нет. Это второй контур поверх того же фундамента. Если страница не в индексе и бот не может её получить, цитировать нечего. В России при этом основной трафик по-прежнему даёт классическая выдача Яндекса, поэтому GEO разумно делать дополнительно, а не вместо.
Продвигаем сайты с 2014 года, более 300 выполненных проектов. О компании · Кейсы


