Блокировать AI-краулеров через robots.txt или на уровне сервера?
Решение ограничить доступ AI-краулеров к сайту сегодня стало не только техническим, но и бизнес-вопросом. Владельцы ресурсов хотят защитить собственный контент от обучения нейросетей, снизить нагрузку на инфраструктуру и сохранить контроль над данными. При этом запрет для всех ботов может уменьшить представленность бренда в ответах ChatGPT, Google AI Overviews и других систем.
На практике применяются два основных подхода: настройка robots.txt для AI-ботов и принудительная фильтрация запросов на уровне сервера, CDN или WAF. Разница между ними принципиальна: robots.txt основан на добровольном соблюдении правил, тогда как серверная блокировка действительно не позволяет роботу получить содержимое.
Как работает robots.txt
Файл robots.txt размещается в корневом каталоге сайта и содержит инструкции для автоматических роботов. У каждого крупного AI-сервиса есть собственные идентификаторы. Например, OpenAI использует GPTBot и OAI-SearchBot, Anthropic - ClaudeBot, Claude-User и Claude-SearchBot, Google - Google-Extended, а Perplexity - PerplexityBot.
Чтобы закрыть весь сайт от GPTBot, можно добавить такие правила:
```text
User-agent: GPTBot
Disallow: /
```
Если требуется ограничить доступ только к отдельному разделу, указывается нужный каталог:
```text
User-agent: GPTBot
Disallow: /products/
```
Такой вариант удобен, когда компания хочет оставить часть материалов доступной для AI-поиска, но скрыть коммерческие страницы, внутренние документы или контент, предназначенный только для клиентов. Именно поэтому настройка robots.txt для AI-ботов часто становится первым шагом при разработке политики доступа.
Главное преимущество robots.txt - простота. SEO-специалист обычно может изменить файл самостоятельно или быстро передать задачу разработчикам. Крупные и добросовестные компании, включая OpenAI, Anthropic, Google и Perplexity, заявляют о поддержке соответствующих директив.
Однако robots.txt не является механизмом безопасности. Робот может проигнорировать запрет, замаскироваться под другой user-agent или продолжить обращаться к страницам напрямую. Поэтому файл подходит для управления поведением легитимных краулеров, но не гарантирует полноценную защиту сайта от AI-сканеров.
Блокировка на уровне сервера, CDN и WAF
Более надежный вариант - фильтровать входящие запросы до того, как бот получит ответ от сайта. Сервер анализирует IP-адрес, заголовки, user-agent и другие параметры, после чего может разрешить запрос, отклонить его или перенаправить.
CDN выполняет ту же задачу еще раньше. Запрос перехватывается на периферийном узле, поэтому он не доходит до исходного сервера. Это снижает расход пропускной способности и вычислительных ресурсов. Например, некоторые платформы позволяют включать готовые правила для поисковых роботов, AI-агентов и ботов, собирающих данные для обучения моделей.
Наиболее продвинутый уровень - WAF. В отличие от простого анализа заголовка, межсетевой экран оценивает поведение запроса: частоту обращений, последовательность URL, подозрительные шаблоны и несоответствие между заявленным user-agent и реальными признаками клиента. Поэтому WAF блокировка поисковых роботов эффективнее против ботов, которые пытаются выдать себя за обычный браузер или разрешенный поисковик.
Серверная фильтрация дает реальное принудительное ограничение: заблокированный агент не получает страницу. Но у этого подхода есть недостатки. Настройка требует участия разработчиков или системных администраторов, а ошибочное правило может задеть обычных пользователей, поисковые системы или полезные сервисы. Кроме того, поддерживать список идентификаторов необходимо постоянно - AI-платформы меняют инфраструктуру и могут запускать новые типы краулеров.
Что выбрать владельцу сайта
Если задача заключается в том, чтобы корректно сообщить известным компаниям о нежелательности сканирования, достаточно robots.txt. Это удобный и прозрачный способ выборочно закрыть каталоги, архивы или отдельные типы страниц.
Если контент имеет коммерческую ценность, сайт испытывает повышенную нагрузку или компания принципиально не хочет отдавать материалы AI-сервисам, предпочтительнее комбинированная защита. В таком случае robots.txt фиксирует официальную позицию владельца ресурса, а CDN, серверные правила или WAF обеспечивают фактическое ограничение доступа. Подробнее о различиях между этими уровнями можно узнать в материале о том, как заблокировать AI краулеров без опоры только на декларативные инструкции.
Перед внедрением запретов стоит определить, какую пользу AI-трафик приносит бизнесу. Если бренд получает переходы, упоминания и дополнительные заявки из ответов нейросетей, полный запрет может оказаться невыгодным. Иногда разумнее закрыть только страницы с уникальными разработками, платными материалами и персональными данными, оставив открытыми справочные статьи и разделы, формирующие узнаваемость компании.
Важно также разделять краулеров. Бот, собирающий данные для обучения модели, и поисковый агент, который формирует ответы с возможностью перехода на сайт, могут иметь разную ценность для бизнеса. Поэтому универсальное правило "запретить всех AI-ботов" часто оказывается слишком грубым.
После внедрения ограничений необходимо отслеживать журналы сервера, коды ответов и нагрузку на инфраструктуру. Это поможет понять, соблюдаются ли правила, появляются ли новые агенты и не блокируются ли легитимные пользователи. Оптимальная стратегия обычно строится поэтапно: сначала аудит, затем выборочное закрытие через robots.txt и только после этого - жесткая фильтрация наиболее настойчивых или подозрительных запросов.



