Когда запрет — не повод расслабиться
Вы настроили robots.txt, закрыли от индексации всё лишнее, кажется — можно выдохнуть. Но потом замечаете: нейросети всё равно цитируют фрагменты ваших страниц. Как такое возможно?
robots.txt — это файл на корне сайта, где вы указываете, что можно и нельзя сканировать разным ботам. По-хорошему, поисковики и боты нейросетей уважают эти правила. Но в реальности — не всегда.
Кому нужен robots.txt и почему не все «слушаются»
Если у вас интернет-магазин, публикации или корпоративный сайт — robots.txt защищает внутренние страницы и фильтры от лишнего трафика и индексации. Для крупных брендов это ещё и элемент управления репутацией: не хотите, чтобы сервисы цитировали служебные страницы или закрытые разделы.
Но у крупных языковых моделей (ChatGPT, Perplexity, Claude) собственные политики. Некоторые из них читают robots.txt и уважают запреты, другие могут использовать кэши или обходить правила.
Не хотите разбираться сами?
Divitio закроет задачу под ключ — Результаты SEO-продвижения: что получает ваш сайт и бизнес. Аудит и план работ — бесплатно.
Обсудить проект →Как правильно настроить robots.txt для нейросетей
Совет: всегда явно прописывайте правила для нейросетевых ботов. Вот базовые строчки для запрета:
User-agent: GPTBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
Проверьте, чтобы Allow или Disallow не дублировались в разных частях файла — это прямое приглашение к ошибкам.
- Есть ли ваш robots.txt по адресу ваш-сайт.ru/robots.txt
- Прописаны ли отдельные правила для GPTBot, PerplexityBot, ClaudeBot
- Нет ли конфликтующих инструкций
- Тестировали ли вы файл через валидаторы
Что сделать завтра утром
Откройте свой robots.txt — и посмотрите, есть ли в нём строчки для нейросетевых ботов. Если нет — добавьте. Проверьте работоспособность через валидатор. Даже если не все уважают ваш запрет, это всё равно базовая защита. А для публичных страниц — наоборот, не забудьте разрешить нужную индексацию.