«Закрою раздел /admin/ в robots.txt — и его никто не увидит». Это понятная,
но опасная ошибка владельца сайта. Файл robots.txt не ставит дверь с замком: он
оставляет указание для роботов, которые готовы его соблюдать. Если в разделе
лежат закрытые документы или данные пользователей, одного robots.txt
недостаточно.
Что сообщает robots.txt
Robots Exclusion Protocol — это соглашение между сайтом и автоматическими
клиентами: поисковыми, архивными и другими роботами. Файл размещают по адресу
https://example.com/robots.txt. В нём робот находит группу правил для своего
имени или общее правило *.
Минимальный пример:
User-agent: *
Disallow: /drafts/
Allow: /drafts/public-guide.html
Здесь User-agent: * обращается ко всем роботам, Disallow просит не обходить
адреса с началом /drafts/, а Allow делает исключение для одной публичной
страницы. При пересечении правил обычно важнее более точное совпадение пути.
Это правила обхода: они определяют, какие URL робот должен запрашивать, а не
то, кто вообще может открыть страницу.
Стандарт RFC 9309 прямо предупреждает: протокол не является авторизацией. Кроме того, сам список запрещённых путей виден любому, кто откроет robots.txt. Он может подсказать, где искать служебный раздел.
Обход, индексация и доступ — не одно и то же
Обход — это получение роботом страницы по URL. Индексация — сохранение сведений о ней и возможность показать URL в поиске или другом каталоге. Авторизация — проверка прав перед выдачей содержимого. Robots.txt относится только к первому шагу и действует лишь для роботов, которые его соблюдают.
Поэтому URL может остаться известным: на него уже ссылались с другой страницы, он был обработан раньше или оказался в карте сайта. Google Search Central отдельно объясняет, что запрет обхода не равен надёжному исключению адреса из результатов. Для исключения из поисковой выдачи нужны подходящие механизмы индексации; для действительно закрытого содержания — вход в аккаунт, права доступа и проверка их на сервере. Не рассчитывайте на секретность через непубликацию ссылки.
Как применить это к источнику Dzen Chat
При добавлении сайта в Dzen Chat сначала решите, что именно можно использовать в базе знаний. Если сайт уже выражает желаемые границы в robots.txt, включите соблюдение этих правил для источника. Если правило robots.txt предназначено только для поисковой оптимизации и не соответствует составу вашей базы, задайте границы источника отдельно: добавьте только нужный раздел или исключите лишние URL правилами источника. Это решение об объёме материалов, а не способ открыть закрытые страницы.
Затем откройте «Источники» и проверьте результат обхода. Нужные публичные страницы должны быть обработаны и готовы к использованию; страницы, исключённые правилами, не должны попасть в состав источника. Проверьте по одному URL из каждой группы после обновления правил — так вы увидите не только сохранённую настройку, но и её результат.
Robots.txt полезен, когда нужно вежливо направить добросовестного робота: например, не тратить обход на черновики или технические дубли. Для защиты закрытого раздела сначала настройте авторизацию, а уже потом используйте robots.txt как дополнительный сигнал. О том, как робот находит страницы, читайте в материале «Что делает поисковый робот, когда обходит сайт», о проверке набора URL — в «Как проверить индекс сайта и исключить лишние страницы», а о карте сайта — в статье о sitemap.
Если хотите проверить границы источника и ответы на своих материалах, свяжитесь с командой Dzen Chat.


