Whiteseo

Проверка robots.txt

Вычисляет, заблокирован ли конкретный URL для Googlebot, и показывает все группы правил и строки Sitemap.

Введите полный URL вместе с путём — инструмент найдёт robots.txt этого домена и вычислит, заблокирован ли адрес.

Что делает этот инструмент

Он находит и читает файл robots.txt на домене указанного URL и вычисляет, заблокирован ли этот адрес для выбранного робота. Также выводит все объявленные sitemap и все группы правил.

Выбор правила выполняется по логике, задокументированной Google: побеждает самое длинное (самое конкретное) подходящее правило, а при равной длине приоритет у Allow.

Что robots.txt делает и чего не делает

  • Делает: запрещает роботу сканировать страницу — содержимое не загружается.
  • Не делает: не убирает URL из индекса. При наличии внешних ссылок Google может держать заблокированный адрес в индексе без контента.
Самая опасная ошибкаЗакрыть страницу в robots.txt и одновременно поставить в неё noindex. Google не читает заблокированную страницу, поэтому тег noindex он никогда не увидит, и URL может остаться в индексе. Правильный порядок: сначала снять блок, дать увидеть noindex, а после выпадения из индекса при желании закрыть снова.

Когда использовать

  • При запуске нового сайта — поймать Disallow: /, оставшийся с тестового окружения (самая частая катастрофа).
  • Когда страница не индексируется — проверить, не в блокировке ли причина.
  • После обновления CMS — убедиться, что файл не изменился случайно.
  • При управлении краулинговым бюджетом — проверить, что URL фильтров и поиска закрыты корректно.

Часто задаваемые вопросы

Что если robots.txt нет?

Ничего плохого — при отсутствии файла все адреса считаются открытыми для сканирования. Это не ошибка.

Достаточно ли robots.txt, чтобы убрать страницу из индекса?

Нет. Для удаления нужен noindex на странице, которая при этом не заблокирована, либо ответ 404/410. Подробнее: 404, 410 и soft 404.

Важна ли строка Sitemap?

Не обязательна, но полезна — robots.txt читают все роботы первым делом, поэтому указание sitemap там упрощает обнаружение страниц.

Работает ли Crawl-delay?

Googlebot эту директиву игнорирует. Гораздо эффективнее ускорить ответ сервера.

Проверить сам файл sitemap: проверка sitemap.

WhatsApp Блог