Whiteseo

Отчёт об индексировании страниц и проверка URL в Search Console

Отчёт об индексировании страниц и проверка URL в Search Console

«Моей страницы нет в Google» — самый частый вопрос в SEO, и ответ почти всегда находится в отчёте Search Console «Индексирование страниц». Этот отчёт делит все известные Google URL сайта на две группы — проиндексированные и непроиндексированные — и группирует вторую по причинам.

Слово «причина» здесь ключевое. «Не проиндексировано» — это не одна проблема; за ней стоят около пятнадцати совершенно разных ситуаций: технический блок, дубль, выбор канонической версии, решение о качестве или просто очередь. У каждой свой способ решения, поэтому правило простое: сначала прочитать причину, потом действовать.

Статья разбирает все статусы по официальным объяснениям Google и показывает, как использовать инструмент проверки URL для диагностики. Общая картина инструмента — в статье что такое Google Search Console и как он работает.

Короткий ответЧтобы страница появилась в Google, нужны три условия: URL должен быть обнаружен, просканирован и проиндексирован. Отчёт показывает, на каком этапе всё остановилось. «Обнаружена — не проиндексирована» — вопрос очереди и краулингового бюджета; «Просканирована — не проиндексирована» — решение о качестве, и кнопкой оно не лечится. Запрос индексирования лишь ставит URL в очередь и ничего не гарантирует.

Сканирование и индексирование — разница

Эти два слова постоянно путают, хотя это разные процессы:

Сканирование (crawling) — Googlebot загружает URL. Это просто получение файла.

Индексирование (indexing) — Google обрабатывает контент, записывает его в индекс и делает кандидатом на показ. Это решение, и Google может его не принять.

Различие лежит в основе всей диагностики: просканированная страница может остаться непроиндексированной, даже если технически всё сделано верно. Google никогда не гарантирует индексирование.

Все URL вашего сайтаURL, обнаруженные Googleисточники: sitemap, внутренние и внешние ссылкиПросканированные URLкраулинговый бюджет, ответ сервера, приоритетПроиндексированные URLкачество, дубли, выбор канонической
Схема 1 — На каждом этапе число URL сокращается. Отчёт показывает, где именно произошла потеря.

Структура отчёта

Отчёт состоит из трёх блоков:

Проиндексированные страницы. URL, находящиеся в индексе Google. Само число не является целью: 500 проиндексированных страниц на сайте из 500 — плохой знак, если половина из них это URL фильтров и пустые категории.

Непроиндексированные страницы. Список, сгруппированный по причинам. Обратите внимание: не каждая строка здесь — проблема. Например, «Alternate page with proper canonical tag» — совершенно нормальное и правильное состояние.

Предупреждения. Проиндексировано, но с проблемой: например, страница проиндексирована несмотря на блокировку в robots.txt.

Понимание этого деления экономит время. Практическое правило: большое число «не проиндексировано» само по себе не плохо — важно, по какой причине и хотели ли вы вообще видеть эти URL в индексе.

Все статусы и их реальный смысл

В таблице ниже — официальные объяснения Google и практический перевод каждого статуса.

Статус Объяснение Google Что это значит на практике
Server error (5xx) "Your server returned a 500-level error when the page was requested." Проблема сервера. Срочно — падает и скорость сканирования
Redirect error Слишком длинная цепочка, петля, слишком длинный URL или битый редирект Сократите цепочку редиректов
URL blocked by robots.txt "This page was blocked by your site's robots.txt file." Google не может войти. Если это не намеренно — уберите правило
URL marked 'noindex' "When Google tried to index the page it encountered a 'noindex' directive" Тег или заголовок запрещает. Если не намеренно — удалите
Soft 404 "It returns a user-friendly 'not found' message but not a 404 HTTP response code" Код противоречит содержимому
Blocked due to unauthorized request (401) "The page was blocked to Googlebot by a request for authorization." Страница за авторизацией
Blocked due to access forbidden (403) "The user agent provided credentials, but was not granted access." Сервер отклоняет Googlebot
Not found (404) "This page returned a 404 error when requested." Страницы нет. Если это старый URL — нужен 301
Page with redirect "This is a non-canonical URL that redirects to another page." Нормально — индексируется целевая страница
Alternate page with proper canonical tag "This page is marked as an alternate of another page... correctly points to the canonical page." Не проблема. Канонизация работает верно
Duplicate without user-selected canonical "This page is a duplicate of another page, although it doesn't indicate a preferred canonical page." Поставьте канонический тег
Duplicate, Google chose different canonical than user "This page is marked as canonical... but Google thinks another URL makes a better canonical." Ваши сигналы противоречивы
Crawled — currently not indexed "The page was crawled by Google but not indexed." Решение о качестве и ценности
Discovered — currently not indexed "The page was found by Google, but not crawled yet." Вопрос очереди и бюджета
Indexed, though blocked by robots.txt "The page was indexed despite being blocked by your website's robots.txt file." Противоречивые сигналы — чтобы сработал noindex, снимите блок в robots.txt
Page indexed without content "This page appears in the Google index, but for some reason Google could not read the content." Проблема рендеринга или клоакинга

Разделить статусы на три семейства проще для работы:

1. Технические блоки (401, 403, 404, 5xx, robots.txt, noindex, ошибки редиректов) — решение в ваших руках и оно однозначно. Большинство связано с ответами сервера: HTTP-коды состояния и SEO и 404, 410, soft 404.

2. Группа дублей и канонизации — Google видит один и тот же контент по нескольким URL и выбирает один. Решение: привести в соответствие канонические теги, внутренние ссылки и редиректы.

3. Группа качества и очереди («Crawled/Discovered — currently not indexed») — две самые сложные. Им посвящён следующий раздел.

Два самых сложных статуса

«Discovered — currently not indexed» — Google знает URL, но ещё не сканировал его. Официально: "The page was found by Google, but not crawled yet." Обычные причины:

  • Сайт новый или число URL быстро выросло — краулингового бюджета не хватает.
  • Сервер отвечает медленно, и Googlebot снизил темп.
  • На URL идёт мало внутренних ссылок или их нет вовсе — Google не считает его приоритетным.
  • URL есть в sitemap, но отсутствует в структуре сайта («сиротская страница»).

Что делать: усилить внутреннюю перелинковку (самый действенный шаг — см. тематический авторитет и контент-кластеры), ускорить ответ сервера, очистить sitemap (без 404 и редиректов), сократить бессмысленные варианты URL (параметры фильтров и сортировок).

«Crawled — currently not indexed» — Google видел страницу и решил не индексировать её. Официально: "The page was crawled by Google but not indexed." Это не техническая ошибка, а оценка ценности. Самые частые причины:

  • Контент тонкий или повторяет другие ваши страницы.
  • Страница ничего не добавляет к тому, что уже в выдаче.
  • Преобладает шаблонный текст (одинаковый текст, меняется одно слово).
  • Страница сгенерирована автоматически (комбинации фильтров, пустые категории).

Что делать: усилить страницу (оригинальные данные, глубина, ответы на реальные вопросы), объединить близкие дубли, а бесполезные страницы закрыть noindex или удалить. О структурировании темы: что такое семантическое SEO.

Важное замечаниеМногократно «отправлять на индексирование» страницу со статусом «Crawled — currently not indexed» бесполезно. Google её уже видел; проблема не в видимости, а в ценности или повторяемости контента. Пока страница не изменится, не изменится и результат.

Инструмент проверки URL

Проверка URL показывает всё, что Google знает об одном конкретном адресе. По описанию Google, инструмент "provides information about Google's indexed version of a specific page, and also allows you to test whether a URL might be indexable".

Здесь два разных набора данных, и их смешение — самая частая ошибка:

Версия в индексе Тест в реальном времени
Что показывает Состояние на момент последнего сканирования Страницу такой, какая она сейчас
Когда использовать «Что известно Google?» «Сработала ли моя правка?»
Формулировка Google "the results shown are from most recently indexed version of a page, not the live version on the web" "fetches and examines the URL in real time"

То есть сразу после правки версия в индексе всё ещё покажет старую проблему — это нормально. Чтобы проверить правку, нужно нажать «Проверить страницу» (live test).

Запрос индексирования. Кнопка ставит URL в приоритетную очередь сканирования. Google прямо пишет: "submitting a request does not guarantee that the page will appear in the Google Index." Есть и дневные лимиты — как на проверки, так и на запросы индексирования. Отправлять сотни URL вручную нецелесообразно; на масштабе правильный инструмент — sitemap.

О сроках Google говорит так: "Indexing typically takes only a day or so, but can take much longer in some cases" — иногда стоит подождать неделю-две. На новых сайтах срок бывает ещё больше.

Инструмент также показывает каноническую версию URL (вашу и выбранную Google — они могут различаться), удобство для мобильных, структурированные данные и то, в каком sitemap найден адрес. Расхождение по канонической версии видно здесь быстрее всего.

Последовательность диагностики

Страницы нет в Google → проверьте URL и прочитайте статусСТАТУСДЕЙСТВИЕБлокировка в robots.txtили ответ 401 / 403Снимите правило или ограничение сервера,затем подтвердите живым тестомЕсть тег noindexмета-тег или X-Robots-TagУдалите тег. Важно: при блоке в robots.txtGoogle не видит тег — сначала снимите блокДубль / каноническаяGoogle выбрал другой URLКанонический тег, внутренние ссылкии sitemap — на один и тот же URLDiscovered — not indexedнайдена, не просканированаДобавьте внутренние ссылки, очистите sitemap,ускорьте ответ сервераCrawled — not indexedувидена, не выбранаУсильте или объедините контент —кнопкой это не решается
Схема 2 — Что говорит статус, то и делайте. Две ячейки в красной рамке — вопрос стратегии, а не техники.

Держитесь этого порядка:

  1. Проверьте URL и прочитайте статус конкретной страницы.
  2. Если это технический блок (robots.txt, noindex, 4xx, 5xx) — снимите его и запустите живой тест.
  3. Если это дубль или каноническая версия — убедитесь, что канонический тег, внутренние ссылки и sitemap указывают на один URL.
  4. Если статус «Discovered» или «Crawled — not indexed» — работайте над структурой и контентом, а не над кнопкой.
  5. После правки запросите индексирование один раз и подождите неделю-две.
  6. Если в отчёте есть кнопка «Проверить исправление» — нажмите её, Google перепроверит всю группу.

Частые ошибки

1. Совмещать noindex с блокировкой в robots.txt. Если страница закрыта в robots.txt, Google не прочитает noindex внутри неё, и URL может остаться в индексе. Правильный порядок: снять блок, дать увидеть noindex, и только затем при необходимости закрывать.

2. Пытаться свести «не проиндексировано» к нулю. В это число входят совершенно нормальные случаи (канонические альтернативы, редиректы). Цель — не ноль, а разумное распределение причин.

3. Многократно запрашивать индексирование одного URL. Очередь это не ускоряет, а дневной лимит расходует.

4. Принимать результат живого теста за статус индекса. Живой тест говорит «может быть проиндексирована», а не «проиндексирована».

5. Не чистить sitemap. Файл с 404, редиректами и noindex-адресами снижает доверие и расходует бюджет сканирования.

6. Ждать результата за день на новом сайте. Google пишет, что индексирование обычно занимает около суток, но может занять значительно больше — на новых доменах недели это норма.

Часто задаваемые вопросы

Что значит «Crawled — currently not indexed»?

Google просканировал страницу и решил её не индексировать. Это не техническая ошибка, а оценка ценности, оригинальности или повторяемости контента. Решение — усилить страницу или объединить её с похожей.

Что значит «Discovered — currently not indexed»?

Google знает URL, но ещё не сканировал его. Обычно дело в краулинговом бюджете, слабой перелинковке или медленном сервере. Самый действенный шаг — добавить внутренние ссылки.

Помогает ли запрос индексирования позициям?

Нет. Кнопка лишь ставит URL в очередь сканирования. Google прямо пишет, что запрос не гарантирует появления страницы в индексе, а на ранжирование он не влияет вовсе.

Страница проиндексирована, но я не нахожу её в поиске. Почему?

Быть в индексе и ранжироваться — разные вещи. Страница может стоять на 50-й позиции по конкурентному запросу. Проверьте реальность по показам и позиции в отчёте «Эффективность».

Сколько времени занимает индексирование?

Формулировка Google: "Indexing typically takes only a day or so, but can take much longer in some cases" — иногда неделя-две. На новых сайтах дольше.

Гарантирует ли отправка sitemap индексирование?

Нет. Sitemap помогает обнаружению, но не меняет решения об индексировании. При этом чистый sitemap (только канонические URL с кодом 200) заметно ускоряет процесс.

«Alternate page with proper canonical tag» — это проблема?

Нет. Статус сообщает, что канонизация работает верно: страница является альтернативой другого URL и корректно на него указывает. Трогать ничего не нужно.

Как убрать страницу из индекса?

Для постоянного удаления поставьте на страницу noindex (и не закрывайте её в robots.txt) либо отдавайте 404/410. Инструмент «Удаления» в Search Console только временно скрывает URL — см. 404, 410 и soft 404.

Продолжение кластераДиагностика и устранение проблем индексирования — основная часть наших услуг технического SEO и SEO-аудита.
Использованные официальные источники
  1. Page Indexing report — официальное описание всех статусов
  2. URL Inspection tool — версия в индексе, живой тест, запрос индексирования
  3. Sitemaps report
  4. Search Console overview
  5. Large site owner's guide to managing crawl budget
SEO-команда Whiteseo
SEO-специалисты · 8+ лет опыта · Проверено и отредактировано

Команда Whiteseo занимается поисковой оптимизацией для локальных и международных брендов с 2016 года. Наши статьи основаны на реальном проектном опыте.

WhatsApp Блог