Инструмент проверки индексируемости

Проверить индексируемость
Далее

Страница может быть полностью корректной, но не отображаться в результатах поиска: это может произойти из-за наличия одного тега «noindex» или из-за блокировки робота с помощью файла robots.txt. Вставьте URL, инструмент проверки проанализирует все параметры, используемые Google (robots.txt, meta robots, заголовок X-Robots-Tag, канонический адрес целевой страницы и статус HTTP) и сообщит, можно ли страницу индексировать, почему это невозможно и какие изменения необходимо внести в случае отсутствия соответствующих настроек.

Как проверить индексируемость

  1. 1

    Введите URL

    Модуль проверки получает URL так же, как это делает Googlebot.

  2. 2

    Он устраняет перенаправления

    Выявляется цепочка из 301 или 302 хопов; в качестве окончательного URL используется тот, который был проанализирован.

  3. 3

    Оно считывает каждый сигнал, указывающий на возможность индексации.

    Правила файла robots.txt, мета-разметка robots, тег X-Robots, каноническая версия сайта, код статуса.

  4. 4

    Решение и обоснование

    Индексируемое / неиндексируемое / частичное; с указанием точного сигнала, вызвавшего данное решение.

Сигналы индексируемости и их приоритетность

Google анализирует набор сигналов в определённом порядке; один отрицательный сигнал в этой цепочке достаточно для блокировки индексации.

Порядок оценки сигналов

  1. Статус HTTP: требуется код 2xx; для кодов 3xx применяются соответствующие правила обработки; коды 4xx и 5xx означают завершение индексации.
  2. robots.txt: если указанный URL запрещён для Googlebot, страница никогда не будет просканирована, а значит, теги noindex на ней не будут отображаться.
  3. Заголовок X-Robots-Tag: значение noindex в заголовках HTTP-ответа препятствует индексированию.
  4. Мета-роботы: <meta name="robots" content="noindex"> блокирует индексирование.
  5. Каноничный: указание на другой URL считается каноническим, что означает, что Google индексирует именно этот URL.
  6. Качество контента и обнаружение дубликатов: Google может пропустить индексацию даже в отсутствие явных указаний.

Распространённые ошибки, которые это выявляет

Проблема Причина
Весь раздел не индексируется Правило Disallow: в файле robots.txt
Конкретная страница не индексируется noindex в мета-роботах
Индексируется с неверным URL Канонический адрес указывает на другое место
Застревает на коде 5xx Ошибка сервера прерывает сканирование
Конфликт Disallow + noindex robots.txt блокирует сканирование, тег noindex никогда не считывается
Утечка тестовой среды в продакшн Остатки X-Robots-Tag: noindex из тестовой среды

Ловушка robots.txt + noindex

Если вы указали URL в файле robots.txt с параметром Disallow:, Google никогда не будет сканировать этот URL, поэтому тег noindex там не будет обнаружен. Однако URL может появляться в результатах поиска как пустой запись, с только самим URL и без описания. Чтобы удалить URL из индекса корректно, разрешите его сканирование и используйте параметр noindex; блокируйте сканирование только после того, как Google исключит его из индекса.

Тестирование с точки зрения Googlebot

Система проверки отправляет пользовательский агент Googlebot, чтобы все серверные хитрости типа «краулеры видят только определённый контент» были обнаружимы. Всегда проверяйте URL из производственной среды, а не из тестовой.

Часто задаваемые вопросы

То, что контент подходит для индексации, означает лишь отсутствие технических препятствий; это не гарантирует его фактическую индексацию. Решение Google также принимается с учётом оценки качества контента, наличия дублированной информации и бюджета на сканирование сайта. Для получения окончательного ответа обратитесь непосредственно в Search Console через функцию проверки URL-адресов.

Как правило, подходящим решением является использование только мета-роботов (или X-Robots-Tag). Файл robots.txt блокирует сканирование сайта, а мета-роботы, индексацию страниц. Для страниц, которые не должны быть индексированы, необходимо разрешить их сканирование, чтобы Google мог прочитать метку noindex.

Google анализирует конечную точку цепочки перенаправлений. Перенаправление типа 301 с сайта A на сайт B означает, что в итоге Google индексирует сайт B, а не сайт A. Для проверки этого процесса все перенаправления сначала обрабатываются перед оценкой результата.

Страницы, требующие аутентификации, по определению не подлежат индексированию. Если вам необходима оптимизация для поисковых систем, рассмотрите использование публичной предварительной версии.

Сопутствующие инструменты

Проверка длины мета-описания

Измерьте мета-описание в символах и расчётных пикселях, сравните редакционные ориентиры и макеты для компьютера и телефона.

Инструмент проверки заголовков безопасности HTTP

Вставьте HTTP-заголовки ответа и локально проверьте HSTS, CSP, clickjacking, MIME, referrer и политики cross-origin.

Канонический генератор тегов

Создайте действительный тег ссылки rel=canonical для любого URL. Включает проверку URL и типичные ошибки, которых следует избегать.

Валидатор XML-карты сайта

Проверьте XML-карту сайта в браузере: ошибки разбора, отсутствующие адреса, повторы URL и распространённые значения полей.

Инструмент для извлечения внешних ссылок

Вставьте сырой HTML-код, при желании укажите базовый URL и получите чистый список без дубликатов всех внешних ссылок http/https в коде для проверки ссылок и анализа SEO.

Симулятор выдачи Google

Посмотрите приблизительный сниппет в стиле Google с лимитами символов для телефона и компьютера. Черновик остаётся в текущем сеансе браузера.

Инструмент доступен на других языках