Проверка robots.txt

Вставьте свои правила robots.txt и путь URL, который хотите проверить, и инструмент прочитает строки Allow и Disallow, чтобы сообщить, будет ли этот путь заблокирован или разрешён. Удобно, когда страница внезапно исчезает из Google и нужно убедиться, не виновата ли слишком строгая директива Disallow, или когда вы составляете новые правила и хотите проверить путь перед публикацией файла.

Как работает проверка

  1. 1

    Вставьте правила

    Скопируйте строки Allow и Disallow из вашего robots.txt в поле или напишите новые для проверки.

  2. 2

    Введите путь для проверки

    Укажите путь URL, который хотите проверить, например /private/page. Используйте только путь, а не полный домен.

  3. 3

    Проверьте правило

    Инструмент просматривает строки Allow и Disallow и находит правило, соответствующее введённому пути.

  4. 4

    Прочитайте результат

    Вы получаете количество найденных правил, проверенный путь и решение: разрешено по умолчанию, заблокировано директивой Disallow или разрешено директивой Allow.

Минимальный корректный robots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. Применяется к любому сканеру, не указанному явно в другом блоке.
  • Allow: /. По умолчанию разрешено всё.
  • Disallow: /admin/. Каталог администратора закрыт для сканирования.
  • Sitemap:. Сообщает поисковым системам, где находится XML-карта сайта.

Правила, которым действительно следует Googlebot

Парсер Google является фактическим стандартом интерпретации неоднозначных правил:

  • Пути чувствительны к регистру. /Admin/ и /admin/ различаются.
  • Побеждает самое длинное совпадение. Allow: /admin/public/ важнее Disallow: /admin/ для URL, начинающегося с /admin/public/.
  • Подстановочные знаки. * соответствует любой последовательности символов; $ закрепляет совпадение в конце URL.
  • Комментарии начинаются с #.
  • Порядок не важен. Правила оцениваются по специфичности (длине пути), а не по порядку в файле.

Частые ошибки

Ошибка Последствия
Disallow: / сверху, без Allow Весь сайт заблокирован
Disallow: *.pdf Многие парсеры игнорируют, используйте Disallow: /*.pdf$
Протокол-относительный или абсолютный URL в Disallow Игнорируется, пути должны быть относительными
Несколько строк User-agent перед правилами Объединяются; правила применяются ко всем перечисленным UA
Пробелы в конце путей Молча считаются другим путём
Размещение robots.txt в подкаталоге Загружается только файл из корня домена

robots.txt против noindex

robots.txt указывает сканерам не загружать URL. Страница, которая уже проиндексирована, а затем заблокирована в robots.txt, может оставаться в индексе месяцами, сканер не может загрузить её, чтобы подтвердить удаление. Если нужно убрать её из индекса, используйте метатег noindex или HTTP-заголовок на самой странице и дайте сканеру их увидеть.

Crawl-delay

Crawl-delay: 10 запрашивает 10 секунд между запросами. Google его игнорирует (задавайте частоту сканирования в Search Console). Bing, Yandex и некоторые нишевые сканеры его соблюдают. Используйте его для небольших сайтов под нагрузкой от нишевых ботов.

Чего Disallow НЕ делает

  • Не запрещает ссылаться на страницу. Другие сайты по-прежнему могут ссылаться на запрещённый URL, и он появится в результатах поиска в виде одного адреса (без заголовка и описания).
  • Не мешает странице открываться. Пользователи всё ещё могут зайти на запрещённый URL.
  • Не скрывает URL от всех. robots.txt публичен; перечисляя там секретные пути, вы их раскрываете.

Часто задаваемые вопросы

Потому что Disallow блокирует сканирование, а не индексацию. Если Google уже знает URL (по ссылкам или из карты сайта), он может оставить сам адрес в результатах поиска. Добавьте на страницу тег noindex и дайте Google загрузить её, чтобы подтвердить удаление.

Да. Используйте блок User-agent: BadBot с собственными правилами. Учтите, что недобросовестные боты полностью игнорируют robots.txt; его соблюдают только добросовестные боты.

Нет. robots.txt публичен, указывая его, вы раскрываете расположение. Вместо этого используйте аутентификацию и контроль доступа на уровне сервера.

Да, для путей. Disallow: /Admin/ не блокирует /admin/. Соблюдайте реальный регистр ваших URL.

Да. Перечислите несколько строк Sitemap:, чтобы указать на отдельные XML-карты сайта или на индекс карт сайта.

Сопутствующие инструменты

Инструмент для извлечения внешних ссылок

Вставьте сырой HTML-код, при желании укажите базовый URL и получите чистый список без дубликатов всех внешних ссылок http/https в коде для проверки ссылок и анализа SEO.

Проверка hreflang

Локально проверьте hreflang во вставленном HTML: коды, полные URL, дубликаты, положение и необязательную самоссылку.

Генератор схемы FAQ

Создавайте разметку FAQPage в формате JSON-LD из пар «вопрос-ответ», чтобы страница претендовала на расширенные результаты Google и блок с ответом.

Валидатор XML-карты сайта

Проверьте XML-карту сайта в браузере: ошибки разбора, отсутствующие адреса, повторы URL и распространённые значения полей.

Инструмент проверки заголовков безопасности HTTP

Вставьте HTTP-заголовки ответа и локально проверьте HSTS, CSP, clickjacking, MIME, referrer и политики cross-origin.

Проверка длины мета-описания

Измерьте мета-описание в символах и расчётных пикселях, сравните редакционные ориентиры и макеты для компьютера и телефона.

Инструмент доступен на других языках