Проверка robots.txt
Вставьте свои правила robots.txt и путь URL, который хотите проверить, и инструмент прочитает строки Allow и Disallow, чтобы сообщить, будет ли этот путь заблокирован или разрешён. Удобно, когда страница внезапно исчезает из Google и нужно убедиться, не виновата ли слишком строгая директива Disallow, или когда вы составляете новые правила и хотите проверить путь перед публикацией файла.
Как работает проверка
-
1
Вставьте правила
Скопируйте строки Allow и Disallow из вашего robots.txt в поле или напишите новые для проверки.
-
2
Введите путь для проверки
Укажите путь URL, который хотите проверить, например /private/page. Используйте только путь, а не полный домен.
-
3
Проверьте правило
Инструмент просматривает строки Allow и Disallow и находит правило, соответствующее введённому пути.
-
4
Прочитайте результат
Вы получаете количество найденных правил, проверенный путь и решение: разрешено по умолчанию, заблокировано директивой Disallow или разрешено директивой Allow.
Минимальный корректный robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. Применяется к любому сканеру, не указанному явно в другом блоке.
- Allow: /. По умолчанию разрешено всё.
- Disallow: /admin/. Каталог администратора закрыт для сканирования.
- Sitemap:. Сообщает поисковым системам, где находится XML-карта сайта.
Правила, которым действительно следует Googlebot
Парсер Google является фактическим стандартом интерпретации неоднозначных правил:
- Пути чувствительны к регистру.
/Admin/и/admin/различаются. - Побеждает самое длинное совпадение.
Allow: /admin/public/важнееDisallow: /admin/для URL, начинающегося с/admin/public/. - Подстановочные знаки.
*соответствует любой последовательности символов;$закрепляет совпадение в конце URL. - Комментарии начинаются с
#. - Порядок не важен. Правила оцениваются по специфичности (длине пути), а не по порядку в файле.
Частые ошибки
| Ошибка | Последствия |
|---|---|
Disallow: / сверху, без Allow |
Весь сайт заблокирован |
Disallow: *.pdf |
Многие парсеры игнорируют, используйте Disallow: /*.pdf$ |
| Протокол-относительный или абсолютный URL в Disallow | Игнорируется, пути должны быть относительными |
Несколько строк User-agent перед правилами |
Объединяются; правила применяются ко всем перечисленным UA |
| Пробелы в конце путей | Молча считаются другим путём |
| Размещение robots.txt в подкаталоге | Загружается только файл из корня домена |
robots.txt против noindex
robots.txt указывает сканерам не загружать URL. Страница, которая уже проиндексирована, а затем заблокирована в robots.txt, может оставаться в индексе месяцами, сканер не может загрузить её, чтобы подтвердить удаление. Если нужно убрать её из индекса, используйте метатег noindex или HTTP-заголовок на самой странице и дайте сканеру их увидеть.
Crawl-delay
Crawl-delay: 10 запрашивает 10 секунд между запросами. Google его игнорирует (задавайте частоту сканирования в Search Console). Bing, Yandex и некоторые нишевые сканеры его соблюдают. Используйте его для небольших сайтов под нагрузкой от нишевых ботов.
Чего Disallow НЕ делает
- Не запрещает ссылаться на страницу. Другие сайты по-прежнему могут ссылаться на запрещённый URL, и он появится в результатах поиска в виде одного адреса (без заголовка и описания).
- Не мешает странице открываться. Пользователи всё ещё могут зайти на запрещённый URL.
- Не скрывает URL от всех. robots.txt публичен; перечисляя там секретные пути, вы их раскрываете.
Часто задаваемые вопросы
Потому что Disallow блокирует сканирование, а не индексацию. Если Google уже знает URL (по ссылкам или из карты сайта), он может оставить сам адрес в результатах поиска. Добавьте на страницу тег noindex и дайте Google загрузить её, чтобы подтвердить удаление.
Да. Используйте блок User-agent: BadBot с собственными правилами. Учтите, что недобросовестные боты полностью игнорируют robots.txt; его соблюдают только добросовестные боты.
Нет. robots.txt публичен, указывая его, вы раскрываете расположение. Вместо этого используйте аутентификацию и контроль доступа на уровне сервера.
Да, для путей. Disallow: /Admin/ не блокирует /admin/. Соблюдайте реальный регистр ваших URL.
Да. Перечислите несколько строк Sitemap:, чтобы указать на отдельные XML-карты сайта или на индекс карт сайта.
Сопутствующие инструменты
Инструмент для извлечения внешних ссылок
Вставьте сырой HTML-код, при желании укажите базовый URL и получите чистый список без дубликатов всех внешних ссылок http/https в коде для проверки ссылок и анализа SEO.
Проверка hreflang
Локально проверьте hreflang во вставленном HTML: коды, полные URL, дубликаты, положение и необязательную самоссылку.
Генератор схемы FAQ
Создавайте разметку FAQPage в формате JSON-LD из пар «вопрос-ответ», чтобы страница претендовала на расширенные результаты Google и блок с ответом.
Валидатор XML-карты сайта
Проверьте XML-карту сайта в браузере: ошибки разбора, отсутствующие адреса, повторы URL и распространённые значения полей.
Инструмент проверки заголовков безопасности HTTP
Вставьте HTTP-заголовки ответа и локально проверьте HSTS, CSP, clickjacking, MIME, referrer и политики cross-origin.
Проверка длины мета-описания
Измерьте мета-описание в символах и расчётных пикселях, сравните редакционные ориентиры и макеты для компьютера и телефона.
Инструмент доступен на других языках
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- أداة فحص ملف robots.txt [AR]
- Sprawdzanie robots.txt [PL]
- Pemeriksa Robot.txt [ID]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Robots.txt 검사기 [KO]
- Verificador de Robots.txt [PT]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]