Генератор robots.txt

Задайте краулер, на который вы ориентируетесь, перечислите пути для блокировки и пути для разрешения, добавьте необязательный crawl-delay и укажите ваш sitemap, и генератор соберет корректно отформатированный robots.txt, который можно скопировать и развернуть. Он берет на себя точный формат строк и пунктуацию, так что вам не нужно запоминать синтаксис или написание user-agent.

Как сгенерировать файл

  1. 1

    Задайте user-agent

    Введите краулер, к которому применяются правила, или оставьте *, чтобы охватить всех ботов.

  2. 2

    Перечислите пути для блокировки

    Добавьте каталоги или пути для блокировки, по одному в строке, например /admin/ или /checkout/.

  3. 3

    Перечислите разрешенные пути

    Добавьте пути, которые должны оставаться доступными для сканирования, по одному в строке, чтобы сделать исключения внутри более широкого Disallow.

  4. 4

    Добавьте sitemap и crawl-delay

    Объявите URL вашего sitemap и, при необходимости, crawl-delay в секундах.

  5. 5

    Скопируйте и разверните

    Скопируйте сгенерированный файл и разместите его по адресу https://yourdomain.com/robots.txt, только в корне, а не в подкаталоге.

Типичные стартовые шаблоны

Разрешить все (большинство сайтов):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Заблокировать staging / админку:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Заблокировать ИИ-краулеры обучения, разрешить поисковики:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agent, которые стоит знать

User-agent Владелец Назначение
Googlebot Google Search Индексация веба
Googlebot-Image Google Поиск по картинкам
Google-Extended Google Обучение Bard/Gemini (отказ)
Bingbot Microsoft Поиск Bing
DuckDuckBot DuckDuckGo Поиск DDG
GPTBot OpenAI ChatGPT / обучение (отказ)
ClaudeBot Anthropic Обучение Claude (отказ)
CCBot Common Crawl Корпус, используемый многими LLM
AhrefsBot Ahrefs SEO-индекс обратных ссылок
SemrushBot Semrush SEO-исследования
MJ12bot Majestic SEO-исследования

ИИ-боты обучения отказываются по соглашению, а не по юридическому требованию; добросовестные операторы соблюдают директивы, менее щепетильные, нет.

Правила сопоставления путей

  • Пути относительны корню домена и начинаются с /.
  • * соответствует любым символам. Disallow: /*.pdf$ блокирует все PDF.
  • $ привязывает к концу URL. Disallow: /*/trash$ блокирует /foo/trash, но не /foo/trashes/....
  • Побеждает самое длинное совпадение. Allow: /admin/public/ переопределяет Disallow: /admin/ для этого подпути.
  • Пути регистрозависимы.

Что robots.txt не умеет

  • Удалить страницу из Google. Используйте мета-тег noindex на самой странице.
  • Защитить URL от людей. robots.txt публичен и лишь рекомендации для соблюдающих ботов.
  • Ограничить частоту Googlebot. Crawl-delay игнорируется Google; используйте Search Console.
  • Заблокировать ботов, игнорирующих robots.txt. Спам-скраперы файл не читают.

Чеклист развертывания

  1. Разместите по https://yourdomain.com/robots.txt, только корень.
  2. Отдавайте с Content-Type: text/plain (большинство серверов делают это автоматически).
  3. Размер: менее 500 КБ. Google усекает большие файлы.
  4. После развертывания проверьте полученный файл в тестере robots.txt в Google Search Console.
  5. При удалении Disallow учтите, что деиндексация может занять недели.

Часто задаваемые вопросы

Не строго. Без него краулеры считают «разрешить все». Если есть что блокировать: staging, админку, оформление заказа, внутренний поиск: он вам нужен.

Вы можете попросить их остановиться через блоки user-agent вроде GPTBot, ClaudeBot, CCBot и Google-Extended. Крупные операторы их соблюдают; менее щепетильные скраперы полностью игнорируют.

Краулеры снисходительны: неизвестные директивы игнорируются. Серьезные ошибки (HTTP 404 или 500) трактуются как «разрешить все». Проверяйте файл перед выкладкой.

В корень каждого хоста, который вы хотите покрыть: https://www.example.com/robots.txt и https://example.com/robots.txt: это отдельные файлы для отдельных хостов.

Нет. Введенные пути используются только для сборки файла; они не сохраняются и не логируются.

Сопутствующие инструменты

Справочная таблица ASCII

Полная таблица ASCII от 0 до 127 с десятичным, шестнадцатеричным, восьмеричным и двоичным представлением, а также записью числовых ссылок HTML, включая NUL, LF и DEL.

Справочник символов HTML

Справочник HTML-сущностей с поиском, их именованными и числовыми кодами, а также копированием специальных символов и знаков одним кликом.

Справочник сочетаний клавиш

Ищите документированные сочетания по умолчанию для VS Code, Chrome и Bash с GNU Readline в macOS, Windows и Linux.

Генератор случайных букв

Генерируйте случайные буквы A-Z. Выберите количество, верхний или нижний регистр либо смешанный вариант для игр, заданий и уроков.

Конвертер размера файлов

Преобразуйте значения между байтами, КБ, МБ, ГБ, ТБ и двоичными единицами IEC (KiB, MiB, GiB, TiB), свободно сочетая десятичные и двоичные единицы.

Валидатор электронной почты

Проверьте адрес электронной почты: синтаксис RFC 5322, запрос MX-записей в реальном времени, а также сведения о локальной части, домене и длине. Никаких писем не отправляется.

Инструмент доступен на других языках