Генератор robots.txt
Задайте краулер, на который вы ориентируетесь, перечислите пути для блокировки и пути для разрешения, добавьте необязательный crawl-delay и укажите ваш sitemap, и генератор соберет корректно отформатированный robots.txt, который можно скопировать и развернуть. Он берет на себя точный формат строк и пунктуацию, так что вам не нужно запоминать синтаксис или написание user-agent.
Как сгенерировать файл
-
1
Задайте user-agent
Введите краулер, к которому применяются правила, или оставьте *, чтобы охватить всех ботов.
-
2
Перечислите пути для блокировки
Добавьте каталоги или пути для блокировки, по одному в строке, например /admin/ или /checkout/.
-
3
Перечислите разрешенные пути
Добавьте пути, которые должны оставаться доступными для сканирования, по одному в строке, чтобы сделать исключения внутри более широкого Disallow.
-
4
Добавьте sitemap и crawl-delay
Объявите URL вашего sitemap и, при необходимости, crawl-delay в секундах.
-
5
Скопируйте и разверните
Скопируйте сгенерированный файл и разместите его по адресу https://yourdomain.com/robots.txt, только в корне, а не в подкаталоге.
Типичные стартовые шаблоны
Разрешить все (большинство сайтов):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
Заблокировать staging / админку:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
Заблокировать ИИ-краулеры обучения, разрешить поисковики:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
User-agent, которые стоит знать
| User-agent | Владелец | Назначение |
|---|---|---|
| Googlebot | Google Search | Индексация веба |
| Googlebot-Image | Поиск по картинкам | |
| Google-Extended | Обучение Bard/Gemini (отказ) | |
| Bingbot | Microsoft | Поиск Bing |
| DuckDuckBot | DuckDuckGo | Поиск DDG |
| GPTBot | OpenAI | ChatGPT / обучение (отказ) |
| ClaudeBot | Anthropic | Обучение Claude (отказ) |
| CCBot | Common Crawl | Корпус, используемый многими LLM |
| AhrefsBot | Ahrefs | SEO-индекс обратных ссылок |
| SemrushBot | Semrush | SEO-исследования |
| MJ12bot | Majestic | SEO-исследования |
ИИ-боты обучения отказываются по соглашению, а не по юридическому требованию; добросовестные операторы соблюдают директивы, менее щепетильные, нет.
Правила сопоставления путей
- Пути относительны корню домена и начинаются с
/. *соответствует любым символам.Disallow: /*.pdf$блокирует все PDF.$привязывает к концу URL.Disallow: /*/trash$блокирует/foo/trash, но не/foo/trashes/....- Побеждает самое длинное совпадение.
Allow: /admin/public/переопределяетDisallow: /admin/для этого подпути. - Пути регистрозависимы.
Что robots.txt не умеет
- Удалить страницу из Google. Используйте мета-тег
noindexна самой странице. - Защитить URL от людей. robots.txt публичен и лишь рекомендации для соблюдающих ботов.
- Ограничить частоту Googlebot.
Crawl-delayигнорируется Google; используйте Search Console. - Заблокировать ботов, игнорирующих robots.txt. Спам-скраперы файл не читают.
Чеклист развертывания
- Разместите по
https://yourdomain.com/robots.txt, только корень. - Отдавайте с
Content-Type: text/plain(большинство серверов делают это автоматически). - Размер: менее 500 КБ. Google усекает большие файлы.
- После развертывания проверьте полученный файл в тестере robots.txt в Google Search Console.
- При удалении Disallow учтите, что деиндексация может занять недели.
Часто задаваемые вопросы
Не строго. Без него краулеры считают «разрешить все». Если есть что блокировать: staging, админку, оформление заказа, внутренний поиск: он вам нужен.
Вы можете попросить их остановиться через блоки user-agent вроде GPTBot, ClaudeBot, CCBot и Google-Extended. Крупные операторы их соблюдают; менее щепетильные скраперы полностью игнорируют.
Краулеры снисходительны: неизвестные директивы игнорируются. Серьезные ошибки (HTTP 404 или 500) трактуются как «разрешить все». Проверяйте файл перед выкладкой.
В корень каждого хоста, который вы хотите покрыть: https://www.example.com/robots.txt и https://example.com/robots.txt: это отдельные файлы для отдельных хостов.
Нет. Введенные пути используются только для сборки файла; они не сохраняются и не логируются.
Сопутствующие инструменты
Справочная таблица ASCII
Полная таблица ASCII от 0 до 127 с десятичным, шестнадцатеричным, восьмеричным и двоичным представлением, а также записью числовых ссылок HTML, включая NUL, LF и DEL.
Справочник символов HTML
Справочник HTML-сущностей с поиском, их именованными и числовыми кодами, а также копированием специальных символов и знаков одним кликом.
Справочник сочетаний клавиш
Ищите документированные сочетания по умолчанию для VS Code, Chrome и Bash с GNU Readline в macOS, Windows и Linux.
Генератор случайных букв
Генерируйте случайные буквы A-Z. Выберите количество, верхний или нижний регистр либо смешанный вариант для игр, заданий и уроков.
Конвертер размера файлов
Преобразуйте значения между байтами, КБ, МБ, ГБ, ТБ и двоичными единицами IEC (KiB, MiB, GiB, TiB), свободно сочетая десятичные и двоичные единицы.
Валидатор электронной почты
Проверьте адрес электронной почты: синтаксис RFC 5322, запрос MX-записей в реальном времени, а также сведения о локальной части, домене и длине. Никаких писем не отправляется.
Инструмент доступен на других языках
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator robots.txt [PL]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Robots.txtジェネレーター [JA]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Gerador de Robots.txt [PT]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]