Извлечение URL из текста
Вставьте журнал чата, документ в формате Markdown, ветку писем или сырую HTML-информацию и получите чистый список всех ссылок http:// и https://, которые в ней содержатся. Инструмент убирает завершающие знаки препинания, понимает синтаксис ссылок Markdown и HTML и удаляет точные дубликаты, поэтому список можно сразу передавать в сканер или инструмент архивации.
Как извлечь URL-адреса
-
1
Вставьте источник
Введите текст или HTML-код. Кавычки, угловые скобки, синтаксис ссылок Markdown и завершающие знаки препинания обрабатываются автоматически.
-
2
Запустите сканирование
Находятся все ссылки `http://` и `https://`, убираются завершающие знаки препинания и удаляются точные дубликаты.
-
3
Проверьте количество
Вы видите, сколько уникальных URL найдено, и полный список.
-
4
Копировать или экспортировать
Один URL в строке, готовый для `curl -I`, архиватора, сервиса скриншотов или стартовых списков Screaming Frog.
Что считается URL
Обнаружение URL сложнее, чем кажется, поэтому этот инструмент сознательно придерживается одного безопасного правила: он распознаёт только полные ссылки http:// и https://. Всё остальное остаётся в вашем тексте.
Распознаваемые формы
| Форма | Пример |
|---|---|
| Абсолютный HTTPS | https://example.com/path?q=1 |
| Абсолютный HTTP | http://example.com |
| Цель ссылки Markdown | [text](https://example.com) |
| Абсолютный href в HTML | href="https://example.com" |
Правила обрезки
Завершающие знаки препинания убираются, поэтому (https://example.com). превращается в https://example.com. Пробелы, кавычки, угловые скобки, круглые и квадратные скобки, запятые и точки с запятой останавливают совпадение. URL со скобками обрезается на первой открывающей скобке, поэтому заголовок в стиле Википедии захватывается только до открывающей скобки.
Что пропускается
mailto:,tel:,ftp:и любые другие схемы, кромеhttpиhttps.- Ссылки, относительные к протоколу, например
//cdn.example.com/asset.js. - Голые домены и адреса с префиксом
www.без схемы, напримерexample.com/docs/introилиwww.example.com/page. - Только якоря вроде
#sectionи псевдо-URL на JavaScript.
Как обрабатываются дубликаты
Точные дубликаты удаляются: https://example.com учитывается один раз, сколько бы раз он ни встретился, а Example.com и example.com остаются отдельными записями. Список сохраняет порядок первого появления каждого URL.
Советы по постобработке
- Приводите к нижнему регистру для канонической дедупликации. Если
Example.comиexample.comдолжны считаться одним хостом, приведите результат к нижнему регистру и удалите дубликаты повторно. - Убирайте параметры отслеживания с помощью очистителя UTM перед архивированием, иначе вы получите десятки почти одинаковых дубликатов.
- Проверяйте статус. Прогоните список через проверку битых ссылок, чтобы убрать ошибки 404 перед его фиксацией.
Часто задаваемые вопросы
Только если короткая ссылка записана с полной схемой. Сам по себе bit.ly/xyz не захватывается, а https://bit.ly/xyz обрабатывается как обычный URL. Инструмент не следует перенаправлениям; разрешайте их отдельно, если вам нужен конечный адрес.
Да, если href является полным адресом http:// или https://. Значение извлекается чисто, без окружающего тега; относительные href не захватываются.
Они сохраняются как есть. Если нужно убрать utm_* и подобные параметры отслеживания, используйте после извлечения инструмент очистки URL.
Нет. Текст обрабатывается во время запроса, а его содержимое не сохраняется и не логируется.
Сопутствующие инструменты
Счётчик слов
Подсчитайте слова, символы, предложения и абзацы с учётом времени чтения, времени произнесения вслух, плотности ключевых слов и оценки удобочитаемости по Флешу, для эссе, постов, подписей и meta-описаний.
Символы стрелок для копирования
Копируйте популярные Unicode-стрелки одним щелчком: прямые, двойные, диагональные, крючковые, круговые и треугольные для документов, чатов и дизайна.
Символ «меньше или равно»
Копируйте знак ≤ и связанные математические символы сравнения. Включает Unicode, HTML-сущности и разметку LaTeX для электронных таблиц, научных работ и веб-страниц.
Преобразователь текста для людей с дислексией
Переформатируйте вставленный текст в короткие абзацы и строки примерно по 72 символа для более лёгкого чтения. Скопируйте результат в любой документ, письмо или редактор.
Генератор глитч-текста
Создавайте глитч-текст в стиле Zalgo с помощью комбинируемых знаков Unicode. Выберите интенсивность, посмотрите варианты и скопируйте искаженный текст для профиля, мема или хоррор-поста.
Генератор названий городов
Создавайте вымышленные названия городов, посёлков, деревень и столиц для миростроения, карт, игр, историй и тестовых данных с короткими заметками к каждому результату.
Инструмент доступен на других языках
- 从文本中提取 URL [ZH]
- テキストからURL抽出 [JA]
- Metinden URL'leri Çıkarma [TR]
- ดึง URL จากข้อความ [TH]
- Extraire des URL du texte [FR]
- Extract URLs from Text [EN]
- Wydobywanie URL-ów z tekstu [PL]
- URL's extraheren uit tekst [NL]
- Extrair URLs do Texto [PT]
- Trích xuất URL từ văn bản [VI]
- استخراج عناوين URL من النص [AR]
- URLs aus Text extrahieren [DE]
- Ekstrak URL dari Teks [ID]
- 텍스트에서 URL을 추출합니다 [KO]
- Extrahera URL:er från text [SV]
- Extraer URLs del Texto [ES]
- Estrai URL dal testo [IT]