Извлечение номеров телефонов из текста

Вставьте любой текст, содержащий прозу, подписи или извлечённый HTML-код, и извлеките все содержащиеся в нём номера телефонов. Экстрактор распознаёт форматы (xxx) xxx-xxxx для Северной Америки, форматы с разделением по пробелам для Европы, компактный международный формат +CC..., а также свободные шаблоны, используемые при вводе номеров в электронные письма (555.123.4567, +44 20 7946 0958). Результат выводится в исходном виде, что позволяет затем нормализовать его с использованием библиотеки, такой как libphonenumber.

Как извлечь номера телефонов

  1. 1

    Вставьте источник

    Внесите следующие данные: страницы контактов, подписи электронных писем, результаты экспорта в формате CSV и записи чата.

  2. 2

    Запустите сканирование

    Регулярное выражение проходит по тексту в поисках последовательностей из не менее чем семи цифр, а также узнаваемых разделителей или кодов стран.

  3. 3

    Проверьте совпадения

    Результаты показывают по одному кандидату в строке, дубликаты удаляются автоматически. Просмотрите список на предмет ложных срабатываний (номера заказов, даты) и исправьте исходный текст, если что-то проскочило.

  4. 4

    Копировать или экспортировать

    Скачайте чистый список в виде обычного текста, по одному номеру на строке, и используйте его в системе CRM или программе для набора номеров.

Форматы номеров телефонов, которые распознаёт система

Номера телефонов крайне неупорядочены: в каждой стране соблюдается свой собственный стандарт, к тому же люди часто игнорируют эти правила. Экстрактор ориентируется на типичные структуры, характерные для реального текста.

Поддерживаемые форматы (пример)

Формат Пример Примечания
E.164 +14155552671 Эталонный формат; используйте его для хранения.
Международный с пробелами +44 20 7946 0958 Стационарный номер в Великобритании с группами, разделёнными пробелами.
Североамериканский NANP (415) 555-2671 Код зоны в скобках.
Североамериканский с точками 415.555.2671 Распространён в подписях электронной почты.
Европейский местный 020 7946 0958 Внутренний префикс с нулём в начале.
Мексиканский 10-значный 55 1234 5678 Без кода страны.

На какие ложные срабатывания обращать внимание

  • Номера заказов и отслеживания. 13-значный трек-номер FedEx может выглядеть как телефонный номер, если записан с пробелами. Проверяйте окружающий контекст.
  • Даты. 2024 09 15 может подойти под шаблон из 7 и более цифр в зависимости от режима регулярного выражения. Сначала отфильтруйте даты, если источник насыщен ими.
  • Номера банковских карт. Группы из 16 цифр в формате 4xxx xxxx xxxx xxxx тоже могут совпасть. Замаскируйте данные PCI до извлечения.

Совет: нормализуйте данные перед сохранением

Разные варианты ввода одного и того же реального номера становятся главной причиной проблем с дедупликацией в CRM. Один быстрый прогон через библиотеку, которая знает правила каждой страны (libphonenumber, phonenumbers в Python, laravel-phone в PHP), приведёт всё к формату E.164, единственному формату, который стоит хранить в базе данных.

Часто задаваемые вопросы

Экстрактор возвращает исходный результат сопоставления; для определения страны требуется набор данных с кодами вызовов и правилами длины номеров. Если вас интересует только префикс +CC, он сохраняется в выходном результате буквально.

Экстрактор возвращает только основной номер; внутренний добавочный номер вроде 555-2671 ext. 123 не входит в результат сопоставления. Для строгого хранения по стандарту E.164 перенесите всё после ext, x или # в отдельное поле.

Да, бесплатные номера США (800, 888, 877, 866, 855, 844, 833) соответствуют стандартной структуре NANP. Также работают британские номера типа 0800 и другие аналогичные местные бесплатные номера, они выглядят как обычные стационарные телефоны.

После отправки ответа на экстракцию ни одна копия вашего входного данных не сохраняется; обработка выполняется в памяти прямо внутри запроса.

Сопутствующие инструменты

Счётчик слов

Подсчитайте слова, символы, предложения и абзацы с учётом времени чтения, времени произнесения вслух, плотности ключевых слов и оценки удобочитаемости по Флешу, для эссе, постов, подписей и meta-описаний.

Символы стрелок для копирования

Копируйте популярные Unicode-стрелки одним щелчком: прямые, двойные, диагональные, крючковые, круговые и треугольные для документов, чатов и дизайна.

Символ «меньше или равно»

Копируйте знак ≤ и связанные математические символы сравнения. Включает Unicode, HTML-сущности и разметку LaTeX для электронных таблиц, научных работ и веб-страниц.

Преобразователь текста для людей с дислексией

Переформатируйте вставленный текст в короткие абзацы и строки примерно по 72 символа для более лёгкого чтения. Скопируйте результат в любой документ, письмо или редактор.

Генератор глитч-текста

Создавайте глитч-текст в стиле Zalgo с помощью комбинируемых знаков Unicode. Выберите интенсивность, посмотрите варианты и скопируйте искаженный текст для профиля, мема или хоррор-поста.

Генератор названий городов

Создавайте вымышленные названия городов, посёлков, деревень и столиц для миростроения, карт, игр, историй и тестовых данных с короткими заметками к каждому результату.

Инструмент доступен на других языках