PDF OCR

Выберите отсканированный PDF

Только PDF · 20 MB · 40 страниц

или перетащите сюда один PDF

Этот инструмент пригодится, если PDF содержит изображения отсканированных страниц, а не выделяемый текст. Он отрисовывает страницы и выполняет оптическое распознавание символов (OCR) в браузере, после чего показывает распознанный обычный текст. Его можно проверить, скопировать или сохранить в файле .txt. Исходный PDF остаётся на вашем устройстве. Инструмент не создаёт PDF с возможностью поиска и не сохраняет макет страницы, а в результате OCR могут быть ошибки.

Как извлечь текст из отсканированного PDF

  1. 1

    Выберите язык документа

    Укажите основной язык печатного текста. От выбора зависит, какую модель OCR будет использовать браузер.

  2. 2

    Откройте PDF

    Выберите PDF размером до 20 МБ и объёмом до 40 страниц. Исходный файл остаётся в браузере и не отправляется на наш сервер.

  3. 3

    Дождитесь распознавания

    Браузер отрисует каждую страницу и прочитает её с помощью выбранной модели OCR. Перед началом распознавания может потребоваться загрузить файлы модели.

  4. 4

    Проверьте результат

    Сверьте имена, числа и важные фрагменты с исходными страницами. Считайте результат OCR черновиком и обязательно проверяйте по оригиналу.

  5. 5

    Скопируйте или скачайте текст

    При копировании результат остаётся в браузере. Локальное скачивание TXT сохраняет обычный текст без загрузки на сервер. Создание защищённой страницы скачивания является отдельным и необязательным действием.

Что создаёт этот инструмент

Результат представляет собой обычный текст с меткой страницы перед текстом, распознанным на каждой странице. Инструмент не выполняет следующие действия:

  • не добавляет в PDF скрытый текстовый слой
  • не воссоздаёт колонки, таблицы, формы и исходное оформление
  • не сохраняет визуальный макет страницы
  • не переводит документ
  • не проверяет правильность распознанного текста

Если вам нужен PDF, в котором отсканированные страницы сохранены и дополнены текстом для поиска, используйте специальное приложение для создания PDF с возможностью поиска или настольную программу OCR.

Какие документы распознаются лучше

OCR предназначен для печатного текста. Ровный и чёткий скан с хорошим контрастом распознаётся легче, чем размытая фотография, выцветший факс или повреждённая страница. Декоративные шрифты, рукописный текст, математические обозначения, плотно расположенные колонки и сложные таблицы могут привести к ошибкам и нарушению порядка текста.

Инструмент принимает PDF размером до 20 МБ и объёмом до 40 страниц. Распознавание выполняется постранично и может требовать много памяти, особенно для больших страниц или изображений с высоким разрешением. Если браузеру не хватает памяти, разделите PDF на несколько файлов и обработайте их отдельно.

Поддерживаемые языки OCR

Можно выбрать английский, испанский, французский, немецкий, итальянский, португальский, нидерландский, русский, японский, китайский (упрощённый), корейский или арабский язык.

До открытия файла выберите основной язык документа. Страницу с несколькими языками или системами письма иногда приходится обрабатывать несколько раз. Даже в этом случае похожие символы могут быть перепутаны.

Проверка распознанного текста

Перед использованием результата всегда сверяйте его с исходным PDF. Особое внимание уделите следующим данным:

  • имена, адреса и идентификационные номера
  • даты, суммы, десятичные разделители и знаки минуса
  • юридические, медицинские, финансовые инструкции и правила безопасности
  • разрывы страниц и порядок чтения в многоколоночных документах

Не считайте результат OCR официальной копией важного документа.

Обработка файлов и скачивание

Исходный PDF читается локально в браузере. Он не включается в адрес страницы и не отправляется на наш сервер. Браузер может загрузить по сети библиотеки для отрисовки PDF и OCR, а также модель выбранного языка.

При копировании распознанный текст остаётся в браузере и записывается в буфер обмена. Скачать TXT локально создаёт производный файл .txt и сохраняет его без загрузки на сервер. Если вы выберете Создать страницу скачивания, инструмент загрузит только этот текстовый файл и создаст защищённую ссылку на результат. Файл может храниться до 7 дней. Если эта необязательная загрузка не удастся, локальное скачивание останется доступно.

Часто задаваемые вопросы

Нет. Пока страницы отрисовываются и распознаются, исходный PDF остаётся в браузере. Браузер может загрузить необходимые библиотеки для отрисовки PDF и OCR, а также модель выбранного языка. Копирование и локальное скачивание TXT не загружают распознанный текст. Производный текстовый файл загружается только при отдельном действии «Создать страницу скачивания».

Нет. Результат представляет собой обычный текст, разбитый по страницам. Инструмент не изменяет исходный PDF, не добавляет скрытый текстовый слой и не сохраняет его макет.

Его нужно сверить с исходными страницами. OCR может перепутать символы, пропустить текст или изменить порядок чтения. Проверьте все данные перед использованием результата в юридических, медицинских, финансовых и других важных задачах.

Инструмент рассчитан на печатный текст. Рукописный текст, формулы и декоративные шрифты могут распознаваться ненадёжно. Символы в таблице иногда распознаются, но структура строк и столбцов в обычном тексте не сохраняется.

Английский, испанский, французский, немецкий, итальянский, португальский, нидерландский, русский, японский, китайский (упрощённый), корейский и арабский. Выберите основной язык до открытия PDF.

PDF может иметь размер до 20 МБ и содержать до 40 страниц. Большие или очень подробные страницы всё равно могут превысить доступный объём памяти браузера, поэтому сложный документ лучше разделить на меньшие файлы.

Локальное скачивание TXT создаёт файл .txt из распознанного текста и сохраняет его без загрузки на сервер. При выборе «Создать страницу скачивания» производный файл загружается по защищённой ссылке на результат и может храниться до 7 дней. Если эта необязательная загрузка завершится ошибкой, локальное скачивание останется доступно.

Сопутствующие инструменты

Конвертер PDF в PNG

Преобразуйте страницы PDF в PNG с четким текстом, поддержкой прозрачности и выбранным DPI. Удобно для документации и миниатюр.

Объединить PDF

Объединяйте несколько PDF, меняйте порядок файлов и страниц перетаскиванием и сразу скачивайте готовый документ.

Разделить PDF

Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.

Word в PDF

Конвертируйте документы Word .doc и .docx в PDF с сохранением разметки страниц, изображений, таблиц и заголовков. Безопасная загрузка, автоматическое удаление через 2 часа.

Конвертер PDF в JPG

Преобразуйте страницы PDF в JPG с нужным разрешением и качеством. Скачайте отдельные страницы или все изображения одним ZIP-архивом.

Конвертер JPG в PDF

Объединяйте изображения JPG в один PDF и настраивайте размер страницы, ориентацию и поля для договоров, чеков и портфолио.