PDF OCR
Этот сеанс OCR больше недоступен
Выберите отсканированный PDF
Только PDF · 20 MB · 40 страниц
или перетащите сюда один PDF
Этот инструмент пригодится, если PDF содержит изображения отсканированных страниц, а не выделяемый текст. Он отрисовывает страницы и выполняет оптическое распознавание символов (OCR) в браузере, после чего показывает распознанный обычный текст. Его можно проверить, скопировать или сохранить в файле .txt. Исходный PDF остаётся на вашем устройстве. Инструмент не создаёт PDF с возможностью поиска и не сохраняет макет страницы, а в результате OCR могут быть ошибки.
Как извлечь текст из отсканированного PDF
-
1
Выберите язык документа
Укажите основной язык печатного текста. От выбора зависит, какую модель OCR будет использовать браузер.
-
2
Откройте PDF
Выберите PDF размером до 20 МБ и объёмом до 40 страниц. Исходный файл остаётся в браузере и не отправляется на наш сервер.
-
3
Дождитесь распознавания
Браузер отрисует каждую страницу и прочитает её с помощью выбранной модели OCR. Перед началом распознавания может потребоваться загрузить файлы модели.
-
4
Проверьте результат
Сверьте имена, числа и важные фрагменты с исходными страницами. Считайте результат OCR черновиком и обязательно проверяйте по оригиналу.
-
5
Скопируйте или скачайте текст
При копировании результат остаётся в браузере. Локальное скачивание TXT сохраняет обычный текст без загрузки на сервер. Создание защищённой страницы скачивания является отдельным и необязательным действием.
Что создаёт этот инструмент
Результат представляет собой обычный текст с меткой страницы перед текстом, распознанным на каждой странице. Инструмент не выполняет следующие действия:
- не добавляет в PDF скрытый текстовый слой
- не воссоздаёт колонки, таблицы, формы и исходное оформление
- не сохраняет визуальный макет страницы
- не переводит документ
- не проверяет правильность распознанного текста
Если вам нужен PDF, в котором отсканированные страницы сохранены и дополнены текстом для поиска, используйте специальное приложение для создания PDF с возможностью поиска или настольную программу OCR.
Какие документы распознаются лучше
OCR предназначен для печатного текста. Ровный и чёткий скан с хорошим контрастом распознаётся легче, чем размытая фотография, выцветший факс или повреждённая страница. Декоративные шрифты, рукописный текст, математические обозначения, плотно расположенные колонки и сложные таблицы могут привести к ошибкам и нарушению порядка текста.
Инструмент принимает PDF размером до 20 МБ и объёмом до 40 страниц. Распознавание выполняется постранично и может требовать много памяти, особенно для больших страниц или изображений с высоким разрешением. Если браузеру не хватает памяти, разделите PDF на несколько файлов и обработайте их отдельно.
Поддерживаемые языки OCR
Можно выбрать английский, испанский, французский, немецкий, итальянский, португальский, нидерландский, русский, японский, китайский (упрощённый), корейский или арабский язык.
До открытия файла выберите основной язык документа. Страницу с несколькими языками или системами письма иногда приходится обрабатывать несколько раз. Даже в этом случае похожие символы могут быть перепутаны.
Проверка распознанного текста
Перед использованием результата всегда сверяйте его с исходным PDF. Особое внимание уделите следующим данным:
- имена, адреса и идентификационные номера
- даты, суммы, десятичные разделители и знаки минуса
- юридические, медицинские, финансовые инструкции и правила безопасности
- разрывы страниц и порядок чтения в многоколоночных документах
Не считайте результат OCR официальной копией важного документа.
Обработка файлов и скачивание
Исходный PDF читается локально в браузере. Он не включается в адрес страницы и не отправляется на наш сервер. Браузер может загрузить по сети библиотеки для отрисовки PDF и OCR, а также модель выбранного языка.
При копировании распознанный текст остаётся в браузере и записывается в буфер обмена. Скачать TXT локально создаёт производный файл .txt и сохраняет его без загрузки на сервер. Если вы выберете Создать страницу скачивания, инструмент загрузит только этот текстовый файл и создаст защищённую ссылку на результат. Файл может храниться до 7 дней. Если эта необязательная загрузка не удастся, локальное скачивание останется доступно.
Часто задаваемые вопросы
Нет. Пока страницы отрисовываются и распознаются, исходный PDF остаётся в браузере. Браузер может загрузить необходимые библиотеки для отрисовки PDF и OCR, а также модель выбранного языка. Копирование и локальное скачивание TXT не загружают распознанный текст. Производный текстовый файл загружается только при отдельном действии «Создать страницу скачивания».
Нет. Результат представляет собой обычный текст, разбитый по страницам. Инструмент не изменяет исходный PDF, не добавляет скрытый текстовый слой и не сохраняет его макет.
Его нужно сверить с исходными страницами. OCR может перепутать символы, пропустить текст или изменить порядок чтения. Проверьте все данные перед использованием результата в юридических, медицинских, финансовых и других важных задачах.
Инструмент рассчитан на печатный текст. Рукописный текст, формулы и декоративные шрифты могут распознаваться ненадёжно. Символы в таблице иногда распознаются, но структура строк и столбцов в обычном тексте не сохраняется.
Английский, испанский, французский, немецкий, итальянский, португальский, нидерландский, русский, японский, китайский (упрощённый), корейский и арабский. Выберите основной язык до открытия PDF.
PDF может иметь размер до 20 МБ и содержать до 40 страниц. Большие или очень подробные страницы всё равно могут превысить доступный объём памяти браузера, поэтому сложный документ лучше разделить на меньшие файлы.
Локальное скачивание TXT создаёт файл .txt из распознанного текста и сохраняет его без загрузки на сервер. При выборе «Создать страницу скачивания» производный файл загружается по защищённой ссылке на результат и может храниться до 7 дней. Если эта необязательная загрузка завершится ошибкой, локальное скачивание останется доступно.
Сопутствующие инструменты
Редактировать PDF
Добавляйте текст, выделения, прямоугольники и белые блоки в PDF прямо в браузере. Экспортируйте новый PDF без установки программ.
Конвертер HEIC в PDF
Объедините до 20 фото HEIC или HEIF в PDF формата A4 или US Letter. Конвертация и скачивание выполняются в браузере.
Конвертер PowerPoint в PDF
Загрузите презентацию PPT или PPTX размером до 200 МБ и преобразуйте её на наших серверах в статичный PDF.
Объединить PDF и изображения
Объединяйте PDF и изображения JPG или PNG в один PDF, меняйте порядок загруженных файлов и скачивайте документ из браузера.
Конвертер HTML в PDF
Преобразуйте базовый HTML и встроенные стили CSS в растровый PDF формата A4, Letter или Legal прямо в браузере, без загрузки кода и файла.
PDF в Google Docs
Извлеките выделяемый текст из PDF в браузере, проверьте его и локально скачайте редактируемый DOCX для самостоятельной загрузки в Google Диск.
Инструмент доступен на других языках
- OCR para PDF [ES]
- OCR cho PDF [VI]
- التعرّف الضوئي على النصوص في PDF [AR]
- PDF OCR [JA]
- OCR pour PDF [FR]
- OCR para PDF [PT]
- OCR för PDF [SV]
- PDF OCR [KO]
- OCR PDF [ID]
- PDF-OCR [DE]
- OCR voor pdf [NL]
- OCR ไฟล์ PDF [TH]
- OCR plików PDF [PL]
- PDF OCR [TR]
- PDF OCR 文字识别 [ZH]
- PDF OCR [EN]
- OCR per PDF [IT]