Создание PDF с поиском

Выберите отсканированный PDF

Только PDF · 10 MB

Только PDF, до 10 МБ и 10 страниц

Отсканированный PDF на самом деле лишь стопка изображений в контейнере PDF, поэтому текст нельзя выделить, скопировать или найти. Этот инструмент выполняет оптическое распознавание символов (OCR) для каждой страницы прямо в браузере и добавляет результат как невидимый текстовый слой, выровненный с исходной страницей. Визуальное содержимое страницы остаётся на месте, а Ctrl+F и выделение текста могут использовать распознанные слова. В распознавании возможны ошибки, и этот результат не является тегированным PDF для доступности, поэтому сверяйте важный текст со сканом.

Как выполнить OCR отсканированного PDF

  1. 1

    Загрузите скан

    Перетащите отсканированный PDF (договоры, счета, архивные отчёты). Печатный текст распознаётся лучше всего; рукописный не распознаётся.

  2. 2

    Выберите язык

    Выберите язык документа (английский, испанский, французский, немецкий, итальянский, португальский или нидерландский), чтобы движок OCR загрузил нужную модель символов.

  3. 3

    Запустите распознавание

    Каждая страница рендерится в высоком разрешении в браузере и передаётся движку OCR. Длинные документы могут занять несколько минут.

  4. 4

    Встраивается текстовый слой

    Распознанные слова размещаются в невидимом слое, выровненном с исходной страницей, поэтому каждая страница выглядит без изменений.

  5. 5

    Скачайте новый PDF

    Получите PDF, который сохраняет исходные сканы и теперь доступен для поиска в любом современном просмотрщике.

Когда OCR работает хорошо (а когда нет)

Качество OCR зависит от скана. Всегда сверяйте важные имена, числа и юридические формулировки с исходной страницей.

Исходник Чего ожидать
Чистый скан печатного текста Результат часто бывает хорошим, но важный текст нужно проверить.
Фото печатной страницы Результат зависит от фокуса, освещения и угла страницы.
Старая книга или выцветшая машинопись Внимательно проверьте распознанный текст.
Рукописный текст или курсив Надёжно не поддерживается.
Чеки или вывод термопринтера Внимательно проверьте числа и бледные символы.
Текст с сильным просвечиванием оборота Результат может быть неполным или неточным.

PDF с поиском и PDF только из изображений

  • PDF только из изображений: чистые растровые картинки, без текста. Это то, что сканер выдаёт по умолчанию.
  • PDF с поиском: растровые картинки плюс невидимый текстовый слой (то, что выдаёт этот инструмент). Выглядит идентично, Ctrl+F работает.
  • PDF/A: архивное подмножество PDF, которое встраивает свои шрифты и запрещает внешние ресурсы, часто требуется судами и архивами. Этот инструмент создаёт обычный PDF с поиском, а не сертифицированный PDF/A; преобразуйте и проверьте результат специальным инструментом PDF/A, если этого требует ваш процесс.

Советы для лучшего результата

  • Начните примерно с 300 DPI. Это часто даёт полезный баланс между читаемыми деталями и временем обработки. Более высокое разрешение требует больше времени и памяти.
  • Выровняйте наклон до OCR. Большинство сканеров предлагают автоповорот; даже небольшой наклон может ухудшить качество распознавания.
  • Один язык за проход. Движок распознаёт один язык за раз, поэтому выберите преобладающий. Для двуязычного документа запустите его по одному разу на каждый язык и оставьте лучший результат.
  • Всегда сохраняйте оригинал. OCR вносит небольшие ошибки; невидимый слой нужен для удобства, а не как доказательство.

Часто задаваемые вопросы

Исходное содержимое страницы сохраняется. Распознанный текст добавляется как невидимый слой, выровненный с ним, поэтому внешний вид страницы не должен измениться. Проверьте результат, если важна точная визуальная верность.

Семь языков на латинице: английский, испанский, французский, немецкий, итальянский, португальский и нидерландский. Выберите тот, что соответствует вашему документу. Письменности вроде кириллицы, арабицы и CJK (китайский, японский, корейский) в этом инструменте недоступны.

Ненадёжно. Этот инструмент предназначен для печатного текста. Распознавание рукописного текста требует другой технологии, поэтому рукописные материалы следует отдельно проверить или расшифровать.

Нет. Результат представляет собой обычный PDF с поиском: изображения ваших исходных страниц плюс невидимый текстовый слой OCR. Это не сертифицированный архивный файл PDF/A. Если ваш процесс требует PDF/A, преобразуйте и проверьте результат специальным инструментом PDF/A.

OCR выполняется полностью в браузере, поэтому исходный PDF не отправляется на сервер для распознавания. Обычная локальная загрузка остаётся на вашем устройстве. Только если вы выберете «Создать страницу загрузки», готовый PDF с поиском будет загружен на наш сервер. Исходный PDF останется локально, а загруженный результат хранится до 7 дней.

Сопутствующие инструменты

Конвертер PDF в PNG

Преобразуйте страницы PDF в PNG с четким текстом, поддержкой прозрачности и выбранным DPI. Удобно для документации и миниатюр.

Разделить PDF

Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.

Word в PDF

Конвертируйте документы Word .doc и .docx в PDF с сохранением разметки страниц, изображений, таблиц и заголовков. Безопасная загрузка, автоматическое удаление через 2 часа.

Конвертер JPG в PDF

Объединяйте изображения JPG в один PDF и настраивайте размер страницы, ориентацию и поля для договоров, чеков и портфолио.

Объединить PDF

Объединяйте несколько PDF, меняйте порядок файлов и страниц перетаскиванием и сразу скачивайте готовый документ.

Конвертер PDF в JPG

Преобразуйте страницы PDF в JPG с нужным разрешением и качеством. Скачайте отдельные страницы или все изображения одним ZIP-архивом.