Создание PDF с поиском
Этот сеанс OCR больше недоступен
Выберите отсканированный PDF
Только PDF · 10 MB
Только PDF, до 10 МБ и 10 страниц
Отсканированный PDF на самом деле лишь стопка изображений в контейнере PDF, поэтому текст нельзя выделить, скопировать или найти. Этот инструмент выполняет оптическое распознавание символов (OCR) для каждой страницы прямо в браузере и добавляет результат как невидимый текстовый слой, выровненный с исходной страницей. Визуальное содержимое страницы остаётся на месте, а Ctrl+F и выделение текста могут использовать распознанные слова. В распознавании возможны ошибки, и этот результат не является тегированным PDF для доступности, поэтому сверяйте важный текст со сканом.
Как выполнить OCR отсканированного PDF
-
1
Загрузите скан
Перетащите отсканированный PDF (договоры, счета, архивные отчёты). Печатный текст распознаётся лучше всего; рукописный не распознаётся.
-
2
Выберите язык
Выберите язык документа (английский, испанский, французский, немецкий, итальянский, португальский или нидерландский), чтобы движок OCR загрузил нужную модель символов.
-
3
Запустите распознавание
Каждая страница рендерится в высоком разрешении в браузере и передаётся движку OCR. Длинные документы могут занять несколько минут.
-
4
Встраивается текстовый слой
Распознанные слова размещаются в невидимом слое, выровненном с исходной страницей, поэтому каждая страница выглядит без изменений.
-
5
Скачайте новый PDF
Получите PDF, который сохраняет исходные сканы и теперь доступен для поиска в любом современном просмотрщике.
Когда OCR работает хорошо (а когда нет)
Качество OCR зависит от скана. Всегда сверяйте важные имена, числа и юридические формулировки с исходной страницей.
| Исходник | Чего ожидать |
|---|---|
| Чистый скан печатного текста | Результат часто бывает хорошим, но важный текст нужно проверить. |
| Фото печатной страницы | Результат зависит от фокуса, освещения и угла страницы. |
| Старая книга или выцветшая машинопись | Внимательно проверьте распознанный текст. |
| Рукописный текст или курсив | Надёжно не поддерживается. |
| Чеки или вывод термопринтера | Внимательно проверьте числа и бледные символы. |
| Текст с сильным просвечиванием оборота | Результат может быть неполным или неточным. |
PDF с поиском и PDF только из изображений
- PDF только из изображений: чистые растровые картинки, без текста. Это то, что сканер выдаёт по умолчанию.
- PDF с поиском: растровые картинки плюс невидимый текстовый слой (то, что выдаёт этот инструмент). Выглядит идентично, Ctrl+F работает.
- PDF/A: архивное подмножество PDF, которое встраивает свои шрифты и запрещает внешние ресурсы, часто требуется судами и архивами. Этот инструмент создаёт обычный PDF с поиском, а не сертифицированный PDF/A; преобразуйте и проверьте результат специальным инструментом PDF/A, если этого требует ваш процесс.
Советы для лучшего результата
- Начните примерно с 300 DPI. Это часто даёт полезный баланс между читаемыми деталями и временем обработки. Более высокое разрешение требует больше времени и памяти.
- Выровняйте наклон до OCR. Большинство сканеров предлагают автоповорот; даже небольшой наклон может ухудшить качество распознавания.
- Один язык за проход. Движок распознаёт один язык за раз, поэтому выберите преобладающий. Для двуязычного документа запустите его по одному разу на каждый язык и оставьте лучший результат.
- Всегда сохраняйте оригинал. OCR вносит небольшие ошибки; невидимый слой нужен для удобства, а не как доказательство.
Часто задаваемые вопросы
Исходное содержимое страницы сохраняется. Распознанный текст добавляется как невидимый слой, выровненный с ним, поэтому внешний вид страницы не должен измениться. Проверьте результат, если важна точная визуальная верность.
Семь языков на латинице: английский, испанский, французский, немецкий, итальянский, португальский и нидерландский. Выберите тот, что соответствует вашему документу. Письменности вроде кириллицы, арабицы и CJK (китайский, японский, корейский) в этом инструменте недоступны.
Ненадёжно. Этот инструмент предназначен для печатного текста. Распознавание рукописного текста требует другой технологии, поэтому рукописные материалы следует отдельно проверить или расшифровать.
Нет. Результат представляет собой обычный PDF с поиском: изображения ваших исходных страниц плюс невидимый текстовый слой OCR. Это не сертифицированный архивный файл PDF/A. Если ваш процесс требует PDF/A, преобразуйте и проверьте результат специальным инструментом PDF/A.
OCR выполняется полностью в браузере, поэтому исходный PDF не отправляется на сервер для распознавания. Обычная локальная загрузка остаётся на вашем устройстве. Только если вы выберете «Создать страницу загрузки», готовый PDF с поиском будет загружен на наш сервер. Исходный PDF останется локально, а загруженный результат хранится до 7 дней.
Сопутствующие инструменты
Конвертер PDF в PNG
Преобразуйте страницы PDF в PNG с четким текстом, поддержкой прозрачности и выбранным DPI. Удобно для документации и миниатюр.
Разделить PDF
Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.
Word в PDF
Конвертируйте документы Word .doc и .docx в PDF с сохранением разметки страниц, изображений, таблиц и заголовков. Безопасная загрузка, автоматическое удаление через 2 часа.
Конвертер JPG в PDF
Объединяйте изображения JPG в один PDF и настраивайте размер страницы, ориентацию и поля для договоров, чеков и портфолио.
Объединить PDF
Объединяйте несколько PDF, меняйте порядок файлов и страниц перетаскиванием и сразу скачивайте готовый документ.
Конвертер PDF в JPG
Преобразуйте страницы PDF в JPG с нужным разрешением и качеством. Скачайте отдельные страницы или все изображения одним ZIP-архивом.