Извлечение изображений из PDF

Загрузить PDF

Загрузите PDF-файл и восстановите все встроенные изображения в исходном разрешении. Программа анализирует структуру PDF-документа, находит записи типа /XObject /Image и экспортирует каждое изображение в формат PNG, без создания скриншотов и без потери качества при растровизации всей страницы. Подходит для сканированных документов, отчетов с большим количеством фотографий, каталогов продукции и брошюр.

Как извлечь изображения из PDF-файла

  1. 1

    Загрузите PDF-файл

    Загрузите один файл; зашифрованные PDF-файлы необходимо сначала разблокировать.

  2. 2

    Сканируйте дерево объектов

    Экстрактор перечисляет все объекты типа XObject на всех страницах.

  3. 3

    Предварительно просмотреть результаты

    Каждое изображение представлено в виде миниатюры с указанием номера страницы и размеров.

  4. 4

    Скачайте отдельно или в формате ZIP

    Получите отдельный объект или экспортируйте всё в один архив под названием `image-p1-1.png`.

Как изображения представлены внутри PDF-файла

Файл в формате PDF хранит изображения как отдельные ресурсы (стримы /XObject), ссылки на которые содержатся в тексте страницы. Экстрактор считывает каждый стрим в его исходном кодировании и восстанавливает файл, встроенный автором.

Форматы, которые вы увидите

Фильтр PDF Что вы получите Типичный источник
/DCTDecode PNG (из JPEG) Фотографии, снимки товаров, сканированные изображения
/FlateDecode + RGB PNG Логотипы, диаграммы, скриншоты интерфейса пользователя
/JPXDecode PNG (из JPEG 2000) Архивные сканирования высокого разрешения
/CCITTFaxDecode PNG (из скана) Чёрно-белый сканированный текст
/JBIG2Decode PNG (преобразовано) Сжатые сканированные документы

Экстрактор всегда выдаёт PNG: он перекодирует исходные пиксели в вашем браузере, поэтому источники JPEG, JPEG 2000 и CCITT тоже приходят в формате PNG.

Что не будет восстановлено

  • Векторные иллюстрации. Логотипы, созданные с использованием операторов пути в формате PDF, не являются изображениями, они хранятся в потоке контента, а не представлены в виде объектов типа XObject. Для таких случаев используйте инструмент преобразования PDF в SVG.
  • Фоновые цвета и градиенты. Это графические элементы на уровне страницы, а не встроенные ресурсы.
  • Текст, отображаемый в виде контуров. По виду он представляет собой графический элемент, однако не является объектом изображения.

Советы при работе с экспортом

  • Проверьте размеры. Миниатюра 300x300 на странице может представлять собой оригинальное изображение размером 3000x3000 пикселей, уменьшенное при рендеринге; вы получаете исходные пиксели, а не фактический размер отображения.
  • Уважайте лицензию. Возможность извлечения изображения не предоставляет права на его повторное использование. Фотографии из архива в формате PDF остаются таковыми после извлечения.
  • Сканированные документы. Если каждая страница представляет собой одно крупное изображение со встроенным текстом, то данный PDF-файл является результатом сканирования. Для восстановления текста выполните анализ оптической распознавательной технологии (OCR) на экспортированных PNG-файлах.

Часто задаваемые вопросы

На страницах PDF можно применять матрицу преобразований к способу отображения изображения (переворачивание, поворот, искривление). Экстрактор возвращает сохранённый битмап, исходные пиксели. Если издатель сохранил изображение перевёрнутым и перевернул его во время рендеринга, экспорт будет выглядеть перевёрнутым; для коррекции достаточно выполнить поворот в любом редакторе изображений.

Только после того, как вы разблокировали файлы: сначала проанализируйте их с помощью программы для расшифровки PDF, введите пароль владельца и затем извлеките содержимое.

Да. Изображения добавляются в порядке страниц, а каждое имя файла содержит номер страницы, например image-p1-2.png, чтобы вы знали, с какой страницы взято каждое изображение.

Нет. Исходный PDF-файл полностью открывается и читается в вашем браузере и никогда не отправляется на сервер. На сервер загружается только ZIP-архив с извлечёнными изображениями для создания защищённого сеансом результата; он хранится до 7 дней, а затем удаляется.

Сопутствующие инструменты

Сравнить PDF

Сравните извлекаемый текст двух PDF постранично. Изменения подсвечиваются локально в браузере без загрузки файлов.

PDF-формы

Заполняйте существующие поля AcroForm локально, сохраняйте исходные значения и скачивайте интерактивную или явно сведённую статическую копию.

PDF в Google Docs

Извлеките выделяемый текст из PDF в браузере, проверьте его и локально скачайте редактируемый DOCX для самостоятельной загрузки в Google Диск.

Разделить PDF

Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.

Изменить порядок страниц PDF

Переставляйте, пропускайте или повторяйте страницы PDF по точной последовательности через запятую. До 20 MiB и 200 страниц в браузере.

Зачернить PDF

Закройте конфиденциальные области и создайте в браузере новый сведённый PDF. Каждая выходная страница будет изображением JPEG, без исходного текста, ссылок, форм, слоёв и метаданных.

Инструмент доступен на других языках