Извлечение изображений из PDF
Загрузите PDF-файл и восстановите все встроенные изображения в исходном разрешении. Программа анализирует структуру PDF-документа, находит записи типа /XObject /Image и экспортирует каждое изображение в формат PNG, без создания скриншотов и без потери качества при растровизации всей страницы. Подходит для сканированных документов, отчетов с большим количеством фотографий, каталогов продукции и брошюр.
Как извлечь изображения из PDF-файла
-
1
Загрузите PDF-файл
Загрузите один файл; зашифрованные PDF-файлы необходимо сначала разблокировать.
-
2
Сканируйте дерево объектов
Экстрактор перечисляет все объекты типа XObject на всех страницах.
-
3
Предварительно просмотреть результаты
Каждое изображение представлено в виде миниатюры с указанием номера страницы и размеров.
-
4
Скачайте отдельно или в формате ZIP
Получите отдельный объект или экспортируйте всё в один архив под названием `image-p1-1.png`.
Как изображения представлены внутри PDF-файла
Файл в формате PDF хранит изображения как отдельные ресурсы (стримы /XObject), ссылки на которые содержатся в тексте страницы. Экстрактор считывает каждый стрим в его исходном кодировании и восстанавливает файл, встроенный автором.
Форматы, которые вы увидите
| Фильтр PDF | Что вы получите | Типичный источник |
|---|---|---|
/DCTDecode |
PNG (из JPEG) | Фотографии, снимки товаров, сканированные изображения |
/FlateDecode + RGB |
PNG | Логотипы, диаграммы, скриншоты интерфейса пользователя |
/JPXDecode |
PNG (из JPEG 2000) | Архивные сканирования высокого разрешения |
/CCITTFaxDecode |
PNG (из скана) | Чёрно-белый сканированный текст |
/JBIG2Decode |
PNG (преобразовано) | Сжатые сканированные документы |
Экстрактор всегда выдаёт PNG: он перекодирует исходные пиксели в вашем браузере, поэтому источники JPEG, JPEG 2000 и CCITT тоже приходят в формате PNG.
Что не будет восстановлено
- Векторные иллюстрации. Логотипы, созданные с использованием операторов пути в формате PDF, не являются изображениями, они хранятся в потоке контента, а не представлены в виде объектов типа XObject. Для таких случаев используйте инструмент преобразования PDF в SVG.
- Фоновые цвета и градиенты. Это графические элементы на уровне страницы, а не встроенные ресурсы.
- Текст, отображаемый в виде контуров. По виду он представляет собой графический элемент, однако не является объектом изображения.
Советы при работе с экспортом
- Проверьте размеры. Миниатюра
300x300на странице может представлять собой оригинальное изображение размером 3000x3000 пикселей, уменьшенное при рендеринге; вы получаете исходные пиксели, а не фактический размер отображения. - Уважайте лицензию. Возможность извлечения изображения не предоставляет права на его повторное использование. Фотографии из архива в формате PDF остаются таковыми после извлечения.
- Сканированные документы. Если каждая страница представляет собой одно крупное изображение со встроенным текстом, то данный PDF-файл является результатом сканирования. Для восстановления текста выполните анализ оптической распознавательной технологии (OCR) на экспортированных PNG-файлах.
Часто задаваемые вопросы
На страницах PDF можно применять матрицу преобразований к способу отображения изображения (переворачивание, поворот, искривление). Экстрактор возвращает сохранённый битмап, исходные пиксели. Если издатель сохранил изображение перевёрнутым и перевернул его во время рендеринга, экспорт будет выглядеть перевёрнутым; для коррекции достаточно выполнить поворот в любом редакторе изображений.
Только после того, как вы разблокировали файлы: сначала проанализируйте их с помощью программы для расшифровки PDF, введите пароль владельца и затем извлеките содержимое.
Да. Изображения добавляются в порядке страниц, а каждое имя файла содержит номер страницы, например image-p1-2.png, чтобы вы знали, с какой страницы взято каждое изображение.
Нет. Исходный PDF-файл полностью открывается и читается в вашем браузере и никогда не отправляется на сервер. На сервер загружается только ZIP-архив с извлечёнными изображениями для создания защищённого сеансом результата; он хранится до 7 дней, а затем удаляется.
Сопутствующие инструменты
Сравнить PDF
Сравните извлекаемый текст двух PDF постранично. Изменения подсвечиваются локально в браузере без загрузки файлов.
PDF-формы
Заполняйте существующие поля AcroForm локально, сохраняйте исходные значения и скачивайте интерактивную или явно сведённую статическую копию.
PDF в Google Docs
Извлеките выделяемый текст из PDF в браузере, проверьте его и локально скачайте редактируемый DOCX для самостоятельной загрузки в Google Диск.
Разделить PDF
Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.
Изменить порядок страниц PDF
Переставляйте, пропускайте или повторяйте страницы PDF по точной последовательности через запятую. До 20 MiB и 200 страниц в браузере.
Зачернить PDF
Закройте конфиденциальные области и создайте в браузере новый сведённый PDF. Каждая выходная страница будет изображением JPEG, без исходного текста, ссылок, форм, слоёв и метаданных.
Инструмент доступен на других языках
- Wyodrębnianie obrazów z pliku PDF [PL]
- Bilder aus PDF extrahieren [DE]
- Lấy hình ảnh từ tệp PDF [VI]
- Extraire des images d'un PDF [FR]
- PDF'den Görüntüler Çıkarma [TR]
- Extrair Imagens de PDF [PT]
- استخراج الصور من PDF [AR]
- Extrahera bilder från PDF [SV]
- Afbeeldingen extraheren uit een PDF [NL]
- PDF에서 이미지 추출 [KO]
- Extract Images from PDF [EN]
- 从 PDF 中提取图像 [ZH]
- Extraer imágenes de PDF [ES]
- ดึงภาพจากไฟล์ PDF [TH]
- Ekstrak Gambar dari PDF [ID]
- PDFから画像を抽出 [JA]
- Estrai immagini da PDF [IT]