Таблица PDF в CSV
Выберите PDF с текстом
Преобразуйте простые текстовые таблицы из PDF в файлы CSV или TSV, не отправляя документ на сервер. Браузер группирует фрагменты текста по их видимому положению и ищет повторяющиеся столбцы. Проверяйте каждую найденную таблицу: это осторожный приблизительный анализ, а не гарантия идеальных строк и столбцов в сложной вёрстке.
Как извлечь таблицу PDF в CSV
-
1
Выберите PDF с текстом
Выберите PDF размером до 20 MiB и объёмом до 150 страниц. Скан, состоящий только из изображений, сначала нужно обработать с помощью OCR.
-
2
Запустите поиск таблиц в браузере
Детектор использует видимые координаты текста с учётом поворота страницы и CropBox и ищет повторяющиеся позиции строк и столбцов.
-
3
Проверьте результат и формат
Выберите нужные таблицы и проверьте строки. Укажите запятую, точку с запятой или табуляцию, а также маркер UTF-8 и защиту от формул.
-
4
Скачайте выбранные таблицы
Каждая выбранная таблица локально превращается в отдельный файл CSV или TSV. Таблицы с разных страниц не объединяются.
Что может определить детектор
PDF обычно хранит таблицу не как настоящую сетку ячеек, а как фрагменты текста с координатами. Инструмент группирует фрагменты в видимые строки, объединяет близкие части и сохраняет позиции столбцов, повторяющиеся в нескольких строках. Лучше всего распознаются регулярные текстовые таблицы. Объединённые и многострочные ячейки, а также декоративная вёрстка могут потребовать ручной правки.
Поворот страницы и смещённый CropBox нормализуются. В строках с преобладающим направлением письма справа налево порядок столбцов следует направлению текстового слоя PDF. Несколько регулярных таблиц на странице могут быть найдены отдельно, однако таблица, продолжающаяся на следующей странице, не объединяется автоматически.
| Макет PDF | Вероятный результат | Что проверить |
|---|---|---|
| Чистый экспорт с постоянными столбцами | Обычно лучший случай | Заголовки, десятичные знаки и пустые ячейки |
| Пропущенное значение в обычной строке | Пустая ячейка в предполагаемом столбце | Тот ли столбец остался пустым |
| Объединённая или многострочная ячейка | Текст может сместиться или разделиться | Сравните предпросмотр с PDF |
| Несколько обычных таблиц на одной странице | Могут определиться как отдельные нумерованные таблицы | Один файл для каждой выбранной таблицы |
| Скан в виде изображения | Таблица не найдена | Сначала выполните OCR |
Помимо ограничений 20 MiB и 150 страниц действуют пределы количества текстовых фрагментов и символов. Сильно раздробленный PDF может остановиться раньше.
CSV, TSV и безопасность таблиц
Для CSV можно выбрать запятую или точку с запятой, для TSV используется табуляция. Записи заканчиваются CRLF. Поле с активным разделителем, двойной кавычкой, возвратом каретки или переводом строки заключается в двойные кавычки, а внутренние кавычки удваиваются. Это общие правила RFC 4180, адаптированные к выбранному разделителю.
Защита от формул включена по умолчанию. Если после пробелов ячейка начинается с =, +, - или @, включая поддерживаемые полноширинные варианты, инструмент добавляет апостроф. Значение меняется, зато табличный редактор с большей вероятностью обработает его как текст. Отключение защиты сохраняет исходный текст, но похожее на формулу содержимое из ненадёжного PDF может быть опасно. OWASP описывает CSV Injection и ограничения мер защиты.
Необязательный маркер UTF-8 помогает некоторым программам распознавать нелатинский текст. Проверяйте файл перед бухгалтерским учётом, отчётами и автоматическим импортом.
Приватное состояние шагов
PDF, найденные таблицы и настройки остаются в этом браузере. Они хранятся в ограниченном локальном хранилище до 30 минут, чтобы сохранить три шага. Файлы создаются локально, инструмент ничего не загружает. Начало заново удаляет текущую задачу, а браузер может очистить данные раньше.
Часто задаваемые вопросы
Нет. Чтение, поиск и создание CSV или TSV выполняются в браузере. Задача хранится до 30 минут в ограниченном локальном хранилище, а скачивание создаётся локально.
Без подготовки нет. Скан из одних изображений не содержит текстового слоя с координатами. Сначала выполните OCR, затем используйте текстовый PDF.
Выберите запятую, точку с запятой или табуляцию. Записи используют CRLF; поля с разделителем, кавычкой или концом строки заключаются в кавычки, а внутренние кавычки удваиваются. Табуляция создаёт .tsv.
Она добавляет апостроф к ячейкам, которые после пробелов начинаются с =, +, - или @. Защита включена по умолчанию и меняет такие значения. Отключайте её только для доверенного PDF, когда важен исходный текст.
Детектор использует координаты текста, а не настоящие ячейки. Переносы, объединения, необычные интервалы и смешанные направления письма могут сместить значения. Сравнивайте предпросмотр с источником.
Несколько регулярных таблиц на странице могут быть найдены и выбраны отдельно. Для каждой создаётся свой файл. Таблица, продолжающаяся на следующей странице, не объединяется.
Сопутствующие инструменты
Конвертер PDF в PNG
Преобразуйте страницы PDF в PNG с четким текстом, поддержкой прозрачности и выбранным DPI. Удобно для документации и миниатюр.
Объединить PDF
Объединяйте несколько PDF, меняйте порядок файлов и страниц перетаскиванием и сразу скачивайте готовый документ.
Разделить PDF
Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.
Word в PDF
Конвертируйте документы Word .doc и .docx в PDF с сохранением разметки страниц, изображений, таблиц и заголовков. Безопасная загрузка, автоматическое удаление через 2 часа.
Конвертер PDF в JPG
Преобразуйте страницы PDF в JPG с нужным разрешением и качеством. Скачайте отдельные страницы или все изображения одним ZIP-архивом.
Конвертер JPG в PDF
Объединяйте изображения JPG в один PDF и настраивайте размер страницы, ориентацию и поля для договоров, чеков и портфолио.