Таблица PDF в CSV

Таблица PDF в CSV

Выберите PDF с текстом

Преобразуйте простые текстовые таблицы из PDF в файлы CSV или TSV, не отправляя документ на сервер. Браузер группирует фрагменты текста по их видимому положению и ищет повторяющиеся столбцы. Проверяйте каждую найденную таблицу: это осторожный приблизительный анализ, а не гарантия идеальных строк и столбцов в сложной вёрстке.

Как извлечь таблицу PDF в CSV

  1. 1

    Выберите PDF с текстом

    Выберите PDF размером до 20 MiB и объёмом до 150 страниц. Скан, состоящий только из изображений, сначала нужно обработать с помощью OCR.

  2. 2

    Запустите поиск таблиц в браузере

    Детектор использует видимые координаты текста с учётом поворота страницы и CropBox и ищет повторяющиеся позиции строк и столбцов.

  3. 3

    Проверьте результат и формат

    Выберите нужные таблицы и проверьте строки. Укажите запятую, точку с запятой или табуляцию, а также маркер UTF-8 и защиту от формул.

  4. 4

    Скачайте выбранные таблицы

    Каждая выбранная таблица локально превращается в отдельный файл CSV или TSV. Таблицы с разных страниц не объединяются.

Что может определить детектор

PDF обычно хранит таблицу не как настоящую сетку ячеек, а как фрагменты текста с координатами. Инструмент группирует фрагменты в видимые строки, объединяет близкие части и сохраняет позиции столбцов, повторяющиеся в нескольких строках. Лучше всего распознаются регулярные текстовые таблицы. Объединённые и многострочные ячейки, а также декоративная вёрстка могут потребовать ручной правки.

Поворот страницы и смещённый CropBox нормализуются. В строках с преобладающим направлением письма справа налево порядок столбцов следует направлению текстового слоя PDF. Несколько регулярных таблиц на странице могут быть найдены отдельно, однако таблица, продолжающаяся на следующей странице, не объединяется автоматически.

Макет PDF Вероятный результат Что проверить
Чистый экспорт с постоянными столбцами Обычно лучший случай Заголовки, десятичные знаки и пустые ячейки
Пропущенное значение в обычной строке Пустая ячейка в предполагаемом столбце Тот ли столбец остался пустым
Объединённая или многострочная ячейка Текст может сместиться или разделиться Сравните предпросмотр с PDF
Несколько обычных таблиц на одной странице Могут определиться как отдельные нумерованные таблицы Один файл для каждой выбранной таблицы
Скан в виде изображения Таблица не найдена Сначала выполните OCR

Помимо ограничений 20 MiB и 150 страниц действуют пределы количества текстовых фрагментов и символов. Сильно раздробленный PDF может остановиться раньше.

CSV, TSV и безопасность таблиц

Для CSV можно выбрать запятую или точку с запятой, для TSV используется табуляция. Записи заканчиваются CRLF. Поле с активным разделителем, двойной кавычкой, возвратом каретки или переводом строки заключается в двойные кавычки, а внутренние кавычки удваиваются. Это общие правила RFC 4180, адаптированные к выбранному разделителю.

Защита от формул включена по умолчанию. Если после пробелов ячейка начинается с =, +, - или @, включая поддерживаемые полноширинные варианты, инструмент добавляет апостроф. Значение меняется, зато табличный редактор с большей вероятностью обработает его как текст. Отключение защиты сохраняет исходный текст, но похожее на формулу содержимое из ненадёжного PDF может быть опасно. OWASP описывает CSV Injection и ограничения мер защиты.

Необязательный маркер UTF-8 помогает некоторым программам распознавать нелатинский текст. Проверяйте файл перед бухгалтерским учётом, отчётами и автоматическим импортом.

Приватное состояние шагов

PDF, найденные таблицы и настройки остаются в этом браузере. Они хранятся в ограниченном локальном хранилище до 30 минут, чтобы сохранить три шага. Файлы создаются локально, инструмент ничего не загружает. Начало заново удаляет текущую задачу, а браузер может очистить данные раньше.

Часто задаваемые вопросы

Нет. Чтение, поиск и создание CSV или TSV выполняются в браузере. Задача хранится до 30 минут в ограниченном локальном хранилище, а скачивание создаётся локально.

Без подготовки нет. Скан из одних изображений не содержит текстового слоя с координатами. Сначала выполните OCR, затем используйте текстовый PDF.

Выберите запятую, точку с запятой или табуляцию. Записи используют CRLF; поля с разделителем, кавычкой или концом строки заключаются в кавычки, а внутренние кавычки удваиваются. Табуляция создаёт .tsv.

Она добавляет апостроф к ячейкам, которые после пробелов начинаются с =, +, - или @. Защита включена по умолчанию и меняет такие значения. Отключайте её только для доверенного PDF, когда важен исходный текст.

Детектор использует координаты текста, а не настоящие ячейки. Переносы, объединения, необычные интервалы и смешанные направления письма могут сместить значения. Сравнивайте предпросмотр с источником.

Несколько регулярных таблиц на странице могут быть найдены и выбраны отдельно. Для каждой создаётся свой файл. Таблица, продолжающаяся на следующей странице, не объединяется.

Сопутствующие инструменты

Конвертер PDF в PNG

Преобразуйте страницы PDF в PNG с четким текстом, поддержкой прозрачности и выбранным DPI. Удобно для документации и миниатюр.

Объединить PDF

Объединяйте несколько PDF, меняйте порядок файлов и страниц перетаскиванием и сразу скачивайте готовый документ.

Разделить PDF

Разделите PDF на один файл на страницу или на свои диапазоны, например 1-3, 4-6, 8. Обработайте в браузере и скачайте ZIP.

Word в PDF

Конвертируйте документы Word .doc и .docx в PDF с сохранением разметки страниц, изображений, таблиц и заголовков. Безопасная загрузка, автоматическое удаление через 2 часа.

Конвертер PDF в JPG

Преобразуйте страницы PDF в JPG с нужным разрешением и качеством. Скачайте отдельные страницы или все изображения одним ZIP-архивом.

Конвертер JPG в PDF

Объединяйте изображения JPG в один PDF и настраивайте размер страницы, ориентацию и поля для договоров, чеков и портфолио.