pdfminer.six

pdfminer.six извлекает из PDF текст, координаты символов и блоков, сведения о шрифтах и цветах, встроенные изображения, закладки и значения полей AcroForm. Для разовой обработки доступны команды pdf2txt.py и dumppdf.py, а для автоматизации — функции extract_text, extract_pages и модульные классы парсера, интерпретатора и конвертеров.

pdfplumber

pdfplumber помогает извлекать из PDF точный текст, слова с координатами, таблицы, линии, прямоугольники, аннотации и метаданные, а затем проверять результат на изображении страницы. Основные инструменты — объекты PDF и Page, методы extract_text(), extract_words(), extract_table(), обрезка по координатам и визуальная отладка PageImage.

Tabula Java

Tabula Java извлекает таблицы из текстовых PDF в CSV, TSV и JSON: можно обработать весь документ, указанные страницы или точные области, выбрать алгоритм по пробелам либо линиям, задать границы столбцов и автоматизировать серию однотипных файлов из командной строки или Java-кода.

Excalibur

Excalibur помогает извлекать таблицы из текстовых PDF: загрузить документ, указать страницы, автоматически найти табличные области или обвести их вручную, выбрать режим Lattice для таблиц с линиями либо Stream для разметки пробелами, проверить полученные строки и выгрузить результат в CSV, Excel, JSON или HTML. Рабочая область позволяет уточнять границы, добавлять разделители столбцов и сохранять правило, чтобы повторять одинаковую обработку на документах с похожим макетом.

Camelot

Camelot извлекает таблицы из PDF в структуры pandas, помогает выбрать подходящий анализатор для таблиц с линиями и без них, показывает качество распознавания и сохраняет результат в CSV, Excel, JSON, HTML, Markdown или SQLite.

Tungsten VRS Elite

Tungsten VRS Elite автоматически выравнивает и обрезает страницы во время сканирования, убирает тёмные края, отверстия и случайные точки, распознаёт цветные листы, удаляет пустые обороты и передаёт очищенные изображения в PDF, TIFF или офисный документ. Пользователь управляет обработкой через ленту Image Quality, интерактивное окно предварительного просмотра, профили и правила исключений, поэтому один смешанный пакет можно привести к читаемому виду без ручной правки каждой страницы.

Sensible

Sensible извлекает из PDF, изображений, документов Word и таблиц именованные поля, списки, строки таблиц, отметки и даты, показывает найденные фрагменты рядом с результатом и выдаёт структурированные данные в JSON или Excel. Пользователь может описать нужные сведения обычными инструкциями в визуальном редакторе, дополнить их точными правилами SenseML, проверить исходный фрагмент каждого значения и отправить готовую конфигурацию в пакетную обработку или API.