- Категория: Программы для работы с PDF
|
TableNet помогает находить таблицы на сканированных страницах, отделять их от остального содержимого, строить маски столбцов и передавать найденные ячейки в OCR, чтобы собрать результат в строки, столбцы и табличный набор данных. Основные инструменты рабочего процесса — предварительная обработка изображения, две ветви сегментации, пороговая обработка масок, поиск геометрии таблицы и столбцов, распознавание текста Tesseract и проверка полученной структуры в DataFrame. |
- Категория: Программы для работы с PDF
|
Table Transformer находит таблицы на страницах PDF и изображениях, определяет строки, столбцы, заголовки и объединённые ячейки, а затем формирует структурированное представление для экспорта в HTML или CSV. Пользователь управляет обработкой через Python-сценарии: выбирает режим обнаружения, распознавания структуры или полного извлечения, подключает координаты слов и сохраняет визуализации границ. |
- Категория: Программы для работы с PDF
|
DocLayout-YOLO находит на странице заголовки, обычный текст, иллюстрации, таблицы, подписи, сноски и формулы, возвращает для каждого элемента координаты прямоугольника, класс и оценку уверенности, а затем позволяет сохранить наглядную разметку поверх исходного изображения. Для практической работы используются готовые веса, команда demo.py или Python-класс YOLOv10, параметры размера входа и порога уверенности, а при необходимости — отдельное подавление пересекающихся рамок по IoU. |
- Категория: Программы для работы с PDF
|
PaddleOCR PP-Structure разбирает PDF и изображения на смысловые области, распознаёт текст, таблицы, формулы, печати и диаграммы, восстанавливает порядок чтения и сохраняет результат в Markdown, JSON, DOCX, HTML или XLSX. Пользователь может обработать одну страницу, многостраничный документ или каталог изображений, включить коррекцию поворота и геометрических искажений, заменить модели для нужного языка и получить координаты блоков, строк, слов и ячеек для дальнейшей автоматизации. |
- Категория: Программы для работы с PDF
|
DeepSeek-OCR извлекает текст из сканов и страниц PDF, восстанавливает структуру документа в Markdown, размечает заголовки, таблицы, формулы и изображения, а также отдельно разбирает диаграммы, геометрические схемы и другие встроенные иллюстрации. Пользователь управляет результатом коротким запросом, выбирает режим разрешения и получает обычный текст, координатную разметку, вырезанные изображения или PDF с подсвеченными блоками. |
- Категория: Программы для работы с PDF
|
Docling превращает PDF, офисные документы, веб-страницы, изображения и другие файлы в структурированный материал: распознаёт текст на сканах, восстанавливает порядок чтения, выделяет заголовки, списки, таблицы, формулы, код и рисунки, а затем сохраняет результат в Markdown, HTML, обычный текст, JSON или формат фрагментов для поисковых и RAG-систем. Работу можно выполнить одной командой, настроить через Python API или вынести в очередь Docling Serve, выбирая OCR-движок, точность разбора таблиц, способ сохранения изображений и ограничения по размеру документа. |
- Категория: Программы для работы с PDF
|
olmOCR преобразует PDF, PNG и JPEG в читаемый Markdown, восстанавливает естественный порядок фрагментов на многоколоночной странице, переносит таблицы и формулы в текстовую разметку, распознаёт рукописные участки и помогает проверить результат рядом с исходной страницей через Dolma Viewer. |
Страница 37 из 650






