Docling

Docling превращает PDF, офисные документы, веб-страницы, изображения и другие файлы в структурированный материал: распознаёт текст на сканах, восстанавливает порядок чтения, выделяет заголовки, списки, таблицы, формулы, код и рисунки, а затем сохраняет результат в Markdown, HTML, обычный текст, JSON или формат фрагментов для поисковых и RAG-систем. Работу можно выполнить одной командой, настроить через Python API или вынести в очередь Docling Serve, выбирая OCR-движок, точность разбора таблиц, способ сохранения изображений и ограничения по размеру документа.

olmOCR

olmOCR преобразует PDF, PNG и JPEG в читаемый Markdown, восстанавливает естественный порядок фрагментов на многоколоночной странице, переносит таблицы и формулы в текстовую разметку, распознаёт рукописные участки и помогает проверить результат рядом с исходной страницей через Dolma Viewer.

Pix2Text

Pix2Text распознаёт текст, математические формулы, таблицы и структуру страниц на изображениях и в PDF, собирает результат в Markdown с LaTeX-разметкой и позволяет обрабатывать отдельные фрагменты, сложные страницы или выбранные листы документа через командную строку и Python API.

LayoutParser

LayoutParser помогает разбирать страницы PDF и изображений на текстовые блоки, заголовки, списки, таблицы и иллюстрации, связывать найденные области с OCR, фильтровать их по координатам и сохранять результат в JSON, CSV или объектную структуру для дальнейшей обработки.

Donut

Donut извлекает из изображений документов структурированные поля, определяет тип страницы и отвечает на вопросы по её содержимому без отдельного этапа классического OCR. Пользователь подаёт скан или фотографию, выбирает контрольную точку под нужную задачу, задаёт служебный запрос и получает последовательность, которую можно преобразовать в JSON для учётной системы, поиска, проверки чеков или маршрутизации входящих документов.

TrOCR

TrOCR распознаёт печатные строки, рукописные записи и текст на отдельных изображениях: пользователь подготавливает кадр с одной строкой, передаёт его через TrOCRProcessor в модель, запускает генерацию и получает обычный текст, который можно проверить, сохранить или включить в обработку сканов PDF.

EffOCR

EffOCR распознаёт печатный текст на сканах, выделяет строки, слова и отдельные символы, сопоставляет найденные фрагменты с визуальным индексом и возвращает текст вместе с координатами областей. Главные инструменты — готовые модели для инференса, модульная настройка локализатора и распознавателя, обучение на собственных COCO-аннотациях, визуальная проверка рамок и экспорт результатов для дальнейшей обработки.