OCRFeeder — бесплатная программа для Linux, которая анализирует макет сканов и PDF, выделяет текстовые и графические области, передаёт текст внешнему OCR-движку и позволяет исправить результат перед экспортом в ODT, PDF, HTML или обычный текст.
Программа не содержит собственного универсального распознавателя: она организует страницы, находит блоки, вызывает установленный Tesseract, GOCR, Ocrad, CuneiForm или другой совместимый консольный движок, а затем собирает результат в редактируемый документ. Поэтому точность зависит одновременно от качества скана, разметки областей, выбранного языка и возможностей конкретного OCR-бэкенда.
OCRFeeder разработан Жуакимом Рошей как проект магистерской работы и вошёл в инфраструктуру GNOME. Актуальный upstream-выпуск имеет номер 0.8.5; OCRFeeder работает в Linux и других Unix-подобных систем.
Скачать OCRFeeder
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Только Linux и Unix
- Нужен внешний OCR-движок
- Нет экспорта в DOCX
Что представляет собой OCRFeeder
OCRFeeder относится не к простым оболочкам с кнопкой распознать всё, а к системам анализа структуры документа. На вход поступает одна или несколько растровых страниц либо PDF, преобразованный в изображения. Программа ищет прямоугольные области содержимого, пытается определить, где находится текст, а где иллюстрация, и создаёт для каждого фрагмента отдельный объект. Текстовый объект можно отправить выбранному OCR-движку, графический — сохранить в макете без распознавания. Такая модель особенно полезна для журналов, книг, инструкций и фондовых дел, где на одной странице соседствуют колонки, подписи, рисунки и декоративные элементы.
Внутри рабочего процесса OCRFeeder выполняет роль координатора. Само распознавание символов делает внешняя программа, а OCRFeeder отвечает за загрузку страниц, геометрию областей, порядок обработки, редактирование результата, оформление абзацев и экспорт. Благодаря этому пользователь может сравнить несколько движков на одном и том же фрагменте: например, обработать основной набор Tesseract, а сложный заголовок повторно проверить Ocrad или GOCR. Обратная сторона модульности — после установки одной оболочки распознавание может не заработать, пока в системе не появится хотя бы один совместимый движок и языковые данные.
Название иногда воспринимают как обозначение облачного OCR или библиотеки, однако рассматриваемый продукт — графическое приложение GNOME с исполняемыми командами ocrfeeder и ocrfeeder-cli. Оно устанавливается в систему, работает с локальными файлами и не требует отправлять сканы на удалённый сервер. В публичных каталогах встречаются страницы запуска через удалённый рабочий стол, но это сторонние способы доставки, а не официальный режим программы.
Интерфейс и логика рабочего окна
Основное окно разделено на три функциональные зоны. Слева расположена лента миниатюр: каждая добавленная картинка или страница импортированного PDF отображается отдельным элементом, поэтому большой документ можно просматривать по листам и менять текущую страницу без повторной загрузки. В центре находится увеличенное изображение страницы с рамками распознанных областей. Справа появляется редактор выбранного блока: тип содержимого, фрагмент изображения, координаты, размеры, движок, текст и параметры оформления.
Верхняя строка меню содержит операции с файлами, правкой, видом, документом, инструментами и справкой. Под ней находится компактная панель основных действий: добавление изображения, запуск анализа документа, генерация ODT, уменьшение и увеличение масштаба. Набор и расположение значков слегка различаются между старыми сборками и современными пакетами дистрибутивов, но принцип остаётся прежним: сначала создать набор страниц, затем определить области, проверить текст и только после этого сформировать выходной файл.

Три панели дают больше контроля, чем двухоконная схема скан — готовый текст. Когда пользователь щёлкает рамку в центре, правая панель привязывается именно к этой области. Можно увидеть увеличенный клип, уточнить координаты X и Y, ширину и высоту, переключить тип между текстом и изображением, выбрать OCR-движок, повторить распознавание только для блока и отредактировать полученные символы. Такой подход экономит время на сложных страницах: нет необходимости заново распознавать весь лист из-за одной неудачной колонки.
На небольшом экране правая панель кажется тесной, особенно если раскрыты параметры шрифта и интервалов. Версия 0.8.2 увеличила главное окно и сделала область клипа расширяемой, но программа всё равно рассчитана на настольный монитор. Для комфортной разметки полезно развернуть окно, скрыть лишние панели окружения и подобрать масштаб, при котором рамки видны целиком, а текст исходника остаётся читаемым.
Русский интерфейс
Перевод интерфейса поставляется через языковые каталоги дистрибутива. При русской локали меню, подписи свойств и строка состояния отображаются по-русски, что видно в сборках ветки 0.8. При этом названия внешних движков, некоторые сообщения библиотек и редко используемые пункты могут остаться на английском: они поступают из отдельных пакетов или не имеют перевода. На распознавание русского текста язык интерфейса не влияет — для этого нужен русский набор данных выбранного OCR-движка.

Русская локализация помогает понять назначение вкладок Текст, Стиль и Misc, но не отменяет необходимости разобраться в модели областей. Самая частая ошибка новичка — считать голубую рамку готовым результатом. Рамка лишь обозначает объект на странице; текст внутри правой панели появляется после вызова OCR для этой области или после общего распознавания. Перед экспортом нужно последовательно открыть важные блоки и убедиться, что в текстовом поле действительно есть корректное содержимое.
Как OCRFeeder обрабатывает документ
Полный цикл состоит из нескольких независимых этапов. Сначала программа получает страницы из изображений, сканера или PDF. Затем анализатор делит изображение на окна, ищет контрастные области и формирует прямоугольники. Для каждого прямоугольника определяется предполагаемый тип: текст либо графика. Текстовые области передаются внешнему OCR-процессу, его вывод очищается от части переносов и разбирается как обычный текст. После ручной проверки OCRFeeder создаёт итоговый документ, стараясь сохранить положение блоков и базовые свойства абзацев.
- Добавить растровые файлы, импортировать PDF или получить изображение через SANE.
- При необходимости выровнять наклон и очистить фон средствами Unpaper.
- Запустить автоматическое определение областей для текущей страницы или всего набора.
- Удалить ложные рамки, разделить слитые колонки и добавить пропущенные блоки вручную.
- Выбрать язык и OCR-движок, выполнить распознавание, исправить текст и стили.
- Сохранить проект для продолжения либо экспортировать в ODT, PDF, HTML или TXT.
Этапы можно повторять локально. Если Unpaper ухудшил тонкий шрифт, исходную страницу не обязательно удалять: лучше сравнить обработанную копию с оригиналом. Если автоматический анализ объединил две колонки, рамку можно удалить и нарисовать две новые. Если движок ошибся только в одном абзаце, повторное OCR применяется к выделенной области. Такая обратимость — одно из главных отличий OCRFeeder от пакетных конвертеров, которые сразу создают файл и оставляют исправление на сторонний редактор.
Импорт изображений и поддерживаемые форматы
Наиболее предсказуемый вход — растровые страницы BMP, GIF, JPEG, PNG и TIFF. Фактический набор читаемых вариантов зависит от GdkPixbuf и библиотек, собранных в конкретном дистрибутиве, поэтому экзотический формат лучше заранее преобразовать в PNG или TIFF. Для документов с мелким шрифтом предпочтителен TIFF либо PNG без потерь; повторное сохранение JPEG усиливает блоковые артефакты вокруг букв и снижает контраст тонких штрихов.
Разрешение важнее физического размера файла. Для обычной печати разумной отправной точкой служат 300 точек на дюйм. При 150 dpi мелкие засечки и точки над буквами часто сливаются с фоном, а увеличение уже испорченной картинки не возвращает детали. Сканирование на 600 dpi полезно для очень мелкого текста, ветхой бумаги и сложных гарнитур, но увеличивает память и время анализа. OCRFeeder показывает разрешение текущей страницы в строке состояния; если метаданные отсутствуют, нужно оценивать качество визуально и по пробному распознаванию.
Многостраничный TIFF может интерпретироваться не так удобно, как набор отдельных файлов. Надёжнее заранее разложить его на страницы и добавить изображения в нужном порядке. Имена файлов желательно делать последовательными с ведущими нулями: page-001.png, page-002.png и так далее. Это облегчает сортировку в файловом диалоге и снижает риск поменять страницы местами перед экспортом.
Импорт PDF и его ограничения
PDF импортируется не как набор редактируемых объектов, а как страницы, отрисованные в растр. Для этого OCRFeeder использует Ghostscript: каждая страница становится изображением, после чего проходит обычный анализ областей. Такой метод подходит для сканированных PDF и документов без текстового слоя. Если PDF уже содержит корректный выделяемый текст, повторное OCR обычно избыточно: проще извлечь текст или открыть файл в PDF-редакторе, иначе появятся новые ошибки и потеряется часть исходной структуры.
Качество импорта зависит от установленного Ghostscript, разрешения растеризации и сложности страницы. Защищённый паролем файл, повреждённая таблица ссылок или нестандартные шрифты могут привести к пустым страницам либо отказу импорта. Сначала стоит проверить, открывает ли файл обычный просмотрщик, затем выполнить пробу на одной странице. Для очень большого PDF практичнее заранее разделить документ и обрабатывать части: OCRFeeder хранит изображения и области в памяти, поэтому сотни высокодетальных страниц заметно замедляют интерфейс.
Выпуск 0.8.3 исправлял импорт PDF после перехода на Python 3 и обработку путей, содержащих символы, неудобные для Ghostscript. Тем не менее безопасная рабочая привычка — использовать короткий локальный путь без управляющих символов, убедиться в правах на чтение и иметь свободное место во временном каталоге. Если файл лежит на сетевом ресурсе, сначала скопируйте его локально: это исключает разрывы соединения во время растеризации.
Получение страниц со сканера
Для прямого сканирования OCRFeeder обращается к инфраструктуре SANE. Программа не содержит драйверов устройства: сканер должен определяться системой и работать через sane-backends либо пакет производителя. Перед поиском проблемы в OCRFeeder полезно выполнить команду scanimage -L. Если она не видит устройство, графическая оболочка также не сможет получить страницу.
Диалог сканирования передаёт доступные параметры конкретного бэкенда: подача бумаги, режим цвета, разрешение, область и другие опции, которые сообщает драйвер. Набор полей отличается для планшетного сканера и МФУ с автоподатчиком. После захвата страница добавляется в проект как обычное изображение, поэтому её можно очистить, повернуть, разметить и распознать теми же способами, что файл с диска.
В контейнеризованных сборках прямой доступ к SANE может быть ограничен песочницей. Если Flatpak-версия не показывает исправно настроенный сканер, это не обязательно неисправность устройства: проверьте разрешения пакета или установите нативную сборку дистрибутива. Для стабильной оцифровки большой коллекции часто лучше сканировать отдельной программой в каталог, а OCRFeeder использовать только для анализа уже готовых страниц. Так проще повторить неудачный лист и контролировать имена файлов.
Предварительная обработка через Unpaper
Unpaper — отдельная консольная утилита, которую OCRFeeder вызывает из графического диалога. Она предназначена для очистки сканов: может устранять наклон, выравнивать содержимое, приглушать фон, удалять тёмные края и работать с разворотами. В окне обработки показываются исходный и предполагаемый результат, а параметры сгруппированы по типу операции. Сам OCRFeeder не реализует эти фильтры, поэтому при отсутствии пакета unpaper соответствующий инструмент не заработает.

Предобработка полезна, когда серый фон, тень у корешка или перекос мешают сегментации. Однако агрессивная фильтрация способна стереть тонкие знаки препинания, диакритику и элементы светлого шрифта. Не применяйте весь набор опций автоматически ко всем страницам. Возьмите типичный лист, сохраните необработанный вариант, включайте операции по одной и сравнивайте распознанный текст, а не только внешнюю чистоту картинки.
Для книжного разворота особенно важно правильно указать схему листа. Если инструмент считает одну страницу двумя или наоборот, он может обрезать центральную часть и сдвинуть поля. При одиночных сканах отключите операции, рассчитанные на разворот. Тёмную рамку от крышки сканера лучше убрать ещё на этапе захвата, ограничив область сканирования, чем пытаться компенсировать её несколькими фильтрами.
Выравнивание наклона
Небольшой поворот строк резко ухудшает поиск областей: вертикальные границы колонок становятся ступенчатыми, а строки пересекают прямоугольники соседних абзацев. Инструмент deskew оценивает направление строк и создаёт выровненную копию. После операции нужно заново запустить анализ областей, потому что старые координаты относились к прежней геометрии изображения. Если наклон неодинаков по странице из-за изгиба книги, автоматическое вращение исправит только среднее направление; для сложного разворота потребуется отдельная коррекция перспективы во внешнем редакторе.
Автоматическое выделение областей
При запуске распознавания документа OCRFeeder сначала ищет зоны содержимого. Алгоритм делит страницу на окна, оценивает распределение пикселей и пытается отделить текстовые фрагменты от графики. Результат отображается цветными прямоугольниками поверх изображения. Это не окончательная разметка: рамка может захватить две колонки, разделить один абзац на несколько частей, принять линейку таблицы за изображение или пропустить светлый текст.

Качество сегментации регулируют параметры размера окна и обнаружения колонок. Автоматический размер подходит для однородных страниц, где шрифт и межстрочный интервал примерно одинаковы. Пользовательский размер полезен, если алгоритм регулярно дробит строки или объединяет соседние блоки. Меньшее окно чувствительнее к небольшим объектам, но создаёт больше рамок и шума; крупное быстрее и стабильнее на простом тексте, но может потерять подписи и номера страниц.
Опция улучшенного поиска колонок помогает газетной и журнальной верстке. Минимальная ширина колонки задаёт порог, ниже которого вертикальный фрагмент не считается самостоятельной колонкой. Слишком большой порог склеивает узкие столбцы, слишком малый превращает поля и подписи в отдельные колонки. Настройку следует проверять на нескольких характерных страницах, потому что титульный лист и основная полоса одного издания устроены по-разному.
Ручная разметка и редактор области
Ручная рамка создаётся перетаскиванием мыши по центральному изображению. Выделяйте только полезное содержимое, не захватывая соседнюю колонку, номер страницы или иллюстрацию. Для текста желательно оставлять небольшой внутренний запас вокруг крайних символов: слишком тесная рамка отрезает выносные элементы и знаки препинания, а чрезмерный запас добавляет шум и может изменить режим сегментации OCR-движка.

В редакторе отображаются X, Y, ширина и высота. Числовые поля удобны для точной правки, когда мышью трудно совместить границы нескольких блоков. Тип Text означает, что область будет распознана и представлена как текстовый объект; тип Image сохраняет фрагмент графически. Ошибочная классификация особенно заметна при экспорте: фотография, помеченная как текст, превратится в бессмысленный набор символов, а абзац, помеченный как изображение, останется невыделяемой картинкой.
Клип в верхней части правой панели показывает увеличенный фрагмент рамки. Он помогает проверить, не обрезаны ли буквы, не попала ли соседняя строка и действительно ли выбран нужный объект. Ниже выбирается OCR-движок и запускается распознавание конкретной области. На вкладке текста редактируется результат, на вкладке стиля — оформление абзаца, а в дополнительных параметрах выбирается язык, если движок объявляет языковую поддержку.
При сложной странице эффективнее двигаться сверху вниз в порядке чтения: разметить заголовок, первую колонку, вторую колонку, подписи и изображения. После автоматического анализа удалите лишние блоки и исправьте порядок до распознавания. OCRFeeder сохраняет геометрию, но не всегда угадывает логическую последовательность так, как её ожидает текстовый редактор. Особенно внимательно проверяйте врезки и подписи, расположенные между колонками.
Подключение OCR-движков
OCRFeeder умеет автоматически находить несколько свободных консольных движков, среди которых Tesseract, GOCR, Ocrad и CuneiForm. В современных дистрибутивах наиболее практичным выбором обычно становится Tesseract: он поддерживает множество языковых моделей и активно используется другими приложениями. GOCR и Ocrad полезны как дополнительная проверка на простых монохромных фрагментах. Наличие записи в списке ещё не гарантирует нужный язык: языковой пакет устанавливается отдельно.
Конфигурация движка описывает исполняемую команду, аргументы, способ передачи входного изображения и место, откуда OCRFeeder забирает текст. Поэтому теоретически можно добавить почти любой OCR, работающий из командной строки. На практике необходимо понимать синтаксис программы, кодировку результата и временные файлы. Ошибка в шаблоне команды приводит к пустому тексту даже при исправном движке.

Автоматически обнаруженный движок лучше сначала проверить на одной чистой области. Выберите абзац крупного шрифта, укажите правильный язык и нажмите OCR. Если правое текстовое поле остаётся пустым, запустите сам движок из терминала на тестовом изображении. Так можно разделить проблемы: отсутствие языковых данных, неверная конфигурация OCRFeeder, запрет доступа к временному каталогу или ошибка распознавания.
Tesseract и языковые данные
Для русского текста недостаточно установить пакет tesseract: нужна модель языка rus. В Debian и Ubuntu она обычно поставляется пакетом tesseract-ocr-rus, в Arch Linux — соответствующим пакетом данных Tesseract. Проверка tesseract --list-langs показывает доступные коды. Если rus отсутствует, выбор русского языка в OCRFeeder либо не появится, либо вызов завершится без полезного результата.
Смешанный документ можно распознавать по областям разными языками. Русский основной текст обрабатывается моделью rus, английская библиография — eng, а числовая таблица иногда лучше распознаётся тем же движком без сложной языковой смеси. OCRFeeder хранит язык как свойство области, поэтому не обязательно менять глобальную настройку перед каждым фрагментом. В старых конфигурациях поддержка языка зависит от того, правильно ли задан специальный аргумент и сопоставление кодов.
Слишком широкий языковой набор не всегда повышает точность. Когда движок одновременно рассматривает похожие латинские и кириллические символы, возрастает путаница между C и С, B и В, P и Р. Для однородного абзаца выбирайте конкретный язык; комбинированный режим оставляйте для действительно смешанных строк. После распознавания полезно искать визуально похожие символы, потому что орфографическая проверка не всегда замечает слово с буквой из другого алфавита.
GOCR, Ocrad и CuneiForm
GOCR и Ocrad проще по модели и могут дать приемлемый результат на контрастном печатном тексте без сложной верстки. Их стоит рассматривать не как гарантированно более точную замену Tesseract, а как альтернативный алгоритм для отдельных проблемных зон. Один движок лучше читает цифры, другой — крупные заголовки, третий — конкретную гарнитуру. OCRFeeder позволяет переключить движок в свойствах рамки и сравнить результат без изменения исходной страницы.
CuneiForm исторически использовался в Linux-сборках и поддерживался автонастройкой OCRFeeder, однако доступность пакета зависит от дистрибутива. Не следует скачивать случайный исполняемый файл ради появления пункта в списке. Безопаснее использовать репозиторий системы или собрать известный свободный пакет. Если движок отсутствует в современном репозитории, рабочий процесс с Tesseract остаётся полностью допустимым.
Настройки распознавания
Диалог Preferences разделён на общие параметры, инструменты и распознавание. В разделе распознавания задаётся язык по умолчанию, исправление переносов и разрывов строк, размер окна анализа и параметры колонок. Значение по умолчанию наследуется новыми областями, но существующие объекты могут сохранить прежний язык. После изменения глобальной настройки стоит проверить выбранный блок, а не предполагать, что весь проект обновился автоматически.
Исправление переносов полезно для книг, где слово регулярно разбито в конце строки. Алгоритм пытается удалить дефис и соединить части, но не способен безошибочно отличить перенос от смыслового дефиса. Слова вроде научно-технический нельзя склеивать автоматически. Для юридических и научных документов, где точное написание критично, проверяйте все дефисы сравнением с изображением.
Размер окна и ширина колонки влияют на анализ макета, а не на языковую модель OCR. Если символы распознаются неверно внутри правильно выделенного прямоугольника, изменение размера окна не поможет: нужно улучшать изображение, язык, движок или границы области. И наоборот, смена Tesseract на GOCR не исправит две склеенные колонки, потому что ошибка возникла до вызова распознавателя.
Редактирование распознанного текста
После OCR текст появляется в правой панели и доступен для обычной правки. Изменения относятся к выбранной области и сохраняются в проекте. Это подходящее место для исправления одиночных ошибок, восстановления абзацев и удаления мусорных символов. Массовую литературную редактуру удобнее выполнять после экспорта в LibreOffice, но критические ошибки структуры лучше устранить в OCRFeeder, пока рядом виден исходный фрагмент.
Проверяйте не только слова, но и разбиение на строки. OCR-движок может вернуть перенос после каждой визуальной строки, хотя в итоговом документе нужен один абзац. Опция исправления разрывов помогает, однако списки, стихи, адреса и программный код требуют ручного сохранения строк. Перед объединением убедитесь, что формат исходника действительно абзацный.
Числа, даты, артикулы и номера договоров нельзя проверять по словарю. Сверяйте 0 и O, 1 и l, 5 и S, кириллические и латинские аналоги. В таблицах полезно распознавать каждый логический столбец отдельной рамкой: тогда значения не перемешиваются по строке. OCRFeeder не является полноценным редактором таблиц, поэтому сложную сетку обычно проще перенести в электронную таблицу после отдельного распознавания ячеек или колонок.
Проверка орфографии
Встроенная проверка орфографии использует системные словари через Enchant и компоненты GTK. Диалог показывает подозрительное слово, варианты замены и действия для одного либо всех совпадений. Функция ускоряет очистку обычной прозы, но не является доказательством точности: корректно написанное, но неверно распознанное слово может присутствовать в словаре, а фамилия или термин — отсутствовать.

Язык словаря должен соответствовать тексту области. Если русский словарь не установлен, меню проверки может не предложить нужный язык. Добавьте пакет Hunspell или Aspell, который использует ваш дистрибутив и Enchant, затем перезапустите приложение. В многоязычном проекте проверяйте блоки отдельно, иначе список предложений будет бесполезным.
Команды заменить все применяйте только к однозначной OCR-ошибке. Одинаковая последовательность символов может встречаться как ошибка и как допустимое имя. Сначала посмотрите несколько контекстов, а для номеров, формул и старой орфографии вообще отключите массовую замену. Главным эталоном остаётся изображение страницы.
Стили и сохранение макета
OCRFeeder хранит для текстовой области базовые свойства абзаца: шрифт, выравнивание, межстрочный и межбуквенный интервалы, а также положение рамки. Эти параметры помогают приблизить экспортированный ODT или PDF к исходной странице. Программа не анализирует полную типографику с точностью издательской системы: сложные обтекания, декоративные буквицы, криволинейный текст и точные кернинговые пары придётся восстанавливать вручную.
Стиль задаётся для конкретного блока. Заголовок можно выровнять по центру и выбрать более крупный шрифт, основной текст — выровнять по ширине, подпись — оставить отдельной рамкой. При этом название гарнитуры должно существовать на компьютере, где открывают результат. Если шрифта нет, офисный пакет подставит замену, и геометрия страницы изменится. Для переносимого документа лучше использовать распространённые семейства или встроить шрифты на последующем этапе в PDF-редакторе.
Геометрия областей особенно важна при создании PDF с приблизительным сохранением вида. Для ODT абсолютное позиционирование может оказаться неудобным при дальнейшей правке: текстовые рамки ведут себя иначе, чем обычные последовательные абзацы. Если цель — редактируемая статья, не стремитесь копировать каждый миллиметр. Разметьте логические блоки и после экспорта перестройте документ в нормальный поток LibreOffice.
Сохранение проекта
Проект OCRFeeder сохраняет набор страниц, области, распознанный текст и параметры оформления, чтобы работу можно было продолжить позже. Это важнее промежуточного ODT: после экспорта связь между правкой и рамкой исходного изображения теряется. Для большого документа сохраняйтесь после импорта, после разметки и после существенной коррекции.
Не перемещайте исходные изображения, пока проект не завершён. Формат проекта может ссылаться на файлы и временные данные; изменение пути способно сделать страницы недоступными. Удобно создать отдельную папку задания, положить туда сканы и проект, а результаты складывать в подпапку export. Имя проекта должно отражать документ и этап, например book-layout-reviewed, а не безликое untitled.
Проект не заменяет резервное копирование. Для многодневной оцифровки храните последовательные версии и копию каталога на другом носителе. Перед обновлением пакета OCRFeeder или переходом между дистрибутивами экспортируйте критичный текст в ODT или TXT: внутренний проект удобен для продолжения в той же среде, но не предназначен как формат долговременного хранения.
Экспорт в ODT
ODT считается основным выходным форматом OCRFeeder. Он подходит, когда после распознавания требуется продолжить редактуру в LibreOffice Writer или другом совместимом редакторе. Текстовые области становятся объектами документа, графические области сохраняются как изображения, а базовые стили переносятся настолько, насколько позволяет экспортер. Файл следует воспринимать как рабочую заготовку, а не гарантированную копию оригинальной верстки.
После открытия ODT проверьте порядок блоков, страницы, шрифты, переносы и изображения. На журнальной полосе рамки могут перекрываться, а длинный исправленный абзац — выйти за исходные границы. Если нужна свободная редактура, перенесите текст из рамок в обычные абзацы и заново настройте стили. Если важен внешний вид, наоборот, минимизируйте изменение объёма текста и контролируйте каждую страницу.
Ошибка экспорта иногда связана не с OCR, а с именем файла, правами каталога, отсутствием odfpy либо некорректным объектом внутри проекта. Попробуйте простой локальный путь, проверьте свободное место и экспортируйте небольшой проект из одной страницы. Если он работает, удаляйте или пересоздавайте подозрительные области в большом документе по частям.
Экспорт в PDF
PDF-экспортер собирает страницы из распознанных и графических блоков. Это полезно для создания документа, где внешний вид близок к скану, а текст можно использовать в поиске или копировании. Однако OCRFeeder не позиционируется как полноценный PDF-редактор: он не редактирует существующие аннотации, формы, закладки, цифровые подписи и структуру PDF/A. Импортированный файл сначала растеризуется, поэтому исходные интерактивные элементы не сохраняются.
После экспорта откройте PDF в независимом просмотрщике и выполните три теста: выделите несколько строк, найдите редкое слово и скопируйте фрагмент в текстовый редактор. Затем визуально проверьте совпадение текста с изображением. Поиск может работать при невидимых OCR-ошибках, а корректный внешний вид не гарантирует правильный текстовый слой.
Для стандарта длительного хранения PDF/A, сжатия MRC, оптимизации размера и массового добавления закладок потребуются отдельные инструменты. OCRFeeder решает более раннюю задачу — получить проверенный текст и разметку. Готовый PDF можно затем обработать специализированным редактором или утилитами, не повторяя OCR без необходимости.
Экспорт в HTML и обычный текст
HTML удобен для публикации распознанного материала и дальнейшей обработки скриптами. Он способен сохранить базовое разделение блоков и изображения, но сложная печатная верстка редко превращается в адаптивную веб-страницу без ручной переработки. После экспорта удалите абсолютное позиционирование, задайте семантические заголовки, списки и таблицы, проверьте кодировку и альтернативные описания иллюстраций.
TXT — наиболее устойчивый вариант, когда нужен только текст. Он не сохраняет шрифты, рамки и изображения, зато легко индексируется, сравнивается и передаётся в другие системы. Порядок строк зависит от порядка областей, поэтому перед генерацией проверьте последовательность чтения. Для двух колонок неправильный порядок даст чередование фрагментов, которое придётся разбирать вручную.
Ни один из экспортёров не создаёт DOCX напрямую. Для формата Microsoft Word практический маршрут — экспортировать ODT, открыть его в LibreOffice и сохранить копию как DOCX, затем проверить макет. Конвертация не добавляет точности OCR и может изменить плавающие рамки; критичный документ лучше упростить до обычных абзацев перед сменой формата.
Установка OCRFeeder в Debian и Ubuntu
Нативный пакет дистрибутива — предпочтительный способ установки, потому что менеджер пакетов подтягивает Python, GTK, Ghostscript, Unpaper, SANE и библиотеки экспорта согласованных версий. В Debian и совместимых системах базовая команда выглядит так: sudo apt install ocrfeeder. Для русского распознавания дополнительно установите Tesseract и языковую модель: sudo apt install tesseract-ocr tesseract-ocr-rus. Точные имена дополнительных словарей проверки орфографии зависят от выпуска системы.
В актуальном пуле Debian присутствует пакет 0.8.5-3 с архитектурой all. Обозначение all означает, что код Python не привязан к x86 или x64, но зависимости всё равно устанавливаются под архитектуру вашей системы. Не распаковывайте DEB вручную в произвольный каталог: используйте APT или sudo apt install ./имя-пакета.deb, чтобы менеджер разрешил зависимости и зарегистрировал файлы.
После установки запустите ocrfeeder из терминала хотя бы один раз. Если графическое окно не открывается, терминал покажет отсутствующий модуль или ошибку GTK. Затем проверьте tesseract --list-langs, наличие rus и scanimage -L, если нужен сканер. Такая последовательность быстрее, чем переустановка оболочки без диагностики.
Установка в Arch Linux и других дистрибутивах
В Arch Linux OCRFeeder находится в официальном репозитории Extra как независимый от архитектуры пакет. Страница пакета 0.8.5-10 перечисляет обязательные зависимости, включая Ghostscript, GTK3, Python, Pillow, ReportLab, python-sane и Unpaper, а Tesseract, GOCR и Ocrad отмечены как движки распознавания. Установка через pacman сохраняет подпись пакета и позволяет получать исправления упаковки вместе с системой.
В Fedora, openSUSE и производных название пакета обычно совпадает, но наличие и версия зависят от выпуска. Ищите OCRFeeder в штатном менеджере программ и проверяйте, что поставщик — репозиторий дистрибутива. Если пакет удалён из конкретного стабильного выпуска, не смешивайте библиотеки от разных веток системы: Python и GTK чувствительны к несовместимым зависимостям.
Flatpak-сборка удобна изоляцией, но она предоставляется сообществом и не считается подтверждённой разработчиком. Версия в контейнере может отставать от upstream, а прямое сканирование — упираться в разрешения песочницы. Для обработки готовых изображений Flatpak допустим, но для SANE, системных словарей и ручного подключения движков нативный пакет обычно предсказуемее.
Установка из исходного пакета
Официальный исходный пакет 0.8.5 распространяется в формате tar.xz и предназначен прежде всего для сборки и упаковки. Контрольная сумма SHA-256 позволяет проверить целостность загрузки. Исходная установка требует Python, GTK3, GObject Introspection, Pillow, odfpy, ReportLab, SANE-привязок, Enchant, Ghostscript, Unpaper и инструментов сборки. Наличие пакета не означает, что достаточно распаковать его и дважды щёлкнуть файл.
Сборка из исходников оправдана, если пакет дистрибутива отсутствует, нужно проверить патч или создать собственный пакет. Устанавливать напрямую в системный префикс без учёта менеджера пакетов рискованно: позже будет трудно удалить файлы и понять, какая версия запускается. Лучше использовать изолированную среду сборки и сформировать DEB, RPM или другой нативный пакет.
Перед сборкой прочитайте README и конфигурационные проверки конкретного исходного выпуска. Инструкции из старых обзоров могут ссылаться на Python 2 и PyGTK, тогда как ветка 0.8.2 перешла на Python 3. Копирование старых команд приводит к конфликтам модулей и ошибкам импорта. Для обычного пользователя готовый пакет Debian или Arch безопаснее и быстрее.
Первый запуск и базовая настройка
На первом запуске OCRFeeder проверяет доступные OCR-движки и формирует конфигурацию. Откройте список движков и убедитесь, что Tesseract найден. Затем задайте язык по умолчанию, включите или отключите исправление переносов в соответствии с типом документа и оставьте автоматический размер окна. Не начинайте с десятка тонких настроек: сначала обработайте одну чистую страницу и зафиксируйте исходный результат.
Создайте тестовый каталог без пробелов и необычных символов, положите туда PNG или TIFF, добавьте файл, запустите автоматическое распознавание и откройте несколько рамок. Если текст корректен, сохраните пробный ODT и PDF. Такой короткий сквозной тест одновременно проверяет импорт, движок, язык, экспорт и права записи.
После успешного теста подберите параметры для реального материала. Возьмите страницу с обычным текстом, страницу с иллюстрацией и самую сложную страницу с колонками. Настройка, работающая только на лёгком листе, не подходит для всего проекта. Зафиксируйте решение: разрешение сканирования, цветовой режим, фильтры Unpaper, язык и правила ручной разметки. Последовательность важнее случайного перебора.
Практический процесс: сканированный договор
Договор обычно состоит из одноколоночного текста, реквизитов, таблиц и подписей. Сканируйте в оттенках серого или цвете при 300 dpi, если печать контрастная. Импортируйте страницы, выровняйте только заметный наклон и запустите анализ. Для основного текста оставьте крупные прямоугольники по абзацам, а номера, даты и реквизиты выделите отдельно: так их легче проверить посимвольно.
Подпись и печать помечайте как изображения, если их нужно сохранить визуально. Не пытайтесь распознавать рукописную подпись обычным Tesseract: OCRFeeder ориентирован на печатный текст, а не на идентификацию рукописи. Таблицу реквизитов удобнее разбить на логические строки или столбцы; сложную сетку после экспорта восстановите в офисном редакторе.
Перед сохранением результата сравните все суммы, даты, номера пунктов и фамилии. Обычная орфографическая проверка здесь почти бесполезна. Экспортируйте ODT для правки и отдельный PDF для визуальной сверки. Исходный скан храните неизменным: распознанный текст не должен заменять юридически значимый образ документа.
Практический процесс: книга с двумя колонками
Для книги сначала определите, обрабатываете ли вы одну страницу или разворот. Разворот лучше разделить на отдельные страницы до OCR: изгиб корешка и разные углы наклона мешают единой коррекции. На каждой странице удалите тёмную рамку, проверьте ориентацию и включите улучшенное обнаружение колонок. Автоматический результат должен дать отдельные блоки левой и правой колонки, заголовка и номера страницы.
Если колонки склеиваются, уменьшите минимальную ширину либо создайте две рамки вручную. Если строки дробятся на десятки объектов, увеличьте окно анализа. Порядок чтения проверьте до экспорта: весь текст левой колонки должен идти перед правой, если макет не содержит переходящих врезок. Иллюстрации помечайте как изображения, подписи — как отдельный текст.
Для литературного текста включите исправление переносов, но после OCR ищите смысловые дефисы и тире. В старой печати буквы могут иметь непривычную форму; сравните Tesseract с альтернативным движком на нескольких абзацах. Экспорт в ODT лучше строить как логический текст, а не точную копию полосы, если цель — электронная книга. Для факсимильного PDF, наоборот, сохраните геометрию и изображения.
Практический процесс: пачка однотипных страниц
Когда страницы имеют одинаковый шаблон, сначала доведите до идеала один экземпляр. Определите разрешение, фильтры, размер окна, язык и способ разметки. Затем обработайте небольшой пакет и сравните ошибки. OCRFeeder умеет работать с несколькими изображениями и командной строкой, но не является промышленной системой шаблонного извлечения полей: координаты и качество всё равно нужно контролировать.
Для полностью автоматического преобразования используется ocrfeeder-cli. Команда принимает изображения, выходной файл и параметры распознавания; точный синтаксис смотрите через ocrfeeder-cli --help, потому что набор опций зависит от выпуска. CLI полезен для быстрого пакетного ODT, но использует выбранный по умолчанию движок и лишает пользователя визуальной правки рамок до экспорта.
Безнадзорный режим безопаснее запускать на копиях и писать результат в отдельный каталог. Сначала обработайте пять страниц, посчитайте пустые или подозрительно короткие файлы, затем расширяйте пакет. После автоматизации выборочно проверяйте начало, середину и конец каждой партии, а также страницы с необычным количеством блоков. Высокая скорость не компенсирует систематическую ошибку языка или неверную ориентацию.
Командная строка OCRFeeder
Наличие CLI отличает OCRFeeder от чисто графических редакторов. Он предназначен для быстрых и необслуживаемых преобразований изображений в редактируемые документы и может вызываться другими программами. Два базовых элемента рабочего задания — список входных изображений и имя выходного документа. Остальные параметры управляют форматом, движком, разрешением, распознаванием и обработкой страниц.
Не копируйте пример команды из случайного старого руководства без проверки справки установленной версии. Запустите ocrfeeder-cli --version и ocrfeeder-cli --help, сохраните вывод рядом со скриптом и используйте абсолютные пути. В системном задании cron или службе окружение отличается от интерактивного терминала: PATH, локаль и доступ к шрифтам могут быть другими.
Для русского текста задайте UTF-8-локаль и убедитесь, что движок видит модель rus. Имя выходного файла лучше формировать из безопасных латинских символов, а исходное название хранить в журнале. Скрипт должен проверять код завершения и существование непустого результата. Если CLI вернул успех, но документ пуст, дополнительно анализируйте размер и число страниц.
Как повысить точность распознавания
Главное улучшение даёт не смена интерфейса, а качественный вход. Скан должен быть резким, без JPEG-ореолов, с достаточным разрешением и ровными строками. Белый фон не обязан быть идеально чистым, но контраст букв должен сохраняться. Перед фильтрацией сравните пробное OCR оригинала и обработанной копии: визуально более белая страница иногда распознаётся хуже из-за утраченных тонких штрихов.
- Сканируйте печатный текст обычно при 300 dpi, мелкий или повреждённый — при 400–600 dpi.
- Выбирайте конкретный язык области и устанавливайте соответствующие данные движка.
- Не включайте одновременно лишние языки с похожими алфавитами.
- Разделяйте колонки и таблицы до вызова OCR, а не после смешивания строк.
- Оставляйте вокруг текста небольшой запас, но исключайте соседние объекты.
- Сравнивайте движки на типовых фрагментах, а не по одному удачному слову.
- Исправляйте наклон до построения рамок и заново анализируйте страницу после поворота.
Для слабого контраста попробуйте оттенки серого вместо жёсткой бинаризации. Для цветного фона может помочь выделение канала во внешнем редакторе. OCRFeeder и Unpaper не исправляют перспективные искажения камеры так гибко, как специализированные инструменты; фотографию листа лучше предварительно выровнять по четырём углам. Нельзя восстановить символ, полностью скрытый бликом или сгибом — его придётся ввести вручную.
Оценивать результат нужно на уровне символов и структуры. Случайно выбранный абзац может выглядеть хорошо, пока номера страниц, сноски и курсив систематически портятся. Составьте контрольный набор из разных типов фрагментов и записывайте характер ошибок. Тогда настройка превращается из угадывания в сравнимый эксперимент.
Типичные ошибки и способы устранения
OCR-движок не найден
Если список движков пуст, проверьте наличие исполняемого файла командой вроде which tesseract и его запуск из терминала. Установите пакет из репозитория, затем перезапустите OCRFeeder, чтобы автообнаружение выполнилось заново. В Flatpak хостовая команда может быть недоступна контейнеру; в таком случае используйте движок, включённый в пакет, или нативную сборку.
Распознавание возвращает пустой текст
Пустой результат чаще всего связан с отсутствующим языком, неверным шаблоном команды или слишком маленькой и пустой областью. Проверьте клип справа, выберите известный движок и язык, распознайте крупный чистый абзац. Затем вызовите движок напрямую на сохранённом фрагменте. Если прямой вызов работает, пересоздайте конфигурацию OCRFeeder; если нет — исправьте установку движка.
Автоматический анализ не видит текст
Увеличьте контраст, исправьте ориентацию и наклон, проверьте разрешение. Измените размер окна анализа и отключите чрезмерную обработку фона. На необычном макете не тратьте время на бесконечную настройку: создайте рамки вручную. Ручная разметка является штатной частью программы, а не обходным трюком.
Две колонки объединяются
Включите улучшенный поиск колонок и подберите минимальную ширину. Уберите вертикальные тени и линии, которые визуально соединяют блоки. Если алгоритм продолжает склеивать колонки, удалите общую рамку и создайте отдельные области. Проверьте порядок чтения перед экспортом.
PDF не импортируется
Убедитесь, что установлен Ghostscript, PDF открывается без пароля и доступен локально. Используйте короткий путь, проверьте права и место во временном каталоге. Попробуйте извлечь одну страницу в PNG внешним средством: если изображение загружается, проблема относится к цепочке PDF, а не к OCR. Для повреждённого файла сначала создайте исправленную копию.
Сканер не отображается
Запустите scanimage -L, проверьте кабель, сетевой адрес, группу доступа и пакет sane-backends. Если SANE видит устройство, а OCRFeeder нет, запустите нативную сборку из терминала и изучите сообщение. В песочнице проверьте разрешения. Как надёжный обходной путь сканируйте в файлы другой программой и импортируйте каталог.
Unpaper отсутствует или ухудшает страницу
Установите одноимённый пакет и перезапустите приложение. Если инструмент доступен, но результат хуже, вернитесь к оригиналу и отключите агрессивные фильтры. Применяйте выравнивание, очистку края и подавление фона отдельно. Для тонкого шрифта сохраняйте оттенки серого и не завышайте порог чёрного.
ODT не создаётся
Проверьте права на каталог, имя файла, свободное место и библиотеки ODF. Экспортируйте одну страницу в домашний каталог. Если тест проходит, найдите проблемный блок в большом проекте делением документа на части. Пересоздайте рамку, в которой нет текста или присутствует необычный символ, и повторите экспорт.
Интерфейс тормозит
Снизьте число одновременно загруженных страниц, уменьшите чрезмерное разрешение и закрывайте ненужные проекты. Обрабатывайте длинную книгу главами. Автоматическое распознавание нескольких высокодетальных страниц нагружает и анализатор, и внешний движок; часть времени приложение может выглядеть неотзывчивым. Запускайте пакет на копии и дождитесь завершения процесса, контролируя загрузку системы.
Совместимость и системная среда
OCRFeeder рассчитан на Linux и другие Unix-подобные системы с GTK. Официального настольного выпуска для Windows или macOS нет. Запуск через виртуальную машину технически возможен, но добавляет настройку обмена файлами, шрифтов и сканера; пользователям этих систем рациональнее выбрать нативный аналог. В Linux приложение хорошо вписывается в связку SANE, Tesseract, Ghostscript и LibreOffice.
Код версии 0.8.5 использует Python 3 и GTK3. Современные дистрибутивы продолжают упаковывать программу, но применяют собственные патчи совместимости. Поэтому номер пакета может содержать ревизию дистрибутива, например 0.8.5-3 или 0.8.5-10, при неизменной upstream-версии 0.8.5. Эти ревизии не являются новыми функциями самого OCRFeeder, но могут исправлять зависимости и сборку.
Минимальные требования нельзя свести к одной официальной таблице мегабайт и частоты процессора: нагрузка определяется размером сканов и движком. Для нескольких страниц достаточно обычного настольного Linux, а книга из сотен изображений 600 dpi требует заметно больше памяти и диска. Практический ориентир — обрабатывать документ частями и хранить исходники на накопителе с запасом, а не пытаться загрузить всю коллекцию в один проект.
Конфиденциальность и безопасность
В стандартной конфигурации OCRFeeder обрабатывает файлы локально. Это преимущество для договоров, медицинских документов и фондовых материалов, которые нельзя отправлять в облачный OCR. Но локальность не отменяет контроля: внешние движки и библиотеки запускаются с правами пользователя, а временные изображения могут оставаться в системном каталоге до очистки. Работайте под обычной учётной записью и ограничьте доступ к папке проекта.
Устанавливайте OCRFeeder, движки и словари из подписанных репозиториев дистрибутива. Не используйте неизвестные portable-сборки, рекламные загрузчики и пакеты с изменёнными бинарниками. Официальный upstream предоставляет исходный tar.xz, а готовые пакеты распространяют Linux-дистрибутивы. Контрольная сумма подтверждает целостность пакета, но не заменяет проверку происхождения ссылки.
После завершения конфиденциальной работы удалите ненужные временные экспорты, черновые изображения и резервные копии, учитывая политику организации. Итоговый PDF может содержать распознанный текст, который не виден визуально, но копируется и индексируется. Перед передачей проверьте поиск, метаданные и скрытый слой, особенно если часть страницы должна быть закрыта. Простая закраска изображения не гарантирует удаления текста.
Сильные стороны OCRFeeder
- Разделяет анализ макета и распознавание, позволяя исправлять области до экспорта.
- Поддерживает несколько внешних OCR-движков и выбор движка для отдельного блока.
- Работает с изображениями, сканером через SANE и PDF через Ghostscript.
- Сохраняет проекты с текстом, геометрией и базовыми стилями.
- Экспортирует в ODT, PDF, HTML и обычный текст.
- Содержит ручной редактор рамок, текста, языка и оформления.
- Интегрирует Unpaper и системную проверку орфографии.
- Имеет графический и командный режимы и распространяется по GPL.
Главное достоинство проявляется на неоднородной странице. Простая утилита Tesseract читает поданное изображение целиком, а OCRFeeder позволяет отделить заголовок, две колонки и фотографию, использовать разные языки и сохранить иллюстрацию без OCR. Пользователь видит связь между текстом и координатами и может точечно повторить неудачную операцию.
Открытая архитектура делает программу полезной в учебных процессах и оцифровке фондов. Формат не привязан к платному облаку, исходники доступны, а данные остаются локально. Даже когда итоговую верстку удобнее закончить в LibreOffice, OCRFeeder сокращает ручную работу по сегментации и первичной проверке.
Ограничения и слабые стороны
OCRFeeder не распознаёт символы самостоятельно и требует внешнего движка. Это повышает гибкость, но усложняет установку и диагностику: оболочка, Tesseract, языковые данные, Ghostscript, Unpaper, SANE и словари развиваются отдельно. Ошибка одного компонента проявляется внутри общего процесса, и новичку приходится определять, на каком этапе она возникла.
Программа доступна прежде всего в Linux/Unix и не имеет официальных сборок для Windows и macOS. Интерфейс функционален, но плотная правая панель и модель областей требуют обучения. Автоматический анализ не гарантирует правильный порядок чтения и плохо заменяет ручную разметку сложных таблиц, формул и декоративной верстки.
Экспорт ограничен ODT, PDF, HTML и TXT; прямого DOCX нет. Сохранение внешнего вида основано на блоках и базовых стилях, а не на полноценной реконструкции издательского макета. OCRFeeder не редактирует существующие PDF-формы, подписи, аннотации и закладки и не предлагает промышленную проверку качества по словарям и шаблонам полей.
Точность определяется внешним OCR и исходником. Рукописный текст, искривлённая книжная страница, сложная формула и фотография с перспективой выходят за типичный сценарий. Программа помогает подготовить и проверить материал, но не превращает плохой скан в безошибочный документ одним нажатием.
Сравнение OCRFeeder с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| OCRFeeder | Ручного анализа макета и OCR сложных страниц в Linux | Требует внешнего OCR-движка |
| PDF Commander | Редактирования PDF и распознавания в понятном настольном интерфейсе | Не ориентирован на Linux-разметку сканов по блокам |
| gImageReader | Быстрого графического доступа к Tesseract в Linux и Windows | Меньше средств реконструкции макета в ODT |
| gscan2pdf | Сканирования пачек и создания поисковых PDF в Linux | Фокус на потоке сканирования, а не на редакторе областей |
| NAPS2 | Простого сканирования, профилей устройств и OCR на разных ОС | Не предназначен для детальной верстки каждой области |
| ABBYY FineReader PDF | Коммерческого OCR и редактирования PDF с высокой автоматизацией | Проприетарная платная лицензия |
OCRFeeder стоит выбирать пользователю Linux, которому важны ручная геометрия блоков, разные движки и ODT. gImageReader удобнее для прямого OCR через Tesseract без глубокой реконструкции страницы. gscan2pdf и NAPS2 рациональнее, когда основной процесс начинается со сканера и заканчивается поисковым PDF. PDF Commander подходит тем, кому важнее редактировать PDF в знакомом настольном приложении. ABBYY FineReader PDF ориентирован на коммерческий процесс с более высокой автоматизацией, но не является свободным решением.
Сравнивать программы только по слову OCR некорректно. OCRFeeder — редактор макета и оболочка над движками; Tesseract сам по себе — движок; gscan2pdf и NAPS2 — прежде всего средства захвата; PDF-редакторы решают ещё и изменение страниц, комментариев и объектов. Выбор определяется местом, где требуется контроль: до распознавания, во время сканирования или после создания PDF.
OCRFeeder и gImageReader
Обе программы используют внешнее распознавание и подходят пользователям свободного ПО. gImageReader строит интерфейс вокруг Tesseract и удобен для открытия изображения или PDF, выбора области, получения текста и hOCR. Он доступен не только в Linux, но и в Windows. OCRFeeder сильнее там, где нужно представить страницу как набор текстовых и графических объектов, сохранить базовый макет и выгрузить ODT.
Для нескольких страниц обычного текста gImageReader требует меньше подготовки. Для журнала с иллюстрациями OCRFeeder даёт более явный контроль типа каждого блока. Если организация стандартизировала Tesseract и не нуждается в смене движков, простота gImageReader может быть важнее. Если приходится сравнивать GOCR, Ocrad и Tesseract на отдельных зонах, модель OCRFeeder удобнее.
OCRFeeder и gscan2pdf
gscan2pdf организует получение пачки страниц, поворот, очистку, порядок листов и экспорт в PDF или DjVu. Это сильный инструмент потока сканер — готовый файл длительного хранения. OCRFeeder тоже умеет получать страницы через SANE, но его центр тяжести — анализ областей и редактирование распознанного содержимого.
Для оцифровки коробки однородных документов разумна связка: gscan2pdf выполняет стабильное сканирование и первичную обработку, OCRFeeder разбирает сложные страницы, требующие ручного контроля. Использовать обе программы не обязательно, но разделение этапов упрощает повторное сканирование и снижает нагрузку одного большого проекта.
OCRFeeder и NAPS2
NAPS2 предлагает профили сканеров, пакетную обработку, OCR и создание PDF в Windows, macOS и Linux. Он ориентирован на понятный поток захвата и хорошо подходит офису, где сотрудники регулярно сканируют однотипные бумаги. OCRFeeder требует больше ручной работы, зато позволяет редактировать рамки, стили и текст каждого блока до генерации документа.
Пользователю, которому нужен поисковый PDF из автоподатчика, обычно проще начать с NAPS2. Исследователю, восстанавливающему журнальную полосу или старую книгу в Linux, полезнее редактор областей OCRFeeder. Выбор зависит не от числа кнопок, а от того, важнее ли скорость захвата или точность структуры.
OCRFeeder и коммерческие OCR-пакеты
Коммерческие пакеты объединяют собственный движок, анализ макета, словари, пакетные профили и PDF-редактор в одном продукте. Это снижает число внешних зависимостей и часто даёт более автоматизированную обработку таблиц и сложной верстки. OCRFeeder бесплатен и открыт, но качество его распознавания ограничено подключённым движком, а финальная проверка остаётся на пользователе.
Для редких домашних задач и локального Linux-процесса свободная связка OCRFeeder плюс Tesseract экономична и прозрачна. Для организации, где стоимость ручной корректуры выше лицензии и требуется поддержка, коммерческое решение может быть рациональнее. В любом случае критичные числа и имена нужно сверять: ни один OCR не гарантирует юридически безошибочный текст.
Кому подходит OCRFeeder
- Пользователям Linux, которые оцифровывают книги, журналы и сканы из фондов со сложным макетом.
- Тем, кому нужно локальное распознавание без передачи документов в веб-сервис.
- Исследователям и энтузиастам, желающим сравнивать несколько свободных OCR-движков.
- Пользователям LibreOffice, которым нужен промежуточный ODT с текстом и изображениями.
- Авторам сценариев, которым пригодится ocrfeeder-cli для пакетного преобразования.
Программа менее удачна для человека, который работает только в Windows или macOS, ожидает идеально восстановленный DOCX одним нажатием, распознаёт преимущественно рукопись либо хочет полноценно редактировать существующие PDF-объекты. В этих случаях лучше выбрать нативный OCR/PDF-пакет соответствующей системы.
OCRFeeder также не заменяет систему ввода корпоративного уровня с шаблонами счетов, извлечением полей, очередями операторов и метриками качества. Он рассчитан на управляемую настольную работу и небольшую автоматизацию. Его сила — прозрачность каждого блока, а не скрытая конвейерная обработка миллионов страниц.
Частые вопросы
OCRFeeder работает онлайн?
Нет. Страницы и распознавание обрабатываются локально через программы в Linux.
Можно ли распознать русский текст?
Да, если установлен OCR-движок с русской языковой моделью, например Tesseract с данными rus. Русский перевод интерфейса и русский язык распознавания — разные компоненты. Проверяйте список языков движка и задавайте rus для соответствующей области.
Почему после установки OCR ничего не происходит?
Пакет OCRFeeder может быть установлен без рабочего движка или без языковых данных. Проверьте Tesseract в терминале, список языков и свойства выбранной области. Также убедитесь, что рамка имеет тип Text и содержит видимые символы.
Можно ли открыть PDF?
Да. OCRFeeder использует Ghostscript для преобразования страниц PDF в изображения. Текстовые объекты, формы и аннотации исходного PDF при этом не редактируются напрямую. Для уже текстового PDF повторное распознавание часто не нужно.
Поддерживается ли сканер?
Да, через SANE и установленный системный бэкенд. Сначала устройство должно определяться командой scanimage. В песочнице Flatpak доступ может быть ограничен; импорт заранее отсканированных файлов остаётся надёжной альтернативой.
Можно ли сохранить DOCX?
Прямого экспортёра DOCX нет. Сохраните ODT, откройте его в LibreOffice и создайте копию DOCX, затем проверьте рамки, шрифты и переносы. Для простого текста можно использовать TXT и оформить документ заново.
Распознаёт ли OCRFeeder рукопись?
Программа предназначена главным образом для печатного текста и передаёт изображение внешнему движку. Обычные модели Tesseract не обеспечивают надёжного распознавания свободной рукописи. Подписи и рукописные пометки лучше сохранять как изображения или вводить вручную.
Какой формат выбрать для дальнейшей правки?
ODT подходит для LibreOffice и сохранения базового макета. TXT лучше для чистого текста и автоматической обработки. PDF — для просмотра и поиска с сохранением вида, HTML — для последующей веб-разметки. Выбор нужно сделать до финальной коррекции, потому что требования к рамкам различаются.
Можно ли использовать несколько движков в одном документе?
Да. Движок выбирается для области, поэтому один блок можно обработать Tesseract, другой — Ocrad или GOCR. Сравнивайте результат на одинаковом фрагменте и фиксируйте лучший вариант. Язык также проверяется для каждого блока.
Нужно ли применять Unpaper ко всем страницам?
Нет. Фильтры полезны при наклоне, тёмном фоне и краях, но могут уничтожить тонкие детали. Сначала сделайте тест на типичной странице, сравните OCR до и после и сохраняйте оригинал. Разные группы страниц могут требовать разных параметров.
Итоговая оценка
OCRFeeder остаётся специализированным инструментом для Linux, который соединяет анализ макета, внешние OCR-движки и ручную коррекцию. Он особенно полезен, когда страница сложнее обычного одноколоночного скана и пользователю важно видеть, какой фрагмент распознаётся, каким языком и в каком порядке попадёт в документ. Возможность сохранить проект и экспортировать ODT делает программу практичной промежуточной средой между сканером и офисным редактором.
Использовать OCRFeeder эффективнее как контролируемый конвейер: подготовить качественные изображения, проверить Ghostscript и SANE, установить Tesseract с нужными языками, откорректировать области, исправить критичный текст и проверить каждый выходной формат. Попытка пропустить разметку и контроль превращает гибкость программы в причину ошибок.
Для простого поискового PDF существуют более быстрые сканирующие приложения, а для коммерческой автоматизации — комплексные OCR-пакеты. OCRFeeder занимает собственную нишу: свободная локальная работа с макетом документа в Linux, где пользователь сохраняет полный контроль над изображениями, движками и исправленным текстом. При таком сценарии его ограничения понятны, а сильные стороны используются по назначению.