В Aquaforest Autobahn DX можно собирать многоэтапные задания для OCR, конвертации и обработки PDF, запускать их вручную, по расписанию или при появлении файлов в контролируемой папке, а затем отслеживать ход выполнения по журналам и статусам. Основные инструменты охватывают распознавание сканов, создание PDF/A, сжатие, объединение и разделение документов, чтение штрихкодов, извлечение текста и данных, автоматическое скрытие чувствительной информации, а также обмен файлами с SharePoint, Azure Storage и почтовыми ящиками.
Рабочий процесс строится вокруг вкладок Quick Job, Job Manager, Designer, Monitor и Running Job. Quick Job подходит для проверки одной операции на конкретном файле или папке; Job Manager хранит повторяемые задания; Designer связывает несколько шагов в последовательность и открывает их параметры; Monitor показывает состояние службы и очереди; Running Job выводит подробный журнал текущего выполнения. Такая структура позволяет сначала проверить преобразование на небольшой выборке, а затем перенести настройки в постоянный поток без ручного повторения одинаковых действий.
Для каждого задания задаются исходная и целевая папки, маска файлов, правила обхода подпапок, способ обращения с обработанными документами, рабочие каталоги, размер пакета и порядок сортировки. Затем добавляются шаги OCR, конвертации, разделения, сжатия, проверки PDF/A, обработки штрихкодов или подключения к внешнему хранилищу. Результат зависит не только от выбранного шага, но и от прав учётной записи службы, доступности сетевых путей, качества исходных изображений, режима отладки и корректной настройки движка распознавания.
Скачать Aquaforest Autobahn DX
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Нужна настройка службы
- Нет русского интерфейса
- Только Windows
Как устроен интерфейс Aquaforest Autobahn DX
В верхней части окна расположены постоянные вкладки, между которыми администратор переключается без открытия отдельных программ. Quick Job отвечает за разовые операции и проверку параметров. Job Manager показывает таблицу сохранённых заданий с идентификатором, названием, временем последнего запуска, типом запуска, текущим состоянием и прогрессом. Designer открывает структуру выбранного задания и свойства каждого шага. Monitor используется для контроля службы и активных процессов. Running Job отображает текстовый журнал. Modules & Options содержит сведения о доступных возможностях, лицензионные данные и общие параметры, включая настройки электронной почты.
Левая колонка меняется в зависимости от выбранной вкладки. В Quick Job она содержит команды Run, Save to Job Manager, Save to File, Load from File, Show Command Line и Help. В Job Manager там появляются операции Create New, Edit, Copy, Delete, Run Now, Stop Job, Pause Job, Clear Error, View Log File, View CSV Log File, View Log Analysis, Explore Output и Explore Errors. В Designer слева расположен каталог шагов, сгруппированных по назначению: OCR, Convert, Split and Merge, Connectors, Barcode, PDF Operations и Advanced. Центральная область показывает последовательность шагов, а справа находятся вкладки Properties, Logging, Schedule, Processing и Alerts.
Интерфейс рассчитан на работу с большим количеством технических параметров, поэтому почти каждое поле сопровождается пояснением в нижней части панели свойств. Когда пользователь выделяет параметр, под таблицей выводится его назначение и допустимый формат. Для поиска в длинном списке свойств предусмотрена строка Search: она предлагает совпадающие названия и переводит фокус к выбранной настройке. Это полезно, когда шаг содержит десятки параметров OCR, качества JPEG, поведения при ошибке, шаблонов имён и правил сохранения.

Quick Job: проверка одного преобразования
На вкладке Quick Job сначала выбирают задачу в поле Select Task. Для простого OCR это может быть преобразование изображения или PDF без текстового слоя в searchable PDF. Поле Source принимает файл, папку или дерево каталогов в зависимости от выбранного режима, а Destination задаёт место сохранения. Output File(s) определяет шаблон имени результата. Кнопка More Options открывает диалог параметров документа: защиту, метаданные, режим отображения и настройки конвертации.
Разовый запуск удобен для проверки качества на нескольких типичных документах. Перед переносом настроек в постоянный поток стоит протестировать прямой скан, перекошенную страницу, смешанный PDF с текстовыми и графическими страницами, документ с крупным цветным фоном и файл с нестандартным шрифтом. В поле Task Log сразу видны сообщения движка. Если результат удовлетворяет требованиям, команда Save to Job Manager создаёт сохранённое задание с теми же параметрами; Save to File записывает определение в XML, а Show Command Line показывает эквивалент запуска из командной строки.
Проверка через Quick Job выполняется с правами вошедшего пользователя. Поэтому сетевой диск, доступный в проводнике, может открываться здесь и одновременно быть недоступным запланированному заданию, которое запускает служба. При тестировании сетевой папки лучше сразу использовать UNC-путь и проверять его от имени будущей служебной учётной записи, иначе успешный ручной опыт не гарантирует работу после сохранения задания.
Job Manager и Designer: хранение и сборка потоков
Job Manager хранит задания в виде строк. Команда Create New создаёт каркас и переводит пользователя в Designer. Edit открывает выбранное определение, Copy делает копию для варианта с другими папками или параметрами, а Delete удаляет определение после подтверждения. Run Now запускает сохранённую схему немедленно, Stop Job останавливает её, Pause Job временно приостанавливает, Clear Error снимает состояние ошибки. Команды просмотра журнала и папок избавляют от ручного поиска каталогов по идентификатору задания.
В Designer каждый процесс представлен упорядоченным списком Job Steps. Выход первого шага становится входом следующего, поэтому последовательность имеет прямое значение. Например, архивный поток может сначала загрузить TIFF из Azure, затем выполнить выравнивание и OCR, после этого преобразовать результат в PDF/A-2b, добавить метаданные, проверить соответствие стандарту и загрузить готовый файл в SharePoint. Перестановка проверки PDF/A перед изменением метаданных даст ложное ощущение готовности, потому что последующая операция может изменить документ.
Шаги добавляются из левого дерева. Для изменения порядка используется перетаскивание, а для удаления — команда Delete Step. Designer подсвечивает выбранный шаг и показывает только относящиеся к нему свойства. Вкладка Properties содержит общие папки и фильтры, Logging — каталоги и формат журналов, Schedule — режим запуска, Processing — ограничения по ядрам и служебные параметры, Alerts — почтовые уведомления. Такая разметка помогает отделять логику работы с файлами от расписания и контроля.


Monitor, Running Job и журналы
Monitor показывает состояние службы и список выполняющихся заданий. В таблице видны идентификатор, имя, тип запуска, состояние, текущий шаг и прогресс. Через команды слева можно открыть основной журнал, CSV-журнал, анализ журнала, выходную папку или каталог ошибок. При зависании важно сначала определить, остановился ли весь процесс, конкретный шаг или один файл: эти ситуации требуют разных действий.
Running Job выводит сообщения выбранного запуска в порядке появления. Здесь отображаются подготовка рабочих папок, обработанные имена, параметры подпроцессов, количество страниц, результат OCR, копирование в целевую папку и завершение шага. Для многоядерной обработки часть сообщений может появиться после завершения отдельного шага, поэтому отсутствие новых строк в течение короткого времени ещё не означает зависание.
Обычный журнал предназначен для чтения человеком, CSV удобен для последующего анализа, а режим Log Analysis помогает свести повторяющиеся ошибки. Для диагностики одного проблемного файла включают Debug у конкретного шага. В этом режиме сохраняются дополнительные сведения и промежуточные файлы, но временные каталоги перестают очищаться автоматически. На массовом потоке Debug быстро заполняет диск, поэтому после получения нужных данных его отключают и удаляют оставшиеся рабочие папки только после остановки задания.


Настройка исходных и целевых файлов
Основные поля задания находятся на вкладке Properties. Source Folder задаёт корневой каталог, Destination Folder — место готовых документов. Флажок Process Sub-Folders включает обход дерева, а Use Work Folders заставляет этапы использовать отдельные временные каталоги. Delete Empty Input Folders удаляет опустевшие папки после успешного переноса файлов, поэтому эту опцию не следует включать, если пустая структура каталогов имеет самостоятельное значение для другого приложения.
Input Files определяет судьбу исходников. Практический выбор зависит от требований аудита: файл можно оставить, удалить, переместить или скопировать в архив после обработки. Для производственного OCR безопаснее сначала копировать исходник в архив и только после контрольного периода переходить к перемещению. Если поток работает на месте, где источник и назначение совпадают, Use Work Folders обязателен: иначе этап может попытаться читать файл, который сам же заменяет.
Rename Input Files и Output File Name принимают шаблоны. В имени результата можно использовать исходное имя без расширения, имя каталога, временную метку и другие переменные, предусмотренные шагом. Шаблон нужно проверять на коллизии. Если два входных файла из разных подпапок имеют одинаковое имя, простой шаблон на основе только имени создаст конфликт в общей целевой папке. В таком случае добавляют имя родительского каталога или сохраняют структуру подпапок.
Filter Files определяет правило отбора, Filter Expression — маску или выражение, Batch Size — число файлов за один запуск, File Order — порядок сортировки. Размер пакета особенно важен для наблюдаемых папок. Слишком большой пакет задерживает появление первых результатов и затрудняет повторный запуск после сбоя; слишком маленький увеличивает накладные расходы. Для начала выбирают небольшой размер, измеряют среднее время и затем увеличивают его, пока очередь не начинает обрабатываться без заметных пауз.

Рабочие папки и защита от повторной обработки
Каждый шаг создаёт собственный рабочий каталог. Это изолирует промежуточные TIFF, распознанные изображения, временные PDF и журналы. На диске нужно резервировать место не только под исходный документ, но и под его растровые представления. Цветной многостраничный PDF при растрировании может временно занимать значительно больше исходного файла, особенно если используется высокий DPI и несжатые промежуточные изображения.
Повторная обработка предотвращается сочетанием архивирования исходников, фильтра Include Unprocessed PDFs Only, проверки количества текстовых страниц и корректного шаблона вывода. Если наблюдаемая папка остаётся одновременно источником и назначением, результат должен отличаться по имени или попадать в отдельный подкаталог, иначе он снова будет воспринят как вход. Для смешанных PDF полезен режим пропуска страниц, где уже есть поисковый текст: он сокращает время и не заменяет имеющийся текстовый слой.
Параметр Input Delay в конфигурации задаёт паузу между появлением файла и началом обработки. Он нужен, когда сканер, сетевой клиент или внешняя система копирует большой файл постепенно. Без задержки служба может открыть документ до завершения записи и получить ошибку повреждения или блокировки. Значение подбирают по максимальному времени копирования типичного файла и оставляют небольшой запас.
OCR: движки, языки и подготовка изображения
Шаги OCR различаются по типу источника: Image to Searchable PDF работает с PNG, TIFF, JPEG, GIF и BMP; PDF to Searchable PDF добавляет скрытый текстовый слой к PDF; Any File to Searchable PDF сначала преобразует поддерживаемый документ и затем распознаёт; Merge Image to Searchable PDF собирает несколько изображений в один результат. В Designer эти операции находятся в группе OCR, а конкретный набор параметров зависит от выбранного движка.
Стандартное распознавание поддерживает 23 языка, расширенный движок — 129 языков и несколько языков одного алфавита в одном документе. Выбирать все доступные языки не следует: широкий набор увеличивает время и число ложных вариантов. Для русско-английских документов задают только нужные языки, а для архива с разными языковыми группами разделяют поток по папкам или метаданным. Когда документ содержит русский и английский текст, оба языка должны быть включены в одном шаге; когда в одной папке смешаны кириллица, арабский и иероглифы, лучше использовать отдельные задания.
Качество OCR определяется не только языком. Deskew исправляет наклон, Auto-Rotate определяет ориентацию, Despeckle удаляет мелкий шум, Line Removal убирает линии форм и таблиц, которые мешают распознаванию. Эти операции стоит проверять на копии: агрессивное удаление линий способно затронуть тонкие символы, печати и элементы чертежа. Для чистых цифровых PDF предварительная обработка не нужна и может ухудшить результат из-за лишнего растрирования.
Разрешение выбирают по источнику. Для обычного текста достаточно качества, при котором высота строчной буквы хорошо различима; увеличение DPI выше фактической детализации скана не добавляет информации, но повышает нагрузку на процессор и временный диск. Для мелкого текста и слабого факса сначала проверяют контраст, бинаризацию и удаление фона. Если документ имеет цветные печати и рукописные пометки, сохраняют цветной оригинал и создают отдельную поисковую копию, чтобы не потерять визуальные данные.

Распознавание смешанных и уже поисковых PDF
Смешанный PDF может содержать текстовые страницы, сканы и страницы с текстом поверх изображения. Без анализа весь документ будет растрирован и распознан заново, что увеличит время, изменит качество графики и может испортить существующие ссылки. Шаг GdPicture OCR умеет пропускать страницы, где уже есть поисковый текст или скрытый текстовый слой. Для архивов с документами неизвестного происхождения этот режим обычно безопаснее полного OCR.
Перед массовым запуском проверяют три результата: копируется ли существующий текст без потери, появляется ли текст на сканах и сохраняется ли порядок чтения в сложных макетах. Колонки, таблицы, боковые подписи и штампы могут давать неверную последовательность. Если цель — полнотекстовый поиск, небольшие ошибки порядка допустимы; если текст будет экспортироваться в DOCX или использоваться для извлечения данных, порядок блоков нужно оценивать отдельно.
При сомнении сравнивают число поисковых страниц до и после обработки. Шаг Get Document Information способен получить общее число страниц, количество страниц с текстом и другие характеристики, а Pattern Enumeration — посчитать совпадения по заданным шаблонам. Эти показатели можно записать в CSV и использовать как контроль качества: например, отправлять в каталог ошибок документы, где после OCR не появилось ни одной поисковой страницы.
Рукописный текст и облачное OCR
Для распознавания печатного и рукописного текста предусмотрены шаги, обращающиеся к Microsoft Computer Vision и Google Cloud Vision. В их параметрах задаются конечная точка или файл учётных данных, язык и выходной формат. Каждый лист передаётся внешней службе, поэтому перед использованием проверяют требования к конфиденциальности, регион обработки, срок хранения данных и лимиты учётной записи.
Облачный движок не заменяет обычный OCR во всех задачах. Он полезен для форм с рукописными полями, коротких заметок и материалов, где локальный движок не распознаёт почерк. Для массивного архива печатных сканов локальный этап обычно предсказуемее по стоимости и не зависит от соединения. Практическая схема может сначала выполнять локальный OCR, затем направлять в облачный шаг только документы, не прошедшие контроль по числу слов или ключевым полям.
Создание PDF и параметры результата
Диалог Document Options объединяет четыре группы: Security, Metadata, Document Options и PDF Conversion Settings. Эти настройки применяются к операциям, которые создают новый PDF. На вкладке Metadata вводятся Author, Creator, Title, Subject и Keywords. Значения можно задавать статически или формировать из внешней логики на другом шаге. Для архивного потока полезно записывать источник, тип документа и идентификатор партии, но не следует переносить в общедоступные метаданные конфиденциальные номера счетов или персональные данные.
Document Options задаёт режим открытия: раскладку страниц, вид панели закладок или миниатюр, поведение полноэкранного режима, скрытие панелей, подгонку окна, ориентацию бумаги и поля. Эти параметры меняют удобство просмотра, но не исправляют содержание. Для длинных отчётов обычно оставляют стандартное отображение и сохраняют закладки, если они были созданы при конвертации заголовков.
PDF Conversion Settings управляет тайм-аутом, папкой ошибок, обработкой гиперссылок, закладок, свойств Office, печатью всех листов Excel, фоном HTML, вложениями, масштабом, встраиванием шрифтов, заменой шрифтов, сжатием и уменьшением изображений. Тайм-аут должен быть больше времени преобразования самого тяжёлого ожидаемого файла. Слишком маленькое значение создаёт ложные ошибки на больших презентациях и таблицах; бесконечное ожидание затрудняет восстановление после зависшего приложения.



Защита PDF и ограничения доступа
Вкладка Security позволяет задать пароль открытия, пароль владельца, уровень шифрования и разрешения на печать, копирование, изменение, аннотирование, заполнение форм и использование программ чтения с экрана. Перед включением ограничений нужно понимать, что пароль не является заменой контролю доступа к хранилищу. Если пароль хранится в открытом XML задания или известен всем операторам, реальная защита зависит от прав на папку и управления секретами.
Пароль владельца должен отличаться от пароля открытия. Для автоматического потока его безопаснее передавать из защищённой конфигурации или внешнего хранилища секретов, а не копировать в инструкции. Запрет печати и копирования поддерживается программами просмотра добровольно и не предотвращает получение изображения страницы. Для чувствительных данных надёжнее сочетать шифрование с ограничением прав на SharePoint, Azure или файловую систему.
При обработке зашифрованных исходных PDF пароль источника задаётся отдельно. Если в партии встречаются документы с разными паролями, один шаг не сможет открыть их все без дополнительной логики. Такие файлы лучше предварительно распределить по папкам или использовать пользовательский скрипт, который выбирает пароль по метаданным. Неизвестные или повреждённые защищённые файлы должны попадать в папку ошибок, а не блокировать весь пакет.

Конвертация документов и поддерживаемые форматы
Операция Convert Any File to PDF предназначена для файлов, которые можно открыть соответствующим приложением или преобразовать через служебный компонент. В типичных потоках используются Word, Excel, PowerPoint, Visio, Publisher, HTML, текст, OpenDocument, сообщения Outlook и изображения. Официальное описание указывает поддержку более ста типов, но фактический результат зависит от выбранного метода, установленных приложений, шрифтов, принтеров и прав учётной записи службы.
Шаг Convert Any File To PDF на движке GdPicture обрабатывает многие форматы без запуска Microsoft Office. В руководстве прямо перечислены BMP, DOC, DOCX, DOCM, EMF, GIF, HTML, ICO, JPEG, PGM, PNG, PPM и PPTX, а также другие типы. Этот вариант снижает зависимость от автоматизации Office, но визуальное совпадение сложных документов всё равно нужно проверить: макросы, внешние ссылки, внедрённые объекты, нестандартные шрифты и функции электронных таблиц могут отображаться иначе.
Для Office-конвертации через нативное приложение служебная учётная запись должна хотя бы один раз войти в систему после установки. Word, Excel и другие используемые программы открывают под этой учётной записью, завершают первичную настройку, принимают лицензионные диалоги и отключают окна восстановления. В противном случае фоновая конвертация может ждать невидимого вопроса и завершаться по тайм-ауту.
Convert PDF To Office и Convert Any File To Office создают редактируемые результаты, включая DOCX, RTF, CSV, XLSX, текст, HTML и XPS при наличии соответствующего движка. Такие файлы не следует считать точной копией макета. Таблицы, колонки, колонтитулы, сноски и текст на изображениях реконструируются по результатам анализа. Для юридически значимого архива исходный PDF сохраняют, а Office-файл используют как вспомогательный.
Преобразование PDF в изображения и текст
PDF To JPEG и PDF To PNG создают отдельное изображение для каждой страницы. JPEG подходит для фотографических страниц и компактных превью, PNG — для схем, текста и интерфейсных снимков, где важны резкие границы. При выборе разрешения учитывают дальнейшее использование: для просмотра достаточно умеренного DPI, для повторного OCR нужно сохранять детализацию символов.
PDF To TIFF создаёт многостраничный TIFF, а вариант GdPicture предоставляет собственный набор параметров. TIFF востребован в старых системах документооборота и сканирующих архивах. Выбор CCITT Group 4 оправдан для чёрно-белых страниц, LZW — для изображений без потерь. Преобразование цветного PDF в битональный TIFF необратимо, поэтому порог бинаризации проверяют на печатях, подписях и светлом тексте.
PDF To Text извлекает имеющийся поисковый слой. Он не выполняет распознавание сам по себе: для скана сначала добавляют OCR. В многоэтапном задании порядок должен быть OCR, затем извлечение текста. Для контроля результата можно сохранять TXT рядом с PDF или отправлять текст в последующий скрипт. Кодировку и переносы строк проверяют на кириллице, символах валют, длинных тире и таблицах.
Объединение, разделение и организация документов
Группа Split and Merge содержит Merge PDF, Split PDF, Combine PDFs, Merge TIFF/JPEG/BMP/PNG/GIF, Split TIFF и вариант Split PDF на движке GdPicture. Merge PDF объединяет готовые PDF без предварительной конвертации, а Combine Any File To PDF сначала преобразует разные типы и затем собирает единый документ. При смешивании форматов важно заранее определить порядок: сортировка по имени может поставить страницу 10 перед страницей 2, если номера не дополнены нулями.
Split PDF разделяет документ по числу страниц или другим правилам, предусмотренным шагом. После разделения шаблон имени должен включать номер части или диапазон страниц. Если исходный документ содержит закладки, формы, вложения или цифровые подписи, нужно проверить, что именно сохраняется в каждой части. Любое изменение подписанного PDF делает подпись недействительной, поэтому перед разделением применяют Detect Signatures и направляют подписанные файлы в отдельный поток.
Create PDF Portfolio собирает документы как вложенные элементы портфолио. Это не то же самое, что последовательное объединение страниц: каждый вложенный файл остаётся самостоятельным. Портфолио удобно для комплекта исходников разных типов, но не все программы просмотра одинаково отображают его структуру. Если получателю нужен обычный PDF без зависимости от специального интерфейса, лучше преобразовать и объединить страницы.
Сжатие и оптимизация PDF
Для уменьшения размера используются Optimize PDF, Modern Compress PDF и GdPicture Compress PDF. Доступны JPEG2000, JBIG2, Mixed Raster Content, определение цветности, удаление лишнего содержимого и уменьшение изображений. MRC разделяет страницу на слои: фон, цветные элементы и текстовый слой. Это особенно эффективно для цветных сканов с белым фоном, где обычный JPEG сохраняет всю страницу как фотографию.
JBIG2 предназначен для чёрно-белых изображений и способен сильно уменьшать сканы. При использовании режима с общими словарями одинаковые символы могут кодироваться повторно, поэтому на критичных документах проверяют визуальную точность мелких цифр, серийных номеров и знаков. Для бухгалтерских, медицинских и юридических материалов предпочтительнее настройки, исключающие риск подмены похожих символов, даже если файл станет больше.
JPEG2000 хорошо работает с цветными и полутоновыми изображениями, но совместимость со старыми просмотрщиками ниже, чем у обычного JPEG. Уменьшение DPI следует связывать с конечной задачей: архивная мастер-копия сохраняет исходное качество, а веб-копия может иметь меньший размер. Полезно создать два выхода в разных заданиях или скриптом: PDF/A для хранения и оптимизированную копию для портала.
Linearize PDF включает Fast Web View, чтобы большой документ мог открываться по страницам до полной загрузки. Линеаризация не уменьшает содержание и не заменяет сжатие, но улучшает первое отображение через HTTP. После любого последующего изменения линейная структура может быть нарушена, поэтому этот шаг ставят ближе к концу, после OCR, метаданных, закладок и сжатия.
PDF/A: создание и проверка архивных документов
Autobahn DX поддерживает PDF/A-1b, PDF/A-2b и PDF/A-3b в основных параметрах, а некоторые операции предоставляют дополнительные варианты. Convert PDF To PDF/A преобразует документ, Validate PDF/A проверяет соответствие выбранному профилю. Правильная последовательность для архива: создать или распознать PDF, встроить нужные шрифты, добавить метаданные, выполнить преобразование PDF/A и затем валидацию.
PDF/A-1 имеет более строгие ограничения и подходит для консервативных архивов. PDF/A-2 допускает современные возможности PDF и обычно удобнее для новых коллекций. PDF/A-3 разрешает вложение произвольных файлов, поэтому используется там, где вместе с визуальным представлением нужно хранить исходные XML или другие данные. Выбор стандарта определяется политикой архива и системой приёма, а не только минимальным размером.
Если Validate PDF/A отклоняет файл, его отправляют в отдельный каталог и анализируют причину. Типичные проблемы — не встроенный шрифт, недопустимое шифрование, неправильный цветовой профиль, прозрачность в неподходящем профиле, повреждённые объекты или несогласованные метаданные. Простая смена расширения или свойства не делает документ соответствующим стандарту; нужна полноценная конвертация и повторная проверка.
Штрихкоды: разделение, имена и маршрутизация
Шаг Barcode TIFF/PDF читает одномерные и двумерные штрихкоды, включая QR-коды, на страницах TIFF и PDF. Найденное значение можно использовать для разделения документов, формирования имени и передачи данных следующему шагу. Перед запуском выбирают типы кодов, диапазон страниц и правила поиска. Ограничение списка символогий ускоряет анализ и снижает число ложных совпадений.
Split by Barcode поддерживает сценарии код на первой странице, код на последней странице и удаление страницы-разделителя. Для пачки счетов удобно печатать разделительную страницу перед каждым документом: значение определяет имя, сама страница удаляется. Для входящих форм код можно размещать в фиксированной зоне, чтобы не принимать случайные штрихкоды товаров за границу документа.
Качество чтения зависит от разрешения, контраста, угла и свободного поля вокруг символа. Если код распечатан слишком мелко или перекрыт печатью, предварительная обработка OCR не всегда помогает. В спорных случаях сохраняют страницу в папке ошибок и не подставляют неполное значение в имя. Шаблон имени очищают от символов, запрещённых в Windows, и ограничивают длину, иначе корректно распознанный код приведёт к ошибке записи.
Извлечение данных и автоматическое скрытие информации
Key Value Pair Extraction предназначен для поиска пар поле — значение в полуструктурированных документах. В параметрах задаются языки, формат вывода, порог уверенности и другие свойства. Результат можно сохранять в JSON или табличном формате и передавать в систему учёта. Порог уверенности нужно настраивать на размеченной выборке: высокий порог уменьшает ложные значения, но увеличивает число пропущенных полей.
Pattern Enumeration ищет и считает совпадения по шаблону, Pattern Highlighting отмечает их, Pattern Redaction удаляет соответствующие области. Эти шаги подходят для устойчивых форматов: номера счетов, почтовые адреса, идентификаторы, даты или заранее известные фразы. Регулярное выражение должно учитывать разделители, пробелы и разные варианты записи. Перед необратимым скрытием полезно сначала применить подсветку и проверить отчёт.
Smart Redaction использует анализ содержимого для поиска чувствительных данных, таких как имена, адреса электронной почты, телефоны и другие категории. Автоматическое обнаружение не гарантирует полноту, поэтому документы с высокими требованиями к конфиденциальности проходят выборочный или полный контроль человеком. Красный прямоугольник поверх текста недостаточен: правильный шаг должен удалить содержимое, а не только закрыть его визуально.
PDF Recognition to JSON извлекает структуру страницы и распознанные данные в машиночитаемое представление. Такой результат пригоден для собственного классификатора, проверки наличия полей и интеграции с внешним процессом. При изменении шаблона документа следует сравнивать новую структуру со старой, иначе смещение подписи или таблицы может нарушить правила, которые ориентируются на координаты.
Цифровые подписи и безопасная обработка
Detect Signatures проверяет наличие цифровой подписи до шагов, изменяющих документ. Если подпись обнаружена, файл можно скопировать или переместить в отдельную папку, а исходный подписанный документ — вложить в обработанную копию. Это предотвращает незаметное уничтожение доказательства подписи при OCR, сжатии, разделении, добавлении штампа или изменении метаданных.
Решение о дальнейшей обработке зависит от задачи. Для архива оригинал сохраняют без изменений, а searchable PDF создают как производную копию с явной связью с исходником. Для входящего потока подписанные файлы можно исключить из автоматической оптимизации и направить оператору. В журнале фиксируют выбранное действие, путь оригинала и имя результата.
Подпись может быть невидимой или располагаться в контейнере, поэтому визуального осмотра недостаточно. Любой шаг, который переписывает структуру PDF, способен сделать проверку подписи неуспешной, даже если страницы выглядят одинаково. Detect Signatures должен стоять до первого изменяющего шага, а не непосредственно перед сохранением.
Подключение SharePoint, Azure и электронной почты
Группа Connectors включает SharePoint Download, SharePoint Upload, Azure Storage Download, Azure Storage Upload, Read Mailbox и Send Documents. Типичный поток сначала забирает документы из внешнего источника во временную папку, выполняет обработку и затем загружает результат. Разделение загрузки и обработки облегчает повторный запуск: при ошибке OCR исходник остаётся в контролируемом каталоге, а не исчезает из внешней системы.
Для SharePoint поддерживаются серверные библиотеки, SharePoint Online и OneDrive for Business. В параметрах указывают адрес узла, библиотеку, папку и способ аутентификации. Служебная учётная запись должна иметь минимально необходимые права: чтение во входной библиотеке и добавление или изменение в выходной. Если метаданные обязательны, их задают до загрузки, иначе SharePoint может отклонить файл или оставить его извлечённым.
Azure Storage используется как источник и назначение для контейнеров Blob или файлового хранилища. Ключи и строки подключения не размещают в общедоступных XML и журналах. Для производственной среды применяют отдельную учётную запись, ограниченную нужным контейнером, и регулярно меняют секреты. При большой задержке сети размер пакета подбирают так, чтобы загрузка не занимала всё окно расписания.
Read Mailbox получает письма и вложения через IMAP4 с базовой аутентификацией или OAuth2, а Send Documents отправляет результаты. Правила должны различать тело письма, вложения и вложенные сообщения. MSG и EML могут содержать несколько файлов, подписи и встроенные изображения; перед конвертацией определяют, что считать документом. Для уведомлений о работе задания используется отдельная вкладка Alerts, а не шаг Send Documents.
Почтовые уведомления о результате
На вкладке Alerts включается Send Email Alerts on Job Completion. Можно приложить обычный журнал и отчёт, задать адрес отправителя, получателя, тему и HTML-текст. В шаблоне используются переменные имени задания, состояния, времени, исходной и целевой папки. Кнопка Test Email проверяет общие SMTP-настройки до запуска обработки.
Чтобы не получать письмо при каждом пустом опросе наблюдаемой папки, включают условие At least one file was processed. Для контроля ошибок доступны At least one file error occurred и Job Terminated Prematurely. Первое реагирует на отдельные файлы, второе — на аварийное завершение задания. В критичном потоке полезно настроить два уведомления: краткое для файловых ошибок и отдельное для остановки всей схемы.

Расписание и наблюдаемые папки
Вкладка Schedule предлагает Ad-Hoc, Continuous Watched Folder и Once Per Day. Ad-Hoc не имеет расписания и запускается из интерфейса, API или командной строки. Continuous выполняет опрос через заданное число секунд, минут или часов в указанном временном диапазоне. Флажок Run Continuously включает круглосуточную работу. Once Per Day запускает задание один раз в выбранное время.
Наблюдаемая папка подходит для сканеров, МФУ и систем, которые складывают документы в каталог. Интервал не должен быть короче времени появления стабильного файла. Если устройство сначала создаёт временное имя, а затем присваивает полностью записанному файлу окончательное имя, фильтр на конечное расширение обычно достаточен. Если файл сразу виден под окончательным именем, используют Input Delay.
Ежедневный режим применяют для ночной обработки больших архивов или синхронизации с SharePoint. Время выбирают с учётом резервного копирования, антивирусного сканирования и обслуживания базы данных. Если выполнение длится дольше суток, следующий запуск может пересечься с предыдущим; размер партии, число ядер и окно работы должны исключать неконтролируемое накопление параллельных процессов.

Многоядерная обработка, распределение нагрузки и отказоустойчивость
Число доступных ядер ограничивается лицензией и количеством логических процессоров. Задания OCR и сжатия обычно выигрывают от параллельной работы сильнее, чем простое копирование или изменение метаданных. Увеличение ядер повышает нагрузку на диск, память и сетевое хранилище, поэтому производительность нельзя оценивать только по загрузке CPU.
Для большого числа небольших документов полезна параллельная обработка файлов. Для одного очень длинного документа могут применяться потоки, которые делят его на части. Перед включением максимальной параллельности измеряют скорость на репрезентативной партии: при медленном сетевом диске дополнительные процессы начнут конкурировать за ввод-вывод и сократят стабильность.
Distributed Polling позволяет нескольким серверам смотреть в общую исходную папку и распределять файлы. Ограничение количества файлов на один захват предотвращает ситуацию, когда один узел забирает всю очередь. Общий каталог должен поддерживать надёжные блокировки, а службы на всех узлах — иметь одинаковые права и согласованные настройки.
High Availability использует две установки на разных узлах и переключается на резервную при недоступности основной. Это не заменяет резервное копирование jobdef, конфигурации, лицензий и рабочих данных. Резервный узел должен регулярно проверяться реальным тестовым заданием, иначе ошибка доступа, просроченный пароль или различие шрифтов обнаружится только во время аварии.
Командная строка, XML, .NET API и пользовательские шаги
Командная строка запускает операции, доступные через Quick Job, и сохранённые задания по идентификатору. Параметры задают источник, тип источника, назначение, имя выхода, операцию, OCR, выравнивание, автоповорот и другие свойства. Команда удобна для планировщика, сценария PowerShell и интеграции с системой, которая не использует графический интерфейс.
Определения заданий хранятся в XML. В файле находятся общие папки, расписание, каталоги журналов и параметры каждого шага. XML можно хранить в репозитории изменений, сравнивать перед изменениями и переносить между тестовой и рабочей средой. При переносе заменяют абсолютные пути, учётные данные и параметры, зависящие от сервера. Ручное редактирование выполняют только по документированной схеме, потому что неверное имя свойства может быть проигнорировано или остановить загрузку задания.
.NET Job API позволяет приложению создавать и запускать разовые задания, получать состояние и связывать обработку с бизнес-системой. Это подходит, когда документ должен обрабатываться по событию, а не по опросу папки. Приложение должно обрабатывать тайм-ауты, повторные вызовы и идемпотентность: повторная отправка одного идентификатора не должна создавать два одинаковых результата.
Custom Script Step запускает пользовательский сценарий между стандартными этапами. Скрипт получает входную и выходную папки текущего шага и обязан скопировать или создать ожидаемые файлы, даже если фактически только назначает им другое имя. Его используют для нестандартной маршрутизации, вызова внешней утилиты, проверки имени или упаковки. Любой внешний исполняемый файл проверяют на лицензирование, цифровую подпись и предсказуемые коды завершения.

Практический сценарий: архив TIFF в поисковый PDF/A
Для миграции сканированного архива создают отдельные каталоги In, Out, Archive и Error. В Properties включают обход подпапок, копирование исходника в архив и рабочие папки. Фильтр ограничивают TIFF, а размер партии устанавливают небольшим на этапе проверки. Первый шаг Image to Searchable PDF выполняет автоповорот и умеренное выравнивание; второй преобразует результат в выбранный профиль PDF/A; третий проверяет соответствие.
Перед полной миграцией берут выборку из разных лет и источников: чёрно-белые факсы, цветные сканы, длинные дела, страницы с печатями и документы с нестандартным размером. Для каждого фиксируют точность поиска, размер результата, время и наличие ошибок PDF/A. Настройки, которые дают хороший результат на чистом A4, могут плохо работать на микрофильмах или чертежах.
После запуска контролируют не только число успешно обработанных файлов, но и число страниц, средний коэффициент сжатия, долю документов без текста и содержимое папки Error. Исходники не удаляют до завершения выборочной проверки. Если архив должен сохранить первоначальную структуру, в шаблон назначения включают относительный путь или создают отдельные задания для корневых разделов.
Практический сценарий: разделение пакета счетов по штрихкоду
Сканер формирует один многостраничный TIFF или PDF, где перед каждым счётом находится страница с QR-кодом. Первый шаг читает коды только на предполагаемых разделителях. Split by Barcode начинает новый документ при обнаружении кода, удаляет страницу-разделитель и использует значение в имени. Затем OCR добавляет текст, а Set PDF Properties записывает тип документа и дату партии.
В правилах нужно предусмотреть отсутствующий или нечитаемый код. Пакет не следует делить по следующему случайному штрихкоду внутри счёта. Для этого ограничивают область поиска, тип символики и допустимый формат значения. Документ без ожидаемого кода направляют оператору целиком, а не присваивают ему имя предыдущего счёта.
После разделения проверяют количество полученных документов и сумму страниц с учётом удалённых разделителей. Если исходник содержит 120 страниц и 20 разделителей, итоговые документы должны содержать 100 страниц. Такое простое контрольное правило выявляет потерянные листы и двойные срабатывания раньше, чем файлы попадут в бухгалтерскую систему.
Практический сценарий: конвертация офисных документов в PDF
Входная папка принимает DOCX, XLSX, PPTX, ODT и сообщения. Convert Any File To PDF преобразует поддерживаемые типы, затем Combine PDFs при необходимости собирает комплект. Для Excel заранее решают, печатать ли все листы, как масштабировать широкие таблицы и сохранять ли фон. Для PowerPoint выбирают режим слайдов или раздаточных материалов. Для Word включают закладки по заголовкам, если они нужны в итоговом документе.
Ошибки часто вызваны не самим файлом, а окружением: отсутствует шрифт, приложение показывает окно восстановления, внешняя ссылка недоступна, макрос требует разрешения, документ защищён паролем или служба не имеет профиля пользователя. Тестовый набор должен содержать сложные таблицы, колонтитулы, диаграммы и внедрённые объекты. Результат сравнивают визуально, а не только по факту появления PDF.
Для сценария без установленного Office выбирают GdPicture-конвертацию и отдельно проверяют макет. Если конкретный тип отображается хуже, его можно направлять в другой шаг по расширению. Конфигурация методов сопоставляет расширения способам преобразования; одно расширение не назначают сразу нескольким методам.
Практический сценарий: SharePoint — OCR — SharePoint
Первый шаг SharePoint Download получает новые файлы из входной библиотеки. Затем Get Document Information определяет наличие текстового слоя. PDF без текста проходит OCR, поисковый PDF пропускается или получает только оптимизацию. После проверки PDF/A результат загружается в целевую библиотеку, где сохраняются необходимые поля. Исходный элемент помечается обработанным или перемещается в архивную папку.
Чтобы исключить цикл, входная и выходная библиотеки разделяют или используют устойчивый признак обработки. Имя файла не всегда подходит: пользователь может загрузить новый файл с тем же именем. Надёжнее применять идентификатор элемента, метаданные или отдельный список состояния. При сбое загрузки готовый файл должен остаться в локальной папке повторной отправки.
Права служебной учётной записи тестируют отдельно на чтение, добавление, изменение метаданных и создание папок. Ошибка авторизации может проявляться только на конкретном участке библиотеки с уникальными разрешениями. Журнал должен содержать адрес библиотеки и идентификатор элемента, но не секреты и токены.
Повышение производительности
Производительность измеряют страницами в минуту для конкретного набора документов, а не по размеру файла. Цветная страница с фоном и мелким текстом требует больше времени, чем чистый битональный скан. Смешанный PDF может обрабатываться быстрее при пропуске поисковых страниц. Сжатие MRC и OCR одновременно нагружают процессор, а работа с SharePoint добавляет сетевую задержку.
Первый тест выполняют на одном ядре и локальном SSD. Затем увеличивают число ядер и следят за загрузкой CPU, очередью диска, памятью, скоростью сети и ростом временных каталогов. Если CPU загружен не полностью, ограничение находится в диске, сети, внешнем приложении или одном последовательном этапе. Перенос рабочих папок на быстрый локальный диск часто даёт больше, чем добавление ядер при медленном сетевом хранилище.
Для очень больших PDF важна память на этапе сборки результата. Разделение на части и последующее объединение может снизить пиковое потребление, но усложняет сохранение закладок и метаданных. Threads полезны для документов с большим числом страниц, тогда как параллельная обработка файлов — для множества небольших документов. Эти режимы тестируют отдельно.
Антивирус может сканировать каждый промежуточный TIFF и заметно замедлять поток. Исключения для рабочих каталогов допустимы только после оценки безопасности: входные файлы могут быть недоверенными. Более безопасно исключать строго контролируемые временные папки, сохранять проверку исходного каталога и ограничивать права службы.
Ошибки доступа к файлам и сетевым папкам
Запланированные задания работают от имени учётной записи службы, а Quick Job — от имени текущего пользователя. Поэтому mapped drive вроде Z: часто доступен в тесте и отсутствует у службы. В Job Manager используют UNC-путь, а службе предоставляют права и на сетевой ресурс, и на файловую систему. После изменения пароля обновляют параметры входа службы и перезапускают её.
Если файл занят, сначала выясняют, кто его пишет. Увеличивают Input Delay, проверяют временное расширение и отключают обработку незавершённых загрузок. Повторять открытие бесконечно не следует: повреждённый или постоянно заблокированный файл должен перейти в Error с понятной записью.
Пути длиннее стандартного ограничения вызывают ошибки сканирования, копирования и создания рабочих файлов. Решение — сократить корень общего ресурса и рабочую папку. На новых Windows можно включить поддержку длинных путей в конфигурации и системном параметре LongPathsEnabled, после чего перезагрузить сервер. Совместимость внешних приложений всё равно проверяют: не все компоненты принимают длинные имена.
Ошибки OCR и качества результата
Если текст не появляется, проверяют, что выбран OCR-шаг, а не простая конвертация, и что страница действительно растровая. Затем смотрят язык, DPI, ориентацию и журнал движка. Белая страница может быть результатом неверной бинаризации или повреждённого изображения. Для PDF с прозрачностью полезно сравнить растрирование разными методами.
Если распознавание даёт много ошибок, не следует сразу повышать DPI. Сначала оценивают исходный масштаб, контраст, наклон, шум и выбранные языки. Лишние языки увеличивают неоднозначность. Для таблиц линии можно удалить, но результат проверяют на цифрах. Для точечной матричной печати и факсов лучше настроить отдельный профиль, а не ухудшать параметры для всего архива.
Если размер PDF резко вырос, вероятно, документ был полностью растрирован или сохранён без подходящего сжатия. Проверяют режим пропуска поисковых страниц, параметры JPEG/JBIG2/MRC, разрешение и сохранение исходных изображений. Сначала создают качественный результат, затем отдельным шагом оптимизируют; одновременное изменение многих настроек затрудняет поиск причины.
Ошибки конвертации Office и служебных компонентов
Зависшее преобразование Office обычно связано с диалогом, который не виден в сеансе службы. Нужно войти под служебной учётной записью, открыть приложение, завершить активацию и первичную настройку, закрыть окно восстановления и убедиться, что документ открывается без вопросов. После переустановки компонентов эту процедуру повторяют.
BCL easyPDF используется для части методов. Служба должна быть настроена на корректную учётную запись и иметь доступ к принтерам, профилю и приложениям. Если один формат не конвертируется, проверяют его сопоставление методу в конфигурации. Расширение не должно одновременно находиться в нескольких группах.
Тайм-аут увеличивают только после проверки причины. Если обычный файл обрабатывается за минуту, а один документ висит час, увеличение до двух часов скрывает проблему. Такой файл отправляют в отдельную папку и открывают вручную. Повреждённые вложения, внешние ссылки и макросы лучше исключать или предварительно очищать.
Ошибки службы, лицензии и уведомлений
Если интерфейс не запускает задания, сначала проверяют состояние службы в Monitor, затем права входа и журнал Windows. Недействительный лицензионный ключ блокирует запуск; сведения вводятся в Modules & Options. Ключ может быть привязан к имени сервера, поэтому смена NetBIOS-имени требует согласованной замены.
Перед переустановкой компонентов останавливают службу, закрывают интерфейс и копируют jobdef и jobstatus. После запуска проверяют каждое определение на тестовом файле и до завершения проверки не удаляют резервную копию. Сохранение папок заданий установщиком не заменяет собственный бэкап и проверяемый план восстановления.
Если Test Email проходит, а уведомления не приходят, проверяют условия At least one file was processed, At least one file error occurred и Job Terminated Prematurely. Пустой опрос может не соответствовать выбранному условию. Если тест не проходит, проверяют SMTP-сервер, порт, TLS, учётные данные, адрес отправителя и сетевой доступ. Пароль не должен попадать в журнал Debug.

Совместимость и подготовка среды
Для описанного интерфейса и служебной обработки требуются 64-разрядные Windows 10 или Windows 11 либо Windows Server 2012 R2, 2016, 2019 или 2022. Также необходим .NET Framework 4.7.2, компоненты Visual C++ 2017 x64 и x86 и около 2 ГБ для базовой установки. Рабочий объём диска рассчитывается отдельно по размеру очереди и промежуточных изображений.
Поддерживаемые хранилища включают файловую систему Windows, SharePoint 2013, 2016 и 2019, SharePoint Online, OneDrive for Business, Azure File Storage и Azure Blob Storage. Для SharePoint может потребоваться клиентский SDK. Перед развёртыванием проверяют сетевые правила, прокси, доступ к облачным конечным точкам и возможность службы читать сертификаты.
На виртуальной машине резервируют фиксированные ресурсы и не допускают конкуренции OCR с другими тяжёлыми задачами. Динамическое уменьшение памяти во время обработки приводит к непредсказуемым ошибкам. Снимок виртуальной машины не заменяет согласованную копию рабочих данных, если служба продолжает писать файлы в момент снимка.
Сравнение Aquaforest Autobahn DX с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| Aquaforest Autobahn DX | Многоэтапного серверного OCR, PDF/A, штрихкодов и интеграций с папками, SharePoint и Azure | Требует администрирования службы и подробной настройки заданий |
| ABBYY FineReader Server | Централизованного OCR больших архивов с развитой классификацией и экспортом | Ориентирован на корпоративное развёртывание и специализированную настройку |
| IRISPowerscan | Сканирования, классификации, индексирования и экспорта документов из операторских потоков | Рабочий процесс сильнее связан со сканированием и профилями захвата |
| OCRvision | Простого наблюдения за папками и автоматического добавления текста в PDF | Меньше многошаговых операций, коннекторов и серверной оркестрации |
| FolderMill | Горячих папок для печати и конвертации множества форматов по правилам | Слабее в извлечении данных и сложной маршрутизации |
| Adobe Acrobat Pro | Ручной проверки, OCR и пакетных действий с ограниченным числом PDF | Не предназначен для постоянной серверной очереди и отказоустойчивого потока |
| PDF Commander | Редактирования, объединения, конвертации и защиты отдельных PDF пользователем | Нет серверных наблюдаемых папок и многоэтапных заданий |
Для непрерывного потока со сложной маршрутизацией, PDF/A, штрихкодами и подключением к корпоративным хранилищам подходит Aquaforest Autobahn DX. ABBYY FineReader Server выбирают, когда центральное место занимает высокоточный OCR и классификация больших архивов. IRISPowerscan удобен в проектах, где документы поступают через сканирующие станции и требуют операторского контроля. OCRvision проще для базовой задачи папка со сканами — папка с searchable PDF. FolderMill полезен, когда кроме OCR важны автоматическая печать и универсальная конвертация. Acrobat Pro и PDF Commander лучше применять для ручной работы с отдельными документами, а не для круглосуточной очереди.
Как спроектировать надёжное задание
Сначала формулируют измеримый результат: поисковый PDF, PDF/A определённого профиля, отдельные файлы по штрихкоду, извлечённый JSON или оптимизированная копия. Затем создают минимальную схему из одного шага и проверяют её на небольшой выборке. Каждый следующий шаг добавляют только после сохранения контрольных результатов предыдущего.
Папки In, Out, Archive, Error, Log и Work разделяют физически или логически. Службе дают запись только туда, где она необходима. Имена результатов делают детерминированными и уникальными. Условия ошибки настраивают так, чтобы один повреждённый файл не останавливал всю очередь, но системная ошибка не оставалась незаметной.
Для каждого потока документируют выбранные языки, DPI, сжатие, профиль PDF/A, шаблон имени, расписание, размер партии, число ядер, срок хранения исходников и ответственного за папку Error. Изменение параметров выполняют через копию задания и тестовую папку. После подтверждения копию переводят на рабочие пути, а предыдущую схему сохраняют для отката.
Контроль включает счётчики входных и выходных документов, страницы, ошибки, среднее время, размер и долю поисковых страниц. Журналы хранят достаточно долго для расследования, но очищают по политике, чтобы они не заполняли системный диск. Уведомления направляют не только администратору, но и владельцу процесса, который понимает значение пропущенного документа.
Что проверить перед массовым запуском
- Служебная учётная запись читает источник и записывает результат, архив, журнал и папку ошибок.
- Сетевые пути указаны как UNC и не зависят от подключённых дисков пользователя.
- Файл не захватывается до завершения копирования; настроен Input Delay или временное расширение.
- Шаблон имени остаётся уникальным для одинаковых файлов из разных подпапок.
- Исходники сохраняются до проверки качества и полноты миграции.
- Языки OCR ограничены реальным набором, а предварительная обработка проверена на печатях и цифрах.
- Подписанные PDF отделяются до любого изменения.
- PDF/A валидируется после последнего изменяющего шага.
- Debug отключён после диагностики и временные каталоги очищаются.
- Уведомления различают файловую ошибку, пустой запуск и аварийное завершение.
- Число ядер увеличено только после измерения диска, памяти и сети.
- Папка Error регулярно разбирается, а повторный запуск не создаёт дубликаты.
После этой проверки выполняют пилот на ограниченной партии, сравнивают входные и выходные документы и только затем открывают постоянный поток. Главный критерий готовности — не отсутствие красных строк в интерфейсе, а воспроизводимый результат: каждый вход либо превращается в проверенный выход, либо попадает в диагностируемую очередь ошибок без потери исходника.
Контроль качества с помощью сведений о документе
Шаг Get Document Information позволяет строить проверку не на субъективном впечатлении, а на измеримых характеристиках. Он получает общее число страниц, число страниц с поисковым текстом, число графических страниц и другие сведения, которые доступны для выбранного PDF. Результаты используют для отчёта или решения, нужно ли направлять документ в OCR. Например, файл с двадцатью поисковыми страницами из двадцати можно передать прямо к оптимизации, а файл с тремя поисковыми страницами из двадцати — обработать в режиме пропуска уже распознанных страниц.
Контроль до и после преобразования помогает обнаружить потерю страниц. Если исходный TIFF содержит 84 страницы, а готовый PDF — 83, задание не должно считаться успешно завершённым только потому, что файл создан. Разницу записывают в отчёт и направляют результат в карантин. Для объединения нескольких входов ожидаемое число страниц вычисляют как сумму, а для разделения — как сумму всех частей с учётом удалённых разделителей.
Pattern Enumeration дополняет технические счётчики содержательной проверкой. Можно посчитать номер дела, обязательную фразу, маску даты или другой устойчивый признак. Нулевое число совпадений не всегда означает ошибку OCR, но помогает выделить подозрительную группу. Контрольный шаблон не должен включать персональные данные в открытом журнале: достаточно записать факт совпадения и идентификатор файла.
Отчёт качества целесообразно формировать в CSV с именем входа, временем, числом страниц, поисковыми страницами, размером до и после, статусом PDF/A, количеством найденных штрихкодов и причиной ошибки. Такой файл можно анализировать независимо от интерфейса и сравнивать между партиями. Резкое изменение среднего времени или коэффициента сжатия часто указывает на новую разновидность входных документов или случайную смену параметров.
Имена файлов, журналы и выходные триггеры
Шаблоны имён должны быть понятны человеку и устойчивы для автоматической системы. Переменная исходного имени сохраняет связь с документом, но не гарантирует уникальность. Дата и время запуска также не всегда достаточны при параллельной обработке. Практичный шаблон сочетает исходное имя, идентификатор задания или партии и номер части. Значения штрихкода очищают от обратной косой черты, двоеточия, вопросительного знака и других недопустимых символов.
Имя не должно приближаться к пределу длины пути. Designer добавляет собственные рабочие каталоги, поэтому короткое имя в источнике может стать длинным во временной папке. Лучше ограничить пользовательскую часть и разместить Work ближе к корню диска. Если относительная структура важна, её сохраняют каталогами, а не переносят весь путь в имя файла.
Обычный журнал нужен для расследования, CSV — для агрегации, а каталог Errors — для повторной обработки. Эти три источника не заменяют друг друга. В сообщении об ошибке должны присутствовать исходный путь, шаг и код результата, но не пароль, токен или содержимое конфиденциального поля. Период хранения журналов устанавливают по требованиям аудита и доступному месту.
Конфигурация поддерживает выходной trigger file, который копируется в целевую папку после успешного завершения и переноса результатов. Внешняя система может ждать этот файл вместо постоянного сканирования всех документов. Имя триггера связывают с идентификатором задания или партии. Он должен появляться только после полной успешной публикации; при частичных ошибках лучше создавать отдельный отчёт, а не тот же признак готовности.
Резервное копирование и сопровождение заданий
Основная логика хранится в каталоге jobdef, состояния запусков — в jobstatus, общие настройки — в конфигурационных файлах. Перед переустановкой, переносом или массовым изменением копируют эти каталоги вместе с пользовательскими скриптами. Резервная копия должна включать документацию по служебной учётной записи, сетевым путям, SMTP и внешним соединениям, но секреты хранят отдельно в защищённой системе.
Определения XML удобно помещать в репозиторий изменений. Изменение одного свойства видно как разница строк, а возврат не требует ручного воспоминания прежних значений. Для каждого рабочего задания создают тестовую копию с отдельными папками и отключённой публикацией во внешнюю библиотеку. После проверки изменённый XML переносится контролируемо, а не редактируется одновременно несколькими администраторами.
Рабочие и временные каталоги очищают по расписанию, учитывая активные задания. Нельзя удалять Work во время выполнения: следующий шаг может ожидать промежуточный файл. Папку Errors не очищают автоматически без регистрации решения. Каждый файл должен получить один из исходов: исправлен и повторно обработан, признан неподдерживаемым, возвращён владельцу или сохранён как исключение.
Проверка резервного узла или восстановление из копии проводится заранее. Недостаточно убедиться, что XML открывается: нужно выполнить тестовый файл, получить журнал, создать PDF и загрузить его в назначение. Шрифты, Office, сертификаты, клиентские компоненты SharePoint и права службы должны совпадать с рабочей средой настолько, насколько это требуется конкретным шагам.
Большие, повреждённые и нестандартные документы
Очень большой PDF обрабатывают сначала в изолированной папке. Проверяют структуру, число страниц, наличие вложений, шифрования и подписей. Если документ открывается медленно, увеличивают тайм-аут только для соответствующего профиля, а не для всех заданий. При нехватке памяти используют разделение, последовательную обработку частей и финальное объединение, контролируя закладки и порядок страниц.
Повреждённый PDF может частично отображаться в просмотрщике и при этом не разбираться библиотекой. Такой файл не следует бесконечно повторять. Его копируют в Error, сохраняют точный текст исключения и пробуют восстановить специализированным инструментом вне основного потока. После восстановления документ возвращают с новым именем или отметкой, чтобы отличить его от первоначального повреждённого файла.
Нестандартный размер страницы, поворот на отдельной странице, прозрачность, слои и вложенные шрифты требуют выборочного визуального контроля. Автоповорот применяют к сканам, но не к чертежам, где вертикальная надпись может быть нормой. Уменьшение изображения не включают для схем с мелкими обозначениями. Для документов с картами или фотографиями создают отдельный профиль с мягким сжатием.
Если один тип входа регулярно вызывает ошибки, его выделяют по расширению, имени, папке или предварительной характеристике. Отдельное задание проще настроить и наблюдать, чем множество исключений в общей схеме. Массовый поток должен оставаться предсказуемым: редкие сложные документы лучше направлять в специальную очередь, не задерживая тысячи стандартных страниц.
Итоговый подход к работе
Aquaforest Autobahn DX раскрывает свои возможности, когда задача оформлена как последовательность контролируемых шагов. Quick Job помогает подобрать параметры, Designer связывает операции, Job Manager хранит и запускает задания, Monitor показывает состояние, а журналы объясняют результат каждого файла. Отдельные инструменты решают OCR, конвертацию, PDF/A, сжатие, штрихкоды, извлечение данных, скрытие информации и передачу документов во внешние хранилища.
Надёжность зависит от среды не меньше, чем от параметров документа. Правильная служебная учётная запись, короткие и доступные пути, отдельные рабочие каталоги, достаточный диск, проверенные языки, разумный размер партии и понятная обработка ошибок предотвращают большинство сбоев. Многоядерность и распределение нагрузки подключают после того, как один поток работает предсказуемо.
Для архива следует сохранять исходники, проверять PDF/A после всех изменений и отделять подписанные документы. Для входящих пакетов нужно валидировать штрихкоды и шаблоны имён. Для Office-конвертации требуется подготовленный профиль приложения. Для облачного OCR и внешних коннекторов дополнительно оценивают безопасность учётных данных и передачу содержимого. Такой порядок позволяет превратить разрозненные файлы в управляемый процесс с наблюдаемыми результатами и понятным восстановлением после ошибки.