Laserfiche Quick Fields помогает принимать большие партии сканов и электронных файлов, разделять поток на документы, распознавать текст и штрихкоды, извлекать реквизиты из заданных зон, проверять значения по правилам и базам данных, а затем присваивать имена, поля и папки перед сохранением в репозиторий Laserfiche. Основная работа строится вокруг сессии: администратор задаёт источник, классы документов, последовательность OCR, очистки изображений, идентификации страниц и заполнения метаданных, а оператор просматривает результат, исправляет сомнительные поля и отправляет подготовленные документы на хранение.
Рабочее окно разделено на связанные панели. Слева дерево Session Configuration показывает этапы обработки и порядок процессов, в центре Display Pane выводит образец или выбранную страницу, снизу Processing Information и дополнительные вкладки сообщают об ошибках, предупреждениях и выполненных действиях, справа Tasks Pane меняется в зависимости от выбранного узла. После сканирования Document Revision группирует созданные документы по будущим папкам, а панель миниатюр позволяет проверить состав, переставить страницы и отделить ошибочно объединённые листы.
Типовой маршрут начинается с выбора источника, затем каждая страница проходит предварительную обработку, идентификацию начала документа, назначение класса, обработку страниц, определение конца и завершающие действия. Внутри этих этапов можно сочетать зоны OCR, чтение штрихкодов, регулярные выражения, поиск по внешней базе, преобразование токенов, очистку изображения и аннотации. Результат зависит не только от настроек отдельных операций, но и от их порядка: например, удаление шума перед распознаванием повышает точность, а постоянный штамп до OCR становится частью распознанного текста.
Скачать Laserfiche Quick Fields
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Только Windows
- Нужен репозиторий Laserfiche
- Часть процессов — add-on
Как устроена сессия и почему порядок операций важен
Сессия хранит не сами исходные документы, а схему их приёма и обработки. В дереве конфигурации видны общие этапы и один или несколько классов документов. Каждый процесс выполняется сверху вниз в пределах своего этапа, поэтому перемещение узла мышью или командами вырезания и вставки меняет результат. Если сначала распознать текст на загрязнённой странице, а затем удалить точки, OCR уже не воспользуется очищенным изображением. Если поставить Despeckle перед Zone OCR, распознавание получит страницу без мелкого шума. Аналогично, Color Removal можно прикрепить как локальное улучшение к конкретной зоне, чтобы улучшить чтение цветного бланка, но сохранить цвет в итоговом документе.
Предварительная обработка применяется до распределения страниц по классам. Здесь удобно выполнять операции, одинаковые для всего входящего потока: выравнивать наклон, удалять случайные точки, извлекать общие маркеры, читать штрихкод-разделитель или получать токен, который ускорит последующую классификацию. Затем этап Classification сопоставляет страницу с условиями классов. Внутри класса First Page Identification решает, является ли лист началом нового документа. Page Processing обрабатывает назначенные страницы, Last Page Identification определяет завершение пакета, а Post-Processing выполняет действия после формирования документа или непосредственно перед отправкой в репозиторий.
В Page Processing каждой операции задаётся диапазон страниц: все листы, конкретные номера или комбинации вроде первой страницы и диапазона с третьей по пятую. Это позволяет распознавать шапку только на первом листе, собирать подписи со всех страниц, а штамп наносить лишь на последнюю. В Post-Processing можно отложить ресурсоёмкую операцию до момента сохранения, если от её результата не зависят классификация и ручная проверка. Такой перенос сокращает время, в течение которого оператор ждёт появления документа в Revision, но требует аккуратно проверить, что поздний процесс не должен заполнять поле, используемое до отправки.

Стартовая страница, открытие и перенос сессий
На Start Page отображаются недавно открывавшиеся сессии, их расположение и время изменения. Отсюда можно открыть файл с расширением QFX на компьютере, подключиться к опубликованной сессии на Quick Fields Server, создать пустую конфигурацию или запустить мастер. Для переноса между компьютерами предусмотрен импорт экспортированного файла QEX. Разница между QFX и QEX важна при администрировании: QFX является рабочей сессией, а QEX используется как переносимый экспорт, который импортируется в новую среду.
Мастер предлагает три уровня детализации. Quick Wizard запрашивает минимум параметров, Standard Wizard проводит через основные решения, Full Wizard подходит, когда нужно сразу определить больше свойств. После создания отсутствующие настройки всё равно можно изменить в дереве и Tasks Pane. Практически полезно сначала собрать короткий тестовый вариант на десяти-пятнадцати типичных документах, затем экспортировать его как контрольную копию и только после этого добавлять сложные условия, базы данных и сценарии.
При открытии опубликованной сессии следует учитывать права. Если учётная запись не может создавать документы в выбранной папке, назначать шаблон, записывать поле или публиковать класс, соответствующие действия завершаются ошибкой либо недоступны. Для диагностики полезно сравнить права учётной записи, под которой сессию проектировали, с правами оператора и служебной учётной записи Agent. Особенно часто расхождение проявляется, когда интерактивный запуск проходит успешно, а запланированный не видит сетевую папку или не может войти в репозиторий.


Выбор источника документов
В Standard Wizard доступны Universal Capture, ScanConnect, TWAIN, WIA Scan Engine и Laserfiche Capture Engine. Universal Capture забирает файлы из локальной или сетевой папки. TWAIN и WIA работают с совместимыми сканерами через стандартные интерфейсы Windows. ScanConnect предназначен для поддерживаемого сканирующего оборудования и расширенных параметров захвата. Laserfiche Capture Engine получает уже существующие документы из репозитория, что удобно для повторной классификации, миграции полей, массового OCR или исправления структуры.
Источник следует выбирать по реальному месту возникновения документов. Для папки, куда МФУ складывает PDF и TIFF, проще использовать Universal Capture и настроить фильтр расширений. Для рабочего места оператора с потоковым сканером важны TWAIN или ScanConnect, потому что они дают доступ к параметрам подачи, разрешения и двустороннего режима. Capture Engine оправдан, когда изображения уже находятся в Laserfiche и физического сканирования нет. Смешивание задач в одной сессии усложняет контроль: для разных каналов обычно лучше создавать отдельные конфигурации, но направлять их в общую структуру папок и шаблонов.
В мастере подключения к репозиторию указываются сервер, репозиторий, защищённое соединение и способ аутентификации. Можно использовать учётные данные Windows либо учётную запись Laserfiche. Проверка Validate должна пройти до перехода дальше. У пользователя должны быть права на все операции, которые позже выполнит сессия: создание папок и документов, назначение шаблона, запись полей, аннотаций и тегов, а при обработке существующих объектов — чтение исходных страниц и метаданных.

Universal Capture: папки, расширения и очередь
Universal Capture следит за указанным каталогом и извлекает подходящие файлы. В стандартном списке присутствуют BMP, JPG и TIF, но через Manage File Type Lists можно создать собственные наборы, например только PDF или комбинацию офисных форматов. Маска вводится в виде *.расширение; несколько типов разделяются точкой с запятой. Маска *.* забирает всё, однако в производственной папке она рискованна: временный файл, служебный журнал или неподдерживаемый контейнер попадёт в очередь и создаст лишнюю ошибку.
Параметр Keep each file as a separate document сохраняет границы исходных файлов. Он полезен, если каждый PDF или TIFF уже соответствует одному документу. Если флажок снят, границы определяются правилами First Page Identification, Last Page Identification и длиной документа. Для входящего пакета, где один многостраничный TIFF содержит десятки заявлений, второй вариант необходим; для каталога с отдельными счетами он лишь добавит риск ошибочного объединения.
В разделе Retrieval Limits задаётся поведение, когда новых файлов нет, и максимальное число объектов в очереди. Можно остановить сканирование сразу, подождать заданное число секунд или продолжать наблюдение. Ограничение очереди защищает временный диск: Universal Capture копирует файлы во временную область, при достижении порога приостанавливает копирование и возобновляет его после уменьшения очереди. Это особенно важно для больших PDF и ночных заданий OCR, где скорость поступления выше скорости распознавания.
После обработки исходный файл можно оставить на месте, удалить или переместить в другой каталог. Безопасная схема для первых запусков — переносить в папку Processed, сохраняя структуру подкаталогов, и отдельно направлять проблемные файлы на разбор. Удаление стоит включать только после проверки резервного копирования и уверенности, что сессия не создаёт дубликаты и корректно сохраняет все страницы. Если источник сетевой, служебная учётная запись должна иметь права не только чтения, но и удаления либо перемещения.



Обработка PDF и электронных файлов
Для PDF Universal Capture может создавать изображения страниц, извлекать текст, получать значения полей PDF-форм, сохранять исходный PDF после генерации страниц и преобразовывать PDF-аннотации в аннотации Laserfiche. Генерация изображений нужна процессам, которые работают с пикселями: зонам OCR, очистке, распознаванию штрихкодов на графике, выделению областей и постоянным штампам. Если PDF уже содержит качественный текстовый слой, его извлечение быстрее повторного OCR и сохраняет символы точнее.
При создании изображений можно переводить страницы в чёрно-белый режим и масштабировать их до заданного DPI. Повышение DPI помогает мелкому тексту, но увеличивает размер временных и итоговых страниц. Чёрно-белый режим полезен для деловых форм с контрастным текстом, однако может уничтожить цветовые различия, светлые печати и отметки. Перед массовым запуском следует протестировать минимум три группы: чистые цифровые PDF, цветные сканы и низкоконтрастные копии.
Флажок Keep PDF after using it to generate Laserfiche pages позволяет сохранить электронный файл вместе с созданными страницами, но он доступен не во всех сценариях разделения. Если один исходный PDF разрезается на несколько документов произвольной длины, исходный контейнер нельзя корректно прикрепить к каждому фрагменту. Аналогичное ограничение возникает при смешении разных электронных типов в одном создаваемом документе. Поэтому заранее решите, что важнее: сохранить исходный файл целиком или автоматически разбить его на отдельные записи.
Значения интерактивных полей PDF могут быть добавлены к извлечённому тексту. По умолчанию они располагаются в текстовом представлении отдельно от визуальной позиции. Если для классификации важна координата значения на форме, надёжнее сгенерировать изображение и распознать область. При генерации страниц значения полей формы встраиваются в изображение, поэтому оператор увидит их и после сохранения. Аннотации PDF можно преобразовать в нативные аннотации Laserfiche, что сохраняет возможность работать с ними в репозитории.
Классы документов и границы пакетов
Класс документа объединяет страницы, которые должны обрабатываться одинаково: например, счета поставщиков, заявления, договоры или сопроводительные письма. Для класса задаются условия первого и последнего листа, операции над страницами, метаданные и конечная папка. Базовая конфигурация поддерживает один класс в сессии; несколько классов требуют функции Document Classification. Это ограничение важно учитывать при проектировании: без дополнения разные типы проще разводить по отдельным входным папкам и сессиям.
First Page Identification сравнивает каждую входящую страницу с условиями классов в порядке их расположения. Если лист соответствует первому классу, к следующим классам он уже не проверяется. Поэтому широкое условие вроде наличия слова Invoice должно стоять после более точных условий для конкретных разновидностей счетов, иначе оно перехватит поток. Страница, не совпавшая ни с одним условием, при стандартной логике присоединяется к последнему созданному документу, если другие настройки длины не задают иное поведение.
Условие может опираться на результат Barcode, Zone OCR, Text Identification, Form Identification и другие процессы, доступные на этапе. Оно строится как сравнение токена с текстом, числом или шаблоном: равно, не равно, начинается с, содержит, больше или меньше. Для устойчивости используйте признаки, которые действительно находятся на каждом первом листе, а не только на большинстве. Если шапка иногда отсутствует, комбинируйте два независимых признака или предусмотрите отдельную обработку неопознанных страниц.
Last Page Identification полезен, когда окончание документа отмечено подписью, штрихкодом, фразой или специальным листом. Границы можно также задавать фиксированной длиной либо сохранять границы исходных файлов при Universal Capture и Capture Engine. Эти механизмы взаимодействуют: фиксированная длина способна завершить документ раньше условия последнего листа, а сохранение каждого файла отдельным документом делает часть правил лишней. Перед внедрением нарисуйте ожидаемый поток страниц и проверьте несколько комбинаций отсутствующих и лишних листов.
OCR всей страницы и OCR по зонам
OmniPage OCR создаёт текст для всей страницы и связывает его с документом. Такой текст можно искать в репозитории и использовать последующими процессами. OmniPage Zone OCR читает только заданные области и возвращает результат в токен; сам по себе он не создаёт полный текстовый слой. Зонный подход быстрее и точнее для стабильных форм, где номер, дата или фамилия находятся в известном месте, а полнотекстовый OCR лучше для архивов и документов со свободной компоновкой.
При настройке зоны выбираются диапазон страниц, координаты, единицы измерения, язык, приоритет скорости или точности и ориентация текста. Координаты можно задавать пикселями или процентами. Проценты удобны, если страницы приходят с одинаковыми пропорциями, но разным разрешением. На форматах разной высоты, например Letter и Legal, процентная зона сместится относительно реального поля. Пиксельные координаты требуют стабильного DPI. Поэтому один набор образцов должен включать все реальные размеры страниц.
Параметр Use existing text сначала пытается взять уже связанный текст, включая текст, извлечённый из PDF или полученный Capture Engine, и лишь при его отсутствии запускает OCR. Это экономит время на цифровых PDF. Single line ограничивает результат первой строкой; при отключении можно вернуть все строки. Create multi-value token превращает строки в отдельные значения для многострочного поля, что удобно для перечня кодов, участников или позиций, если каждая запись расположена на новой строке.
Уровень Confidence задаётся от 1 до 100, а ноль отключает проверку. Метод может оценивать минимум, медиану, среднее или среднее без выбросов по символам зоны. При недостижении порога Quick Fields способен очистить значение или оставить распознанный текст, но отметить поле для проверки. Для критичных идентификаторов лучше сохранять сомнительный результат и помечать его: оператор видит возможный вариант и сверяет с изображением, тогда как пустое поле иногда скрывает причину ошибки.
Character preference помогает различать похожие символы. Для всей зоны можно предпочесть буквы или цифры, а в Custom Character Preference задать позиционный шаблон: @ означает букву, # — цифру, ! — знак пунктуации, точка — отсутствие предпочтения. Так дата формата 08/01/2026 описывается последовательностью цифр и разделителей, а код из двух букв и пяти цифр — двумя @ и пятью #. Это не заменяет валидацию регулярным выражением, но уменьшает ошибки I/1, O/0 и S/5.
Штрихкоды как разделители и источники данных
Процесс Barcode можно разместить до классификации, в идентификации первой или последней страницы, в обработке страниц и после формирования документа. Прочитанное значение становится токеном, который используется в имени, поле, пути или запросе к базе. Наиболее надёжный сценарий — лист-разделитель с кодом типа документа и идентификатором дела. Он одновременно создаёт границу, выбирает класс и даёт ключ для заполнения метаданных.
В настройках можно ограничить область поиска, ориентацию, минимальную длину и допустимые типы. Интерфейс предлагает Code 39, Code 128, Codabar, UPC-A, UPC-E, Code 93, Interleaved 2 of 5, EAN 8, EAN 13, PDF417, Data Matrix и QR Code. Чем меньше типов и направлений включено, тем быстрее и стабильнее распознавание. Если все этикетки горизонтальны и используют Code 128, не оставляйте вертикальный поиск и остальные форматы на всякий случай.
Зона штрихкода на постоянном месте снижает вероятность принять случайный графический элемент за код. Для нестабильной подачи задавайте область с запасом, но не всю страницу. Checksum следует включать, когда выбранный стандарт и данные его используют: контрольная сумма отсекает часть ложных чтений. Convert to ASCII нужен, когда содержимое должно переводиться в читаемую строку. После чтения обязательно применяйте Pattern Matching или Lookup, чтобы убедиться, что значение соответствует длине и реально существует в учётной системе.
Токены, имена документов и динамические папки
Токен — подстановка, которая при обработке заменяется реальным значением. Токены создают источники, OCR, штрихкоды, даты, поля, пути и специальные процессы. В имени документа можно сочетать статический текст и токены, например тип, номер и дату. В пути токен даты автоматически создаёт иерархию по годам и месяцам, а токен подразделения направляет документы в разные ветви. Если два документа получают одинаковое имя, репозиторий добавляет суффикс, но лучше заранее формировать уникальную комбинацию.
Token Editor позволяет форматировать даты, числа и строки, выбирать элемент многострочного результата и применять регулярное выражение. Региональные параметры даты и валюты берутся из настроек Windows на компьютере, где выполняется сессия. Это критично для Agent: интерактивный тест под одной учётной записью может давать формат день-месяц, а служба под другой — месяц-день. Для имени папки задавайте явный формат года, месяца и дня, не полагаясь на системный короткий формат.
Pattern Matching извлекает часть значения, соответствующую регулярному выражению, а Substitution заменяет найденные фрагменты. Так из строки Invoice No: AB-001245 можно получить только AB-001245, убрать пробелы или привести разделители к единому виду. Поля допускают собственные constraints, которые не позволяют оператору сохранить значение в неподходящем формате. Правило извлечения и ограничение поля решают разные задачи: первое получает данные, второе не пропускает неверный результат.
Token Accumulator собирает значения одного или нескольких токенов по диапазону страниц и создаёт многострочный токен. Это полезно для многостраничного документа, где на каждом листе указан один согласующий, номер позиции или код приложения. После обработки собранный список записывается в multi-value field. Следует исключать пустые и повторяющиеся значения настройками процесса либо последующим скриптом, иначе поле накопит ненужные элементы.
Настройка шаблонов и полей
В Configure Fields администратор выбирает шаблон, добавляет доступные поля, меняет их порядок и состояние. Поле можно сделать видимым, скрытым, только для чтения или обязательным. Эти изменения относятся к конкретной сессии и не переписывают определение шаблона в репозитории. Поэтому поле, скрытое для оператора Quick Fields, остаётся доступным пользователям Laserfiche после сохранения документа.
Required полезен для реквизитов, без которых документ нельзя отправлять дальше. Read-only защищает значение, вычисленное процессом или полученное из базы. Hidden убирает технические поля из рабочего экрана. При проектировании не стоит делать обязательными все поля: оператор будет вынужден вводить фиктивные данные на исключениях. Лучше выделить небольшой набор критичных реквизитов, а остальные проверять условными правилами или отдельным контролем качества.
Field Constraint использует регулярное выражение и собственное сообщение об ошибке. Для идентификатора из двух букв и пяти цифр правило должно требовать именно такую структуру, а сообщение объяснять допустимый формат. Ограничение срабатывает при ручной правке и помогает обнаружить OCR-ошибку до отправки. Оно не проверяет существование записи в базе; для этого служит Lookup или Field Verification.
Zoom Field связывает поле с областью изображения. Когда оператор ставит курсор в поле, Display Pane переходит на заданную страницу и увеличивает нужный фрагмент. Можно выбрать текущую или конкретную страницу, процент заполнения панели, цвет подсветки и координаты области. Функция работает с изображёнными документами и особенно ускоряет проверку номера, даты и подписи, потому что оператору не приходится каждый раз искать реквизит вручную.

Проверка данных по внешним базам
Field Lookup в Real-Time Processes сопоставляет одно или несколько значений с колонками внешней базы и возвращает данные из первой подходящей строки. Источник настраивается через Windows ODBC, расширенный или экспертный режим. Входами могут быть поля и токены, а результатами — значения других полей. Процесс запускается при изменении поля, по клавише или после обработки документа. Это позволяет оператору исправить ключ и сразу получить обновлённые реквизиты.
Надёжный запрос должен возвращать одну строку. Если номер клиента не уникален, добавьте второй вход, например подразделение или дату. В мастере можно выбрать таблицу и колонки либо написать собственный SQL-запрос. Кнопка Test показывает число результатов и ошибки до запуска партии. Не включайте в запрос строку, которую оператор может произвольно изменить без ограничения: сначала проверьте формат поля, затем выполняйте поиск.
На этапе Results каждому полю назначается статическое значение, токен входного документа или колонка результата. Следует явно решить, перезаписывать ли уже заполненное поле. Если оператор вручную уточнил название, автоматический повторный запуск не должен возвращать устаревшее значение. Триггер When a field changes удобен для интерактивной проверки, а When the document is processed — для автоматической партии, где все входные токены готовы к моменту запроса.
Field Verification не заполняет данные, а сравнивает поля с базой. При несовпадении значение можно отметить или очистить в соответствии с настройкой. Этот процесс подходит для проверки номера договора, кода поставщика и связки реквизитов. Реальный контроль лучше строить в два слоя: Lookup заполняет известные атрибуты по ключу, Verification подтверждает, что уже распознанные данные соответствуют учётной записи.






Очистка изображений и влияние на точность
Image Enhancements работают с изображёнными страницами и с изображениями, созданными из PDF; к электронному файлу без сгенерированных страниц они не применяются. Улучшение можно сделать постоянным, чтобы изменённая страница сохранилась, либо локальным для конкретного процесса. Локальный вариант предпочтителен, когда цвет или исходный вид нужно сохранить, а OCR требуется временно дать контрастную чёрно-белую копию.
Despeckle удаляет небольшие точки и случайные пиксели. Размер следует выбирать осторожно: слишком агрессивное значение может убрать точки над буквами, десятичные разделители и тонкие элементы штрихкода. Deskew исправляет наклон, Line Removal удаляет линии бланка, Color Removal убирает выбранные цвета, Smooth расширяет, сжимает или сглаживает формы на бинарном изображении. Smooth полезен для рваных матричных символов, но выдаёт ошибку, если страница не приведена к двухцветному виду; перед ним добавляют Color Removal или другое преобразование в бинарное изображение.
Порядок улучшений имеет смысл. Color Removal и Invert обычно выполняются до Despeckle, чтобы шум оценивался уже на целевом фоне. Despeckle перед Smooth уменьшает число лишних объектов и ускоряет сглаживание. Line Removal перед OCR помогает формам, где линии пересекают символы, но неверные размеры линии способны удалить части букв. Каждое изменение проверяйте на копиях самых плохих и самых хороших сканов: настройка, спасавшая факс, может повредить чистый оригинал.
Улучшения в First Page Identification и Last Page Identification применяются временно только для распознавания границ. Чтобы очищенная страница сохранилась, повторите процесс в Pre-Classification, Page Processing или Post-Processing в постоянном режиме. Дублирование допустимо, если первое применение локальное для классификации, а второе формирует итоговый вид. Не следует дважды применять агрессивную очистку к одной и той же странице без необходимости.
Аннотации, постоянные штампы и нумерация Bates
Fixed Annotation добавляет в заданную область аннотацию Laserfiche: выделение, редакцию, штамп, заметку или текстовый блок. Такая аннотация остаётся отдельным объектом с привычными свойствами репозитория. Auto-Annotation ищет текст по шаблону и аннотирует совпадения; для неё нужен связанный текст, полученный OCR, PDF extraction или Capture Engine. Это позволяет автоматически подсвечивать договорные слова, номера или персональные данные.
Permanent Stamp встраивает текст или изображение непосредственно в пиксели. После применения его нельзя скрыть при просмотре, печати или экспорте. Если штамп поставлен до OCR, его текст также распознаётся и становится доступен для поиска. Поэтому служебную отметку, которую не следует включать в поисковый слой, наносите после OCR. Для неизменяемой отметки оператора, даты или статуса этот процесс подходит лучше обычной аннотации.
Bates Numbering создаёт последовательные номера для документов или страниц и выдаёт токен. Его можно записать в поле, включить в имя или передать Permanent Stamp. В юридическом архиве часто требуется одновременно сохранить номер как метаданные и нанести его на изображение. Сначала генерируется номер, затем токен используется в штампе. Нужно заранее определить область нумерации, начальное значение, разрядность и правила перехода между пакетами, чтобы повторный запуск не создал пересечения.
При любом постоянном изменении держите неизменяемую копию исходника или сохраняйте электронный PDF вместе со страницами, если сценарий это допускает. Ошибка координат штампа на тысячах листов исправляется значительно сложнее, чем неверная аннотация. Перед производственным запуском сформируйте тестовый документ, экспортируйте его из репозитория и убедитесь, что отметка видна, не закрывает реквизиты и имеет ожидаемый масштаб.
Ручная проверка в Document Revision
После обработки документы появляются в Document Revision, если сессия не настроена на немедленную отправку. Дерево показывает будущую папку и имя, Display Pane — выбранную страницу, Tasks Pane — метаданные, а Thumbnails — состав документа. Оператор может изменить имя и поля, переставить листы, отделить страницу в новый документ, объединить неверно разделённые части, удалить лишний лист и повторно запустить процесс.
Проверку удобно организовать от ошибок к предупреждениям. Кнопки перехода к предыдущему или следующему документу с ошибкой сокращают просмотр большой партии. Обязательное поле, нарушенное constraint, отсутствие папки или неуспешный Lookup должны блокировать отправку либо явно попадать в очередь исключений. Предупреждение о низкой уверенности OCR не всегда означает ошибку, но требует сравнить поле с зоной изображения.
Zoom Fields превращают проверку в последовательный ввод: оператор нажимает Tab, курсор переходит к следующему полю, а изображение автоматически увеличивает соответствующую область. Порядок полей в Configure Fields должен совпадать с естественным маршрутом по документу. Если дата находится сверху, номер справа, а сумма внизу, расположите поля именно в таком порядке. Это сокращает движения мышью и снижает риск сверить значение с неправильной строкой.
Processing Information показывает ошибки, предупреждения и сообщения по выполненным процессам. Output Pane даёт более подробный журнал и может экспортироваться в текстовый файл. Application Errors Pane открывается через меню View или F12 и содержит технические ошибки сканирования. При обращении в поддержку полезно сохранить журнал, имя сессии, проблемный образец, точный этап и сведения о том, воспроизводится ли ошибка при ручном тесте процесса.
Автоматический запуск через Quick Fields Agent
Quick Fields Agent выполняет запланированные сессии без оператора. Он устанавливается на том же компьютере, где доступна Quick Fields, и работает под служебной учётной записью. Для сетевых каталогов эта учётная запись должна быть доменной и иметь права на чтение, перемещение и удаление исходников. Если сессия использует Windows Authentication для репозитория, служба также должна запускаться от пользователя, которому разрешены нужные действия.
Перед публикацией автоматической сессии выполните её вручную под максимально похожими условиями: тем же источником, той же учётной записью и теми же путями. Локальная буква диска, видимая интерактивному пользователю, может отсутствовать у службы; используйте UNC-путь. Убедитесь, что временный каталог имеет достаточный объём, а очередь ограничена. Для ночной обработки задайте понятную политику повторов и отдельную папку для файлов, которые не удалось разобрать.
Немедленная отправка документов уменьшает объём Revision, но исключает ручную проверку. Для стабильных бланков с жёсткой валидацией это приемлемо. Для разнородных архивов лучше сначала хранить результаты в очереди проверки или направлять только документы без ошибок, а исключения оставлять оператору. Внешняя база и репозиторий должны быть доступны в момент запуска; временный сетевой сбой не должен приводить к удалению исходника.
Скрипты на VB.NET и C#
Script Editor позволяет добавить код VB.NET или C# к событиям сессии. Доступны события создания страницы, создания документа, идентификации, завершения обработки страницы или документа, момента перед сохранением и после сохранения. Скрипт принадлежит конкретной сессии. Он подходит для логики, которую нельзя выразить стандартными процессами: сложного преобразования токенов, нестандартной проверки, обращения к API или маршрутизации исключений.
Выбор события влияет на доступные данные. До идентификации ещё нельзя надёжно обращаться к свойствам класса, а после сохранения уже существует объект в репозитории. Код, связанный со страницей, запускается для каждого листа: действие, безобидное на одном документе, может выполниться сотни раз на большой партии. Нельзя показывать интерактивное окно в автоматической сессии и ожидать ответа оператора. Вместо этого записывайте сообщение в Output или формируйте контролируемую ошибку.
Скрипт, который обращается к репозиторию до стадии сохранения, должен самостоятельно устанавливать соединение через доступные средства Laserfiche Toolkit. Учётные данные нельзя хранить открытым текстом в коде сессии. Обрабатывайте исключения, задавайте тайм-ауты и логируйте ключевые параметры без персональных данных. После изменения сценария тестируйте не только успешный документ, но и пустой токен, отсутствующую базу, недоступную папку и повторный запуск.
Практический сценарий: счета поставщиков
Для счетов создайте входную папку, куда почтовая система или МФУ помещает PDF и TIFF. Universal Capture сохраняет каждый файл отдельным документом, извлекает текст из цифровых PDF и генерирует изображения для сканов. На первой странице Zone OCR читает номер счёта, дату и итоговую сумму, а Barcode — код поставщика, если он присутствует. Pattern Matching очищает подписи Invoice # и разделители, constraints проверяют формат даты и числового значения.
Field Lookup сопоставляет код или налоговый номер поставщика с учётной базой и возвращает официальное название, внутренний идентификатор и подразделение. Папка строится из токенов года, поставщика и статуса, имя — из номера и даты. Если Lookup не находит запись или OCR не проходит порог, документ остаётся в Revision. Zoom Fields показывают оператору номер, дату и сумму по очереди. После подтверждения документ отправляется в нужную папку, а исходник перемещается в Processed.
Слабое место такого процесса — разные макеты. Не пытайтесь сделать одну маленькую зону для сотен поставщиков. Либо создавайте классы и зоны для стабильных форматов, либо используйте общий полнотекстовый OCR с Pattern Matching и более широкой проверкой. Поставщиков с большим объёмом обрабатывайте отдельными правилами, а редкие документы направляйте в ручной ввод. Измеряйте долю автоматического прохождения и причины исключений, а не только среднюю скорость.
Практический сценарий: личные дела и заявления
Для заявлений с фиксированным бланком Form Identification или комбинация Zone OCR и текста определяет первую страницу, а последующие приложения присоединяются до следующего бланка. Поля фамилии, имени, даты и идентификатора извлекаются из известных областей. Field Lookup по идентификатору дополняет подразделение и статус. Если пакет содержит подпись на последнем листе, Last Page Identification может искать соответствующую отметку; иначе граница следующего первого листа будет достаточной.
Персональные данные требуют осторожного журнала. Не выводите полные идентификаторы в сообщения Script Editor и Output. Ограничьте права сессии и оператора только нужными папками, а временные каталоги включите в корпоративную политику защиты. Fixed Annotation с редакцией следует применять только после юридически утверждённого правила и проверки координат. Для долгосрочного хранения полезно сохранить исходный PDF или исходный скан наряду с обработанными страницами, если это допускает схема импорта.
Практический сценарий: договоры и приложения
Договорный пакет часто содержит титульный лист, основной текст, приложения и листы подписей. First Page Identification ищет устойчивый заголовок или штрихкод на титульном листе. Token Accumulator собирает номера приложений или имена подписантов по страницам. Bates Numbering присваивает последовательный идентификатор, который сохраняется в поле и наносится Permanent Stamp на копию для выдачи. Auto-Annotation может выделять номера пунктов или ключевые слова, если документ имеет текстовый слой.
Не стоит разделять пакет только по слову Приложение: оно может встречаться в оглавлении и тексте. Используйте положение фразы, сочетание с номером страницы или отдельный разделительный штрихкод. Если приложения должны стать самостоятельными документами, сохранять исходный PDF целиком вместе с каждым фрагментом не получится; решите, нужен ли отдельный неизменный оригинал в родительской папке. Связь между основным договором и приложениями можно сохранять общим полем номера дела.
Практический сценарий: повторная обработка документов из репозитория
Laserfiche Capture Engine получает существующие документы по папке или условию поиска. Это позволяет добавить OCR к старым изображениям, заполнить новое поле, перенести документы в другую структуру или исправить ошибочную классификацию. Перед запуском ограничьте выборку тестовой папкой и не меняйте оригиналы необратимо. Сначала создайте отчёт о том, сколько объектов найдено, какие типы страниц встречаются и есть ли электронные файлы без изображений.
При повторной обработке учитывайте существующие поля и аннотации. Настройка может брать значения из исходного документа и использовать их как токены. Получение аннотаций через Capture Engine следует отдельно проверить на конкретных типах документов. Если сессия записывает поля, решите, заменять ли непустые значения. Без этого массовая операция способна стереть ручные исправления. Для миграции применяйте отдельный технический шаблон и журналируйте идентификатор исходного документа.
Производительность и масштабирование
Время обработки складывается из чтения источника, генерации страниц PDF, улучшений изображения, OCR, запросов к базе и записи в репозиторий. Самые дорогие операции не следует повторять в каждом классе. Общий штрихкод или OCR, нужный для классификации, лучше выполнить один раз в Pre-Classification и передать результат токеном. Полнотомасштабный OCR всех страниц не нужен, если задача ограничена несколькими стабильными полями и полнотекстовый поиск не требуется.
Зоны должны быть минимально достаточными. Поиск штрихкода на всей странице во всех ориентациях и форматах заметно медленнее поиска Code 128 в правом верхнем углу. Для OCR выбирайте один реальный язык и правильную ориентацию. Опция Accuracy повышает качество ценой времени; Balanced обычно подходит для рабочих тестов. Сначала измеряйте скорость на репрезентативной партии, затем оптимизируйте операции, которые занимают больше всего времени.
Ограничение очереди Universal Capture не ускоряет OCR, но предотвращает заполнение диска. Для нескольких независимых потоков лучше разделить сессии и расписания, чем создать одну огромную конфигурацию с десятками классов и сложными условиями. Однако параллельный запуск увеличивает нагрузку на OCR, базу и репозиторий. Наблюдайте за временем ответа Lookup, размером временных каталогов и задержкой хранения, а не только за загрузкой процессора.
Типичные ошибки и их устранение
Документ попадает не в тот класс
Проверьте порядок классов: первая совпавшая конфигурация прекращает дальнейшее сравнение. Запустите Test на одном и том же образце для каждого условия и посмотрите токены. Сузьте широкое регулярное выражение, добавьте второе условие или переместите общий класс ниже. Убедитесь, что локальное улучшение, необходимое OCR, находится до процесса идентификации и применяется к правильному образцу.
Страницы объединяются или разделяются неправильно
Сверьте Keep each file as a separate document, условия First и Last Page Identification и фиксированную длину. Эти параметры могут противоречить друг другу. Для файлов, уже разделённых корректно, сохраняйте границы источника. Для сканированного рулона листов используйте надёжный первый лист или разделитель. Добавьте в тест отсутствующий первый лист и лишнюю пустую страницу, чтобы увидеть поведение исключений.
Zone OCR читает не ту область
Сравните размер страницы, DPI и единицы зоны. Процентная область смещается на другом формате бумаги, пиксельная — при другом разрешении. Создайте отдельные образцы для Letter, Legal и A4 либо нормализуйте страницы до одного размера до OCR. Проверьте ориентацию, язык, Use existing text и наличие локального Color Removal. Не повышайте Confidence, пока сама зона стоит неверно.
Smooth сообщает, что изображение не бинарное
Smooth работает только с двухцветными изображениями. Добавьте Color Removal или другое преобразование перед ним и разместите операцию в той же локальной цепочке. Проверьте, что результат действительно чёрно-белый, а не серый. Если исходник цветной и цвет должен сохраниться, примените бинаризацию локально только для OCR, а Smooth не делайте постоянным.
Lookup возвращает несколько строк или ничего
Запустите Test в мастере и проверьте входные значения после форматирования. Добавьте колонки, которые делают запрос уникальным, уберите пробелы и нормализуйте регистр. Убедитесь, что ODBC-источник доступен служебной учётной записи, а не только администратору. Для нулевого результата оставляйте документ в Revision с понятным сообщением, а не заполняйте поля случайной первой записью.
Agent не видит сетевую папку
Замените подключённый диск на UNC-путь и проверьте права учётной записи службы. Интерактивные диски пользователя не доступны сервису автоматически. Дайте права на чтение и на выбранное действие после обработки. Если используется Windows Authentication репозитория, проверьте права того же доменного пользователя. Перезапустите службу после изменения учётной записи и выполните небольшой запуск.
PDF виден не полностью или процессы не работают
Разделяйте электронный файл и созданные изображения. Процессы обработки пикселей требуют генерации страниц. Если нужен только текст цифрового PDF, включите извлечение текста. Для полей формы решите, достаточно ли текста внизу Text Pane или требуется изображение с выжженными значениями. Если документ разрезается на части, проверьте ограничение сохранения исходного PDF.
Поля не принимают распознанное значение
Сравните тип поля и constraint с результатом токена. Дата в региональном формате может не соответствовать ожидаемой строке, число может содержать валютный знак или разделитель тысяч. Отформатируйте токен явно, затем повторите Test. Если поле обязательно, но значение иногда отсутствует по бизнес-правилу, пересмотрите обязательность или создайте отдельный класс исключений.
Совместимость и подготовка рабочего места
Поддерживаются Windows 10 и Windows 11, а серверные компоненты работают на поддерживаемых выпусках Windows Server с графическим интерфейсом. Домашние редакции Windows не заявлены как поддерживаемые. Для просмотра и обработки нужно обеспечить доступ к репозиторию, подходящую лицензию и права. Установка отдельных компонентов выполняется через фирменный пакет, где выбираются Quick Fields, Quick Fields Scanning, Agent, языки и дополнительные элементы.
Для PDF, которые требуется просматривать непосредственно в Display Pane, документация указывает зависимость от Adobe Reader и его настройки открытия PDF. Даже когда электронный файл нельзя показать в центральной панели, Quick Fields может обрабатывать его текст и метаданные. На современном рабочем месте обязательно протестируйте просмотр на корпоративной сборке Reader, потому что политики безопасности и ассоциации файлов могут отличаться от стандартных.
Некоторые процессы лицензируются отдельно. К ним относятся возможности нескольких классов, Zone OCR и другие расширения, отмеченные в справке как add-on. Перед проектированием проверьте состав лицензии: конфигурация, созданная на полном стенде, может потерять доступные операции на рабочем месте оператора. Для автоматической обработки дополнительно нужна лицензия и установка Agent, а для серверной публикации — соответствующие серверные компоненты.
Сравнение Laserfiche Quick Fields с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| Laserfiche Quick Fields | Потокового захвата, классификации и заполнения метаданных перед сохранением в Laserfiche | Максимальная ценность раскрывается внутри экосистемы Laserfiche |
| PDF Commander | Ручного редактирования, объединения, преобразования и защиты отдельных PDF | Нет серверной классификации и маршрутизации пакетов |
| ABBYY FlexiCapture | Крупных проектов OCR, ICR, OMR, классификации и распределённой верификации | Внедрение и обучение проектов требуют специализированной настройки |
| Tungsten Capture | Корпоративного сканирования, индексации и передачи данных в разные бизнес-системы | Архитектура сложнее простой рабочей станции |
| Square 9 GlobalCapture | Визуальных маршрутов захвата и передачи документов в GlobalSearch и внешние системы | Сильнее привязан к собственной платформе управления контентом |
| UiPath Document Understanding | Связки классификации, извлечения, ML и ручной проверки внутри RPA-процессов | Нужна оркестрация UiPath и проектная таксономия |
Laserfiche Quick Fields выбирают, когда конечным местом хранения уже является Laserfiche и важно управлять полями, папками, аннотациями и правами без дополнительного коннектора. PDF Commander удобнее одному пользователю, которому нужно быстро исправить или собрать PDF, но он не заменяет промышленную линию захвата. ABBYY FlexiCapture подходит для сложного распознавания разных форм и распределённой проверки, Tungsten Capture — для больших сканирующих контуров с множеством экспортных направлений, Square 9 GlobalCapture — для организаций на GlobalSearch, а UiPath Document Understanding — когда обработка документа является частью роботизированного процесса с ML и Action Center.
Как подготовить надёжную конфигурацию
- Соберите набор реальных документов: чистые, плохие копии, разные размеры, пустые поля и исключения.
- Опишите границы документов и признаки классов до настройки OCR и штрихкодов.
- Создайте минимальную сессию с одним источником, одним классом и одной конечной папкой.
- Добавляйте процессы по одному и сохраняйте контрольный экспорт после каждого устойчивого этапа.
- Для каждого извлечённого поля задайте формат, источник проверки и действие при низкой уверенности.
- Проверьте права оператора, Agent и учётной записи базы данных отдельно.
- Запустите тестовую партию, измерьте долю автоматического прохождения и классифицируйте причины исключений.
- Только после этого включайте удаление исходников, немедленную отправку и ночное расписание.
Главный критерий готовности — предсказуемое поведение на исключениях. Сессия должна не только правильно обработать стандартный документ, но и безопасно остановить или выделить файл без первой страницы, с повреждённым PDF, неверным штрихкодом, недоступной базой и отсутствующим обязательным полем. Ошибку, которую оператор видит и исправляет, можно контролировать; тихое сохранение неверного документа в правдоподобную папку значительно опаснее.
После запуска периодически пересматривайте образцы и правила. Поставщик меняет макет счёта, подразделение переносит штрихкод, Windows получает другие региональные параметры, а база — новый формат идентификатора. Журнал исключений показывает такие изменения раньше жалоб пользователей. Обновляйте зоны и выражения на копии сессии, сравнивайте результаты на контрольной партии и лишь затем заменяйте рабочую конфигурацию.
Образцы страниц и тестирование отдельных процессов
При настройке процесса центральная панель показывает sample page, на которой можно выполнять Test и сразу видеть зоны, результаты токенов и влияние улучшений. Встроенный пример годится только для знакомства с интерфейсом. Для производственной сессии добавьте собственные образцы каждого класса: самый чистый, самый плохой и пограничный. Если форма имеет лицевую и оборотную стороны, приложите обе; если поле иногда сдвигается, включите варианты с максимальным смещением.
Тест отдельного процесса не всегда воспроизводит полный маршрут. Zone OCR может успешно читать образец, но в реальном сканировании получить страницу после другого изменения размера или поворота. После проверки узла запускайте всю сессию на небольшой партии и сравнивайте итоговые токены, поля, имена и папки. Для класса с несколькими условиями полезно хранить один отрицательный образец, который похож на нужный документ, но не должен быть принят.
При корректировке зоны можно включить автоматический повторный тест после перемещения области. Это ускоряет настройку, но на тяжёлом OCR создаёт задержку при каждом движении мыши. На больших изображениях сначала задайте область приблизительно, затем включите повторное тестирование для точной подгонки. Координаты и единицы фиксируйте в рабочей документации, чтобы после смены DPI можно было понять причину смещения.
Панели, вкладки и настройка рабочего пространства
Панели можно скрывать, менять размер, переводить в плавающее состояние, закреплять, объединять во вкладки и автоматически сворачивать. Display Pane остаётся центральной областью и не переносится, а остальные панели располагаются вокруг неё. Для широкоформатного монитора удобно держать Session Configuration слева, Tasks справа, Document Revision и Processing Information снизу. На портретном документе Tasks Pane можно перенести вниз, чтобы увеличить ширину изображения.
Выбор узла в Session Configuration меняет содержимое Tasks Pane. При выборе класса там отображаются имя, папка, поля и действия класса; при выборе процесса — его мастер и свойства; при выборе этапа — список доступных процессов и улучшений. Пользователь, который смотрит только на правую панель, может не заметить, что редактирует другой узел. Перед изменением проверяйте выделение в дереве и заголовок Tasks Pane.
Output Pane по умолчанию может быть скрыта. В настройках сессии задаётся, какие события писать: все сообщения, только предупреждения и ошибки либо минимум информации. Для отладки включайте подробный вывод на ограниченной партии, затем уменьшайте уровень, чтобы журнал не затруднял поиск действительно важных событий. Команда восстановления стандартного расположения панелей полезна после случайного закрытия или переноса окна за пределы видимой области.
Неопознанные документы и безопасная очередь исключений
В свойствах сессии определяется, что делать со страницами и документами, которые не удалось назначить классу. Их можно оставить в специальном узле Unidentified Documents для ручного разбора, назначить поведение по умолчанию или не допускать автоматической отправки. Для нового процесса безопаснее сохранять неопознанные элементы в Revision: оператор видит исходные страницы и может определить, какой признак отсутствовал.
Неопознанный лист нельзя автоматически присоединять к предыдущему документу без проверки, если поток содержит разделители, пустые страницы и вложения разного размера. Один пропущенный первый лист способен объединить два дела. Создайте отдельную инструкцию: оператор сравнивает соседние документы, при необходимости разделяет пакет, выбирает класс и повторно запускает нужные процессы. Причину следует отметить в журнале настройки, чтобы повторяющиеся случаи привели к изменению правила, а не к постоянной ручной работе.
Для Agent организуйте папку исключений на уровне источника. Если файл повреждён или процесс завершился ошибкой до создания документа, он должен оставаться доступным для повторного запуска. Не удаляйте исходники при неуспешном сохранении. Полезно добавлять к имени файла дату и код ошибки только в отдельной копии, сохраняя первоначальное имя в поле или журнале для трассировки.
Настройка сканирования и качество исходных страниц
Результат OCR ограничен качеством захвата. Для деловых документов обычно выбирают разрешение, при котором мелкие символы имеют достаточное число пикселей, но файл не становится чрезмерно большим. Двустороннее сканирование нужно проверять на пустых оборотах: удаление пустых страниц должно иметь порог, который не выбросит светлую подпись или печать. Автоматический поворот полезен для смешанной ориентации, однако его результат следует проверить на страницах с небольшим количеством текста.
TWAIN, WIA и ScanConnect предоставляют разные наборы параметров, поэтому одна и та же модель сканера может вести себя по-разному в зависимости от источника. Если пропадают аппаратные функции, проверьте выбранный драйвер и разрядность, а не только настройки сессии. Для потокового сканера важны обнаружение двойной подачи, размер листа, цветовой режим, яркость, контраст и удаление пустых страниц. Эти параметры лучше стабилизировать до настройки зон OCR.
Неровная подача меняет координаты полей. Deskew исправляет наклон, но не компенсирует значительный сдвиг и обрезанную кромку. Используйте направляющие сканера, одинаковую ориентацию пачки и реалистичный запас вокруг зоны. Если документ приходит из нескольких источников с различным DPI и геометрией, создайте отдельные сессии либо нормализуйте изображения до единого размера перед зонным распознаванием.
Проектирование регулярных выражений и преобразований
Pattern Matching должен возвращать ровно ту часть строки, которая нужна следующему шагу. Выражение, допускающее любую последовательность цифр, может принять дату за номер счёта. Добавляйте устойчивый контекст, границы слова, длину и допустимые разделители. Для теста используйте положительные и отрицательные строки, включая пустое значение, распознанную букву вместо цифры и лишний пробел. Не исправляйте слишком широкий шаблон только последующей заменой: лучше сузить извлечение.
Substitution подходит для стандартизации: убрать пробелы из номера, заменить косую черту дефисом, удалить служебный префикс, привести несколько разделителей к одному виду. Порядок замен важен. Если сначала удалить все нецифровые символы, информация о знаке минус или десятичной запятой потеряется. Для денежных сумм сначала определите региональный формат, затем убирайте валютный символ и преобразуйте разделитель.
Регулярное выражение в Field Constraint проверяет окончательное значение, но не изменяет его. Сообщение о нарушении должно быть понятным оператору и содержать пример. Вместо Invalid value лучше указать Введите две буквы, дефис и пять цифр. Для поля, которое заполняется Lookup и защищено Read-only, constraint всё равно полезен: он обнаружит неправильную структуру, полученную из внешней системы.
Права доступа, учётные записи и соединения
Сессия может успешно открыть репозиторий, но не иметь права на конечную операцию. Проверяйте создание документа, создание недостающей папки, назначение шаблона, запись каждого поля, добавление аннотации и доступ к объёму. Если путь строится токенами, тестовый пользователь должен иметь права во всех возможных ветвях. Ошибка на одном документе не должна приводить к отправке следующего объекта в неверную папку.
При Windows Authentication результат зависит от пользователя, под которым реально выполняется процесс. Проектировщик, оператор и служба Agent могут иметь разные разрешения. При Laserfiche Authentication учётные данные задаются в конфигурации соединения и также должны соответствовать политике хранения секретов. Directory Server authentication может использовать WebTools Agent для более продолжительного сеанса, чтобы интерактивный пользователь не вводил данные повторно.
Соединение с внешней базой через ODBC следует создавать в той области Windows, которая доступна нужной разрядности и учётной записи. Пользовательский DSN администратора не обязательно виден службе. Для автоматической сессии предпочтителен системный DSN или явно настроенный экспертный источник с защищёнными параметрами. Проверяйте сетевую доступность, драйвер и разрешение SELECT отдельно от логики запроса.
Контроль изменений и перенос между средами
Сессию следует изменять как управляемую конфигурацию. Перед правкой экспортируйте QEX, укажите дату, цель изменения и контрольный набор файлов. Не редактируйте рабочую копию одновременно несколькими администраторами. После теста опубликуйте новую конфигурацию в согласованное окно и сохраните предыдущий экспорт для отката. Это особенно важно после изменения регулярных выражений, SQL и порядка классов.
Между тестовой и рабочей средой различаются имена серверов, репозитории, пути, ODBC-источники и права. После импорта пройдите все соединения и не полагайтесь на то, что они перенеслись корректно. Токены и логика классов обычно остаются, но конечные папки и учётные данные требуют проверки. В мастере используйте Validate, а затем сохраните один документ в отдельную тестовую ветвь рабочего репозитория.
Новые алгоритмы шифрования сессий могут делать опубликованные или сохранённые конфигурации несовместимыми с более ранней установленной сборкой. Поэтому все рабочие места, Agent и Server должны обновляться согласованно. Нельзя сохранить сессию на обновлённом администраторском компьютере и ожидать, что старый оператор безусловно её откроет. Перед обновлением экспортируйте конфигурации и проверьте совместимость на копии.
Метрики качества и ежедневный контроль
Для оценки процесса считайте не только страницы в минуту. Полезны доля документов, прошедших без ручной правки, число неверных классов, среднее количество исправленных полей, процент низкой уверенности OCR, количество нулевых и множественных Lookup, время в Revision и число повторных сканирований. Эти показатели указывают, где настройка действительно экономит труд, а где лишь переносит его на оператора.
Разделяйте технические и содержательные ошибки. Недоступная база, заполненный диск и потеря соединения требуют действий администратора. Нечитаемый номер, новый макет и отсутствующая страница относятся к документу или бизнес-процессу. Разные очереди и коды сообщений позволяют быстрее назначить ответственного. Не включайте чувствительные значения в отчёт; достаточно идентификатора партии, класса, процесса и типа ошибки.
Контрольный набор из одинаковых файлов помогает обнаружить регрессию после изменения настроек, драйвера или обновления. Сравнивайте полученные токены, поля, число страниц и папки с эталоном. Для OCR допускайте ожидаемые различия только там, где они не меняют бизнес-значение. Если новый процесс улучшает один макет, но ухудшает другой, разделите правила вместо выбора среднего компромисса.
Работа оператора: последовательность проверки партии
Оператор начинает с количества входных файлов и ожидаемого числа документов, затем просматривает ошибки Processing Information. После устранения блокирующих проблем он проходит документы с предупреждениями, проверяет выделенные поля и сравнивает их с Zoom Fields. Затем просматривает границы пакетов по миниатюрам, особенно места после разделителей и пустых страниц. Только после этого запускается отправка в репозиторий.
При ручной правке важно не обходить проверку. Если значение не проходит constraint, оператор должен сверить образ и исправить реквизит, а не вставлять формально допустимый фиктивный код. Если Lookup не находит запись, документ направляется в согласованный маршрут исключения. Повторное выполнение процесса после ручной правки может перезаписать поле; персонал должен знать, какие кнопки безопасно использовать на конкретном этапе.
После отправки случайная ошибка не исправляется в Revision, потому что документ исчезает из этой панели. Проверку результата выполняют в конечной папке репозитория: имя, шаблон, поля, число страниц, текст и аннотации. Для первых партий выбирайте небольшие объёмы и сверяйте каждую запись. После стабилизации переходите к выборочному контролю и автоматическим отчётам.
Нежелательные схемы настройки
Не создавайте одну универсальную сессию, которая пытается распознать все документы организации десятками широких условий. Порядок классов станет трудно прогнозировать, а изменение одного правила затронет несвязанные потоки. Разделяйте процессы по источнику, владельцу и общему набору признаков. Общая структура папок и одинаковые поля не требуют единственной конфигурации.
Не полагайтесь только на OCR без проверки формата и существования ключа. Правдоподобно распознанный, но неверный номер опаснее пустого поля, потому что отправляет документ в чужое дело. Используйте Confidence, Pattern Matching, Lookup или Verification и оставляйте сомнительный документ оператору. Для штрихкода включайте конкретный тип, направление и контрольную сумму, когда она предусмотрена.
Не включайте удаление исходных файлов в первый день. Сначала убедитесь, что все страницы сохраняются, электронные файлы остаются там, где это нужно, а исключения не теряются. Перемещение в архивную папку даёт возможность повторить партию. Удаление можно вводить после устойчивого периода и при наличии резервной копии, журналов и процедуры восстановления.