ChronoScan Capture помогает превратить поток сканов и PDF в разобранные документы: принять страницы со сканера или из папки, разделить большой пакет по штрихкодам, пустым листам или шаблонам, распознать реквизиты и строки таблиц, проверить значения в форме и выгрузить результат в PDF, CSV, XML, базу данных либо систему электронного документооборота. Основные инструменты — задания, пакеты, зоны OCR, Intelli-Tag, триггеры, сетки захвата, правила проверки и модули вывода.
Рабочая область построена вокруг ленты команд и нескольких синхронизированных панелей. Слева обычно видны страницы текущего пакета, справа — форма с полями и их состояниями, а снизу или в отдельной вкладке — таблица значений по всем документам. Команды Scan/Input отвечают за приём, разделение и первичную обработку; Data Entry — за настройку распознавания и проверку; Administration — за задания, общие параметры и тестирование конфигурации.
Типовой процесс начинается не с одиночного файла, а с задания, в котором заранее определены поля, правила деления страниц, способы распознавания, проверки и конечные выходы. Оператор создаёт пакет по этому заданию, добавляет PDF, TIFF или JPEG либо запускает TWAIN-сканирование, затем обрабатывает страницы, исправляет только отмеченные ошибки и выполняет экспорт. Такая схема особенно полезна, когда каждый день поступают однотипные счета, накладные, анкеты или многостраничные отчёты.
Скачать ChronoScan Capture
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Требуется настройка заданий
- Интерфейс перегружен
- Только Windows
Как устроена рабочая область
На вкладке Scan/Input лента объединяет управление пакетами, источниками изображений, делением документов, распознаванием, типами документов и режимами просмотра. Кнопки New Batch, Open Batch, Export Batch, Delete Batch и Close Batch относятся к контейнеру документов. Рядом находится выбор источника — импорт PDF или изображений, TWAIN Scanner либо генератор тестовых документов — и команда Start Input. Такое соседство важно: перед запуском ввода можно сразу выбрать способ разделения и дополнительные условия, а не исправлять структуру после загрузки сотен страниц.
Центральная область может показывать миниатюры нескольких страниц или увеличенное текущее изображение. В режиме миниатюр легко увидеть, где закончился один документ и начался другой, перетащить страницу, вставить разделение, удалить технический лист или изменить порядок. В режиме текущей страницы удобнее рисовать зоны, проверять якоря и оценивать качество текста. Переключение не меняет данные пакета: форма, сетка и выбранная страница остаются связанными.
Правая часть обычно содержит Form View и Grid View. Form View показывает поля одного документа, распознанные значения, значки успешной проверки и ошибки. Grid View сводит те же поля по всему пакету в строки, поэтому отклонения видны как цветные ячейки. Если в счёте неверно прочитана дата или сумма, оператор может перейти из таблицы к конкретному изображению, исправить значение и сразу увидеть изменение состояния.

Панели можно показывать и скрывать через команду Panels. Это не косметическая настройка: при создании шаблона полезны Properties, Triggers, Data Modules и Text Blocks Viewer, а при обычной индексации они занимают место и отвлекают. Для небольшого монитора разумно оставить изображение и форму; для контроля большого пакета — изображение и Grid View. В некоторых режимах панели объединяются вкладками, поэтому пропавшая форма нередко находится за вкладкой соседней панели, а не отключена полностью.
Лента поддерживает разные визуальные стили, но названия вкладок и логика команд сохраняются. Кнопка сворачивания ленты освобождает вертикальное пространство, что особенно заметно на документах формата A4. При этом основные действия можно выполнять контекстным меню миниатюры: поворот, удаление, разбиение, назначение типа и запуск обработки. Контекстное меню полезно для единичных исправлений, а команды ленты — для выбранного набора страниц.
Задания, пакеты и типы документов
Задание хранит повторяемую логику обработки. В нём задаются имя и рабочая папка, поля документа, проверки, способы разделения, параметры OCR, типы документов, триггеры и выходные модули. Пакет — конкретная партия файлов, обработанная по этому набору правил. Благодаря этому одна конфигурация может применяться каждый день, а результаты разных запусков не смешиваются. Для счетов поставщиков, заявлений сотрудников и транспортных накладных лучше создавать отдельные задания, даже если часть полей совпадает.
Job Wizard проводит через основные шаги: имя, общие параметры, структуру страниц, поля и выход. Мастер удобен для первого рабочего варианта, но не заменяет последующую настройку. После создания задания следует открыть Job Administration, проверить рабочую папку, правила пакета, включённые операции обработки и список полей. Кнопка Test Document позволяет прогнать эталонный файл до запуска реального потока и увидеть, где зоны или проверки требуют корректировки.

Имя задания желательно связывать не с отделом, а с устойчивым типом потока: например, Счета поставщиков PDF, Транспортные накладные сканер или Ежемесячный отчёт по филиалам. Это упрощает выбор при создании пакета и снижает риск экспорта в неправильную систему. Описание стоит использовать для краткой инструкции оператору: источник документов, обязательные поля, ожидаемый способ разделения и действие при ошибке.
Поля создаются до рисования зон. Для каждого поля указывается назначение и тип значения: текст, число, сумма, дата, список или служебное значение. Тип определяет не только отображение, но и разбор строки, допустимые символы, формат десятичного разделителя и правила проверки. Поле Invoice total лучше делать суммой, а не обычным текстом: тогда программа может нормализовать разделители и сравнить итог с рассчитанным значением.
Тип документа представляет визуальный шаблон страницы или группы страниц. Когда в одном пакете встречаются счета разных поставщиков, каждый макет можно сохранить как отдельный тип и привязать к собственным зонам. Механизм распознавания типа анализирует страницу и назначает подходящий шаблон. Если макеты слишком похожи, полезно добавить текстовый признак — название поставщика, постоянный заголовок или код формы — вместо попытки отличать документы только по геометрии.
Пакет имеет состояние и набор документов. Во время работы его можно закрыть, снова открыть, обработать частично и экспортировать после проверки. Удаление пакета отличается от удаления страницы: оно затрагивает всю партию и может удалить связанные рабочие данные. Поэтому перед Delete Batch следует проверить, завершён ли экспорт и не используется ли пакет другим оператором. Для тестов безопаснее создавать отдельное задание и отдельные тестовые пакеты.

Импорт PDF, TIFF и JPEG
Для файлового ввода выбирают Import PDF или Import Images и нажимают Start Input. Import Files Module хранит именованные конфигурации. В конфигурации задаются каталог, маска расширения, маска имени, регулярное выражение, обход подпапок, максимальное число файлов, порядок сортировки, действие после импорта и папка назначения обработанных исходников. Это позволяет один раз описать поток и не выбирать одинаковые параметры при каждом запуске.

Маска имени нужна, когда в каталоге лежат файлы разных процессов. Например, выражение для имени может пропускать только счета с определённым префиксом. Регулярное выражение полезно для более сложных правил, но его следует проверять на тестовой папке: слишком широкое условие подхватит посторонние документы, а слишком узкое оставит часть файлов необработанной. Параметр Search subdirectories включают только тогда, когда структура вложенных папок действительно является частью процесса.
При импорте изображений можно создавать новый документ для каждого файла, для каждой папки или собирать многостраничные последовательности. Выбор зависит от исходного сканера. Если МФУ сохраняет каждый лист отдельным TIFF, новый документ на каждый файл разрушит многостраничные договоры; в этом случае сначала импортируют страницы в один поток и применяют деление. Если каждый PDF уже является отдельным счётом, дополнительное разделение обычно отключают.
Порядок файлов должен совпадать с реальной последовательностью страниц. Alphanumeric Ascending корректно работает с именами вроде scan0001, scan0002 и scan0010. Имена scan1, scan2, scan10 могут сортироваться неожиданно в некоторых схемах, поэтому лучше использовать ведущие нули. Параметр Last file и импорт от последнего файла помогают продолжить прерванную операцию, но перед повторным запуском необходимо убедиться, что часть исходников не была перемещена вручную.
Опции удаления, переименования и перемещения импортированных файлов требуют отдельной тестовой папки. Безопасная схема — сначала копировать исходники в рабочую папку, затем после успешного ввода перемещать их в каталог imported. Немедленное удаление удобно только при наличии резервной копии. Если обработка завершилась ошибкой, настройка Continue if there is an error определяет, будет ли очередь продолжена; для финансовых документов лучше сохранять ошибочный файл отдельно и фиксировать его имя.

PDF можно добавить и перетаскиванием из Проводника. При ручном добавлении появляется окно параметров PDF, где выбирается способ получения страниц. Для цифрового PDF выгодно использовать встроенный текст, если он корректен; для скана требуется рендеринг страницы и OCR. Смешанный документ иногда содержит текстовый слой только на части страниц, поэтому результат следует проверить по индикаторам OCR/PDF на миниатюрах и по Text Overlay.
Офисные документы не являются базовым входом наравне с PDF и изображениями. Их обработка зависит от настроенного преобразователя в PDF. Если поток включает DOCX или XLSX, надёжнее заранее конвертировать их в PDF контролируемым средством и только затем передавать в задание. Это исключает различия шрифтов, полей печати и скрытых листов, которые могут изменить геометрию зон.
Сканирование через TWAIN
Источник TWAIN Scanner открывает окно TWAIN Scan. В нём доступны Start Scan, Set up Scanner и Select Source. Сначала выбирают устройство, затем вызывают его собственные настройки. В зависимости от драйвера доступны разрешение, цветность, двусторонняя подача, формат страницы, яркость и автоматическое удаление пустых оборотов. ChronoScan передаёт команды драйверу, поэтому набор параметров и названия опций у разных сканеров отличаются.

Для текстовых документов обычно достаточно 300 dpi. Повышение до 400–600 dpi помогает мелкому шрифту и слабой печати, но увеличивает объём изображений и время OCR. Цветной режим нужен для цветных печатей, отметок и сложного фона; для обычных счетов часто достаточно оттенков серого. Чёрно-белый режим даёт небольшие файлы, однако агрессивный порог может уничтожить тонкие символы и десятичные точки.
Флажок Show Scanner Settings Window позволяет видеть диалог драйвера перед сканированием. Это удобно при настройке, но мешает полностью автоматическому потоку. Always create new document at start scanning начинает новый документ при каждом запуске подачи; эту опцию включают, когда одна загрузка автоподатчика соответствует одному делу. Если в лотке лежит смешанный пакет, структуру лучше определять штрихкодами, PatchCode, пустыми страницами или IDR.
Close this window after scan и Close batch after scan полезны для рабочих мест с фиксированным сценарием. Однако автоматическое закрытие пакета следует включать только после отладки: оператор может не заметить перекос, двойную подачу или пропущенный оборот. При первой настройке разумнее оставить окно открытым, сравнить число физических листов с числом миниатюр и проверить несколько страниц в увеличении.
Если сканер не появляется в Select Source, сначала проверяют разрядность драйвера и установленного приложения, затем наличие устройства в родной утилите производителя. WIA-драйвер не всегда предоставляет полноценный TWAIN-интерфейс. Для сетевого МФУ часто надёжнее настроить сканирование в папку и импорт через файловый модуль, чем пытаться управлять устройством как локальным TWAIN-сканером.
Разделение большого потока на документы
ChronoScan поддерживает несколько стратегий деления, и правильный выбор сильнее влияет на надёжность, чем последующее OCR. Manual Split подходит для нерегулярных пакетов. Split Every n Pages работает, когда каждый документ имеет одинаковое число страниц. Blank Page Detection использует пустой лист как границу. Barcode Split и PatchCode Split распознают специальные метки. IDR и подтипы страниц позволяют отделять документы по содержимому и внешнему виду.
Ручное разделение выполняют кнопкой, курсором или контекстной командой на миниатюре. Оно быстро для небольшой партии, особенно когда на экране видно несколько страниц. Перед разделением полезно увеличить миниатюры настолько, чтобы различались первые страницы. После операции следует проверить нумерацию страниц и убедиться, что приложение не оставило пустой документ между двумя границами.
Split Every n Pages не анализирует содержание. Если один трёхстраничный документ случайно потерял лист, все последующие границы сместятся. Поэтому этот режим безопасен только при контролируемом источнике, где число страниц гарантировано. Для массовых анкет с одним листом выбирают Single Image Documents: каждая страница сразу становится отдельным документом.
Пустые страницы удобны как дешёвые разделители, но порог пустоты должен учитывать тени, отверстия от степлера, фон бумаги и следы обратной стороны. Слишком строгий порог не распознает лист как пустой; слишком мягкий удалит страницу с небольшим штампом или короткой подписью. Тестовый набор должен включать самый грязный пустой лист и самую малозаполненную полезную страницу.
PatchCode предназначен для операторских потоков: напечатанный код вставляют между документами, а после распознавания страница-разделитель удаляется. Важно выбрать тот тип PatchCode, который указан в настройке, и печатать его без масштабирования. Barcode Split гибче: можно использовать собственный одно- или двумерный код и при необходимости проверять конкретное значение. Следует помнить, что при режиме разделительного штрихкода страница с кодом может удаляться, поэтому деловую информацию на ней размещать нельзя.
IDR-разделение применяют, когда первая или последняя страница имеет устойчивый макет. Сначала создают типы и подтипы страниц, затем назначают образцам роли. При обработке система ищет известный первый или последний тип и устанавливает границу. Метод не требует печатных разделителей, но чувствителен к близким шаблонам. Для похожих форм добавляют текстовые признаки или триггеры, а не полагаются на один логотип.
После автоматического деления пакет проверяют в Documents View. Полезно фильтровать документы с ошибками и выборочно просматривать границы. Ошибка деления опаснее одной ошибки OCR: реквизиты могут попасть не в тот документ, а экспортированный PDF будет юридически неверным. Для критичных потоков проверка первой и последней страницы каждого документа должна входить в регламент.

Поворот, порядок страниц и визуальный контроль
Миниатюры позволяют увидеть порядок, ориентацию и принадлежность страниц. Поворот применяют до распознавания, чтобы зоны совпадали с макетом. Если камера или сканер записал EXIF-ориентацию, изображение может выглядеть правильно в просмотрщике, но передаваться в OCR иначе; поэтому после импорта проверяют фактическое положение текста и при необходимости применяют поворот внутри задания.
Перемещение страницы между документами используют для исправления неправильной границы. Сначала выделяют страницу, затем переносят её в нужную позицию или применяют команду Move Page. После перемещения рекомендуется повторно запустить типизацию и чтение полей для затронутых документов: старые значения могли быть получены с прежней страницы и не обновиться автоматически в зависимости от выбранных задач обработки.
Удалять страницу следует только после увеличения. Бледная оборотная сторона может выглядеть пустой на миниатюре, хотя содержит подпись или продолжение таблицы. Для массового удаления лучше использовать проверенное правило пустой страницы, а не множественное выделение по внешнему виду. Перед экспортом число страниц в PDF сравнивают с исходным счётчиком или сопроводительным реестром.
Кнопки Undo и история действий помогают отменить часть операций интерфейса, но не должны заменять резервную копию исходников. Импортная папка и пакет выполняют разные роли: пакет содержит рабочие представления и извлечённые значения, а исходный файл остаётся единственным эталоном при споре. Поэтому перемещение в imported безопаснее удаления.
Распознавание текста и выбор OCR
Программа может использовать разные механизмы распознавания. Для каждого OCR-объекта или столбца сетки можно выбрать движок и его параметры. Базовая проверка начинается с языка, ориентации, масштаба и качества изображения. Выбор движка имеет смысл только после устранения перекоса и размытия: даже сильный OCR будет стабильно путать символы на плохом исходнике.
Окно OCR all pages позволяет запустить распознавание по всему пакету, выбрать активный движок, число параллельных процессов, удаление предыдущего результата и максимальное время на страницу. Параллельность ускоряет большие пакеты, но увеличивает нагрузку на память и процессор. Если приложение зависает на тяжёлых страницах, число потоков снижают, а ограничение времени используют для выделения проблемных листов вместо остановки всей партии.

Повторное OCR с флажком Delete previous OCR очищает старый текстовый слой. Это важно после смены языка, фильтра или ориентации; иначе часть интерфейса может продолжать показывать прежние данные. Для выборочного исправления не обязательно перечитывать весь пакет: можно обработать только выделенные страницы или документы с OCR-ошибкой, если соответствующий режим доступен в конфигурации.
Tesseract требует установленного языкового пакета. Для русского языка выбирают русскую модель, а для смешанных документов добавляют только реально встречающиеся языки. Чем шире набор, тем больше похожих символов участвует в выборе. В числовой зоне список языков менее важен, чем белый список допустимых символов, формат числа и запрет букв.
Опциональные движки и облачное распознавание могут давать лучший результат на рукописных пометках, сложных фонах и нестандартных шрифтах, но требуют отдельной настройки, лицензии или сетевого доступа. Для конфиденциальных документов заранее определяют, разрешена ли передача изображения внешнему сервису. Если нет, выбирают встроенный или установленный движок и компенсируют ограничения фильтрами и ручной проверкой.
Для цифрового PDF предпочтительнее извлечь реальный текст, а не распознавать отрисованную страницу. Однако встроенный текст может содержать лишние пробелы, неправильный порядок символов или нестандартное кодирование. При таком дефекте сравнивают режим PDF text с OCR. Для кода, телефона или идентификатора иногда помогает отключение лишних пробелов и регулярное выражение; для обычной фразы это может склеить слова, поэтому настройку применяют только к конкретному полю.
Зоны OCR и свойства полей
OCR Zone — прямоугольная область на определённой странице и типе документа. Она подходит, когда реквизит находится в стабильном месте: номер счёта, дата, итог, код клиента. Сначала выбирают поле в форме, затем инструмент создания зоны и обводят текст на изображении. Результат связывается с выбранным полем, а подпись зоны помогает видеть, какой реквизит она заполняет.
Зона является позиционной. Если реквизит смещается из-за разной длины адреса или масштаба скана, фиксированный прямоугольник захватит соседний текст. В таких документах используют относительное позиционирование от триггера, Intelli-Tag или отдельные типы шаблонов. Увеличивать зону с запасом опасно: OCR может вернуть заголовок, подпись и значение одной строкой.
Свойства зоны включают движок, режим чтения, допустимые символы, формат даты или числа, фильтры изображения и постобработку. Для суммы задают десятичные разделители и очищают валютный символ только после распознавания. Для номера счета часто применяют белый список букв, цифр, дефиса и косой черты. Для даты полезно явно указать ожидаемый порядок дня, месяца и года.
View Labels Overlay показывает подписи зон и триггеров. View Text Overlay накладывает распознанный текст поверх изображения и быстро выявляет пропущенные символы, неверную ориентацию и смещение строк. Zoom Areas автоматически фокусирует изображение на зоне выбранного поля, что ускоряет проверку: оператор выбирает поле, видит соответствующий фрагмент и не ищет его на странице вручную.
Глобальная обработка изображения и фильтр зоны решают разные задачи. Глобальный фильтр меняет представление всей страницы, а локальный может усилить только бледный номер или убрать сетку вокруг суммы. Перед применением агрессивного порога сравнивают несколько образцов: фильтр, улучшающий одну копию, способен уничтожить тонкую печать на другой.
Значения по умолчанию для зон сокращают настройку новых типов документов. Если одинаковое поле во всех шаблонах читается как дата с одним форматом и движком, параметры можно сделать стандартными. Но геометрию и фильтры следует проверять отдельно: разные поставщики используют разные размеры шрифта, фон и выравнивание.

Intelli-Tag, триггеры и относительный поиск
Intelli-Tag ищет устойчивую метку и извлекает значение рядом с ней. Для надписи Invoice No можно искать ближайший код справа, для Total — ближайшую сумму, для Date — дату в заданном направлении. Такой подход лучше фиксированной зоны, когда блок перемещается по вертикали, но название поля сохраняется. Чем точнее метка и область поиска, тем меньше ложных совпадений.
Триггер реагирует на найденный текст, регулярное выражение, штрихкод или другой признак и выполняет действие. Он может установить якорь для зоны, назначить тип, разделить документ, заполнить поле или запустить дополнительную операцию. OCR Trigger Assistant показывает текст, найденный в области поиска, и позволяет выбрать фразу для условия. Это надёжнее ручного ввода, потому что виден фактический результат распознавания.
Регулярное выражение применяют, когда значение имеет устойчивую структуру, а подпись или положение меняются. Например, номер может состоять из двух букв, дефиса и восьми цифр. Выражение должно быть достаточно узким, чтобы не принять почтовый индекс или дату. Полезно использовать группу захвата: условие находит всю строку, а в поле записывается только нужная часть.
Относительный якорь строит зону возле найденной метки. Его параметры включают направление и смещение. При настройке используют документы с короткими и длинными значениями, а также сканы с небольшим изменением масштаба. Если метка встречается несколько раз, задают ближайшее расположение, страницу, тип документа или дополнительное условие поля.
Приоритеты важны, когда одновременно работают глобальные и шаблонные Intelli-Tag. Специфичное правило для поставщика должно иметь преимущество над общим, иначе универсальная метка может заполнить поле раньше точной. После изменения приоритета пакет нужно перечитать на тестовых документах разных типов, а не только на одном успешном примере.
Триггеры могут образовать цепочку, поэтому отладку проводят поэтапно. Сначала проверяют распознавание текста, затем условие, затем действие. Если сразу включить разделение, назначение типа и заполнение полей, ошибка в первом условии проявится как несколько несвязанных проблем. Панель Triggers и режим отображения меток помогают увидеть активные объекты на странице.
Штрихкоды и PatchCode
Штрихкоды используются не только как разделители, но и как источник данных. После включения Barcode Read выбирают типы кодов, которые реально присутствуют на документах. Чем больше форматов разрешено, тем выше вероятность ложного распознавания на графике или таблице. Для производственного потока лучше ограничиться одним-двумя известными форматами и указать область поиска.
Значение кода можно записать в поле, использовать для имени выходного файла, поиска записи в базе и выбора маршрута. Если код содержит составные данные, регулярное выражение разделяет его на части. Перед эксплуатацией проверяют ведущие нули: числовое поле может их отбросить, поэтому идентификатор чаще хранят как текст.
Качество чтения зависит от размера модуля, контраста, поворота и повреждений. Медианный фильтр может уменьшить шум, но чрезмерная обработка размывает тонкие элементы. При проблемах сначала увеличивают разрешение сканирования и проверяют печать кода без масштабирования. Для кода у края страницы необходимо оставить физическое поле, чтобы автоподатчик не обрезал край.
PatchCode проще настраивать как технический разделитель, но требует физической вставки листов. Штрихкод на первой странице документа избавляет от дополнительных листов, однако его значение должно быть гарантированно доступно до разделения. Выбор зависит от процесса: операторский архив часто выигрывает от PatchCode, а поток форм с заранее напечатанным номером — от Barcode Split.
Распознавание типа документа
Механизм типов нужен, когда в одном пакете встречаются разные формы. Для каждого типа выбирают репрезентативные образцы: чистый PDF, обычный скан и документ с допустимым отклонением. Если обучать только идеальному образцу, реальные копии могут попадать в неопределённый тип. Если объединить слишком разные макеты, зоны перестанут совпадать.
Текстовые подтипы помогают различать страницы одной формы: первая, продолжение, приложение или последняя. Они полезны для автоматического разделения многостраничных документов. Условие должно опираться на устойчивый заголовок или метку, а не на номер страницы, который может отсутствовать после объединения файлов.
После назначения типа применяются связанные зоны и правила. Неправильная классификация поэтому вызывает серию ошибок: поля пусты, зоны читают соседние области, сетка не находит строки. При массовых красных ячейках сначала проверяют тип документа, а уже потом OCR. В тестовом пакете полезно намеренно включить неизвестный макет и убедиться, что система помечает его для ручного решения, а не присваивает ближайший тип без контроля.
Сходные документы можно уточнять по названию компании, коду формы, языку или другому тексту. Визуальный признак и текстовый триггер дополняют друг друга: первый быстро отбирает кандидатов, второй подтверждает. Для формы с меняющимся логотипом текст обычно устойчивее; для скана с плохим OCR, напротив, геометрический шаблон может быть надёжнее.
Извлечение таблиц с помощью Capture Grid
Capture Grid предназначена для строк табличных данных: позиции счёта, товары, количество, цена, сумма, коды счетов. Сначала в задании активируют табличный контрол и создают столбцы, затем на документе рисуют область сетки. Заголовок определяет положение колонок, тело — диапазон строк, а мастер-колонка помогает понять, где начинается новая запись.

Мастер-колонка выбирается по наиболее заполненному и устойчивому столбцу. В счёте это часто описание товара или количество, но не итоговая сумма, которая может отсутствовать в части строк. Если в мастер-колонке много переносов, одна позиция разделится на несколько записей. Тогда меняют колонку, минимальную высоту строки или правила многострочного чтения.
Границы колонок должны учитывать реальный разброс макетов. Слишком узкая колонка обрежет цифру; слишком широкая захватит соседнее значение. Для выравненных таблиц геометрия работает хорошо, для отчётов с плавающими пробелами полезны текстовые разделители и триггеры начала/конца. На образцах проверяют строки с максимальной длиной описания и отрицательными значениями.
Read Grid запускает чтение и показывает результат в Modules Panel. Ошибочные строки можно добавить или удалить вручную. Manual Row Controls нужны, когда алгоритм не увидел строку из-за слабой печати или объединённой ячейки. Ручное исправление допустимо для исключения, но если оно требуется в каждом документе, следует менять геометрию или правило разделения строк.
Check Balance сравнивает табличные значения с итоговым полем, если задание настроено для линейного захвата. Такая проверка выявляет пропущенную позицию, неверный знак или десятичный разделитель. Баланс не подтверждает смысл каждой строки: две ошибки могут взаимно компенсироваться, поэтому критичные коды и суммы дополнительно проверяют по формату и справочнику.
Для таблиц с несколькими независимыми блоками используют несколько сеток. Каждой сетке задают понятное имя или псевдоним, чтобы не перепутать строки при экспорте. При наложении областей следует убедиться, что один и тот же текст не считывается дважды. Цвета сеток помогают визуально различать конфигурации на странице.
Grid View итогового пакета отличается от Capture Grid на странице. Capture Grid описывает геометрию и строки одного документа, а Grid View показывает поля по множеству документов. Ошибка в сетке сначала исправляется в Modules Panel текущего документа; затем результат проверяется в общей таблице и выходном CSV или XML.
Проверка значений в Form View и Grid View
Form View предназначена для последовательной индексации. Поля могут иметь значки успешного чтения, проверки или ошибки. Выбор поля фокусирует соответствующую область изображения, если включён Zoom Areas. Оператор исправляет только проблемные значения, подтверждает документ и переходит дальше. Порядок полей лучше совпадать с расположением на странице, чтобы взгляд двигался сверху вниз.
Grid View удобна для пакетного контроля. По столбцам видны тип, поставщик, номер, дата и суммы, а цветом выделяются ошибки. Фильтры позволяют показать все документы, только подтверждённые или только проблемные. Сортировка по поставщику или дате помогает заметить выброс: одна строка с другой маской номера или нереальной датой быстро выделяется среди соседних.

Правила проверки должны отличать обязательность от качества OCR. Обязательное поле без значения — ошибка. Необязательная заметка может быть пустой без блокировки. Формат проверяет структуру, диапазон — допустимое число или дату, список — принадлежность справочнику. Для суммы полезны минимум, максимум и число десятичных знаков; для номера — регулярное выражение.
Справочные списки ускоряют ввод, но требуют актуальности. Если новый поставщик отсутствует, оператор не должен подбирать похожее имя только ради зелёного статуса. Правильный процесс предусматривает добавление записи ответственным сотрудником или временный маршрут исключения. Список и отображаемое имя могут отличаться от реального ключа, поэтому экспорт проверяют на тестовой записи.
Экспорт только подтверждённых документов защищает от попадания ошибок в учётную систему. Однако пакет с одним неподтверждённым документом может остаться незавершённым. В регламенте нужно определить: блокировать весь пакет, экспортировать только валидные записи или направлять ошибки в отдельную папку. Выбранный подход должен совпадать с настройкой выходного модуля.
Проверка по базе данных
Database Lookup сопоставляет распознанное значение с внешней таблицей. По коду поставщика можно получить внутренний идентификатор, наименование, договор и счёт затрат. Такой поиск уменьшает ручной ввод и одновременно подтверждает, что значение существует. Ключевые поля необходимо нормализовать: убрать лишние пробелы, привести регистр и сохранить ведущие нули.
Запрос может использовать один или несколько ключей и дополнительные фильтры. Оператору следует понимать, что найдено: точное совпадение, первое из нескольких или запись по условию OR. Если несколько строк подходят одинаково, поле нельзя автоматически считать подтверждённым. Лучше показать список или сформировать ошибку для ручного выбора.
Внешняя база должна быть доступна во время обработки или проверки. При сетевом сбое OCR может завершиться, но lookup останется пустым. Ошибку соединения нельзя путать с отсутствием записи. Для диагностики проверяют журнал, строку подключения, права учётной записи и доступность источника с того же компьютера.
Двусторонний обмен требует осторожности. Чтение справочника безопаснее обновления рабочей базы. Если сценарий записывает данные обратно, сначала тестируют транзакцию на отдельной таблице, определяют уникальный ключ и поведение при повторном экспорте. Иначе повторная обработка одного пакета создаст дубликаты.
Работа с PDF и создание текстового слоя
PDF может быть цифровым, сканированным или смешанным. Цифровой документ содержит текстовые объекты, сканированный — только изображения, смешанный — изображения и частичный текстовый слой. При импорте важно определить, какой источник используется для полей. Реальный PDF-текст быстрее и точнее для хорошо сформированного отчёта, но рендеринг с OCR надёжнее при нарушенном порядке символов или нестандартном шрифте.
Для архивного результата создают PDF с поисковым текстом. В параметрах PDF Text включают Searchable Text, после чего распознанный слой помещается поверх или под изображением страницы. Пользователь видит оригинальный скан, но может искать и копировать слова. Перед массовым экспортом открывают образец в другом просмотрщике и проверяют поиск по нескольким словам, русским буквам и номеру.
Если требуется сохранить исходный PDF, выбирают режим, который не перерисовывает страницы без необходимости. Рендеринг может изменить размер файла, цвет и качество мелких линий. С другой стороны, повреждённый или сложный PDF иногда приходится отрисовать в изображения. Настройка должна зависеть от свойств входа, а не быть одинаковой для всех документов.
PDF/A используют для длительного хранения, когда это поддерживает выбранный модуль. Необходимо различать сам формат и качество распознавания: соответствие PDF/A не исправляет неверный текстовый слой. После преобразования проверяют наличие страниц, вложенных шрифтов, поиск и размер файла. Для юридически значимых архивов дополнительно применяют независимый валидатор.
Report Dismount и извлечение страниц полезны для больших отчётов, где один PDF содержит множество логических документов. Триггер начала записи, текстовый идентификатор или структура страниц определяют границы, после чего каждый фрагмент получает собственные поля и имя. Тестовый набор должен включать запись, которая переходит через страницу, и последнюю запись отчёта без следующего разделителя.
Закладки PDF можно формировать из полей и структуры документов. Дерево закладок удобно для многоуровневого архива, но значения должны быть очищены от недопустимых символов и пустых строк. Если в имени закладки используется OCR-поле, ошибка распознавания станет частью навигации, поэтому такое поле включают в обязательную проверку.
Экспорт документов и данных
Output Settings задаёт назначение документов и общий формат, а Execute Output позволяет подключить больше модулей и настроить их детально. Доступны файловый вывод, PDF, исходный формат, текстовые и структурированные данные, электронная почта, FTP и коннекторы к системам управления документами. Набор активных модулей зависит от установленной конфигурации и лицензии.

Файловый модуль должен использовать предсказуемую структуру каталогов и уникальные имена. Имя из номера счёта удобно, но два поставщика могут иметь одинаковый номер. Безопаснее соединить код поставщика, номер и дату либо добавить внутренний идентификатор пакета. Недопустимые для Windows символы заменяют до записи, а пустое поле обрабатывают запасным шаблоном.
CSV и TXT подходят для простых таблиц, XML и JSON — для структур и вложенных строк. При экспорте сеток проверяют разделитель, кодировку, формат дат и десятичный знак. Открытие CSV двойным щелчком в табличном редакторе может автоматически изменить ведущие нули и даты; для контроля лучше импортировать файл с явными типами столбцов.
Расширенный XML позволяет формировать узлы и атрибуты для документа и строк сетки. Структуру следует согласовать с принимающей системой до настройки. Изменение имени поля в задании способно изменить выходной узел, если схема строится автоматически. Для стабильной интеграции используют фиксированные технические имена и отдельные отображаемые подписи.
Вывод в базу или ERP требует проверки повторной отправки. Модуль должен либо обновлять запись по уникальному ключу, либо отклонять дубликат, либо сохранять версию. Простая вставка без проверки опасна при повторном нажатии Export Batch. В тесте обязательно повторяют экспорт одного пакета и смотрят, что произошло на стороне назначения.
Коннекторы к M-Files, SharePoint, CMIS и другим системам сопоставляют поля ChronoScan со свойствами объекта. До запуска проверяют тип объекта, класс, обязательные свойства, права пользователя и поведение при существующем документе. Если система возвращает сетевой сбой, пакет не следует помечать завершённым без подтверждения, что файл и метаданные действительно созданы.
Электронная почта может использовать поля в адресе, теме, имени вложения и тексте сообщения. Перед массовой рассылкой выполняют тест на внутренний адрес, проверяют TLS/OAuth, размер вложения и кодировку кириллицы. Адрес получателя из OCR должен проходить строгую проверку: неверно распознанная буква способна отправить документ постороннему адресату.
FTP и SFTP требуют различать протоколы и порты. Обычный FTP не обеспечивает ту же защиту, что SFTP. При ошибке соединения проверяют не только пароль, но и пассивный режим, сертификат, прокси и доступ из сети. Выходной модуль должен сохранять локальную копию или журнал, чтобы можно было восстановить отправку без повторного OCR.
Автоматический ввод через Hot Folder
Hot Folder отслеживает папку и добавляет новые файлы в заданный процесс. Это удобно для МФУ, сетевого обмена, выгрузки из почты и ночной обработки. Рабочая папка должна иметь отдельные каталоги входа, успешно импортированных файлов и ошибок. Нельзя использовать одну и ту же папку как источник и результат: созданный PDF может быть принят повторно.
Файл следует импортировать только после завершения копирования. Для больших PDF полезна задержка или проверка стабильности размера, иначе процесс захватит неполный файл. Сетевой ресурс должен быть доступен под той учётной записью, от имени которой работает служба или планировщик; доступ пользователя в Проводнике не доказывает доступ службы.
Маски и расписание ограничивают поток. Временное окно полезно, когда сервер должен обрабатывать документы ночью. Однако файлы, поступившие вне окна, должны оставаться в очереди, а не считаться ошибочными. После перезапуска проверяют, продолжает ли механизм с последнего файла и не импортирует ли уже перемещённые исходники.
Ошибка одного файла не должна скрывать остальные. Папка ошибок и журнал должны сохранять исходное имя, время, задание и сообщение. Для зашифрованных PDF можно настроить правила пароля, но хранить пароли в открытом виде в общей папке небезопасно. Неизвестный пароль должен переводить файл в исключение.
Командная строка и сценарии
Поддержка командного запуска позволяет включить обработку в планировщик или существующую систему. Команда должна ссылаться на конкретное задание и вход, а результат возвращать проверяемый код или журнал. Перед автоматизацией весь процесс от импорта до экспорта выполняют вручную на тестовом пакете, чтобы отделить ошибки конфигурации от ошибок запуска.
VBScript используется для нестандартных действий: заполнения полей, вычислений, маршрутизации, работы с внешними данными и реакции на события. Скрипт может запускаться при начале или окончании обработки документа, при выборе строки сетки, перед выводом или после модуля. Чем больше логики уходит в сценарий, тем важнее хранить версию и комментарии вне единственной рабочей копии.
Скрипт не должен молча исправлять сомнительные значения. Для критичного поля безопаснее установить ошибку и показать оператору причину. Любое обращение к файлам или базе оборачивают обработкой исключений и журналированием. Повторный запуск должен быть идемпотентным: не создавать второй объект, если первый уже был записан.
Параметры станции содержат рабочие каталоги, пути к движкам, почтовые настройки и служебные идентификаторы. Их изменение влияет на все задания данного рабочего места. Перед правкой сохраняют конфигурацию, а после — проверяют запуск, OCR и экспорт на тестовом пакете. Пароли и ключи API не следует включать в публичные журналы или скриншоты.

Практический сценарий: счета поставщиков
Для счетов создают поля поставщика, номера, даты, заказа, валюты, нетто, налога и итога, а также сетку позиций. Сначала классифицируют макет или находят поставщика по Intelli-Tag, затем читают основные поля. Номер очищают по допустимым символам, дату разбирают по формату, суммы приводят к общему десятичному разделителю.
Поставщика удобно подтверждать через базу по налоговому номеру или внутреннему коду. Название, распознанное OCR, подходит для показа, но может содержать опечатку. Найденная запись заполняет внутренний идентификатор и параметры маршрута. Если совпадения нет, документ направляют на добавление поставщика, а не экспортируют с произвольным кодом.
Сетка позиций получает описание, количество, цену, налог и сумму. Проверка баланса сравнивает сумму строк с итогом. Отдельное правило контролирует, что дата не находится далеко в будущем, валюта допустима, а номер не пуст. Если заказ обязателен только для части поставщиков, условие проверки связывают с типом или кодом поставщика.
После подтверждения создают поисковый PDF и структурированный файл либо запись в ERP. Имя PDF формируют из стабильных полей, но внутренний ключ добавляют для уникальности. При повторном экспорте система должна найти существующий объект и выполнить предусмотренное действие — обновить, добавить версию или остановить дубликат.
Практический сценарий: договоры и кадровые документы
В договорном потоке важнее правильная структура страниц и поиск, чем табличные строки. Пакет разделяют по первой странице, штрихкоду дела или пустому листу. Поля включают номер, дату, контрагента, вид документа и срок. Для многостраничного документа контролируют, что приложение и подписи остались внутри того же объекта.
Полный OCR создаёт текстовый слой для поиска по фамилиям и условиям. Зоны читают только реквизиты, поэтому ошибки полного текста не обязательно блокируют экспорт, а ошибки номера или даты — блокируют. Конфиденциальные документы не отправляют во внешний OCR без согласованной политики.
В кадровых формах встречается рукопись и отметки. Обычный OCR хорошо читает печатные поля, но подпись не следует интерпретировать как текст. Наличие подписи можно проверять отдельным признаком или оставить оператору. Для чекбоксов и отметок используют соответствующий механизм распознавания, если он настроен, а не зону обычного текста.
Экспорт в систему управления документами требует правильного класса и прав. Поле сотрудника должно ссылаться на однозначную запись справочника, а не на свободно распознанную строку. Документ с неизвестным сотрудником лучше остановить до публикации, потому что исправление доступа после загрузки сложнее.
Практический сценарий: накладные и логистика
Транспортные документы часто поступают сканами с перекосом, штампами и рукописными исправлениями. Приём начинают с 300–400 dpi и проверки автоподатчика. Поля номера рейса, даты, отправителя и получателя ищут по меткам, а штрихкод груза используют как ключ. Сетка извлекает места, вес и код товара.
Если одна накладная занимает разное число страниц, режим фиксированного количества не подходит. Надёжнее штрихкод на первой странице, PatchCode между комплектами или определение первого листа по типу. После деления проверяют документы с одной страницей и необычно большим числом страниц как потенциальные ошибки.
Вес и количество проверяют диапазонами и сравнением с итогом. Десятичная запятая и точка должны нормализоваться одинаково. Код груза хранится текстом, чтобы не потерять нули. При несовпадении кода со справочником документ остаётся в исключении, даже если OCR уверен.
Выход может включать PDF для архива и CSV/XML для транспортной системы. Для сетевой отправки нужен журнал, где видны имя файла, ключ, время и результат. При временной недоступности назначения повторяют только экспорт, а не весь процесс сканирования и распознавания.
Сравнение ChronoScan Capture с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| ChronoScan Capture | Настраиваемых потоков сканирования, зонального OCR, табличного захвата и выгрузки в корпоративные системы | Для стабильного результата требуется спроектировать задание и правила проверки |
| PDF Commander | Ручного редактирования, объединения, распознавания и подготовки отдельных PDF без сложной схемы захвата | Не заменяет конвейер классификации, триггеров и табличного извлечения |
| ABBYY FineReader PDF | Точного OCR, преобразования сканов в редактируемые форматы и повседневной работы с PDF | Меньше ориентирован на пакетные правила ввода и маршрутизацию метаданных |
| Tungsten OmniPage Ultimate | OCR-конвертации документов и автоматических последовательностей преобразования в офисной среде | Доступен только для Windows и уступает системам захвата в сложной классификации потока |
| NAPS2 | Простого сканирования в PDF, базового OCR и работы на Windows, macOS или Linux | Нет сопоставимого конструктора полей, триггеров и корпоративных выходов |
| Tungsten Capture | Крупных многопользовательских проектов ввода, очистки, классификации и проверки документов | Внедрение и администрирование заметно сложнее для небольшой организации |
ChronoScan Capture выбирают, когда нужно не просто распознать страницы, а регулярно получать проверенные поля и строки из разных источников. PDF Commander удобнее для пользователя, который вручную правит и собирает отдельные PDF. FineReader PDF и OmniPage сильны в OCR и конвертации, но не дают того же сочетания зон, триггеров, сеток и маршрутов без дополнительной инфраструктуры. NAPS2 подходит для бесплатного сканирования и поиска. Tungsten Capture имеет смысл при крупном централизованном внедрении с выделенными администраторами.
Ограничения, которые нужно учитывать заранее
Основная сложность заключается в проектировании задания. Программа не может угадать бизнес-правила по одному образцу: нужно определить поля, допустимые форматы, типы документов, исключения и поведение экспорта. Для разового преобразования нескольких страниц такая подготовка избыточна, а для ежедневного потока окупается снижением ручного ввода.
Интерфейс содержит много панелей и команд, потому что одна рабочая область обслуживает импорт, шаблоны, OCR, проверку и выход. Новому оператору лучше выдать упрощённое расположение панелей и короткий регламент, а настройку зон, триггеров и модулей оставить администратору. Иначе случайное изменение шаблона повлияет на все будущие пакеты.
Работа ориентирована на Windows и драйверы TWAIN. Для компьютеров с macOS или Linux потребуется другой клиент либо отдельная Windows-станция. Сетевой сканер можно обойти через папку обмена, но настройка задания и проверка всё равно выполняются в поддерживаемой среде.
Часть OCR-движков, коннекторов, серверных функций и облачных сервисов требует дополнительных компонентов, лицензии или учётных данных. Наличие кнопки в интерфейсе не гарантирует, что модуль готов к работе. Перед проектом составляют перечень обязательных выходов и проверяют их на тестовой лицензии.
Качество результата ограничено качеством исходника и определённостью формы. Сильно различающиеся документы, рукопись, фото с перспективой и таблицы без устойчивых колонок потребуют ручной проверки или специализированного распознавания. Процент автоматизации измеряют на реальном наборе, включая плохие страницы, а не на одной идеальной копии.
Совместимость и подготовка рабочего места
Перед установкой проверяют поддерживаемую версию Windows, разрядность и доступ к требуемым компонентам. Для старого TWAIN-драйвера разрядность особенно важна. На рабочем месте должны быть права на каталоги программы, общую папку заданий, временные изображения, журналы и выход. Недостаток прав часто выглядит как ошибка импорта или экспорта, хотя сам файл открывается вручную.
Свободное место рассчитывают по пиковому объёму, а не по размеру готового PDF. Во время обработки хранятся исходники, отрисованные страницы, OCR-данные, временные файлы и результат. Большой цветной пакет может занимать во много раз больше итогового архива. Рабочий каталог лучше размещать на быстром диске, а резервное копирование настраивать отдельно.
Антивирус и контролируемый доступ к папкам могут блокировать создание временных файлов, сценарии или запуск вспомогательных движков. Исключение добавляют только для проверенных каталогов и исполняемых файлов, а не отключают защиту целиком. После изменения политики повторяют тест импорта, OCR и вывода.
Для сетевых коннекторов проверяют DNS, прокси, сертификаты, порты и часы системы. Неверное время может нарушить TLS и OAuth. Учётную запись сервиса документируют отдельно от личной учётной записи администратора, чтобы смена сотрудника не остановила поток.
Устранение неполадок
Сканер не найден или не начинает подачу
Откройте Select Source и убедитесь, что выбран именно TWAIN-драйвер. Запустите родную утилиту производителя и сделайте один скан. Если устройство работает только через WIA, установите полноценный TWAIN-пакет. При несовпадении разрядности проверьте подходящий вариант приложения или драйвера. Для сетевого устройства временно используйте сканирование в папку, чтобы отделить проблему драйвера от обработки документов.
Если диалог драйвера появляется, но Start Scan не получает страницы, отключите автоматическое закрытие окна и упрощайте параметры: односторонний режим, 300 dpi, оттенки серого, одна страница. Затем по одному возвращайте duplex, автоподачу и автоматические опции. Так определяется параметр, который драйвер не поддерживает.
PDF импортируется пустым или с неправильным текстом
Сравните режим извлечения PDF-текста и рендеринг. Если изображение страницы видно, а поля пусты, запустите OCR и проверьте язык. Если текст есть, но слова разделены лишними пробелами, настройте конкретное поле: используйте OCR, ограничение пробелов или регулярное выражение. Не отключайте пробелы глобально для длинного текста, иначе слова склеятся.
Для защищённого PDF проверьте пароль и разрешения. Файл, который открывается в просмотрщике после ручного ввода пароля, не обязательно доступен автоматическому процессу. Настройте правило пароля либо отправляйте документ в исключение. Повреждённый PDF сначала пересохраните проверенным средством и сравните число страниц.
OCR путает цифры и буквы
Уменьшите набор допустимых символов в зоне. Для суммы оставьте цифры, разделители и знак минус; для номера — только ожидаемые буквы, цифры и служебные знаки. Проверьте 300–400 dpi, поворот и контраст. Если ошибка связана с одним шрифтом, сравните доступные движки на десяти разных документах, а не на одной строке.
Регулярное выражение должно проверять структуру, но не скрывать ошибку. Если символ не соответствует маске, поле лучше оставить ошибочным для проверки, чем автоматически заменять похожие знаки без контекста. Замена O на 0 допустима только в позиции, где буква невозможна.
Зона читает соседний текст
Включите View Labels и Zoom Areas, выберите поле и посмотрите фактические границы. Уменьшите зону до значения либо привяжите её к текстовому якорю. Если положение меняется между поставщиками, создайте отдельные типы. Если оно меняется внутри одного типа, используйте Intelli-Tag или относительный триггер.
Проверьте масштаб и поворот. Зона, настроенная на 300 dpi, может смещаться при необычном рендеринге PDF или обрезанных полях. В тестовый набор добавьте страницы с другим размером и убедитесь, что правило масштабирования работает ожидаемо.
Документы разделяются не там
Сначала отключите все способы разделения, кроме одного, и повторите импорт тестового набора. Для пустых страниц настройте порог на крайних образцах. Для штрихкода ограничьте типы и область. Для IDR проверьте подтип первой или последней страницы. Несколько активных правил могут создавать двойные границы.
Если страница-разделитель исчезает, проверьте режим: PatchCode и некоторые варианты Barcode Split удаляют технический лист. Если на нём была полезная информация, измените процесс и помещайте код на первой странице документа либо используйте триггер без удаления.
Сетка пропускает строки или делит одну строку на две
Проверьте мастер-колонку, высоту строки, границы тела и переносы в описании. Выберите столбец, заполненный в каждой позиции. Увеличьте минимальную высоту только после проверки мелких строк. Если таблица продолжается на следующей странице, настройте начало и конец для каждой страницы и протестируйте перенос.
Откройте Modules Panel, прочитайте сетку и сравните зелёные и оранжевые области с исходником. Пропущенную исключительную строку можно добавить вручную, но повторяемая ошибка означает неверную конфигурацию. Check Balance помогает обнаружить пропуск, но не указывает его место.
Поля остаются красными после исправления
Убедитесь, что значение сохранено и правило проверки применилось заново. Ошибка может исходить не из OCR, а из обязательности, справочника, диапазона или зависимого поля. Откройте свойства поля и определите конкретное условие. При lookup проверьте соединение с базой и нормализацию ключа.
Если исправляется одно поле, а ошибка остаётся в группе, раскройте группу и найдите другое обязательное значение. В Grid View отфильтруйте ошибки и перейдите к соответствующей ячейке. После изменения шаблона перечитайте затронутые документы, потому что старые статусы могли сохраниться.
Экспорт создаёт дубликаты
Определите уникальный ключ и поведение при существующем объекте. Проверьте шаблон имени файла, настройки базы или коннектора. Выполните повторный экспорт тестового пакета и убедитесь, что результат обновляется либо отклоняется. Не полагайтесь только на имя PDF: одинаковые номера встречаются у разных поставщиков.
Журнал должен связывать пакет, документ, ключ и ответ назначения. Если первая попытка завершилась сетевой ошибкой, проверьте фактическое наличие объекта перед повтором. Тайм-аут мог произойти после успешной записи, и слепой повтор создаст второй экземпляр.
Письма не отправляются
Проверьте сервер, порт, TLS, способ аутентификации и адрес отправителя. Для Microsoft 365 и других современных сервисов может требоваться OAuth; обычный пароль или отключённая базовая аутентификация приведут к отказу. Сначала отправьте письмо на внутренний адрес без динамических полей, затем добавьте вложение и шаблон.
Если часть документов отправляется, а часть нет, сравните размер вложения и адрес получателя. Поле e-mail должно пройти проверку формата. Сохраните ответ SMTP в журнале. Не повторяйте весь пакет без фильтра, иначе успешно отправленные письма уйдут второй раз.
Hot Folder не видит новые файлы
Проверьте маску, подпапки, расписание и права учётной записи службы. Создайте маленький тестовый файл прямо в отслеживаемой папке. Если локальный путь работает, а сетевой нет, используйте UNC-путь и выдайте права сервисной учётной записи. Убедитесь, что файлы не перемещаются другим процессом раньше импорта.
Для больших файлов добавьте задержку и не копируйте их с конечным именем сразу: временное расширение можно переименовать после завершения передачи. Это исключает импорт частичного PDF. Проверьте папку ошибок и журнал продолжения после сбоя.
Обработка большого пакета замедляется
Разделите диагностику на импорт, рендеринг, OCR, проверки и выход. Снизьте число параллельных OCR-процессов, если системе не хватает памяти, или увеличьте его при свободных ресурсах. Цветные 600-dpi страницы требуют значительно больше памяти, чем 300-dpi серые. Для цифрового PDF используйте реальный текст, когда он корректен.
Рабочий каталог разместите на быстром локальном диске, а не на медленном сетевом ресурсе. Сеть оставьте для входа и результата. Удаляйте или архивируйте завершённые тестовые пакеты по регламенту, но не очищайте папку вручную во время обработки.
Как настроить пилотный процесс
- Соберите не менее нескольких десятков реальных документов, включая плохие сканы, разные макеты, пустые обороты и исключения.
- Опишите поля, обязательность, форматы, источники справочников и конечные системы до создания зон.
- Создайте задание, настройте один источник ввода и один способ разделения, затем проверьте структуру пакета.
- Настройте типы, зоны, Intelli-Tag и сетки поэтапно; после каждого этапа измеряйте ошибки на всём наборе.
- Добавьте проверки, справочники и правила исключений, не превращая сомнительные значения в автоматически подтверждённые.
- Настройте один выходной модуль, повторный экспорт и журнал, затем подключайте дополнительные назначения.
- Зафиксируйте расположение панелей и короткую инструкцию оператора, отделив права настройки от обычной индексации.
- Запустите пилот на копиях документов и сравните число страниц, поля, строки таблиц и объекты в целевой системе.
Критерий готовности — не единичный успешный документ, а воспроизводимый результат на всём наборе. Следует отдельно измерять правильность разделения, классификации, полей, строк сетки и доставки. Ошибка страницы и ошибка одного символа имеют разный риск, поэтому общий процент OCR не заменяет контроль бизнес-результата.
После запуска сохраняют эталонный пакет для регрессионной проверки. Любое изменение движка, зоны, регулярного выражения, справочника или выходной схемы прогоняют на этом наборе. Если новая настройка исправляет один макет, но ухудшает другой, создают отдельное правило или тип вместо глобального компромисса.
Организация ежедневной работы
Оператору достаточно знать выбор задания, запуск ввода, проверку границ, обработку, фильтр ошибок, исправление полей и экспорт. Администратор отвечает за зоны, триггеры, сетки, справочники, сценарии и коннекторы. Такое разделение снижает риск случайного изменения конфигурации во время срочной обработки.
В начале смены проверяют доступность источника, тестовое сканирование и соединение с назначением. В конце — отсутствие зависших пакетов, содержимое папки ошибок и журнал экспорта. Пакет не считается завершённым только потому, что OCR прошёл без красных полей: целевая система должна подтвердить приём.
Исключения собирают и анализируют по причинам: новый макет, плохое качество, неизвестный поставщик, неверный штрихкод, недоступная база, ошибка выхода. Если одна причина повторяется, её устраняют в задании или процессе ввода. Ручное исправление одного и того же дефекта каждый день означает, что автоматизация не завершена.
Документы с персональными или финансовыми данными обрабатывают с учётом доступа к рабочим папкам, журналам и облачным OCR. Тестовые наборы должны быть обезличены либо защищены так же, как рабочие. Снимки экрана для поддержки не должны содержать пароли, ключи API и реальные реквизиты без необходимости.
Итоговый рабочий подход
ChronoScan Capture раскрывается в повторяемых задачах, где страницы нужно не только сохранить, но и превратить в проверенные данные. Надёжный процесс строится в порядке ввод — разделение — тип — распознавание — проверка — выход. Попытка начать с экспорта или сложного сценария без устойчивой структуры пакета приводит к трудно диагностируемым ошибкам.
Для первой конфигурации достаточно одного типа документа, нескольких полей, одного способа разделения и файлового выхода. Затем добавляют относительные теги, сетки, справочники и корпоративные коннекторы. Пошаговое усложнение даёт контроль над причиной каждой ошибки и позволяет сохранить рабочий базовый вариант.
Главный практический результат — оператор видит только исключения, а обычные документы проходят одинаковый путь. Для этого нужны качественные образцы, узкие правила, понятные статусы и проверяемый экспорт. Когда эти элементы настроены, пакет из сотен страниц обрабатывается как единый управляемый процесс, а не как набор файлов, который приходится разбирать вручную.