Aquaforest Searchlight

Aquaforest Searchlight проверяет библиотеки SharePoint, OneDrive, Azure и файловые папки, находит сканы и частично индексируемые PDF, распознаёт текст, создаёт поисковый слой, сохраняет исходные метаданные и запускает повторную обработку по расписанию.

Работа строится вокруг библиотек — отдельных заданий с собственным источником, фильтрами документов, OCR-профилем, архивом, расписанием и оповещениями. На панели Dashboard видно, сколько файлов полностью доступно для поиска, какие документы содержат только изображения или неполный текстовый слой, когда выполнялся последний запуск и не остановилась ли обработка из-за ошибки подключения.

Перед первым массовым распознаванием полезно выполнить только аудит: программа скачивает или копирует документы во временную папку, анализирует их содержимое, записывает результаты в базу и показывает объём будущей работы, не заменяя исходники. После проверки статистики для той же библиотеки включают OCR, задают правила архивации и запускают обработку вручную либо по графику.

Скачать Aquaforest Searchlight

Оценка 9.7 Рекомендуем
  • Редактирование PDF
  • Русский интерфейс
  • Просто новичкам
Скачать бесплатно на Windows
Лучшая альтернатива
Aquaforest Searchlight
Оценка 8.5
  • Только Windows
  • Требуется ключ лицензии
  • Нет ручной правки PDF
Скачать Aquaforest Searchlight
Загрузка начнётся после нажатия

Логика обработки документов

Интерфейс Aquaforest Searchlight: Логика обработки документов

Каждая библиотека проходит две независимые стадии. На стадии аудита Searchlight получает файл из выбранного хранилища, помещает рабочую копию во временный каталог и определяет, есть ли в PDF пригодный для индексирования текст. Результат относится к одной из практических групп: документ полностью доступен для поиска, доступен частично, состоит только из изображений либо не поддаётся анализу из-за повреждения или иной ошибки. Такая классификация важнее простого подсчёта расширений: два файла с окончанием PDF могут требовать совершенно разных действий.

На стадии OCR обрабатываются только категории, отмеченные в Document Settings. Для скана формируется текстовый слой, после чего готовый PDF возвращается в исходное хранилище. Если входом служит TIFF, JPEG, PNG или BMP, программа создаёт PDF; судьба исходного изображения зависит от настройки удаления и правил архива. В SharePoint результат может стать новой версией того же элемента, поэтому перед включением массовой замены необходимо согласовать версионирование, публикацию основной версии и комментарий к check-in.

Аудит и распознавание не следует смешивать в первом запуске на неизвестном архиве. Предварительный отчёт выявляет долю сканов, ошибочных файлов, чрезмерно больших изображений и документов с уже существующим скрытым текстом. По этим данным выбирают OCR-движок, число ядер, объём временного диска и допустимое окно обслуживания. Такой порядок снижает риск, что длительная очередь займёт рабочий день или заменит файлы, которые достаточно было оставить без изменений.

Dashboard: контроль всех библиотек

Интерфейс Aquaforest Searchlight: Dashboard: контроль всех библиотек

Dashboard сводит библиотеки в одну таблицу. Для каждой строки показываются имя, тип источника, время последнего запуска, назначенное расписание, доля доступных для поиска документов и текущее состояние задачи. Рядом расположены команды запуска, паузы и остановки. По этой панели удобно отличать нормальное ожидание очередного окна от зависшего задания: статус службы отображается отдельно в нижней части окна, а состояние конкретного запуска — в строке библиотеки.

Процент поисковой доступности не является оценкой качества распознавания отдельных слов. Он показывает, какая часть проверенных документов классифицирована как полностью searchable. Если показатель резко изменился после добавления новых папок, нужно открыть Status и Run Details: причиной может быть массовая загрузка сканов, недоступный раздел хранилища, изменение фильтра или ошибки чтения. Сравнивать проценты корректно только при одинаковом составе источников и правилах аудита.

При нескольких заданиях Dashboard помогает распределять обработку по времени. Тяжёлую историческую библиотеку можно запускать ночью, а небольшую папку входящих документов — короткими непрерывными циклами. Одновременный старт множества библиотек увеличивает нагрузку не только на процессор OCR, но и на SharePoint, Azure, сеть, базу данных и временный каталог. Поэтому панель лучше использовать как диспетчер очередей, а не как кнопку запуска всех задач сразу.

Создание библиотеки и выбор источника

Интерфейс Aquaforest Searchlight: Создание библиотеки и выбор источника

Новая библиотека создаётся кнопкой Add new library. Мастер сначала просит выбрать тип источника: Windows File System, SharePoint On-Premises, SharePoint Online, Azure Blob Storage или Azure File Storage. Затем добавляются одна или несколько локаций. Для SharePoint это могут быть коллекции сайтов, отдельные сайты, библиотеки документов и при включённой обработке списков — вложения элементов. Для файловой системы задаются локальные либо сетевые пути, а для Azure — контейнеры или файловые ресурсы с соответствующими учётными данными.

Имя библиотеки должно описывать не технический сервер, а рабочую область: например, входящие счета, архив договоров или отсканированные дела за конкретный период. Это имя появляется в Dashboard, отчётах и шаблонах писем, поэтому одинаковые названия быстро делают уведомления бесполезными. Крупное хранилище разумно делить на несколько библиотек, если разделам нужны разные языки OCR, расписания, архивы или правила сохранения метаданных.

В мастер можно включить режим Audit only либо Audit and OCR. Первый безопасен для инвентаризации, второй после анализа сразу передаёт подходящие документы в распознавание. Здесь же задаётся число используемых процессорных ядер. Максимальное значение не всегда оптимально: при медленном сетевом источнике или ограниченном SharePoint больше параллельных заданий может увеличить число повторных запросов, а не ускорить итоговый цикл.

Подключение SharePoint и OneDrive for Business

Для SharePoint важно указывать адрес сайта или библиотеки, а не страницу представления с окончанием Forms/AllItems.aspx и не служебный путь _layouts. Неверный адрес часто проходит визуальную проверку в браузере, но мастер не может перечислить документы. Если подключение не создаётся, сначала сокращают URL до корня нужного сайта или библиотеки, затем проверяют доступ той же учётной записи к элементам, версиям и метаданным.

Учётной записи нужны права не только на чтение. При включённом OCR Searchlight загружает изменённый файл обратно, выполняет check-out и check-in, может создавать версию, сохранять поля и добавлять комментарий. Отдельно следует проверить библиотеки с обязательным извлечением, утверждением содержимого или сочетанием основных и промежуточных версий. Недостаточные права обычно проявляются уже после успешного аудита, потому что анализ требует чтения, а публикация результата — записи.

OneDrive for Business обрабатывается через инфраструктуру Microsoft 365 и должен быть доступен выбранной идентификации. Для современных сред предпочтительна конфигурация, соответствующая политике организации и многофакторной аутентификации; сохранённый пароль обычной учётной записи может не пройти условный доступ. При плановом запуске доступ должен работать без интерактивного окна, иначе ручная проверка соединения окажется успешной, а служба ночью не сможет получить файлы.

Особенности списков SharePoint

Опция Process SharePoint Lists относится к вложениям элементов списков, а не к обычным документным библиотекам. Перечисление большого числа элементов и их вложений может заметно увеличить длительность аудита. Включать эту настройку стоит только там, где вложенные сканы действительно участвуют в поиске; иначе дополнительный обход создаёт нагрузку без полезного результата.

Для списков необходимо отдельно проверить сохранение полей Created, Created By, Modified и Modified By. Поведение метаданных отличается от работы с документами, особенно если вложение заменяется новым PDF. Контрольный запуск на копии списка помогает увидеть, какие поля изменяет учётная запись службы и соответствует ли это требованиям аудита.

Файловая система и длинные пути

Для локальных и сетевых папок Searchlight копирует файл во временную область, обрабатывает его и возвращает результат. У службы должны быть права чтения, создания, замены и удаления в источнике, архиве, каталоге ошибок и папке отчётов. Проверка через Проводник под администратором недостаточна: служба может работать от другой учётной записи и видеть сетевой ресурс иначе. Надёжный тест — создать и удалить пробный файл именно с учётными данными службы.

В источниках с длинными именами папок полезно включить системную политику Enable Win32 long paths на поддерживаемых выпусках Windows, затем перезапустить интерфейс и службу. Без этого отдельные глубоко вложенные документы могут попадать в ошибки, хотя корневой каталог открывается нормально. Путь увеличивается и во временной папке, поэтому короткий рабочий каталог снижает риск превышения ограничения.

Разные варианты файлового источника учитывают стандартные, Unicode- и длинные пути. Выбор должен соответствовать реальному архиву: смешанная коллекция с национальными символами и глубокой иерархией требует более осторожной проверки, чем плоская англоязычная папка. Для сетевого ресурса лучше использовать UNC-путь, доступный службе постоянно, а не букву диска, подключённую только в пользовательском сеансе.

Azure File Storage и Azure Blob Storage

Интерфейс Aquaforest Searchlight: Azure File Storage и Azure Blob Storage

Azure File Storage подходит для иерархии, похожей на сетевую папку, а Blob Storage — для контейнеров объектов. В библиотеке указывается соответствующий тип, после чего добавляются нужные локации. Ошибка выбора не исправляется одной заменой адреса: механизмы перечисления, идентификаторы и правила путей различаются, поэтому источник создают заново или корректируют его профиль в Library Settings.

При работе с облачным хранилищем скорость определяется не только OCR. На каждый файл приходится загрузка рабочей копии и обратная передача результата; архивирование добавляет ещё одну операцию. Для больших многостраничных TIFF и PDF временный диск и канал связи могут стать узким местом раньше процессора. Перед массовой очередью следует измерить длительность на репрезентативной выборке, включающей маленькие документы, крупные сканы и файлы с ошибками.

Если для SMTP или облачных подключений используется Azure OAuth2, параметры задаются в Settings. Токен и разрешения должны быть доступны фоновому процессу, а не только пользователю, который открыл интерфейс. После изменения идентификации проверяют и чтение, и запись: успешное перечисление контейнера ещё не доказывает возможность заменить документ или сохранить отчёт.

Document Settings: какие файлы попадут в очередь

Интерфейс Aquaforest Searchlight: Document Settings: какие файлы попадут в очередь

В Document Settings выбираются категории PDF, которые разрешено обрабатывать: полностью поисковые, частично поисковые, image-only и иные результаты аудита. Для обычной миграции безопаснее распознавать только image-only и тщательно проверить частично поисковые документы. Повторная обработка fully searchable может увеличить размер, изменить визуальный слой или ухудшить уже качественный текст, если не задана специальная причина.

Там же включаются TIFF, BMP, JPEG и PNG. Изображение после OCR превращается в PDF, поэтому необходимо заранее определить, должен ли исходный файл оставаться рядом, удаляться после успешного результата или перемещаться в архив. Настройка удаления применяется только после успешной обработки; однако организационно всё равно нужен резервный путь, потому что ошибочная классификация или неверное имя выходного файла обнаруживаются уже после запуска.

Дополнительная опция позволяет извлекать и распознавать PDF-вложения внутри MSG. Она полезна для почтовых архивов, где скан хранится не отдельным документом, а вложением сообщения. При расчёте объёма нужно учитывать, что один MSG может породить несколько операций. Текст самого письма и произвольные форматы вложений не следует считать эквивалентом PDF-вложения: профиль предназначен для конкретной цепочки извлечения и OCR.

Фильтры по датам, путям и регулярным выражениям

Чтобы не запускать весь архив, Document Settings ограничивает документы по времени создания или изменения. Дата полезна при первичной обработке новых поступлений, но требует понимания метаданных источника: копирование между хранилищами может изменить Modified, тогда как Created сохраняется не всегда. Перед применением фильтра следует открыть несколько реальных элементов и проверить, какое поле отражает бизнес-действие, например дату сканирования или дату миграции.

Исключения по путям отсекают служебные каталоги, архивы, тестовые области и папки с конфиденциальными материалами. Условие необходимо формулировать так, чтобы оно не совпадало с частью обычного имени. Для сложного отбора используются регулярные выражения. Их проверяют на небольшой библиотеке с заранее известным набором: выражение, которое кажется очевидным, может зависеть от регистра, разделителей пути и полного имени, передаваемого механизмом перечисления.

Фильтры должны предотвращать повторное попадание выходных и архивных файлов в исходную очередь. Если архив расположен внутри наблюдаемого дерева и не исключён, следующий цикл увидит копии как новые документы. Это создаёт дубликаты, лишние версии и растущую нагрузку. Самое надёжное решение — физически отделить архив и папку ошибок; если это невозможно, добавить точные исключения и подтвердить их по Run Details.

Временная папка, ошибки и повторные попытки

Временная папка принимает копии на время аудита и OCR. Ей нужен запас, сопоставимый не со средним размером документа, а с суммой одновременно обрабатываемых файлов и промежуточных изображений. Повторная визуализация многостраничного PDF при высоком DPI способна кратно увеличить рабочий объём. Каталог на медленном или почти заполненном диске вызывает задержки, которые ошибочно принимают за проблему SharePoint или движка распознавания.

Для документов, которые не удалось обработать, можно настроить копирование или перемещение в отдельную локацию с сохранением структуры папок. Копирование безопаснее на этапе настройки, поскольку исходник остаётся на месте; перемещение полезно в контролируемом входящем потоке, где ошибка должна покинуть рабочую очередь. В обоих случаях следует исключить каталог ошибок из источника, иначе следующий запуск снова подхватит тот же файл.

Число повторных попыток выбирают с учётом характера сбоев. Кратковременная сеть или блокировка документа оправдывает несколько повторов, а повреждённый PDF не станет исправным после десятого запроса. В Run Details нужно разделять ошибки загрузки, публикации, декодирования изображения и превышения лимитов: одинаковая политика повторов для всех причин только удлиняет очередь и скрывает действительно проблемные документы.

Как Searchlight определяет поисковый PDF

PDF считается доступным для поиска, когда в нём есть текстовые операторы и содержимое можно индексировать. Однако наличие нескольких текстовых элементов не гарантирует полноту. Скан с маленьким штампом, введённым как текст, может попасть в категорию partially searchable: часть страницы содержит символы, а основное изображение — нет. Именно поэтому программа разделяет полностью и частично поисковые документы, позволяя назначить им разные действия.

Параметр pdfTextOperators в расширенной конфигурации влияет на критерии обнаружения текста. Менять его следует только после анализа ложных результатов и с пониманием синтаксиса PDF. Слишком узкий набор операторов отправит качественные документы на повторный OCR, слишком широкий — оставит сканы без поискового слоя. Контрольная выборка должна включать цифровые PDF, сканы, гибридные документы, формы и файлы с векторной графикой.

После OCR полезно провести повторный аудит той же библиотеки и сравнить категории. Рост fully searchable подтверждает наличие текстового слоя, но не заменяет проверку точности. Для языков со сложной разметкой, таблиц, мелкого шрифта и плохих копий нужно открыть несколько результатов, выполнить поиск по редким словам и скопировать фрагмент текста. Так обнаруживаются ошибки порядка чтения и распознавания, которые агрегированный процент не показывает.

Стандартный OCR-движок

Интерфейс Aquaforest Searchlight: Стандартный OCR-движок

Стандартный движок подходит для документов на одном выбранном языке из поддерживаемого набора европейских языков. В General Settings доступны Auto Rotate, Deskew, Remove Lines, Despeckle, обработка рамок и поле Advanced Flags. Язык задаётся для всей библиотеки, поэтому архив с русскими, английскими и немецкими документами лучше разделить на профили либо использовать Extended OCR, если документы действительно смешанные.

Auto Rotate анализирует ориентацию текста и поворачивает страницу перед распознаванием. Deskew исправляет небольшой наклон после сканирования, Remove Lines уменьшает влияние линий форм и таблиц, а Despeckle удаляет одиночные точки и шум. Эти операции не нужно включать автоматически все сразу: агрессивное удаление линий может повредить символы, штрихкоды или чертежи, а сильное удаление точек — диакритические знаки и мелкую пунктуацию.

Параметр Box Graphics определяет обращение с рамками при OCR. Он полезен для бланков, где текст заключён в прямоугольники, но требует проверки на таблицах: удалённая рамка облегчает сегментацию текста, однако визуальная структура может быть значимой. Save Pre-despeckle сохраняет промежуточный вариант для диагностики и увеличивает объём временных данных, поэтому его используют при настройке качества, а не постоянно.

Стандартный OCR для PDF

Интерфейс Aquaforest Searchlight: Стандартный OCR для PDF

В PDF Source Settings решается, будет ли исходный PDF повторно превращён в изображения. Re-Image PDF полезен, когда файл содержит некорректный скрытый текст, сложные маски или смешанную структуру, мешающую обычному OCR. Одновременно задаётся DPI. Повышение разрешения помогает мелкому шрифту до определённого предела, но увеличивает память, время и размер промежуточных страниц; слишком высокий DPI не восстанавливает детали, отсутствующие в исходном скане.

Настройки позволяют сохранять закладки, метаданные и предпочтения просмотра. Их необходимость зависит от назначения архива. Для навигационных PDF потеря закладок заметнее, чем небольшое изменение размера, а в юридическом хранилище метаданные могут быть частью учётной записи документа. После включения соответствующих флажков нужно сравнить не только текст, но и структуру закладок, начальный режим просмотра, поля свойств и число страниц.

Remove Hidden Text удаляет существующий невидимый слой перед новым распознаванием. Это средство для документов с неверным OCR, а не универсальный ускоритель. Если скрытый текст уже качественный, его удаление создаёт лишнюю работу и потенциально меняет координаты символов. Force Vector Check помогает отделить страницы с полезным цифровым содержимым от изображений, но на технических PDF необходима выборочная проверка, чтобы векторные подписи не были приняты за достаточный текст.

Преобразование изображений в PDF

Интерфейс Aquaforest Searchlight: Преобразование изображений в PDF

Image Source Settings определяет параметры PDF, создаваемого из TIFF, BMP, JPEG и PNG. Здесь выбираются версия PDF, режим сжатия и при необходимости соответствие PDF/A с последующей валидацией. Один и тот же профиль не всегда подходит фотографиям и монохромным сканам: JPEG эффективно для цветных страниц, тогда как двухцветные документы обычно лучше сжимаются алгоритмами, рассчитанными на чёрно-белое изображение.

При выборе PDF/A следует учитывать не только переключатель создания, но и результат проверки. Валидация может обнаружить, что конкретная страница или вложенный объект не соответствует заданному профилю. Такие файлы нельзя молча считать готовыми: их выводят в отчёт, открывают в независимом валидаторе и решают, допустимо ли повторное преобразование с более консервативными настройками.

Имя выходного PDF должно сохранять связь с исходным изображением и не конфликтовать с существующим файлом. В папке, где уже есть scan001.tif и scan001.pdf, автоматическая замена требует заранее определённой политики. Архивирование исходника и тест на коллизии имён защищают от ситуации, когда результат одного формата перезаписывает другой документ с тем же базовым названием.

Extended OCR: языки и сложные оригиналы

Интерфейс Aquaforest Searchlight: Extended OCR: языки и сложные оригиналы

Extended OCR использует движок IRIS и рассчитан на более широкий набор языков, смешанные документы и дополнительные методы предварительной обработки. В одном профиле можно выбрать несколько языков с совместимым алфавитом; руководство ограничивает список восемью позициями. Чем шире набор, тем больше вариантов движок рассматривает при распознавании, поэтому добавлять языки, которых нет в библиотеке, невыгодно: это может снизить точность и увеличить время.

Для азиатских, арабского, фарси, иврита и расширенного сжатия могут требоваться отдельные модули лицензии. Наличие языка в интерфейсе ещё не подтверждает право на обработку. Перед проектом с такими документами проверяют License Details, запускают небольшую выборку и убеждаются, что служба применяет нужный модуль без демонстрационных ограничений.

Extended OCR стоит выбирать не потому, что он формально содержит больше функций, а когда источники действительно используют смешанные языки, тёмные поля, сложный фон, слабый контраст или нуждаются в специальном сжатии. Для чистых одноязычных сканов Standard может дать предсказуемый результат с меньшим числом параметров. Сравнение проводят на одинаковых файлах и оценивают скорость, размер, поиск по контрольным словам и визуальную сохранность.

Очистка и выравнивание в Extended OCR

General Settings Extended OCR включает Auto Rotate, Deskew, Remove Dark Borders, Keep Original Image, Despeckle, Advanced Despeckle, Remove White Pixels и другие операции. Remove Dark Borders полезен для книжных сканов и страниц с чёрной рамкой от крышки сканера. Если рамка содержит рукописные отметки или печать у края, автоматическая очистка может удалить значимую область, поэтому сначала проверяют самые тесно обрезанные страницы.

Keep Original Image сохраняет визуальный слой, добавляя распознанный текст без полной замены изображения. Этот режим важен там, где внешний вид документа имеет доказательственное значение. Обратная сторона — исходные дефекты и большой размер остаются. Если задача одновременно требует компактного архива, сравнивают вариант с сохранением оригинала и вариант с повторной компрессией, не полагаясь только на процент уменьшения.

Remove Blank Pages удаляет страницы, признанные пустыми, и имеет чувствительность. Высокая чувствительность способна принять бледный штамп или карандашную отметку за шум. Для договоров, медицинских и кадровых документов автоматическое удаление нужно либо отключить, либо валидировать по выборке, где присутствуют почти пустые обороты. Число страниц до и после обработки обязательно включают в контроль качества.

Расширенная предварительная обработка

Интерфейс Aquaforest Searchlight: Расширенная предварительная обработка

Advanced Pre-processing содержит отдельные правила удаления горизонтальных и вертикальных линий. Для них настраиваются очистка, расширение, максимальный разрыв, толщина и минимальная длина. Это позволяет убрать сетку формы, не разрушая короткие штрихи букв. Настройки нужно подбирать на типовом шаблоне: значения для бухгалтерского бланка не подходят инженерному чертежу, где линии несут основную информацию.

Binarize переводит страницу к двухцветному представлению, а Brightness, Contrast, Smoothing, Threshold и Interpolate изменяют подготовленное изображение. Эти параметры взаимодействуют. Например, повышение контраста после неудачного порога может слить близкие символы, а сглаживание уменьшить тонкие элементы. Менять лучше по одному параметру и сохранять контрольные результаты, иначе невозможно понять, какая операция улучшила или ухудшила текст.

Для неоднородного архива выгоднее создать несколько библиотек с разными профилями, чем искать одну универсальную комбинацию. Газетные вырезки, факсы, чистые офисные сканы и формы с сеткой требуют различных настроек. Разделение также упрощает повторную обработку: проблемная категория не заставляет заново пропускать через экспериментальный фильтр документы, которые уже распознавались правильно.

PDF Source Settings в Extended OCR

Интерфейс Aquaforest Searchlight: PDF Source Settings в Extended OCR

Extended PDF Source Settings управляет версией выходного PDF, сохранением закладок и метаданных, удалением скрытого или видимого текста, DPI и проверкой векторного содержимого. Remove Visible Text применяют только при сознательном полном переформировании страницы: видимые надписи могут быть частью цифрового PDF, и их удаление без качественного изображения приведёт к потере информации.

Опции JPEG, JPEG 2000 и iHQC задают разные стратегии сжатия. iHQC относится к расширенной компрессии и зависит от лицензии. Сравнивать алгоритмы следует не на одном документе, а на наборе цветных сканов, монохромного текста, печатей и фотографий. Размер файла оценивают вместе с читаемостью мелкого шрифта и скоростью открытия; минимальный размер не является целью, если появляются артефакты вокруг символов.

Force Vector Check особенно важен в смешанных PDF, где часть страниц создана из офисного приложения, а часть отсканирована. Правильная настройка позволяет не растрировать цифровые страницы без необходимости. После обработки проверяют выборочно и текстовые, и сканированные страницы: первые должны сохранить чёткость при увеличении, вторые — получить поисковый слой.

Скрытый текст, повторное OCR и ложные совпадения

Скрытый текст располагается поверх или под изображением и используется поиском, хотя пользователь видит скан. Если старый слой содержит ошибки, новый OCR поверх него может оставить дублированные слова и неправильное выделение. Remove Hidden Text сначала очищает этот слой, после чего движок создаёт новый. Решение принимают по проверке копирования текста, а не по тому, что документ визуально выглядит как картинка.

Документы с водяными знаками, штампами и единичными цифровыми полями часто попадают в промежуточную категорию. Для них полезен отдельный профиль: удаление скрытого текста может быть оправдано, но полная повторная визуализация способна ухудшить векторные элементы. Перед массовой обработкой нужно сравнить поиск, выделение и печать на нескольких страницах разного типа.

Расширенная настройка ignorePreviouslyOcredDocuments помогает исключать файлы, уже обработанные Searchlight, но полагаться только на неё нельзя при миграции или изменении метаданных. Если документ был скопирован, переименован или создан другой системой, признаки предыдущего OCR могут не совпасть с ожиданием. Надёжное предотвращение циклов сочетает фильтр пути, аудит текстового слоя и понятную структуру архива.

PDF/A и проверка архивного результата

PDF/A выбирают, когда документ должен соответствовать требованиям длительного хранения. Профиль ограничивает некоторые возможности обычного PDF и требует встроенных ресурсов. Searchlight может создавать и валидировать такой результат, но итоговую политику хранения определяет организация: необходимо знать требуемый уровень соответствия и допустимость преобразования исходного документа.

Валидация после OCR должна фиксироваться отдельно от успешного распознавания. Файл может содержать searchable text, но не пройти требования PDF/A. В отчёте такие случаи выделяют в собственную очередь и не смешивают с повреждёнными входами. Исправление зависит от причины: шрифт, цветовой профиль, прозрачность или иной объект требуют разных действий.

Для документов с цифровыми подписями любое изменение содержимого обычно нарушает криптографическую целостность подписи. Такие файлы следует исключать из автоматической замены или обрабатывать по согласованной процедуре с сохранением оригинала. Архивная копия помогает восстановить исходное состояние, но не делает изменённый PDF подписанным заново.

Архивирование оригиналов

Archive Settings задаёт, нужно ли сохранять исходник перед заменой, куда его помещать и как формировать имя. В качестве архива доступны файловая система, SharePoint, SharePoint Online, Azure Blob Storage и Azure File Storage. Локацию лучше выбирать отдельно от источника и проверять права служебной учётной записи на создание каталогов и файлов.

Шаблон имени по умолчанию сочетает исходное имя и временную метку перед расширением. Временная метка защищает от коллизий при повторной обработке и позволяет связать копию с конкретным запуском. Если организация меняет шаблон, в нём должны остаться элементы, обеспечивающие уникальность; одно исходное имя недостаточно, когда документ проходит OCR повторно.

Опция сохранения структуры папок делает архив пригодным для восстановления, но увеличивает длину пути. Для SharePoint и старых файловых сред следует учитывать их ограничения на длину имени и полного пути. Контроль восстановления должен включать не только наличие файла в архиве, но и возможность найти его по исходной библиотеке, дате запуска и записи Run Details.

Метаданные, даты и авторы

Document Settings позволяет сохранять дату создания, дату изменения, автора создания и автора изменения. В SharePoint эти поля связаны с колонками элемента, а в файловой системе отображение и возможности записи отличаются. В руководстве отдельно подчёркивается различие между метаданными SharePoint и метаданными внутри PDF: включение одного набора не гарантирует сохранение другого.

При переносе результата между типами хранилищ часть полей сопоставляется приблизительно. Например, создатель может быть отображён как владелец файла, а некоторые атрибуты не имеют прямого аналога. Перед рабочим запуском составляют таблицу обязательных полей и проверяют их на входе, в архиве и у выходного PDF. Это особенно важно для записей, где Created и Modified используются в правилах хранения.

Сохранение метаданных требует прав на изменение системных полей и может конфликтовать с политиками SharePoint. Если поле после OCR меняется на учётную запись службы, нужно проверить сочетание настроек Retain и прав приложения. Ошибку нельзя исправить только редактированием PDF-свойств: колонка библиотеки и внутреннее поле документа — разные сущности.

Версионирование и check-in в SharePoint

В Library Settings можно включить SharePoint Versioning, выбрать публикацию основной версии и задать check-in comment. Если версионирование отключено, готовый PDF заменяет исходный элемент; при включённом режиме появляется новая версия. Политика должна учитывать квоты и число документов: массовый OCR большого архива способен заметно увеличить объём хранилища за счёт сохранённых предыдущих версий.

Публикация основной версии возможна только при соответствующей конфигурации библиотеки. Если SharePoint использует основные и промежуточные версии, настройки Searchlight должны совпадать с процессом утверждения. Автоматическая публикация может обойти ожидаемый ручной этап, а отсутствие публикации оставить результат невидимым части читателей. Проверка проводится пользователем с обычными, а не административными правами.

Комментарий к check-in поддерживает шаблонные значения даты и времени. Дополнительно можно записать комментарий в пользовательскую колонку типа Text или Date. Колонку создают заранее и проверяют её внутреннее имя и тип. Полезный комментарий должен отличать автоматический OCR от ручной правки, но не содержать секреты, пути к временным файлам или технические токены.

Scheduler: ручной, ежедневный и непрерывный запуск

Интерфейс Aquaforest Searchlight: Scheduler: ручной, ежедневный и непрерывный запуск

В Scheduler доступны Manual, ежедневный запуск в заданное время, Continuous и Run Once. Manual подходит для настройки и разовых миграций. Daily удобен для ночной обработки накопившихся документов. Run Once фиксирует отдельное окно. Continuous повторяет цикл между временем начала и окончания с интервалом в минутах, часах, днях или месяцах.

Непрерывный режим не означает мгновенное распознавание каждого загруженного файла. Служба завершает перечисление и обработку согласно циклу, а затем ждёт интервал. Слишком короткий интервал в большой библиотеке может наложить новый обход на длительную работу или постоянно нагружать источник. Интервал выбирают после измерения полного времени запуска и оставляют запас на сетевые задержки.

Расписание зависит от часового пояса, указанного в Settings, и состояния службы. После перевода часов, изменения часового пояса сервера или обслуживания Windows нужно убедиться, что следующий запуск отображается ожидаемо. Для критичной очереди полезно настроить письмо об успехе и отдельное оповещение об ошибке соединения: отсутствие письма не должно быть единственным способом обнаружить остановленную службу.

Служба Searchlight и фоновая работа

Аудит, OCR, расписания, оповещения и отчёты выполняет служба. Интерфейс показывает её состояние в нижней части окна. Если кнопки запуска доступны, но задача не двигается, сначала проверяют Service Status, затем журнал и системные службы Windows. Перезапуск интерфейса без перезапуска фонового процесса не всегда применяет изменённые параметры.

В Settings > Advanced службу можно включать и выключать. Остановка нужна перед изменением некоторых конфигурационных параметров, обслуживанием базы или переносом временного каталога. Перед остановкой проверяют, нет ли активного OCR: принудительное завершение во время обратной загрузки способно оставить файл извлечённым или создать незавершённую версию.

Служебная учётная запись должна иметь стабильный пароль или управляемую идентификацию и право входа как служба. После смены пароля задача может перестать обращаться к сетевым папкам, хотя интерфейс открывается у администратора. Проверку проводят по фактическому ночному запуску и Run Details, а не только по зелёному индикатору процесса.

Alerts: письма и отчёты

Интерфейс Aquaforest Searchlight: Alerts: письма и отчёты

В Alerts создаются правила уведомлений. Действием может быть отправка письма, формирование CSV, прикрепление отчёта или сохранение его в выбранную локацию. Адреса To, Cc и Bcc вводятся списком с разделителем; перед массовой рассылкой лучше отправить тест на технический адрес, чтобы проверить SMTP, кодировку темы и размер вложения.

Шаблоны сообщения поддерживают значения имени библиотеки, статуса, пути к журналу и текста ошибки. Они позволяют одному правилу обслуживать несколько задач, но письмо должно содержать достаточно контекста для действия: имя библиотеки, время, итог и число ошибок. Полный журнал лучше сохранять в защищённой папке, а не отправлять каждому получателю, поскольку в нём могут быть имена документов и пути.

Триггеры включают успешное завершение, ошибку, проблему соединения SharePoint или Azure и периодические отчёты. Для стабильной эксплуатации полезно разделить срочные ошибки подключения и обычную сводку. Сигнал о недоступном источнике отправляют сразу ответственному администратору, а статистический отчёт — ежедневно, еженедельно или ежемесячно владельцу процесса.

Run Details и разбор конкретного запуска

Интерфейс Aquaforest Searchlight: Run Details и разбор конкретного запуска

Run Details хранит историю запусков и список документов, прошедших аудит или OCR. Записи фильтруются, разбиваются на страницы и экспортируются в CSV. При выборе запуска отображаются его результаты, поэтому можно отличить старую ошибку от проблемы последнего цикла. Для расследования фиксируют идентификатор запуска и время до изменения настроек.

Контекстное меню позволяет копировать имя или путь, открыть файл либо его расположение, если оно доступно с машины администратора. Эта команда удобна для единичной проверки, но не должна заменять системный отчёт: путь, открывающийся у пользователя, может быть недоступен службе и наоборот. При сетевой ошибке доступ проверяют обеими идентификациями.

Журнал можно выводить в PDF, RTF или HTML, а табличные данные — в CSV. Форматы имеют разное назначение: CSV удобен для сортировки и сводных таблиц, а форматированный журнал — для передачи контекста в поддержку. Перед публикацией отчёта за пределами команды следует удалить конфиденциальные имена файлов, адреса сайтов и учётные сведения.

Оценка производительности

Производительность складывается из перечисления источника, передачи файлов, анализа PDF, растеризации, OCR, сжатия, архивации и обратной загрузки. График страниц в минуту из лабораторного примера нельзя переносить на реальный архив без измерения: цвет, DPI, число страниц, язык и предварительная обработка меняют скорость. Контрольный набор должен отражать фактическое распределение документов.

Число ядер регулирует параллелизм OCR, однако память и диск ограничивают его практическое значение. Несколько крупных страниц одновременно создают большие растровые буферы. Если память заканчивается, система начинает активно использовать файл подкачки, и увеличение ядер замедляет работу. Во время пилота наблюдают загрузку процессора, рабочий набор процессов, очередь диска, свободное место и сетевой трафик.

Для планирования окна обработки удобно измерить медиану и медленные процентили по страницам, а не только среднее. Несколько тяжёлых документов могут занять значительную часть ночи. Ограничение OCR Document Limit позволяет сдерживать размер одного запуска, после чего очередь продолжается следующим циклом. Это помогает укладываться в окно, но требует контроля, чтобы отставание не росло каждый день.

Работа с крупными и необычными изображениями

В конфигурации предусмотрен контроль предельных размеров изображения: упоминаются границы 32768 на 32768 пикселей и суммарно 75 миллионов пикселей. Такие лимиты защищают движок от чрезмерного потребления памяти. При их превышении документ нужно отдельно оценить: уменьшить разрешение, разделить лист или исключить технический чертёж из текстового OCR.

Многостраничный TIFF может содержать страницы разных размеров и ориентации. Проверять только первую страницу недостаточно. После преобразования сравнивают число страниц, порядок, ориентацию и читаемость крайних листов. Если одна аномальная страница блокирует весь файл, её предварительно исправляют специализированным редактором изображения и повторяют обработку копии.

Фотографии документов с перспективой, тенью и изогнутыми строками хуже подходят для пакетного профиля, рассчитанного на сканер. Deskew корректирует наклон, но не обязательно исправляет перспективные искажения. Для такого потока лучше улучшить захват на входе или выделить отдельный профиль, а не усиливать фильтры для всей библиотеки.

Совместимость и подготовка среды

Для поддерживаемой среды указываются 64-разрядные Windows 10 и Windows 11, а также Windows Server 2016, 2019 и 2022. Нужны .NET Framework 4.7.2, подходящий пакет Microsoft Visual C++ 2017 Redistributable и примерно 950 МБ для компонентов, не считая временных файлов, базы, журналов и архивов. Практический запас диска должен быть значительно больше минимального.

Для небольших заданий руководство рекомендует не менее 4 ГБ памяти, для более крупных — 8 ГБ и выше; реальный объём зависит от параллелизма и страниц. Сервер или виртуальная машина должны иметь постоянный доступ к источникам и не переходить в сон. Антивирусные исключения нельзя добавлять бездумно: сначала выясняют, блокирует ли сканирование временные файлы, и ограничивают исключение конкретным рабочим каталогом.

Компоненты SharePoint и сетевые зависимости должны соответствовать разрядности и типу подключения. После установки, обновления .NET или политик TLS выполняют тестовый аудит и тестовую обратную загрузку. Успешный старт окна не подтверждает, что служба может обработать документы в автономном режиме.

Лицензия и проверка доступных модулей

Интерфейс Aquaforest Searchlight: Лицензия и проверка доступных модулей

Без действующего ключа интерфейс сообщает об отсутствии лицензии и предлагает перейти к её вводу. В разделе License Details видны разрешённые возможности и ограничения. Перед настройкой библиотеки нужно проверить, доступны ли выбранный OCR-движок, языковые модули, дополнительные процессорные ядра и расширенная компрессия.

Лицензирование влияет на технический профиль: конфигурация, сохранённая на машине с расширенными модулями, может не выполнить те же операции на другом сервере. При переносе настройки импортируют только после активации и сверяют каждый переключатель. Если модуль недоступен, лучше явно заменить его поддерживаемой настройкой, а не ждать ошибки в середине ночной очереди.

Ключ и сведения активации не следует помещать в журналы, письма или скриншоты для широкой рассылки. Для обращения в поддержку достаточно диагностического пакета и описания, а секретные данные передают по согласованному защищённому каналу. Резервный план должен учитывать процедуру повторной активации после замены виртуальной машины.

Темы, часовой пояс и общие параметры

В Settings настраиваются лицензия, почтовое подключение, OAuth2, тема интерфейса, часовой пояс и дополнительные параметры службы. Наличие множества визуальных тем влияет только на удобство администратора; для рабочих инструкций лучше выбрать одну тему и делать скриншоты в ней, чтобы названия вкладок и расположение элементов совпадали.

Часовой пояс участвует в расписаниях и периодических отчётах. На сервере, обслуживающем несколько регионов, его нужно выбрать по бизнес-процессу, а не по местонахождению центра обработки данных. После изменения проверяют отображение следующего запуска и границы непрерывного окна, особенно в дни перехода на летнее или зимнее время.

Расширенные параметры могут изменять частоту проверки службы, параллелизм перечисления, поведение при ошибках и повторные запросы к SharePoint или базе. Это не набор универсальных ускорителей. Любое изменение фиксируют, применяют на тестовой библиотеке и сопоставляют с журналом; иначе одновременная правка нескольких значений затруднит откат.

Диагностический инструмент

Интерфейс Aquaforest Searchlight: Диагностический инструмент

В Help & Support доступен Diagnostic Tool. Он проверяет зависимости и собирает ZIP с журналами и сведениями, необходимыми для анализа проблемы. Инструмент запускают после воспроизведения ошибки, пока нужные записи ещё присутствуют. Перед передачей архива следует просмотреть его состав и соблюдать правила организации по обработке имён документов, адресов и системных данных.

Диагностика полезна при неясной разнице между интерфейсом и службой: например, соединение проверяется вручную, но плановый запуск падает. В отчёте можно увидеть окружение, конфигурацию и журналы фонового процесса. К обращению добавляют идентификатор библиотеки, время запуска, ожидаемое действие и один пример файла, если его разрешено передавать.

Не стоит заменять диагностический пакет снимком экрана с общей ошибкой. Код исключения, вложенная причина и последовательность повторных попыток часто находятся только в журнале. При этом ZIP не является резервной копией библиотеки: настройки и исходные документы нужно защищать отдельными средствами.

Очистка базы данных и журналов

История аудита и OCR накапливается в базе. Для обслуживания предусмотрен Aquaforest.Searchlight.DatabaseCleanup.exe, позволяющий удалять журналы по дате или идентификатору запуска. Очистку выполняют после резервного копирования и согласования срока хранения: старые Run Details могут понадобиться для расследования или подтверждения объёма обработанных документов.

Удаление файлов журналов вручную не равнозначно очистке базы. Несогласованное вмешательство оставляет записи без связанных данных или нарушает отчётность. Утилиту запускают при остановленном или контролируемом состоянии службы согласно процедуре, затем открывают интерфейс и проверяют историю нескольких библиотек.

Срок хранения выбирают по частоте запусков и требованиям аудита. Непрерывная библиотека создаёт больше записей, чем ежемесячная миграция. Полезно сохранять агрегированные CSV за закрытые периоды, а детальные технические записи очищать после установленного срока, чтобы база не росла без необходимости.

Типовой сценарий: инвентаризация перед миграцией

Перед переносом SharePoint или файлового архива создают библиотеку в режиме Audit only и включают все релевантные источники, но исключают корзины, архивы и системные папки. Первый результат показывает долю fully searchable, partially searchable, image-only и ошибок. Из каждой категории выбирают примеры и проверяют, соответствует ли классификация реальному содержимому.

Затем оценивают объём OCR по числу страниц и размерам, а не только по числу файлов. Для разных языков и качества формируют отдельные профили. Архив оригиналов направляют в независимое хранилище, а расписание ограничивают тестовым окном. После пилота повторно проводят аудит результата и сравнивают метаданные, версии, число страниц и возможность поиска.

Только после подтверждения профиля расширяют охват. Ошибки переносят в отдельную очередь: повреждённые PDF исправляют, чрезмерные изображения уменьшают, защищённые или подписанные документы исключают. Такой процесс даёт миграционной команде измеримый остаток, а не неопределённое утверждение, что OCR был запущен для всей библиотеки.

Типовой сценарий: входящие сканы

Для папки входящих сканов создают небольшую библиотеку с фильтром по формату изображения и коротким непрерывным интервалом. Исходники архивируются, успешные PDF возвращаются в целевую папку, ошибки перемещаются в карантин. Источник, архив и карантин не должны пересекаться, иначе файлы будут повторно попадать в цикл.

Профиль OCR подбирают к фактическому сканеру: ориентация, DPI, шум и язык обычно стабильны, поэтому можно использовать более точные настройки, чем для исторического архива. Remove Blank Pages включают только после теста двустороннего сканирования. В имени результата сохраняют идентификатор, используемый последующей системой учёта.

Оповещение об ошибке должно приходить оператору, который может пересканировать документ, а ежедневная статистика — владельцу процесса. Если очередь растёт, проверяют длительность полного цикла, доступность службы и число документов, ограниченное настройкой запуска. Увеличение ядер имеет смысл только после подтверждения, что узким местом является OCR, а не передача или публикация.

Типовой сценарий: смешанный архив PDF

В смешанном архиве цифровые PDF, сканы и гибридные документы лежат рядом. Сначала аудит отделяет fully searchable от partially searchable и image-only. Цифровые файлы исключают из OCR, чтобы не растрировать текст и не увеличивать размер. Частично поисковые документы анализируют по шаблонам: одни требуют удаления ошибочного скрытого слоя, другие содержат лишь отсканированное приложение к нормальному тексту.

Для гибридных документов важны Force Vector Check и правила обработки скрытого текста. На пилоте проверяют страницы с векторной графикой, встроенными шрифтами, формами и изображениями. Цель — добавить поиск там, где его нет, сохранив исходную чёткость цифровых страниц.

Отчёт после обработки должен показывать не только новый процент searchable, но и размер коллекции, число ошибок и изменение количества версий. Если рост хранилища слишком велик, пересматривают сжатие и архивную политику, не удаляя оригиналы до завершения проверки.

Типовой сценарий: формы, таблицы и чертежи

Формы с сеткой распознаются лучше после аккуратного удаления линий. В Standard OCR для этого есть Remove Lines и Box Graphics, в Extended — раздельные параметры горизонтальных и вертикальных линий. Минимальная длина и максимальный разрыв позволяют отличить рамку таблицы от короткого штриха символа. Результат проверяют на полях с цифрами и знаками пунктуации.

Технические чертежи требуют противоположной осторожности: линии являются содержимым, а текста может быть мало. Агрессивная очистка и повторная визуализация способны ухудшить чертёж. Такие документы лучше выделить в отдельную библиотеку, использовать Force Vector Check и ограничить OCR страницами, где поиск действительно нужен.

Для таблиц поисковый слой не гарантирует правильное восстановление строк и столбцов при копировании. Searchlight решает задачу индексирования PDF, а не структурированного извлечения данных. Если бизнес-процесс требует перенести суммы и ячейки в базу, нужен отдельный механизм извлечения и валидации.

Типовой сценарий: контролируемое хранение

В процессе с требованиями к прослеживаемости включают архивирование, сохранение метаданных и версий, комментарий check-in и отчёт по каждому запуску. Исходный файл остаётся доступным для восстановления, а результат связан с датой обработки. Права на архив ограничивают, чтобы обычный пользователь не мог изменить доказательственную копию.

PDF/A и валидацию включают только в соответствии с утверждённым профилем хранения. Для подписанных файлов и документов с юридически значимыми отметками создают исключения. Контрольная процедура сравнивает хэш или иные идентификаторы оригинала в архиве, число страниц, метаданные и статус выходного файла.

Периодический отчёт не заменяет журнал ошибок. Сводка показывает объём и процент, а Run Details позволяет проследить отдельный документ. Срок хранения журналов и архивов задают раздельно: технические записи можно очищать раньше, чем исходники, если требования это допускают.

Ошибка подключения к SharePoint

Если список библиотек пуст или соединение завершается ошибкой, сначала проверяют форму URL. Адрес должен указывать на корень сайта или документной библиотеки без страницы представления и служебных сегментов. Затем той же идентификацией открывают источник и проверяют чтение нескольких папок, включая самые глубокие.

Следующий этап — права записи, check-out, check-in и изменение метаданных. Аудит может завершиться успешно при доступе только на чтение, а OCR упасть на загрузке результата. В Run Details ищут момент сбоя: download, processing или upload. Это позволяет не менять OCR-параметры, когда проблема находится в SharePoint.

При ошибках сертификата безопаснее добавить точный SHA-1 thumbprint доверенного сертификата в список recognizedCertificateThumbprints, чем отключать все проверки. Параметр ignoreAllCertificateErrors создаёт слишком широкий риск и допустим лишь в изолированном контролируемом тесте. После изменения перезапускают интерфейс и службу и повторяют одну библиотеку.

Ошибка длинного пути или недоступной папки

Симптомы включают успешное перечисление верхнего уровня и ошибки только на глубоко вложенных файлах. На подходящих системах включают Enable Win32 long paths, выбирают короткий временный каталог и перезапускают процессы. Затем проверяют полный путь проблемного файла с учётной записью службы.

Если источник подключён буквой сетевого диска, служба может не видеть пользовательское сопоставление. Путь заменяют на UNC и назначают явные права. Каталоги архива, ошибок и отчётов проверяют отдельно: успешное чтение источника не подтверждает возможность создать файл в другой локации.

При повторяющихся ошибках путь и имя экспортируют из Run Details, чтобы увидеть скрытые пробелы, национальные символы или слишком длинное расширение. Массовое переименование выполняют только после сохранения связи с исходными записями и проверки внешних ссылок.

Ошибка OCR и повреждённый PDF

Повреждённый PDF может открываться в одном просмотрщике благодаря автоматическому восстановлению, но не разбираться движком. Его помещают в каталог ошибок, проверяют независимым валидатором и при необходимости пересохраняют специализированным средством. Повторные попытки Searchlight без изменения файла обычно только увеличивают журнал.

Защищённые документы требуют проверки разрешений и политики паролей. Автоматическая очередь не должна хранить пароли в открытом виде или пытаться снимать защиту без полномочий. Такие файлы исключают либо обрабатывают в отдельном согласованном процессе.

Если OCR завершается, но текст плохой, сравнивают язык, DPI, ориентацию, шум и выбранный движок. Меняют один параметр за раз на копии. Для mixed-language документа Standard с неверным единственным языком часто уступает Extended с точно выбранным набором; добавление всех языков сразу не является корректным исправлением.

Ошибка службы, SMTP или отчёта

Когда расписание не запускается, проверяют Service Status, системную службу, учётную запись и время следующего запуска. После смены пароля или политики безопасности служба может работать как процесс, но не иметь доступа к сети. Тест выполняют в том же временном окне и с той же библиотекой, что и автоматическое задание.

При сбое SMTP сначала отправляют минимальное письмо без вложения. Затем добавляют отчёт и проверяют ограничения размера, TLS и разрешения учётной записи. Если используется OAuth2, подтверждают срок действия и права токена. Путь сохранения отчёта проверяют от имени службы.

HTTP 500.19 в веб-компоненте может быть связан с модулем URL Rewrite или конфигурацией IIS. Сначала проверяют наличие требуемого компонента и журнал IIS. Изменение системного реестра по старой инструкции нельзя применять без резервной копии и оценки совместимости; безопаснее устранить отсутствующую зависимость или обратиться в поддержку с диагностическим пакетом.

Сравнение Aquaforest Searchlight с аналогами

Aquaforest Searchlight отличается не самим фактом OCR, а сочетанием аудита поисковой доступности, коннекторов к корпоративным хранилищам, архивации и повторных запусков. Поэтому прямое сравнение нужно вести по рабочему процессу. Редактор PDF может распознать выбранный файл точнее под контролем пользователя, но не заменяет непрерывное перечисление тысяч элементов. Серверный OCR способен дать высокую производительность, однако требует иной схемы интеграции.

PDF Commander лучше выбирать для сотрудника, которому нужно открыть конкретный документ, исправить страницы и вручную проверить результат. ABBYY FineReader Server и Tungsten OmniPage Server подходят для широких корпоративных потоков и интеграций. Adobe Acrobat Pro удобен для эпизодической работы с PDF. OCRmyPDF полезен команде, готовой строить собственную автоматизацию. Searchlight рационален, когда центральная задача — измерять и повышать searchable-статус существующих библиотек с сохранением их структуры и метаданных.

ПрограммаЛучше подходит дляГлавное ограничение
Aquaforest SearchlightПостоянного аудита и пакетного OCR библиотек SharePoint, OneDrive, Azure и файловых папокНе предназначена для ручного редактирования страниц и объектов PDF
PDF CommanderРучного OCR, исправления текста, перестановки страниц и подготовки отдельных PDFНе отслеживает серверные библиотеки и не запускает репозиторный аудит по расписанию
ABBYY FineReader ServerВысокопроизводительного серверного распознавания через папки, задания и корпоративные интеграцииТребует отдельного проектирования серверного процесса и администрирования
Tungsten OmniPage ServerМасштабируемого OCR с Folder Watcher, рабочими узлами и REST-интеграциейОриентирован на интеграцию, а не на готовую панель аудита библиотек SharePoint
Adobe Acrobat ProРаспознавания и проверки отдельных или выбранных пользователем групп PDFНет постоянного мониторинга и статистики поисковой доступности репозитория
OCRmyPDFАвтоматизации добавления текстового слоя и PDF/A через командную строкуНет встроенных коннекторов, панели, расписаний и отчётов для SharePoint

Практический выбор профиля OCR

Для чистых одноязычных сканов начните со Standard OCR: укажите точный язык, включите Auto Rotate и при необходимости Deskew, затем проверьте 20–30 документов. Remove Lines и Despeckle добавляйте только при видимой проблеме. Если контрольные слова ищутся, страницы не изменились и размер приемлем, усложнение профиля не требуется.

Для смешанных языков, тёмных рамок, сложного фона и специальных требований к сжатию используйте Extended OCR. Выберите только реально встречающиеся языки и проверьте лицензию модулей. Advanced Pre-processing настраивайте отдельными шагами, сохраняя результаты контрольной выборки.

Для цифровых и гибридных PDF основной риск — ненужная растеризация. Сначала аудит, затем обработка image-only и выбранной части partially searchable. Включайте Remove Hidden Text лишь для доказанно плохого слоя, а Force Vector Check проверяйте на документах с векторной графикой. Оригиналы архивируйте до замены.

Контроль качества после запуска

Первый уровень контроля — технический: завершён ли запуск, сколько документов audited и OCRed, какие ошибки появились, выросла ли доля fully searchable. Второй уровень — документный: совпадает ли число страниц, сохранились ли ориентация, закладки, метаданные и версии, открывается ли файл стандартным просмотрщиком. Третий уровень — содержательный: находятся ли контрольные слова и правильно ли копируется текст.

Выборка должна включать не только успешные типовые документы, но и худшие оригиналы: мелкий шрифт, печати, таблицы, развороты, рукописные пометки, цветной фон и крайние размеры. Ошибки часто скрываются именно там. Для регулируемых процессов фиксируют критерии приёмки и ответственного, а не ограничиваются визуальным впечатлением администратора.

После настройки запускают повторный аудит и сохраняют CSV как базовую линию. При последующих изменениях OCR-движка, DPI, сжатия или фильтров сравнивают показатели с этой линией. Если размер коллекции растёт быстрее доли searchable, проверяют версии, архивные дубликаты и повторное попадание выходов в очередь.

Безопасная эксплуатация

Учётной записи службы предоставляют минимально необходимые права к конкретным библиотекам, архивам и папкам отчётов. Административный доступ ко всему фермерскому или облачному окружению упрощает пилот, но увеличивает последствия компрометации. После проверки операций права сужают и повторяют тест чтения, записи, версионирования и метаданных.

Временная папка и журналы могут содержать копии документов, имена и пути. Их размещают на защищённом диске, включают резервирование или очистку согласно политике и ограничивают интерактивный доступ. Почтовые уведомления не должны отправлять полный отчёт широкому списку, если в нём есть конфиденциальные названия.

Обновление компонентов Windows, .NET, TLS, SharePoint или облачной идентификации проверяют на тестовой библиотеке. План отката включает резервную копию конфигурации, базы и правил подключения. Остановка службы перед обслуживанием должна быть запланирована так, чтобы не прервать загрузку результата.

Пошаговая проверка перед массовым OCR

Сначала создайте библиотеку Audit only и добавьте минимальный набор источников. Проверьте правильность URL или путей, доступ службы, исключения и даты. Запустите аудит вручную, откройте Dashboard и Run Details, экспортируйте CSV и выборочно подтвердите четыре категории документов.

Затем скопируйте настройки в тестовую библиотеку либо переключите пилот на Audit and OCR. Настройте архив, сохранение метаданных, версионирование и один OCR-движок. Ограничьте число документов и ядер, обработайте репрезентативную выборку, сравните оригинал и результат по страницам, поиску, размеру и свойствам.

После успешного пилота задайте расписание, оповещения и срок хранения журналов. Увеличивайте охват поэтапно, наблюдая за временным диском, сетью и скоростью публикации. Не удаляйте архив исходников до завершения повторного аудита и формальной приёмки владельцем документов.

  • Источник и все исключения подтверждены по реальным путям.
  • Учётная запись службы умеет читать, заменять и архивировать файлы.
  • Язык и OCR-движок проверены на сложной выборке.
  • Метаданные, версии, закладки и число страниц сохраняются как требуется.
  • Каталоги архива и ошибок не входят в наблюдаемое дерево.
  • Расписание длиннее измеренного полного цикла.
  • Оповещения проверены отдельным тестовым письмом.
  • Повторный аудит показывает ожидаемый рост searchable-документов.

Что Searchlight не заменяет

Программа не предоставляет инструменты ручного редактирования текста, изображений, ссылок и страниц PDF. Если оператор должен исправить конкретное слово, удалить объект, объединить документы или переставить страницы, результат передают в PDF-редактор. Searchlight отвечает за пакетное обнаружение и OCR по правилам, а не за интерактивную корректуру.

Поисковый слой не является структурированным извлечением данных. Наличие распознанного текста помогает индексации SharePoint и поисковым системам, но не гарантирует правильное выделение реквизитов, таблиц и полей. Для автоматического ввода счетов или форм нужен отдельный инструмент извлечения с валидацией.

Аудит searchable-статуса не измеряет юридическую подлинность, доступность для людей с ограничениями или полноту семантической разметки PDF. Эти задачи требуют собственных проверок. Чёткое разделение целей позволяет не считать успешный OCR доказательством соответствия всем требованиям к документу.

Итоговый рабочий процесс

Надёжная работа начинается с аудита без замены: он показывает реальную долю сканов, гибридных PDF и ошибок. Затем документы разделяются по языку и качеству, выбирается Standard или Extended OCR, а на контрольной выборке проверяются текст, внешний вид, размер, страницы и метаданные. Только после этого включаются архивирование и публикация результата.

В постоянной эксплуатации Dashboard показывает состояние библиотек, Scheduler запускает их в измеренных окнах, Alerts сообщает о сбоях, а Run Details связывает проблему с конкретным файлом. Временный диск, база и журналы обслуживаются по плану. Ошибки подключения, длинные пути и повреждённые PDF направляются в отдельные процедуры, а не маскируются бесконечными повторами.

Такой порядок позволяет превратить разрозненный массив сканов в контролируемую поисковую коллекцию без ненужной обработки цифровых PDF. Главные условия качества — точные фильтры, отдельный архив оригиналов, права фоновой службы, проверенный языковой профиль и повторный аудит после каждого значимого изменения настроек.