Archivarius 3000

Archivarius 3000 позволяет находить слова, фразы и словоформы внутри PDF, офисных документов, писем и архивов, заранее собирая их содержимое в отдельные индексы. Пользователь задаёт область поиска, вводит запрос, при необходимости добавляет условия по дате, размеру, типу или расположению файла, а затем просматривает найденные фрагменты с подсветкой совпадений, не открывая каждую исходную программу.

Основное окно разделено на вкладки Search, Index, Server, Help и More. Во вкладке Search находятся строка запроса, выбор поисковой зоны, кнопка Search attributes, список результатов и встроенный просмотрщик; вкладка Index отвечает за создание, перестроение, сжатие и обновление баз; Server открывает настройки удалённого доступа к уже подготовленным индексам.

Практический рабочий цикл состоит из трёх действий: сначала мастер индекса получает папки, сетевые ресурсы, почтовые хранилища или съёмные носители, затем извлекает из поддерживаемых файлов текст и метаданные, после чего запросы выполняются по компактной базе. Благодаря этому повторный поиск не перебирает диск заново, а результат можно получить даже для документа с отключённого CD, DVD или внешнего накопителя, если его текст был сохранён в индексе.

Скачать Archivarius 3000

Оценка 9.7 Рекомендуем
  • Редактирование PDF
  • Русский интерфейс
  • Просто новичкам
Скачать бесплатно на Windows
Лучшая альтернатива
Archivarius 3000
Оценка 8.5
  • Только Windows
  • Нет встроенного OCR
  • Лимит демо — 10 000 файлов
Скачать Archivarius 3000
Загрузка начнётся после нажатия

Как устроено основное окно поиска

Верхняя строка вкладки Search напоминает привычную поисковую систему: поле Enter query принимает запрос, кнопка Find запускает его, а стрелки Back и Forward возвращают предыдущие состояния. Ниже расположен список Search zone. В нём выбирается конкретный индекс либо группа индексов, поэтому одна и та же фраза может проверяться только в рабочей документации, только в архиве переписки или одновременно во всех подключённых базах.

Левая часть рабочей области показывает результаты. Набор колонок включает имя файла, показатель соответствия запросу, папку, дату и размер. Показатель Rate удобен при широком запросе: документы с большим числом значимых совпадений поднимаются выше, а сортировка по папке или дате помогает быстро отделить старую копию от актуального рабочего файла. В нижней панели доступны команды View, Open file, Switch list и Clear search result.

Справа размещён встроенный просмотрщик. Он выводит извлечённый текст и выделяет найденные слова, поэтому пользователь видит контекст до открытия Word, Acrobat Reader, почтового клиента или браузера. В меню просмотра предусмотрены переходы между совпадениями, изменение масштаба, поиск внутри текущего результата, закладки и печать доступного фрагмента. Если исходный носитель отключён, просмотр зависит от того, сохранялся ли извлечённый текст в базе при индексировании.

Результаты поиска и просмотр найденного текста в Archivarius 3000

Расположение просмотрщика меняется через меню More. Его можно закрепить слева, справа, сверху или снизу, а также полностью скрыть. Для широкого монитора удобна правая панель: список результатов остаётся достаточно высоким, а документ читается как отдельная страница. На небольшом экране полезнее нижнее размещение или временное отключение просмотра, чтобы увеличить число видимых строк.

Создание первого индекса

Поиск по содержимому начинается не с ввода фразы, а с подготовки индекса. На вкладке Index кнопка Create запускает создание базы, а Wizard проводит по последовательным настройкам. Пользователь задаёт понятное имя, выбирает место хранения индексных файлов, перечисляет источники и указывает, какие документы нужно включать. Название стоит связывать с задачей, а не с буквой диска: Договоры, Проектная переписка или Архив DVD понятнее, чем Индекс 1.

Путь к базе следует выбирать отдельно от индексируемой коллекции. Если документы лежат на медленном сетевом ресурсе или съёмном диске, индекс разумно хранить на быстром локальном накопителе. Тогда чтение исходников требуется во время построения и обновления, а обычные запросы выполняются по локальной структуре. При резервном копировании нужно сохранять как сами документы, так и каталог индекса: это разные наборы данных.

Источником может быть папка на локальном диске, дерево каталогов, доступная сетевая папка, подключённый носитель или поддерживаемое почтовое хранилище. Для большой коллекции лучше создавать несколько тематических индексов. Раздельные базы проще перестраивать, переносить и подключать к серверному поиску; кроме того, запрос можно ограничить одним проектом, не получая совпадения из личной почты или старого архива.

После запуска индексатор последовательно открывает файлы, определяет их тип, извлекает текст и метаданные, разбирает контейнеры и записывает сведения в базу. Прогресс имеет смысл контролировать по протоколу: большое число пропусков обычно указывает на исключённые расширения, неподдерживаемую кодировку, отсутствие прав доступа, повреждённые документы или недоступный сетевой путь. Завершённая операция не гарантирует, что каждый файл дал текст, поэтому первый индекс полезно проверять контрольными запросами.

Список индексов и планировщик обновлений Archivarius 3000

Что находится на вкладке Index

Панель управления индексами содержит команды Create, Delete, Rebuild, Settings, Wizard, Compress и Scheduler. Create добавляет новую базу, Delete удаляет выбранный индекс, Rebuild заново читает источники, Settings открывает детальные параметры, а Wizard возвращает пошаговый режим настройки. Compress уплотняет структуру после крупных обновлений и удаления записей, Scheduler создаёт задания на автоматический запуск индексирования.

В таблице индексов видны имя базы и количество документов. Нижняя область предназначена для расписаний: там отображаются время запуска, тип задания и следующая плановая дата. Разделение на верхнюю и нижнюю части удобно для администрирования нескольких коллекций: выбранный индекс остаётся виден, пока пользователь добавляет или изменяет связанные задания.

Rebuild нужен после изменения правил разбора, морфологии, кодировок или списка расширений. Обычное обновление добавляет новые и изменённые документы, но не всегда перерабатывает уже сохранённый текст с новыми параметрами. Полная перестройка занимает больше времени, зато устраняет накопившиеся несоответствия и формирует базу по единому набору правил.

Подробные настройки индексирования

Диалог Index settings организован как дерево разделов. В нём встречаются категории Name, Index type, Morphology, Documents, File extensions, Encodings, Archives, Advanced, Exclusions, Protocol, Permissions, Encoded files, Local area network, Text filtering, File splitting и Limitations. Такая структура позволяет отдельно управлять источниками, обработкой текста, контейнерами, журналированием и ограничениями, но требует внимательной первичной настройки.

Имя, тип и расположение базы

В разделе Name задаются отображаемое название и путь индексной базы. Переименование помогает привести список в порядок, однако не заменяет проверку физического каталога. Перед переносом базы следует остановить обновления и серверный доступ, скопировать весь набор файлов индекса, изменить путь в настройках и только после этого выполнить контрольный поиск. Частичное копирование приводит к ошибкам открытия или к пустым результатам.

Index type определяет назначение базы и способ работы с источниками. Для повседневного поиска по постоянно доступным папкам важны быстрые инкрементальные обновления. Для съёмных носителей ценнее сохранение извлечённого текста и точного обозначения диска, чтобы найденный документ можно было связать с конкретным CD, DVD или внешним накопителем после его отключения.

Морфология и язык текста

Морфологический поиск расширяет запрос словоформами. Для русского слова программа может учитывать падежные и числовые формы, а для английского, немецкого, французского, испанского и других поддерживаемых языков — соответствующие грамматические варианты. Это полезно для договоров, писем и научных материалов, где одно понятие встречается в разных формах. При поиске кода, артикулов или фамилий такое расширение иногда даёт лишние совпадения, поэтому точную фразу лучше проверять отдельно.

Опция распознавания языка текста помогает выбрать правила морфологии автоматически. В многоязычных коллекциях её включение повышает полноту поиска, но увеличивает работу индексатора. Если база состоит почти только из русских документов, фиксированный набор языков предсказуемее. Для двуязычной переписки стоит создать контрольный набор из нескольких писем и убедиться, что запросы на обоих языках возвращают ожидаемые формы.

Полная поддержка Unicode важна не только для текста документа, но и для имён файлов. Папки с кириллицей, диакритическими знаками и азиатскими символами не должны терять названия при добавлении в индекс. Проблемы обычно возникают не из-за Unicode как такового, а из-за неверно определённой кодировки старых TXT, CSV, почтовых баз или экспортов из устаревших систем.

Документы, расширения и кодировки

Раздел Documents задаёт общие правила извлечения текста, а File extensions ограничивает набор файлов. Исключение ненужных расширений ускоряет построение и уменьшает базу. В коллекции договоров можно оставить PDF, DOC, DOCX, RTF, TXT, HTML и почтовые форматы, не индексируя изображения, исполняемые файлы и резервные копии. Для технического архива, наоборот, могут понадобиться журналы, конфигурации, исходные тексты и редкие контейнеры.

Расширение само по себе не гарантирует правильного разбора: файл может иметь неверное имя или быть повреждён. Поэтому диагностика должна включать проверку фактического формата. Если документ открывается в родной программе, но не находится по уникальной фразе, стоит посмотреть протокол индексатора и временно снять ограничения по расширению. После успешного теста правило можно вернуть в более строгий вид.

Encodings управляет интерпретацией текстовых файлов. Для старых русскоязычных архивов типичны Windows-1251, DOS-кодировки и KOI8-R; веб-выгрузки чаще используют UTF-8. Неверный выбор приводит не к ошибке открытия, а к бессмысленным символам в индексе. Контрольный запрос по редкому слову и просмотр фрагмента быстрее выявляет проблему, чем повторная индексация всей коллекции наугад.

Расширенные параметры

В разделе Advanced предусмотрены флажки Save extracted texts in base, Index files that contain no text, Scan mail attachments, Recognize language of texts, Compress index after indexing, Add folders to index, Skip indexing of mount points и Skip duplicate texts. Набор отражает главную особенность программы: пользователь может выбирать между полнотой архива, размером базы и скоростью обновления.

Save extracted texts in base нужен, когда исходник может стать недоступным. Сохранённый текст позволяет читать найденный фрагмент после отключения носителя, но увеличивает индекс и затрагивает вопросы конфиденциальности: копия содержимого остаётся в базе даже после перемещения документа. Для постоянно доступной рабочей папки эту опцию можно отключить, если важнее компактность и открытие оригинала.

Index files that contain no text сохраняет записи о файлах, из которых не удалось извлечь слова. Это полезно для каталога носителя, где поиск по имени, пути, дате или размеру должен находить также изображения и бинарные объекты. Если задача ограничена полнотекстовым поиском, такие записи только увеличивают число элементов и могут быть исключены.

Scan mail attachments включает вложения в обработку. Без него письмо будет находиться по теме и телу, но приложенный договор или таблица останутся невидимыми. Опция повышает нагрузку, особенно когда вложения содержат архивы с большим количеством документов. Для корпоративной почты имеет смысл ограничить глубину и типы вложений другими настройками, а затем проверить несколько характерных цепочек.

Skip duplicate texts отбрасывает документы с одинаковым извлечённым содержимым. Это уменьшает шум от копий, однако одинаковый текст может иметь разные реквизиты, подписи или путь. В юридическом архиве дубликаты часто важны как отдельные экземпляры, поэтому флажок следует включать только после понимания, по каким признакам программа считает тексты одинаковыми.

В блоке File modification check доступны режимы Index only modified and new files, Index all files again и Index only new files. Первый подходит для регулярного обновления, второй — для полной повторной обработки после изменения правил, третий — для коллекций, где существующие документы не изменяются. Неправильный выбор объясняет многие случаи, когда исправленная кодировка или новое правило не применяется к старым записям.

Исключения, права и сетевые источники

Exclusions задаёт маски папок и файлов, которые индексатор должен пропускать. Исключения особенно полезны для временных каталогов, кэшей, папок сборки, резервных копий и повторяющихся экспортов. Правило стоит формулировать узко: маска по слишком общему фрагменту пути может исключить полезный проект вместе с техническими данными.

Permissions определяет, как учитывать ограничения доступа. При индексировании общей папки программа работает с правами текущей учётной записи или настроенного сервиса. Если администратор видит все документы, а удалённые пользователи получают общий индекс без фильтрации, в результатах может появиться закрытая информация. Поэтому серверный доступ нужно сочетать с отдельными индексами, группами пользователей и проверкой прав на тестовых учётных записях.

Local area network отвечает за чтение сетевых путей. Надёжнее использовать постоянные UNC-пути, а не буквы подключённых дисков, которые могут отсутствовать при запуске планировщика или службы. Перед созданием расписания следует открыть источник из той же учётной записи, под которой будет выполняться задание, и проверить доступ к нескольким вложенным папкам.

Skip indexing of mount points предотвращает неожиданный переход в подключённые тома и циклические структуры. Опция полезна, когда внутри индексируемой папки есть точки подключения к большим архивам или повторно подключённым каталогам. Если нужный ресурс действительно находится за такой точкой, его лучше добавить отдельным источником, чтобы объём и правила обработки были очевидны.

Протокол и ограничения

Protocol сохраняет сведения о ходе индексирования. Журнал нужен не только при сбое: по нему видно, какие файлы пропущены, где не удалось извлечь текст и сколько времени заняли отдельные участки. При большой коллекции полезно сначала выполнить пробный индекс небольшой папки, исправить повторяющиеся ошибки и только затем запускать полный массив.

Limitations позволяет ограничивать глубину, размер или другие параметры обработки там, где потенциально встречаются огромные контейнеры и файлы. Ограничения защищают от ситуации, когда один повреждённый архив или гигантский журнал надолго задерживает обновление. Значения следует выбирать по реальной коллекции: слишком низкий предел незаметно исключит крупные PDF и почтовые базы, слишком высокий увеличит риск нехватки памяти и места.

Фильтрация текста и разбиение файлов

Text filtering убирает из индексируемого содержимого повторяющиеся служебные фрагменты. В веб-архивах это меню, навигация и шаблонные подписи; в выгрузках — заголовки и разделители. Хороший фильтр повышает значимость результатов, но ошибочная маска способна удалить важный текст. Настройку следует проверять по сохранённому фрагменту до массовой перестройки.

File splitting предназначен для больших структурированных текстов, где один физический файл содержит множество логических записей. В настройках задаются маска папки, маска файла, разделитель частей, чувствительность к регистру, возможность представить разделитель HEX-последовательностью, смысл разделителя и минимальный размер части. После включения одна выгрузка может появляться в результатах как несколько самостоятельных элементов.

Разбиение удобно для журналов, экспортов почтовых систем и консолидированных текстовых баз. Например, если каждая запись начинается с постоянного маркера, этот маркер указывается как Begin of part. Для двоичного или нестандартного разделителя пригодится HEX-режим. Минимальный размер защищает от появления тысяч пустых или служебных частей.

Поиск по PDF-документам

Для PDF Archivarius 3000 извлекает доступный текст и помещает его в индекс. После этого документ находится по словам из основного текста, а в правой панели виден фрагмент с подсветкой. Такой сценарий особенно полезен для каталогов договоров, инструкций, судебных материалов, технических паспортов и электронных книг, где имя файла мало говорит о содержимом.

Программа не заменяет PDF-редактор: она не меняет страницы, не переставляет листы, не создаёт подписи и не исправляет текст внутри файла. Её задача — построить поисковую базу и привести пользователя к нужному месту. Для правки найденного документа требуется отдельное приложение, а команда Open file передаёт оригинал зарегистрированной в системе программе просмотра.

Главное условие полнотекстового поиска — наличие текстового слоя. Если PDF состоит только из отсканированных изображений, индексатор не получает слова и не сможет найти фразу на странице. Такой файл сначала нужно распознать в OCR-программе и сохранить с текстовым слоем, затем обновить или перестроить индекс. Простое отображение букв на экране не доказывает наличие извлекаемого текста: проверкой служит возможность выделить и скопировать фразу в обычном просмотрщике.

Защищённые или повреждённые PDF также могут не дать содержимое. Если уникальная фраза не находится, следует открыть файл, проверить ограничения на извлечение, сохранить исправную копию и выполнить режим Index all files again для тестовой папки. При массовой проблеме нужно убедиться, что расширение PDF включено и не попало под исключение.

В больших PDF полезно сочетать полнотекстовый запрос с атрибутами. Фильтр по папке отделяет регламенты от переписки, дата — старые редакции от новых, размер — краткие уведомления от полноценных руководств. Точная фраза снижает число случайных совпадений, а морфология помогает найти склонённые термины в русскоязычных документах.

Поддерживаемые документы и редкие форматы

Набор фильтров охватывает распространённые офисные и текстовые типы: PDF, DOC и DOT, DOCX, XLS и XLW, PPT, RTF, TXT, ASC, CSV, HTML и HTM, XML, CHM, HLP, WRI, документы Microsoft Works, WordPerfect и старые таблицы Lotus 1-2-3. Для архивных фондов важна поддержка форматов, которые современные универсальные поисковики часто пропускают.

В перечень распознаваемых документов входят файлы Adobe PageMaker, Ami Pro, IBM Revisable Form Text, ChiWriter, PROMPT Translator, TRichView, WinOrganizer, Word and Deed и некоторые форматы электронных книг. DjVu индексируется при наличии текстового слоя. Поддерживаются MIME HTML и отдельные почтовые сообщения EML и MSG, что удобно для выгрузок переписки вне почтового клиента.

Наличие фильтра не означает идеальное воспроизведение внешнего вида. Индексатору важен извлечённый текст, а не точная верстка, формулы, макросы или встроенная графика. Сложные таблицы могут читаться в другом порядке, колонтитулы — смешиваться с основным текстом, а текст внутри изображений — отсутствовать. Поэтому для критичной коллекции нужно провести тест на реальных файлах каждого типа.

Современные офисные документы следует проверять отдельно. DOCX поддерживается, но сложные вложенные объекты и нестандартные генераторы могут создавать варианты, из которых извлекается не всё. Для XLSX и PPTX нельзя автоматически переносить выводы с устаревших XLS и PPT: контрольный запрос по уникальным ячейкам и заметкам покажет фактический результат быстрее, чем общий список расширений.

Файлы без текста всё равно могут сохраняться как записи, если включена соответствующая опция. Тогда они находятся по имени, пути и метаданным, но не по содержимому изображения или аудиодорожки. Для фотографий, сканов и мультимедиа Archivarius 3000 не выполняет смысловое распознавание.

Поиск внутри архивов

Архивы обрабатываются как контейнеры: программа раскрывает поддерживаемый формат, извлекает текст из вложенных документов и связывает результат с исходным архивом. Среди распространённых типов встречаются ZIP, RAR, ACE, ARJ, CAB, GZIP, TAR, JAR, LHA и LZH. Также заявлены многочисленные редкие форматы резервного копирования и дисковых образов, что делает программу полезной для старых коллекций.

Практическая ценность состоит в том, что пользователь ищет не имя архива, а фразу из документа внутри него. Если в папке лежат сотни ZIP с отчётами, запрос по номеру договора может сразу показать вложенный файл и контейнер. Аналогично обрабатываются архивы, прикреплённые к письмам, когда включено сканирование вложений.

Глубокая обработка контейнеров заметно увеличивает время индексирования. Большой архив может содержать тысячи мелких файлов или вложенные архивы, а повреждённый элемент — задерживать процесс. Для регулярной рабочей базы стоит ограничить ненужные форматы, размеры и глубину, а редко используемый исторический фонд вынести в отдельный индекс с собственным расписанием.

Парольные архивы не дают текст без ключа. Запись о контейнере может сохраниться по имени и пути, но его закрытое содержимое не станет полнотекстовым результатом. Если зашифрованные архивы важны для поиска, безопаснее распаковать разрешённую копию в контролируемый каталог и индексировать её с учётом политики хранения.

Почта, вложения и почтовые базы

Archivarius 3000 умеет искать в сообщениях и приложениях разных почтовых систем. В описаниях продукта перечисляются Outlook, Outlook Express, Microsoft Exchange, Netscape, Mozilla Thunderbird, PocoMail и The Bat!, а также базы Lotus Notes и Lotus Domino. Поддержка отдельных EML и MSG позволяет индексировать экспортированную переписку как обычные файлы.

Для письма индексируются текст сообщения и доступные поля, а при включённом Scan mail attachments — документы во вложениях. Это решает типичную задачу: пользователь помнит формулировку из приложенного договора, но не отправителя и не тему. Поиск возвращает письмо или вложенный объект, после чего можно открыть исходное сообщение в подходящем клиенте либо просмотреть сохранённый текст.

Почтовые базы требуют осторожности. Активное хранилище может быть заблокировано клиентом, содержать ошибки или иметь большой размер. Перед массовой индексацией полезно закрыть почтовую программу, сделать резервную копию и проверить небольшую папку. Для архивной переписки надёжнее использовать штатный экспорт в поддерживаемый формат, чем давать индексатору единственный рабочий файл без копии.

Вложения создают дополнительный уровень нагрузки и риска. Один архив во вложении может раскрыться в сотни документов, а дубликаты одинаковых файлов из цепочки ответов увеличат базу. Опция пропуска одинаковых текстов уменьшает повторения, но её следует тестировать: одинаковое вложение в разных письмах может быть важно именно как свидетельство разных отправок.

Для поиска по отправителю, теме и дате полезно сочетать текст запроса с Search attributes. Если известна только часть фразы, морфология помогает найти словоформы; если требуется дословная цитата, лучше использовать точную фразу. В результате нужно обращать внимание на путь и источник, чтобы не спутать тело письма, вложение и сохранённую копию документа.

Съёмные диски и поиск без подключённого носителя

Одно из самых практичных применений — каталогизация CD, DVD и внешних накопителей. При индексировании программа сохраняет сведения о файлах и, при выбранной настройке, извлечённый текст. После отключения диска запрос всё равно показывает документ, его путь и фрагмент, позволяя понять, какой носитель нужно подключить.

Чтобы схема работала, каждому носителю следует присвоить устойчивое имя. Метка DVD-023 — бухгалтерия 2012 полезнее автоматически назначенной буквы привода. То же имя стоит использовать в названии индекса или описании источника. Тогда найденный путь не превращается в загадочную ссылку на давно отсутствующий диск.

Для большой физической коллекции удобны отдельные индексы по теме или периоду. Один гигантский индекс проще искать, но сложнее переносить, проверять и восстанавливать. Несколько баз позволяют подключать только нужный фонд и при повреждении перестраивать ограниченную часть. Серверный режим умеет предлагать выбор нескольких индексов на странице поиска.

Сохранённый текст не заменяет оригинал. Просмотр даст содержание, но открыть вложенную графику, таблицу, подпись или исходное форматирование без носителя не получится. Поэтому индекс следует рассматривать как каталог и средство предварительного отбора, а не как полную резервную копию.

Сетевые папки и совместная коллекция

Для локальной сети программа может индексировать общие папки, доступные текущей учётной записи. Лучше указывать постоянные сетевые пути и хранить индекс на машине, которая регулярно видит источник. Если база создаётся на рабочем компьютере, выключение этого компьютера остановит и плановые обновления, и серверный поиск.

Сетевое индексирование чувствительно к задержкам и разрывам соединения. Первый проход лучше запускать по частям, чтобы один недоступный ресурс не затруднял диагностику. В протоколе нужно отделять ошибки чтения от неподдерживаемых форматов: первая группа требует проверки сети и прав, вторая — изменения фильтров или подготовки документов.

При совместной работе важно выбрать владельца индекса. Если каждый сотрудник строит собственную базу одной папки, расходуется место и появляются разные результаты из-за отличающихся правил. Централизованный индекс с серверным доступом упрощает поддержку, но требует строгого разграничения и резервного копирования.

Сетевые файлы могут изменяться во время чтения. Для критичных архивов предпочтительно индексировать снимок, резервную копию или папку, куда документы поступают после завершения обработки. Это снижает вероятность частично прочитанного файла и делает повторную проверку воспроизводимой.

Запросы: от одного слова до сложного условия

Простой запрос состоит из одного или нескольких слов. При включённой морфологии каждое слово расширяется грамматическими формами, поэтому поиск охватывает больше документов, чем буквальное сравнение. Для первоначального знакомства полезно выбрать редкий термин из известного файла, запустить запрос и убедиться, что нужный документ появляется среди первых результатов.

Точная фраза нужна, когда порядок слов имеет значение. Она отделяет устойчивое выражение от документов, где те же слова разбросаны по разным абзацам. В договорах это помогает искать формулировку пункта, в переписке — цитату, в технической документации — точное сообщение об ошибке. Если фраза не находится, стоит проверить переносы строк, дефисы и распознавание текста.

Для сложных условий предусмотрены язык запросов и Query Builder. Конструктор собирает выражение без запоминания синтаксиса: пользователь добавляет обязательные слова, альтернативы, исключения и атрибуты. Такой подход безопаснее ручного ввода, особенно когда нужно сочетать текст с датой, типом документа и размером.

Логические операции позволяют сформулировать запрос вида договор и поставка, но не шаблон. Исключение особенно полезно против типовых форм, которые содержат все нужные слова, но не относятся к конкретному делу. Альтернативы объединяют разные написания термина, аббревиатуру и полное название. Скобки помогают сохранить порядок вычисления в длинном выражении.

Direct Search ориентирован на буквальный контроль. В нём можно учитывать регистр, пробелы, маски и дополнительные атрибуты. Он подходит для номеров изделий, идентификаторов, фрагментов кода и слов с нестандартной пунктуацией. Морфологический режим в таких задачах, наоборот, может расширить запрос нежелательными вариантами.

Search Wizard ведёт по нескольким шагам и задаёт понятные вопросы о дате, размере, типе и ключевых словах. Мастер полезен, когда пользователь помнит свойства файла, но не знает синтаксис. После получения результата условие можно уточнять обычными средствами, не создавая новый индекс.

Поиск по дате, размеру и типу

Search attributes открывает дополнительные критерии. Дата помогает ограничить период создания или изменения, размер — убрать слишком маленькие служебные файлы либо найти крупное руководство, тип — оставить только PDF, письма или таблицы. Сочетание атрибутов уменьшает шум, но чрезмерно строгий фильтр может скрыть нужный документ из-за неточной метки времени.

Дата файла не всегда совпадает с датой документа. Копирование на другой носитель, распаковка архива или экспорт почты могут изменить метаданные. Поэтому при сомнении диапазон следует расширить, а затем смотреть даты внутри текста. Аналогично размер — лишь вспомогательный признак: оптимизированный PDF может быть меньше старой сканированной копии.

Фильтр по папке или индексу обычно надёжнее. Если организационная структура поддерживается аккуратно, область Проект Альфа быстрее отделит нужные материалы, чем сложный набор слов. Если структура хаотична, отдельные тематические индексы фактически становятся виртуальными коллекциями и компенсируют недостатки файловой системы.

Оценка результатов и встроенный просмотр

После поиска список можно сортировать по соответствию, имени, папке, дате или размеру. Сортировка по Rate хороша для содержательного запроса, по дате — для выбора свежего экземпляра, по папке — для просмотра связанных документов. Нельзя считать самый высокий процент гарантией правильного ответа: короткий файл с многократным повторением термина может обойти подробный документ, где слово встречается один раз.

Подсветка в просмотрщике показывает контекст и ускоряет отбор. Полезно переходить между всеми совпадениями, а не оценивать только первый фрагмент. В длинном договоре первое слово может находиться в оглавлении, тогда как нужное условие расположено дальше. Для точной работы следует открыть оригинал и проверить страницу, структуру и приложения.

Команда Switch list меняет представление результатов. Компактный список удобен для массового отбора, подробный — когда важны фрагменты и метаданные. Clear search result очищает текущую выдачу, но не удаляет индекс. Back и Forward возвращают прошлые запросы и полезны при постепенном уточнении условий.

Open file работает только при доступности оригинала и наличии связанной программы. Если носитель отключён, команда не сможет открыть файл, хотя сохранённый текст продолжит отображаться. Если расширение не связано с приложением, Windows попросит выбрать программу; это не ошибка индекса.

Подсветка слова в списке результатов и просмотрщике Archivarius 3000

Обновление, перестроение и сжатие базы

Индекс быстро устаревает, если рабочие папки меняются. Регулярное обновление добавляет новые файлы, перечитывает изменённые и должно учитывать удалённые элементы. Частоту выбирают по характеру коллекции: активная переписка требует частых запусков, архив закрытого проекта можно обновлять только после поступления новой партии.

Режим Index only modified and new files экономит время и подходит для большинства рабочих баз. Он опирается на признаки изменения, поэтому не переработает документ, если изменились только правила извлечения. После корректировки кодировок, морфологии, архивации или фильтра текста нужен Index all files again либо Rebuild.

Index only new files полезен для неизменяемого архива, но опасен для общих папок, где документы редактируют. Изменённая версия останется представлена старым текстом. Такой режим следует применять только к источникам с понятной политикой: новые файлы добавляются, существующие не переписываются.

Compress удаляет лишние внутренние структуры и уплотняет базу после многочисленных обновлений. Операцию стоит выполнять в период простоя, особенно для крупного индекса. Перед сжатием полезна резервная копия, потому что прерывание дисковой операции или нехватка места может повредить базу.

Rebuild создаёт согласованное состояние заново. Его используют при ошибках открытия, большом числе устаревших результатов, изменении базовых параметров или переходе на другой набор источников. Перестройка не должна быть первой реакцией на любую проблему: сначала нужно проверить один файл, журнал, права и свободное место, иначе та же причина повторится.

Планировщик индексирования

Scheduler добавляет автоматические задания. В нижней части вкладки Index отображаются запланированное время, выполняемая задача и следующая дата запуска. Расписание освобождает пользователя от ручного обновления, но работает надёжно только при доступных источниках и корректной учётной записи.

Для сетевой папки ночной запуск имеет смысл, если компьютер включён, сеть доступна, а учётные данные не требуют интерактивного входа. Для внешнего диска автоматическое задание может каждый раз завершаться ошибкой, когда носитель не подключён. В таком случае лучше использовать ручное обновление или отдельное расписание, которое запускается только в период обслуживания архива.

Не следует запускать одновременно обновление, сжатие и резервное копирование одного индекса. Пересекающиеся операции создают лишнюю нагрузку и повышают риск получения неполной копии. Разумная последовательность: обновление, контроль протокола, сжатие при необходимости, затем резервное копирование закрытой базы.

Первое время задания нужно проверять вручную. Наличие записи в расписании не доказывает успешное выполнение. Контрольный запрос по недавно добавленному документу и просмотр протокола дают более надёжную картину. После нескольких успешных циклов достаточно периодической проверки.

Серверный режим и поиск через браузер

Вкладка Server публикует подготовленные индексы для удалённого поиска. На панели находятся Start, Stop, Settings, Users и Information. Основная область показывает IP-адрес, доменное имя, порт и ссылку на поисковую страницу, а нижняя часть ведёт протокол обращений. Это позволяет предоставить коллегам поисковую форму без установки клиентской части на каждый компьютер.

Запущенный серверный режим Archivarius 3000

Перед запуском нужно выбрать адрес привязки и порт. Если сервер доступен только в локальной сети, не следует открывать его во внешний интернет без защищённого канала, фильтрации и аутентификации. Простой переход по показанной ссылке с другого компьютера проверяет маршрутизацию, но не заменяет проверку прав.

В Settings перечислены General, Security, Server address, SSL encryption, Templates, Shared files, Protocol, NT service и IP filtering. Разделение позволяет независимо управлять поведением страницы, сетевой привязкой, шифрованием, внешним видом, выдачей файлов, журналом и ограничениями по адресам.

Общие настройки серверного поиска Archivarius 3000

Общие настройки веб-поиска

General включает историю запросов, автоматический запуск сервера вместе с программой, число документов на странице и действие по щелчку результата. Можно разрешить выбор нескольких индексных баз, отметить их по умолчанию и показывать дату изменения индекса. Эти параметры формируют поведение интерфейса для обычного пользователя.

Link life time определяет, сколько минут действует ссылка на найденный документ, а Maximum search time ограничивает длительность запроса. Короткая жизнь ссылки уменьшает риск передачи постоянного доступа, но неудобна при медленном чтении. Ограничение времени защищает сервер от слишком широких запросов, однако низкое значение может обрывать поиск по большой группе индексов.

Шаблоны и оформление страниц

Templates задаёт пути к шаблонам поисковой формы, страницы результатов, просмотра документа и справки. Администратор может изменить внешний вид под внутренний портал, сохранив логику поиска. Перед заменой файлы следует скопировать, а изменения проверять в отдельной папке: ошибка разметки способна сделать страницу недоступной, хотя сам индекс останется исправным.

Пути к HTML-шаблонам серверного режима Archivarius 3000

Шаблон не должен раскрывать физические пути и служебные данные. Достаточно показывать название, фрагмент, дату, тип и разрешённое действие. Если пользователю не требуется скачивание оригинала, Shared files нужно настроить консервативно или отключить, оставив только просмотр сохранённого текста.

Пользователи, безопасность и фильтрация

Users и Accounts предназначены для управления доступом. Практика один общий пароль для всех упрощает запуск, но лишает администратора возможности отозвать доступ конкретному человеку и отследить действия. Лучше создавать отдельные группы и проверять, какие индексы и документы доступны каждой из них.

Security определяет правила аутентификации, SSL encryption — защищённое соединение, IP filtering — разрешённые и запрещённые адреса. Эти механизмы нужно рассматривать вместе. Фильтр по IP не защищает от пользователя внутри разрешённой сети, а пароль без шифрования может передаваться небезопасно.

NT service позволяет организовать работу сервера как системной службы. Такой запуск удобен для постоянно доступного узла, но меняет контекст прав: служба может не видеть подключённые диски и пользовательские учётные данные. Все источники и каталоги индексов следует проверить именно под служебной учётной записью.

Protocol фиксирует обращения и ошибки. Журнал помогает определить, какой запрос перегружает систему, почему страница не возвращает файл и с какого адреса пришёл запрос. При включённой истории нужно учитывать конфиденциальность: поисковые фразы сами могут содержать персональные данные, номера дел и внутренние термины.

Настройка внешнего вида и поведения

Меню More содержит Settings, Accounts, переключатель Show viewer, варианты положения просмотрщика, Language, Font и List mode. Изменение шрифта полезно для длинной работы с мелким текстом и многоязычными документами. Слишком крупный шрифт уменьшает объём видимого фрагмента, поэтому лучше отдельно подобрать размеры списка и просмотра.

Меню More с положением просмотрщика, языком и шрифтом

Русский интерфейс выбирается в Language, если он входит в установленный пакет. Смена языка не меняет морфологию уже построенного индекса: язык меню и правила анализа документов — разные настройки. После изменения морфологических параметров старую базу следует перестроить.

List mode управляет видом результатов. Для ежедневного поиска удобен режим с фрагментом, рейтингом и путём; для массовой проверки имён — компактная таблица. Положение просмотрщика и режим списка можно менять без повторного индексирования, потому что они относятся только к представлению.

Настройки цветов и шрифтов помогают выделить совпадения и уменьшить нагрузку на глаза. При выборе похожих цветов подсветка теряется, особенно в документах с собственным форматированием. После изменения темы нужно открыть результат с несколькими совпадениями и проверить выделение, ссылки и активную строку.

Производительность и размер индекса

Скорость поиска достигается ценой предварительного индексирования. На время первого прохода влияют количество файлов, их форматы, вложенные архивы, почтовые базы, сетевые задержки и сохранение извлечённого текста. Нельзя оценивать производительность только по гигабайтам: миллион маленьких сообщений создаёт больше служебных операций, чем несколько крупных PDF.

Размер базы растёт от текста, метаданных и служебных структур. Save extracted texts in base увеличивает объём, но обеспечивает просмотр без оригинала. Сканирование вложений и архивов резко расширяет число логических документов. Пропуск дубликатов и исключение ненужных расширений уменьшают базу, однако могут убрать важные экземпляры.

Для очень большой коллекции лучше несколько индексов. Разделение по отделам, годам или типам данных ускоряет обслуживание и позволяет выполнять узкие запросы. Серверный режим умеет объединять выбор нескольких баз, поэтому тематическое разделение не лишает пользователя общего поиска.

Индекс желательно размещать на быстром диске с запасом свободного места. Во время перестройки и сжатия может потребоваться дополнительное пространство. Если свободное место заканчивается, операция способна завершиться неполной базой. Перед крупным обслуживанием нужно проверить объём и сделать копию.

Нагрузка индексатора заметна на старом оборудовании и сетевых ресурсах. Расписание на период простоя снижает влияние на рабочие программы. При одновременном доступе многих пользователей через сервер нужно ограничивать длительность запросов и число результатов на странице.

Совместимость и установка

Для Windows предлагаются отдельные установочные пакеты под 32- и 64-разрядную архитектуру. Разрядность нужно выбирать по системе, а не по типу индексируемых документов. Существующий индекс следует резервировать до переустановки; сам установщик не является копией базы и не восстанавливает пользовательские коллекции.

На современных выпусках Windows программу разумно проверять на тестовой машине. Основные операции могут работать, но интеграция со старыми почтовыми клиентами, службой, сетевыми путями и ассоциациями файлов зависит от окружения. Для серверного использования особенно важны права на порт, правила брандмауэра и запуск под подходящей учётной записью.

Установщик следует получать из проверяемого источника и проверять цифровую подпись издателя. Если подпись отсутствует или не подтверждается, файл нельзя запускать на рабочей системе без дополнительного анализа. Старый размер или знакомое имя не доказывают подлинность: сравниваются хеш, издатель, сигнатура PE и сведения нескольких каталогов.

Пробная лицензия ограничивает срок использования и объём индекса. В описании деморежима указывается максимум 10 000 файлов, ограничение по числу запусков и уведомление о регистрации. Для оценки нужно заранее выбрать небольшую, но репрезентативную коллекцию, иначе предел будет исчерпан служебными файлами до проверки главных форматов.

Типовые рабочие сценарии

Поиск договора по фразе из условия

Создайте отдельный индекс папок с договорами и приложениями, включите PDF, DOC, DOCX, RTF, XLS и почтовые сообщения, а сканы предварительно пропустите через OCR. Введите запомнившуюся формулировку как точную фразу. Если результатов слишком много, ограничьте папку, период и тип документа, затем проверьте подсвеченный контекст и откройте оригинал.

Для регулярной работы настройте инкрементальное обновление. Старые закрытые годы можно вынести в отдельные индексы и подключать только при необходимости. Не включайте пропуск одинаковых текстов, если юридически важны разные подписанные экземпляры с похожим содержимым.

Каталог технических дисков

Присвойте каждому носителю уникальную метку, создайте тематический индекс и включите сохранение извлечённого текста. После обработки отключите диск и выполните контрольный запрос. Результат должен показывать название носителя, путь и читаемый фрагмент. Отдельно храните таблицу соответствия физических коробок и меток.

Если на дисках много архивов, включайте только нужные контейнеры. Повреждённые и парольные архивы отмечайте в протоколе, чтобы пользователь понимал предел полноты. Индекс резервируйте вместе с каталогом носителей, но не считайте его копией оригинальных файлов.

Поиск по экспортированной переписке

Экспортируйте письма в EML или MSG либо добавьте поддерживаемую почтовую базу. Включите Scan mail attachments и ограничьте расширения вложений рабочими форматами. Проверьте запрос по теме, фразе из тела и уникальному слову из приложения. Три теста показывают, какие уровни действительно обработаны.

Для больших цепочек ответов оцените дубликаты. Если одинаковые вложения создают сотни результатов, попробуйте отдельный тестовый индекс с Skip duplicate texts. Сравните полноту и только затем применяйте правило к основной базе.

Внутренний поиск для отдела

Разместите индексы на постоянно включённом компьютере, настройте серверный адрес, порт, пользователей и доступные базы. Включите ограничение времени запроса и разумное число результатов на странице. С другого компьютера проверьте вход, поиск, просмотр и открытие файла под обычной, а не административной учётной записью.

Разделяйте конфиденциальные и общие документы по индексам. Не полагайтесь только на скрытие ссылки: пользователь не должен получать закрытый фрагмент даже через прямой запрос. Журнал сервера и резервная копия настроек необходимы для диагностики.

Разбор большого текстового экспорта

Если система выдаёт один гигантский TXT, включите File splitting и задайте маркер начала записи. Проверьте регистр, кодировку и минимальный размер части. После пробного индексирования убедитесь, что каждая логическая запись отображается отдельно и не теряет заголовок.

При неверном разделителе база может получить одну огромную запись или тысячи пустых частей. Исправление требует повторной обработки файла, поэтому тестируйте на короткой копии. Для двоичного маркера используйте HEX-последовательность и документируйте правило рядом с индексом.

Устранение ошибок индексирования

Файл открывается, но не находится по содержимому

Сначала убедитесь, что запрос действительно уникален и область поиска включает нужный индекс. Затем проверьте расширение, исключения и протокол. Если это PDF или DjVu, подтвердите наличие текстового слоя. Для TXT проверьте кодировку. После изменения параметров используйте Index all files again для небольшой тестовой папки.

Если имя файла находится, а фраза нет, запись была создана без извлечённого текста. Причиной может быть неподдерживаемый вариант формата, защита, повреждение или опция Index files that contain no text. Сохраните документ в более простом поддерживаемом формате и сравните результат.

В результатах остаются удалённые документы

Запустите нормальное обновление и проверьте, что источник доступен во время операции. Если удаление не отражается, выполните Rebuild. После большого числа изменений используйте Compress. Перед перестройкой сохраните настройки и убедитесь, что база не используется сервером.

На съёмном носителе отсутствие файла не всегда означает удаление: диск может быть просто отключён, а индекс специально хранит его карточку. Различайте архивную базу носителя и рабочую папку, где устаревшие записи должны исчезать.

Русские слова отображаются неправильно

Проблема обычно связана с кодировкой исходного текстового файла. Откройте его в редакторе, определите кодировку, настройте Encodings и перестройте тестовый индекс. Для HTML проверьте объявление кодировки в документе; неверный заголовок может заставить фильтр интерпретировать текст ошибочно.

Если буквы читаются нормально, но словоформы не находятся, проверьте Morphology и распознавание языка. Изменение языка интерфейса не исправляет анализ текста. Для артикулов и имён собственных сравните морфологический и точный запрос.

Индексирование сетевой папки пропускает файлы

Откройте тот же UNC-путь под учётной записью задания. Проверьте чтение вложенных каталогов, длинные имена и временные разрывы. Подключённая буква диска может быть видна пользователю, но отсутствовать у службы или планировщика. Добавьте сетевой путь напрямую и повторите тест.

Если часть файлов открыта другим приложением, индексатор может не получить доступ. Выберите период меньшей активности или работайте со снимком. Протокол должен показать, какие элементы заблокированы, а не просто сообщить об общем завершении.

Почтовая база вызывает зависание

Закройте почтовый клиент и создайте резервную копию хранилища. Проверьте его штатными средствами, затем индексируйте ограниченную папку или экспорт. Большая активная база сочетает блокировки, повреждённые сообщения и вложенные архивы, поэтому диагностика по всему файлу сразу малоинформативна.

Если EML или MSG обрабатываются нормально, а монолитная база нет, используйте экспорт как промежуточный формат. Это увеличит число файлов, но упростит контроль и позволит повторить обработку только проблемного сообщения.

Индекс занимает слишком много места

Проверьте Save extracted texts in base, вложения, архивы, дубликаты и файлы без текста. Отключение сохранённого текста уменьшает базу, но лишает офлайн-просмотра. Исключение вложений ускоряет работу, но ухудшает полноту. Оптимизацию нужно выполнять по приоритету задачи, а не удалять всё сразу.

Разделите коллекцию, удалите ненужный индекс штатной командой и выполните Compress для оставшихся баз. Не стирайте отдельные внутренние файлы вручную. Если место закончилось во время операции, восстановите копию или перестройте индекс в каталоге с запасом.

Просмотрщик показывает пустую страницу

Проверьте, был ли извлечён текст. Для файла без текстового слоя, зашифрованного документа или изображения пустой просмотр ожидаем. Если исходник отключён и Save extracted texts in base не использовался, программа не сможет показать содержимое без подключения носителя.

Откройте оригинал через Open file. Если он исправен, создайте тестовую копию в простом формате и повторите индексирование. Разница покажет, относится ли проблема к фильтру конкретного формата или ко всему индексу.

Веб-поиск не открывается с другого компьютера

Убедитесь, что сервер запущен, адрес и порт верны, а брандмауэр разрешает входящее соединение. Проверьте локальное открытие страницы на сервере, затем доступ по IP из сети. Если локально работает, а удалённо нет, причина обычно в сетевой привязке, фильтре IP или правилах маршрутизации.

При работе как службы проверьте учётную запись и доступ к индексам. Страница может открываться, но поиск возвращать ошибку, если служба не видит базу. Просмотрите Protocol и сравните права интерактивного пользователя со служебными.

Результатов слишком много

Отключите слишком широкую морфологию для технического термина, используйте точную фразу, исключите шаблонное слово и добавьте атрибуты. Ограничьте Search zone тематическим индексом. Сортировка по Rate помогает, но не заменяет уточнение запроса.

Если шум создают одинаковые шаблоны, примените Text filtering при индексировании или добавьте отрицательное условие в запрос. Фильтрацию следует проверять на копии, потому что удалённый служебный фрагмент может оказаться частью нужного документа.

Резервное копирование и перенос индексов

Индекс содержит результат длительной обработки, поэтому его стоит резервировать. Копию выполняют после остановки обновления и серверного доступа, чтобы набор внутренних файлов находился в согласованном состоянии. Параллельное копирование активной базы может сохранить части разных моментов времени.

В резервную копию включают каталог индекса, параметры, пользовательские шаблоны сервера и описание источников. Исходные документы копируются отдельно. Для архива съёмных дисков также нужна таблица меток носителей, иначе найденный путь не поможет определить физический диск.

После восстановления проверьте несколько запросов, открытие свойств и количество документов. Если пути источников изменились, обновите настройки до запуска планировщика. Нельзя считать копию рабочей, пока она не открыта и не проверена на другом каталоге.

При переносе между компьютерами учитывайте разрядность установщика, права на сетевые ресурсы и пути к шаблонам. Сам индекс может открыться, но команды Open file и обновление будут ссылаться на старые расположения. Для переносимого архива лучше заранее использовать устойчивые пути и понятные имена.

Конфиденциальность индексной базы

Сохранённый текст превращает индекс в копию значительной части содержимого документов. Даже если оригинал зашифрован на отключённом носителе, извлечённый ранее фрагмент может остаться доступным в базе. Каталог индекса должен защищаться не слабее исходных данных.

Удаление файла из рабочей папки не гарантирует немедленного исчезновения текста из индекса. Требуется обновление, а иногда перестройка и сжатие. Для документов с ограниченным сроком хранения нужно включить обслуживание индекса в процедуру удаления и подтвердить результат контрольным запросом.

Серверная история запросов тоже чувствительна. Пользователи вводят фамилии, номера договоров, диагнозы, идентификаторы и другие данные. Срок хранения журнала, доступ администраторов и резервные копии должны соответствовать внутренним правилам.

Разделение индексов упрощает разграничение. Общий фонд можно публиковать отделу, а конфиденциальный держать отдельно. Один индекс со всеми документами сложнее безопасно фильтровать, особенно если права исходной файловой системы не переносятся на результаты автоматически.

Сравнение Archivarius 3000 с аналогами

ПрограммаЛучше подходит дляГлавное ограничение
Archivarius 3000Архивов документов, почты, редких форматов и отключаемых носителейНет встроенного OCR и требуется предварительный индекс
dtSearch DesktopКрупных профессиональных коллекций, сложных запросов, почты и вложенных контейнеровКоммерческое решение с более сложным администрированием
Copernic Desktop SearchПовседневного поиска по файлам, Outlook и подключаемым источникам в WindowsЧасть типов и источников зависит от редакции и подключаемых модулей
DocFetcherБесплатного переносимого поиска по обычным документам на разных системахМеньше корпоративных средств удалённого доступа и разграничения
RecollГибкого открытого полнотекстового поиска в Linux, Windows и macOSДля некоторых форматов нужны внешние фильтры и ручная настройка

Archivarius 3000 стоит выбирать для уже сформированного архива, где важны редкие документы, почтовые базы, съёмные диски и встроенный сервер. dtSearch лучше подходит для больших профессиональных массивов и современных форматов с развитым языком запросов. Copernic удобнее как пользовательский поиск по рабочему компьютеру и Outlook. DocFetcher рационален для бесплатной переносимой базы, а Recoll — для открытой и настраиваемой системы на нескольких платформах.

PDF Commander в эту таблицу не включён, потому что решает другую задачу: редактирует и преобразует PDF, а не строит общий полнотекстовый индекс документов и почты. Эти программы могут дополнять друг друга: поисковик находит нужный файл, редактор вносит изменения в его страницы.

Как оценить программу на собственной коллекции

Для проверки подготовьте папку из 100–500 файлов, которая отражает реальные данные: текстовый PDF, скан без OCR, DOCX, старый DOC, таблицу, архив с вложенным документом, несколько EML и файл в нестандартной кодировке. Добавьте один защищённый и один повреждённый элемент, чтобы увидеть поведение протокола.

Сформулируйте заранее десять контрольных запросов. Они должны проверять точную фразу, русскую словоформу, имя файла, дату, вложение, архив, отключённый носитель и отрицательное условие. Результаты запишите до изменения настроек. Такой тест показывает реальную полноту и позволяет сравнить альтернативы на одинаковом наборе.

Отдельно измерьте время первого построения, повторного обновления, размер базы и задержку поиска. Важна не рекордная скорость на одном запросе, а устойчивость: одинаковый запрос должен давать тот же результат после перезапуска и обновления, а протокол — объяснять пропуски.

Проверьте восстановление. Скопируйте закрытый индекс, откройте копию в другом каталоге и выполните контрольные запросы. Если база используется через Server, протестируйте обычную учётную запись, ограничения по индексам и срок действия ссылок. Только после этого переносите рабочую коллекцию.

Практические вопросы

Можно ли искать без предварительного индексирования?

Основной быстрый поиск рассчитан на подготовленную базу. Индексатор заранее извлекает слова и метаданные, поэтому повторные запросы выполняются почти сразу. Для новой папки сначала создаётся или обновляется индекс; простое добавление пути в поле поиска не заменяет этот этап.

Находит ли программа текст на сканах?

Только если в PDF или DjVu уже есть распознанный текстовый слой. Встроенного OCR нет. Изображение страницы нужно распознать отдельным средством, сохранить результат и повторно проиндексировать файл.

Можно ли просматривать документ после отключения диска?

Да, если при построении была включена запись извлечённого текста в базу. Полный внешний вид, изображения и оригинальный файл без носителя недоступны. Индекс покажет текстовый фрагмент и расположение на диске.

Нужно ли держать Word или Acrobat открытыми?

Для обычного поиска нет. Встроенные фильтры извлекают текст во время индексирования, а просмотрщик показывает сохранённое представление. Родная программа нужна для открытия и редактирования оригинала либо для формата, который обрабатывается через внешнюю интеграцию.

Можно ли искать сразу в нескольких индексах?

Да. В Search zone выбираются доступные базы или группа, а в серверном режиме можно разрешить множественный выбор и отметить набор по умолчанию. Для точного запроса лучше начинать с тематической базы и расширять область только при отсутствии результата.

Что произойдёт после переименования папки?

Путь в существующих записях станет устаревшим до обновления или перестройки. Текст может продолжать находиться, но Open file не откроет оригинал по старому адресу. После крупной реорганизации каталогов выполните полное обслуживание индекса.

Можно ли индексировать внешний сайт?

Программа ориентирована на файлы, почту, сетевые ресурсы и собственный сервер поиска. HTML-страницы можно индексировать как сохранённые файлы или локальное зеркало. Не следует приписывать ей полноценный современный веб-краулер без отдельной проверки конкретного сценария.

Как уменьшить число одинаковых результатов?

Используйте Skip duplicate texts, отдельные индексы, исключения резервных копий и более точный запрос. Перед включением дедупликации проверьте, не важны ли разные экземпляры одинакового текста по пути, дате или письму-источнику.

Можно ли перенести индекс на другой диск?

Да, при остановленных операциях и копировании полного каталога базы. После переноса укажите новый путь, откройте индекс и выполните контрольный поиск. Исходные файлы должны оставаться доступны по прежним путям, если требуется их открытие и обновление.

Почему поиск находит слово в неожиданном файле?

Совпадение может находиться во вложении, скрытом служебном поле, HTML-навигации, колонтитуле или архиве. Откройте подсвеченный фрагмент и посмотрите путь. При систематическом шуме настройте Text filtering, исключения или типы документов.

Итоговая схема надёжной работы

Начинайте с небольшой контрольной коллекции и фиксируйте правила: источники, расширения, кодировки, морфологию, обработку архивов и сохранение текста. После проверки создавайте тематические индексы, а не одну неопределённую базу всего диска. Это упрощает обновление, безопасность и поиск.

Для ежедневной работы используйте инкрементальные обновления, а Rebuild оставляйте для изменения фундаментальных параметров и исправления несогласованной базы. Контролируйте протокол, свободное место и несколько эталонных запросов. Планировщик должен подтверждаться результатом, а не только наличием задания.

В поиске двигайтесь от редкого термина к точной фразе и атрибутам. Оценивайте не только Rate, но и путь, дату, тип и контекст. Сохранённый текст помогает быстро отбирать документы, однако юридически или технически значимое решение следует принимать по открытому оригиналу.

Серверный режим разворачивайте только после локальной проверки индексов. Настройте пользователей, допустимые базы, IP-фильтрацию, шифрование, срок жизни ссылок и журнал. Общий поиск удобен, но индекс с полным текстом является самостоятельным хранилищем конфиденциальных данных.

Archivarius 3000 особенно полезен там, где документы распределены между папками, почтой, архивами и съёмными носителями, а названия файлов не помогают вспомнить содержание. Грамотно настроенные индексы превращают разрозненную коллекцию в поисковый каталог: запрос приводит к нужному фрагменту, показывает источник и сокращает время от смутного воспоминания до открытия оригинала.