dtSearch помогает находить фразы, числа, адреса, даты и сочетания терминов внутри больших коллекций PDF, офисных документов, писем, архивов и веб-материалов: пользователь создаёт индекс нужных папок, задаёт точный, нечёткий, морфологический или логический запрос, а затем просматривает найденные файлы с подсвеченными совпадениями, фильтрует выдачу и формирует отчёт с контекстом каждого попадания.
Работа начинается не с перебора каталогов, а с выбора поисковой области. В окне Search слева показывается словарь выбранного индекса, справа отмечаются один или несколько индексов, ниже вводится запрос и включаются дополнительные режимы. После запуска выдача делится на список документов и область просмотра: по строкам видно имя, путь, число совпадений и релевантность, а кнопки перехода ведут от одного выделенного фрагмента к следующему.
Для повторяемого процесса достаточно один раз создать индекс, добавить папки, почтовые хранилища или адреса для Spider, а затем регулярно выполнять обновление с добавлением новых файлов и удалением записей об исчезнувших. Точность поиска зависит от настроек индекса: правил разбора дефисов, стоп-слов, полей, сегментации, обработки вложений и кэширования текста, поэтому эти параметры лучше определить до массовой загрузки документов.
Скачать dtSearch
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Только Windows
- Нет встроенного OCR
- Для PDF нужен WebView2
Как устроен поиск в dtSearch
Индекс в dtSearch — это служебная база, где для каждого распознанного слова сохраняются сведения о документах и позициях слова внутри них. При обычном поиске программа не перечитывает каждый PDF или файл Word: она обращается к этой базе, поэтому сложный запрос по многим папкам выполняется значительно быстрее прямого сканирования. Исходные документы при этом остаются на своих местах; индекс хранит ссылки на них, а при включённом кэшировании — ещё и извлечённый текст либо копии документов для просмотра.
Такой принцип требует дисциплины обновления. Если исходный файл изменился, но индекс не обновили, выдача продолжит опираться на прежний текст, а подсветка может оказаться смещённой относительно открытого документа. Если файл удалён, его запись останется в выдаче до запуска операции Remove deleted documents. Практичная схема — обновлять активные рабочие папки по расписанию, а архивные коллекции пересчитывать после пакетного пополнения.
Один запрос может охватывать несколько индексов. Это удобно, когда договоры, переписка, техническая документация и материалы проекта разделены физически, но искать нужно сразу по всем массивам. Раздельные индексы проще обслуживать и разграничивать, а объединённая выдача сохраняет ранжирование и позволяет перейти к конкретному документу без ручного обхода хранилищ.
Три этапа рабочего процесса
- Создать индекс и определить области: папки, Outlook, веб-адреса или их сочетание.
- Обновить индекс, проверить журнал обработки и устранить ошибки чтения защищённых, повреждённых или неподдерживаемых файлов.
- Открыть Search, выбрать индексы, сформировать запрос, уточнить диапазон по именам, датам и размерам, затем исследовать совпадения в выдаче.
Индексирование и поиск разделены намеренно. Параметры, влияющие на токенизацию текста, нельзя безнаказанно менять после заполнения: если иначе трактовать дефис, регистр, диакритические знаки или длину слова, старые записи и новый запрос начнут понимать текст по-разному. При серьёзной смене таких правил безопаснее создать индекс заново, чем пытаться исправить расхождения одним обновлением.

Создание индекса и выбор места хранения
Команда Index → Create Index открывает небольшое окно, где задаются имя и каталог индекса. Имя должно объяснять содержимое, а не повторять букву диска: Договоры 2024–2026 полезнее, чем Index1. Путь стоит выбирать с учётом свободного места, резервного копирования и скорости носителя. Индекс активно читает множество служебных файлов, поэтому быстрый SSD заметно удобнее медленного сетевого ресурса, особенно при одновременном поиске в нескольких базах.
После подтверждения dtSearch предлагает сразу добавить документы. В окне Update Index кнопка Add Folder добавляет файловую папку, Add Outlook — папки из профиля Outlook, Add Web — стартовый адрес для Spider. Ресурси можно комбинировать, но для управляемого обслуживания крупные и неоднородные массивы лучше разнести. Отдельный индекс для почты, например, позволяет чаще обновлять переписку, не затрагивая редко меняющийся архив PDF.
Указание папки не означает безусловное включение всего дерева. Рядом настраиваются фильтры имён и исключения. Можно индексировать только `*.pdf;*.docx`, исключить временные файлы, резервные копии, каталоги сборки и другие данные, которые создают шум. Фильтр применяется при последующих обновлениях, поэтому изменение маски требует внимательной проверки: ранее включённые документы могут оставаться до удаления устаревших записей.
Как назвать и расположить индекс
- Использовать понятное имя, которое видно в списке Search и Index Manager.
- Не размещать активно обновляемый индекс в папке, которую синхронизатор постоянно блокирует или копирует по частям.
- Не смешивать индекс с исходными документами: служебные файлы проще резервировать и удалять отдельным каталогом.
- Для переносимой коллекции применять относительные пути, чтобы связь с документами сохранялась при смене буквы носителя.
- Перед публикацией общего индекса проверить права на каталог и доступ пользователей к исходным файлам или кэшированным копиям.
Относительные пути особенно полезны для внешнего диска или подготовленного набора, где индекс и документы перемещаются вместе. В этом режиме путь вычисляется относительно каталога индекса. Если структура папок меняется, ссылка перестаёт указывать на оригинал, поэтому переносить следует весь корневой каталог, сохраняя внутреннюю иерархию.
Обновление индекса без потери актуальности
Окно Update Index содержит список ресурсов и набор операций. Для обычного обслуживания отмечают Index new or modified documents и Remove deleted documents. Первая опция добавляет новые файлы и перечитывает изменённые, вторая удаляет записи, которым больше не соответствует исходный объект. Если оставить только добавление, индекс постепенно накопит результаты для уже удалённых документов.
Кнопка Start Indexing запускает обработку, а журнал показывает путь текущего файла, число добавленных документов, предупреждения и ошибки. Важен не только итоговый счётчик. Сообщение об image-only PDF означает, что в файле нет поискового текстового слоя; запись метаданных возможна, но слова со страниц не появятся в словаре. Сообщения о шифровании, повреждении или отказе доступа требуют отдельной проверки исходника и прав учётной записи.
Повторное обновление не обязано занимать столько же времени, сколько первичное построение. dtSearch сравнивает состояние ресурсов и обрабатывает изменившиеся элементы. Однако сетевые задержки, большие почтовые хранилища и архивы с многочисленными вложениями могут сделать предварительный обход заметным. Для таких наборов полезно разделить ресурсы и назначить разные расписания.

Расписание через Windows Task Scheduler
Команда Index Manager → Schedule Updates создаёт задачу обновления, которую выполняет Планировщик заданий Windows. В расписании нужно учитывать момент доступности сетевых дисков, состояние VPN и права той учётной записи, под которой запускается задача. Интерактивный поиск может работать у пользователя, а ночная задача — получать отказ, если она запущена без доступа к сетевому ресурсу.
Для часто меняющихся папок разумно назначить короткое ежедневное обновление, а сжатие выполнять реже. При обновлении больших массивов следует оставить запас времени до начала рабочего дня: одновременное активное индексирование и интенсивный поиск конкурируют за дисковый ввод-вывод. После первого автоматического запуска стоит открыть журнал и убедиться, что задача действительно увидела все ресурсы.
Окно Search и логика элементов интерфейса
В верхней левой части Search располагается Indexed word list. Это не список найденных файлов, а словарь слов из выбранного индекса. Когда пользователь печатает начало термина, список прокручивается к близким вариантам и помогает заметить другое написание, опечатку или отсутствие слова в базе. Если отмечено несколько индексов, выпадающий список над словарём определяет, чей словарь показывать, но сам запрос может выполняться по всем отмеченным индексам.
Верхняя правая область содержит индексы для поиска. Снятие флажка исключает базу из текущего запроса, не удаляя её. Поле Search request принимает слова, фразы и операторы. Рядом выбирается тип интерпретации: Any words, All words, Boolean либо Natural language, если такой режим нужен для ранжирования свободно сформулированного текста. Ниже включаются stemming, fuzzy, phonic и synonym search.
Дополнительные ограничения открываются через More Search Options. Там задаются маски включаемых и исключаемых файлов, диапазоны дат и размера, максимальное число результатов, а также выбор между индексированным и прямым поиском. Ограничения по имени и дате выгодно задавать до запуска: они сокращают выдачу и избавляют от просмотра нерелевантных совпадений.

Как проверить термин до запуска
Если запрос неожиданно даёт ноль результатов, сначала нужно посмотреть на словарь. Наличие термина подтверждает, что он действительно попал в индекс в такой форме. Кнопка Browse Words показывает влияние подстановочных знаков, нечёткого, фонетического и морфологического режимов: пользователь видит, какие конкретно слова будут охвачены. Такой предварительный просмотр особенно полезен для фамилий, артикулов и терминов с дефисом.
Отсутствие слова в словаре не всегда означает отсутствие документа. Термин мог быть исключён как noise word, оказаться длиннее установленного предела, состоять из символов, которые алфавит считает разделителями, или находиться в изображении без OCR. Ещё одна причина — поиск ведётся по другому индексу, чем тот, чей словарь открыт.
Режимы Any words и All words
Any words предназначен для запроса, где достаточно присутствия любого из перечисленных элементов. Он удобен для первичного отбора по нескольким возможным названиям: `акт протокол заключение`. Результаты ранжируются по сочетанию совпадений, поэтому документы с несколькими терминами обычно поднимаются выше, но формально обязательным не является ни один.
All words требует присутствия каждого указанного слова или фразы. Кавычки объединяют слова в точную фразу, плюс перед элементом делает его обязательным, минус исключает. Запрос `"техническое задание" +подрядчик -черновик` ищет точную фразу и слово подрядчик, отбрасывая документы со словом черновик. Важно ставить знак непосредственно перед словом или открывающей кавычкой.
Эти режимы проще Boolean, но не заменяют его, когда важна структура отношений. Они хорошо подходят для быстрых рабочих запросов, где пользователь знает обязательные и нежелательные термины, но не хочет расставлять скобки и операторы. Для юридических конструкций и проверки близости слов лучше перейти к Boolean.
Boolean-запросы, скобки и приоритет операций
Boolean связывает слова и фразы операторами AND, OR и NOT. `поставка AND гарантия` требует оба элемента, `поставка OR отгрузка` допускает любой, а `поставка AND NOT черновик` исключает нежелательный термин. Фраза без оператора трактуется как последовательность слов, поэтому `срок поставки` и `срок AND поставки` решают разные задачи: первая ищет выражение, вторая — два слова независимо от расстояния.
Скобки устраняют неоднозначность. Запрос `договор AND (аренда OR лизинг)` требует договор и один из двух типов отношений. Без скобок пользователь рискует получить другую логическую группировку. В длинных запросах полезно сначала проверить отдельные части, затем объединить их: так легче обнаружить слишком жёсткое условие, которое обнуляет выдачу.
NOT следует применять осторожно. Исключаемое слово может находиться в приложении, подписи или процитированном письме и удалить из выдачи полезный документ. Если нежелательный термин важен только рядом с основным, точнее использовать NOT W/N, ограничив расстояние, а не исключать файл целиком.
Поиск слов рядом друг с другом
Оператор W/N требует, чтобы два элемента находились в пределах N слов. `неустойка W/10 просрочка` найдёт документы, где понятия связаны контекстом, даже если между ними стоят служебные слова. Чем меньше N, тем строже связь; слишком большое значение приближает запрос к обычному AND. Порядок терминов не обязательно совпадает с порядком в запросе, если не задана отдельная конструкция.
NOT W/N означает, что второй термин не должен встречаться в указанной окрестности первого. Это полезно для различения похожих тем: можно найти упоминания банк, рядом с которыми нет банк данных. Специальные маркеры xfirstword и xlastword позволяют ограничить термин началом или концом документа: например, `номер W/20 xfirstword` ориентирует поиск на шапку, а не на каждое упоминание номера в основном тексте.
Фразы, подстановочные знаки и числовые диапазоны
Кавычки фиксируют фразу, но результат зависит от того, как индекс разбивает текст на слова. Пунктуация обычно выступает разделителем, а дефис по умолчанию обрабатывается как пробел. Поэтому форма `северо-западный` может индексироваться как два слова; изменение правила дефиса требует согласованного построения индекса и поиска.
Знак вопроса заменяет один символ: `догово?` охватывает варианты одинаковой длины. Звёздочка заменяет произвольное число символов: `сертификат*` может найти формы и составные продолжения. Начальная звёздочка потенциально заставляет просматривать большое число слов словаря, поэтому запрос `*логия` тяжелее точного префиксного поиска. Перед массовым запуском полезно открыть Browse Words и увидеть размер раскрытия шаблона.
Конструкция с двумя тильдами задаёт числовой диапазон. Запрос `100~~150` охватывает числа внутри интервала, а знак равенства работает как подстановка одной цифры. Эти средства удобны для артикулов, диапазонов лет и серийных номеров, но разделители чисел должны совпадать с тем, как текст был распознан и проиндексирован.
Нечёткий, фонетический и морфологический поиск
Fuzzy search допускает ошибки в написании. Уровень нечёткости определяет, сколько различий может быть принято; чем он выше, тем больше вариантов и тем больше шум. Режим полезен для OCR-текста с заменёнными буквами, фамилий и ручного ввода, но не должен постоянно включаться для точных кодов. Сначала стоит искать точную форму, затем добавлять небольшую нечёткость и контролировать расширение через словарь.
Phonic search сопоставляет слова по звучанию. Он ориентирован прежде всего на варианты имён и английские фонетические различия. В многоязычной коллекции результат зависит от конкретного написания, поэтому фонетический режим лучше сочетать с явным списком известных вариантов фамилии, а не полагаться только на него.
Stemming добавляет грамматические варианты окончаний. Поиск основы слова может охватить производные формы без перечисления каждой. Это не полноценный лингвистический анализ смысла: близкие по значению слова не появляются автоматически, а омонимы остаются омонимами. Для синонимов предусмотрен отдельный режим и тезаурус.
Тезаурус и собственные группы терминов
Synonym search использует встроенный англоязычный тезаурус либо пользовательские определения. Окно Browse Thesaurus показывает группы и позволяет выбрать нужные варианты перед переносом в запрос. Для отраслевой лексики полезнее создать User Thesaurus: объединить сокращение, полное название, внутренний код и устоявшийся перевод.
Пользовательская группа должна быть достаточно узкой. Если связать слишком общие слова, каждый запрос будет порождать сотни нерелевантных документов. После изменения тезауруса переиндексация обычно не требуется, потому что расширение применяется при поиске, но результат следует проверить на небольшой контрольной выборке.


Поиск списка слов и проверка большого набора терминов
Search for List of Words предназначен для ситуации, когда требуется проверить десятки или сотни независимых терминов: номера дел, фамилии, индикаторы компрометации, названия веществ или коды изделий. Список можно вводить построчно или подготовить во внешнем текстовом файле. Программа выполняет поиск каждого элемента и собирает результаты, не заставляя вручную повторять один и тот же цикл.
Перед запуском важно определить, считаются ли строки точными фразами и какие поисковые функции разрешены. Нечёткое расширение на большом списке может резко увеличить число совпадений. В отчёте стоит сохранять не только имя файла, но и контекст, чтобы отличать реальное упоминание от совпадения в подписи, заголовке вложения или служебных данных.

Поля документов и запросы по метаданным
Field search ограничивает термин определённой частью документа. Для писем это могут быть Subject, From, To и другие поля, для документов — свойства, заголовки или пользовательские текстовые области. Конструкция `subject contains поставка` ищет выражение в теме, а не во всём теле письма. Кнопка Fields в окне поиска показывает поля, реально встречающиеся в выбранных индексах, что надёжнее угадывания имени.
Поля полезны, когда одно и то же слово встречается повсюду, но значение имеет его роль. Поиск фамилии в From отбирает отправителя, а та же фамилия в полном тексте найдёт подписи, цитаты и вложения. Можно сочетать поле с Boolean-условиями, например требовать тему договора и определённого адресата.
Настройка Text Fields позволяет определить поля в обычном тексте, HTML или XML по маркерам начала и конца, в том числе с регулярными выражениями. Это применимо к логам, выгрузкам и структурированным карточкам, где строки `Client:` или XML-теги повторяются во многих записях. Правило нужно тестировать на разных образцах: слишком широкий конец поля захватит соседние блоки, слишком узкий пропустит многострочные значения.

Распознавание дат, адресов электронной почты и номеров карт
В индексирующих параметрах можно включить автоматическое распознавание дат, адресов электронной почты и последовательностей, похожих на номера банковских карт. После этого специальные функции запроса позволяют искать тип данных, а не только буквальное написание. Даты можно отбирать диапазоном, даже если в документах используются разные допустимые формы.
Проверка номеров карт использует числовые признаки допустимости, но она не гарантирует, что найденная последовательность действительно является платёжным реквизитом. Контрольные алгоритмы отсеивают часть случайных чисел, однако ложные срабатывания возможны. Поэтому такие результаты нужно рассматривать как кандидаты для проверки, а не как доказательство наличия чувствительных данных.
Опция влияет на состав индекса и должна быть включена до его построения. Если активировать её после массовой индексации, старые документы не получат специальные токены до полного обновления или перестроения. Для проверки можно открыть List Index Contents и вывести элементы соответствующего типа.
Регулярные выражения: где они полезны и где ограничены
Регулярное выражение помещается в кавычки и предваряется маркером `##`. Оно удобно для формализованных идентификаторов, когда простых `*`, `?` и `=` недостаточно. Тем же синтаксисом можно описывать границы сегментов и текстовых полей.
Индексный поиск регулярных выражений имеет принципиальные ограничения. Выражение должно соответствовать одному целому индексируемому слову; оно не превращается в произвольный поиск по строкам всего документа. Символы, которые алфавит индекса считает разделителями, нельзя внезапно сделать значимыми только выражением. Якоря начала и конца строки не работают так, как в редакторе текста, потому что индекс хранит слова и позиции, а не исходные строки в виде непрерывного потока.
Регистр и преобразования для выражения не подставляются автоматически. В регистронезависимом индексе буквы обычно хранятся в нормализованном виде, поэтому шаблон нужно согласовать с этой формой. Выражение с широким началом действует по скорости подобно ведущей звёздочке: оно проверяет много слов словаря. Для одной неизвестной цифры быстрее знак `=`, а для простого диапазона — числовой оператор.
Выдача, ранжирование и просмотр совпадений
После поиска окно результатов показывает документы строками. Набор колонок зависит от настроек, но обычно полезны имя, путь, число hits, размер, дата и score. Score отражает релевантность в рамках конкретного запроса, а не качество или достоверность документа. При поиске обязательной точной фразы сортировка по дате иногда практичнее ранга; при широком тематическом запросе ранжирование помогает начать с насыщенных совпадениями файлов.
Область просмотра извлекает текст и выделяет найденные слова. Кнопки Next Hit и Previous Hit переходят между отдельными попаданиями. Для PDF внутренний просмотрщик показывает страницы и поддерживает многоцветную подсветку разных терминов. Оригинал остаётся неизменным: выделение является слоем представления результата, а не аннотацией, записанной в файл.
Двойной щелчок или команда запуска открывает исходник связанным приложением. Если формат нужно всегда передавать определённой программе, это настраивается в External Viewers. Для редких форматов можно указать командную строку и параметры, но путь должен существовать на компьютере пользователя; общая настройка с абсолютным путём на компьютере не переносится на другие рабочие места без адаптации.


Выделение и пакетные действия
Результаты можно выделять по одному, диапазоном или группой, после чего копировать найденные файлы в отдельный каталог. Это удобно для подготовки выборки, но копирование меняет контекст: одинаковые имена из разных папок могут конфликтовать, а вложения и зависимые материалы — потерять связь с контейнером. Перед пакетной операцией стоит включить отображение полного пути и проверить правила разрешения совпадающих имён.
Search History сохраняет предыдущие запросы и помогает повторить сложную конструкцию. Историю следует очищать или не использовать для чувствительных терминов на общем компьютере. Для повторяемых процедур лучше сохранить проверенный запрос или макрос с понятным названием, чем восстанавливать его из случайной строки истории.
Отчёты по результатам и контекст совпадений
Search Report формирует представление, где для каждого документа выводится заданное число фрагментов вокруг hits. Пользователь выбирает объём контекста, число совпадений на документ и формат представления. Такой отчёт быстрее просматривать, чем поочерёдно открывать сотни файлов, особенно при первичной юридической или исследовательской выборке.
Контекст нельзя считать полной цитатой документа. Извлечение может убрать сложное форматирование, колонтитулы и расположение таблиц. Если фрагмент влияет на решение, нужно открыть оригинал и проверить страницу, соседний текст, примечания и подписи. Для PDF с распознанным слоем полезно сравнить выделение с видимым изображением: ошибки OCR иногда превращают слово в формально подходящее, но неверное совпадение.
При включённом кэшировании текста отчёты строятся быстрее и остаются доступны, даже если исходный сетевой ресурс временно медленный. Но кэш содержит извлечённые данные, поэтому каталог индекса должен защищаться не слабее исходных документов. Нельзя считать индекс безобидным только потому, что в нём нет привычных файлов PDF или DOCX.

PDF: индексирование, просмотр и реальные ограничения
Текстовый PDF индексируется по встроенному текстовому слою. Документ может содержать шрифты, векторную графику и изображения, но для поиска важен извлекаемый текст. PDF Portfolio обрабатывается как контейнер с вложенными элементами, если их типы распознаются. Метаданные также могут попадать в индекс в зависимости от настроек.
Скан, состоящий только из изображений страниц, не становится поисковым сам по себе. dtSearch сообщает о таких PDF в журнале, но не выполняет OCR. Сначала документ нужно распознать в отдельном OCR-инструменте и сохранить текстовый слой, затем обновить индекс. Проверить результат можно простым выделением текста в PDF-просмотрщике или поиском контрольной фразы, видимой на странице.
Внутренний просмотр PDF основан на компоненте, которому в Windows требуется среда Microsoft Edge WebView2. При её отсутствии окно может не показать документ или подсветку. Решение — установить или восстановить WebView2 Runtime, перезапустить программу и повторить открытие. Эта зависимость касается отображения; уже построенный индекс не требуется пересоздавать только из-за смены просмотрщика.
Подсветка показывает каждое попадание и позволяет переходить непосредственно между hits. Если найденные слова подсвечиваются в неправильных местах, наиболее вероятна рассинхронизация: документ изменился после последнего обновления. Нужно обновить соответствующий индекс с обработкой изменённых файлов. Если исходный PDF защищён, повреждён или содержит нестандартное кодирование, извлечение текста может быть неполным; журнал и проверка копии в другом просмотрщике помогут отделить проблему файла от проблемы индекса.
Что dtSearch не делает с PDF
- Не редактирует текст и страницы PDF, не объединяет и не разделяет документы.
- Не создаёт OCR-слой для сканов и фотографий страниц.
- Не записывает поисковую подсветку как постоянные аннотации в исходный файл.
- Не снимает пароль и не обходит запреты на извлечение текста.
- Не заменяет визуальную проверку таблиц, подписей и расположения элементов.
Поэтому программа особенно сильна как средство поиска и отбора, а последующее изменение PDF выполняется в профильном редакторе. В рабочей цепочке это выглядит так: найти все документы по содержимому, скопировать подтверждённую выборку, затем открыть нужные файлы для редактирования, комментирования или сборки итогового пакета.
Поддерживаемые документы, почта и контейнеры
Фильтры dtSearch извлекают текст из распространённых форматов Microsoft Word, Excel, PowerPoint, Access и OneNote, файлов OpenDocument и OpenOffice, RTF, HTML, XML, обычного текста, CSV, XBASE и ряда других структур. Для PDF заявлена обработка вплоть до PDF 2.0. Реальная полнота зависит от структуры конкретного файла: текст в диаграмме, внедрённом объекте или изображении может не совпадать с тем, что доступно основному фильтру.
Почтовые данные охватывают Outlook и распространённые форматы сообщений и хранилищ, включая вложения. Вложенный документ индексируется как отдельный элемент с привязкой к контейнеру. Многоуровневая цепочка — письмо, внутри ZIP, внутри него документ — может быть разобрана, если каждый слой поддерживается и не зашифрован. Это делает поиск по переписке полезным, но увеличивает время и объём индекса.
Архивы ZIP, RAR, GZIP и TAR рассматриваются как контейнеры. Парольный архив не даёт прочитать содержимое без пароля; повреждённый контейнер может породить ошибку на весь вложенный набор. Чтобы изолировать проблему, полезно проверить архив отдельным распаковщиком и посмотреть точный путь в журнале индексирования.
Для изображений, аудио и видео программа может индексировать доступные метаданные, но не распознаёт речь и не анализирует пиксели. Название, комментарий или EXIF-поле найдутся, если фильтр извлёк их, а текст на фотографии — нет. То же правило применимо к скриншотам, помещённым в документ без OCR.
Кэширование текста и документов в индексе
При создании индекса можно включить Cache document text и Cache original documents. Кэш текста ускоряет отчёты и просмотр извлечённого содержимого, особенно если оригиналы лежат на медленном сервере или получены Spider. Кэш документов позволяет открывать сохранённую копию, когда исходник недоступен, но заметно увеличивает объём базы.
Кэширование меняет модель безопасности. Пользователь, получивший доступ к каталогу индекса и средствам поиска, потенциально видит данные, даже если исходный сетевой путь теперь закрыт. Для общего индекса необходимо применять права доступа, шифрование носителя и резервное копирование с тем же уровнем защиты, что и у первичных документов.
Изменение режима кэширования требует переобработки содержимого. Нельзя включить хранение копий и ожидать, что уже проиндексированные документы появятся в кэше без обновления. Перед выбором стоит оценить размер исходной коллекции, типичные сценарии удалённого доступа и требования к удалению данных.
Spider: индексирование веб-сайтов и внутренних порталов
Кнопка Add Web добавляет стартовый адрес, после чего Spider переходит по ссылкам и передаёт загруженные материалы индексатору. По умолчанию обход ограничивается исходным сервером; переход на другой хост нужно разрешить отдельно. Это предотвращает случайное расползание задания по внешним сайтам.
Глубину и объём обхода контролируют фильтры URL, максимальное число страниц, лимит времени, размер файла и пауза между загрузками. Исключения следует формулировать до большого запуска: календарь с бесконечными параметрами, фасетная навигация или множество эквивалентных URL способны создать огромное количество дублей. Spider соблюдает robots.txt, поэтому закрытый раздел не будет проиндексирован вопреки правилам сервера.
Для защищённых ресурсов предусмотрено хранение имени пользователя и пароля. Учётная запись должна иметь ровно тот доступ, который допустим для индекса. Если одна техническая учётная запись видит больше, чем пользователи выдачи, кэшированный индекс может раскрыть лишний материал. Внутренние сайты также могут требовать особый user agent, прокси или метод загрузки; эти параметры находятся в Spider Options.
При индексировании веб-данных кэш текста особенно полезен: страница может измениться или исчезнуть между поиском и просмотром. Однако кэш не превращает обход в полноценный архив сайта — динамические сценарии, контент после JavaScript и формы могут не предоставлять Spider тот же результат, который видит интерактивный браузер.
Фильтры имён и правила типов файлов
Filename Filters задают маски включения и исключения. Они применимы и к путям на диске, и к URL Spider. Маска должна отражать задачу, а не привычное расширение: файл с неправильным расширением может быть распознан по содержимому, но строгий фильтр отсечёт его ещё до проверки. И наоборот, включение `*.*` пропустит служебные и бинарные файлы, которые не нужны в поиске.
File Type Rules определяют, как dtSearch обрабатывает конкретные расширения или сигнатуры. Можно связать расширение с известным фильтром, считать файл обычным текстом, исключить тип либо настроить специальную обработку. Это необходимо для внутренних форматов, которые фактически содержат текст, но имеют нестандартное расширение.
Правило считать текстом безопасно только для действительно текстовой структуры. Попытка читать бинарный файл как текст создаёт мусорные слова, увеличивает индекс и ухудшает выдачу. После добавления правила следует проиндексировать небольшую тестовую папку, открыть List Index Contents и проверить несколько документов в просмотре.

Сегментация больших текстовых файлов
File Segmentation делит один большой текстовый, HTML- или XML-файл на логические поддокументы по маркерам. Это полезно для журналов, выгрузок баз, конкатенированных писем и XML-наборов, где каждый блок должен появляться отдельной строкой выдачи. Максимальный размер одного сегмента ограничен 16 МБ, поэтому правило нужно подобрать так, чтобы записи не сливались в чрезмерно крупные блоки.
Граница может быть буквальной строкой или регулярным выражением. Для XML и HTML предусмотрено повторение заголовка первого сегмента в последующих, чтобы каждый фрагмент сохранял необходимые объявления и структуру. Название найденного поддокумента формируется по правилу, что помогает понять, какая запись внутри большого файла совпала.
Ошибочная сегментация опасна тихими потерями контекста. Если маркер встречается внутри данных, одна запись расколется; если некоторые блоки не содержат маркер, они сольются. Правило нужно испытывать на начале, середине и конце реального файла, а также на пустых и многострочных полях.

Алфавит, дефисы, стоп-слова и длина термина
Индексирующий алфавит определяет, какие символы считаются буквами, цифрами, пробелами и дефисами. Именно здесь решается, будет ли `AB-123` одним словом, двумя словами или комбинацией, доступной несколькими способами. По умолчанию дефис рекомендуется трактовать как пробел, потому что это устойчиво для обычного текста, но каталоги деталей и юридические номера могут потребовать другого подхода.
Edit Alphabet позволяет изменить классификацию символов. Это фундаментальная настройка: после изменения существующий индекс нужно перестроить, иначе словарь сохранит старую токенизацию. Перед настройкой стоит собрать контрольные примеры — номера с дефисами, электронные адреса, сокращения, слова с апострофом — и заранее определить ожидаемые запросы.
Noise Words — список частых слов, которые не включаются в индекс ради экономии места и уменьшения шума. Если важный термин попал в этот список, поиск его не найдёт. В специализированной коллекции обычное служебное слово может быть значимым кодом, поэтому стандартный список следует проверить. Полное отключение стоп-слов увеличивает индекс и может замедлить широкие запросы.
Maximum word length ограничивает длину индексируемого слова. Очень длинные хэши, идентификаторы и склеенные OCR-последовательности могут быть обрезаны или пропущены в зависимости от параметров. Для форензики и журналов предел иногда увеличивают, но это повышает объём словаря. Лучше настроить его под реальные идентификаторы, а не ставить максимум без оценки.

Регистр и диакритические знаки
Индекс может учитывать регистр либо нормализовать его. Регистронезависимый поиск удобнее для обычных документов, где Договор и договор равнозначны. Регистрозависимый нужен для кодов и обозначений, в которых различие букв имеет смысл, но он требует точного ввода и чаще приводит к пропускам.
Для диакритических знаков доступна чувствительная и опциональная обработка. Опциональный режим позволяет сделать акцент в запросе значимым, сохраняя способность неакцентированной буквы совпадать с обоими вариантами. Это полезно в международных массивах, где часть авторов опускает знаки. Строгая чувствительность точнее, но пропустит документ с упрощённым написанием.
Эти параметры должны совпадать между индексированием и поиском. Если база создана без различения регистра, запрос не восстановит потерянное различие. Поэтому решение принимается по рабочим сценариям до построения большой коллекции.
Index Manager: проверка, сжатие, смена имени и объединение
Index Manager показывает известные индексы и предоставляет операции обслуживания. Recognize добавляет в библиотеку существующий каталог индекса, не перестраивая его. Это применяется после переноса или подключения общего ресурса. Delete удаляет служебную базу; перед подтверждением важно отличить индекс от исходных документов и проверить путь.
Compress удаляет устаревшую информацию, накопившуюся после обновлений, и оптимизирует структуру. Операция может уменьшить занимаемое место, но требует времени и свободного пространства. Её не обязательно выполнять после каждого небольшого изменения; разумнее запускать после серии крупных обновлений или когда рост индекса стал несоразмерным.
Verify проверяет целостность. Если поиск выдаёт ошибки чтения индекса, результаты внезапно исчезают или служебные файлы были скопированы во время записи, проверка — первый диагностический шаг. Ошибка Verify требует восстановления из резервной копии либо перестроения; ручное удаление отдельных служебных файлов почти всегда усугубляет проблему.
Merge объединяет несколько индексов. Исходные базы должны иметь совместимые параметры алфавита и других фундаментальных настроек. Объединение удобно для консолидации архивов, но не заменяет логическое разделение прав доступа. После слияния все документы оказываются в одной поисковой области, поэтому безопасность и размер нужно оценить заранее.
Библиотеки индексов и совместная работа
Index Library хранит список индексов, которые пользователь видит в Search и Index Manager. Index Library Manager добавляет и удаляет библиотеки, назначает понятные метки и определяет, где искать их файлы. Это позволяет подключить общий набор баз без ручного Recognize на каждом рабочем месте.
Общий индекс размещается в доступном каталоге. Пользователям поиска достаточно чтения, а процессу обновления нужны права записи. Разделение ролей снижает риск случайного повреждения. Если кэшированы документы или текст, права на каталог индекса должны повторять ограничения исходного хранилища.
Пути к оригиналам должны быть одинаково разрешимы для всех участников. Буква сетевого диска может отсутствовать у другого пользователя, поэтому UNC-путь обычно надёжнее. Если документы открываются только у создателя индекса, а у коллег возникает Document not found, нужно проверить путь, сетевое подключение и относительные ссылки, а не перестраивать словарь без причины.
Поиск без индекса и когда он оправдан
More Search Options позволяет выполнять прямой поиск по файлам без заранее созданного индекса либо сочетать его с индексированным. Прямой режим читает документы во время запроса, поэтому он медленнее, но видит свежие изменения и полезен для одноразовой проверки небольшой папки.
Такой поиск стоит применять, когда набор невелик, содержимое меняется каждую минуту или пользователь не имеет права создавать служебную базу. Для повторяющихся запросов по тысячам документов индекс окупается быстро. Кроме скорости, он даёт словарь, расширенные режимы и более удобную работу с несколькими коллекциями.
Комбинированный режим требует понимать, откуда пришёл результат. Индекс может содержать старую копию, а прямая область — уже изменённый файл. Если важна воспроизводимость, лучше зафиксировать момент обновления и использовать один согласованный ресурс.
Производительность на больших коллекциях
Скорость определяется не только числом документов. Миллион коротких сообщений создаёт больше файловых операций, чем несколько крупных PDF того же суммарного объёма. Сетевые задержки, вложенные архивы, антивирусная проверка и медленное хранилище могут стать узким местом раньше процессора.
Для крупного массива полезно сначала построить пилотный индекс на репрезентативной части и измерить размер, время и число ошибок. Затем можно настроить количество индексирующих потоков, кэш, исключения и расписание. Избыточное число потоков не всегда ускоряет работу: на одном медленном диске они конкурируют за чтение, а фильтры сложных форматов потребляют память.
Индекс нужно размещать там, где хватает места для построения, обновления, сжатия и резервной копии. Свободный объём должен превышать ожидаемый размер служебной базы; некоторые операции создают временные файлы. Если диск заполняется во время обновления, индекс может остаться в неполном состоянии и потребовать Verify или перестроения.
Антивирус может проверять каждый служебный файл и резко замедлять обновление. Исключение каталога из проверки допустимо только после оценки политики безопасности: индекс обрабатывает недоверенные документы и не должен становиться слепой зоной. Более безопасный вариант — согласовать продуктовые исключения с администратором и оставить сканирование исходных данных.
Практический сценарий: поиск по договорам и приложениям
Для договорного архива создают отдельный индекс, включают PDF, DOCX, XLSX и почтовые сообщения с вложениями, а временные и подписанные дубликаты различают по папкам или маскам. Перед массовой загрузкой проверяют, что сканы имеют OCR-слой. Поля темы и отправителя полезны для переписки, а имена файлов — для номера договора.
Первый запрос обычно широк: название контрагента с вариантами написания и обязательным термином предмета. Затем добавляют W/N для связки штраф и просрочка, диапазон дат либо маску файла. Отобранные документы просматривают по hits, а Search Report используют как навигационный список, не как замену оригиналам.
При передаче выборки копируют только подтверждённые файлы и сохраняют запрос отдельно. Это делает процедуру повторяемой: другой сотрудник может обновить индекс, выполнить ту же конструкцию и объяснить, почему конкретный документ попал в набор.
Практический сценарий: техническая документация и коды
В инженерной коллекции основная сложность — артикулы, дефисы, подчёркивания и длинные идентификаторы. До индексации формируют контрольный набор кодов и проверяют алфавит. Если `AB-123-XY` должен искаться как единое значение, стандартное разбиение на слова может быть недостаточно; если пользователи обычно вводят только `123`, единый токен, напротив, ухудшит доступность.
Фильтры исключают каталоги сборки, двоичные образы и повторяющиеся выгрузки. Для журналов применяют сегментацию по метке времени или идентификатору записи, а поля выделяют уровень, модуль и сообщение. Тогда запрос может ограничить ошибку конкретным компонентом, вместо поиска одинакового кода во всём тексте.
Нечёткий поиск для кодов обычно отключают, потому что одна изменённая цифра означает другой объект. Подстановки и регулярные выражения используют только там, где неизвестная часть действительно допустима. Browse Words показывает, не раскрылся ли шаблон до чрезмерного числа вариантов.
Практический сценарий: письма и вложения
При добавлении Outlook выбирают нужные папки профиля, а не всю почту без разбора. Архивные PST можно индексировать отдельно от текущего ящика. Поля From, To и Subject позволяют отделить роль адреса от случайного упоминания в теле, а вложения появляются как доступные для поиска документы.
Цитируемые цепочки создают дублирование терминов: одно сообщение может содержать весь предыдущий диалог. Чтобы найти исходное письмо, полезно ограничивать дату, отправителя и тему. Для проверки приложенного документа нужно открыть его из контекста контейнера и убедиться, что совпадение относится к вложению, а не к тексту письма.
Если Outlook или PST заблокирован, индексатор может не получить данные. Закрытие Outlook, проверка прав и целостности хранилища часто решают проблему. Для автоматического задания профиль должен быть доступен той учётной записи, под которой запускается индексирование; служба без интерактивного профиля может видеть другой набор папок.
Типовые ошибки и способы устранения
Документ есть в папке, но не находится
Сначала проверяют, включён ли правильный индекс и есть ли контрольное слово в Indexed word list. Затем смотрят ресурс в Update Index, маски включения и исключения, дату последнего обновления и журнал. Если PDF состоит из изображений, требуется OCR. Если файл зашифрован или повреждён, фильтр мог пропустить его и записать предупреждение.
Для изменившегося документа запускают обновление с Index new or modified documents. Если менялись алфавит, стоп-слова, регистр или другие фундаментальные параметры, нужен новый индекс. Простое повторение поиска не исправляет отсутствие токена в словаре.
Результат есть, но оригинал не открывается
Сообщение Document not found означает, что индекс сохранил путь, но файл больше недоступен по нему. Проверяют подключение сетевого ресурса, букву диска, UNC-путь, права и перемещение папки. После исправления пути можно восстановить структуру или перестроить ссылки; удаление записи с последующим обновлением необходимо, если файл действительно исчез.
Если доступна кэшированная копия, просмотр может работать даже при недоступном оригинале. Это не доказывает, что исходный файл существует. При экспорте выборки нужно различать кэш и оригинал, особенно когда важны подпись, временная метка и контрольная сумма.
Подсветка не совпадает с текстом
Наиболее частая причина — документ был отредактирован после индексирования. Обновление синхронизирует позиции слов. Для PDF также проверяют наличие WebView2 Runtime и открытие файла во внутреннем просмотрщике. Если текстовый слой PDF повреждён или порядок извлечения отличается от визуального, совпадения могут следовать внутренней структуре, а не привычному чтению страницы.
Индекс занимает слишком много места
Проверяют включённое кэширование оригиналов, число вложений, стоп-слова и накопление устаревших записей. Compress удаляет старые данные после обновлений. Если кэш документов не нужен, новый индекс без него может быть значительно меньше; отключение опции не всегда мгновенно освобождает всё место в уже построенной базе.
Verify сообщает ошибку
Поиск и обновление прекращают, чтобы не усугублять повреждение. Сначала сохраняют журнал и проверяют диск, свободное место и резервные копии. Надёжный путь — восстановить целый каталог индекса из согласованной копии либо перестроить его по исходникам. Копировать отдельные служебные файлы из разных состояний нельзя.
Spider индексирует слишком много страниц
Останавливают задачу и анализируют URL в журнале. Затем ограничивают сервер, каталог, глубину, число страниц и параметры адресов, исключают календарные и поисковые страницы. Пауза между загрузками снижает нагрузку на сайт, но не решает логические циклы ссылок; для них нужны фильтры.
Настройка отображения и читаемости
Document Fonts and Colors управляет шрифтом извлечённого текста, фоном и цветами hits. Разные поисковые термины можно выделять разными цветами, что ускоряет просмотр сложного запроса. Контраст должен оставаться достаточным: слишком светлый фон и близкие оттенки делают совпадения незаметными.
Настройка влияет на представление, а не на индекс. Изменение шрифта не исправляет неверную кодировку исходного файла; при кракозябрах нужно проверить распознавание формата и кодировки. Для многоязычных документов выбирают шрифт с нужными глифами.
Accessibility Options и клавиатурные команды помогают выполнять поиск без постоянной мыши. Ctrl+S открывает Search, Ctrl+U — Update Index. В длинной сессии полезно настроить размеры панелей и оставить видимыми колонки, по которым реально принимается решение, вместо перегруженной таблицы.

Папки настроек и перенос конфигурации
Диалог dtSearch Folders показывает каталоги программы, персональных настроек, индексов и временных данных. Он полезен при диагностике, переносе профиля и резервном копировании. Настройки хранятся в отдельных файлах, включая определения сегментации, текстовых полей, макросов и внешних просмотрщиков.
Копировать конфигурацию следует целиком и при закрытой программе. Абсолютные пути внутри правил могут быть недействительны на другом компьютере, поэтому после переноса проверяют индексные библиотеки, внешние программы и временную папку. Опции Package позволяют собрать выбранные настройки, но пакет не отменяет проверку зависимостей и прав.
Персональный каталог не следует размещать в области, где несколько пользователей одновременно записывают одни и те же файлы конфигурации. Для общих правил лучше использовать предусмотренные механизмы совместного доступа, оставляя пользовательские истории и интерфейсные параметры раздельными.

Безопасность и работа с конфиденциальными данными
Индекс может содержать словарь, позиции, метаданные, кэшированный текст и копии документов. Поэтому его утечка способна раскрыть содержание коллекции даже без доступа к исходным папкам. Права на индекс, резервные копии и временные каталоги должны соответствовать классификации данных.
Функции поиска номеров карт, адресов и иных шаблонов помогают обнаруживать чувствительную информацию, но создают новые артефакты: история запросов и отчёты сами становятся чувствительными. Их хранят в защищённом каталоге и удаляют по принятой политике, а не оставляют в общей папке загрузок.
Spider и сетевое индексирование выполняются с правами конкретной учётной записи. Нельзя строить общий кэш под административной учётной записью и затем предоставлять его всем, если исходные ACL различаются. dtSearch не заменяет систему управления доступом; архитектура индексов должна следовать границам разрешений.
Зашифрованные и повреждённые документы по умолчанию пропускаются с записью в журнал. Опция извлечения распознаваемых текстовых сегментов из таких файлов может вернуть фрагменты, но также создаёт мусор и не должна использоваться как обход защиты. Полученные данные требуют проверки и законного основания обработки.
Ранжирование, веса терминов и Natural Language
Релевантность в dtSearch строится по составу запроса, частоте и распределению терминов. Число после слова задаёт положительный или отрицательный вес и меняет порядок результатов, не превращая термин в обязательный. Такой приём полезен, когда один признак важнее остальных: название проекта можно поднять в ранге, а распространённое служебное слово ослабить. Слишком большой вес способен вывести наверх документы с одним сильным совпадением, поэтому настройку проверяют на знакомой выборке.
Отрицательный вес отличается от NOT. NOT полностью исключает документ, тогда как отрицательный вес лишь снижает его позицию. Это позволяет не терять материал, где нежелательное слово встречается случайно, например в цитате или приложении. Для обязательного условия по-прежнему используют AND либо плюс в режимах Any words и All words.
Natural Language принимает обычную фразу и ранжирует документы по набору значимых слов. Режим удобен для тематического входа, когда точная конструкция ещё неизвестна, но его результат менее воспроизводим, чем строгое Boolean-условие. После первичной выдачи лучше выписать характерные термины из верхних документов и перейти к явному запросу с фразами, полями и близостью.
Score нельзя сравнивать между разными запросами как абсолютную величину. Оценка 80 в одной выдаче не означает того же качества, что 80 в другой. Практический смысл имеет порядок внутри текущего набора и изменение позиций после корректировки условий.
Search Macros для повторяемых конструкций
Макрос присваивает короткому имени заранее подготовленную часть запроса. Он полезен для длинного перечня синонимов, стандартного условия по полю или устойчивого фильтра терминов. Вместо повторного ввода пользователь обращается к имени макроса, снижая риск пропустить скобку или один из вариантов написания.
Макросы следует проектировать как небольшие проверяемые блоки. Один макрос может описывать группу названий организации, другой — виды документа, третий — исключения. Составной запрос из таких блоков легче тестировать, чем одну непрозрачную строку на несколько экранов. Имя должно объяснять смысл, а не содержать случайный номер.
После изменения определения все запросы с этим именем начинают работать иначе. Поэтому в регламентированной процедуре нужно хранить дату и текст определения вместе с отчётом. Если требуется воспроизвести старую выборку, одной строки с именем макроса недостаточно: нужен именно тот вариант конфигурации, который применялся при запуске.
Макрос не добавляет отсутствующие слова в индекс. Если определение включает термин, исключённый стоп-листом или неправильно разбитый алфавитом, результат останется неполным. Сначала проверяют отдельные элементы через Browse Words, затем собирают конструкцию.
Browse Words и List Index Contents как средства контроля
Browse Words показывает словарь вокруг введённого выражения и раскрывает действие fuzzy, stemming, phonic, synonym и wildcard. Это быстрый способ увидеть фактический охват до поиска документов. Для шаблона артикула можно обнаружить десятки неожиданных вариантов, а для OCR-слова — убедиться, что нечёткость действительно включает искажённую форму.
List Index Contents выводит документы либо слова, находящиеся в индексе. Список документов помогает проверить, попала ли конкретная папка, архив или почтовое вложение. Список слов показывает нормализованные токены и их частоту. Эти данные особенно ценны после настройки алфавита, длины слова и автоматического распознавания дат.
Контроль выполняют на маленьком тестовом индексе. В нём должны присутствовать образцы каждого важного формата, зашифрованный файл, image-only PDF, документ с диакритикой, код с дефисом и вложенный архив. По итогам можно различить ожидаемые пропуски и ошибки конфигурации до обработки основного массива.
Частота слова не равна числу документов. Один большой файл может содержать термин тысячи раз. Для оценки распространённости нужно выполнить поиск и посмотреть число найденных документов, а не только статистику словаря.
Ограничения по имени, дате и размеру файла
More Search Options позволяет одновременно применять текстовый запрос и свойства файла. Маска имени полезна, когда содержимое одинаково в черновиках и финальных копиях, а каталог организован по соглашению об именовании. Включающая маска отбирает нужные расширения или префиксы, исключающая убирает резервные и временные варианты.
Диапазон дат может опираться на время изменения, создания или другие доступные свойства. Эти метки принадлежат файловой системе и не обязательно совпадают с датой внутри договора или письма. Копирование между носителями способно изменить время создания, поэтому для юридически значимого периода надёжнее сочетать файловый фильтр с распознанной датой в тексте или поле.
Размер помогает исключить пустые, подозрительно маленькие либо чрезмерно крупные элементы. Однако большой архив может содержать маленький полезный документ, а короткое письмо — важное подтверждение. Ограничение применяют только при понятной причине и фиксируют вместе с запросом, иначе выборка будет неполной без очевидного сообщения.
Максимальное число результатов ускоряет первичный просмотр, но скрывает хвост выдачи. Если задача требует полного перечня, лимит увеличивают или разбивают поиск по датам и ресурсам. Отчёт должен указывать общее число совпадений и факт ограничения.
Unicode, языки и смешанные коллекции
dtSearch индексирует Unicode и позволяет искать документы с разными системами письма в одной коллекции. Для европейских языков важны правила диакритики и регистр; для китайского, японского и корейского — корректное разбиение текста на слова; для языков справа налево — наличие подходящего шрифта и правильное направление отображения.
Кодировка обычных текстовых файлов может быть неочевидной. Если фильтр определил её неверно, словарь заполнится искажёнными последовательностями. Проверка начинается с внутреннего просмотра и List Index Contents. Для собственного текстового формата лучше задать правило и привести ресурсы к единой кодировке, чем компенсировать ошибку нечётким поиском.
Морфологический режим не является универсальным переводчиком. Stemming расширяет формы в рамках поддерживаемых правил, а тезаурус связывает явно заданные слова. Для двуязычного архива создают пользовательские группы из терминов на обоих языках или вводят OR-конструкцию. Это делает логику запроса видимой и проверяемой.
Смешение визуально похожих символов создаёт отдельную проблему: латинская `A` и кириллическая `А` выглядят одинаково, но являются разными кодовыми точками. Такой дефект встречается в OCR и ручных кодах. Его выявляют словарём и контрольными копиями термина; простая смена регистра не объединяет разные алфавиты.
Командная строка и автоматизация операций
Командные параметры позволяют открывать поиск, запускать индексатор и выполнять подготовленные операции из сценария. Автоматизация полезна для ночного обновления, развёртывания общего профиля и запуска стандартного запроса из другой рабочей процедуры. Перед использованием в расписании команду проверяют интерактивно под той же учётной записью.
Код возврата и журнал важнее появления окна. Задача может завершиться без видимого диалога, но пропустить сетевой ресурс или получить ошибку диска. Сценарий должен сохранять журнал в контролируемом месте, проверять свободное пространство и не запускать второе обновление того же индекса одновременно.
Ключ сжатия после добавления документов удобен для редких пакетных загрузок, но увеличивает длительность каждого запуска. Для часто меняющейся базы лучше отделить короткое обновление от периодического обслуживания. Командная автоматизация не отменяет Verify и резервное копирование.
При развёртывании настроек на нескольких компьютерах нельзя без проверки копировать абсолютные пути, профиль Outlook и команды внешних просмотрщиков. Автоматический пакет должен включать только общие параметры, а пользовательские каталоги и права определяться на целевой системе.
Проверка результатов и воспроизводимость поиска
Для задачи, где результат должен быть объясним, сохраняют текст запроса, список индексов, время их последнего обновления, фильтры, число найденных документов и параметры отчёта. Одного скриншота выдачи недостаточно: он не показывает скрытые ограничения и состояние словаря.
Контрольная выборка включает заведомо релевантные и нерелевантные документы. Если известный положительный пример не найден, запрос слишком строг или индекс неполон. Если отрицательные примеры регулярно выходят наверх, уточняют поля, фразы и расстояние, а не просто повышают порог релевантности без анализа.
Результат меняется после обновления документов, индекса или макросов. Для повторного аудита сохраняют исходную коллекцию либо её контрольные суммы и согласованную копию индекса. Кэш может помочь открыть старое состояние, но только если он был включён и защищён.
При передаче отчёта другому сотруднику полезно добавить краткое описание логики обычным языком: какие понятия обязательны, какие допустимы, что исключено и почему. Это помогает заметить смысловую ошибку, которую синтаксически правильная строка не обнаруживает.
Совместимость Windows и компонент WebView2
Основные операции поиска и индексирования рассчитаны на Windows. Для общего каталога это означает, что рабочие места должны иметь доступ к тем же путям и совместимым приложениям открытия документов. Индексы на сетевом ресурсе не делают интерфейс доступным из другой операционной системы сами по себе.
Внутренний просмотр PDF использует Microsoft Edge WebView2 Runtime. На поддерживаемых системах компонент часто уже присутствует, но корпоративный образ может удалить или заблокировать его. Признаки проблемы — пустая область PDF, ошибка инициализации или отсутствие подсветки при нормальном поиске по тому же документу.
Диагностика включает проверку установленного WebView2 Runtime, его восстановление, права запуска и политики безопасности. После исправления пересоздавать индекс не требуется: извлечённый текст и позиции не зависят от состояния визуального компонента. Если PDF всё равно не отображается, проверяют файл во внешнем просмотрщике и параметры External Viewers.
Старые системы могут выполнять часть функций, но новый PDF-просмотр требует Windows 10 или 11. В организации полезно проверить компонент на эталонном рабочем месте до массового развёртывания, особенно если WebView2 обновляется централизованно.
Сравнение dtSearch с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| dtSearch | Крупных смешанных архивов, сложного синтаксиса, почты, вложений и управляемых индексов | Требует настройки индексов и работает в Windows |
| FileLocator Pro | Сочетания быстрого индексного и точного прямого поиска с отчётами | Индекс не обновляется непрерывно без расписания |
| Copernic Desktop Search | Повседневного поиска файлов и почты через более простой интерфейс | Ориентирован на Windows и зависит от набора коннекторов |
| DocFetcher | Бесплатных переносимых индексов на Windows, Linux и macOS | Меньше корпоративных средств администрирования и отчётности |
| Recoll | Гибкого открытого поиска на Linux, macOS и Windows с командной строкой | Часть форматов и возможностей зависит от платформы и внешних фильтров |
Выбор зависит от характера массива. dtSearch оправдан, когда нужны сложные Boolean- и proximity-запросы, словарь, настраиваемые поля, Spider, работа с письмами и детальное обслуживание нескольких индексов. FileLocator Pro удобен специалисту, который часто чередует индексный и прямой поиск. Copernic проще для ежедневной персональной выдачи. DocFetcher подходит для бесплатной переносимой коллекции, а Recoll — для открытой и кроссплатформенной среды, где допустима более техническая настройка.
PDF Commander не включён в таблицу прямых аналогов, потому что решает другую задачу: он изменяет PDF, тогда как перечисленные средства ищут содержание в коллекциях. Эти инструменты можно использовать последовательно — сначала найти набор документов, затем редактировать выбранные PDF.
Как подготовить надёжный индекс с первого раза
- Собрать контрольную папку с PDF, офисными файлами, письмами, архивами, сканами и нестандартными идентификаторами.
- Определить ожидаемое поведение дефисов, регистра, диакритики, стоп-слов и максимальной длины слова.
- Проверить OCR у сканов и права доступа к сетевым каталогам.
- Создать тестовый индекс, просмотреть журнал и словарь, выполнить набор эталонных запросов.
- Настроить кэш только после оценки объёма и требований безопасности.
- Разделить коллекции с разными расписаниями и правами на отдельные индексы.
- Назначить обновление, периодическую проверку и резервное копирование целого каталога индекса.
- Документировать поисковые конструкции, маски и правила, чтобы процедуру мог повторить другой сотрудник.
Эталонные запросы должны проверять не только наличие результата, но и отсутствие ложных совпадений. В набор включают точную фразу, близость слов, поле, подстановку, код с дефисом, слово с диакритикой, вложение и image-only PDF. После каждой серьёзной смены настроек эти тесты повторяют.
Резервная копия должна быть согласованной: индекс нельзя копировать по частям во время активного обновления. Лучше остановить задачу, закрыть запись, затем сохранить весь каталог и библиотеку индексов. Исходные документы всё равно остаются главным ресурсом; резерв индекса экономит время восстановления, но не заменяет резерв данных.
Итоговый рабочий подход
Наиболее предсказуемый результат даёт простая последовательность: построить индекс по проверенным ресурсам, изучить журнал, убедиться в наличии контрольных слов, сформировать запрос от широкого к точному и подтвердить каждый важный фрагмент в оригинале. Расширенные режимы следует включать осознанно: fuzzy исправляет опечатки, stemming добавляет формы, synonym расширяет лексику, W/N связывает контекст, а поля ограничивают роль термина.
Качество выдачи определяется подготовкой не меньше, чем синтаксисом. OCR-слой, корректные права, своевременное обновление, продуманные маски и согласованный алфавит предотвращают большинство ситуаций, когда документ точно есть, но поиск его не показывает. Журнал индексирования, Indexed word list и Verify дают три независимых точки диагностики: обработан ли файл, присутствует ли термин и цела ли база.
После настройки dtSearch превращает разрозненные PDF, письма, архивы и документы в управляемую поисковую коллекцию. Пользователь получает быстрый переход от запроса к конкретному совпадению, но сохраняет контроль над ресурсами, правилами и подтверждением результата — именно это делает поиск воспроизводимым в юридической, технической и исследовательской работе.