Recoll — локальная программа для полнотекстового поиска по PDF, офисным документам, письмам и сжатым контейнерам: она заранее индексирует выбранные папки, находит фразы внутри файлов, показывает фрагменты совпадений и открывает результат в связанной программе.
Это не редактор PDF и не облачный поисковик. Recoll работает с данными на компьютере, строит локальную базу на движке Xapian и затем отвечает на запросы без отправки документов на внешний сервер. Пользователь выбирает каталоги, режим обновления индекса и набор обработчиков форматов, а графическая оболочка на Qt отвечает за поиск, фильтры, предварительный просмотр и запуск штатных приложений.
Recoll 1.44 доступна для Linux, Windows и macOS; на официальном сайте текущей названа версия 1.44.1 от 22 июля 2026 года. При этом конкретный пакет зависит от платформы: в репозиториях Linux может находиться свежая сборка, официальный AppImage пока имеет номер 1.43.14, а Windows-выпуск распространяется отдельно. Такое расхождение важно учитывать при установке и диагностике функций.
Скачать Recoll
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Нужна индексация
- PDF требует Poppler
- Интерфейс перегружен
Что такое Recoll и для каких задач он создан
Recoll относится к классу настольных систем полнотекстового поиска. Его задача — не изменить документ, а быстро ответить, в каком файле встречается нужное слово, выражение, имя, номер договора или сочетание терминов. Программа извлекает текст и метаданные из выбранных объектов, записывает сведения в индекс, а при запросе обращается уже к компактной поисковой базе. Поэтому повторный поиск по большой коллекции обычно занимает доли секунды или секунды, тогда как последовательное чтение каждого PDF при каждом запросе было бы заметно медленнее.
Особенно полезен Recoll там, где имена файлов не отражают содержание. Папка может состоять из сотен отчетов с названиями вроде scan001.pdf, report-final-2.docx и mail-export.mbox. Обычный поиск по имени почти бесполезен, а Recoll сопоставляет запрос с внутренним текстом, заголовком, автором, темой письма и другими доступными полями. В выдаче виден контекст совпадения, поэтому пользователь может понять релевантность без открытия каждого документа.
Разработчиком и основным автором проекта является Жан-Франсуа Докес. Официальная программа использует библиотеку Xapian, графическую оболочку Qt и набор собственных либо внешних обработчиков. Ее не следует путать с одноименными компаниями, мобильными клиентами и веб-интерфейсами. RecollDroid и браузерная оболочка могут обращаться к уже созданной базе, но не превращают основное приложение в самостоятельный облачный сервис: сначала нужен установленный индексатор и доступ к локальным или серверным файлам.

Почему Recoll считается устанавливаемой программой
Основной Recoll запускается как приложение операционной системы и создает служебные данные на диске. В Linux и macOS конфигурация по умолчанию находится в пользовательском каталоге, а в Windows — в профиле пользователя. Индексатор читает файловую систему, вызывает обработчики типов, формирует базу Xapian и поддерживает ее актуальность. Без этой локальной части браузерный клиент не сможет самостоятельно просканировать коллекцию документов.
На сайте проекта действительно упоминается Web UI, однако это дополнительный интерфейс к существующему индексу. Он полезен для удаленного доступа через браузер или терминальный браузер, но требует развернутого Recoll на машине, где хранятся база и файлы.
Версии, ветки и совместимость индекса
Нумерация имеет вид X.Y.Z: средняя часть соответствует функциональным изменениям, последняя — исправлениям. Эта схема помогает оценивать риск обновления: переход между исправляющими выпусками обычно не меняет базовые сценарии, хотя резервная копия конфигурации и индекса все равно разумна для рабочей станции с важной коллекцией.
Ветка 1.44 сохраняет совместимость форматов индекса с выпусками 1.20–1.44, поэтому обычное обновление не должно требовать полного повторного сканирования. Это существенно для коллекций на сотни гигабайт: построение базы может занять часы. Полная пересборка нужна не из-за номера 1.44 как такового, а при повреждении базы, существенной смене правил токенизации, намеренном переходе к другой схеме параметров или после решения администратора очистить прежние данные.
Нельзя считать номер на любой странице универсальным номером всех пакетов. Например, официальный AppImage на момент проверки указан как 1.43.14, а исходный выпуск — 1.44.1. Репозиторий конкретного дистрибутива может уже содержать 1.44.1 либо отставать. Перед сравнением поведения важно открыть сведения о программе или посмотреть пакетный менеджер, а не ориентироваться только на заголовок сайта.
Как выбрать вариант установки
Linux: пакет дистрибутива, AppImage или Flatpak
Для Linux наиболее естественна установка из штатного репозитория: пакетный менеджер подтягивает Xapian, Qt и доступные обработчики, учитывает архитектуру и затем обновляет Recoll вместе с системой. Недостаток такого пути — версия в стабильной ветке дистрибутива может быть старше текущей. На системах с быстрым обновлением пакетов разрыв обычно меньше, а на консервативных выпусках он способен быть заметным.
AppImage удобен для проверки без системной установки: достаточно выдать файлу право на исполнение и запустить его. Внутри есть графическая часть, индексатор, antiword и unrtf, поэтому распространенные текстовые, HTML, современные офисные, старые DOC и RTF обрабатываются без отдельной сборки. Однако PDF по-прежнему требует утилиту pdftotext из Poppler, а для аудиометаданных, тегов изображений, презентаций и некоторых сжатых форматов понадобятся дополнительные компоненты.
Flatpak дает изоляцию и содержит много обработчиков, но песочница влияет на интеграцию. При открытии результата наружу используется xdg-open, поэтому Recoll не всегда может передать внешней PDF-программе номер страницы. Сам поиск и внутренний просмотр работают, а точный переход в нативный просмотрщик зависит от формата установки и его разрешений. Для сценария, где критичен запуск PDF сразу на совпавшей странице, нативный пакет обычно предсказуемее.
Windows и macOS
Windows-порт поставляется как самодостаточная сборка и распространяется разработчиком отдельно; на официальной странице запрашивается небольшой взнос за загрузку. Сборка тестировалась для Windows 10 и, по сообщениям, работает в Windows 11. В ней нет многопоточного выполнения некоторых операций, доступного в Unix-подобной версии, поэтому индексирование большой коллекции может идти медленнее на том же процессоре.
На macOS Recoll также остается программа. Практическая сложность обычно связана не с поиском, а с зависимостями и политикой запуска сторонних пакетов: пользователю следует выбрать актуальный способ установки, разрешить доступ к индексируемым каталогам и проверить, что внешние обработчики видны в PATH. После этого логика работы совпадает с Linux: конфигурация, индексатор и графическая выдача разделены.
Первый запуск и границы индекса
Самое важное решение при первом запуске — какие каталоги считать стартовыми. Параметр Start directories, соответствующий topdirs, задает корни рекурсивного обхода. По умолчанию это домашний каталог пользователя, но индексировать его целиком не всегда разумно: туда попадают кэши браузеров, каталоги сборки, виртуальные окружения и другие шумные данные. Для рабочей станции лучше явно указать папки с документами, почтой, проектами и справочными материалами.
Чем точнее границы, тем меньше индекс, быстрее обновление и чище выдача. Например, для юридической коллекции можно добавить каталоги Договоры, Переписка и Нормативные документы, но исключить временные экспорты и резервные копии. Для исследовательского компьютера полезно разделить статьи, заметки и наборы данных. Recoll умеет читать несколько корней, поэтому не требуется сводить все файлы в одно место.
Первая индексация всегда дольше последующих. Индексатор открывает каждый объект, определяет тип, извлекает текст, нормализует слова, записывает поля и при необходимости проходит вложенные объекты. После завершения обычный запуск становится инкрементным: новые и измененные файлы добавляются, удаленные записи убираются. Полную пересборку выполняют отдельной командой только при необходимости.
Как устроен процесс индексации
Recoll состоит из трех логических уровней. Первый уровень — обход файловой системы: он решает, какие пути включить, какие исключить и какие объекты изменились. Второй — извлечение содержимого. Для части форматов используется встроенный код или сценарий из комплекта, для других вызывается внешняя утилита. Третий — запись терминов и метаданных в Xapian. Графический поиск затем читает эту базу, а не повторно разбирает документы.
Такая архитектура объясняет две особенности. Во-первых, отсутствие обработчика конкретного формата не ломает весь Recoll: файл может остаться доступным по имени, но текст внутри не попадет в базу. Во-вторых, обновление внешнего конвертера иногда меняет качество извлечения, хотя версия самого Recoll остается прежней. При расследовании пропавшего текста нужно смотреть не только на индексатор, но и на цепочку обработчиков.
Во время разбора больших контейнеров и почтовых вложений создаются временные файлы. Переменная RECOLL_TMPDIR позволяет перенести их на том с достаточным свободным местом. Если она не задана, используются системные временные каталоги. На машине с небольшим системным разделом это важная настройка: нехватка места может остановить обработку крупной почтовой базы или многослойного комплекта документов.
Главное окно и логика интерфейса
В верхней части главного окна находится поле запроса и переключатель режима. Центральная область показывает результаты с заголовком, путем, типом, датой и фрагментами совпадений. Панель инструментов открывает расширенный поиск, историю, проводник терминов и настройки. Интерфейс не стремится быть минималистичным: многие функции доступны непосредственно, поэтому новичку потребуется время, чтобы отличить параметры индекса от параметров поиска.
Выдача по умолчанию ранжируется по релевантности. Recoll учитывает встречаемость терминов и другие признаки Xapian, а совпавшие слова выделяет в фрагменте. Пользователь может ограничить набор каталогов, переключить представление, свернуть дубликаты и открыть текстовый просмотр. При больших коллекциях полезно сначала сформулировать узкий запрос, а затем расширять его, иначе релевантные документы будут смешиваться с тысячами формально подходящих.
Язык подписей обычно выбирается по системной локали, если перевод присутствует. В настройках можно принудительно указать язык интерфейса или запустить программу с параметром -L. Полнота локализации отличается между выпусками: отдельные новые пункты могут оставаться на английском. Это не влияет на индексацию русского текста, поскольку язык интерфейса и языковые параметры поиска — разные настройки.
Простой поиск: режимы и поведение запроса
Режим All Terms требует присутствия всех введенных слов. Он подходит для запроса фамилия номер проект, когда каждый элемент обязателен. Any Term возвращает документы хотя бы с одним словом и повышает оценку тем, где совпало больше терминов. File Name ищет только в именах файлов; отдельный индекс имен позволяет эффективнее использовать маску в начале слова. Query Language выглядит как обычное поле, но понимает операторы, поля, диапазоны и логические конструкции.
Для ежедневной работы разумно оставить Query Language. Без специальных символов он ведет себя близко к поиску всех слов, но при необходимости запрос можно уточнить, не открывая отдельное окно. Точная фраза задается словами в кавычках. Маски поддерживают звездочку, вопросительный знак и классы символов. Начальная звездочка способна развернуть очень много терминов и замедлить запрос, поэтому ее следует применять после ограничения каталога или типа файла.
История хранит последние тексты запросов и помогает повторять работу. Автодополнение использует историю и словарь индекса. Двойной щелчок по слову в результате или окне просмотра может перенести его в строку. Для фрагмента, вставленного из письма или документа, режим All Terms удобнее языка запросов: пунктуация и переносы обрабатываются как обычный текст, а специальные знаки не интерпретируются как операторы.
Язык запросов и точное уточнение выдачи
Язык запросов позволяет сочетать AND, OR и отрицание, задавать фразы, близость слов и поля. На практике полезнее всего ограничения dir, mime, filename, author, title и date. Например, запрос по номеру проекта можно ограничить каталогом договоров и типом PDF; поиск фамилии — временным диапазоном; термин из технического отчета — заголовком или автором. Синтаксис чувствителен к специальным символам, поэтому сложные конструкции стоит проверять через функцию Show Query.
Show Query показывает, как Recoll разобрал ввод: какие слова расширил, какие поля применил и как расставил логические связи. Это особенно важно, если результат неожиданно широкий. В языке Recoll оператор OR имеет особый приоритет, поэтому длинную формулу безопаснее группировать скобками. Когда точный синтаксис помнить неудобно, расширенный диалог строит тот же запрос через поля и устраняет неоднозначность парсера.
Поиск близости отличается от точной фразы. Фраза требует заданного порядка соседних слов, а proximity допускает промежуток и в соответствующем режиме иной порядок. Для документов с переносом строки, дефисом или вставленным определением близость часто дает лучший результат. Увеличивать окно слишком сильно не стоит: сочетание превращается в два почти независимых слова и теряет смысл.
Морфология, регистр и языки
Recoll применяет стемминг во время запроса, а не уничтожает исходные формы при индексации. Поэтому пользователь может расширить слово до родственных форм и при необходимости отключить расширение. В стандартном очищенном индексе регистр обычно не влияет на совпадение, но заглавная первая буква запроса может запретить стемминг для конкретного термина. Глобальные языки стемминга задаются в конфигурации индекса.
Для русскоязычной коллекции следует включить соответствующий языковой модуль и проверить выдачу на нескольких формах существительных и глаголов. Стеммер не является полноценным лингвистическим анализатором: он сопоставляет основы, но не понимает предметный смысл и способен расширить запрос нежелательно. Для номера, аббревиатуры, фамилии или артикулов лучше использовать точную форму либо фразу.
Китайский, японский и корейский текст обрабатывается с особыми правилами токенизации. В интерфейсе слова запроса для восточноазиатских языков иногда следует разделять пробелами, даже если в печатном тексте пробелов нет. Поддержка Unicode позволяет хранить многоязычные коллекции в одном индексе, однако качество результата зависит от кодировки извлеченного текста и выбранных правил токенизации.

Фрагменты совпадений и оценка результата
Фрагмент под результатом — не произвольное начало файла, а участок вокруг найденных терминов. Он помогает отличить документ, где слово встречается в основной части, от объекта, где оно присутствует только в служебном поле или подписи. Для длинного PDF может быть показано несколько фрагментов. Отображаемый текст зависит от того, что извлек обработчик, поэтому разрывы строк и порядок колонок иногда отличаются от визуальной страницы.
Для PDF Recoll способен связать фрагмент с номером страницы и передать его поддерживаемому просмотрщику. Эта функция работает лучше, когда текстовый слой корректен и внешняя команда открытия принимает параметр страницы. В Flatpak такая передача часто недоступна из-за xdg-open, а для OCR, выполненного только внутренним обработчиком Recoll, нативный просмотрщик не знает координату совпадения. Добавленный в сам PDF текстовый слой дает более надежный переход.
Оценка релевантности не равна юридической или научной значимости. Документ с частым повторением слова может оказаться выше официального письма, где термин встречается один раз. Поэтому результат следует уточнять полями, датой и каталогом. Для типовых проверок полезно сохранить запрос, чтобы следующий запуск использовал одинаковые условия, а не менялся из-за случайной формулировки.

Табличный режим результатов
Помимо обычного списка Recoll предлагает табличное представление. Оно удобно, когда нужно сортировать по имени, дате, размеру, типу или пути и сравнить множество однотипных документов. Нижняя область показывает дополнительные сведения о выбранной строке. Такой режим ближе к исследовательской выборке: сначала запрос формирует набор, затем сортировка помогает найти самый новый отчет, самый крупный PDF или группу файлов из одного каталога.
Сортировка по столбцу меняет порядок показа, но не состав набора. Если требуется исключить каталог или тип, лучше изменить запрос, а не пытаться визуально отфильтровать сотни строк. Набор доступных полей зависит от представления и метаданных: у письма есть тема и отправитель, у офисного файла — автор и заголовок, а у простого текста может быть только имя, путь и дата.
Таблица полезна и для контроля индекса. Если одинаковые объекты появились несколько раз, можно сравнить их пути и понять, индексируется ли резервная копия вместе с основной папкой. Функция сворачивания дубликатов уменьшает шум, но не заменяет правильные исключения: лишняя ветка продолжит занимать место и время обновления, даже если часть повторов скрыта в интерфейсе.

Встроенный предварительный просмотр
Предварительный просмотр показывает извлеченный текст без запуска тяжелой офисной программы. Окно поддерживает вкладки, переход между результатами, поиск внутри текста и печать. Для письма можно видеть заголовки и тело, для PDF — последовательность извлеченных страниц, для изображения — доступные метаданные. Shift с клавишами вверх и вниз переключает документы, а встроенный поиск помогает перейти к термину в длинном содержимом.
Просмотр не является точной визуальной копией. Он не воспроизводит верстку страницы, шрифты, сложные таблицы, колонки и рисунки так, как оригинальное приложение. Его цель — быстро подтвердить контекст. Если важны подпись, печать, график или расположение текста, документ следует открыть в штатном редакторе или просмотрщике. Это особенно важно для договоров и сканов, где смысл зависит от визуальных элементов.
При проблеме с кодировкой окно просмотра помогает отделить ошибку индексации от ошибки выдачи. Если текст уже испорчен здесь, искать правильные слова Recoll не сможет: нужно исправить обработчик или кодировку. Если текст читается, но запрос не находит термин, следует проверить язык, стемминг, символы, состояние базы и наличие записи в активном индексе.

Расширенный поиск как конструктор
Диалог Advanced Search исторически назван расширенным, хотя по мощности не превосходит язык запросов. Его преимущество — видимые поля. Пользователь добавляет условия All terms, Any term, None, Phrase, Proximity или Filename, задает тип документа, расположение, дату изменения и размер. Для сотрудника, который редко пишет сложные формулы, такой конструктор снижает риск ошибки и делает критерии проверяемыми.
Типовой запрос для договоров может содержать точную фразу в первом поле, название контрагента во втором, исключаемое слово черновик, каталог отдела, MIME-тип PDF и диапазон дат. После выполнения Recoll превращает форму в обычное условие. При регулярной работе запрос можно сохранить. Важно помнить, что дата изменения файла не всегда равна дате документа: после копирования или восстановления она может измениться.
Ограничение по размеру полезно для отделения коротких писем от приложений или для поиска объемных руководств, но оно относится к файлу-контейнеру. Вложенный объект может наследовать контекст родителя, а фактический размер отдельного сообщения или вложения трактуется иначе. Поэтому размер — вспомогательный фильтр, а не надежный признак типа содержимого.

Проводник терминов
Term Explorer обращается к словарю индекса и показывает, какие формы реально записаны. Он умеет расширять маски, стеммы, варианты написания и фонетические соответствия. Инструмент полезен, когда пользователь не уверен, как имя было распознано, присутствует ли форма с дефисом или какой вариант встречается в коллекции. Вместо десятка пробных запросов можно посмотреть близкие термины и вставить подходящий.
Фонетический режим и орфографические подсказки используют Aspell. Если пакет не установлен, основная полнотекстовая выдача продолжит работать, но эти вспомогательные возможности будут недоступны. Начальная маска заставляет просматривать большой словарь и может быть медленной. На крупной базе лучше задать несколько первых символов или ограничить задачу поиском имен файлов.
Проводник также помогает диагностировать токенизацию. Если выражение с точкой, знаком процента или внутренним дефисом разбито неожиданно, список терминов покажет фактические единицы. В новых ветках часть пунктуации можно настроить как индексируемые отдельные знаки. Изменение такого правила относится к структуре индекса и может потребовать пересборки, поэтому его планируют до массового сканирования.

Какие типы данных индексирует Recoll
Базовый набор включает обычный текст, HTML, сообщения Maildir и mailbox, OpenDocument, современные форматы Microsoft Office на основе XML, AbiWord, FB2, SVG, Gnumeric, заметки Okular, Joplin и ряд других структурированных документов. ZIP и некоторые tar-подобные контейнеры могут раскрываться, а вложенные объекты индексируются отдельно с сохранением связи с родителем. Поддержка конкретного расширения определяется MIME-типом и доступным обработчиком, а не одной только строкой после точки.
Часть старых и специальных форматов требует внешних программ. Для DOC применяется antiword или LibreOffice как резервный путь, для RTF — unrtf, для PDF и PostScript — инструменты Poppler и Ghostscript, для DjVu — djvutxt, для WordPerfect — wpd2html, для Outlook PST/OST — libpff. Аудиотеги читаются через Mutagen, теги изображений — ExifTool, 7z и RAR — через соответствующие Python-модули и утилиты. Наличие Recoll не означает автоматическую установку всего списка.
Практический подход — установить только то, что нужно коллекции. Если пользователь хранит PDF, DOCX, ODT, TXT и электронную почту, не требуется добавлять обработчики DVI, LyX и WordPerfect. После первой индексации диагностический отчет укажет отсутствующие команды и MIME-типы. Это лучше, чем заранее загружать десятки компонентов и усложнять сопровождение системы.
Поиск внутри PDF
PDF — один из ключевых сценариев Recoll, но сам формат представляет контейнер с разными видами содержимого. Если в документе есть корректный текстовый слой, pdftotext извлекает строки, метаданные, иногда закладки и сведения о страницах. Recoll индексирует результат, показывает фрагменты и может открыть внешнюю программу на нужной странице. Пароль, повреждение структуры или нестандартное кодирование шрифтов способны ухудшить извлечение.
У PDF с несколькими колонками порядок текста может отличаться от визуального чтения: обработчик последовательно собирает блоки, и две колонки иногда перемешиваются. На поиск отдельных терминов это влияет мало, а точная длинная фраза может не совпасть. В таком случае следует искать ключевые слова с близостью, уменьшить длину фразы или проверить извлеченный текст во встроенном окне.
Вложения PDF также могут индексироваться, если обработчик видит их и формат вложенного объекта поддерживается. Пользователь получает отдельный результат, но путь может включать цепочку контейнеров. При открытии Recoll извлекает временную копию вложения. После закрытия не следует редактировать такую копию в расчете на сохранение обратно: для изменения нужно открыть исходный контейнер штатным приложением.
Recoll не редактирует страницы, не объединяет документы, не ставит подписи и не заполняет формы. Для этих операций нужен PDF-редактор. Его место в рабочем процессе другое: сначала Recoll находит нужный файл по содержимому, затем внешняя программа выполняет правку. Это объясняет, почему PDF Commander показан как альтернатива для редактирования, но не включен в таблицу прямых аналогов полнотекстового поиска.
Сканированные PDF и OCR
Скан без текстового слоя для индексатора выглядит как набор изображений. Название файла и некоторые метаданные доступны, но слова на странице не находятся. Recoll умеет запускать OCR через настроенный модуль, в частности Tesseract, а в отдельных системах — ABBYY FineReader. Для PDF распознавание включается параметром pdfocr и выполняется только тогда, когда обычное извлечение не обнаружило текста.
OCR заметно увеличивает время и нагрузку. Язык распознавания должен соответствовать документу; для смешанной коллекции можно указать несколько языков либо разные настройки для подкаталогов. Результат кэшируется, чтобы не распознавать неизмененный файл при каждом обновлении. Качество зависит от разрешения, наклона, контраста, шрифта и состояния оригинала. Ошибка в одной букве фамилии может сделать точный запрос бесполезным, поэтому полезны маски и поиск по нескольким устойчивым словам.
Когда допустимо изменить копию файла, более надежный подход — предварительно обработать PDF программой, которая добавляет текстовый слой внутрь документа. Тогда Recoll индексирует обычный текст, внешний просмотрщик может искать внутри файла и переходить к странице, а результат остается доступен другим системам. Внутренний OCR Recoll хорош для автоматического локального поиска, но не улучшает сам исходный PDF.
Для изображений поддержка OCR настраивается отдельно от извлечения тегов. В ветках 1.43 обработчики на Python могут распознавать JPEG, PNG, TIFF и другие типы; на Windows применяется вариант, который сохраняет использование ExifTool для метаданных. Для большого фотокаталога лучше создать отдельный индекс: OCR каждого кадра медленнее обычного чтения тегов и может существенно удлинить обновление документов.
Почта, вложения и многоуровневые контейнеры
Recoll умеет индексировать Maildir, mailbox и ряд экспортов почты. Сообщение становится отдельным документом с полями темы, отправителя, получателей, даты и тела. Вложение также обрабатывается отдельно, если его тип поддерживается. Поэтому запрос может найти DOCX, вложенный в письмо, которое лежит в почтовом хранилище внутри ZIP-контейнера. В выдаче сохраняется цепочка родителей, необходимая для открытия.
Такой глубокий обход удобен, но создает дубликаты, если одна переписка одновременно хранится в почтовом клиенте, экспортной копии и резервной папке. Лучше выбрать один основной набор для индекса, а копии исключить. Иначе один и тот же текст будет встречаться несколько раз, а размер базы и время обновления возрастут. Сворачивание похожих результатов скрывает часть шума, но не устраняет лишнюю обработку.
Большие mailbox-файлы требуют особого внимания. Небольшое изменение может заставить обработчик снова разобрать объемный контейнер, а на временном разделе появятся крупные промежуточные данные. В версии 1.44 обработка mbox оптимизирована с использованием памяти, но объем ОЗУ и свободное место остаются важными. Для многогигабайтной почты стоит проводить первый запуск вне рабочего времени и наблюдать за журналом.
Настройка стартовых каталогов и исключений
Глобальные параметры задают стартовые каталоги, пропускаемые пути, языки стемминга, режимы обхода и общие лимиты. Локальные параметры переопределяют часть правил для конкретной ветки. Это позволяет, например, включить OCR только в папке Сканированные, запретить обработку больших контейнеров в каталоге резервных копий или задать иной набор суффиксов для проекта с исходным кодом.
Исключения должны быть достаточно точными. Слишком широкая маска способна убрать полезные документы, слишком узкая — пропустить кэши. После изменения полезно выполнить инкрементное обновление, затем проверить контрольные файлы: один объект из включенной папки, один из исключенной и один вложенный. Если исключенный документ остается в выдаче, возможно, база еще не очищена от удаленной записи или тот же файл доступен через другой стартовый путь.
Рекурсивный обход сетевой точки или домашнего каталога может попасть в символическую ссылку, связывающую уже просмотренные ветки. Recoll имеет защитные правила, но администратору лучше не строить сложные циклы. Сетевые каталоги следует индексировать только при стабильном подключении и понятных правах. Внезапно исчезнувший том может быть воспринят как удаление данных, если не включена соответствующая политика съемных носителей.
Периодическое и непрерывное обновление
Периодический режим запускает recollindex по расписанию. На Unix-подобных системах это обычно cron или системный планировщик, в Windows — Task Scheduler; графическая оболочка предлагает упрощенную настройку. Подход подходит для большой, но сравнительно стабильной библиотеки: ночной проход обновляет изменения, днем индексатор не потребляет ресурсы. До следующего запуска новый документ не появится в выдаче.
Непрерывный режим держит индексатор как фоновый процесс и получает уведомления файловой системы, например через inotify. Новый или измененный объект добавляется почти сразу. Цена — постоянный процесс, дескрипторы наблюдения и нагрузка при массовом копировании. На очень большом дереве число наблюдаемых каталогов может упереться в системные ограничения, а бурный поток изменений создаст очередь обработки.
Режимы можно сочетать через несколько индексов. Небольшую папку текущих проектов имеет смысл отслеживать непрерывно, а коллекцию технической документации обновлять ночью. В поиске оба индекса подключаются одновременно. Такая схема дает свежесть там, где она нужна, и предсказуемую нагрузку для редко меняющегося массива.
Несколько индексов, съемные носители и сеть
Каждый экземпляр конфигурации Recoll связан с основным индексом, но графическая программа умеет подключать внешние базы. Пользователь может разделить личные документы, общую документацию и съемный диск, а затем включать нужные наборы флажками. Разделение уменьшает область обновления и позволяет переносить базу вместе с данными, однако требует дисциплины путей и одинаковых правил доступа.
Для съемного носителя доступны два подхода: хранить его записи в основном индексе с защитой от удаления, когда устройство не подключено, либо поместить индекс на сам носитель. Второй вариант удобен для переносимой библиотеки, но база увеличивает объем и должна обновляться на машине с Recoll. При смене точки монтирования применяются преобразования путей, иначе ссылка результата будет вести в старое место.
Сетевое хранилище можно индексировать как доступную файловую систему, но Recoll не заменяет корпоративный сервер поиска. Права индексатора определяют, что попадет в базу. Если общая база создана под привилегированной учетной записью, а затем доступна всем, фрагменты могут раскрыть содержание файлов, которые пользователь не должен читать. Для многопользовательской среды нужны отдельные индексы, контроль доступа к базе и продуманная веб-оболочка.
Конфиденциальность и локальное хранение
Обычная работа Recoll не требует отправки документов в облако. Индекс, конфигурация и кэш OCR находятся локально. Официальная Windows-страница указывает, что сборка не устанавливает внешние соединения, кроме проверки обновления, которую пользователь запускает вручную. Это удобно для закрытых коллекций, но безопасность зависит от операционной системы: любой, кто читает базу и кэш, потенциально может увидеть извлеченный текст.
Индекс следует защищать не слабее оригиналов. Шифрование домашнего каталога или диска, корректные права и блокировка сеанса важны, потому что база агрегирует информацию из множества мест. Даже если исходный PDF удален, фрагмент может сохраняться до следующего обновления. После удаления чувствительных файлов следует запустить индексацию, которая очистит устаревшие записи, а при особых требованиях — пересоздать базу и проверить временные каталоги.
Внешние обработчики получают доступ к индексируемому объекту. Следует устанавливать их из доверенных репозиториев и обновлять, особенно когда они разбирают сложные форматы. Recoll не является антивирусом и не делает неизвестный документ безопасным. Индексирование коллекции из непроверенных вложений разумно выполнять под непривилегированной учетной записью, с актуальными библиотеками и ограниченными правами записи.
Практический сценарий: библиотека PDF и научных статей
Исследователь может создать отдельную конфигурацию для папок Статьи, Книги и Заметки, включить PDF, EPUB, FB2, ODT и DOCX, а каталоги менеджера библиографии с кэшем исключить. После первого прохода запрос по точной фразе находит статьи независимо от имени файла. Поля author и title помогают отделить публикации одного автора, а date и dir — ограничить период и проект.
Для систематического обзора удобно сохранять запросы по теме. Один запрос отражает основные термины, второй включает синонимы через OR, третий исключает нерелевантное значение. Список результатов затем сортируется по дате или просматривается по релевантности. Recoll не удаляет дубликаты библиографически и не строит цитатные связи, поэтому окончательный учет публикаций лучше вести в профильном менеджере, а полнотекстовый поиск использовать как слой обнаружения.
Если PDF состоит из сканов, перед массовой индексацией стоит добавить текстовый слой. Это улучшит не только Recoll, но и поиск в любом просмотрщике. Для редких документов можно включить внутренний OCR только в отдельной папке. Контрольная проверка должна включать фразу с кириллицей, латиницей, формулу или номер, а также документ с двумя колонками, чтобы понять реальное качество извлечения.
Практический сценарий: договоры, счета и деловая переписка
В деловом массиве сильны структурные ограничения. Номер договора ищут как точный термин, название компании — как фразу, каталог — через dir, период — по дате файла. Для счета полезны номер, ИНН, сумма и название услуги, но форматирование чисел может различаться. Запрос лучше строить из двух устойчивых полей, а не одной суммы, которая встречается в других документах.
Recoll ускоряет поиск, но не подтверждает актуальность редакции. Файл с пометкой финал может быть старше подписанной версии. В табличном режиме следует сравнить путь и дату, а затем открыть оригинал и проверить подпись, номер страницы и визуальные реквизиты. Встроенный текстовый просмотр предназначен для отбора, а не для юридической экспертизы.
Почтовый индекс позволяет найти письмо и вложение по одной теме. Если сотрудник помнит только фразу из ответа и фамилию отправителя, сочетание body и from с датой обычно дает точный набор. При передаче станции другому сотруднику нужно учитывать, что индекс содержит фрагменты всей переписки; простого удаления учетной записи почтового клиента недостаточно без очистки базы Recoll.
Практический сценарий: техническая документация и код
Инженерная коллекция часто смешивает PDF-руководства, Markdown, исходный код, журналы, XML и сгенерированные файлы. Recoll может индексировать текстовые типы, но каталоги сборки, зависимости и двоичные результаты создают шум. Стартовые папки стоит ограничить документацией и исходниками, а node_modules, build, dist, .git и временные логи исключить или вынести в отдельную конфигурацию.
Для идентификатора функции режим File Name бесполезен, если имя встречается только в коде; нужен обычный полнотекстовый поиск. Для пути или расширения эффективны filename и mime. Точную строку с пунктуацией индексатор может разделить на токены, поэтому диагностировать запрос следует через Term Explorer. Специализированный grep быстрее для мгновенного поиска в небольшом дереве кода, а Recoll выигрывает на смешанной коллекции с PDF и офисными документами.
Справочные комплекты на съемном SSD можно хранить с отдельным индексом. Тогда поиск по нескольким версиям документации выполняется одновременно, а рабочая база не очищается при отключении диска. Путь открытия нужно сопоставить с текущей точкой монтирования. Перед переносом на другую систему полезно проверить совместимость Xapian и версии Recoll, а не копировать базу вслепую.
Практический сценарий: персональная база знаний
Личная коллекция часто состоит из заметок Markdown, сохраненных страниц HTML, электронных книг, чеков, инструкций и старой переписки. Recoll объединяет их в одно поле поиска, но структура папок все равно важна. Разделение на Финансы, Дом, Обучение и Проекты дает возможность ограничивать запрос dir и снижать число совпадений. Кэши приложения заметок и синхронизационные копии лучше исключить.
Для повторяющихся тем полезны сохраненные запросы: гарантия и модель устройства, имя врача и дата, название курса и термин. Программа не заменяет систему тегов, но компенсирует случаи, когда тег не был поставлен. Содержимое остается на компьютере, поэтому пользователь сам отвечает за резервное копирование конфигурации и защиту индекса.
Если коллекция синхронизируется между устройствами, индекс обычно строят отдельно на каждом компьютере. Синхронизация базы Xapian как обычной папки может привести к конфликтам файлов и повреждению. Документы можно передавать штатным клиентом, а Recoll пусть обновляет локальную базу после прихода изменений.
История запросов и повторяемые проверки
История в Recoll хранит введенные строки, а не полный контекст режима. Если пользователь повторяет запрос в другом режиме, результат может отличаться. Для важной процедуры лучше сохранять запрос как объект с параметрами и записывать назначение в рабочей инструкции. При загрузке Recoll предупреждает, если текущие предпочтения, например автопостроение фраз или активные внешние индексы, отличаются от тех, что использовались ранее.
История полезна для коротких повторов: номер дела, название проекта, редкая фамилия. Автодополнение предлагает варианты из прошлых запросов и словаря. На общем компьютере это также конфиденциальные данные, поскольку строка может раскрыть, что искал предыдущий пользователь. Профили операционной системы и отдельные конфигурации Recoll уменьшают риск смешения.

Открытие результата во внешней программе
Двойной щелчок запускает приложение, связанное с MIME-типом, либо команду, настроенную в Recoll. Для обычного файла это прямой путь, для вложения — временно извлеченная копия. В отдельных интеграциях PDF-просмотрщику передается номер страницы. Команда открытия должна корректно обрабатывать пробелы и национальные символы в пути; ручное редактирование шаблона требует понимания кавычек и параметров.
Если открывается не та программа, сначала проверяют системную ассоциацию, затем настройки MIME в Recoll. В Flatpak доступен только xdg-open, поэтому тонкая настройка ограничена. В нативной установке можно назначить отдельный просмотрщик для PDF, текстовый редактор для исходников и почтовый клиент для сообщений. После изменения следует протестировать обычный файл, вложение и путь с пробелами.
Внешнее открытие не заменяет встроенный просмотр. Для быстрой проверки контекста внутреннее окно быстрее и безопаснее с точки зрения случайного редактирования. Нативная программа нужна, когда важны разметка, печать, комментарии, подписи или изменение файла. Такая двухступенчатая схема — найти и проверить, затем открыть — экономит время на больших наборах.

Производительность и размер базы
Скорость первого прохода определяется не только числом файлов. Тысяча небольших DOCX может потребовать больше запусков обработчиков, чем несколько крупных PDF; OCR и почтовые контейнеры резко увеличивают время. Быстрый SSD помогает временным данным и Xapian, а достаточная память уменьшает частые сбросы. Параметр idxflushmb можно повышать для очень больших коллекций, но превышение доступной ОЗУ приведет к свопингу и обратному эффекту.
Размер индекса зависит от объема извлеченного текста, полей, позиций слов и настроек. Он не равен фиксированному проценту от исходной коллекции. Фотографии с одними тегами дадут небольшую базу, а с OCR — значительно большую; сжатый PDF может содержать много текста при малом размере файла. Планировать место следует после пилотного прохода репрезентативной папки и измерения результата.
Большую коллекцию можно разделить на несколько баз и искать параллельно. Это упрощает обслуживание и позволяет обновлять активную часть чаще. Альтернатива — объединение Xapian средствами compact, но оно требует административной процедуры. Для обычного пользователя разделение по назначению проще: текущие проекты, справочная библиотека, почта и съемные носители.
Непрерывный индексатор чувствителен к массовым операциям. Распаковка десятков тысяч файлов, синхронизация облачной папки или переключение ветки проекта создают поток событий. На время такого процесса можно остановить демон и затем запустить пакетное обновление. Это снижает конкуренцию за диск и исключает повторную обработку промежуточных состояний.
Командная строка и автоматизация
Команда recollindex выполняет построение и обновление базы без графической оболочки. Обычный запуск инкрементный; параметры -z и -Z используются для полной пересборки с разными вариантами очистки, а -k повторяет обработку ранее неудачных объектов. На сервере команду помещают в системный планировщик и перенаправляют журнал. Перед автоматизацией нужно убедиться, что под этой учетной записью доступны все каталоги и обработчики.
Графическую программу можно запустить с другой конфигурацией через -c, с принудительным языком через -L и с готовым запросом через -q. Это позволяет создать ярлыки для отдельных коллекций. Командный клиент recollq подходит для сценариев и терминала: он принимает язык запросов и выводит результаты без Qt. Формат вывода следует фиксировать, если его разбирает сторонний скрипт.
Python-модуль дает программный доступ к базе: подключение, запрос, чтение полей, перечисление дочерних объектов и расширение терминов. В версии 1.44 API дополнен функциями индексирования. Это основа для внутренних панелей, интеграции с файловым менеджером и специализированных рабочих процессов. Но приложение, использующее API, должно учитывать путь к конфигурации, совместимость модуля и права на файлы.
Web UI и мобильный клиент являются надстройками. Они удобны для удаленного поиска, но требуют защищенного сетевого развертывания. Нельзя просто открыть порт в интернет: фрагменты и загрузка документов должны быть закрыты аутентификацией, шифрованием и правилами доступа. Для локальной персональной станции графический Recoll проще и безопаснее.
Особенности Windows-версии
Windows-сборка включает необходимые основные компоненты и не требует отдельного Xapian. Конфигурация по умолчанию находится в каталоге Local AppData пользователя. Для Tesseract путь часто задают явно, потому что программа распознавания не всегда добавлена в PATH. Пути в recoll.conf записывают без лишних кавычек в параметрах, где ожидается одно значение: руководство предупреждает, что двойные кавычки могут стать частью пути.
На Windows отсутствует многопоточное выполнение, поэтому ожидания по скорости следует формировать по собственной коллекции, а не по тесту Linux. Планировщик заданий запускает периодическое обновление, а графическая настройка помогает создать расписание. Индексирование сетевого диска зависит от того, видит ли его учетная запись планировщика; подключенный в интерактивном сеансе диск может отсутствовать у фоновой задачи.
Современная сборка ориентирована на Windows 10 и 11. Старые системы не следует считать совместимыми только потому, что ранние версии Recoll когда-то работали на них. При переносе с другой машины безопаснее установить актуальный пакет, перенести конфигурацию после резервного копирования и проверить индекс. Если формат базы и библиотеки отличаются, повторное построение надежнее прямой подмены файлов Xapian.

Особенности Linux и Wayland
В Linux Recoll лучше всего интегрируется при нативной установке: пакетный менеджер добавляет зависимости, MIME-ассоциации и обновления. В состав дистрибутива могут входить отдельные пакеты recollgui, recollcmd или python3-recoll. При смене репозитория возможны конфликты имен библиотек; решение заключается в удалении старых пакетов и чистой установке, а не в сохранении несовместимых зависимостей.
На Wayland у Qt-приложения иногда возникают проблемы отображения: пустые области, неверное обновление или другие графические дефекты. Официальная рекомендация — проверить запуск через X11-бэкенд, задав QT_QPA_PLATFORM=xcb. Если это помогает, параметр можно добавить в ярлык или окружение только для Recoll. Перед этим стоит убедиться, что пакет xcb доступен и проблема не вызвана темой или поврежденной конфигурацией Qt.
AppImage не изолирован песочницей и может запускать установленные в системе обработчики. Это полезно: после установки Poppler или ExifTool Recoll увидит их обычным образом. Flatpak, наоборот, поставляет больше компонентов внутри, но ограничивает внешнее открытие и доступ к каталогам разрешениями портала. Выбор зависит от приоритета: нативная интеграция, переносимость одного файла или изоляция.
Особенности macOS
На macOS система конфиденциальности может запретить приложению чтение некоторых папок, даже если путь указан в Recoll. Нужно предоставить доступ к документам, съемным томам или полному диску только в необходимом объеме. Если индексатор запущен из планировщика или терминала, его контекст прав может отличаться от графического приложения. Контрольный файл в каждой папке быстро выявляет проблему доступа.
Внешние команды должны находиться в окружении, которое видит индексатор. PATH при запуске из Finder и из shell может различаться. Поэтому установленный через пакетный менеджер pdftotext способен работать в терминале, но не находиться из графического сеанса. Явный путь в конфигурации или корректный launch environment устраняет расхождение. После изменения обработчик проверяют повторной индексацией одного PDF.
Диагностика: документ не появляется в выдаче
Сначала проверяют, входит ли путь в Start directories и не совпадает ли с исключением. Затем смотрят дату последнего обновления и запускают инкрементную индексацию. Если файл новый, но база не обновлялась, проблема не в запросе. Если запись есть по имени, но нет по содержимому, следует открыть диагностику MIME и убедиться, что обработчик извлек текст.
Полезная последовательность состоит из пяти шагов: найти файл в режиме File Name, открыть встроенный просмотр, проверить сообщение об отсутствующем обработчике, выполнить обновление с журналом и повторить простой запрос по редкому слову. Такая схема отделяет путь, извлечение и язык поиска. Полную пересборку начинают только после этих проверок, потому что она занимает время и может скрыть первопричину.
- File Name не находит объект — вероятны границы, исключение, права или неактуальная база.
- Имя находится, а текстовый просмотр пуст — нет обработчика, файл защищен или это скан.
- Текст виден, но слово не находится — проверьте токенизацию, стемминг, активные индексы и синтаксис.
- Результат открывается неверно — проверьте MIME-ассоциацию, путь и ограничения пакета.
- Старая запись остается после удаления — выполните обычное обновление с очисткой исчезнувших объектов.
Диагностика: отсутствует обработчик формата
Recoll сообщает имя команды и MIME-тип, которые не удалось обработать. Устанавливать следует пакет из репозитория системы, а затем убедиться, что команда доступна пользователю индексатора. Для PDF это обычно pdftotext из Poppler; для старого DOC — antiword; для RTF — unrtf; для аудио — модуль Mutagen; для тегов изображений — ExifTool. Простого копирования исполняемого файла в случайную папку недостаточно, если PATH его не включает.
После установки не нужно обязательно пересобирать всю базу. Команда recollindex -k повторяет объекты, которые ранее завершились ошибкой, а обычное обновление обработает измененные файлы. Если пустая запись уже считалась успешной, полезно изменить дату тестового файла либо выполнить целевую переиндексацию. Журнал должен показать запуск нового обработчика и отсутствие прежнего сообщения.
Диагностика: устаревшие или поврежденные результаты
Инкрементный режим удаляет записи исчезнувших документов, но этому может помешать аварийное завершение, отключенный том или ошибка прав. Сначала запускают обычное обновление при подключенных всех носителях. Если несоответствие сохраняется, проверяют журналы и состояние Xapian. Полная пересборка с -z очищает базу и создает ее заново, но перед этим следует сохранить recoll.conf, mimeconf и другие настройки.
Повреждение может проявляться ошибками открытия базы, падением запроса или невозможностью добавить записи. Причиной бывает заполненный диск, внезапное выключение или несовместимая библиотека. Нужно освободить место, остановить все процессы Recoll, сделать копию конфигурации, проверить пакет Xapian и только затем перестраивать. Удалять каталоги наугад опасно: рядом с базой находятся пользовательские правила.
Диагностика OCR
Если скан не распознается, проверяют четыре уровня: включен ли pdfocr или imgocr для нужной ветки, установлена ли команда, задан ли правильный путь и существует ли языковой пакет. Затем запускают OCR отдельно на тестовом изображении. Если внешняя команда не читает файл, Recoll не исправит ее работу. Если команда успешна, журнал покажет параметры и кэш.
Слишком медленный OCR часто означает, что правило применено ко всей фотоколлекции. Локальные параметры позволяют ограничить его папкой сканов. Для изображений на Windows обработчик, сочетающий Python и ExifTool, дополнительно замедляет чтение тегов; отдельный индекс делает нагрузку управляемой. Кэш OCR следует размещать на диске с достаточным пространством и защищать как извлеченный текст.
Диагностика открытия PDF на нужной странице
Сначала нужно убедиться, что Recoll знает страницу: во фрагменте и встроенном просмотре должна быть соответствующая позиция. Затем проверяют команду внешнего просмотрщика и поддерживаемый параметр. Если установка Flatpak использует только xdg-open, передать номер страницы нельзя. Нативный пакет и совместимый просмотрщик дают больше контроля.
Для скана, распознанного только внутренним OCR, координата может не совпасть с визуальной страницей. Добавление текстового слоя в PDF решает задачу надежнее: обработчик получает структуру страниц, а внешний просмотрщик выполняет собственный поиск. Если документ защищен или поврежден, переход также может не сработать, хотя общий текст был частично извлечен.
Диагностика нагрузки и временных файлов
Высокая загрузка процессора во время первого прохода нормальна для конвертации и OCR. Ненормальна бесконечная обработка одного объекта. В журнале находят последний файл, проверяют его размер и тип, запускают обработчик отдельно и при необходимости исключают проблемный путь. Ограничение размера обрабатываемого файла защищает от случайного многогигабайтного образа или поврежденного контейнера.
Если заполняется системный раздел, задают RECOLL_TMPDIR на просторном томе и перезапускают индексатор. Переносить только Xapian недостаточно: крупные временные распаковки по-прежнему окажутся в /tmp или системном каталоге. После аварии следует удалить осиротевшие временные файлы, но только когда процессы Recoll остановлены и путь точно идентифицирован.
Сильные стороны Recoll
- Полнотекстовый поиск по смешанной локальной коллекции, включая PDF, офисные документы, письма и вложенные объекты.
- Быстрая повторная выдача благодаря Xapian и инкрементному обновлению.
- Язык запросов, фразы, близость, маски, поля, даты, каталоги и типы файлов.
- Встроенный текстовый просмотр, фрагменты совпадений и запуск нативной программы.
- Раздельные конфигурации и подключаемые внешние индексы для больших коллекций.
- Локальная обработка без обязательной передачи документов облачному провайдеру.
- Открытая лицензия и расширяемые обработчики в Linux-экосистеме.
Главное преимущество Recoll — сочетание глубины и автономности. Он способен пройти несколько уровней вложений, индексировать почту и технические форматы, а затем дать единое поле запроса. При этом пользователь контролирует каталоги и может понять, какой обработчик отвечает за конкретный тип. Для персональной базы знаний и рабочего накопителя это гибче простого поиска файлового менеджера.
Ограничения, которые нужно учитывать
- До первого результата требуется построить индекс; новые файлы видны после фонового или планового обновления.
- Некоторые форматы зависят от внешних утилит, а набор компонентов различается между пакетами.
- Сканы без OCR не находятся по словам на странице.
- Интерфейс насыщен техническими настройками и не скрывает сложность конфигурации.
- Windows-порт не использует многопоточное выполнение так же, как Unix-подобная версия.
- Flatpak ограничивает передачу параметров внешним приложениям, включая страницу PDF.
- Recoll ищет и показывает текст, но не редактирует PDF и не управляет библиографией.
Ограничения не делают программу слабой; они определяют правильный сценарий. Recoll выбирают, когда коллекция достаточно велика, чтобы оправдать индекс, и когда нужен поиск глубже имени файла. Для разового просмотра нескольких документов проще штатная функция операционной системы. Для правки PDF нужен редактор, для корпоративного разграничения — серверная система с централизованной политикой.
Сравнение Recoll с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| Recoll | Глубокий локальный поиск по PDF, почте, вложениям и смешанным форматам на Linux, Windows и macOS | Нужны индекс и обработчики отдельных типов |
| DocFetcher | Переносимый кроссплатформенный индекс документов с более простой моделью областей поиска | Требует Java и имеет менее гибкую экосистему обработчиков |
| AnyTXT Searcher | Быстрый полнотекстовый поиск по распространенным документам на Windows | Ориентирован прежде всего на Windows |
| Agent Ransack | Поиск файлов и содержимого на Windows без обязательной большой предварительной базы | Продвинутые функции сосредоточены в коммерческой редакции |
| Copernic Desktop Search | Корпоративный поиск на рабочих станциях и серверах Windows с централизованными сценариями | Коммерческая модель и привязка к Windows |
| ripgrep-all | Командный поиск по многим форматам в скриптах и терминале | Нет полноценного графического каталога и постоянного индекса Recoll |
Recoll лучше выбирать для долговременной локальной коллекции, где встречаются почта, вложения, PDF и редкие форматы, а пользователь готов настроить индекс. DocFetcher проще переносить вместе с набором документов. AnyTXT Searcher подходит владельцу Windows, которому важен знакомый графический поиск по распространенным типам. Agent Ransack удобен для оперативной проверки файловой системы, особенно когда не хочется заранее строить крупную базу. Copernic ориентирован на коммерческие и централизованные Windows-сценарии. ripgrep-all разумен для администратора и разработчика, предпочитающего терминал.
PDF Commander в эту таблицу не включен, потому что решает другой класс задач. Он редактирует конкретные PDF, тогда как Recoll индексирует коллекцию и ищет по содержимому. В реальном процессе программы могут использоваться последовательно: Recoll находит документ, а PDF-редактор вносит изменения.
Чем Recoll отличается от обычного поиска системы
Файловый менеджер чаще всего хорошо ищет по имени и базовым свойствам, а системный индексатор ограничивает набор форматов и глубину вложений. Recoll дает явные стартовые каталоги, собственный словарь, язык запросов, внешние обработчики и несколько баз. Пользователь может увидеть извлеченный текст, диагностировать MIME и настроить правила для подкаталога. Цена этой прозрачности — больше параметров и отдельное обслуживание.
Для маленькой папки разница может быть незаметна. Преимущество проявляется на десятках тысяч объектов, когда запрос повторяется и включает содержание почты либо контейнеров. Recoll не обязан заменять системный поиск: один инструмент быстро запускает приложение по имени, второй отвечает на содержательные вопросы по рабочей библиотеке.
Настройка Recoll для русского языка
Русский текст индексируется в Unicode, но для морфологического расширения следует включить русский стеммер в параметрах индекса. После изменения языков нужно учитывать состояние существующей базы: новые правила поиска могут работать без разрушительного стемминга при записи, однако проверка контрольных слов обязательна. Фамилии, коды и аббревиатуры лучше искать без расширения, а словоформы обычной лексики — со стеммингом.
Интерфейс пытается использовать системную локаль. Если перевод неполон или отдельный термин мешает следовать руководству, можно временно переключиться на английский через настройку или -L en. Это не меняет язык документов. Для OCR русского скана отдельно устанавливается языковой набор Tesseract и задается код rus либо комбинация языков без пробелов.
При старых текстовых файлах проблема чаще связана с кодировкой. UTF-8 читается предсказуемо, а однобайтовый файл без метки может быть распознан неверно. Встроенный просмотр сразу покажет искаженные символы. Следует конвертировать документ в корректную кодировку или настроить обработчик, затем переиндексировать. Изменение только интерфейсной локали не исправит содержимое.
Рекомендуемая стартовая конфигурация
- Установите нативный пакет Recoll и только нужные обработчики: для PDF — Poppler, для DOC — antiword, для RTF — unrtf.
- Создайте отдельную конфигурацию для рабочей коллекции, а не индексируйте весь домашний каталог без разбора.
- Добавьте папки документов и исключите кэши, каталоги сборки, синхронизационные копии и временные выгрузки.
- Включите русский и другие реально используемые языки стемминга.
- Начните с периодического режима; непрерывный включайте только для активной небольшой ветки.
- Проведите первый проход и просмотрите отчет об отсутствующих обработчиках.
- Проверьте контрольные PDF, DOCX, письмо, вложение и скан.
- Сохраните несколько рабочих запросов и сделайте резервную копию каталога конфигурации.
Эта схема дает предсказуемый результат без ранней оптимизации. После недели использования станет видно, какие типы доминируют, сколько занимает база и насколько быстро меняются файлы. Тогда можно выделить отдельный индекс для почты, добавить OCR, повысить лимиты памяти или подключить непрерывный режим. Настройка на реальных данных надежнее универсального максимального профиля.
Частые вопросы о Recoll
Можно ли искать без индексации?
Основная сила Recoll основана на индексе. Разовый поиск без подготовленной базы не является его главным режимом. Для небольшой папки и единичной задачи удобнее grep, ripgrep-all или системный поиск. Recoll оправдан, когда запросы повторяются и коллекция достаточно велика, чтобы время первого прохода окупалось мгновенной выдачей.
Нужен ли интернет?
Для поиска по уже установленной коллекции интернет не нужен. Пакеты и внешние обработчики устанавливаются заранее. Дополнительный Web UI может работать в локальной сети, но это не обязательная часть. Проверка обновлений выполняется отдельно и не участвует в обычном запросе.
Почему PDF находится по имени, но не по тексту?
Либо отсутствует pdftotext, либо файл представляет скан, защищен паролем, поврежден или использует нестандартное кодирование. Откройте извлеченный текст. Пустой просмотр означает проблему обработчика или отсутствие текстового слоя. Для скана требуется OCR; для обычного PDF — рабочий Poppler и повторная индексация.
Можно ли индексировать сетевой диск?
Да, если файловая система доступна индексатору и соединение стабильно. Плановая задача должна видеть тот же путь и иметь права. Для общей многопользовательской базы нужно отдельно продумать разграничение, потому что индекс содержит фрагменты. Recoll не накладывает корпоративные ACL поверх результатов автоматически.
Нужно ли перестраивать индекс после обновления?
Переход на 1.44.1 из совместимых веток обычно не требует пересборки: форматы 1.20–1.44 совместимы. Перестройка нужна при повреждении, смене критических правил токенизации или по специальной инструкции выпуска. Перед ней сохраняют конфигурацию и оценивают время первого прохода.
Можно ли искать внутри вложения письма?
Да, если почтовый формат и тип вложения поддерживаются. Вложение становится отдельным дочерним результатом, а Recoll сохраняет связь с сообщением. Открывается временная копия; редактирование ее не меняет исходное письмо. Дубликаты экспорта и живой почты лучше исключить.
Редактирует ли Recoll PDF?
Нет. Он извлекает текст, индексирует, показывает фрагмент и запускает внешний просмотрщик. Объединение, подпись, разметка, изменение страниц и формы выполняются PDF-редактором. Recoll полезен на этапе обнаружения файла.
Почему запрос с маской работает медленно?
Начальная звездочка или очень широкая маска раскрывается по большому словарю индекса. Сначала ограничьте тип, каталог или первые буквы. Для имени файла используйте отдельный режим File Name. Term Explorer покажет объем расширения до запуска сложной формулы.
Как перенести коллекцию на другой компьютер?
Перенесите документы, конфигурацию и при совместимых версиях — базу, сохранив соответствие путей. Для съемного носителя используйте индекс на самом томе или преобразование путей. Если Xapian, архитектура или версия существенно отличаются, надежнее построить базу заново. Контрольный запрос должен открыть реальный файл, а не только показать старую запись.
Итоговая оценка
Recoll — мощный локальный поисковый слой для пользователя, который накопил тысячи PDF, офисных файлов, писем и вложений. Он дает быстрые запросы, точные фильтры, текстовый просмотр, работу с несколькими базами и расширяемую систему обработчиков. На Linux проект особенно органичен благодаря пакетам и открытой лицензии, но рабочие версии существуют и для Windows и macOS.
Программа требует осознанной настройки. Нужно определить границы, установить обработчики нужных форматов, выбрать расписание и проверить OCR. Насыщенный интерфейс и технические параметры могут отпугнуть человека, которому нужен поиск в одной папке. Зато после подготовки Recoll превращает разрозненный накопитель в единый локальный каталог и позволяет находить документ по тому, что в нем написано, а не по тому, как когда-то назвали файл.
Лучший кандидат для Recoll — долгоживущая персональная или рабочая коллекция, где конфиденциальность важнее облачного удобства, а запросы повторяются. Для разовой проверки выбирают инструмент без базы, для централизованного предприятия — серверное решение с политиками доступа, для изменения PDF — редактор. В своей нише Recoll остается одним из наиболее гибких способов полнотекстового поиска на настольных системах.