Cisdem OCRWizard распознаёт печатный и рукописный текст в PDF, фотографиях и сканах, извлекает отдельные фрагменты, обрабатывает серии изображений, переносит табличные данные в XLSX и сохраняет результат в DOCX, TXT или RTF. Для разных задач предусмотрены восемь режимов: от быстрого чтения одного снимка и захвата области экрана до разметки зон на многостраничном документе.
Стартовый экран не заставляет собирать рабочий процесс из разрозненных команд: пользователь сразу выбирает подходящую плитку, добавляет исходник перетаскиванием или кнопкой, указывает язык распознавания, формат вывода и папку сохранения. В простых режимах исходное изображение показывается слева, а распознанный текст — справа, поэтому ошибки можно заметить до сохранения файла.
Практическая последовательность почти всегда одинакова: подобрать режим по типу документа, загрузить PDF или изображение, проверить ориентацию и читаемость, выбрать язык, задать выходной формат, запустить распознавание и открыть папку с результатом. Отличия начинаются на этапе подготовки: для таблиц используется отдельный экспорт в Excel, для фрагмента — рамка выделения, а для сложной страницы — зоны распознавания и исключения.
Скачать Cisdem OCRWizard
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Нет русского интерфейса
- Ввод без TIFF и HEIC
- Демо: до трёх файлов
Как устроен стартовый экран и выбор режима
Главное окно разделено на восемь крупных цветных плиток. Single Image Recognition предназначен для одного изображения, Batch Images Recognition — для очереди картинок, Image Excel Recognition — для таблиц, PDF Recognition — для обычных и отсканированных PDF. Нижний ряд содержит Partial Image Recognition, Screenshot Recognition, Advanced Recognition и Handwriting Recognition. Такое деление важно: режим определяет не только способ добавления файла, но и доступный формат результата, набор элементов управления и способ проверки распознанного содержимого.
Плитки работают как маршрутизатор задач. Если открыть одиночное распознавание, слева появляется вертикальное меню со всеми режимами, а центральная область принимает один файл. При переходе к пакетному режиму центральная часть превращается в таблицу очереди. В Advanced Recognition добавляются вкладки документов, миниатюры страниц, список зон и панель свойств. Пользователь не настраивает абстрактный профиль OCR заранее: сначала выбирается сценарий, затем показываются только относящиеся к нему команды.
Для первого знакомства удобнее начать с Single Image Recognition, потому что этот экран демонстрирует базовые элементы программы: область перетаскивания, список языков, поле формата, путь к папке, кнопку запуска, масштаб и панель результата. После освоения этой схемы пакетный режим воспринимается как её расширение, а частичное и расширенное распознавание — как варианты с дополнительной разметкой.

Подготовка исходников перед распознаванием
OCRWizard принимает PDF, BMP, PNG и JPG. Если скан хранится в TIFF, фотография — в HEIC, а страница — в GIF или WebP, файл требуется предварительно преобразовать в поддерживаемый формат. Для одиночной картинки безопаснее выбирать PNG, когда важны тонкие линии, мелкий шрифт и отсутствие JPEG-артефактов. JPG подходит для фотографий страниц, но повторное сохранение с сильным сжатием создаёт ореолы вокруг букв, которые ухудшают разделение символов.
Перед добавлением проверьте четыре свойства исходника: текст должен быть ориентирован горизонтально, строки не должны уходить в сильную перспективу, буквы должны заметно отличаться от фона, а минимальные элементы не должны сливаться. Рабочий интерфейс делает основную ставку на распознавание и выделение областей, а не на развитую ретушь сканов. Поэтому поворот, исправление перспективы, подавление цветного фона и удаление больших теней лучше выполнить до импорта в графическом редакторе или программе сканера.
Не увеличивайте маленький снимок простым растягиванием ради большого разрешения: интерполяция добавит пиксели, но не вернёт утраченные штрихи. Полезнее переснять страницу при равномерном освещении или повторно отсканировать её. Для печатного текста обычно критичнее резкость и контраст границ, чем красивый цвет бумаги. Для рукописи, напротив, важно сохранить тонкие соединения и нажим, поэтому агрессивное осветление может стереть части букв.
- Разверните страницу так, чтобы базовые линии текста были параллельны краям изображения.
- Обрежьте пустые поля, если они занимают большую часть кадра и уменьшают полезный масштаб.
- Уберите соседние страницы, пальцы, блики и тени, пересекающие строки.
- Не смешивайте в одной пакетной очереди документы на разных языках, если для них нужен разный язык OCR.
- Сохраните исходники отдельно: OCR-результат следует проверять по оригиналу.
Распознавание одного изображения
Single Image Recognition подходит для снимка страницы, скриншота, визитки, объявления или отдельного скана, когда результат нужно сразу получить в TXT, DOCX либо RTF. Файл можно перетащить в пустую область или добавить кнопкой. После загрузки изображение занимает левую часть рабочей области; внизу остаются язык, формат, каталог и кнопка Start. Масштаб регулируется ползунком, а команды Re-select и Clear позволяют заменить исходник либо очистить экран.
Язык выбирается до запуска. Для русскоязычного документа укажите Russian, для украинского — Ukrainian, для смешанного материала подбирайте язык по основной массе текста. Программа не предлагает в этом режиме автоматический анализ всех возможных языков, поэтому неверный выбор приводит к систематическим подменам похожих знаков: латинская P смешивается с кириллической Р, цифра 0 — с O, а мягкий знак — с b. Правильный язык даёт движку словари и набор допустимых символов, но не отменяет ручную проверку фамилий, артикулов и кодов.
После распознавания справа появляется текстовая выдача, а оригинал остаётся слева. Сравнение двух панелей удобнее выполнять при увеличении до 100 процентов: сначала проверьте заголовки и числа, затем окончания слов, дефисы и знаки пунктуации. Preview служит для контроля, а не заменяет полноценный текстовый редактор. Если результат требует большой правки, сохраните DOCX или RTF и продолжайте работу в редакторе, где доступны поиск, замена, стили и проверка орфографии.

TXT выбирайте, когда важен только текст без оформления: такой файл легче индексировать, сравнивать и загружать в базы данных. DOCX удобнее для дальнейшей правки абзацев и заголовков. RTF полезен как промежуточный формат для редакторов, которые не работают с DOCX, но поддерживают базовое форматирование. Перед сохранением убедитесь, что путь в поле Directory доступен для записи; иначе распознавание может завершиться, а файл окажется не там, где его ожидают.
Пакетная обработка изображений
Batch Images Recognition рассчитан на набор однотипных страниц: последовательность сканов договора, фотографии конспекта, карточки товаров или страницы папки с документами. Команды Add Images и Add Folder добавляют отдельные файлы либо содержимое каталога. В очереди отображаются имя, размер, разрешение, состояние и действие. Кнопка запуска в строке обрабатывает конкретный элемент, а общая Start — всю очередь. Это позволяет сначала проверить один типичный файл, а затем запускать оставшийся массив с теми же параметрами.
Пакетный режим использует общий язык, формат и каталог назначения. Поэтому он особенно эффективен для документов с одинаковой структурой и языком. Если половина страниц русская, а половина английская, лучше разделить их на две папки и выполнить два прохода. То же относится к выходным форматам: служебные записки можно выгрузить в DOCX, а короткие квитанции — в TXT. Смешанная очередь экономит один запуск, но усложняет контроль и повышает риск получить неподходящий формат для части файлов.
Столбец Status показывает, был ли файл обработан. После успешного распознавания рядом появляется команда открытия каталога результата. Если один элемент не прошёл, не обязательно очищать всю очередь: удалите только проблемный файл, подготовьте его заново и добавьте повторно. Кнопка Clear очищает весь список, поэтому перед её нажатием убедитесь, что обработанные результаты уже найдены и проверены.
Имена исходников следует нормализовать заранее. Схема вроде 001-contract.png, 002-contract.png сохраняет порядок в файловой системе и упрощает сопоставление с результатами. Не полагайтесь только на время создания снимков: при копировании оно может измениться. Если страницы должны объединиться в один документ, OCRWizard удобнее использовать для извлечения содержимого, а окончательную сборку и нумерацию выполнять в редакторе после распознавания.
Извлечение таблиц в Excel
Image Excel Recognition отделён от обычного распознавания, потому что его цель — получить XLSX, а не сплошной текст. Режим принимает несколько JPG, PNG или BMP, показывает их в очереди и сохраняет результат в выбранный каталог. В нижней панели формат уже ориентирован на XLSX; пользователь выбирает язык и папку. Для бухгалтерской ведомости, прайс-листа, расписания или табличного фрагмента это рациональнее, чем распознавать строки в TXT и вручную расставлять разделители.

Качество таблицы зависит от видимости сетки и стабильности колонок. Если вертикальные линии разорваны печатями, тенью или сгибом, отдельные ячейки могут объединиться. Если исходник снят под углом, ширина колонок меняется от верхней части к нижней, и движку сложнее построить прямоугольную структуру. Перед импортом выровняйте перспективу, удалите широкие поля и проверьте, что заголовок таблицы не перекрывает первую строку данных.
После экспорта откройте XLSX и проведите контроль не только по внешнему виду. Числа могут выглядеть правильно, но сохраниться как текст; десятичный разделитель может не совпасть с настройками электронных таблиц; ведущие нули в кодах могут исчезнуть после автоматического преобразования. Для финансовых данных сверяйте итоги по строкам и столбцам, а для артикулов устанавливайте текстовый формат ячеек до дальнейшей обработки.
Режим Excel не заменяет полноценную модель извлечения реквизитов. Он переносит визуальную таблицу в электронную форму, но не знает бизнес-смысл колонок и не проверяет НДС, валюту, единицы измерения или дубликаты. Поэтому хорошая схема состоит из трёх стадий: распознать, очистить структуру в XLSX и затем выполнить предметную валидацию формулами или вручную.
Распознавание PDF-документов
PDF Recognition принимает как сканированные, так и обычные PDF и выдаёт TXT, DOCX или RTF. После добавления файлов список показывает число страниц, диапазон, статус и действие. Для каждого PDF можно запустить обработку отдельно либо обработать весь список общей кнопкой. Этот режим полезен, когда исходник уже собран в многостраничный контейнер и не требуется предварительно разбирать его на изображения.

Перед запуском определите, действительно ли документ нуждается в OCR. В обычном PDF текст может уже выделяться и копироваться. Повторное распознавание такого файла способно внести ошибки там, где исходный текстовый слой был корректен. Если задача состоит только в извлечении нескольких абзацев из цифрового PDF, сначала попробуйте копирование. OCR нужен для страниц, представляющих собой изображение, либо для смешанного документа, где часть страниц не имеет текстового слоя.
Для длинного PDF сначала обработайте несколько характерных страниц. В списке можно запустить один файл, а в Advanced Recognition — выбрать текущую страницу. Контрольный проход показывает, правильно ли выбран язык и сохраняется ли порядок колонок. Ошибка в настройках на двух страницах исправляется быстро; та же ошибка в сотне страниц превращается в длительную повторную обработку.
Документ с паролем или ограничениями следует открывать только при наличии законного доступа. На странице продукта заявлена работа с зашифрованными PDF, однако поведение зависит от типа защиты: пароль открытия и запрет копирования — разные механизмы. Если файл не добавляется, сначала откройте его в просмотрщике, введите пароль и сохраните разрешённую копию без ограничений. Не пытайтесь обходить защиту, если владелец не дал разрешения.
Выбор DOCX оправдан для договоров и инструкций, где нужно редактировать абзацы. TXT подходит для индексации, полнотекстового поиска и анализа. RTF полезен, если документ должен открываться в разных офисных редакторах с базовым форматированием. Основной результат PDF Recognition — редактируемый текстовый файл, а не PDF с невидимым поисковым слоем; для поискового PDF длительного хранения требуется редактор, который умеет возвращать распознанный слой в PDF.
Частичное распознавание области
Partial Image Recognition нужен, когда на странице интересует один фрагмент: реквизиты в шапке, адрес, серийный номер, цитата, подпись под иллюстрацией или отдельный столбец. После загрузки изображения поверх него появляется рамка с маркерами. Пользователь растягивает рамку до нужной области, выбирает язык и формат, затем запускает OCR. Остальная часть страницы затемняется и не участвует в распознавании.

Точная рамка сокращает количество мусора и помогает движку не смешивать целевой текст с соседними блоками. Оставляйте небольшой запас вокруг букв: если рамка проходит по краю строки, верхние выносные элементы и нижние хвосты могут обрезаться. Одновременно не захватывайте лишнюю колонку, водяной знак или номер страницы. Для нескольких разрозненных областей одного документа удобнее Advanced Recognition, потому что частичный режим рассчитан на один прямоугольный фрагмент.
После запуска справа появляется текст только из выбранного участка. Сравните первую и последнюю строки: именно по краям рамки чаще всего теряются символы. Если часть текста отсутствует, расширьте выделение и повторите. Если добавились соседние слова, сузьте область. Повторный подбор рамки обычно быстрее, чем удаление большого количества лишнего текста после сохранения.

Этот режим особенно удобен для регулярного ручного ввода небольших реквизитов. Например, оператор может открывать фотографию накладной, выделять номер документа и сохранять его в TXT. Но автоматической привязки поля к базе данных здесь нет: названия полей, проверка формата и перенос в учётную систему остаются отдельными этапами.
Распознавание текста со снимка экрана
Screenshot Recognition позволяет взять область экрана сочетанием Alt+F. После нажатия окно OCRWizard скрывается, пользователь обводит нужный участок, а полученный кадр возвращается в программу. Дальше действуют привычные параметры: язык, выходной формат, каталог и Start. Такой сценарий подходит для текста в приложении, где копирование отключено, для подписи на видеокадре, уведомления или небольшого фрагмента веб-интерфейса, если пользователь имеет право работать с этим содержимым.
Перед захватом увеличьте исходное окно так, чтобы буквы были крупными и чёткими. Масштабирование интерфейса до снимка эффективнее, чем увеличение уже захваченной картинки. Не включайте в рамку панели браузера, боковое меню и посторонние уведомления: лишние элементы создают дополнительные строки и нарушают порядок чтения. Для длинной страницы лучше сделать несколько последовательных кадров с небольшим перекрытием и затем проверить, не повторились ли абзацы.
На macOS при первом использовании потребуется разрешение Screen Recording в системных настройках конфиденциальности. Если Alt+F ничего не захватывает, проверьте, есть ли Cisdem OCRWizard в списке приложений с доступом к записи экрана, включите переключатель и перезапустите программу. На Windows конфликт может возникнуть, если другое приложение уже перехватывает Alt+F; временно измените его горячую клавишу или запускайте захват после закрытия конфликтующей утилиты.

Результат показывается рядом с захваченным изображением. На скриншотах интерфейсов особенно внимательно проверяйте элементы, похожие на текст: значки, сокращения, кнопки и числа могут распознаться как часть предложения. Если нужен только один номер или короткая строка, Partial Image Recognition с заранее сохранённым снимком иногда даёт более контролируемую рамку.
Расширенное распознавание и разметка зон
Advanced Recognition предназначен для сложных страниц, где автоматический порядок чтения недостаточно надёжен. После добавления изображения или PDF каждый файл открывается во вкладке. Справа показываются миниатюры страниц и свойства, сверху — Add File, Recognize и Save. Пользователь может размечать области, которые нужно распознать, исключать ненужные фрагменты и очищать сделанную разметку.

Команда Recognize areas создаёт зоны включения. Ею обводят колонки, подписи, шапку таблицы или отдельные блоки в требуемом порядке. Ignore areas отмечает участки, которые не должны попадать в результат: логотипы, фоновые надписи, фотографии, номера бланков, колонтитулы. Cancel areas удаляет разметку, когда область создана неверно. Цветные рамки и панель свойств помогают отличать включённые и исключённые зоны.

Для двухколоночной страницы создавайте отдельную область на левую колонку и отдельную на правую, не захватывая обе одним широким прямоугольником. Если заголовок относится ко всей странице, выделите его отдельной зоной перед колонками. Для формы с полями распознавайте только значения, если подписи полей уже известны и не нужны в результате. Чем точнее области соответствуют логической структуре, тем меньше перестановок строк придётся исправлять.
Меню Recognize позволяет выбрать текущую страницу или все страницы. Текущая страница удобна для проверки разметки и языка. Обработка всех страниц оправдана, когда макет стабилен. Если страницы различаются, универсальные области могут захватить не те блоки; тогда лучше обрабатывать группы одинакового шаблона или размечать страницы отдельно.

Расширенный режим сохраняет извлечённый текст через команду Save. В руководстве показано сохранение в TXT. Это подчёркивает назначение режима: точное управление тем, какие участки войдут в текст, а не восстановление сложного офисного оформления. Если требуется документ с исходным дизайном, используйте зоны для получения чистого текста, а макет собирайте в редакторе отдельно.

Распознавание рукописного текста
Handwriting Recognition принимает изображение рукописи и сохраняет распознанное содержимое в TXT, DOCX или RTF. Рабочая схема совпадает с одиночным режимом: загрузка JPG, PNG или BMP, язык, формат, папка и Start. После обработки оригинал остаётся слева, текст появляется справа. Режим полезен для аккуратных заметок, подписанных форм и коротких рукописных фрагментов, но не следует ожидать одинаковой точности для любого почерка.

Лучше всего распознаются крупные раздельные буквы, ровные строки и контрастные чернила. Слитный почерк, сильный наклон, декоративные элементы, перечёркивания и наложение строк увеличивают число ошибок. Если текст написан на линованной бумаге, линии могут пересекать нижние части букв. При подготовке изображения ослабляйте фон осторожно: удаление линий не должно разрывать штрихи.
Язык рукописи должен соответствовать алфавиту. При наличии цифр, латиницы и кириллицы в одной строке проверяйте каждый символ. Имена, адреса, медицинские обозначения и формулы не всегда поддерживаются словарной моделью, поэтому их необходимо сверять с изображением. Для критичных данных рукописное OCR следует рассматривать как ускорение ввода, а не как окончательную верификацию.

Сохраняйте рукописный результат в DOCX, если планируется редактирование и комментарии. TXT удобен для импорта в заметки и поиска. RTF остаётся компромиссом для совместимости. После сохранения полезно включить проверку орфографии в текстовом редакторе, но не принимать все исправления автоматически: редактор может заменить редкую фамилию на распространённое слово и скрыть исходную OCR-ошибку.
Языки распознавания и работа с русским текстом
В технических данных перечислены 25 языков: английский, французский, немецкий, итальянский, русский, испанский, польский, румынский, турецкий, упрощённый и традиционный китайский, португальский, японский, чешский, украинский, греческий, арабский, корейский, каталанский, датский, финский, нидерландский, норвежский, словенский и шведский. Выбор относится к языку документа, а не к языку интерфейса.
Для русского текста особенно проверяйте пары 3/З, 6/б, 0/О, Latin C/С, P/Р, H/Н и X/Х. В номерах документов словарь не помогает, потому что последовательность может не образовывать слово. В таблицах контролируйте разделители тысяч и десятичные запятые. В дореформенной орфографии, церковнославянских текстах и документах со старыми шрифтами вероятность ошибок выше, поскольку заявленный Russian ориентирован на современный набор символов.
Если документ содержит два языка, выберите тот, которым написана большая часть строк, и отдельно проверьте второй. Для двух самостоятельных блоков разумно применить Partial или Advanced Recognition дважды с разными языками. Это дольше одного запуска, но снижает систематические подмены. Для каталога, где каждая карточка на другом языке, лучше распределить файлы по папкам и использовать пакетный режим для каждой группы.
Поддерживаемые форматы и выбор результата
Набор входных форматов предельно конкретен: PDF, BMP, PNG и JPG. Это упрощает диалог добавления, но требует конвертации TIFF, HEIC, WebP и других контейнеров. На выходе основные режимы предлагают TXT, DOCX и RTF, а табличный — XLSX. Рабочие диалоги предлагают именно эти форматы; если нужного расширения нет в списке, его следует подготовить заранее или выбрать другой инструмент для конвертации.
Выбирайте TXT для машинной обработки, полнотекстового индекса, загрузки в систему поиска и простого копирования. В нём нет стилей, картинок и сложной структуры, зато меньше скрытых объектов и проблем совместимости. DOCX подходит для офисной правки, когда важны абзацы и дальнейшее оформление. RTF открывается многими редакторами и сохраняет базовое форматирование. XLSX предназначен именно для табличных изображений и требует проверки типов данных.
Не используйте DOCX как гарантию полного воспроизведения макета. OCRWizard извлекает текст и старается сохранить структуру, но сложные журнальные полосы, плавающие изображения, математические формулы и вложенные таблицы могут потребовать ручной вёрстки. Если приоритетом является копия для длительного хранения с неизменным изображением страницы и поисковым слоем, нужен инструмент, который формирует searchable PDF.
Как повысить точность без лишних повторов
Точность в реальной работе определяется не рекламным процентом, а качеством конкретного исходника и критериями проверки. Для обычного письма одна ошибка в тысяче символов может быть приемлема, а для номера счёта одна неверная цифра делает результат непригодным. До массового запуска сформулируйте, какие поля критичны: суммы, даты, фамилии, номера договоров, артикулы или весь сплошной текст.
Проведите пробный проход на странице среднего качества, а не на самом чистом листе. Если типичный скан распознаётся удовлетворительно, партия, скорее всего, будет однородной. Если проба содержит переставленные колонки, не запускайте сотни страниц в обычном PDF Recognition: перейдите в Advanced Recognition и задайте зоны. Если таблица превращается в строки, используйте Image Excel Recognition.
- Проверьте ориентацию, резкость и контраст исходника.
- Выберите режим, соответствующий структуре документа.
- Укажите язык, а не оставляйте случайное значение по умолчанию.
- Распознайте один типичный файл или одну страницу.
- Сверьте критичные поля по оригиналу.
- Только после проверки запускайте пакет или все страницы.
- Сохраните результат в формате, подходящем для следующего этапа.
При повторном распознавании меняйте одну причину за раз. Сначала исправьте язык, затем область, затем качество изображения. Если одновременно изменить всё, невозможно понять, что помогло. Сохраняйте проблемные примеры в отдельной папке: они станут тестовым набором для будущих документов того же типа.
Практические рабочие процессы
Договоры и многостраничные приложения
Для договора в сканированном PDF начните с PDF Recognition и обработайте одну страницу. Проверьте порядок абзацев, номера пунктов и таблицы приложений. Если основная часть идёт одной колонкой, а приложения содержат сложные формы, разделите работу: текст договора распознайте пакетно, а таблицы — через Image Excel Recognition или Advanced Recognition. Итоговые файлы объединяйте только после сверки нумерации страниц.
Счета, накладные и квитанции
Если требуется вся таблица позиций, используйте экспорт в XLSX. Если нужны только номер, дата и сумма, быстрее выделить отдельные поля в Partial Image Recognition. Для повторяющихся шаблонов сохраняйте одинаковый порядок действий и называйте результаты по номеру исходника. Проверяйте десятичный разделитель, валюту, ведущие нули и знак минус.
Книги, статьи и учебные материалы
Страницы книги удобно обрабатывать пакетно, если они сохранены отдельными изображениями, или через PDF Recognition, если уже собраны в один файл. Колонтитулы и номера страниц можно исключить в Advanced Recognition. Для двухколоночной статьи создайте зоны по порядку чтения. Сноски проверяйте отдельно: мелкий кегль и разделительные линии часто нарушают последовательность.
Скриншоты и интерфейсные сообщения
Для короткой ошибки на экране используйте Alt+F, затем сохраните TXT. Перед захватом увеличьте масштаб приложения и скройте лишние панели. Команды, пути и коды ошибок сверяйте посимвольно, потому что словарь может превратить техническую строку в похожее обычное слово.
Рукописные заметки
Сфотографируйте лист строго сверху, уберите тень телефона и выберите язык. Сначала распознайте одну заметку. Если почерк стабилен, добавляйте остальные по одному: отдельный режим рукописи не представлен как пакетная очередь, поэтому контроль каждого результата остаётся частью процесса. Сохраняйте в DOCX для последующей правки.
Организация папок и контроль результатов
Поле Directory задаёт место сохранения. Создавайте отдельную папку для каждого проекта и не отправляйте результаты в общий Downloads: там легко перепутать одноимённые файлы. Полезная структура содержит подпапки source, ocr и checked. В source лежат неизменённые исходники, в ocr — первичная выдача, в checked — проверенные документы. Такая схема предотвращает случайную замену оригинала распознанной копией.
Добавляйте к имени результата признак этапа: invoice_014_ocr.docx и invoice_014_checked.docx. Не используйте слово final до завершения проверки всех критичных полей. Для пакетной обработки сохраняйте журнал: количество исходников, количество успешных результатов и список ошибок. OCRWizard показывает состояние в очереди, но после закрытия проекта внешняя таблица контроля надёжнее.
Если в одной папке встречаются одинаковые имена, полученные из разных мест, задайте им уникальные названия до обработки. Автоматический суффикс вроде copy не объясняет происхождение. Лучше включать дату документа, номер и тип: 2026-07-18_contract_125_page_003.png. Это повышает прослеживаемость и облегчает повторное распознавание конкретной страницы.
Ограничения демо-режима и активация
В пробном режиме Single Image, Partial Image, Screenshot и Handwriting Recognition суммарно позволяют преобразовать до трёх изображений. Batch Images, Image Excel и PDF Recognition ограничены тремя файлами. В Advanced Recognition можно распознать три файла, но только по одной странице в каждом. Эти лимиты достаточны для проверки интерфейса и качества на собственных примерах, но не для полноценной оцифровки документного фонда.
Для активации используется значок ключа в правой верхней части окна и код лицензии. Вводите код копированием, чтобы не спутать O и 0, I и l. Если активация не проходит, сначала проверьте отсутствие пробелов в начале и конце, соответствие кода платформе и доступ программы к сети. Не устанавливайте сторонние активаторы и изменённые сборки: они не нужны для проверки демо и создают риск повреждения документов.
Планируя покупку, тестируйте именно свои сложные случаи: плохой скан, двухколоночную страницу, таблицу и рукопись. Высокая точность на рекламном примере не гарантирует результат на факсе или фотографии под углом. Пробные ограничения следует расходовать осознанно: один простой файл для освоения, один типичный и один проблемный.
Совместимость и системные требования
В опубликованных требованиях для macOS указаны компьютеры с Intel и Apple Silicon, не менее 512 МБ оперативной памяти и около 1 ГБ свободного места; перечислены системы от macOS 10.13 до macOS 14. Для Windows на странице продукта указаны Windows 11, 10, 8 и 7. Перед установкой на более новую систему проверьте запуск демо и доступ к экранной записи, потому что разрешения и совместимость могут изменяться быстрее документации.
Объём установочного пакета значительно больше минимального места, необходимого для результатов, поскольку OCR-модели занимают сотни мегабайт. Для больших PDF оставляйте запас на временные данные и выходные файлы. Если свободного места мало, распознавание может завершиться ошибкой сохранения даже после успешного анализа страницы.
На компьютере с небольшим объёмом памяти не добавляйте сразу сотни изображений высокого разрешения. Разделите их на партии, закройте тяжёлые приложения и сохраняйте результаты на локальный диск. Сетевой каталог удобен для обмена, но кратковременный обрыв соединения способен сорвать запись; надёжнее сначала сохранить локально, проверить файл и затем скопировать.
Типичные ошибки и способы устранения
Файл не добавляется
Проверьте расширение: поддерживаются PDF, JPG, PNG и BMP. TIFF, HEIC, WebP и изображения внутри ZIP-контейнеров нужно преобразовать или извлечь. Затем откройте файл в обычном просмотрщике. Если он повреждён, имеет нулевой размер или требует пароль, OCRWizard не сможет обработать его как обычный исходник. Для длинного пути с нестандартными символами временно скопируйте файл в короткую локальную папку.
Результат пустой или содержит несколько символов
Убедитесь, что рамка Partial Recognition действительно охватывает текст, а в Advanced Recognition зона не помечена как Ignore. Проверьте контраст и масштаб. Светло-серый текст на белом фоне может быть виден человеку, но плохо отделяться алгоритмом. Сделайте контрастную копию изображения и повторите.
Русские слова превращаются в латиницу
Выберите Russian в списке Language и запустите распознавание заново. Не исправляйте сотни систематических замен вручную, пока не проверена настройка языка. Для смешанного документа обрабатывайте языковые блоки отдельно.
Колонки перемешаны
Перейдите в Advanced Recognition. Создайте отдельные зоны в логическом порядке, исключите колонтитулы и иллюстрации. Сначала распознайте текущую страницу. Если порядок стал правильным, применяйте подход к страницам того же макета.
Таблица сохраняется как сплошной текст
Используйте Image Excel Recognition вместо обычного режима. Если структура всё равно нарушена, выровняйте перспективу, усилите линии сетки и удалите пересекающие печати. После экспорта проверьте объединённые ячейки и типы данных.
Снимок экрана не создаётся
На macOS дайте программе разрешение Screen Recording и перезапустите её. На Windows проверьте конфликт Alt+F с другим приложением. Запускайте сочетание, когда активен режим Screenshot Recognition; в остальных режимах программа может не ожидать захват.
Файл распознан, но результат не найден
Посмотрите путь в поле Directory и используйте значок папки в строке завершённого элемента. Проверьте, не был ли каталог изменён между запусками. Если папка удалена или недоступна, задайте новую локальную директорию и повторите сохранение.
Обработка идёт слишком долго
Уменьшите размер партии, закройте лишние приложения и проверьте свободное место. Для проверки не запускайте весь многостраничный PDF: обработайте текущую страницу в Advanced Recognition. Изображения с огромным разрешением можно уменьшить до разумного размера, сохранив читаемые штрихи, но не используйте чрезмерное JPEG-сжатие.
Программа закрывается на одном документе
Проверьте, воспроизводится ли ошибка на копии файла и на одной странице. Если проблема связана с конкретным PDF, экспортируйте проблемную страницу в PNG и распознайте её отдельно. Не отправляйте конфиденциальный документ в поддержку без удаления персональных данных и разрешения владельца.
Проверка обновлений не работает
В Windows команда Check for Updates находится в меню с тремя линиями, в macOS — в меню Cisdem OCRWizard. Если проверка не соединяется, убедитесь, что соединение не блокируется межсетевым экраном или прокси. Обновляйте только из меню программы или с официального сайта.

Конфиденциальность документов и безопасная работа
Исходники и результаты распознавания требуют одинаковых правил доступа: DOCX, TXT и XLSX могут содержать те же персональные данные, что и сканы. Для договоров, счетов и внутренних документов заранее задайте защищённую папку вывода и не оставляйте рабочие копии в общедоступных каталогах.
Сохраняйте конфиденциальные результаты в защищённой папке, не используйте общий рабочий стол и очищайте временные копии после проверки. Если документ передаётся коллеге, применяйте утверждённый канал и контролируйте, что отправляется проверенная копия. Для особо чувствительных данных отключите автоматическую синхронизацию каталога вывода с личным облаком, если политика организации это запрещает.
Не вставляйте лицензионный код в снимки экрана и инструкции. Перед демонстрацией интерфейса закройте окно активации и удалите код из буфера обмена, чтобы он не попал в общий документ или переписку.
Сравнение Cisdem OCRWizard с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| Cisdem OCRWizard | Быстрого OCR изображений, PDF, областей экрана, таблиц и рукописи по восьми готовым сценариям | Узкий набор входных и выходных форматов, нет полноценного редактора PDF |
| PDF Commander | Русскоязычной работы с PDF: OCR, редактирования, сборки страниц, подписей и защиты в одном окне | Основной рабочий сценарий ориентирован на Windows |
| ABBYY FineReader PDF | Сложных макетов, большого числа языков, проверки зон и профессиональной конвертации | Больше настроек и более тяжёлый рабочий процесс; набор PDF-функций на Mac уже |
| Adobe Acrobat | Создания поискового слоя в PDF, пакетного OCR и последующей правки внутри PDF | OCR встроен в крупный платный PDF-комплекс, часть редактирования требует подписки |
| Readiris PDF | Сканирования, OCR на большом числе языков и преобразования документов на Windows или Mac | Набор инструментов зависит от лицензии |
Cisdem OCRWizard выбирают, когда нужен понятный маршрут от изображения к DOCX, TXT, RTF или XLSX и полезны отдельные режимы снимка экрана, фрагмента и рукописи. PDF Commander рациональнее для пользователя Windows, которому кроме OCR требуется русскоязычное редактирование самого PDF. ABBYY FineReader PDF подходит для сложной профессиональной конвертации и широкой языковой поддержки. Adobe Acrobat удобен, если конечным результатом должен остаться PDF с поисковым слоем и дальнейшим редактированием. Readiris PDF стоит рассматривать для сканерного процесса и большого набора языков, предварительно сверив возможности выбранной лицензии.
Когда какой режим выбирать
| Исходная задача | Режим OCRWizard | Результат |
|---|---|---|
| Одна фотография страницы | Single Image Recognition | TXT, DOCX или RTF |
| Папка однотипных сканов | Batch Images Recognition | Серия TXT, DOCX или RTF |
| Таблица на фотографии | Image Excel Recognition | XLSX |
| Многостраничный скан | PDF Recognition | TXT, DOCX или RTF |
| Один реквизит или абзац | Partial Image Recognition | Текст выбранного прямоугольника |
| Текст в окне приложения | Screenshot Recognition | TXT, DOCX или RTF |
| Колонки и исключаемые области | Advanced Recognition | Текст размеченных зон |
| Рукописная заметка | Handwriting Recognition | TXT, DOCX или RTF |
Если подходят два режима, выбирайте тот, который уменьшает последующую ручную работу. Таблица должна идти в Excel, а не в TXT; один реквизит лучше выделить, чем удалять всю остальную страницу; сложные колонки лучше разметить, чем исправлять перепутанный порядок. Правильный выбор режима обычно влияет на результат сильнее, чем многократный запуск одинаковых настроек.
Контроль качества после распознавания
Проверка должна быть основана на риске. Для художественного текста прочитайте несколько абзацев и найдите систематические ошибки. Для договора проверьте номера пунктов, даты, суммы и фамилии. Для таблицы пересчитайте итоги и сравните количество строк. Для рукописи сверяйте каждое слово, которое меняет смысл. Отметка Completed в очереди означает завершение обработки, а не подтверждение безошибочности.
Используйте поиск по характерным ошибкам: двойные пробелы, одиночные латинские буквы внутри русского слова, необычные символы, пропущенные дефисы, последовательности из нескольких знаков вопроса. В DOCX включите отображение непечатаемых символов. В XLSX найдите числа, сохранённые как текст, и пустые ячейки внутри заполненного диапазона.
Храните выборку проверенных страниц и список типичных замен для каждого шаблона. При следующей партии сначала ищите эти проблемы. Такой словарь контроля полезнее общей оценки точности, потому что отражает конкретный шрифт, качество сканера и структуру документов.
Навигация внутри рабочих модулей
После выбора плитки слева остаётся вертикальный список всех восьми режимов, поэтому для перехода к другой задаче не требуется возвращаться на стартовый экран. Это полезно при контрольной обработке одного комплекта: сначала таблицу можно отправить в Image Excel Recognition, затем страницу с обычным текстом открыть в Single Image Recognition, а сложный разворот — в Advanced Recognition. При переключении следите, очищена ли предыдущая очередь и соответствует ли папка вывода новой задаче.
Нижняя панель простых режимов содержит три параметра, влияющих на результат: Language, Format и Directory. Кнопка Start запускает анализ с текущими значениями. Если после первого прохода меняется только язык, исходник можно не загружать заново. Если меняется режим, проверьте формат: XLSX доступен в табличном модуле, а текстовые варианты — в режимах обычного, частичного, экранного и рукописного распознавания.
Ползунок масштаба изменяет просмотр, а не качество исходного файла. Увеличение до 100 процентов помогает проверить края букв и границу выделения, но само по себе не добавляет информации OCR-движку. Команды Re-select и Clear имеют разный смысл: первая заменяет текущий исходник, вторая очищает рабочую область. В пакетных списках удаление одной строки предпочтительнее полной очистки, если остальные файлы уже обработаны.
В очереди действие с треугольником запускает конкретный элемент, значок корзины удаляет его, а значок папки после завершения открывает результат. Такой набор позволяет использовать очередь как контрольный журнал текущего сеанса. Перед закрытием окна сравните число строк со статусом Completed с числом сохранённых файлов, потому что незапущенный элемент остаётся в списке, но не создаёт результат.
Планирование диапазонов и многостраничных документов
PDF-очередь показывает количество страниц и Page Range. Для короткого документа можно обрабатывать все страницы, но для большого файла безопаснее начать с ограниченного фрагмента. Выбирайте страницы с разными типами макета: титульную, обычную текстовую, страницу с таблицей и страницу с печатью. Такой тест быстрее выявляет, подходит ли единый режим для всего документа.
Если несколько страниц имеют одинаковый дефект, например поворот или тёмный фон, отделите их от чистой части. OCRWizard не предлагает развитую панель массовой коррекции изображений внутри текущего интерфейса, поэтому проблемные страницы лучше экспортировать, исправить и вернуть отдельным файлом. Чистую часть PDF можно распознать обычным проходом, а исправленные страницы — как изображения или отдельный PDF.
При работе с приложениями к договору сохраняйте связь с исходной нумерацией. Если из PDF извлечены страницы 12–18, укажите этот диапазон в имени результата. Иначе после преобразования в DOCX внутренние номера страниц могут не совпасть с физическими страницами файла. Для проверки используйте устойчивые ориентиры: номер раздела, дату, название приложения и первые слова абзаца.
Advanced Recognition позволяет выбрать Current page или All page. Первый вариант применяйте для настройки зон, второй — только после проверки, что расположение блоков повторяется. Если на нечётных страницах текст слева, а на чётных справа, одна схема зон может быть непригодна. В таком случае создайте два отдельных PDF с нечётными и чётными страницами либо обрабатывайте страницы группами.
Разметка сложных страниц: практические схемы
Две колонки с общим заголовком
Сначала выделите заголовок отдельной зоной, затем левую колонку сверху вниз и правую колонку сверху вниз. Не создавайте одну рамку на всю ширину: автоматический анализ может чередовать строки двух колонок. Колонтитул и номер страницы отметьте Ignore, если они не нужны в тексте.
Форма с подписями и значениями
Если требуется сохранить полный контекст, выделяйте строку подписи вместе со значением. Если названия полей уже известны системе учёта, выделяйте только значения, но соблюдайте одинаковый порядок зон на всех формах. При сдвинутом скане границы нужно поправлять: фиксированная рамка, пересекающая соседнее поле, создаст объединённый результат.
Страница с иллюстрацией и подписью
Изображение отметьте Ignore, а подпись — отдельной распознаваемой областью. Если подпись очень мелкая, увеличьте качество исходника до импорта. Включение самой иллюстрации обычно не помогает, поскольку OCR ищет текстовые штрихи и может принять детали рисунка за символы.
Таблица с примечаниями
Если нужна электронная таблица, предпочтительнее Image Excel Recognition. Advanced Recognition выбирайте, когда требуется только несколько ячеек или текстовое примечание вокруг таблицы. Разделите зоны так, чтобы строка примечания не соединялась с последней строкой данных. Для всей таблицы экспорт в TXT потеряет структуру ячеек.
Скан с печатью поверх текста
Зона не устраняет наложение печати, но позволяет исключить её свободные части и оставить только необходимый абзац. Если печать пересекает буквы, попробуйте подготовить контрастную копию в цветовых каналах вне OCRWizard. Итог всё равно проверяйте посимвольно в месте пересечения.
Работа с низкокачественными сканами
Для факсимильной копии характерны шум, полосы и размытые края. Начните с сохранения оригинала, затем создайте рабочую копию. Удалите широкие чёрные поля и выровняйте страницу. Не применяйте сильный фильтр резкости ко всему изображению: он подчёркивает и буквы, и шум. В OCRWizard загрузите подготовленную копию и сравните результат с исходником.
На фотографии телефона основными проблемами становятся перспектива и неравномерное освещение. Левый край страницы может быть крупнее правого, а тень от устройства — перекрывать строки. Исправьте геометрию до импорта. Если переснять нельзя, используйте Partial Recognition для наиболее ровной области или Advanced Recognition для отдельных блоков, не захватывая сильно искажённые края.
Для старой машинописи проверяйте буквы с повреждёнными лентой штрихами. Символы е, с, о и а могут терять части контура. Увеличение контраста помогает только до момента, когда тонкие элементы исчезают. Сделайте две рабочие копии с разной обработкой и распознайте одну типичную строку; выберите вариант с меньшим числом систематических замен.
На копиях с серым фоном полезно отделить текст от бумаги, но полностью белый фон не является самоцелью. Если осветление убирает точки над ё, й или i, качество ухудшается. Контрольный критерий — сохранность всех штрихов при читаемом контрасте, а не визуальная белизна страницы.
Когда качество неоднородно внутри одного PDF, не используйте один проход как единственный результат. Чистые страницы обрабатывайте пакетно, проблемные — отдельно. В журнале проверки отмечайте, какие страницы прошли дополнительную подготовку, чтобы при последующей сверке уделить им больше внимания.
Проверка результатов по типам данных
Обычный текст
Сравнивайте абзацы, переносы и порядок чтения. Ищите строки, внезапно вставленные из соседней колонки. Проверяйте тире, кавычки и списки: OCR может заменить длинное тире дефисом, а маркер списка — случайным символом. Для смыслового использования эти различия иногда несущественны, но для публикации требуют исправления.
Числа и суммы
Сверяйте каждую цифру, десятичный разделитель и знак минус. В XLSX проверьте, воспринимается ли значение как число. Сумма 1 250,00 может попасть в одну ячейку как текст из-за пробела. Не запускайте расчёты до нормализации формата и проверки контрольных итогов.
Даты и номера
Даты 01.07.2026 и 07.01.2026 визуально похожи и не проверяются словарём. Номера договоров могут содержать буквы двух алфавитов. Используйте шаблон проверки: допустимая длина, набор символов и положение разделителей. Любое отклонение возвращайте к оригиналу.
Фамилии и адреса
Проверка орфографии часто считает редкую фамилию ошибкой и предлагает неверную замену. Сначала сверяйте с изображением, затем с утверждённым справочником. В адресах контролируйте номера домов, корпуса, дефисы и сокращения. Не полагайтесь на автоматическую капитализацию.
Табличные реквизиты
Сравните число строк и колонок, заголовки, объединённые ячейки и пустые значения. Если одна строка разделилась на две, последующие данные могут сдвинуться. Проверка только первой и последней строки не обнаружит внутренний сдвиг; используйте несколько контрольных точек и итоги.
Когда использовать область экрана, а когда сохранённое изображение
Screenshot Recognition быстрее, когда нужный текст уже открыт и помещается в один кадр. Он исключает промежуточное сохранение и автоматически возвращает захват в программу. Однако повторяемость ниже: если рамка выбрана неточно, снимок приходится делать заново. Для регулярных задач лучше сохранить исходные кадры в отдельную папку и использовать Batch Images Recognition.
Сохранённое изображение сохраняет набор исходников и позволяет повторить OCR с другим языком. Оно удобнее для аудита: проверяющий видит тот же файл, который обрабатывался. Захват экрана подходит для разовой строки, а пакет изображений — для серии интерфейсных страниц или слайдов.
Не захватывайте конфиденциальные уведомления вместе с целевым текстом. До Alt+F закройте панели, где видны имена, адреса и сообщения. OCRWizard распознает всё внутри рамки, поэтому лишний фрагмент может попасть в сохранённый TXT или DOCX.
Если приложение использует сглаженный мелкий шрифт, увеличьте масштаб окна. На дисплее с высоким DPI буквам соответствует больше пикселей, но уменьшенный скриншот может потерять детали после системного масштабирования. Проверяйте фактический кадр в левой панели до запуска.
Пакетная обработка без потери контроля
Разделяйте большой документный фонд на партии по типу документа, языку и качеству. Партия из одинаковых бланков позволяет использовать один язык и один формат, а результат проще проверять выборочно. Смешивание договоров, чеков и фотографий в одной очереди приводит к разным ошибкам и усложняет поиск причины.
Перед Start проверьте список имён и разрешений. Неожиданно маленькое изображение часто является миниатюрой, а не полноценным сканом. Неожиданно большой файл может содержать фотографию в полном разрешении, которая замедлит партию. Удалите такие элементы и обработайте отдельно.
Запускайте один элемент кнопкой в строке. Если результат соответствует требованиям, запускайте очередь. После завершения сортируйте результаты по имени и сопоставляйте с исходниками. Статус Completed подтверждает работу движка, но файл может содержать OCR-ошибки, поэтому контрольная выборка обязательна.
При прерывании не очищайте список сразу. Зафиксируйте, какие элементы завершены, найдите их в папке и перезапустите только оставшиеся. Повторная обработка всех файлов создаёт дубликаты или заменяет результаты, если имена совпадают. Важные партии сохраняйте в каталог с правами, исключающими случайное удаление.
Если документы поступают ежедневно, создайте постоянные правила именования и папки по датам. OCRWizard не является системой документооборота и не ведёт карточки документов, поэтому порядок должен обеспечиваться файловой структурой или внешней системой.
Использование результатов в других программах
DOCX открывайте в текстовом редакторе и сразу сохраняйте рабочую копию. Проверьте стили абзацев, интервалы и переносы. OCR-результат может содержать ручные разрывы строк в местах, где в исходнике просто закончилась строка. Для связного текста удаляйте их осторожно, не объединяя заголовки и пункты списка.
TXT импортируйте с кодировкой Unicode. Если редактор показывает неправильные символы, проблема может быть не в OCR, а в неверном определении кодировки. Не пересохраняйте файл несколько раз в разных кодировках без копии: можно потерять кириллицу. Для анализа строк сначала нормализуйте пробелы и переносы.
RTF подходит для обмена между редакторами, но его оформление следует проверять после открытия в целевой программе. Разные редакторы интерпретируют отступы и шрифты по-разному. Содержание сверяйте отдельно от внешнего вида.
XLSX после Image Excel Recognition требует структурной очистки. Определите заголовки, задайте форматы колонок, удалите пустые служебные строки и проверьте формулы. Не подключайте файл напрямую к бухгалтерской или аналитической системе до валидации, потому что одна сдвинутая колонка изменит смысл всей строки.
Если конечная цель — PDF, сначала исправьте распознанный DOCX, затем экспортируйте его в PDF. Такой файл будет содержать цифровой текст, но визуальное совпадение со сканом зависит от ручной вёрстки. Для сохранения изображения страницы с невидимым текстовым слоем используйте специализированный PDF-редактор.
Распознавание русскоязычных документов разных типов
В официальных письмах контролируйте сокращения, инициалы и номера исходящих документов. Точки после инициалов и косые черты в номерах часто теряются. Для шапки письма можно использовать Partial Recognition, а основной текст распознать отдельно, чтобы реквизиты не нарушали порядок абзацев.
В чеках и кассовых документах типичны узкие шрифты, термобумага и выцветшие участки. Image Excel Recognition подходит только при явной табличной структуре; для короткого чека чаще удобнее обычный текст. Суммы и налоговые ставки проверяются вручную, поскольку ошибка одной цифры критична.
В анкетах и заявлениях печатные подписи полей соседствуют с рукописными значениями. Один режим может распознать их с разным качеством. Печатную часть обрабатывайте Advanced Recognition, выделяя значения, а рукописные поля при необходимости сохраняйте отдельными изображениями и отправляйте в Handwriting Recognition.
В технической документации встречаются латинские обозначения внутри русского текста. Основной язык Russian помогает обычным словам, но артикулы и команды требуют посимвольной сверки. Для таблицы спецификаций используйте XLSX и задайте текстовый формат колонке артикулов, чтобы электронная таблица не преобразовала значения.
В старых документах дореформенные символы и нестандартная орфография могут не соответствовать современной модели. Сохраняйте изображение рядом с транскрипцией и отмечайте сомнительные места, а не исправляйте их по современному словарю без основания.
Диагностика результата по характеру ошибки
| Симптом | Вероятная причина | Действие в OCRWizard или до импорта |
|---|---|---|
| Много латинских букв в русском тексте | Неверно выбран язык | Установить Russian и повторить |
| Строки двух колонок чередуются | Автоматически определён неверный порядок | Разметить отдельные зоны в Advanced Recognition |
| Потеряна крайняя строка фрагмента | Рамка обрезает буквы | Расширить область Partial Recognition |
| Таблица стала сплошным текстом | Выбран обычный режим | Использовать Image Excel Recognition |
| Символы распались на шум | Низкое разрешение или JPEG-артефакты | Подготовить более чёткий PNG или пересканировать |
| Alt+F не захватывает экран | Нет разрешения или конфликт горячей клавиши | Разрешить Screen Recording либо убрать конфликт |
| Результат не появился в ожидаемой папке | Изменён Directory | Проверить путь и открыть каталог значком папки |
| В XLSX пропали ведущие нули | Автопреобразование числа | Задать текстовый формат и сверить исходник |
Характер ошибки помогает выбрать действие быстрее, чем повторный запуск без изменений. Если проблема систематическая, исправляйте настройку или исходник. Если ошибка единичная, отмечайте её при ручной проверке. Несколько разных симптомов на одной странице обычно указывают на сложный макет или плохое изображение, поэтому полезнее перейти к зонам и подготовке файла.
Вопросы о работе Cisdem OCRWizard
Можно ли распознать русский текст?
Да, Russian входит в опубликованный список языков OCR. Его нужно выбрать в поле Language до запуска. Английский интерфейс при этом не меняется: настройка определяет язык документа.
Можно ли добавить TIFF?
В руководстве среди изображений перечислены PNG, JPG и BMP, а также PDF. TIFF нужно предварительно преобразовать. Для многостраничного TIFF удобнее сначала собрать страницы в PDF или экспортировать их в последовательность PNG.
Создаёт ли программа поисковый PDF?
Документированные текущие режимы выводят TXT, DOCX, RTF и XLSX, а расширенный режим сохраняет текст. Для PDF с невидимым текстовым слоем нужен редактор, который поддерживает searchable PDF.
Можно ли распознать только одну часть страницы?
Да. Partial Image Recognition использует одну прямоугольную рамку. Для нескольких зон, колонок и исключаемых областей применяйте Advanced Recognition.
Как обработать папку фотографий?
Откройте Batch Images Recognition, добавьте файлы или папку, выберите общий язык, формат и каталог. Сначала запустите один типичный элемент, затем всю очередь.
Как перенести таблицу?
Используйте Image Excel Recognition. Результат сохраняется в XLSX. После открытия проверьте границы ячеек, числовые форматы, ведущие нули и итоги.
Что делает Advanced Recognition?
Он открывает изображения и PDF во вкладках, показывает страницы и свойства, позволяет создавать зоны распознавания, зоны исключения и очищать разметку. Можно обработать текущую или все страницы и сохранить извлечённый текст.
Почему рукопись распознана хуже печатного текста?
Почерк сильнее различается по форме букв, наклону и соединениям. Используйте крупный контрастный снимок, выбирайте правильный язык и проверяйте результат по оригиналу. Декоративный и слитный почерк требует больше ручной правки.
Где изменить папку сохранения?
Путь задаётся в поле Directory в нижней части простых режимов. В пакетной очереди после завершения значок папки помогает быстро открыть созданный файл.
Что означает статус Completed?
Он показывает, что обработка элемента завершена. Это не оценка точности. Файл нужно открыть и проверить по исходнику, особенно числа, имена и порядок колонок.
Что делать, если PDF уже содержит текст?
Сначала попробуйте выделение и копирование. Повторный OCR нужен только для страниц без корректного текстового слоя или для изображения текста. Не распознавайте цифровой документ повторно без необходимости.
Можно ли использовать один язык для смешанного документа?
Можно выбрать основной язык, но второй алфавит потребует тщательной проверки. Для независимых блоков лучше выполнить два прохода с разными языками через Partial или Advanced Recognition.
Как избежать повторной обработки сотен файлов?
Тестируйте один типичный файл, фиксируйте язык, формат и каталог, затем запускайте партию. После завершения сохраняйте журнал статусов и не очищайте очередь до сверки количества результатов.
Нужен ли доступ к экранной записи?
На macOS он нужен для Screenshot Recognition. Разрешение выдаётся в системных настройках конфиденциальности. После изменения разрешения программу следует перезапустить.
Можно ли считать OCR-выдачу окончательным документом?
Нет, если данные имеют юридическое, финансовое или медицинское значение. OCR ускоряет ввод, но критичные поля необходимо сверять. Финальный статус документ получает только после проверки.
Приёмка результата и повторяемый регламент
До начала проекта определите критерий готовности для каждого типа файла. Для обычного текста это может быть отсутствие пропущенных абзацев и исправление всех отмеченных ошибок; для таблицы — совпадение числа строк, колонок и контрольных итогов; для договора — точное воспроизведение реквизитов, дат, сумм и нумерации. OCRWizard выдаёт редактируемый материал, но критерий приёмки задаёт пользователь, потому что программа не знает юридическую или финансовую значимость конкретного символа.
Создайте короткий регламент: кто готовит сканы, кто выбирает режим и язык, кто проверяет выдачу, где лежат исходники и проверенные файлы. В небольшой задаче все роли может выполнять один человек, но порядок всё равно полезен. Он предотвращает ситуацию, когда исправленный DOCX случайно заменяется непроверенной повторной выдачей, а оригинал удаляется после успешного статуса.
Для выборочного контроля определите долю страниц и обязательные поля. Чистые однотипные документы можно проверять по выборке, но критичные реквизиты следует сверять в каждом файле. Проблемные страницы, рукопись и таблицы проверяйте полностью. Если в выборке обнаружена систематическая ошибка, расширьте проверку на всю партию и при необходимости повторите OCR с исправленной настройкой.
Храните протокол ошибок в виде простого списка: имя файла, страница, неверный фрагмент, причина и исправление. Через несколько партий станет видно, какие дефекты повторяются. Например, постоянное смешение колонок означает, что этот шаблон следует сразу отправлять в Advanced Recognition; потеря ведущих нулей означает обязательный текстовый формат в XLSX; ошибки кириллицы указывают на неверный язык или смешанный алфавит.
После приёмки перемещайте результат в отдельную папку checked и запрещайте автоматическую перезапись. Если документ нужно распознать повторно, сохраняйте новый результат рядом, а не поверх проверенного. Сравнение двух файлов покажет, действительно ли повторный проход улучшил результат. Для крупных текстов полезно использовать инструмент сравнения документов, а для таблиц — формулы и сверку контрольных сумм.
Регламент обновляйте только на основании проверенных примеров. Не меняйте процесс из-за одной случайной ошибки, если она не повторяется. Но если ошибка затрагивает критичное поле, добавьте отдельную проверку даже при единичном случае. Такой подход сохраняет скорость OCRWizard и одновременно не переносит риск автоматического распознавания в конечную базу или документ.
Итоговый рабочий подход
Cisdem OCRWizard наиболее эффективен, когда задача заранее сведена к одному из восьми сценариев. Один снимок обрабатывается в паре панелей, серия файлов — в очереди, таблица — в XLSX, PDF — постранично или пакетно, фрагмент — по рамке, экран — через Alt+F, сложный макет — по зонам, рукопись — в отдельном режиме. Пользователь получает контролируемую последовательность без необходимости разбираться в десятках абстрактных параметров OCR.
Главное практическое ограничение — программа не выполняет всю документную работу после распознавания. Результаты нужно проверять, сложный макет иногда собирать заново, а поисковый PDF создавать другим редактором. Узкий список входных форматов требует предварительной конвертации TIFF и HEIC, а английский интерфейс может замедлить первое знакомство. Эти ограничения предсказуемы и компенсируются правильным выбором режима и пробным проходом.
Для стабильной работы используйте чистые исходники, задавайте правильный язык, тестируйте одну страницу, размечайте колонки в Advanced Recognition и храните оригинал рядом с проверенным результатом. Такой процесс превращает OCRWizard из кнопки автоматического распознавания в воспроизводимый инструмент оцифровки, где каждая ошибка обнаруживается до того, как данные попадут в документ, таблицу или хранилище.