DocuWare Intelligent Indexing

DocuWare Intelligent Indexing автоматически распознаёт ключевые сведения в счетах, накладных, письмах и других деловых документах, предлагает значения для полей карточки, показывает уверенность распознавания цветом и запоминает исправления, сделанные через One Click Indexing. Пользователь получает заполненный диалог сохранения с номером документа, датой, организацией, суммой и другими индексными данными, проверяет сомнительные позиции рядом с изображением оригинала и отправляет документ в архив без повторного ручного набора.

Работа начинается в лотке DocuWare: помещённый туда файл передаётся на анализ, после чего миниатюра получает зелёную, жёлтую или красную отметку. Цвет относится не к качеству самого PDF, а к надёжности предложенных индексных значений. Зелёный документ обычно требует лишь контрольного взгляда, жёлтый нужно сверить по отдельным полям, а красный следует проиндексировать внимательнее и тем самым дать системе новый учебный пример.

При открытии команды сохранения слева или рядом с Viewer появляется диалог полей, а найденные фрагменты подсвечиваются на странице. Ошибочное значение лучше не перепечатывать: достаточно активировать One Click Indexing, выбрать нужное поле и выделить корректный текст мышью. В карточку передаётся не только строка, но и сведения о её расположении, поэтому следующий документ похожего вида распознаётся точнее.

Открыть DocuWare Intelligent Indexing

Оценка 9.7 Рекомендуем
  • Редактирование PDF
  • Русский интерфейс
  • Просто новичкам
Скачать бесплатно на Windows
Лучшая альтернатива
DocuWare Intelligent Indexing
Оценка 8.5
  • Нужна система DocuWare
  • Требуется обучение
  • Зависит от качества OCR
Открыть DocuWare Intelligent Indexing онлайн
Сервис откроется в новой странице

Как проходит индексация от лотка до архива

Intelligent Indexing включается в конкретном лотке документов и работает вместе с назначенным ему диалогом сохранения. Это важная деталь рабочего процесса: предложения не появляются во всех карточках автоматически, а относятся к заранее настроенной связке лоток — диалог — архив. Когда оператор перетаскивает PDF или скан в такой лоток, анализ начинается в фоне. Файл остаётся видимым среди остальных документов, поэтому сотрудник может продолжать сортировку, объединение страниц и подготовку пачки, не открывая отдельное окно распознавания.

После завершения анализа у миниатюры появляется цветная полоса. Общая зелёная отметка означает, что все задействованные поля получили предложения с высокой уверенностью. Жёлтая отметка говорит о смешанном результате: часть значений распознана уверенно, а одно или несколько полей требуют проверки. Красная появляется, когда предложения ненадёжны либо отсутствуют. Смысл такой индикации — быстро разделить поток на документы для почти автоматического сохранения и документы, которым нужен оператор.

Лоток DocuWare с цветными отметками уверенности Intelligent Indexing

Цвет миниатюры не заменяет контроль содержания. Даже зелёный счёт следует кратко сверить, если сумма или номер запускают платёжный процесс, а жёлтый документ не обязательно заполнен неправильно целиком. Практичный порядок — сначала обработать несколько красных документов нового поставщика, затем повторить индексацию оставшейся пачки и только после этого переходить к массовому сохранению зелёных экземпляров.

Открытие диалога сохранения

Команда Store открывает документ в Viewer и одновременно показывает диалог индексных полей. Пользователь видит страницу и карточку в одном рабочем пространстве: значения организации, даты, номера, контактного лица, суммы и других реквизитов уже находятся в назначенных полях. Слева от каждого предложения отображается свой цвет уверенности, поэтому оператор проверяет не всю карточку одинаково тщательно, а прежде всего жёлтые и красные строки.

Выбор диалога сохранения для документа с Intelligent Indexing

Если для одного лотка доступно несколько вариантов сохранения, нужный диалог можно узнать по значку лампочки. Эта метка показывает, что именно с ним связана автоматическая подстановка. Выбор обычного диалога без такой связи приведёт к пустым полям, хотя документ уже прошёл анализ. При расследовании жалобы распознавание сработало, но карточка не заполнилась сначала проверяют именно выбранный диалог и его назначение лотку.

После подтверждения документ попадает в файловый архив с индексами, по которым его можно искать, включать в списки и передавать в дальнейшие процессы. Intelligent Indexing не меняет текст или графику внутри исходного PDF: результатом являются метаданные карточки. Поэтому исправление номера счёта в поле не исправляет опечатку на изображении документа, а лишь задаёт корректное значение для поиска и маршрутизации.

Viewer и One Click Indexing

Viewer служит не только средством просмотра страниц. Во время сохранения он связывает область документа с активным индексным полем. При включённом One Click Indexing слова, даты и числа распознаются как выбираемые фрагменты. Щелчок по фрагменту переносит его в поле, после чего курсор автоматически переходит к следующей строке диалога. Такой режим особенно удобен при последовательном заполнении компании, номера, даты и суммы.

Перенос реквизитов из Viewer в поля через One Click Indexing

Для обучения важен не только итоговый текст, но и способ его ввода. Если оператор набирает исправление с клавиатуры, система получает правильную строку, но не узнаёт, где она расположена на странице. При выделении мышью передаются и значение, и координаты. На похожем бланке следующего документа модель может проверить участок рядом с тем же заголовком или в той же смысловой зоне, что заметно полезнее простого запоминания текста.

Выбор составных значений

Одно индексное значение иногда состоит из нескольких разнесённых слов. Например, имя и фамилия могут быть распознаны отдельными блоками, а адрес — несколькими строками. Удерживая Ctrl, пользователь может выбрать несколько фрагментов для одного поля. Это избавляет от ручной склейки и одновременно сохраняет сведения обо всех выбранных областях. Перед сохранением следует проверить порядок частей, особенно если документ содержит колонки или повторяющиеся подписи.

One Click Indexing умеет передавать не только текст на странице, но и доступные свойства файла, показанные в нижней части Viewer: имя, тип или дату файла. Это пригодно, когда индекс строится по техническому имени, полученному из сканирующего процесса или внешней системы. Однако такое поле следует использовать последовательно: смешивание даты файла с датой документа создаёт неоднозначные учебные примеры.

Кнопка One Click Indexing на панели инструментов Viewer

Почему инструмент может быть не виден

Если значок отсутствует на панели, его добавляют через настройку инструментов Viewer. Ещё одна причина — документ открыт не в контексте сохранения, а только для просмотра. One Click Indexing доступен, когда есть активное поле, куда можно передать значение: в диалоге сохранения, при редактировании индексных данных или в подходящей задаче. Простое открытие файла без карточки назначения не создаёт такого контекста.

Выделение должно захватывать именно нужный текст, без соседнего заголовка, символа валюты или части другого столбца, если эти элементы не должны входить в индекс. Ошибка на первом этапе обучения повторяется на похожих документах. Лучше сразу отменить неверный выбор и повторить его аккуратно, чем сохранять карточку с лишними символами и затем постепенно переучивать модель.

Viewer с подсвеченными источниками индексных значений

Как система учится на исправлениях

Каждый сохранённый документ становится примером того, какие сведения организация считает правильными для данного типа и расположения полей. Алгоритмы сравнивают новый файл с уже обработанными похожими документами, оценивают результаты распознавания и формируют наиболее вероятное значение для каждого поля. Менее вероятные варианты могут быть доступны в раскрывающемся списке, что позволяет выбрать корректную альтернативу без набора текста.

Для нового шаблона первая карточка часто содержит красные поля. Это нормальная ситуация: система ещё не видела форму конкретного поставщика, перевозчика или подразделения. Оператор переносит реквизиты через One Click Indexing, сохраняет документ и повторяет процедуру на нескольких похожих экземплярах. Практика поддержки DocuWare рекомендует несколько последовательных корректных примеров; четыре-пять документов одного вида обычно дают модели устойчивую основу, хотя сложные макеты могут потребовать больше.

Первый этап обучения: выбор правильных значений в документе

Обучение происходит при сохранении. Простое открытие карточки и выделение текста без завершения операции не закрепляет пример. По этой причине тестовую пачку нужно проводить через полный рабочий путь: загрузить в связанный лоток, дождаться предложений, исправить значения, сохранить в назначенный архив и только затем оценивать следующий документ.

Второй этап обучения с подтверждением индексных значений

Последствия неправильных примеров

Если разные сотрудники используют одно поле по-разному, модель не может вывести стабильное правило. Классический случай — один оператор помещает в сумму значение с налогом, второй указывает сумму без налога, а третий оставляет строку пустой. Для алгоритма все три действия являются обратной связью. До запуска нужно договориться о смысловом стандарте каждого поля и закрепить его в инструкции для операторов.

Неверно сохранённые документы не исчезают из накопленного опыта сразу. Если ошибочный вариант подтверждался несколько раз, его придётся несколько раз последовательно исправить на новых документах. Система постепенно отдаёт больший вес корректным примерам. Поэтому контроль первых партий важнее, чем исправление большого загрязнённого набора позже.

Проверка результатов после сохранения учебного документа

Когда конкретный шаблон распознаётся уверенно, значения и подсветка становятся зелёными. Это не означает, что обучение завершено навсегда. Поставщик может изменить дизайн счёта, переместить номер или добавить новый блок. При появлении жёлтых результатов оператор снова применяет One Click Indexing и тем самым добавляет пример для обновлённого макета.

Высокая уверенность после обучения на похожих документах

Повторная индексация пачки

Если сразу импортирована большая пачка нового типа, все документы могут получить красные отметки, потому что анализ выполнялся до появления первого учебного примера. После сохранения нескольких корректно заполненных экземпляров оставшиеся файлы не обязательно удалять и загружать заново. В контекстном меню лотка используется команда Repeat Intelligent Indexing, которая повторно отправляет выбранный документ на анализ уже с учётом накопленной обратной связи.

Повтор имеет смысл после реального изменения знаний: сохранения нескольких примеров, корректировки сопоставления или устранения проблемы OCR. Многократный запуск без новых данных обычно не превращает красное предложение в зелёное. Если результат не меняется, нужно искать причину в качестве изображения, типе поля, выбранном диалоге или неоднозначном макете.

Сопоставление индексных полей

Администратор связывает категории Intelligent Indexing с полями диалога сохранения. Благодаря этому понятие Document Number попадает, например, в поле Номер документа, категория Correspondent Name — в Компания, а сумма — в числовое поле. Имена в интерфейсе организации могут отличаться, но смысл и тип данных должны совпадать. Именно сопоставление определяет, куда попадёт каждое предложение.

Сопоставление полей диалога с категориями Intelligent Indexing

Система предоставляет 42 категории: 11 стандартных и 31 настраиваемую. Стандартные категории содержат встроенную логику для типичных реквизитов, поэтому их следует использовать по назначению. Например, категория отправителя учитывает характерные признаки названий организаций, а категория номера документа ищет последовательности рядом с обозначениями счёта или номера. Перенос адреса электронной почты в категорию отправителя лишает администратора этой логики и повышает риск неверных предложений.

Настраиваемые категории нужны для специфических реквизитов, которым не соответствует стандартная семантика. Среди них имеются 16 текстовых, пять дат и десять десятичных полей. Это не просто набор одинаковых ячеек: тип влияет на интерпретацию результата. Дату нужно связывать с датой, числовую сумму — с десятичным полем, обычный идентификатор — с текстом. Дата, сопоставленная текстовой категории, может не назначаться автоматически.

Категория типа документа

Поле типа документа имеет особое значение, поскольку помогает разделять счета, договоры, письма, заказы и другие классы. При сопоставлении для него выбирается язык индексного значения. Без языковой настройки конфигурация не сохраняется. Если внутренний процесс ожидает собственный термин, например Входящий счёт вместо стандартной формулировки, наименование можно адаптировать в настройках Intelligent Indexing, не меняя распознаваемый смысл документа.

Единообразие особенно важно при нескольких лотках и диалогах, ведущих в один архив. Одинаковый логический реквизит должен быть связан с одной и той же категорией. Если в одном лотке номер заказа обучается как Custom Text 1, а в другом — как Document Number, примеры одного типа перестают усиливать друг друга и могут ухудшать качество.

Настройка лотка с назначенным диалогом Intelligent Indexing

Один диалог на понятный сценарий

На практике проще поддерживать один чётко определённый диалог Intelligent Indexing для конкретного процесса и архива. Когда одному лотку предлагают несколько почти одинаковых карточек, оператор легче выбирает неправильную, а администратору сложнее контролировать одинаковость полей. Если несколько диалогов действительно нужны из-за ролей или набора обязательных реквизитов, сопоставления общих полей должны оставаться идентичными.

Изменение сопоставления после длительного обучения требует осторожности. Новая категория начинает собирать собственные примеры, а старые знания могут использоваться лишь как запасной контекст. Поддержка DocuWare описывает мягкий сброс через замену конкретной настраиваемой категории на другую, но предупреждает, что поле придётся обучать заново и эффект появится постепенно. Массово менять все связи одновременно не следует.

Настройка лотка и диалога сохранения

Чтобы предложения появились у пользователей, одной настройки полей недостаточно. В конфигурации архива выбирают или создают диалог сохранения, включают автоматическое заполнение с Intelligent Indexing и назначают категории. Затем этот диалог указывают в настройках нужного лотка. После сохранения конфигурации каждый новый документ, попавший в лоток, автоматически отправляется на анализ.

Включение Intelligent Indexing и выбор диалога в настройках лотка

Цвет лотка, права пользователей и архив для автоматического сохранения настраиваются отдельно от интеллектуального распознавания. Сотрудник должен иметь доступ и к лотку, и к целевому архиву, и к выбранному диалогу. Когда предложения видит администратор, но не видит оператор, следует проверять права и доступность диалога для роли, а не переобучать модель.

Для конфигурирования требуется соответствующее функциональное право. В рабочей организации разумно отделить роль администратора настройки от роли оператора, который только подтверждает и исправляет поля. Это снижает риск случайного изменения сопоставления в момент, когда накоплены сотни корректных примеров.

Значок лампочки и выбор сценария

В раскрывающемся списке Store рядом с диалогом, связанным с Intelligent Indexing, отображается лампочка. Если значка нет, выбранный путь сохранения не использует предложения. На изображении лотка может быть зелёная отметка, но обычный диалог всё равно откроется пустым. Поэтому учебная инструкция для персонала должна содержать не только кнопку Store, но и точное название диалога со значком.

Выбор диалога со значком Intelligent Indexing

Документы с высокой уверенностью можно направлять на автоматическое сохранение, если процесс и риск допускают это. Перед включением такого режима проверяют обязательные поля, долю ошибок на репрезентативной выборке и последствия неверного индекса. Для счетов, где номер и сумма запускают оплату, безопаснее оставить контроль хотя бы критических реквизитов; для однотипной внутренней корреспонденции автоматизация может быть строже.

Конфигурацию следует тестировать на реальных вариациях: многостраничных PDF, сканах с небольшим поворотом, счетах разных поставщиков, документах с пустыми полями и дубликатах. Идеальный демонстрационный файл не показывает, как система поведёт себя в потоке. Набор приёмочных примеров должен включать и те документы, которые оператор обычно считает неудобными.

Качество OCR и подготовка документов

Intelligent Indexing опирается на текст, полученный распознаванием. Если OCR путает символы, модель может правильно определить область, но получить неверное значение. Типичные ошибки — смешение I, l и 1, распознавание w как двух v, пропуск десятичного разделителя или объединение соседних колонок. Машинное обучение умеет компенсировать часть повторяющихся ошибок, однако оно не восстанавливает информацию, которой нет в читаемом изображении.

Для чёрно-белого сканирования рекомендуется не менее 300 dpi, для цветного — не менее 200 dpi. Более высокое разрешение не всегда улучшает результат: чрезмерно тяжёлые файлы замедляют передачу и обработку, а артефакты сжатия остаются. Важнее резкость, ровный фон, отсутствие обрезанных краёв и достаточный контраст мелкого шрифта.

Быстрый тест OCR выполняется без специальных утилит: документ открывают в программе чтения PDF, копируют несколько строк и вставляют в текстовый редактор. Если номер, дата и название компании копируются с ошибками, Intelligent Indexing будет работать с тем же проблемным текстом. Сначала исправляют сканирование или распознавание, затем оценивают обучение.

Наклон, поворот и сложная верстка

Алгоритмы способны анализировать документ, отсканированный под углом, и не привязаны к одной странице или фиксированной позиции поля. Тем не менее сильная перспектива от фотографии телефона, тени у сгиба, волнистая бумага и перекрывающие штампы ухудшают OCR. Для регулярного потока лучше использовать профиль сканера с выравниванием, удалением пустых полей и контролем ориентации.

На многостраничном документе реквизит может находиться не на первой странице. Система анализирует элементы независимо от номера страницы, но оператору всё равно нужно убедиться, что в лоток попал полный комплект. Отсутствующая последняя страница с итоговой суммой не является ошибкой индексации — данных физически нет в переданном файле.

Парольная защита, повреждённая структура PDF или недоступный текстовый слой могут нарушить обработку ещё до этапа предложений. Если миниатюра создаётся, но поля остаются красными для всех документов одного происхождения, полезно пересохранить один файл в стандартный PDF, снять разрешённую владельцем защиту и сравнить результат. Массовую конвертацию начинают только после теста на копии.

Какие файлы подходят для процесса

В лоток можно помещать PDF, результаты сканирования и другие форматы, которые принимает DocuWare и отображает в Viewer. Intelligent Indexing ориентирован на извлечение индексных значений, а не на преобразование документа в редактируемый Word или Excel. Даже когда исходный файл содержит таблицу, конечным результатом являются поля и строки индексной таблицы, а не копия исходного макета в офисном формате.

Лучшие результаты дают повторяющиеся деловые формы: счета, заказы, накладные, уведомления и письма с устойчивой структурой. Полностью свободные тексты, рукописные заметки и сильно меняющиеся макеты требуют большего контроля. Для рукописного содержания и сложной классификации в экосистеме DocuWare предусмотрены другие средства интеллектуальной обработки; подменять ими возможности Intelligent Indexing в настройке не следует.

Счета и индексные таблицы

Один из наиболее практичных сценариев — обработка входящих счетов. Обычные поля содержат поставщика, номер, дату, срок оплаты, сумму, налоговый номер и проект. После нескольких корректных примеров документы знакомого поставщика получают зелёные значения, а бухгалтер проверяет карточку рядом с оригиналом. Это сокращает ручной набор и уменьшает ошибки, из-за которых документ трудно найти или неправильно направить.

Распознавание реквизитов счёта рядом с диалогом сохранения

Для строк счёта используется индексная таблица. В ней могут храниться описание позиции, количество, цена, сумма, дата поставки, контакт или иной набор колонок, заданный архивом. В диалоге сохранения оператор выделяет первую корректную строку через One Click Indexing, после чего функция автозаполнения переносит следующие позиции по распознанной структуре.

Табличное распознавание работает и с многостраничными счетами. Если заголовок повторяется на каждой странице или колонки немного смещаются, результат нужно проверить по границам страниц. Пропущенная строка часто возникает из-за переноса описания, пустого значения в одной колонке или другой структуры итоговой секции. В таком случае первой заново обучают строку, на которой произошёл сбой, и повторяют автозаполнение.

Как обучать таблицу

  1. Создать в архиве индексную таблицу с колонками подходящих типов.
  2. Включить Intelligent Indexing для диалога сохранения и назначить нужные колонки.
  3. Связать диалог с лотком, в который поступают счета.
  4. Открыть первый документ, заполнить начальную строку через One Click Indexing и запустить автозаполнение.
  5. Проверить каждую перенесённую позицию, исправить первый ошибочный ряд и повторить действие.
  6. Сохранить несколько счетов одного макета, прежде чем оценивать долю автоматизации.

Колонки индексной таблицы не требуют того же ручного сопоставления с 42 одиночными категориями, что обычные поля: обучение происходит по содержимому строк. Но типы колонок всё равно важны. Количество и цена должны быть десятичными, дата — датой, код товара — текстом, иначе последующие проверки и вычисления в процессе будут ненадёжны.

Автоматическое заполнение строк относится к облачной службе Intelligent Indexing. При локально размещённом варианте этой функции может не быть, хотя одиночные индексные предложения работают. Это существенное ограничение для бухгалтерии: перед проектированием процесса с детализацией позиций нужно подтвердить доступность таблиц в конкретной среде.

Карточное представление лотка с индексными предложениями

Контроль сумм и дальнейший процесс

Intelligent Indexing извлекает данные, но не заменяет бизнес-проверки. Итог по строкам, налог и общая сумма могут сравниваться правилами рабочего процесса, а номер заказа — с данными закупки. Если проверка не сходится, документ отправляют сотруднику независимо от зелёного цвета распознавания. Уверенность отвечает на вопрос вероятно ли прочитано значение, а не правилен ли счёт с точки зрения договора.

Нормализация значений с помощью фильтров

На документе одно и то же юридическое лицо может встречаться в разных написаниях: с сокращением, опечаткой, дефисом или устаревшим обозначением. Для поиска и интеграции с ERP обычно нужен один справочный вариант. Фильтр поля сравнивает распознанное значение со списком допустимых терминов и подставляет согласованную форму.

Список готовится как текстовый файл: по одному корректному значению в строке, без разделителей. В настройках Intelligent Indexing выбирают изменение фильтра, добавляют новый файл и указывают поле, к которому он относится. После применения похожие варианты на следующих документах преобразуются в значение из списка. Сам исходный текст на странице не меняется.

Фильтр полезен для поставщиков, подразделений, проектов и других сущностей, которые должны совпадать с мастер-данными. Он не должен превращаться в огромный неуправляемый словарь. Справочник следует обновлять вместе с ERP, удалять дубликаты и контролировать слишком похожие названия, иначе автоматическая нормализация может выбрать соседнюю компанию.

Когда фильтр не помогает

Фильтр не исправит неверно выбранную область. Если вместо названия поставщика модель извлекает получателя, оба значения могут быть корректными словами из справочника, но смысл останется неправильным. Сначала проверяют сопоставление категории и обучение координатам, затем используют нормализацию написания.

Также фильтр не заменяет обязательную проверку уникальных идентификаторов. Номер счёта или заказа обычно нельзя выбирать из ограниченного списка, поскольку каждое значение новое. Для таких полей важны правильная категория, качественный OCR и контроль формата, например маска допустимой длины или префикса в последующем процессе.

Если справочник содержит только часть контрагентов, новый поставщик может не получить ожидаемого значения. Оператор должен иметь понятный путь: выбрать корректный новый термин, запросить добавление в мастер-данные и не сохранять приблизительное совпадение ради зелёного статуса. Иначе индекс перестаёт отражать юридический документ.

Рабочие сценарии кроме входящих счетов

Заказы и подтверждения

В заказах система может извлекать номер, дату, заказчика, контакт, сумму и проект. Для подтверждения заказа особенно полезно одинаково индексировать номер, чтобы связать его с исходной заявкой. Когда поставщик меняет расположение реквизитов, первые документы нового шаблона проверяют вручную; после обучения последующие подтверждения поступают в нужный процесс с заполненными полями.

Накладные и уведомления о доставке

В накладной важны номер поставки, дата, отправитель, получатель и ссылка на заказ. Документы часто сканируются на складе, поэтому качество изображения отличается от офисного PDF. Профиль сканера должен сохранять мелкие цифры и штриховые обозначения, а оператор — контролировать красные поля, прежде чем документ будет связан с закупкой.

Договоры и деловая корреспонденция

Для договоров можно индексировать тип, контрагента, дату и номер, если эти реквизиты явно присутствуют и повторяются в узнаваемой структуре. Полный смысл свободного юридического текста система не анализирует как юрист. Условия, исключения и обязанности остаются содержанием документа, а поля служат для поиска и маршрутизации. Чем свободнее макет, тем выше роль проверки.

Письма и уведомления подходят, когда организация использует устойчивые шаблоны: заголовок, отправитель, дата, тема и номер обращения. Если письмо представляет собой произвольный текст без фиксированных реквизитов, настраиваемая категория может обучиться извлекать отдельный фрагмент, но надёжность будет ниже, чем у стандартного счёта.

Кадровые документы

В кадровом процессе можно извлекать сотрудника, дату, вид документа и внутренний номер из типовых форм. При этом доступ к лотку и архиву должен соответствовать правилам конфиденциальности. Обучение на реальных персональных документах проводят только уполномоченные сотрудники, а тестовые снимки и диагностические файлы не размещают в общедоступных папках.

Входящий поток из электронной почты

Вложения могут поступать в лоток через почтовую интеграцию или наблюдаемую папку, после чего Intelligent Indexing обрабатывает их так же, как файлы, добавленные вручную. Важно определить, хранится ли письмо отдельно от вложения и какой файл считается документом для индексации. Подпись письма, логотипы и цепочка переписки не должны случайно стать источником значения для карточки счёта.

Организация проверки по цветам

Цветовая модель позволяет построить очередь по риску. Зелёные документы проходят быстрый контроль обязательных полей, жёлтые открываются с фокусом на сомнительных строках, красные направляются сотруднику, который умеет обучать новые шаблоны. Такое распределение эффективнее одинаковой ручной проверки всех полей, но только если операторы понимают, что означает цвет и как исправление влияет на будущие документы.

Для критических полей можно установить более строгий внутренний порядок. Например, номер счёта, сумма и поставщик сверяются всегда, даже когда зелёные, а тема письма или внутренний проект проверяются только при жёлтой отметке. Это не настройка алгоритма, а регламент процесса, который учитывает стоимость ошибки.

Карточное представление лотка показывает предложения прямо рядом с миниатюрами. Сотрудник видит основные индексы без открытия каждого документа и может выделить группу зелёных файлов для автоматического действия. Перед массовым сохранением полезно отфильтровать новый тип документа или одного поставщика и убедиться, что несколько карточек заполнены одинаково.

Когда не следует доверять общей зелёной отметке

Общая зелёная отметка возникает, когда все задействованные поля имеют высокий уровень уверенности. Если критическое поле вообще не сопоставлено или исключено из диалога, его отсутствие не обязательно сделает документ красным. Поэтому приёмочное тестирование должно проверять не только цвет, но и полноту перечня полей.

Ещё один риск — уверенно распознанное, но бизнес-неверное значение. Алгоритм может стабильно извлекать сумму без налога, если именно её подтверждали в обучающих примерах, тогда результат будет зелёным. Значение зелёный означает соответствие изученному шаблону, а не соответствие бухгалтерской политике.

Типичные ошибки и их устранение

Все документы нового поставщика красные

Сохраните несколько экземпляров вручную, используя One Click Indexing для каждого исправления, затем запустите Repeat Intelligent Indexing для оставшейся пачки. Не ожидайте улучшения после одного только повторного анализа. Проверьте, что учебные документы действительно сохранены через тот же диалог и в тот же архив.

Поля пустые, хотя миниатюра получила цвет

Убедитесь, что выбрана карточка со значком лампочки. Проверьте назначение диалога лотку и права пользователя. Затем откройте сопоставление: категория могла быть удалена, связана с другим полем или иметь несовместимый тип. Если проблема затрагивает одного сотрудника, сначала сравнивают доступные ему диалоги с учётной записью администратора.

Дата распознаётся, но не подставляется

Сравните типы полей. Категория даты должна быть связана с полем даты, а не с обычным текстом или DateTime, для которого в конкретном сценарии действуют иные правила. Проверьте региональный формат и наличие нескольких дат на странице. При исправлении выделяйте нужную дату на документе, а не вводите её вручную.

Название компании постоянно обрезается

Выберите поле и протяните выделение по полному названию через One Click Indexing. Повторите на нескольких документах. Если написания различаются, добавьте фильтр со справочным вариантом. Не исправляйте только клавиатурой: модель запомнит строку, но не получит границы полного блока.

Модель извлекает получателя вместо отправителя

Проверьте, что поле компании сопоставлено с категорией Correspondent Name или другой подходящей стандартной категорией, а не с произвольным текстом. Затем сохраните серию правильных примеров. Если ошибочные документы ранее подтверждались, улучшение будет постепенным, поскольку старые примеры не исчезают мгновенно.

После изменения шаблона качество резко снизилось

Рассматривайте новый макет как отдельную разновидность. Обучите несколько файлов обновлённой формы, не удаляя старые. Если старый и новый бланк очень похожи, но реквизиты поменялись местами, уделите внимание каждому жёлтому полю. Повторная индексация всей пачки выполняется после сохранения учебных примеров.

В таблице пропускается строка

Найдите первую строку, перенесённую неверно, заполните её заново через One Click Indexing и снова включите автозаполнение таблицы. При разрыве описания на две строки или пустой ячейке может потребоваться несколько исправлений. Проверяйте, не принята ли итоговая строка или примечание за товарную позицию.

OCR путает цифры и буквы

Проверьте разрешение, контраст и текстовый слой. Пересканируйте один образец с рекомендованными параметрами и сравните. Если исходник получен из внешней системы, попросите цифровой PDF вместо фотографии или сжатого изображения. Обучение не должно использоваться как замена читаемому источнику.

Результат не улучшается после многих исправлений

Сравните действия операторов и смысл поля: возможно, сотрудники подтверждают разные значения. Проверьте сопоставление и наличие старых ошибочных примеров. Для отдельного настраиваемого поля можно применить мягкий сброс через новую категорию и обучить её заново, сохранив прежние знания как запасной контекст. Такое изменение выполняет администратор на контролируемой выборке.

Служба не отвечает

Сначала проверяют доступность организации DocuWare, состояние соединения и возможность открыть другие документы. Для локально управляемого подключения администратор проверяет запись Intelligent Indexing и параметры, предоставленные лицензией. Не следует менять адреса и модельное пространство вручную без документации: неверное соединение затронет всех пользователей.

Диагностика и обращение в поддержку

Для воспроизводимой заявки недостаточно сообщения неправильно распознаёт. Подготовьте исходный документ, название лотка и диалога, список затронутых полей, фактически предложенные и ожидаемые значения, а также снимок сопоставления. Это позволяет отделить ошибку OCR от неверной категории, обучения или бизнес-правила.

Каждый документ в лотке Intelligent Indexing получает уникальный идентификатор. Его находят через контекстную команду просмотра индексных записей, затем открывают системные записи. Идентификатор доступен, пока документ находится в соответствующем лотке; после перемещения в архив путь поиска меняется, поэтому диагностические данные лучше собрать до окончательного сохранения проблемного экземпляра.

Поддержке также может понадобиться идентификатор пользователя Intelligent Indexing, который виден в конфигурационном модуле в области подключённого пользователя. Перед передачей сведений соблюдают внутренние правила защиты: оригинал счёта может содержать банковские и персональные данные, поэтому его отправляют только через разрешённый канал.

Минимальный диагностический набор

  • Идентификатор Intelligent Indexing для проблемного документа.
  • Идентификатор подключённого пользователя или организации.
  • Оригинальный файл без дополнительного пересохранения, если его можно передать.
  • Названия полей с ошибками и точные ожидаемые значения.
  • Снимок сопоставления категорий с полями диалога.
  • Описание действий оператора: выбор из списка, One Click Indexing или ручной ввод.
  • Указание, воспроизводится ли ошибка на всех документах или на одном шаблоне.

Перед созданием заявки полезно проверить документ под другой учётной записью с тем же диалогом. Если результат одинаков, причина системная или модельная; если отличается только доступный диалог, проблема, вероятно, связана с правами или выбором сценария. Повторять обучение на десятках файлов до диагностики не стоит — можно закрепить неправильную схему.

Передача данных и изоляция обучения

Web Client и служба Intelligent Indexing обмениваются полнотекстовыми извлечениями, предложениями индексных значений и обратной связью. Передача защищается HTTPS. Для пользователя это означает, что индексирование происходит в фоне, но результат возвращается в обычный диалог DocuWare, а не в отдельный внешний редактор.

Учебные результаты и фрагменты организованы в модельном пространстве конкретной организации. Данные разных организаций разделены. Такая изоляция важна при оценке конфиденциальности: система обучается на документах своей организации, а не смешивает её исправления с карточками другого клиента.

Администратор всё равно должен определить, какие классы документов разрешено отправлять на обработку, кто видит лоток и как долго проблемные файлы остаются в нём. Техническое шифрование канала не заменяет разграничение прав, журналирование и правила обращения с персональными данными.

Что именно сохраняется в архиве

В архив попадает исходный документ и индексные данные, подтверждённые в диалоге. Intelligent Indexing не создаёт отдельную отредактированную копию PDF и не наносит подсветку на страницу. Цвета и выделения являются элементами интерфейса проверки. Аннотации, штампы и изменения содержания управляются другими инструментами Viewer и не относятся к автоматическому извлечению полей.

Если индексные сведения передаются дальше в ERP или workflow, ответственность за преобразование и проверку лежит на соответствующей интеграции. Например, нормализованное название поставщика можно использовать как ключ, но устойчивее применять уникальный код из справочника. Извлечение текста — первый шаг, а не полный контроль транзакции.

Практические ограничения

Intelligent Indexing приносит пользу внутри процессов DocuWare. Он не предназначен для разового открытия произвольного PDF и сохранения результата в Word, Excel или текстовый файл. Пользователю нужен настроенный лоток, диалог и архив, а администратору — понятная схема полей. Для простого редактирования страниц, объединения файлов или добавления подписей требуется отдельный PDF-инструмент.

Качество зависит от примеров. Новый поставщик, новый бланк или иной язык сначала дают менее надёжные предложения. Система не освобождает организацию от определения того, что считать номером, суммой или отправителем. Если правила не согласованы, автоматизация быстрее распространяет несогласованность.

Распознавание опирается на OCR и поэтому чувствительно к обрезанным краям, мелкому шрифту, фотографии под углом и плохому контрасту. Высокая уверенность не гарантирует бизнес-корректность. Для критических реквизитов нужны проверки диапазона, дубликатов, соответствия заказу и полномочий поставщика.

Автоматическая обработка строк счёта доступна не во всех вариантах развёртывания. Если проект строится вокруг детализации позиций, ограничение выясняют до проектирования индексной таблицы и workflow. Нельзя предполагать, что наличие одиночных предложений автоматически означает наличие распознавания всех строк.

Рукописные данные и полностью свободные документы не являются сильной стороной этого механизма. Для таких задач выбирают решения с распознаванием рукописи, классификацией и настраиваемыми моделями, а затем интегрируют результат с архивом. Попытка обучить стандартное индексное поле на непредсказуемом тексте приводит к большому объёму ручной проверки.

Когда решение особенно уместно

  • Документы уже поступают в DocuWare и должны сохраняться с индексной карточкой.
  • Поток содержит повторяющиеся шаблоны поставщиков или подразделений.
  • Операторы готовы исправлять значения выделением, а не только клавиатурой.
  • Есть владелец справочников и единых правил заполнения полей.
  • В процессе можно разделить зелёные, жёлтые и красные документы по уровню контроля.
  • Ошибки индекса обнаруживаются проверками до необратимого бизнес-действия.

Когда лучше выбрать другой инструмент

  • Нужно редактировать содержимое PDF, переставлять страницы или конвертировать файл.
  • Требуется универсальный API распознавания вне DocuWare.
  • Основной поток состоит из рукописных или очень свободных документов.
  • Нужно обучать сложные классификаторы и извлекать вложенные структуры независимо от архива.
  • Организация не готова определить единые поля и правила подтверждения.

Сравнение DocuWare Intelligent Indexing с аналогами

ПрограммаЛучше подходит дляГлавное ограничение
DocuWare Intelligent IndexingАвтозаполнения карточек и обучения на исправлениях непосредственно в лотках DocuWareТребует настроенной среды DocuWare и согласованного сопоставления полей
ABBYY VantageПостроения переиспользуемых навыков классификации, извлечения и сквозных процессовНастройка навыков и интеграции сложнее для простого сценария сохранения в архив
Microsoft Azure AI Document IntelligenceВстраивания готовых и пользовательских моделей в приложения через API и SDKНужны облачная архитектура, разработка и контроль квот
Google Cloud Document AIСоздания процессоров OCR, классификации и пользовательского извлечения в Google CloudРезультат требуется отдельно связать с архивом и пользовательской проверкой
Amazon TextractAPI-извлечения текста, форм, таблиц, запросов и данных счетов в AWSНе предоставляет готовый процесс хранения и обучения оператором в DocuWare
RossumОблачной обработки транзакционных документов с очередями проверки и интеграцией ERPОриентирован на отдельную платформу документооборота, а не на нативный диалог DocuWare

DocuWare Intelligent Indexing выбирают, когда документы уже должны попадать в архив DocuWare и ценна простая обратная связь прямо в Viewer. ABBYY Vantage лучше подходит для организации, которой нужны собственные навыки и более сложная оркестрация. Azure AI Document Intelligence, Google Document AI и Amazon Textract удобнее разработчикам, строящим API-процесс с нуля. Rossum полезен для отдельной транзакционной платформы с очередями исключений и коммуникацией с поставщиками.

PDF Commander не включён в таблицу, потому что решает другой класс задач: редактирование, сборка и преобразование PDF, а не автоматическое обучение индексным карточкам корпоративного архива. Он может быть полезен до загрузки — например, чтобы удалить лишние страницы или объединить комплект, — но не заменяет извлечение метаданных и работу с лотком.

Пошаговый запуск в организации

1. Определить поля и смысл

Составьте перечень реквизитов, которые реально используются для поиска, маршрутизации и интеграции. Для каждого укажите источник на документе, тип данных, обязательность и пример правильного значения. Не добавляйте поля на всякий случай: каждое новое поле увеличивает объём проверки и вероятность противоречивого обучения.

2. Подготовить архив и диалог

Создайте поля подходящих типов, настройте списки и обязательность, затем включите Intelligent Indexing в отдельном диалоге сохранения. Сопоставьте стандартные категории по смыслу и используйте настраиваемые только для специфических реквизитов. Для типа документа выберите язык и согласованные внутренние названия.

3. Создать контролируемый лоток

Назначьте диалог одному тестовому лотку и ограничьте доступ небольшой группе. Проверьте значок лампочки, импорт и открытие Viewer. На этом этапе не включайте автоматическое сохранение: важнее увидеть реальные ошибки и понять, как сотрудники применяют One Click Indexing.

4. Собрать репрезентативную выборку

Используйте документы нескольких поставщиков, разные месяцы, многостраничные файлы, сканы и цифровые PDF. Включите редкие варианты: кредит-ноту, счёт с пустой строкой, накладную с печатью, документ с изменённым логотипом. Выборка должна отражать поток, а не только удобные примеры.

5. Обучить и зафиксировать правила

Проведите каждый шаблон через несколько сохранений. Исправления выполняйте выделением. Параллельно записывайте спорные случаи: какая сумма нужна, что считать датой документа, как нормализовать компанию. Решения превращаются в короткую инструкцию для всех операторов.

6. Измерить результат

Считайте долю зелёных документов, среднее количество исправляемых полей, время проверки и частоту возврата после сохранения. Отдельно анализируйте критические поля. Высокая общая доля зелёного бесполезна, если номер счёта ошибается чаще второстепенной темы.

7. Включать автоматизацию постепенно

Сначала разрешите ускоренную обработку зелёных документов знакомых поставщиков, сохранив ручной контроль суммы и номера. Затем расширяйте охват. Новый тип, изменённый макет или новый источник снова проходит период наблюдения. Такой поэтапный подход предотвращает массовое сохранение неверных индексов.

Ежедневная работа оператора

  1. Открыть назначенный лоток и дождаться цветных отметок.
  2. Сначала обработать несколько красных документов новых типов.
  3. В команде Store выбрать диалог со значком лампочки.
  4. Проверить критические поля и все жёлтые или красные предложения.
  5. Исправлять текст через One Click Indexing; ручной ввод использовать только когда значения нет на странице.
  6. Проверить таблицу позиций и итоговые строки, если она используется.
  7. Сохранить документ, чтобы обратная связь попала в модель.
  8. После обучения повторить индексацию оставшейся пачки нового типа.
  9. Не подтверждать сомнительное значение ради ускорения; передать исключение владельцу процесса.

Оператору не требуется понимать внутренние алгоритмы, но он должен знать последствия действий. Выбор из списка, выделение и ручной ввод неравнозначны для обучения. Особенно важна привычка ставить курсор в правильное поле перед выделением: иначе верный фрагмент обучит неправильную категорию.

При работе с большим потоком полезно группировать документы по источнику. Несколько счетов одного поставщика легче сравнивать, а изменения макета заметнее. Смешанная очередь из договоров, накладных и счетов повышает риск выбрать неверный диалог, даже если система классифицирует часть документов автоматически.

Не следует исправлять только цвет. Цель — точные данные. Если красное поле правильно пустое, потому что реквизита нет на документе, не нужно подставлять выдуманное значение. Политика должна определять, допускается ли пустота, вводится ли служебный код или документ отправляется на уточнение.

Контроль качества после запуска

Качество модели оценивают не один раз при внедрении. Ежемесячно или после заметного изменения потока анализируют документы с ручными исправлениями. Полезно разделять причины: новый шаблон, плохой OCR, неверное сопоставление, противоречивое правило, отсутствующий справочник или ошибка пользователя.

Метрика доля зелёных показывает уровень автоматизации, но не точность сама по себе. Дополнительно нужны доля исправлений критических полей, число документов, возвращённых из процесса из-за индекса, и количество повторных запусков. Для таблиц считают строки, которые пришлось корректировать, а не только документы целиком.

Выборочную проверку проводят и для зелёных документов. Если контролировать только красные, уверенная систематическая ошибка останется незаметной. Выборка должна включать разных поставщиков и операторов. Результаты обсуждают с владельцем бизнес-процесса, а не только с техническим администратором.

Изменения, требующие повторной проверки

  • Поставщик обновил шаблон или систему выставления счетов.
  • Изменены названия, типы или обязательность полей архива.
  • Добавлен новый лоток либо другой диалог сохранения.
  • Обновлён справочник фильтра или интеграция с ERP.
  • Изменены параметры сканирования или источник почтовых вложений.
  • Включено автоматическое сохранение либо обработка таблиц.
  • К работе подключена новая группа операторов.

При значительном изменении сначала тестируют копию конфигурации или ограниченный лоток. Моментальная замена сопоставления в основном потоке может обесценить накопленные знания. Документируйте дату и причину изменения, чтобы связать возможное ухудшение с конкретным действием.

Подробно об элементах рабочего интерфейса

В верхней части Web Client пользователь переключается между лотками, поиском, списками и задачами, но Intelligent Indexing проявляется прежде всего в лотке и диалоге сохранения. На миниатюре видна цветная полоса, в меню Store — диалог со значком лампочки, а после открытия карточки — цветные индикаторы отдельных полей. Такое распределение элементов позволяет оценить состояние пачки до открытия документа и затем перейти к точечной проверке.

В лотке полезны два представления. Обычная сетка показывает больше миниатюр и помогает визуально распознавать поставщиков по бланку. Представление индексной карточки выводит предложенные значения рядом с документом. Второй режим удобнее, когда нужно быстро сравнить номера, даты и суммы нескольких файлов, а первый — когда важно увидеть структуру страницы или наличие лишних листов.

Раскрывающиеся варианты в полях

Для некоторых полей справа доступен список альтернатив. Он содержит менее вероятные результаты, найденные алгоритмами. Если правильное значение уже присутствует в списке, его выбор быстрее и безопаснее ручного набора. Однако для обучения расположению предпочтительнее One Click Indexing, особенно когда ошибка повторяется на одном шаблоне. Выбор альтернативы исправляет текущую карточку, а выделение дополнительно показывает источник.

Кнопка Reset в диалоге возвращает значения к исходному состоянию карточки. Её используют, когда оператор сделал несколько ошибочных переносов и проще начать проверку заново. Перед нажатием нужно понимать, какие ручные значения будут потеряны. После сброса снова выбирают поля по порядку и не сохраняют документ, пока критические строки не сверены.

Контекстное меню лотка

Контекстное меню открывается правой кнопкой по документу и содержит действия, доступные конкретной роли. Для Intelligent Indexing важны повторный анализ и просмотр индексных записей. Первая команда пригодна после обучения на нескольких примерах, вторая — для диагностики и поиска системного идентификатора. Если команды отсутствуют, проверяют контекст, права и то, находится ли файл именно в связанном лотке.

Выделение нескольких документов ускоряет повторную обработку, но применять действие ко всей очереди следует после проверки нескольких результатов. Если причина красного статуса — плохой скан или неправильный диалог, массовый повтор лишь создаст нагрузку и не изменит предложения. Сначала подтверждают гипотезу на одном или двух файлах.

Навигация по многостраничному документу

Панель Viewer показывает номер текущей страницы и позволяет переходить между листами. Подсвеченный источник индексного значения может находиться на другой странице, поэтому при сомнении оператор проходит по документу, а не предполагает, что все реквизиты взяты с первой. Для таблиц особенно важно проверить место перехода на новую страницу и повторяющийся заголовок.

Масштаб выбирают так, чтобы цифры читались без потери контекста. Слишком крупное увеличение скрывает подпись поля, а слишком мелкое делает незаметной ошибку в одной цифре. Удобный приём — сначала сверить значение при среднем масштабе, затем увеличить область только для спорного номера или суммы.

Единые правила для нескольких операторов

Самообучение собирает обратную связь от всех сотрудников, поэтому индивидуальные привычки быстро становятся общей моделью. До начала продуктивной работы организация должна определить владельца каждого спорного поля. Для счёта это может быть бухгалтерия, для договора — юридический отдел, для накладной — логистика. Администратор настраивает технику, но не должен единолично решать бизнес-смысл реквизита.

Краткая инструкция должна отвечать на конкретные вопросы: использовать сумму с налогом или без него, брать дату документа или дату получения, включать ли префикс в номер, как записывать название компании, что делать с пустым значением и когда создавать исключение. Формулировка заполнить правильно недостаточна, потому что разные сотрудники понимают её по-разному.

Разбор спорных документов

Для исключений полезно завести отдельную очередь или статус. Оператор не угадывает значение и не обучает модель сомнительному варианту, а передаёт документ владельцу процесса. После решения правильное значение переносится через One Click Indexing или вводится вручную, если его нет на странице. Причина исключения фиксируется, чтобы при повторении изменить правило или справочник.

Если два отдела сохраняют один тип документа в разные архивы, они должны согласовать общие реквизиты. Например, поставщик и номер счёта не должны иметь разные трактовки только из-за разных конечных процессов. При необходимости специфические данные добавляют отдельными настраиваемыми полями, не меняя смысл стандартных категорий.

Обучение новых сотрудников

Новому оператору сначала дают тестовые документы и показывают разницу между щелчком, выделением и клавиатурным вводом. Полезно намеренно создать ошибку и затем исправить её правильным способом. После тренировки проверяют не скорость, а последовательность: выбор нужного диалога, контроль цветов, выделение источника и завершение сохранения.

В первые дни действия нового сотрудника выборочно контролируют. Даже единичная привычка вводить все значения клавиатурой снижает пользу обучения, а перепутанные поля постепенно закрепляют неверную схему. Обратная связь должна быть быстрой, пока ошибка не распространилась на большую пачку.

Связь индексных данных с бизнес-процессом

Индексные поля становятся полезными, когда на них опираются поиск, списки и автоматические правила. Тип документа может выбрать маршрут, компания — определить ответственного, сумма — задать уровень согласования, а номер заказа — связать счёт с закупкой. Поэтому качество каждого поля оценивают по последствиям, а не только по удобству ввода.

Перед запуском процесса задают проверки. Номер документа не должен быть пустым, дата должна попадать в допустимый период, сумма — иметь разумный знак и диапазон, а поставщик — существовать в справочнике. Такие правила ловят уверенно распознанные, но неправильные значения. Intelligent Indexing предлагает данные; валидация решает, можно ли использовать их без участия человека.

Поиск дубликатов

Для счетов важна проверка дубликата по сочетанию поставщика, номера и даты или суммы. Если один и тот же файл пришёл по электронной почте и был отсканирован, оба экземпляра могут получить зелёные индексы. Без отдельного правила автоматизация сохранит их как два документа. Проверка выполняется до оплаты или другого необратимого действия.

Связь с заказом и поставкой

Извлечённый номер заказа можно использовать для поиска связанного заказа, а строки счёта — для сопоставления с поставкой. Если связь не найдена, документ переводится в исключение. Ошибка может быть в OCR, в исходном документе или в мастер-данных, поэтому процесс должен показывать оператору оба значения и позволять исправить индекс без изменения оригинала.

Экспорт и интеграция

Когда индексы передаются во внешнюю систему, заранее определяют формат дат, десятичный разделитель, кодировку и уникальные идентификаторы. Название компании удобно человеку, но для интеграции надёжнее код контрагента. Если код отсутствует на документе, его можно получить из справочника после нормализации названия, а не пытаться обучить систему выдумывать значение.

Изменение структуры внешней системы не должно автоматически менять обучение. Сначала обновляют преобразование или справочник, затем оценивают, требуется ли новое поле в архиве. Иначе техническая миграция может заставить операторов переучивать документные реквизиты, хотя их расположение и смысл не изменились.

Границы между типами документов

Модель сравнивает новые файлы с ранее обработанными похожими документами. Если два класса имеют почти одинаковый макет, но разные правила индексации, их следует чётко различать по типу документа или по лотку. Например, счёт и кредит-нота могут содержать те же поля, однако сумма и дальнейший маршрут трактуются по-разному.

Слишком широкая категория Финансовый документ смешивает счета, заказы, акты и уведомления. Слишком узкие категории для каждого незначительного варианта усложняют работу и дают мало примеров. Практичная граница определяется не дизайном, а набором полей и бизнес-действием: если документы сохраняются одинаково и требуют тех же проверок, их можно обучать вместе.

Поставщики с несколькими шаблонами

Один поставщик может отправлять разные бланки для товаров, услуг и филиалов. Система способна выучить несколько вариантов, если оператор последовательно подтверждает одни и те же смыслы. Когда в одном шаблоне номер заказа отсутствует, поле оставляют пустым или обрабатывают по утверждённому правилу; нельзя выбирать похожее число только ради заполнения.

Многоязычные документы

Стандартные категории работают с разными языками и культурными форматами, но язык типа документа и правила дат должны быть настроены осмысленно. Число 03/04 может означать разные даты. Если поток смешанный, лучше опираться на полный формат, локаль документа и контекст заголовка, а сомнительные значения направлять на проверку.

Названия компаний с диакритикой, сокращениями и разными алфавитами полезно нормализовать фильтрами только после согласования эталонного справочника. Автоматическое удаление национальных символов может создать совпадения между разными организациями. Для юридически значимых процессов сохраняют отображаемое название и отдельный уникальный код.

Регламент обслуживания модели

  • Еженедельно просматривать причины красных документов и новые шаблоны.
  • Ежемесячно проверять случайную выборку зелёных документов по критическим полям.
  • После изменения справочника тестировать нормализацию на похожих названиях.
  • Перед изменением сопоставления сохранять снимок текущей конфигурации.
  • Обучать новый шаблон на ограниченной пачке до массового повторного анализа.
  • Фиксировать дату, автора и причину каждого административного изменения.
  • Хранить тестовый набор документов для повторной приёмки после настройки.

Тестовый набор не должен состоять только из идеальных файлов. В него включают разные разрешения, многостраничные документы, пустые значения, длинные названия, несколько валют и изменённые шаблоны. При повторной проверке сравнивают не точное совпадение цвета, а корректность предложений и объём необходимых действий оператора.

Снимки конфигурации помогают понять, почему качество изменилось. На них должны быть видны поля диалога, категории Intelligent Indexing, типы и язык документа. Пароли, токены и персональные документы на снимок не помещают. Для поддержки достаточно структуры и примера проблемного результата.

Безопасное изменение поля

Если требуется заменить категорию одного поля, сначала создают план: какие документы будут тестовыми, как оператор отличит новый результат, сколько примеров нужно и как откатить настройку. После изменения не смешивают старый и новый диалог в одном лотке. Несколько дней контролируют все предложения этого поля, даже если они зелёные.

Полное переустройство карточки лучше выполнять как отдельный проект. Одновременное переименование, смена типов, добавление таблицы и изменение лотков лишает команду возможности установить причину ошибки. Изменения вводят поэтапно, после каждого этапа проводят тестовую пачку и фиксируют результат.

Ответы на практические вопросы

Можно ли использовать предложения без сохранения документа?

Предложения можно просмотреть в карточке, но обучение закрепляется при сохранении. Для теста, который должен повлиять на следующие документы, проведите полный цикл. Если тестовый файл нельзя хранить в рабочем архиве, используйте разрешённый тестовый архив с тем же сопоставлением.

Почему ручной ввод иногда необходим?

Значение может отсутствовать на странице: внутренний код проекта, статус или ответственный сотрудник. В этом случае выделять нечего, и ручной ввод корректен. Но он не обучает расположению, поэтому не стоит применять его к номеру или дате, которые реально напечатаны на документе.

Можно ли удалить неправильное обучение одним действием?

Обычная работа предполагает постепенное переобучение корректными примерами. Для отдельного поля администратор может сменить настраиваемую категорию и обучить её заново, что действует как мягкий сброс. Полное вмешательство в модель выполняют только с участием поддержки и после оценки последствий.

Что означает жёлтое поле в зелёном документе?

Общая отметка рассчитывается по набору полей, и в разных представлениях цвет может показываться с разной детализацией. В диалоге ориентируйтесь на цвет конкретной строки и проверяйте её. Общая миниатюра нужна для сортировки очереди, а не для объяснения каждого предложения.

Можно ли автоматически сохранить все зелёные файлы?

Технически процесс можно настроить на автоматизацию, но решение зависит от риска. Перед этим измерьте точность критических полей, добавьте проверки дубликатов и бизнес-правила. Для финансовых документов обычно оставляют контроль или маршрутизацию исключений.

Как распознать реквизит, который меняет место?

Стандартные алгоритмы не ограничены фиксированными координатами и учитывают контекст. Обучите несколько вариантов через One Click Indexing. Если реквизит находится в совершенно разных смысловых блоках, выделите типы документов или поставщиков отдельными сценариями, чтобы примеры не противоречили друг другу.

Поможет ли повышение разрешения старому размытому файлу?

Простое программное увеличение пикселей не возвращает потерянные детали. Лучше получить исходный цифровой PDF или повторно отсканировать бумагу. Повышенное разрешение полезно только при новом захвате, когда камера или сканер действительно фиксирует больше информации.

Редактирует ли инструмент PDF?

Нет. Он считывает сведения и заполняет индексные поля. Удаление страниц, исправление текста, объединение файлов, подпись и конвертация выполняются другими средствами. Не смешивайте исправление метаданных с изменением юридически значимого оригинала.

Можно ли использовать одну модель для нескольких архивов?

Похожие документы могут обрабатываться в разных архивах, но сопоставление общих реквизитов должно быть согласованным. Если один и тот же шаблон учит разные категории или смысловые значения, качество снижается. Проектируйте поля на уровне организации, а затем отражайте их в диалогах.

Что делать с новым документом, который система не классифицирует?

Выберите правильный диалог, заполните тип документа и остальные поля через выделение и сохраните несколько примеров. Если класс слишком свободный или встречается редко, возможно, выгоднее оставить ручную индексацию либо применить более специализированную модель классификации.

Итоговый рабочий подход

DocuWare Intelligent Indexing даёт наибольший эффект не как кнопка мгновенного OCR, а как дисциплинированный цикл: правильно настроенные поля, качественный входной документ, цветовая очередь, исправление через One Click Indexing и сохранение обратной связи. Каждый элемент важен. Хороший скан не компенсирует неверную категорию, а правильная категория не исправит противоречивые решения сотрудников.

Начинайте с одного понятного потока и нескольких поставщиков, измеряйте ошибки по критическим реквизитам и расширяйте автоматизацию после устойчивых результатов. При изменении макета возвращайтесь к обучению, при массовых красных отметках используйте повторную индексацию только после новых примеров, а при системной ошибке собирайте идентификаторы и сопоставление для диагностики.

В ежедневной работе оператор должен видеть документ и карточку как единое целое: предложение проверяется по подсвеченному фрагменту, исправление берётся с самой страницы, а цвет определяет приоритет, но не отменяет здравый смысл. Такой порядок превращает накопленные исправления в повторяемую автоматизацию и сохраняет качество индексных данных, от которых зависят поиск, архив и последующие процессы.