Xtracta помогает принимать счета, накладные, заказы, банковские выписки, договоры и другие деловые документы, распознавать их содержимое, извлекать нужные поля и строки таблиц, проверять суммы и формат значений, а затем передавать структурированные данные в учётную или отраслевую систему. Основные инструменты работы — очереди документов, экран Engine Learning Screen для проверки и обучения, правила преобразования и валидации, сопоставление со справочниками, разделение многостраничных файлов и настраиваемые способы вывода результатов.
Работа строится вокруг workflow: для каждого потока задаются тип документов, поля, способ распознавания, правила контроля и конечное направление данных. На домашней странице видны доступные процессы и количество материалов в очередях Indexing, Quality Assurance, Rejected, Processing и Output Queue. Оператор быстро понимает, где документ ожидает проверки, где остановлен ошибкой, а где уже готов к передаче дальше.
При открытии документа экран обработки показывает оригинал и извлечённые значения рядом. Пользователь выбирает фрагмент на странице, исправляет поле, добавляет или удаляет строки, проверяет подсветку, после чего сохраняет результат, отправляет его на обучение, в контроль качества, в другую очередь или сразу на выход. Такой рабочий порядок особенно полезен там, где поставщики присылают файлы с разной версткой и одинаковые реквизиты находятся в разных местах.
Открыть Xtracta
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Только английский интерфейс
- Нужна настройка workflow
- Веб-загрузка до 100 МБ
Как устроен путь документа
Документ проходит последовательную цепочку, а не просто распознаётся одним нажатием. Сначала система создаёт рабочий PDF и миниатюры страниц, затем при необходимости выполняет автоматическое разделение пакета. После OCR определяется класс и дизайн, извлекаются значения, применяются правила очистки, форматирования, расчётов и сопоставления. Только после этих операций срабатывают проверки обязательности, формата, арифметики и внешних справочников. Итоговый маршрут зависит от результата: корректный документ отправляется в Indexing, Quality Assurance либо сразу на выход, а документ с нарушенными правилами попадает в Rejected.
Такой порядок важен при диагностике. Если номер счёта распознан верно, но после обработки исчез первый символ, искать причину нужно не в OCR, а в Strip and Replace. Если дата читается как текст, но превращается в неверный день, проверяют Auto Format и выбранный формат даты. Если все поля заполнены, однако документ остаётся отклонённым, просматривают индивидуальные и расширенные валидации. Разделение этапов позволяет не переобучать модель там, где ошибка возникла позже.
Для стабильного запуска полезно заранее описать ожидаемый результат. Нужно определить, какие поля обязательны, какие значения берутся с документа, какие подтягиваются из базы, как обрабатываются пустые строки и что считается допустимым расхождением итогов. Чем точнее схема workflow соответствует реальному процессу, тем меньше документов будет без необходимости задерживаться в ручных очередях.
Домашняя страница и выбор рабочего потока
После входа пользователь видит таблицу назначенных workflow. Каждая строка соответствует отдельному процессу, например счетам поставщиков, банковским выпискам или заказам. В колонках отображаются идентификатор и название потока, активные пользователи, производственный статус, количество документов в основных очередях, имя группы и сведения о плане. По этой таблице удобно замечать накопление материалов ещё до открытия конкретной очереди.
Счётчики Indexing, QA, Reject, Processing и Output Queue показывают разные стадии. Большое значение Processing означает, что документы ещё проходят OCR, извлечение и преобразования. Рост Reject указывает на срабатывание правил либо проблемы входных файлов. Накопление Output Queue обычно связано с конечным каналом передачи. Поэтому одинаковое число ожидающих документов требует разных действий в зависимости от колонки.
Автообновление таблицы полезно оператору, который следит за поступлением в течение дня. Режим остановленного обновления лучше подходит для сверки: строки не меняются во время просмотра, и можно зафиксировать состояние очередей. После выбора workflow открывается его Dashboard с документами, фильтрами и доступными действиями.

Dashboard и назначение очередей
Dashboard является основной точкой управления документами внутри выбранного процесса. Верхние вкладки разделяют материалы по назначению, а таблица показывает идентификатор, число страниц, состояние, очередь, время получения, последнюю активность и поля, которые администратор вывел в колонки. Набор столбцов можно менять, поэтому в счётах рядом с техническими данными часто отображают номер документа, поставщика, налог и итоговую сумму.
Overview даёт общий срез и помогает увидеть документы, прошедшие начальную обработку. Indexing предназначен для проверки извлечённых значений. Quality Assurance используется для дополнительного контроля, когда требуется второе мнение либо отдельная роль проверяющего. Rejected хранит материалы, не прошедшие валидацию, с указанием причины. History показывает уже обработанные записи и позволяет снова открыть данные. Recycle Bin содержит удалённые документы, которые администратор может вернуть в исходную очередь.
My Files отличается от остальных вкладок блокировкой. Документ, отправленный туда из Engine Learning Screen, закрепляется за конкретным пользователем. Другие операторы видят состояние Suspended и не могут открыть запись, пока владелец или администратор её не освободит. Для этой очереди можно задать предельное время хранения; без ограничения документ останется закреплённым бессрочно, что иногда становится причиной незаметной задержки.

Просмотр общей и индексной очереди
В Overview удобно начинать разбор неоднородной пачки. Значок глаза открывает документ, фильтр сужает список, а команда Process next ready document берёт следующую готовую запись без ручного выбора. Если процесс настроен на немедленный Output, успешно обработанные документы могут не появляться в общей очереди: там останутся только исключения и записи, для которых предусмотрена ручная стадия.
Indexing следует использовать в период первоначального обучения и после заметных изменений документов. Здесь оператор открывает запись, сверяет значения с оригиналом и завершает её подходящим действием. Пока документ не выведен, не переназначен или не перемещён в другую очередь, он продолжает отображаться в Indexing. Поэтому сохранение без выхода полезно для паузы, но не считается окончанием обработки.
Фильтры и пользовательские колонки стоит настраивать под причину проверки. Для счетов полезны поставщик, номер, дата, налог и итог; для выписок — банк, номер счёта и период; для договоров — стороны и контрольные даты. Чем больше технических полей выведено без необходимости, тем сложнее оператору заметить бизнес-ошибку.

Очереди Indexing, Rejected и Recycle Bin
Записи в Indexing обычно имеют состояние Ready: OCR и извлечение завершены, поэтому документ можно открыть в ELS. Если строка долго остаётся в Processing, повторное нажатие не ускорит работу. Следует проверить размер файла, число страниц, количество строк и состояние входного плана. Для крупных таблиц загрузка интерфейса занимает больше времени, чем извлечение нескольких реквизитов.
Rejected показывает не только факт отказа, но и текст причины. Это может быть повреждённый входной файл, сбой отправки результата, отсутствие обязательного значения, неверный формат, несходящаяся арифметика или отрицательный результат проверки базы. Исправлять нужно именно причину, а не все поля подряд. После корректировки документ можно вывести либо направить в другую очередь, если требуется дополнительный контроль.
Удаление переносит запись в Recycle Bin. В этой вкладке администратор восстанавливает документ в прежнее место, но обычного безвозвратного удаления из интерфейса нет. Такой подход снижает риск потери при ошибочном действии, однако правила хранения исходных PDF и созданных изображений всё равно нужно учитывать отдельно.

Разбор отклонённых документов
Перед открытием отклонённой записи прочитайте колонку Reason(s). Если указано обязательное поле, откройте ELS и найдите красную или ошибочную область. Если причина связана с выводом, сами извлечённые данные могут быть корректны; тогда проверяют адрес SFTP, параметры OAuth, права доступа к S3 либо конечную систему. Повторное обучение поля не исправит недоступный канал.
Документ может быть отклонён несколькими правилами одновременно. Удобнее устранять их сверху вниз: сначала восстановить исходные значения, затем проверить преобразования, после этого арифметику и сопоставление. При массовом появлении одинаковой причины анализируют workflow, а не исправляют сотни документов вручную. Единичная ошибка чаще связана с конкретным макетом или качеством изображения.
Мягкую проверку можно временно проигнорировать в ELS, когда бизнес-процесс допускает исключение. Жёсткое правило требует исправления. Использовать обход систематически не стоит: если почти каждый документ нуждается в игнорировании, условие или порог настроены неверно.

История и восстановление
History служит не складом изображений, а рабочим представлением обработанных данных. Из неё можно снова открыть ELS, проверить захваченные значения и проследить результат. File Tracking дополняет картину: там отражается активность от момента поступления до последнего действия и пользователь, выполнивший операцию. Для документов, обработанных через API, в качестве пользователя отображается System.
При расследовании расхождения сначала фиксируют Document ID. Этот идентификатор связывает очередь, историю, журналы интеграции и запросы API. Если файл был разделён, каждая созданная часть получает собственный ID, поэтому исходный номер пакета и номера дочерних документов нужно хранить вместе.
Восстановление из Recycle Bin возвращает запись к работе, но не отменяет уже отправленные данные во внешнюю систему. Перед повторным выводом убедитесь, что приёмник умеет распознавать дубликаты или что документ не был проведён ранее.

Способы поступления документов
В один workflow документы можно направлять несколькими каналами: перетаскиванием с компьютера, на выделенный адрес электронной почты, по FTP или SFTP, через API и мобильную отправку. Канал выбирают не по удобству администратора, а по способу поступления. Поставщикам проще писать на адрес процесса, сканирующей службе подходит защищённая передача пачек, а бизнес-приложение обычно использует API.
Веб-загрузчик удобен для проверки и небольших партий. Пользователь выбирает Upload Documents, затем Upload from computer и переносит файлы в окно. Ограничение размера отдельного файла для этого способа составляет 100 МБ, а максимальный POST — 110 МБ. Электронная почта принимает файл до 127,98 МБ, FTP — до 200 МБ. Эти пределы нужно учитывать до отправки, иначе документ не дойдёт до стадии OCR.
Почтовый вход требует контроля вложений и подписей. Картинка в футере письма, превышающая 50 пикселей по высоте или ширине, может быть воспринята как вложение и обработана отдельно. Чтобы не получать логотипы и баннеры как документы, лучше использовать чистый адрес для пересылки файлов либо заранее фильтровать письма.
- Веб-загрузчик — ручные тесты и разовые документы.
- Электронная почта — регулярные вложения от контрагентов.
- FTP или SFTP — массовые каталоги и пакетная передача.
- API — управляемая интеграция с приложением.
- Мобильная отправка — фотографии и полевые документы.
Подготовка файлов перед отправкой
Xtracta принимает изображения GIF, HEIC, JPG, JPE, JPEG, PNG, TIF и TIFF, а также DOC, DOCX, ODS, ODT, PDF, XLS и XLSX. Наличие расширения в списке не гарантирует одинакового качества распознавания. Для деловых документов предпочтительнее исходный цифровой PDF или чёткий TIFF; фотографию следует снимать без перспективного наклона, бликов и обрезанных краёв.
Парольная защита делает документ ошибочным: система не может открыть его для OCR. Перед загрузкой снимите пароль разрешённым способом либо запросите незашифрованную копию. Не следует печатать защищённый файл в низком разрешении только ради обхода защиты — мелкий текст и таблицы после этого распознаются хуже.
У многостраничных пакетов проверьте порядок страниц. Если в одном PDF соединены несколько счетов, используйте автоматическое или ручное разделение. Если один счёт разорван на несколько файлов, сначала объедините его до отправки либо переназначьте страницы после загрузки. Правильная граница документа влияет на классификацию, суммы и количество учтённых документов.
Engine Learning Screen: рабочее пространство оператора
New ELS объединяет просмотр страниц, поля шапки, повторяющиеся наборы и действия над документом. В центре находится оригинал документа, слева — миниатюры страниц, справа — Data Extraction и Document Information, снизу — таблица строк. Панели можно разворачивать, выносить в плавающее окно и менять размер, поэтому на широком мониторе документ и поля остаются видимыми одновременно.
Верхняя панель содержит выход, идентификатор документа и команды удаления, переназначения, отправки в My Files, QA или Rejected, пропуска, сохранения, Save and Learn и Output. Меню позволяет закрепить кнопки, изменить расположение окна сравнения, посмотреть или переназначить сочетания клавиш и открыть классический экран. Перед действием нужно понимать его последствия: Save сохраняет изменения без обучения, Save and Learn передаёт значения для обучения, Output запускает настроенные выходы.
Document Information показывает класс, дизайн, способ OCR, число страниц и ревизию. Эти сведения помогают отделить ошибку модели от ошибки данных. Если неожиданно выбран другой класс, исправление отдельных полей даст временный эффект; сначала нужно разобраться с классификацией.

Поля шапки и ручная коррекция
Обычные поля используются для значений, которые встречаются один раз: поставщик, номер счёта, дата, валюта, итог, адрес или номер заказа. Значение может появиться из распознавания, обучения, преобразования, сопоставления с базой, значения по умолчанию или ручного ввода. В ELS виден итог после всех применённых этапов, поэтому при непонятной замене полезно временно отключить Auto Format, Data Matching или Strip and Replace для конкретного поля.
Для коррекции выберите поле и выделите соответствующую область на документе. Ручное выделение отображается синим, результат автоматического извлечения — зелёным. После выбора фрагмента проверьте пробелы, знаки валюты и разделители. Если поле должно содержать только число, очистку лучше поручить правилу, а не обучать модель на обрезанном фрагменте каждый раз.
Фильтры Error, Trained и Most Common сокращают список. Error показывает значения, требующие внимания; Trained — поля, заполненные обученной моделью; Most Common — часто вводимые пользователями варианты. Clear All Fields удаляет текущие значения, Reload Prefilled Data возвращает предварительно заданные данные. Блокировка поля позволяет переносить одно и то же значение в будущие документы, пока её не снимут; этот инструмент подходит для постоянного подразделения, но опасен для меняющихся реквизитов.
Повторяющиеся наборы и строки таблиц
Repeating Field Set предназначен для строк счёта, транзакций выписки и других повторяющихся структур. Колонки ведут себя как таблица: можно добавлять и удалять строки, дублировать строку, вставлять её выше или ниже, очищать весь столбец, копировать значение вниз, менять местами данные двух колонок и переносить значения в другую колонку. Это быстрее, чем повторно выделять каждое поле после ошибки схемы.
При проверке строк двигайтесь слева направо по устойчивой логике: код, описание, количество, единица, цена, скидка, налог, итог. Если описание переносится на две строки, убедитесь, что модель не создала лишний товар. Если один визуальный ряд содержит несколько цен, проверьте, какая колонка соответствует цене за единицу, а какая сумме строки. Ошибка в одной колонке часто приводит к арифметическому отклонению всего документа.
Для большого количества строк полезны цветовые настройки колонок. В New ELS оператор может выбрать отдельный цвет подсветки или случайное распределение. Цвет сохраняется для пользователя и помогает визуально отличать код от количества и суммы. Это не влияет на распознавание, но снижает риск выделить значение не в ту колонку.
Learn & Extract для однотипных строк
Learn & Extract ускоряет обработку таблиц с устойчивой структурой. Сначала добавьте строку и вручную свяжите её значения с соответствующими колонками. После обучения хотя бы одной строки команда пытается извлечь остальные строки по тому же рисунку. Для сложных таблиц лучше показать две или больше строк, особенно если встречаются переносы описания, пустые ячейки или разные форматы количества.
Функция предполагает повторяемый шаблон внутри конкретной таблицы. Если каждая строка оформлена по-разному, есть вложенные подстроки или несколько уровней итогов, результат нужно тщательно проверить. Learn & Extract не заменяет контроль: после заполнения сравните число строк, начало и конец таблицы, суммы и положение подсветки.
Само нажатие команды не запускает долговременное обучение. Значения попадут в обучающий процесс после Output либо Save and Learn, в зависимости от конфигурации. Обычный Save полезен для сохранения промежуточной разметки, но не должен использоваться как финальный шаг, если цель — улучшить будущие документы.
Действия Save, Save and Learn, Output и Skip
Save сохраняет текущие правки и возвращает документ в прежнюю очередь. Он подходит для длинного файла, который нужно продолжить позже, или для проверки коллегой. Обучение при этом не запускается. Save and Learn сохраняет значения и передаёт их в обучение, после чего документ закрывается. Output завершает обработку, выполняет настроенные выходы и также может отправить значения на обучение.
Skip пропускает документ без завершения. Несохранённые изменения теряются, если в workflow не включено автоматическое сохранение. Поэтому перед пропуском убедитесь, что исправления не нужны. Exit and Unlock сравним с отменой: запись освобождается и возвращается в прежнее состояние.
Send to QA используют, когда документ заполнен, но требуется независимая проверка. Reject Document перемещает запись в отклонённые и требует причину. Reassign отправляет документ в другой workflow, но пользователь должен иметь доступ к исходному и целевому процессу. My Files оставляет запись за текущим оператором.
Разделение, перестановка и удаление страниц
Document Preview показывает миниатюры страниц и позволяет работать с многостраничным файлом. В ручном сценарии уменьшите страницы до миниатюр, наведите указатель на границу между ними и выберите Split Document. После подтверждения каждая часть получает отдельную запись, а первая остаётся открытой для извлечения. Повторяйте разделение только в местах, где действительно начинается новый документ.
Автоматическое разделение задаётся в Workflow Designer через Document Creation Method и вариант Detect automatically. Оно подходит для потоков, где в одном пакете регулярно находятся несколько документов. Перед включением протестируйте смешанные примеры: чистые разрывы, пустые страницы, приложения и документы без явного заголовка. Ошибочное разделение создаёт дополнительные Document ID и может расходовать лимит плана.
Если страницы попали не туда, используйте Reassign Pages на Dashboard. Введите исходный Document ID, номера страниц и целевой тип. Страницы можно перенести в новый документ или вернуть к существующему. Удаление отдельной страницы в ELS следует применять только к действительно лишнему листу; после удаления проверьте нумерацию и итоговые суммы.

Классы, дизайны и обучение на примерах
Классификация определяет, к какой группе относится документ, а дизайн описывает похожее визуальное расположение внутри класса. Система может использовать первичный классификатор по признакам вроде адресов, телефонов и других устойчивых элементов, строковый классификатор по выбранному полю, фиксированный класс, режим игнорирования класса для особых моделей или значение, переданное через API.
Строковый классификатор начинает объединять документы после нескольких обученных примеров с одинаковым значением. Для нового поставщика полезно обработать серию репрезентативных счетов, а не пять копий одного файла. В набор должны попасть разные номера, даты, суммы и длины таблиц, иначе модель запомнит случайные особенности.
После классификации похожие макеты получают дизайн. Если поставщик изменил форму счёта, документ может создать новый дизайн или попасть в неверный. В такой ситуации обучайте поля на новом макете и проверьте, что старые документы не используются как ложные примеры. Field Learning History показывает, какие прошлые выделения влияли на поле, а Data History хранит изменения текущего документа с пользователем, временем и ревизией.
Порядок преобразований и почему он важен
После извлечения Xtracta применяет Strip and Replace в порядке отображения полей и в порядке правил внутри поля. Затем выполняются Auto Format, расчёты дат, объединение полей, Data Matching, математические расчёты и проверки. Поскольку каждый этап получает результат предыдущего, два правильных правила могут вместе дать неправильное значение.
Пример: OCR вернул $ 1,234.50. Strip and Replace удалил знак валюты, Auto Format преобразовал разделители, после чего математическая проверка сравнила число с итогом. Если сначала заменить запятую точкой без учёта локали, получится неоднозначная строка. Поэтому тестируйте правила на значениях с тысячными разделителями, отрицательными суммами, скобками и пустыми полями.
Data Matching выполняется циклически, пока изменения продолжаются. Это позволяет сначала найти поставщика по налоговому номеру, затем подставить его внутренний код и использовать код в следующем сопоставлении. Одновременно возрастает риск петли или неожиданных замен. Каждое правило должно иметь чёткое условие и не возвращать поле к предыдущему состоянию.
Очистка и автоматическое форматирование
Strip and Replace удаляет или заменяет символы и фрагменты: валютные знаки, служебные пробелы, префиксы, скобки, дефисы и устойчивые подписи. Правило должно очищать значение, а не компенсировать плохое выделение. Если модель захватывает заголовок вместе с номером, сначала стоит переобучить область, а затем добавить минимальную очистку для допустимых вариантов.
Auto Format приводит суммы, даты, время и регистр к заданному виду. Формат даты workflow должен соответствовать входным документам: день и месяц легко перепутать в значениях до двенадцати. Для международного потока лучше разделить документы по региону или использовать явные признаки, чем применять один формат ко всем.
Объединение полей полезно для составных адресов, имён и кодов. Перед слиянием определите разделитель и поведение при пустой части. Два пробела или лишняя запятая после пустого поля затем мешают сопоставлению с базой. Проверяйте не только вид в ELS, но и фактическую строку в выходном CSV или API.
Data Matching и внешние справочники
Сопоставление сравнивает извлечённые значения с базами поставщиков, кодов товаров, заказов и других справочников. Оно может подтвердить существование записи, вернуть внутренний идентификатор или заменить распознанный вариант нормализованным. Для счетов часто используют налоговый номер, номер аккаунта поставщика и номер заказа; для строк — код поставщика и внутренний код товара.
Качество зависит от справочника. Дубликаты поставщиков, устаревшие номера и разные варианты пробелов создают неоднозначность. Перед подключением очистите ключевые поля, определите приоритет совпадений и задайте поведение, когда найдено несколько строк. Молчаливый выбор первого совпадения опаснее, чем отправка документа в QA.
В ELS Data Matching можно временно отключить для выбранного поля. Это помогает увидеть исходное распознанное значение и понять, где возникла ошибка. После диагностики верните правило; постоянная ручная замена скрывает проблему и не улучшает поток.
Проверки формата, обязательности и арифметики
Индивидуальные валидации выполняются по полям в порядке их отображения. Они проверяют обязательность, допустимый формат и другие ограничения. Расширенные проверки используются для арифметики и запросов к базе. Если правило обязательности срабатывает раньше сопоставления, поле должно быть заполнено до этого этапа; фактический порядок обработки нужно учитывать при проектировании.
Математическая проверка счета обычно сопоставляет нетто, налог и итог, а также суммы строк. Не закладывайте абсолютное равенство для валют с округлением: определите допустимый предел. Отдельно обработайте кредит-ноты, отрицательные количества, налог включённый в цену и документы с несколькими ставками.
Soft validation позволяет оператору завершить документ с осознанным исключением. Это удобно для небольшого расхождения округления, но причина должна быть видна в учётном процессе. Hard validation блокирует выход до исправления. Разделяйте критические нарушения, например отсутствующий номер счёта, и предупреждения, например необязательный адрес.
Выбор OCR и работа с языками
Для workflow доступны Nuance, Nuance Rasterized, Tesseract, Microsoft Azure и Google Vision. Nuance предпочтителен для цифровых PDF, Rasterized — для сканов. Tesseract помогает при отдельных проблемах шрифта и специальных символов. Azure и Google Vision могут дать лучшие результаты на сложных изображениях; Azure чаще выбирают для рукописного текста, хотя гарантированная поддержка рукописи ограничена качеством исходника.
Nuance и Tesseract обрабатываются внутри инфраструктуры Xtracta, а при выборе Azure или Google Vision документ передаётся соответствующему поставщику OCR. Для конфиденциальных материалов этот факт нужно согласовать с политикой данных. Нельзя менять движок только ради одного неудачного файла без тестирования: другие координаты и идентификаторы слов могут потребовать повторного обучения.
Список языков зависит от движка. Русский поддерживается Nuance, Google Vision и Microsoft Azure. Google и Azure также охватывают арабский, китайский, японский, корейский, иврит, хинди, тайский, вьетнамский и многие другие языки. Интерфейс при этом остаётся английским. Для смешанного документа выбирайте OCR по реальному набору письменностей и проверяйте даты, десятичные разделители и латинские коды отдельно.
Повторное OCR и исправление качества
Если текст читается неверно, сначала определите причину: низкое разрешение, наклон, сжатие, необычный шрифт, фон или неправильный движок. Повторное OCR на том же плохом изображении редко решает проблему. Лучше загрузить исходный PDF, пересканировать страницу или исправить ориентацию.
Для отдельных документов можно выбрать повторное распознавание, а для устойчивой проблемы — OCR Override или смену движка workflow с участием поддержки. После смены сравните не только текст, но и извлечение полей: модель опирается на расположение и идентификаторы слов, поэтому старые примеры могут перестать работать так же.
При фотографировании сохраняйте весь лист, избегайте теней на сгибе, располагайте камеру параллельно и обеспечьте контраст. Для мелких таблиц важнее разрешение, чем красивое сжатие. HEIC поддерживается, но при нестабильной интеграции разумно нормализовать фотографии в JPEG или PDF до отправки.
Ограничения размеров и сложных документов
Пределы входного файла зависят от канала: 100 МБ через API или веб-загрузчик, 127,98 МБ по электронной почте и 200 МБ по FTP. На Dashboard отдельной ошибкой считаются документы шире или выше 1700 мм, а также JPEG с непропорциональными размерами, когда ширина не менее 400 пикселей, а высота превышает её более чем в 5,66 раза.
Документы свыше 300 страниц попадают в Error Documents, хотя для некоторых случаев доступен Force Reprocess. Перед принудительной обработкой лучше настроить Limit Processed Pages: можно взять первые N и последние N страниц. Это подходит для пакетов, где полезные реквизиты находятся в начале и конце, но не подходит для таблицы, продолжающейся через весь файл.
Фиксированного предела строк нет, однако каждая строка умножается на число полей и правил. Если в строке шесть колонок, десять строк создают шестьдесят значений, каждое из которых может проходить преобразования и проверки. Большие документы медленнее открываются, особенно в Classic ELS. New ELS лучше загружает сложные таблицы, но архитектуру workflow всё равно следует упрощать.
Error Documents и Force Reprocess
В Error Documents автоматически попадают защищённые паролем файлы, документы с чрезмерным размером страницы, некоторые непропорциональные JPEG и записи, которые не удаётся обработать. Оператор может подтвердить ознакомление через Acknowledge, чтобы убрать запись из активного счётчика. Это не исправляет файл и не запускает его заново.
Force Reprocess доступен не для всех ошибок. Его можно использовать для корректного документа, превысившего ограничение страниц, но обработка займёт больше времени и может снова остановиться. Для парольной защиты и превышения физических размеров принудительная команда не поможет: входной файл нужно исправить до повторной загрузки.
При массовом появлении Error Documents сохраните примеры и сравните метаданные. Одинаковая ширина, высота или канал поступления указывает на проблему сканера либо генератора PDF. Разные случайные ошибки чаще требуют анализа канала передачи и целостности файлов.
Вывод данных и подключение бизнес-систем
После успешной обработки данные можно получать через webhook и REST API, а также направлять в CSV, XLS, SQL, электронную почту, загрузку, SFTP, OAuth или S3 в зависимости от конфигурации. Конечный формат выбирают по потребителю. CSV подходит для простой таблицы, XLS — для ручной сверки, SQL — для управляемой загрузки, API — для приложения, которому нужны статусы и вложенные структуры.
Перед запуском согласуйте имена полей, типы значений, кодировку, часовой пояс и формат дат. Сумма должна передаваться числом, а не строкой с валютным знаком; идентификатор с ведущими нулями нельзя автоматически превращать в число; пустое значение нужно отличать от нуля. Эти решения влияют на учёт сильнее, чем внешний вид ELS.
Двусторонняя интеграция позволяет не только забрать результат, но и передать справочники или параметры классификации. Для надёжности храните Document ID, статус, время и ответ приёмника. Повторная отправка должна быть идемпотентной: один и тот же счёт не должен создавать две проводки после сетевого сбоя.
API, ключи и автоматизация
Ключ пользователя или группы используется для аутентификации запросов. Он даёт доступ к чувствительным действиям, включая просмотр, изменение и удаление документов, баз и планов, поэтому его нельзя пересылать в открытом письме, чате или включать в клиентский код. Храните ключ в защищённом хранилище секретов и заменяйте при подозрении на утечку.
Через API приложение загружает документы, отслеживает обработку, получает данные и управляет сущностями. Для асинхронного потока загрузка должна возвращать внутренний идентификатор, а последующие шаги — опрашивать статус или принимать webhook. Не пытайтесь скачать результат сразу после отправки крупного файла: OCR и правила ещё не завершены.
Ссылки на PDF и изображения не следует считать постоянными. В первые дни они сохраняются, затем могут измениться при перемещении хранения. Перед просмотром через API запрашивайте свежий адрес документа. Для долговременного хранения сохраняйте разрешённую копию в собственной системе согласно политике хранения.
Учётная запись, группы и права
В My Account пользователь меняет имя, адрес электронной почты, компанию, телефон и пароль. Пароль должен содержать не менее восьми символов, хотя корпоративная политика может требовать большего. Preferences задаёт язык интерфейса, локаль, отображение даты и времени и переход по полям клавишей Tab. Сейчас пользовательский интерфейс поддерживает английский язык.
Assigned Groups показывает группы и основной контекст пользователя. Assigned Workflows перечисляет процессы и разрешения: администрирование, доступ к Indexing и QA, отклонение, обучение, загрузка, просмотр адресов входа, скачивание, история, отслеживание, переназначение страниц и документов. Выдавайте только необходимые действия; оператору проверки не всегда нужны настройки workflow и базы.
Разделение ролей полезно для контроля. Один пользователь может исправлять значения в Indexing, другой подтверждать QA, а администратор — изменять правила и восстанавливать удалённые записи. Такой процесс снижает риск, что один человек одновременно настроит проверку, обойдёт её и отправит результат.

Настройки отображения и навигации
В Preferences выбирается локаль и формат даты-времени для File Tracking, Received Time и Last Activity. Если команда работает в разных часовых поясах, включение времени браузера делает журналы удобнее человеку, но усложняет совместное расследование. Для аудита лучше договориться о едином формате и всегда указывать часовой пояс в внешних логах.
Scroll on Tab Press переводит фокус между полями ELS и прокручивает интерфейс к следующему значению. Это ускоряет последовательную проверку, особенно при длинной панели. Перед массовой работой настройте сочетания клавиш и положение Comparison Box так, чтобы оператор меньше переключался между мышью и клавиатурой.
Пользовательские настройки не меняют данные workflow, поэтому разные операторы могут выбрать удобное отображение. Однако инструкция команды должна описывать одинаковые действия независимо от расположения панелей, иначе скриншоты и шаги быстро перестанут совпадать.

Назначение групп и workflow
Вкладка Assigned Groups показывает идентификатор, имя группы и роль. Primary Group определяет основной контекст при наличии нескольких групп. Super Admin имеет широкие права, поэтому такую роль оставляют ограниченному числу сотрудников. Обычный пользователь должен видеть только те группы, чьи документы он действительно обрабатывает.
Assigned Workflows отображает разрешения по каждому процессу. Для счётов и выписок набор может различаться: сотруднику бухгалтерии разрешают Indexing и History, контролёру — Quality Assurance, специалисту интеграции — Download и File Tracking, а администратору — Workflow Admin и Train Extraction Models. Проверяйте права после перехода сотрудника в другую команду.
Если кнопка отсутствует, сначала смотрят разрешения, а не состояние браузера. Для Reassign пользователь должен состоять в исходном и целевом workflow. Для восстановления из Recycle Bin нужны административные полномочия. Для просмотра адреса электронной почты или FTP существует отдельное разрешение.

Безопасность входа и двухфакторная проверка
После ввода адреса и пароля при включённой двухфакторной защите появляется поле шестизначного кода из приложения-аутентификатора. Код обновляется каждые тридцать секунд. Администратор может требовать 2FA для всей группы, что особенно важно для пользователей с доступом к документам и API.
После успешной проверки можно доверить устройство на тридцать дней. Не используйте эту возможность на общем компьютере. Вариант Skip не сохраняет доверие, Do Not Trust помечает устройство как рискованное, Trust временно отключает повторный запрос кода на этом устройстве. При потере аутентификатора восстановление выполняется через зарегистрированную почту или администратором по утверждённой процедуре.
Мобильное приложение может входить по QR-коду из профиля; код истекает через шестьдесят секунд. QR, API-ключи и экран профиля нельзя публиковать в инструкциях с реальными данными. Для учебных материалов используйте обезличенный аккаунт.

Вход и требования к браузеру
Для работы подходят свежие выпуски Google Chrome, Mozilla Firefox, Apple Safari и Microsoft Edge. Обновление браузера важно не только для безопасности: ELS использует сложные панели, масштабирование документа и динамические таблицы. Старый движок может неправильно отрисовать кнопки или потерять фокус при переходе между полями.
Если страница входа зацикливается или после авторизации снова просит пароль, очистите данные сайта для домена, проверьте запрет сторонних cookies по корпоративной политике и повторите вход в поддерживаемом браузере. При проблеме только у одного пользователя сравните расширения и сетевые правила. При проблеме у всей команды проверьте доступность конечной точки и статус удостоверяющего провайдера.
Не храните пароль в общедоступном профиле браузера. Для операторского места используйте отдельную учётную запись системы и блокировку экрана. Если ELS открывает конфиденциальные документы, запретите автоматическую синхронизацию снимков экрана и загрузок в личное облако.

Хранение документов и аудит
Значения полей сохраняются долговременно. Созданные PDF и JPG обычно удаляются через девяносто дней, если документ не находится в Learning, а миниатюры — через шесть месяцев, если нет истории обучения поля. Политику можно настроить отдельно, а в некоторых конфигурациях применяются требования GDPR или собственные правила размещения.
Для API нельзя полагаться на однажды сохранённый адрес файла: при перемещении между хранилищами ссылка меняется. Получайте свежую ссылку через API или открывайте документ из Dashboard и File Tracking. Если оригинал должен храниться годы, его нужно сохранить в системе учёта до истечения срока.
Field History и File Tracking решают разные задачи. Первая показывает обучение и изменения конкретного поля, вторая — движение документа и действия пользователей. Для расследования используйте обе: история поля объясняет, почему значение стало таким, а отслеживание — кто и когда отправил документ дальше.
Практика обработки счетов
Для счетов обычно создают поля поставщика, адреса, номера и даты, срока оплаты, номера заказа, валюты, нетто, налога, итога и строки товаров. В Repeating Field Set добавляют код, описание, количество, единицу, цену, скидку и сумму строки. После извлечения поставщик сопоставляется со справочником, номер заказа — с открытыми заказами, а итоги проходят математическую проверку.
Новый поставщик не требует координатного шаблона, но первые документы нужно внимательно проверять. Выберите напечатанное имя, налоговый номер и аккаунт, а не только логотип. Логотип меняется и часто распознаётся хуже. После нескольких корректных примеров система получает устойчивые признаки класса и дизайна.
Дубликаты следует выявлять до проведения. В качестве ключа используют поставщика, номер, дату и сумму, но учитывают кредит-ноты и повторное выставление. Если внешний учёт уже содержит документ, Data Matching или конечная интеграция должны вернуть управляемое исключение, а не молча создать вторую запись.
Заказы, выписки и договоры
В заказах важны номер, покупатель, поставщик, адрес доставки, дата, товарные коды, количества и цены. Строк может быть очень много, поэтому заранее ограничьте число видимых колонок и используйте Learn & Extract только при устойчивом рисунке. Сопоставление кодов покупателя и поставщика уменьшает ручной выбор товаров.
В банковской выписке повторяющийся набор содержит дату операции, описание, дебет, кредит и баланс. Проверка начального и конечного баланса помогает обнаружить пропущенную строку. Многостраничные выписки не следует разделять по каждой странице, если баланс продолжается: это разрушит целостность периода.
В договорах можно извлекать стороны, даты, суммы, сроки продления, условия прекращения и нужные пункты. Такие документы менее регулярны, поэтому точечное обучение и ручная проверка важнее, чем попытка создать один визуальный дизайн. Для правовых выводов извлечённое значение должно вести к оригинальному фрагменту, чтобы специалист мог подтвердить контекст.
Паспорта, удостоверения и фотографии
Для удостоверений нужны имя, дата рождения, гражданство, номер, срок действия, орган выдачи и машиночитаемая зона. Фотографию следует делать без бликов на ламинации и с видимыми краями. Перед передачей такого документа настройте регион обработки, права и срок хранения согласно внутренним требованиям.
Извлечение данных не заменяет проверку подлинности, если workflow не содержит отдельной интеграции для верификации. Оператор должен отличать распознанное значение от результата проверки личности. В выходной схеме храните тип документа и страну, иначе одинаковые номера разных систем могут смешаться.
Многостраничный захват полезен для лицевой и оборотной стороны. Не разделяйте стороны на независимые записи, если они относятся к одному удостоверению. При автоматическом разделении добавьте тесты с пустой оборотной стороной и дополнительными визами.
Типичные ошибки и способы устранения
Сообщение о том, что документ обрабатывается другим пользователем, означает блокировку записи. Проверьте My Files, состояние Suspended и активную сессию. Не создавайте повторную копию только ради обхода блокировки: после освобождения можно продолжить исходный документ, сохранив единый ID.
Код доступа или ошибка 403 обычно указывает на права, просроченную сессию или параметры интеграции. Сравните роль пользователя, доступ к workflow и действительность ключа. Для API проверьте заголовок аутентификации и среду, для интерфейса — повторный вход и назначение группы.
Если документ долго Processing, оцените размер, страницы, строки и правила. Проверьте, не исчерпан ли лимит плана: дополнительные документы остаются в pre-processing до обновления или повышения плана. Если счётчик доступен, но очередь не движется, исследуйте входной файл и журналы.
Если извлечение верное, а итоговая строка неверна, отключайте преобразования по одному в ELS. Если подсветка указывает на неправильный фрагмент, исправляйте обучение. Если текст на странице уже неверен, меняйте качество или OCR. Такой порядок предотвращает бессмысленное переобучение.
Как улучшать точность без лишней ручной работы
Соберите небольшой, но разнообразный набор документов каждого типа. Включите длинные и короткие таблицы, разные валюты, кредит-ноты, сканы, цифровые PDF и редкие макеты. Обрабатывайте их одинаково: выделяйте полное значение, не захватывайте подписи и используйте одни и те же колонки.
Не обучайте ошибку. Перед Save and Learn проверьте каждое обязательное поле, строки и итог. Один неверный пример может повлиять на последующие документы. Для сомнительного случая используйте Save и отправьте его эксперту, а обучение выполните после подтверждения.
Измеряйте не только процент распознанных символов. Важнее доля документов без касания, количество исправлений на поле, причины Reject, время в очереди и ошибки после экспорта. Улучшение OCR, которое увеличило неверные автоматические выходы, не является улучшением процесса.
Регулярно просматривайте Field Learning History. Удаляйте или исправляйте примеры, относящиеся к неверному дизайну, и следите за изменениями поставщиков. После смены OCR или структуры workflow проведите контролируемый повторный тест, прежде чем возвращать автоматический Output.
Организация работы операторов
Разделите поток по ролям и сложности. Простые документы могут выходить автоматически, низкая уверенность — попадать в Indexing, критические суммы — в QA, нарушения правил — в Rejected. Так оператор работает с исключениями, а не просматривает все файлы.
Создайте короткие инструкции по каждому workflow: какие поля обязательны, что выбирать на документе, когда допустимо игнорировать мягкую проверку и куда отправлять спорный случай. Инструкция должна использовать названия полей из интерфейса и примеры реальных исключений.
Следите за My Files. Записи, закреплённые за отсутствующим сотрудником, тормозят процесс. Установите разумный тайм-аут и назначьте администратора, который освобождает документы. Для сменной работы лучше отправлять незавершённые записи в общую QA с комментарием, чем держать их в личной очереди.
Контроль перед автоматическим Output
Перед включением обработки без участия человека проверьте каждое правило на положительных и отрицательных примерах. Обязательное поле должно отклонять действительно неполный документ, но не блокировать допустимую пустоту. Арифметика должна учитывать округление и тип документа. Справочник должен возвращать однозначное совпадение.
Настройте мониторинг выходного канала. Успешное извлечение не означает успешную доставку. Сохраняйте код ответа приёмника, время, Document ID и идентификатор созданной записи. При сбое повторяйте отправку безопасно и не создавайте дубликаты.
Проведите параллельную сверку на ограниченном периоде. Сравните данные Xtracta с ручным вводом, разберите расхождения и только потом сокращайте контроль. Для нового поставщика или нового дизайна временно возвращайте документы в Indexing, пока не накопятся подтверждённые примеры.
File Tracking и поиск причины задержки
File Tracking показывает последовательность событий для каждого документа: поступление, запуск обработки, переходы между очередями, действия пользователя и последнее состояние. Для расследования сначала находят запись по Document ID, затем сопоставляют Received Time и Last Activity. Если между этими отметками большой интервал, важно определить, находился ли файл в вычислительной обработке, был закреплён оператором или ожидал внешнего вывода.
Документы, отправленные через API, отмечаются пользователем System. Это позволяет отделить автоматическое действие интеграции от коррекции в ELS. Если после System появляется имя оператора, файл был открыт или изменён вручную. При споре о значении полезно сверять File Tracking с Data History конкретного поля: первый журнал отвечает на вопрос, что происходило с документом, второй — кто и когда менял значение.
Для ежедневного контроля отбирают записи с давно не меняющейся Last Activity. Документ в My Files проверяют на блокировку, запись в Processing — на размер и сложность, запись в Output Queue — на состояние канала назначения. Такой разбор точнее общего повторного запуска, поскольку не создаёт дубликаты и не скрывает первичную причину задержки.
Learning Queue и подтверждённое обучение
Перемещение документа в Learning само по себе не обучает извлечение. В этой очереди материал лишь ожидает пользователя. Чтобы пример повлиял на последующие результаты, документ открывают, корректируют все нужные поля и строки, затем выполняют Save and Learn. Если оставить ошибочное или непроверенное значение, модель получит неверный образец, поэтому очередь Learning должна иметь ответственного и понятный срок обработки.
Save and Learn применяют к документу, который действительно представляет полезный вариант макета или расположения поля. Для случайного повреждённого скана, рукописной пометки поверх реквизита или разового нестандартного приложения безопаснее использовать обычный Save. Обучение исключения может ухудшить поведение на нормальных файлах, тогда как сохранение позволяет завершить текущую обработку без изменения модели.
После обучения контролируют следующие документы того же типа. Улучшение должно проявляться в правильной зелёной подсветке и уменьшении ручных исправлений. Если модель начинает выбирать соседний текст, открывают Field Learning History и проверяют примеры, влияющие на поле. Обучение оценивают по повторяемому результату, а не по успешному сохранению одного документа.
Field History и Data History
Команда Field History открывает две разные вкладки. Learning History показывает прежние примеры обучения выбранного поля из других документов, если эта возможность включена в workflow. Оператор видит, какие участки использовались как образцы и почему новое значение могло быть извлечено из похожего места. Это особенно полезно после изменения формы поставщика, когда старый заголовок или соседняя подпись остаются в памяти модели.
Data History относится только к текущему документу. В ней сохраняются исходное и последующие значения, автор изменения, номер ревизии и время. Если итоговая сумма отличается от первого результата OCR, журнал позволяет установить, была ли она исправлена пользователем, заменена системой или изменилась после повторного открытия. Для аудита важно фиксировать не только конечное значение, но и цепочку корректировок.
При анализе не следует путать обучение и историю данных. Неверный пример в Learning History влияет на будущие документы и требует исправления модели. Неверная запись в Data History описывает уже совершённое действие и помогает восстановить ход обработки. Совместный просмотр двух вкладок даёт доказательство того, откуда появилось значение и каким образом оно стало итоговым.
Quality Assurance и второй уровень проверки
Очередь Quality Assurance подходит для документов, где одного исправления недостаточно. В неё направляют крупные суммы, низкую уверенность, новые макеты или материалы, требующие разделения обязанностей. Проверяющий открывает тот же ELS, видит документ и извлечённые данные, но оценивает их как отдельный этап перед Output. Это удобнее передачи скриншотов и таблиц вне системы, поскольку сохраняются идентификатор и история действий.
Правило направления в QA должно быть конкретным. Можно проверять определённый тип документа, критическое поле или результат бизнес-валидации. Если туда отправляется весь поток без различия риска, очередь превращается во второй ручной ввод. Если туда не попадают новые макеты и высокие суммы, второй контроль не выполняет своей задачи. Полезный критерий должен сокращать риск, а не просто увеличивать число кликов.
После исправления проверяющий выбирает Output, Save, Rejected или другое разрешённое действие. При спорном документе лучше сохранить и передать его владельцу правила, чем обходить жёсткую валидацию. Для сменной команды права QA назначают отдельной группе, а File Tracking используют для проверки того, что решение принял уполномоченный сотрудник.
Reassign и перенос между рабочими потоками
Reassign переносит документ в другой workflow, когда первоначальная классификация или канал поступления выбраны неверно. Пользователь должен иметь доступ и к исходному, и к целевому процессу. Перед переносом проверяют, совместима ли схема полей: данные, существующие только в прежнем workflow, могут не соответствовать новой конфигурации, поэтому после переназначения документ нужно открыть и проверить заново.
Переназначение полезно для общего почтового ящика, куда приходят счета, заказы и кредит-ноты. Классификатор направляет большинство файлов автоматически, а исключение оператор передаёт в правильный процесс. Не следует использовать Reassign как постоянную замену исправлению классификации. Если один и тот же тип регулярно попадает не туда, добавляют примеры и корректируют условия определения класса.
При многостраничном пакете возможен перенос выбранных страниц, а не всего файла. Сначала разделяют документ, затем назначают части соответствующим workflow. После операции у получившихся документов появляются собственные идентификаторы, поэтому интеграция должна учитывать связь с исходным пакетом и не ожидать один результат на весь загруженный PDF.

Классификация документов без жёсткой привязки к шаблону
Классификация определяет, к какому типу относится документ, до применения схемы извлечения. В настройках можно использовать разные режимы: классифицировать каждый файл целиком, каждую страницу либо сначала разделять набор и затем определять класс частей. Выбор зависит от входа. Отдельный счёт в одном PDF требует классификации документа, а пачка разнородных страниц — более детального анализа и разделения.
Для проверки классификатора собирают примеры, похожие по внешнему виду, но разные по смыслу: счёт и кредит-ноту одного поставщика, заказ и подтверждение заказа, банковскую выписку и платёжное извещение. Модель должна опираться не только на логотип, поскольку один контрагент присылает несколько типов документов. Полезны устойчивые признаки: название формы, набор реквизитов и характерная структура таблицы.
Ошибка класса проявляется до ошибки поля. Если ELS показывает неожиданный Class или Design, не нужно обучать реквизиты в неправильной схеме. Сначала переназначают документ и проверяют классификацию. Иначе примеры разных типов смешиваются, а система начинает извлекать номер заказа как номер счёта или сумму страницы как итог документа.
Дизайны, варианты макета и границы обобщения
Design описывает визуальный вариант внутри класса. Для регулярных форм он помогает учитывать расположение подписей, колонок и итогов, не создавая отдельный бизнес-тип. Один поставщик может иметь несколько дизайнов из-за разных систем формирования PDF, языков или старой и новой формы. Их объединяют в один класс, когда выходные поля и правила одинаковы, но визуальная структура различается.
Не следует создавать дизайн для каждого единичного документа. Слишком дробная схема требует постоянного администрирования и плохо обобщает изменения. С другой стороны, попытка обучить один дизайн на радикально разных таблицах увеличивает неверные совпадения. Практическая граница проходит там, где сохраняется одинаковый смысл полей, но меняется устойчивый визуальный способ их размещения.
При смене формы загружают несколько подтверждённых примеров и временно направляют документы в Indexing. После проверки заголовков и строк выполняют Save and Learn. Старые примеры не удаляют автоматически: сначала выясняют, продолжают ли поступать прежние документы. Если оба варианта используются параллельно, модель должна различать их, а не заменять один другим.
Русский текст, языки и выбор движка OCR
Русский язык поддерживается несколькими доступными методами распознавания, включая Nuance, Google Vision и Azure. Выбор делают на реальных документах: цифровой PDF с текстовым слоем, скан бухгалтерской формы и фотография рукописного поля требуют разных подходов. Для цифрового файла приоритетен точный захват существующего текста, а для фотографии важнее устойчивость к шуму, наклону и нестандартным символам.
В многоязычном документе проверяют не только буквы, но и числа, сокращения, коды валют и даты. Похожая форма кириллических и латинских символов может испортить идентификатор, даже когда слово выглядит правильно. Для ИНН, номера счёта, IBAN, артикула и других кодов добавляют форматную проверку или сопоставление, чтобы обнаружить замену буквы цифрой и наоборот.
Google Vision и Azure предполагают внешнюю обработку OCR, тогда как Nuance и Tesseract могут выполняться внутри инфраструктуры Xtracta. Этот выбор важен для политики передачи данных. До включения движка для паспортов, медицинских форм или договоров нужно согласовать регион, поставщика распознавания и допустимый маршрут информации, а затем проверить качество на обезличенном наборе.
Большие таблицы и контроль производительности
У Xtracta нет фиксированного предела числа строк, однако время и нагрузка растут с количеством ячеек, правил и страниц. Таблица из ста строк и десяти колонок создаёт до тысячи проверяемых значений, не считая полей шапки. Каждое значение может проходить очистку, форматирование, сопоставление и валидацию, поэтому сложность определяется не одним размером PDF.
Для ускорения убирают ненужные колонки и правила, а не только уменьшают разрешение. Сильное сжатие может ухудшить OCR и увеличить ручную работу. Если полезные страницы известны, Limit Processed Pages позволяет взять начало и конец документа, но этот приём нельзя применять к выписке или реестру, где строки продолжаются на всех страницах. Сначала подтверждают, что пропущенные страницы действительно не содержат данных.
New ELS предпочтительнее для больших и сложных документов, поскольку загружает рабочие области эффективнее классического экрана. Тем не менее оператору полезно фильтровать поля по ошибкам и проверять таблицу блоками. При зависании сравнивают число страниц, строк и активных преобразований на проблемном документе с нормальным примером, чтобы найти причину роста времени.
Повторная обработка без потери причины
Force Reprocess следует использовать после того, как понятна причина ошибки и есть шанс, что повторный проход её устранит. Команда не снимает пароль, не исправляет повреждённый файл и не уменьшает физический размер страницы. Для документа свыше допустимого числа страниц повтор может быть уместен, особенно вместе с ограничением обрабатываемых страниц, но результат всё равно нужно проверить.
Перед повторным запуском сохраняют Document ID, текст ошибки и параметры файла. Если запись исчезнет из Error Documents, эти сведения позволят сравнить новый результат с первоначальным. При массовой проблеме сначала повторно обрабатывают один репрезентативный файл. Запуск всей партии без теста может занять ресурсы и воспроизвести ту же ошибку сотни раз.
Acknowledge только убирает ошибку из активного внимания и не восстанавливает обработку. Эту команду используют после фиксации решения либо когда файл признан непригодным. Если документ нужен бизнес-процессу, его исправляют до отправки, загружают заново или применяют допустимый Force Reprocess; простое подтверждение не создаёт выходных данных.

Сравнение Xtracta с аналогами
Прямые аналоги различаются не столько способностью читать PDF, сколько глубиной рабочего процесса, обучением, ручной проверкой и интеграцией. Xtracta ориентирована на поток от поступления до проверенного вывода, с очередями, ELS, правилами и несколькими каналами ввода. ABBYY Vantage строит процессы из навыков классификации, OCR, документов и процессов. Rossum делает акцент на очередях и экране валидации транзакционных документов. Nanonets сочетает модели извлечения с настраиваемыми workflow. Azure AI Document Intelligence предоставляет готовые и пользовательские модели через Studio, API и SDK, но полноценный операционный контур обычно собирается в других компонентах Azure или в собственном приложении.
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| Xtracta | Потоков документов с очередями, обучением и проверками | Требует настройки workflow |
| ABBYY Vantage | Сложных корпоративных навыков и ручной проверки | Продвинутые сценарии сложнее |
| Rossum | Транзакционных документов и операторской валидации | Основной фокус на бизнес-документах |
| Nanonets | Быстрых моделей и автоматизации без большого кода | Сложные процессы требуют настройки |
| Azure AI Document Intelligence | Разработки OCR и извлечения через API и SDK | Операционный workflow собирается отдельно |
Для бухгалтерского потока с готовыми очередями, ручным обучением и несколькими способами загрузки логично выбирать Xtracta или Rossum. Для крупной архитектуры навыков и сложных схем обработки подходит ABBYY Vantage. Для команды, которой важны быстрые модели и визуальная автоматизация, стоит сравнить Nanonets. Azure AI Document Intelligence удобен разработчикам, которые хотят встроить распознавание в собственную систему и готовы самостоятельно реализовать очереди, права, повторные попытки и контроль исключений.
Рабочая памятка по запуску
Начните с одного типа документов и одного понятного результата. Создайте поля, повторяющиеся наборы и правила только для данных, которые реально нужны принимающей системе. Выберите канал поступления и OCR, затем загрузите разнообразные примеры. На первых документах используйте Indexing и проверяйте каждое значение.
После накопления корректных примеров включите сопоставление и проверки. Убедитесь, что ошибочные документы попадают в Rejected с понятной причиной. Настройте QA для критических случаев и протестируйте разделение страниц. Затем подключите выход, сохраните идентификаторы и проверьте повторную отправку.
Автоматизацию включайте поэтапно. Сначала разрешите без участия человека только документы, которые проходят строгие проверки. Наблюдайте за причинами отклонения, временем обработки и качеством данных в конечной системе. Новые макеты временно возвращайте на ручную проверку.
При сбое определяйте этап: вход, OCR, классификация, извлечение, преобразование, валидация или вывод. Исправляйте причину на соответствующем уровне. Такой подход сохраняет полезное обучение, не маскирует интеграционные ошибки и постепенно сокращает число ручных операций.
Итоговый порядок ежедневной работы
Оператор начинает с домашних счётчиков и открывает очередь с накоплением. В Indexing он берёт следующий готовый документ, сверяет обязательные поля и строки, исправляет выделение и проверяет арифметику. Уверенный документ отправляется на Output, спорный — в QA, незавершённый — в My Files или сохраняется, а ошибочный получает понятную причину Reject.
Администратор следит за Error Documents, блокировками, сроками My Files и состоянием выходов. Он анализирует повторяющиеся причины, корректирует правила и права, а не заставляет операторов обходить одну и ту же ошибку. Специалист интеграции контролирует ответы API, свежие ссылки на документы и защиту ключей.
Когда входные файлы подготовлены, поля описаны точно, обучение подтверждено, проверки отражают реальные правила, а экспорт защищён от дублей, Xtracta превращает неоднородные документы в управляемый поток данных. Главная практическая ценность достигается не одиночным распознаванием, а связью очередей, ELS, обучения, проверок и доставки результата.