ScanTailor помогает превратить сырые сканы книги или пачку сфотографированных страниц в ровный, одинаково оформленный набор изображений: программа разделяет развороты, исправляет наклон, выделяет область текста, выравнивает поля, убирает мелкий мусор, распрямляет изгиб у корешка и сохраняет подготовленные страницы в TIFF для последующей сборки PDF или распознавания текста.
Рабочее окно построено вокруг последовательности этапов слева, большого предпросмотра по центру и вертикальной ленты миниатюр справа. Пользователь проходит страницы в фиксированном порядке: задаёт ориентацию, делит развороты, выправляет наклон, проверяет границы содержимого, настраивает поля и только затем формирует результат. Такая схема не даёт случайно экспортировать часть книги с разными размерами листа или пропущенными настройками.
Проект создаётся для папки с исходными JPEG, PNG или TIFF. ScanTailor не изменяет эти файлы: решения о повороте, линиях разреза, рамках текста и полях сохраняются в проекте, а обработанные изображения появляются в отдельной выходной папке. Большинство параметров можно применить к одной странице, ко всем страницам, к текущей и последующим, к чётным или нечётным листам и к заранее выделенной группе миниатюр.
Скачать ScanTailor
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Не открывает PDF напрямую
- Вывод только в TIFF
- Нет OCR и сборки PDF
Какие исходники подготовить перед началом работы
Лучший исходный материал для ScanTailor — отдельный растровый файл на каждый кадр сканирования. Для планшетного сканера это могут быть одиночные страницы или развороты; для камеры — последовательность фотографий. Поддерживаются JPEG, PNG и TIFF. Многостраничный PDF сначала требуется разложить на изображения, потому что программа не принимает его как входной формат. Если PDF уже содержит сканы, экспортируйте страницы без лишнего повторного сжатия и сохраните одинаковое разрешение для всей книги.
Имена файлов определяют порядок миниатюр, поэтому до создания проекта удобно привести их к единой нумерации: 0001, 0002, 0003 и далее. Лексикографическая сортировка ставит файл 10 перед файлом 2, если номера записаны без ведущих нулей. Переименование после начала работы нежелательно: проект запоминает пути к исходникам, и массовая смена имён потребует повторного сопоставления файлов.
Сканировать заранее впритык не нужно. Небольшой запас вокруг листа помогает алгоритму увидеть край бумаги, переплёт и фон стола, а затем корректно определить геометрию. Однако чрезмерно широкий фон увеличивает время обработки и затрудняет автоматическое выделение содержимого. Для разворота оставляйте заметную область у корешка; для одиночного листа достаточно равномерной рамки по периметру.
- Сохраняйте весь комплект в одной исходной папке.
- Не смешивайте в проекте изображения с резко различающимся DPI без проверки метаданных.
- Уберите случайные дубликаты и тестовые кадры до импорта.
- Создайте отдельную пустую папку для результата или разрешите программе сформировать каталог out.
Создание проекта и выбор папок
В окне нового проекта указываются каталог с исходными изображениями и каталог для результата. После выбора входной папки ScanTailor показывает найденные файлы и позволяет исключить лишние кадры до создания проекта. Выходная папка должна отличаться от исходной: программа записывает туда TIFF и при повторной обработке заменяет соответствующий результат, поэтому смешивание сырья и готовых страниц быстро создаёт путаницу.
Проектный файл хранит настройки обработки, но не включает сами изображения. Его разумно сохранять рядом с исходной папкой, не внутрь каталога результата. Для переноса работы на другой диск копируйте вместе проект, исходники и выходную папку, сохраняя относительное расположение. Если пути изменились, при открытии появится запрос на поиск перемещённых файлов; укажите новый каталог, а затем проверьте несколько страниц на каждом этапе.
При первом добавлении изображений программа может запросить разрешение в точках на дюйм. Этот параметр важен не только для печати: он связывает размеры в пикселях с физическими полями и выходным форматом. Если сканер записал ошибочное значение, задайте фактический DPI вручную. Исправление метаданных не дорисовывает детали и не повышает реальную резкость, но предотвращает неверный физический размер страниц.
Как устроено рабочее окно ScanTailor
Слева находится список этапов, и активный этап выделяется. Центральная область показывает текущую страницу и интерактивные направляющие: линию разреза, рамку содержимого, границы полей или сетку распрямления. Справа расположены миниатюры, на которых удобно видеть общий ритм книги и находить страницы, отличающиеся поворотом, шириной или количеством полей. Нижняя строка и элементы масштаба помогают увеличить проблемный фрагмент без изменения исходного файла.
В верхней части центральной области у некоторых этапов появляются вкладки. На выходном шаге через них переключаются итоговый вид, зоны изображений, распрямление и очистка. Параметры выбранной операции обычно находятся слева под названием этапа. Кнопка применения к группе открывает отдельное окно с областью действия; прежде чем подтвердить массовую настройку, полезно выделить небольшой диапазон и проверить результат на его крайних страницах.
Лента миниатюр выполняет роль контроля качества. В ней можно сортировать страницы по ширине или высоте рамки содержимого, чтобы быстро обнаружить неверно распознанный лист. Страница с необычно узкой рамкой часто потеряла боковую сноску, а чрезмерно широкая захватила тень переплёта. После ручной правки верните обычный порядок и убедитесь, что соседние листы имеют согласованные поля.

Этап Fix Orientation: поворот всего набора
Первый этап исправляет ориентацию кадров с шагом 90 градусов. Он нужен, когда сканер записал книгу боком, камера меняла положение или часть листов перевёрнута. Выберите правильный поворот для текущей страницы и откройте область применения. Для однородной пачки задайте все страницы; если ориентация чередуется, применяйте действие к каждой второй странице либо к выделенному диапазону.
Поворот ориентации отличается от исправления небольшого наклона. Здесь меняется положение листа целиком, например из альбомного в книжное. Угол в несколько градусов обрабатывается позже на шаге Deskew. Если попытаться компенсировать боковой кадр только Deskew, алгоритм не найдёт нормальные горизонтальные строки и следующие этапы начнут ошибаться.
После массового поворота пролистайте миниатюры сверху вниз. Иллюстрации без текста иногда затрудняют визуальную проверку, поэтому ориентируйтесь на колонтитулы, номер страницы, направление корешка и соседние листы. Отдельный перевёрнутый вкладыш исправляйте только для него, не меняя уже проверенную группу.

Этап Split Pages: разделение разворотов
На втором шаге ScanTailor определяет, содержит кадр одну страницу, одну страницу с фрагментом соседней или полный разворот. Для разворота программа строит линию разделения и создаёт две логические страницы. Исходный файл остаётся целым, а в проекте появляются две миниатюры, каждая из которых проходит дальнейшую обработку отдельно. Это особенно удобно для книг, сканированных без разрезания переплёта.
Автоматическая линия разреза обычно ориентируется на тёмную область корешка и границы листов. На плотно раскрытой книге она может сместиться к широкому внутреннему полю, а на фото — пойти по тени. Перетащите управляющие точки так, чтобы линия проходила между страницами и не захватывала буквы. Увеличьте масштаб возле верхнего и нижнего края: перекошенный корешок иногда требует наклонной, а не строго вертикальной границы.
Режим одной страницы выбирают для кадров, где виден только один лист. Вариант с соседним фрагментом полезен, если в кадр попал узкий край другой страницы: программа оставит основную страницу и отбросит лишнюю полосу. Не применяйте один тип ко всей книге без просмотра титула, вклеек и раскладных схем — такие кадры часто устроены иначе, чем основной блок.
После разделения контролируйте последовательность. Левая и правая половины разворота должны идти в правильном порядке относительно направления чтения. Если сканы снимались с переворотом книги или файлы названы в необычной последовательности, исправьте порядок до долгой ручной настройки, иначе выходные TIFF придётся массово переименовывать.
Этап Deskew: исправление небольшого наклона
Deskew выравнивает страницу вращением на небольшой угол. В автоматическом режиме программа анализирует длинные строки, границы текста и контрастные элементы, затем показывает рассчитанный угол. Результат оценивают по базовым линиям: текст должен идти горизонтально, а вертикальные штрихи и поля не должны заметно плыть от верхнего края к нижнему.
Автоматика ошибается на нотах, картах, страницах с единственной иллюстрацией, рукописях и листах, где большая тёмная тень сильнее текста. Переключитесь на ручной режим и поверните направляющую параллельно строке или другому надёжному горизонтальному объекту. Для страницы без текста используйте рамку изображения, линейку таблицы или согласование с соседними листами.
Deskew исправляет поворот плоскости, но не перспективу и не изгиб бумаги. Если верх страницы уже нижней, требуется геометрическое выправление кадра до импорта либо осторожная работа с сеткой распрямления на выходном этапе. Если строки дугой поднимаются у корешка, оставьте общий угол ровным и не пытайтесь компенсировать кривизну чрезмерным вращением.
Для пачки из одного сканера удобно сначала применить автоматический режим ко всем страницам, затем отсортировать миниатюры и вручную проверить выбросы. Особое внимание уделите пустым листам, фронтисписам и страницам с крупной фотографией: у них меньше ориентиров, поэтому рассчитанный угол может отличаться от соседних.


Этап Select Content: рамка значимого содержимого
На шаге Select Content программа ищет область, которую следует сохранить как содержимое страницы. В рамку обычно входят текст, номер страницы, заголовки и иллюстрации, но не фон сканера, край соседнего листа и тень переплёта. Эта рамка влияет на последующее выравнивание: ScanTailor сравнивает размеры содержимого разных страниц и добавляет поля вокруг него.
Автоматическая рамка требует проверки на страницах со сносками, маргиналиями, печатями, подписями карандашом и маленькими номерами. Если важный объект оказался снаружи, перетащите соответствующую сторону рамки. Лишний мусор внутри рамки тоже нежелателен: тёмный край обложки или полоска корешка искусственно увеличит ширину и нарушит одинаковый размер полосы набора.
Для быстрой ревизии используйте сортировку миниатюр по ширине и высоте содержимого. Несколько крайних значений почти всегда указывают на особый лист либо ошибку распознавания. Сначала откройте самые узкие страницы, затем самые широкие. После исправления рамок снова отсортируйте список: распределение должно стать более ровным, но иллюстрированные вклейки и титульные листы могут закономерно отличаться.
Не обрезайте рамкой естественные элементы книги только ради единообразия. Если на одной странице есть боковая помета, включите её в содержимое и при необходимости скорректируйте выравнивание на следующем шаге. Для вырезания дефектов предназначены зоны заливки в Output, а Select Content должен прежде всего описывать полезную область.


Page Layout: поля, размер листа и выравнивание
Page Layout формирует итоговый прямоугольник страницы вокруг рамки содержимого. Здесь задаются верхнее, нижнее, внутреннее и внешнее поля, а также положение содержимого внутри листа. Интерфейс показывает жёсткие поля, введённые пользователем, и дополнительное пространство, которое появляется при согласовании размера с другими страницами.
Функция согласования размеров полезна для книг: страницы с немного разной площадью текста получают одинаковый физический формат, поэтому при перелистывании PDF блок не прыгает. Программа ориентируется на максимальные размеры в проекте и добавляет мягкие поля к меньшим страницам. Перед окончательной обработкой убедитесь, что ошибочно огромная рамка Select Content не заставила весь набор раздуваться.
Выравнивание задаёт, к какой стороне прижимается содержимое внутри доступного пространства. Для обычной книги внутреннее поле часто делают шире внешнего, чтобы текст не исчезал у виртуального корешка. Для двусторонней печати настройки левых и правых страниц должны зеркально соответствовать друг другу. Если сканы чередуются, примените один набор к нечётным страницам, а зеркальный — к чётным.
Обложки, карты и широкие вклейки могут требовать отдельной геометрии. Если включить им согласование с обычными страницами, вся книга получит чрезмерные поля. Выделите такие кадры, отключите для них сопоставление размеров или обработайте отдельным проектом, затем приведите формат при сборке PDF. Решение зависит от цели: документальная копия сохраняет исходную пропорцию, а электронная книга обычно стремится к устойчивому размеру экрана.


Почему этап Output становится доступен не сразу
Финальный этап зависит от геометрии всего проекта. Пока хотя бы одна страница не прошла Select Content и Page Layout, программа не знает общий диапазон размеров и не может надёжно вычислить мягкие поля. Поэтому Output может оставаться недоступным или выдавать неполный результат. Пройдите обязательные шаги для всех миниатюр, включая пустые листы и обложки, после чего вернитесь к экспорту.
При переходе на Output ScanTailor рассчитывает страницу и записывает TIFF в выходную папку. Обработка может происходить по мере выбора миниатюр, а массовый запуск последовательно создаёт файлы для всего диапазона. Если вы позже меняете линию разделения, угол, рамку содержимого или поля, соответствующий TIFF следует пересоздать, иначе на диске останется результат старых настроек.
Проверяйте выходную папку не только в конце. Откройте несколько TIFF сторонним просмотрщиком на масштабе 100%, чтобы оценить тонкие штрихи, мелкий кегль, серый фон и качество изображений. Центральный предпросмотр удобен для настройки, но фактический файл позволяет увидеть влияние выбранного DPI и режима обработки.
Выходное разрешение и физический размер
В Output задаётся разрешение результата. Часто для чёрно-белого книжного текста выбирают 600 DPI, поскольку тонкие штрихи и мелкие засечки после бинаризации сохраняются лучше. Для цветных страниц, фотографий и исходников с невысокой детализацией достаточно меньшего значения, если оно соответствует реальному сканированию. Увеличение числа DPI сверх доступной детализации лишь создаёт больше пикселей и увеличивает файл.
При изменении выходного DPI ScanTailor пересчитывает размеры изображения, сохраняя физическую геометрию страницы. Поэтому ошибочные входные метаданные могут дать неожиданно огромный или маленький TIFF. Если результат имеет неверные сантиметры при правильном числе пикселей, вернитесь к сведениям об исходном разрешении и исправьте их согласованно для всей серии.
Для OCR важнее не формальная цифра, а высота букв в пикселях и отсутствие разрушения контуров. Проверьте страницу с самым мелким шрифтом и страницу с плохой печатью. Если символы сливаются после бинаризации, увеличение DPI само по себе может не помочь; сначала ослабьте порог, уменьшите утолщение линий и отключите чрезмерную очистку.

Чёрно-белый режим для текста
Режим Black and White превращает страницу в двухцветное изображение и лучше всего подходит для печатного текста, штриховых рисунков и документов без важных полутонов. Его преимущество — высокая читаемость и небольшой размер после сжатия. Основной параметр управляет границей между белым фоном и чёрными элементами: сдвиг в одну сторону очищает бумагу, в другую сохраняет более бледные штрихи и пятна.
Порог подбирают на нескольких типичных страницах. Откройте лист с тонким шрифтом, лист с жирным заголовком и самый загрязнённый скан. Настройка, идеально отбеливающая фон, может уничтожить точки над буквами, запятые и тонкие элементы формул. Слишком мягкая настройка, напротив, оставит серый шум в виде множества чёрных точек.
Параметр толщины линий полезен для выцветшей печати или слишком жирного скана. Небольшое утолщение укрепляет слабые штрихи, но быстро закрывает просветы внутри букв. Уменьшение толщины разделяет слипшийся текст, однако повреждает засечки. Меняйте значение малыми шагами и оценивайте не крупный заголовок, а мелкий абзац с буквами е, а, в, цифрами и знаками пунктуации.
Чёрно-белый режим не подходит для фотографий, акварельных иллюстраций, печатей с полутоном и бумаги, где важна фактура. Такие участки либо обрабатывайте в смешанном режиме с зонами изображений, либо сохраняйте всю страницу как Color/Grayscale. Превращение фотографии в один бит необратимо и не восстанавливается при последующей сборке PDF.
Despeckling: удаление точек без потери знаков
Despeckling удаляет маленькие изолированные компоненты, которые программа считает пылью, зерном бумаги или дефектами сканера. Степень очистки выбирается в Output и сразу отражается в предпросмотре. Инструмент особенно эффективен на старой бумаге после бинаризации, когда равномерный серый фон распадается на множество чёрных точек.
Главный риск — принять полезный знак за мусор. Точки над i в латинице, двоеточия, апострофы, диакритика, тонкие дробные черты и элементы нот могут иметь тот же размер, что и пыль. Проверяйте очищенный слой на странице с самым мелким кеглем. Если исчезают знаки, снизьте уровень или отключите очистку для отдельных страниц.
Не пытайтесь despeckling удалить крупную тень корешка, штамп или рукописную помету. Для крупных объектов используйте корректную рамку содержимого либо зоны заливки. Очистка по размеру предназначена для мелких компонент; слишком сильное значение начинает скруглять буквы и разрушать линии таблиц.
Цветной и полутоновый режим
Color/Grayscale сохраняет оттенки исходника и подходит для фотографий, факсимильных изданий, цветных помет, печатей и страниц с полутоновыми иллюстрациями. В этом режиме важны баланс между чистотой фона и сохранением фактуры. Белые поля можно сформировать вокруг содержимого, не стирая цвет внутри рамки.
Выравнивание освещения помогает ослабить плавный градиент, возникающий у корешка или при съёмке камерой. Алгоритм полезен, когда одна сторона листа заметно темнее другой, но на изображениях с реальным крупным градиентом способен изменить художественный тон. Проверяйте лица, небо, акварельные заливки и старую бумагу: однородность фона не должна достигаться ценой потери деталей.
Если исходник был JPEG с сильным сжатием, цветной вывод не устраняет квадраты и ореолы. Наоборот, повышение резкости или контраста может сделать их заметнее. Для сохранения мастер-копии лучше начинать с TIFF или качественного JPEG, а в ScanTailor ограничиться геометрией, полями и умеренной коррекцией освещения.
Смешанный режим и зоны изображений
Mixed объединяет чёрно-белый текстовый слой с цветными или серыми участками. ScanTailor автоматически пытается найти иллюстрации, а пользователь уточняет результат зонами изображений. В центральном окне автоматически распознанные области подсвечиваются; ошибка обнаружения исправляется замкнутым многоугольником, который добавляет область к цветному слою или исключает её.
Зона строится последовательными щелчками по вершинам и замыкается возвратом к первой точке. Незавершённый многоугольник отменяется клавишей Esc. После создания вершины можно перетаскивать, добавлять щелчком на ребре и удалять сведением с соседней вершиной. Контекстное меню зоны позволяет изменить её назначение или удалить целиком.
При пересечении нескольких зон действует приоритет. Область, принудительно вычитаемая из всех слоёв, остаётся чёрно-белой; область, добавленная к автоматическому слою, сохраняется цветной; зона исключения убирает ошибочно распознанную картинку. Из-за перекрытия полезно временно переключаться между вкладкой зон и итоговым изображением, а не судить только по цветной подсветке.
Смешанный режим подходит для учебника с текстом и фотографиями, журнала с небольшими иллюстрациями или технического руководства со схемами. Для страницы, целиком занятой фотографией, проще выбрать Color/Grayscale. Для чистого текста без рисунков Black and White даёт меньше сложных границ и обычно лучше сжимается.
Fill zones: удаление крупных дефектов
Зоны заливки закрывают выбранную область цветом фона и применяются к пятнам, штампам, следам пальцев, полосе соседней страницы и другим объектам, которые нельзя убрать общим порогом. Многоугольник следует строить с небольшим запасом вокруг дефекта, но не заходить на буквы. На неоднородном цветном фоне заливка может быть заметна, поэтому инструмент наиболее предсказуем на белых полях.
Для повторяющегося дефекта, например тёмной полосы от края стекла, сначала устраните причину рамкой страницы или настройкой сканера. Копирование большой зоны на все страницы способно стереть номера, колонтитулы и примечания, расположенные немного по-разному. Массовое применение оправдано лишь для стабильной области вне полезного содержимого.
Если нужно сохранить историческую печать или помету, не воспринимайте её как мусор. В документальной копии такие элементы имеют смысл и должны оставаться. Создайте две версии результата: документальную с сохранением особенностей и читательскую с очисткой. Проект позволяет менять зоны и повторно формировать TIFF без повреждения исходников.
Dewarping: распрямление страницы у корешка
Dewarping исправляет кривизну строк на странице, которая выгнулась у переплёта или была снята камерой. В Output открывается сетка модели и выбирается автоматический либо ручной режим. Автоматика ищет боковые границы и длинные горизонтальные линии текста, затем строит преобразование, которое делает сетку прямоугольной и равномерной.
На обычной книжной странице автоматическая модель часто даёт хороший старт. Проверьте верхнюю и нижнюю строки, участок у корешка и внешний край. Если сетка следует не по тексту, а по границе иллюстрации, переключитесь на Manual и поправьте управляющие точки. Кривые должны описывать реальное направление строк, а боковые границы — форму страницы.
Дополнительные точки помогают точнее провести верхнюю и нижнюю кривые. Их не обязательно ставить непосредственно на каждом символе: они управляют формой сплайна. Лишние точки усложняют модель и могут создать локальные волны, поэтому добавляйте их только там, где простая кривая заметно расходится со строкой. Ненужную точку удаляют клавишами Delete или D.
Параметр восприятия глубины меняет горизонтальное сжатие около корешка. Слишком сильное значение растягивает буквы и делает внутренний край неестественным; слишком слабое оставляет текст сжатым. Оценивайте круглые буквы и равномерность межбуквенных интервалов на нескольких строках, а не только прямизну границы.
Автоматике трудно на страницах, где нет длинных строк: фотоальбомах, картах, нотах с разрывами, сложной журнальной верстке. Зоны изображений не задают модель распрямления, поэтому крупная картинка не заменяет текстовые ориентиры. В таком случае используйте ручную сетку, ограничьтесь исправлением перспективы либо подготовьте геометрию во внешнем редакторе.
Пакетная обработка и область Apply to
Практическая сила ScanTailor раскрывается при сочетании автоматического расчёта и выборочного массового применения. Один параметр можно назначить текущей странице, всем страницам, текущей и следующим, каждой второй странице, выделенным страницам или каждой второй внутри выделения. Это позволяет зеркально настраивать поля, разделять серии с разной ориентацией и исправлять только один сканерный проход.
Перед массовым применением выделите характерные страницы: обычный текст, иллюстрацию, титул и лист с малым количеством содержимого. Примените настройку к этому набору, перейдите по миниатюрам и только затем расширяйте область. Такой пробный диапазон быстрее, чем отменять ошибку на сотнях страниц.
Команда текущая и последующие удобна, если в середине проекта меняется способ сканирования, например после переворота стопки. Каждая вторая страница полезна для зеркальных полей левой и правой полосы. Выделенные страницы подходят для цветных вклеек, которым нужен другой режим Output.
Массовая настройка не освобождает от визуального контроля. Автоматическая рамка содержимого и угол зависят от конкретного изображения, поэтому одинаковое числовое значение не всегда означает одинаково хороший результат. После каждой стадии просматривайте миниатюры и открывайте выбросы по размеру или форме.
Рабочий процесс для сканированной книги
- Разложите исходники по порядку, проверьте номера и DPI.
- Создайте проект с отдельной выходной папкой.
- Исправьте ориентацию всей серии и исключения.
- Разделите развороты, вручную проверьте корешок.
- Запустите Deskew и просмотрите страницы без длинных строк.
- Проверьте рамки Select Content сортировкой по ширине и высоте.
- Настройте зеркальные поля и согласованный размер страницы.
- Выберите режим Output на типичных текстовых и иллюстрированных листах.
- При необходимости добавьте зоны, очистку и dewarping.
- Сформируйте TIFF, проверьте их на 100% и только после этого собирайте PDF.
Для книги с чётко выраженными левыми и правыми страницами полезно сначала настроить один обычный разворот. После разделения выберите левую страницу, задайте внутреннее и внешнее поле, примените к каждой второй. Затем повторите зеркальную настройку для правых страниц. Проверьте начало книги: титульный лист, оборот титула и вклейки могут смещать чередование.
Не удаляйте пустые страницы автоматически. Они могут сохранять нумерацию, разделять главы и обеспечивать правильное расположение разворотов. Если пустой лист нужен в PDF, задайте ему разумную рамку содержимого или согласованный размер, чтобы он прошёл обязательные этапы. Если он действительно лишний, исключите его осознанно на этапе подготовки или при сборке итогового документа.
Рабочий процесс для фотографий страниц
Кадры с камеры чаще требуют исправления перспективы, освещения и кривизны. Старайтесь снимать объективом над центром листа, держать одинаковое расстояние и фиксировать книгу. ScanTailor хорошо выравнивает строки и поля, но не превращает произвольную трапецию с сильно различающимися углами в идеальный скан без потери качества.
Сначала выберите кадры с приемлемой резкостью. Размытый текст, смаз от движения и блики не исправляются геометрической обработкой. Затем проверьте ориентацию и разделение. На Deskew выровняйте общий наклон, а кривизну строк оставьте для Dewarping. В Select Content не включайте фон стола и пальцы, удерживающие страницу.
Для неравномерного света используйте цветной или серый режим с осторожной коррекцией освещения. Если цель — OCR, сравните его с чёрно-белым вариантом: иногда локальные тени лучше переживают полутоновый экспорт и последующую адаптивную бинаризацию распознавателя. Не отбеливайте страницу настолько, чтобы исчезли светлые буквы у корешка.
Dewarping на фото проверяйте по нескольким строкам на разных высотах. Ошибка сетки может сделать центр ровным, но искривить верх или низ. В ручном режиме проведите верхнюю и нижнюю кривые по длинным строкам, затем настройте глубину по форме букв. Если на странице только рисунок, модель лучше строить по краям листа или отказаться от автоматического распрямления.
Подготовка страниц к OCR
ScanTailor сам не распознаёт текст, но его результат часто служит входом для OCR. Для распознавания полезны ровные строки, стабильный размер, отсутствие тёмных полей и достаточное число пикселей на высоту буквы. Чёрно-белый TIFF подходит для чистой печати, а серый — для слабого текста, сложного фона и документов с фотографиями.
Перед запуском OCR откройте итоговый TIFF и увеличьте до 100–200%. Точки над буквами, тонкие знаки, дроби и вертикальные штрихи должны быть целыми. Слишком сильный despeckling снижает точность, даже если страница визуально кажется чистой. Слипшиеся символы указывают на чрезмерный порог или утолщение линий.
Для многоязычного документа сохраняйте геометрию одинаковой, а языки задавайте уже в распознавателе. ScanTailor не создаёт текстовый слой и не знает словаря, поэтому его задача — не угадать буквы, а дать им чёткую форму. Если OCR плохо читает отдельную страницу, сравните чёрно-белый и серый экспорт, а также вариант без коррекции освещения.
После OCR проверьте не только текст, но и соответствие страниц. Разделённый разворот создаёт два результата, а исключённый пустой лист меняет нумерацию. Перед сборкой поискового PDF сопоставьте имена TIFF с фактическими номерами книги и сохраните контрольную таблицу для длинного проекта.
Сборка TIFF в PDF
ScanTailor оставляет финальную сборку другому инструменту. После обработки выходная папка содержит последовательность TIFF, которую можно импортировать в PDF-редактор, программу OCR или конвертер. В PDF Commander эти изображения удобно расположить по порядку, удалить ошибочные страницы, повернуть отдельные листы, добавить номера и сохранить единый документ.
Не конвертируйте каждый TIFF в отдельный JPEG перед сборкой без необходимости: повторное сжатие ухудшает мелкий текст и создаёт ореолы. Чёрно-белые TIFF с потерями не связаны, а LZW сохраняет пиксели. Итоговый PDF-движок может применить подходящее сжатие для одного бита или цветных страниц уже при упаковке документа.
Если нужен поисковый PDF, сначала выполните OCR либо используйте редактор, который создаёт скрытый текстовый слой. Простое объединение TIFF даёт PDF-картинку: он выглядит правильно, но текст нельзя искать и копировать. Для PDF/A долговременного хранения дополнительно проверяются цветовые профили, шрифты текстового слоя и соответствие выбранному стандарту.
Перед публикацией пролистайте PDF в режиме двух страниц. Внутренние поля должны смотреть к центру разворота, размер листов не должен прыгать, а иллюстрации — выпадать из рамки. Сравните номера страниц с оглавлением и убедитесь, что левая и правая половины исходного разворота не переставлены.
Сохранение проекта и восстановление путей
Проект следует сохранять регулярно, особенно после ручной расстановки линий, рамок и зон. Файл проекта содержит ссылки на исходные изображения и накопленные параметры, поэтому его небольшой размер не означает, что он самодостаточен. Резервная копия должна включать исходную папку, файл проекта и, при необходимости, выходные TIFF.
Если исходники перемещены, ScanTailor предложит указать новое расположение. Выберите папку, в которой сохранились те же имена файлов, и проверьте сопоставление. При частичном переименовании автоматический поиск может привязать не те страницы или оставить пропуски. В сложном случае верните старые имена либо создайте копию проекта перед экспериментом.
Не редактируйте исходные изображения после настройки проекта без причины. Обрезка, изменение размеров или замена файла при том же имени меняет геометрию, а сохранённые линии и рамки остаются прежними. После такой замены пройдите этапы заново для затронутых страниц и пересоздайте выходные TIFF.
Производительность и место на диске
Время обработки зависит от числа пикселей, режима Output и сложности геометрии. Цветной TIFF при 600 DPI может занимать значительно больше памяти и места, чем чёрно-белая страница. Dewarping, выравнивание освещения и смешанный режим также требуют больше вычислений, чем простое вращение и бинаризация.
Для длинной книги сначала настройте и сформируйте небольшой диапазон. По размеру нескольких TIFF можно оценить весь объём и понять, достаточно ли места на диске. Выходную папку лучше размещать на быстром локальном накопителе, а резервную копию переносить после проверки. Запись сразу на медленный сетевой ресурс увеличивает задержки и усложняет восстановление при обрыве.
Закройте тяжёлые приложения, если предпросмотр больших цветных страниц становится медленным. Не снижайте качество исходников только ради скорости: разумнее временно обрабатывать диапазонами. После завершения можно удалить промежуточные ошибочные TIFF, но исходники и проект сохраняйте до проверки финального PDF.
Частые ошибки и способы исправления
PDF не появляется в окне выбора файлов
Это ожидаемое ограничение: сначала экспортируйте страницы PDF в JPEG, PNG или TIFF. Сохраняйте одинаковый DPI и не уменьшайте изображения автоматически. Если PDF содержит только сканы, предпочтителен экспорт без повторного JPEG-сжатия. Затем создайте проект по папке с полученными файлами.
JPEG не загружается или отображается ошибкой
Сначала проверьте файл в обычном просмотрщике и пересохраните один тестовый кадр в PNG или TIFF. В исторических конфигурациях загрузке JPEG мог мешать антивирусный фильтр Symantec или Norton. Не отключайте защиту без необходимости: безопаснее обновить защитное ПО, добавить доверенное исключение для проверенной папки либо конвертировать исходники в TIFF.
Output недоступен
Пройдите Select Content и Page Layout для каждой миниатюры. Особые страницы, пустые листы и половины разворотов тоже должны иметь рассчитанную геометрию. Найдите миниатюры без результата предыдущего этапа, обработайте их, затем снова откройте Output.
После разделения потеряна часть текста
Вернитесь в Split Pages, увеличьте область у корешка и передвиньте линию разделения. Проверьте верх и низ, потому что наклонная граница может быть правильной в центре и пересекать буквы у края. Если кадр содержит одну страницу с узким фрагментом соседней, выберите соответствующий тип вместо полного разворота.
Страница остаётся кривой после Deskew
Определите тип искажения. Равномерный наклон исправляется ручным углом Deskew. Трапеция требует коррекции перспективы, а дугообразные строки — Dewarping. Не увеличивайте угол вращения, пытаясь выпрямить изгиб: одна сторона станет ровнее, другая отклонится сильнее.
Рамка содержимого обрезает примечание
На Select Content расширьте рамку вручную и проверьте соседние страницы. Если примечания повторяются у внешнего поля, можно применить изменение к группе, но убедитесь, что туда не попадает тень или край стола. После изменения заново оцените поля в Page Layout.
У всех страниц появились огромные поля
Обычно одна страница имеет ошибочно большую рамку содержимого или необычный формат при включённом согласовании размеров. Отсортируйте миниатюры по ширине и высоте, найдите выброс и исправьте рамку. Для карты или вклейки отключите сопоставление с основным набором либо вынесите её в отдельный проект.
После очистки исчезают точки и запятые
Уменьшите Despeckling и проверьте толщину линий. Сравните итоговый слой с исходником на 200%. Для страниц с мелким кеглем или диакритикой используйте слабую очистку либо отключите её индивидуально. Крупные пятна удаляйте зонами, не повышая общий уровень.
Распремление создаёт волны
Переключитесь на ручную сетку, удалите лишние контрольные точки и проведите кривые по длинным строкам. Проверьте боковые границы и параметр глубины. Если надёжных ориентиров нет, уменьшите степень коррекции: умеренная остаточная кривизна лучше, чем локально деформированные буквы.
Результат не обновился после правки
Изменение проекта не всегда означает, что старый TIFF уже заменён. Откройте исправленную страницу в Output или запустите повторную обработку нужного диапазона. Сверьте время изменения файла в выходной папке и удалите устаревший результат только после сохранения проекта.
Практика контроля качества
Контроль удобнее проводить не сплошным перелистыванием, а несколькими проходами. Сначала ищите геометрические выбросы на миниатюрах, затем проверяйте текст на масштабе 100%, после этого открывайте случайные TIFF вне программы. Отдельный проход посвятите иллюстрациям и зонам, ещё один — нумерации и порядку страниц.
Сформируйте контрольный набор из десяти страниц: мелкий текст, жирный текст, фотография, таблица, титул, пустой лист, страница у начала и конца блока, сильно изогнутая страница и лист с пометкой. Любое массовое изменение Output сначала проверяйте на этом наборе. Если настройка проходит все случаи, риск скрытой потери деталей заметно ниже.
Сравнивайте соседние страницы в одинаковом масштабе. Резкая смена толщины шрифта указывает на разные пороги или DPI, скачок рамки — на ошибку Select Content, изменение положения блока — на поля и выравнивание. При работе над большой книгой записывайте диапазоны с особыми настройками, чтобы повторная обработка была воспроизводимой.
Сравнение ScanTailor с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| ScanTailor | Точная геометрическая подготовка сканов, разделение разворотов, поля и распрямление | Не создаёт PDF и текстовый слой |
| ScanTailor Advanced | Расширенная обработка сканов с дополнительными режимами и исправлениями | Интерфейс и параметры требуют освоения |
| NAPS2 | Сканирование с устройства, организация страниц, OCR и быстрый экспорт в PDF | Меньше специализированного контроля книжной геометрии |
| gscan2pdf | Сканирование и сборка PDF или DjVu с OCR в Linux | Зависит от внешних OCR и сканерных компонентов |
| OCRmyPDF | Пакетное добавление OCR-слоя к готовым сканированным PDF | Командная строка и нет ручной разметки полей |
| PDF Commander | Сборка изображений в PDF, редактирование страниц и распознавание | Не заменяет поэтапную коррекцию разворотов и кривизны |
ScanTailor выбирают, когда главная задача — аккуратно привести сырые страницы к единой геометрии до OCR и сборки. NAPS2 удобнее для прямого сканирования и быстрого получения PDF, gscan2pdf — для связанного Linux-процесса со сканером и DjVu, OCRmyPDF — для автоматического распознавания уже собранных PDF. ScanTailor Advanced подходит тем, кому нужны дополнительные варианты обработки и кто готов разбираться в более насыщенных настройках. PDF Commander логично использовать после ScanTailor, когда TIFF необходимо объединить, отредактировать и сохранить как законченный PDF.
Когда ScanTailor особенно полезен
Программа хорошо подходит для домашних и библиотечных проектов, где книга сканируется разворотами и требуется единый вид сотен страниц. Она ценна при работе с переплётом: линия разделения, зеркальные поля и dewarping решают задачи, которые обычная пакетная обрезка не учитывает. Ручные рамки и зоны позволяют сохранить сноски, печати и иллюстрации, не принимая автоматический результат вслепую.
Другой сильный сценарий — подготовка изображений перед OCR. Ровные строки, чистые края и стабильный масштаб уменьшают количество ошибок распознавания. При этом пользователь контролирует, что именно удаляется: точечная очистка, порог и зоны можно настраивать отдельно, а исходники остаются нетронутыми.
ScanTailor менее удобен, когда нужен один быстрый PDF прямо со сканера, редактирование существующего текста, заполнение форм или электронная подпись. Эти задачи относятся к сканирующим оболочкам и PDF-редакторам. Здесь программа выступает как специализированный промежуточный этап между получением изображения и выпуском документа.
Масштаб, перемещение и точная ручная правка
Ручные границы удобнее настраивать в два прохода. Сначала уменьшите страницу так, чтобы видеть её целиком, и задайте общую форму линии или рамки. Затем увеличьте участки с мелким текстом, корешком и нижним номером страницы. На крупном масштабе легче заметить, что линия разделения пересекает хвост буквы, рамка содержимого задевает сноску или кривая dewarping проходит между строками.
При увеличении не принимайте пиксельную ступеньку за реальный дефект печати. Оценивайте контуры на 100% и на масштабе, близком к размеру чтения. Сверхкрупный вид нужен для положения контрольных точек, но решение о пороге и толщине линий следует принимать по целому слову и абзацу. Иначе можно сохранить единичную слабую точку ценой грязного фона на всей странице.
Перемещаясь по странице, держите в поле зрения устойчивые ориентиры: верхнюю строку, нижнюю строку, внутренний и внешний край. После правки одного угла вернитесь к общему виду, потому что сдвиг рамки или сплайна влияет на всю геометрию. Особенно это важно для наклонной линии разделения и ручного распрямления: локально точная точка может ухудшить противоположную сторону.
Для повторяющихся действий используйте выделение миниатюр и область Apply to, а не пытайтесь воспроизвести числа вручную. Массовое применение сохраняет точное значение и уменьшает случайные расхождения. Исключения корректируйте после групповой настройки, начиная с страниц, которые визуально отличаются на ленте миниатюр.
Обложки, форзацы и титульные листы
Обложка часто имеет другой формат, цвет и количество полезных элементов, чем основной текст. Для неё обычно выбирают Color/Grayscale, рамку содержимого по всей значимой композиции и отдельные поля. Согласование размера с книжным блоком применяйте только тогда, когда итоговый PDF должен иметь единый лист; при передаче мастер-копии пропорцию обложки лучше сохранить и добавить нейтральные поля на этапе сборки.
Форзацы могут быть пустыми, узорными или содержать владельческие отметки. Если узор важен, не включайте чёрно-белый режим и не выравнивайте освещение слишком агрессивно. Пустой форзац всё равно может быть нужен для правильного разворота. Задайте ему размер, согласованный с соседними страницами, и проверьте, что он не исчез из последовательности после разделения.
Титульный лист и его оборот часто нарушают привычное чередование левых и правых полей. Не применяйте зеркальные настройки, опираясь только на номер файла. Откройте начало книги в режиме последовательного просмотра, определите фактическую сторону каждого листа и выделите диапазон, с которого начинается регулярное чередование.
На обложках и титульных листах рамка Select Content может захватывать декоративную рамку, виньетку или издательский знак. Это правильно, если элемент должен остаться. Не сужайте рамку до одного текста ради совпадения с основной полосой: лучше настроить отдельное выравнивание и сохранить композицию страницы.
Таблицы, формулы, ноты и технические схемы
Страницы с таблицами требуют осторожной бинаризации. Тонкие линейки исчезают раньше букв, а утолщение линий может соединить соседние ячейки. Проверяйте пересечения вертикалей и горизонталей, дробные черты, индексы и знаки операций. Если один общий порог не сохраняет и текст, и сетку, используйте серый вывод или подготовьте отдельную версию для OCR.
Математические формулы содержат маленькие индексы, точки, штрихи и символы, которые сильная очистка принимает за мусор. Уровень despeckling для таких страниц обычно должен быть мягче, чем для обычного текста. Сравните исходник и результат на формулах с верхними и нижними индексами, знаками интеграла, точками умножения и тонкими скобками.
Нотные страницы дают много длинных горизонтальных линий, поэтому автоматический Deskew часто определяет угол уверенно. Однако очистка и изменение толщины могут закрыть промежутки между линейками или удалить точки нот. Оцените несколько тактов на 100%, а страницы с рукописными пометами оставляйте в сером режиме, если их оттенок важен.
Технические схемы и карты нередко занимают почти весь лист. Select Content должен включать легенду, выносные линии и подписи у края. Автоматическая рамка ориентируется на плотные области и может не заметить одинокую тонкую стрелку. Расширьте её вручную и отключите сопоставление размеров, если широкая схема заставляет обычные страницы получать большие поля.
Газеты, журналы и многоколоночная верстка
На газетной странице полезная область может состоять из нескольких разнесённых колонок, заголовков и фотографий. Select Content задаёт общий прямоугольник, а не отдельные колонки, поэтому в рамку включается вся полоса. Пятна между колонками удаляются зонами или порогом, но геометрия должна сохранять взаимное положение материалов.
Смешанный режим удобен для журнала, где текст должен быть контрастным, а фотографии — цветными. Автоматическое распознавание изображений проверяйте возле рамок, цветных заголовков и рекламных блоков: алгоритм может считать крупный декоративный шрифт картинкой. Зонами добавьте настоящие фотографии и исключите области, которые должны стать чёрно-белыми.
Страницы с печатью навылет не имеют естественного белого поля. Если добавить большие поля в ScanTailor, дизайн изменится; если обрезать по содержимому слишком тесно, потеряется фон у края. Определите цель документа: для воспроизведения сохраняйте весь лист, для удобного чтения допустима согласованная рамка с небольшим безопасным запасом.
На старой газете фон часто неравномерен из-за тонкой бумаги и просвечивания оборота. Жёсткая бинаризация превращает просвет в шум. Попробуйте Color/Grayscale с выравниванием освещения либо мягкий чёрно-белый порог без сильного despeckling. Для OCR иногда лучше сохранить серый TIFF и позволить распознавателю выполнить собственную адаптивную обработку.
Рукописи, печати и учётные отметки
Рукописный текст отличается переменной толщиной и слабым контрастом. Чёрно-белый режим может разорвать бледные штрихи, особенно карандашные. Начните с Grayscale, сохраните фактуру и проверьте читаемость. Если нужна компактная читательская копия, создайте второй вариант с мягким порогом, не заменяя мастер-результат.
Печати и штампы часто имеют цвет, который в сером изображении оказывается светлее основного текста. В Mixed пометьте их как зону изображения, чтобы сохранить оттенок и форму. Не удаляйте штамп зоной заливки только потому, что он перекрывает поля: для исторического или юридического документа он может быть значимой частью содержания.
Карандашные номера, библиотечные шифры и владельческие пометы располагаются у края и легко выпадают из автоматической рамки. На Select Content расширяйте границу до этих элементов, если они должны войти в копию. При выравнивании страницы учитывайте, что одиночная помета увеличит рамку; иногда лучше сохранить её и задать индивидуальное положение листа.
Для документов с разрывами бумаги и неровными краями не пытайтесь сделать границу идеальной ценой обрезки текста. ScanTailor формирует прямоугольную страницу, но внутри неё можно оставить естественный контур листа в цветном режиме. Белое заполнение вокруг содержимого используйте только после проверки, что повреждённый край не несёт информации.
Выбор между Black and White, Mixed и Color/Grayscale
| Ситуация | Предпочтительный режим | Что проверить |
|---|---|---|
| Чистый печатный текст | Black and White | Пунктуацию, тонкие штрихи и фон |
| Текст с фотографиями | Mixed | Границы зон и цветные подписи |
| Факсимиле старого издания | Color/Grayscale | Фактуру бумаги и равномерность света |
| Слабая машинопись | Grayscale или мягкий Black and White | Разрывы букв и просвет оборота |
| Схема с цветными обозначениями | Color/Grayscale | Тонкие линии и легенду |
| Книга для компактного OCR | Black and White после теста | Высоту букв и отсутствие слипания |
Выбор режима делают не по категории книги, а по самому сложному типу страницы. Если большинство листов текстовые, а несколько содержат фотографии, основной диапазон можно обработать в Black and White, а иллюстрированные страницы — в Mixed или Color/Grayscale. Выделение миниатюр позволяет назначать режим группам без создания нового проекта.
Не оценивайте режим только по размеру файла. Чёрно-белый TIFF обычно меньше, но потерянные полутона и штрихи восстановить нельзя. Цветной файл тяжелее, зато даёт больше материала OCR и последующей коррекции. Для долгосрочного хранения разумно сохранить качественный мастер и отдельно подготовить облегчённый PDF для чтения.
Работа с левой и правой страницей разворота
После Split Pages обе половины разворота становятся самостоятельными страницами, но их геометрия связана способом съёмки. Внутренний край левой страницы и внутренний край правой обычно имеют разные тени и кривизну. Настройки dewarping следует проверять отдельно, даже если общий угол и поля применяются по чётности.
Зеркальные поля назначайте по фактической стороне страницы, а не слепо по чётности файла. Если серия начинается с обложки, одиночного титула или пропущенного листа, математическое чередование может сдвинуться. Найдите первый настоящий разворот и проверьте несколько последующих пар перед массовым применением.
Внутреннее поле не должно компенсировать ошибочную линию разделения. Сначала точно отделите страницы у корешка и включите весь текст в Select Content, затем добавляйте пространство в Page Layout. Иначе часть тени останется внутри содержимого, а полезная строка может быть обрезана до того, как поле начнёт действовать.
При просмотре итогового PDF разворот должен выглядеть симметрично: текстовые блоки находятся на сопоставимом расстоянии от центра, внешние поля не прыгают, номера страниц располагаются устойчиво. Если отдельная пара заметно смещена, вернитесь к рамке содержимого и выравниванию именно этих двух листов.
Промежуточные тесты вместо обработки всей книги
До массового Output сформируйте небольшой тестовый диапазон и пройдите полный цикл до PDF. Это обнаруживает проблемы, которые не видны в пределах одного этапа: неправильный порядок половин разворота, чрезмерный физический размер, слабое сжатие, исчезновение пунктуации после OCR или неверное положение внутренних полей.
Тестовый диапазон должен включать не только лучшие страницы. Добавьте самый тёмный скан, страницу с мелким шрифтом, фотографию, пустой лист и сильный изгиб. Если один набор параметров не справляется, заранее разделите проект на группы или запланируйте индивидуальные исключения. Это экономит время по сравнению с повторным формированием сотен TIFF.
После тестовой сборки откройте PDF на обычном экране и распечатайте одну страницу, если документ предназначен для бумаги. Экран скрывает различия физического DPI и ширины полей, а печать показывает реальный размер текста. Корректируйте исходные параметры ScanTailor, а не масштабируйте каждую страницу случайным образом при сборке.
Храните тестовый PDF и запись применённых параметров до завершения. При последующих изменениях можно сравнить два результата по одинаковым страницам и понять, улучшилась ли геометрия без потери деталей. Субъективное впечатление от разных участков книги менее надёжно, чем параллельное сравнение одних и тех же кадров.
Имена выходных файлов и порядок страниц
Выходные TIFF наследуют связь с исходной последовательностью и разделёнными страницами. После Split Pages один кадр может дать два файла, поэтому проверяйте не только алфавитный порядок, но и содержимое первых разворотов. Программа сборки PDF должна сортировать имена так же, как файловый менеджер, иначе номера с разной длиной могут перемешаться.
Не переименовывайте часть выходных файлов до окончания обработки проекта. Повторный Output может создать файл под исходным ожидаемым именем, и в папке появятся две версии одной страницы. Сначала завершите ScanTailor, сделайте резервную копию результата, затем выполняйте окончательную нумерацию отдельной операцией.
Если обнаружен пропущенный кадр, добавление его в середину завершённой серии может потребовать пересборки порядка. Безопаснее вернуть страницу в исходный набор, создать копию проекта или обработать её отдельно с теми же физическими параметрами, а затем вставить TIFF в нужное место при сборке PDF. Обязательно сравните поля и размер с соседями.
Для контроля создайте список файлов с номером, кратким содержанием и соответствием печатной странице. Такая ведомость особенно полезна для книг с ненумерованными вклейками, римской нумерацией предисловия и разворотными схемами. Она помогает отделить ошибку обработки от особенностей оригинального издания.
Внешняя подготовка, которая действительно помогает
До импорта полезно удалить полностью ошибочные кадры, исправить повреждённые файлы и привести имена к порядку. Коррекцию перспективы стоит выполнить заранее, если фотография представляет сильную трапецию и края страницы сходятся. ScanTailor затем займётся разделением, углом, содержимым, полями и остаточной кривизной.
Не применяйте к исходникам агрессивную резкость, бинаризацию и шумоподавление сразу в нескольких программах. Каждый этап может разрушить детали, а ScanTailor уже предоставляет порог, толщину линий и despeckling. Сохраняйте исходную тоновую информацию до момента, когда сможете сравнить варианты на конкретной странице.
Если сканер создал изображения с разными цветовыми профилями или глубиной, проверьте их во внешнем редакторе до проекта. Резкие изменения яркости между страницами трудно исправить одной массовой настройкой. Однако не конвертируйте всё в JPEG ради единообразия: TIFF или PNG сохранят больше информации для цветных и слабоконтрастных листов.
Многостраничный TIFF и PDF лучше предварительно разложить на отдельные страницы с предсказуемыми именами. Это делает проект прозрачным, позволяет исключать отдельные кадры и упрощает восстановление. После экспорта сравните число полученных файлов с количеством страниц в контейнере, чтобы не начать обработку с незаметным пропуском.
Как изолировать причину плохого результата
Если итоговая страница выглядит неправильно, двигайтесь назад по этапам. Сначала сравните TIFF с предпросмотром Output. Затем отключите dewarping, зоны и очистку, чтобы увидеть базовый режим. Если проблема остаётся, проверьте поля, рамку содержимого, угол и линию разделения. Последовательное отключение быстрее случайной смены всех параметров.
Потеря фрагмента обычно возникает в Split Pages или Select Content; лишнее пустое пространство — в Select Content или Page Layout; волнистый текст — в Dewarping; исчезнувшие мелкие знаки — в пороге, толщине линий или despeckling. Неверный физический размер связан с DPI. Такая карта причин позволяет сразу открыть нужный этап.
Проверяйте одну страницу-копию настроек, прежде чем применять исправление к группе. Если причина найдена, определите область её распространения: один кадр, все левые страницы, диапазон после смены сканирования или весь проект. Только после этого используйте Apply to. Массовое исправление без определения диапазона создаёт новые исключения.
Сохраняйте проект перед крупной правкой и формируйте тестовый TIFF с отдельным именем вне основной выходной папки, если сравнение особенно важно. Возможность вернуться к предыдущему состоянию ценнее, чем попытка запомнить десятки чисел и положений контрольных точек.
Пример обработки книги на несколько сотен страниц
Для большого проекта разделите работу на контрольные проходы. В первом проходе проверяются файлы, ориентация и разделение; во втором — угол и рамки содержимого; в третьем — поля; в четвёртом — Output и исключения. Не настраивайте dewarping каждой страницы до того, как подтверждён порядок и разделение: ранняя ошибка заставит повторять самую трудоёмкую работу.
После каждого прохода сохраняйте проект и записывайте диапазоны исключений. Например: цветные вклейки, страницы с картами, листы со слабой печатью, кадры после смены положения камеры. На Output эти группы можно выделить и назначить разные режимы, не разыскивая их заново по всей ленте.
Формируйте результат порциями, например по главам или по нескольким десяткам страниц, и сразу проверяйте файлы. Так ошибка диска, нехватка места или неверный параметр затронет ограниченный диапазон. После проверки объедините порции в одну последовательность, не меняя физический размер и принципы именования.
В конце выполните сквозной контроль по миниатюрам и отдельный контроль PDF. Первый ловит геометрические выбросы, второй — порядок, развороты и поведение страниц в реальном просмотрщике. OCR проверяется третьим проходом по поиску редких слов и копированию нескольких абзацев с разными шрифтами.
Что ScanTailor намеренно оставляет другим программам
Получение изображения со сканера выполняется заранее. В ScanTailor нет управления TWAIN, WIA или SANE, выбора устройства, автоподатчика и экспозиции устройства. Поэтому качество фокуса, блики, обрезанный край и реальное оптическое разрешение нужно контролировать во время сканирования или съёмки.
Распознавание символов также выполняется после подготовки. Программа не выдаёт редактируемый текст, не выбирает язык и не создаёт поисковый слой. Её параметры влияют на качество будущего OCR косвенно: выравнивают строки, сохраняют штрихи и удаляют фон. Языковые ошибки исправляются в OCR-системе или редакторе текста.
Многостраничный PDF или DjVu собирается из выходных TIFF отдельным инструментом. Это позволяет выбрать подходящий формат, сжатие и OCR, но требует дополнительного шага. Перед сборкой убедитесь, что все страницы обработаны и лежат в правильном порядке; после неё проверьте закладки, метаданные и свойства документа уже в PDF-редакторе.
Редактирование букв, замена слов, заполнение форм, подписи и аннотации находятся за пределами поэтапной подготовки сканов. Если такие действия нужны, сначала получите чистые страницы, затем переходите в PDF Commander или другой редактор. Разделение задач сохраняет качество: ScanTailor отвечает за изображение страницы, а редактор — за структуру и интерактивные элементы PDF.
Повторная обработка без потери ручных настроек
Если после сборки обнаружена проблема только на нескольких страницах, не создавайте проект заново. Откройте нужную миниатюру, перейдите к этапу, где возникла ошибка, измените линию, рамку или параметр и снова сформируйте Output для этого листа. Проверьте, что обновился правильный TIFF, затем замените соответствующую страницу в PDF. Остальные ручные решения проекта сохраняются.
При изменении общего параметра, например выходного DPI или режима обработки, заранее определите затрагиваемый диапазон. Изменение одной страницы не пересчитывает автоматически весь набор, а массовая команда может заменить уже проверенные исключения. Сначала сохраните копию проекта, затем примените параметр к выделенным страницам и сформируйте тестовые результаты из начала, середины и конца диапазона.
Если выходная папка содержит старые и новые файлы, ориентируйтесь на имена и время изменения, но не удаляйте всё до проверки. Создайте временный каталог для повторного диапазона или перенесите подтверждённый результат в резервную папку. Такой порядок исключает ситуацию, когда исправленная страница смешивается с устаревшей копией и в итоговый PDF попадает неверный вариант.
После точечной замены повторно проверьте соседние развороты. Изменение рамки содержимого или полей может сделать страницу немного шире и нарушить визуальный ритм пары. Если исправление влияет на общий согласованный размер, пересчитайте связанные страницы или задайте индивидуальную геометрию так, чтобы итоговый лист совпадал с основным форматом.
Как сохранить воспроизводимый результат
Для длительной работы полезно хранить рядом с проектом короткий журнал: фактический входной DPI, выбранный выходной DPI, режимы для основных диапазонов, правила чётных и нечётных полей, список цветных вклеек и страниц с ручным dewarping. Эти сведения позволяют понять замысел настроек спустя время и быстро продолжить работу на другом компьютере.
Не полагайтесь только на выходной PDF. Он не содержит линий разделения, рамок и зон, поэтому при обнаружении ошибки исправление в итоговом документе часто ведёт к повторному сжатию. Исходные изображения и проект дают возможность заново получить TIFF без ухудшения. Храните их хотя бы до окончательной приёмки и резервного копирования документа.
Контрольные хеши исходной папки помогают заметить случайную замену или повреждение файла. Для обычного домашнего проекта достаточно резервной копии и сверки количества файлов; для долговременного хранения полезно сформировать список SHA-256. Если один кадр изменился, перепроверьте его геометрию, даже когда имя и размеры остались прежними.
Воспроизводимость означает, что другой человек сможет открыть проект, найти исходники, понять группы настроек и повторить Output. Понятные имена папок, последовательная нумерация и отсутствие случайных копий final2 важнее сложной структуры. Результат должен быть проверяемым от исходного кадра до соответствующей страницы PDF.
Финальная проверка проекта перед сборкой документа
- Все исходные кадры идут в правильном порядке, дубликаты отсутствуют.
- Развороты разделены без потери букв у корешка.
- Наклон проверен на текстовых и нетекстовых страницах.
- Рамки содержимого включают номера, сноски и значимые пометы.
- Левые и правые поля зеркальны, а размер страниц согласован.
- Цветные иллюстрации сохранены нужным режимом и зонами.
- Despeckling не удаляет пунктуацию и мелкие элементы.
- Dewarping не создаёт волн и не растягивает буквы.
- Все TIFF пересозданы после последних изменений.
- Итоговые файлы проверены вне ScanTailor на масштабе 100%.
После этой проверки выходную последовательность можно передавать в OCR или PDF-редактор. Сохраняйте проект до тех пор, пока итоговый документ не проверен по порядку, качеству и поисковому слою: любая найденная ошибка исправляется точечно без повторного сканирования всей книги. Именно последовательная работа по этапам позволяет получить страницы с ровными строками, устойчивыми полями и сохранёнными деталями, а затем собрать из них удобный для чтения и печати PDF.