PDFify превращает сканы, фотографии, письма, веб-страницы и обычные PDF в документы с поиском по тексту, объединяет разнородные страницы, распознаёт их через Apple Vision или Tesseract, уменьшает размер файла, готовит PDF/A и запускает массовую обработку из Finder.
Работа строится вокруг одного окна: слева располагаются миниатюры страниц и команды добавления материалов, в центре — крупный просмотр выбранного листа, сверху — кнопки Scanner, Squeeze, OCR, Copy Text, Read, Print, Actions, Save As и Share. Такой порядок помогает сначала собрать документ, затем проверить ориентацию и последовательность страниц, после чего выполнить распознавание, сжатие или перевод в PDF/A.
Страницы можно перетащить из Finder, вставить из буфера обмена, получить со сканера, снять камерой iPhone либо добавить снимком области экрана. При импорте нескольких файлов PDFify создаёт единый документ, сохраняет визуальное представление страниц и применяет распознавание только там, где текстового слоя нет или пользователь явно запускает OCR повторно.
Скачать PDFify
- Редактирование PDF
- Русский интерфейс
- Просто новичкам
- Только macOS
- Нет правки текста
- Сжатие требует Pro
Окно документа и логика рабочего процесса
Центральная область показывает страницу почти так же, как она будет выглядеть после сохранения. Слева видны миниатюры, поэтому длинный договор, подборку чеков или набор отсканированных писем удобно проверять не по именам файлов, а визуально. Выбор миниатюры переводит просмотр к нужному листу; перетаскивание меняет порядок, а контекстные команды позволяют удалить ненужную страницу или повернуть её перед распознаванием.
Верхняя панель разделяет операции по назначению. Add Pages отвечает за пополнение документа, Scanner открывает получение бумажных страниц, Squeeze уменьшает объём, OCR создаёт или обновляет текстовый слой, Copy Text переносит распознанное содержимое в буфер, Read запускает чтение вслух, а Actions собирает дополнительные операции. Save As сохраняет копию под новым именем, Share передаёт файл системным способом, Print отправляет его в стандартное окно печати.
Нижняя строка служит для контроля состояния. В ней отображаются выбранный механизм OCR, язык, размер открытого файла и сведения о соответствии PDF/A, когда такой статус определён. После сжатия именно здесь удобно сравнить объём с исходным документом. Если результат оказался больше, чем ожидалось, можно сразу отменить действие и выбрать другой профиль, не закрывая окно и не собирая страницы заново.

Как собрать PDF из нескольких материалов
Самый быстрый путь — выделить в Finder изображения и PDF, затем перетащить их на окно. При одновременном импорте PDFify учитывает сортировку файлов, поэтому перед переносом полезно назвать их с числовыми префиксами: 001, 002, 003. Такой приём особенно важен для актов, приложений и страниц, которые сканировались отдельными заданиями. После добавления достаточно просмотреть колонку миниатюр и при необходимости перетащить один лист на правильное место.
Добавлять страницы можно не только в конец. Настройка вставки сверху полезна, когда новые сканы должны стать титульными листами или когда пачка документов оцифровывается в обратном порядке. Перед большой серией лучше проверить поведение на двух страницах: добавить первую, затем вторую и убедиться, что итоговая последовательность соответствует подаче бумаги. Это предотвращает ручную перестановку десятков миниатюр.
Если в окно попадает готовый PDF с нормальным текстовым слоем, программа не обязана растеризовать его. Текст, векторная графика и существующие страницы сохраняются, пока пользователь не выбирает режим сжатия, который превращает всю страницу в изображение. Поэтому объединение цифрового договора со сканированными приложениями можно выполнить так, чтобы печатный текст договора остался резким и доступным для поиска.
Контроль порядка и состава страниц
- Проверяйте первую и последнюю миниатюры каждой добавленной группы, чтобы сразу заметить обратный порядок подачи.
- Поворачивайте страницу до OCR: правильная ориентация улучшает разбиение строк и снижает число ошибочных символов.
- Удаляйте пустые листы до сжатия, иначе они займут место и попадут в нумерацию.
- После перестановки используйте поиск по характерному слову, чтобы убедиться, что текстовый слой относится к нужной странице.
- Сохраняйте промежуточную копию перед массовым удалением, если исходный набор трудно собрать повторно.

Добавление изображений, снимков экрана и буфера обмена
Кнопка File подходит для JPG, PNG, TIF и GIF, а многостраничный TIFF добавляется целиком. Это удобно при переносе материалов из программ сканирования, которые сохраняют пачку в один TIF. Для фотографий документов следует заранее выровнять перспективу и обрезать фон: PDFify распознаёт текст, но не заменяет специализированную коррекцию геометрии камеры. Чем ровнее строки и равномернее освещение, тем меньше исправлений потребуется после OCR.
Команда Screenshot позволяет сразу захватить область экрана и добавить её новой страницей. Рабочий сценарий подходит для квитанций, фрагментов справочных систем, диалогов настройки и других материалов, которые нельзя экспортировать в PDF. При включённом перемещении окна на задний план область под PDFify не перекрывается. После снимка стоит проверить масштаб: мелкий текст, снятый при низком разрешении, может выглядеть читаемо глазами, но давать нестабильное распознавание.
Вставка из буфера полезна, когда изображение уже скопировано из Preview, браузера, почтового клиента или редактора. Она избавляет от промежуточного сохранения PNG. Если в буфере находится не изображение, а обычный текст, результат зависит от приложения, из которого выполнялось копирование; для предсказуемого PDF лучше сначала вставить текст в документ и распечатать его в PDF либо использовать снимок области.
Импорт писем, веб-страниц и HTML
Письмо можно перетащить из почтового клиента в окно: содержимое преобразуется в постраничный PDF, после чего к нему применяются обычные операции. Такой путь полезен для счетов, подтверждений заказа и служебной переписки, где важны тема, дата, отправитель и тело сообщения. Перед сохранением следует проверить, попали ли вложения: письмо и приложенный файл могут потребовать отдельного добавления, если почтовая программа передаёт их как разные объекты.
Веб-страницу можно добавить через HTML либо копированием адреса в буфер с последующей вставкой. Результат зависит от печатного представления страницы: динамические блоки, всплывающие элементы и содержимое, загружаемое после прокрутки, могут не попасть в документ. Для юридически значимого подтверждения разумно сначала открыть печать в браузере и проверить страницы, а затем передать сформированный PDF в PDFify для OCR, объединения и уменьшения размера.
При работе с HTML важна ширина макета. Слишком широкая таблица может уменьшиться до нечитаемого кегля или разбиться на несколько листов. Если цель — сохранить именно текст для поиска, лучше выбрать печатную компоновку без боковых панелей. Если важна визуальная идентичность, сделайте серию снимков экрана с одинаковым масштабом и объедините их, предварительно исключив повторяющиеся области.
Сканирование бумажных документов
Scanner открывает диалог, в котором выбираются устройство, цветовой режим, разрешение и двусторонняя подача. На поддерживаемых системах компактный вид предназначен для быстрого запуска, а подробный показывает предварительный просмотр и параметры рядом. Полезно начать с тестового листа: проверить границы, резкость и ориентацию, а уже затем подавать пачку. Ошибка в области захвата на пятидесяти страницах исправляется гораздо дольше, чем один пробный скан.
Флажок добавления к открытому документу определяет, будет ли очередное сканирование продолжать текущий PDF или создаст новый. Для папки из отдельных договоров его лучше выключать между документами; для многостраничного дела — включать. Настройка особенно важна при планшетном сканере, где каждый лист запускается вручную: забытый флажок легко смешивает две независимые подборки.
Предварительный просмотр позволяет обвести область мышью, задать размеры в миллиметрах или дюймах и выбрать готовый формат A4 либо US Letter. Указанная область запоминается для конкретного сканера, поэтому регулярные чеки или бланки одинакового размера можно оцифровывать без повторной разметки. Если устройство подаёт бумагу слегка смещённо, оставьте небольшой запас по краям, иначе отдельные строки будут обрезаны.

Разрешение, цвет и двусторонняя подача
Для обычного печатного текста разумной отправной точкой служит 300 dpi. Более низкое значение уменьшает файл, но тонкие штрихи и мелкие индексы быстрее теряются; более высокое увеличивает время и объём, не всегда улучшая OCR. Чеки на термобумаге, документы с мелкими печатями и страницы после факса стоит проверять при повышенном разрешении, а затем уменьшать уже готовый PDF отдельным действием.
Цветовой режим выбирают по содержимому. Чёрно-белый подходит для чистых контрастных страниц и даёт малый объём, оттенки серого лучше сохраняют карандашные пометки и слабый текст, цвет нужен для штампов, схем и маркеров. Если цвет не несёт доказательной или рабочей ценности, сканирование в оттенках серого обычно даёт более предсказуемый баланс между читаемостью и размером.
Дуплекс следует включать только при наличии текста на обороте. Подача односторонних листов в двустороннем режиме создаёт пустые страницы, которые затем приходится удалять. Перед длинной пачкой проверьте, как сканер располагает оборот: некоторые устройства требуют поворота или иной ориентации бумаги, иначе каждая вторая страница окажется вверх ногами и ухудшит автоматическое распознавание.

Работа со ScanSnap и другими сканерами
PDFify можно выбрать назначением для ScanSnap, чтобы файл после физического сканирования сразу попадал в рабочее окно. В таком процессе настройки подачи и изображения задаются в программном обеспечении сканера, а PDFify отвечает за объединение, OCR, PDF/A и уменьшение объёма. Чтобы не потерять исходное качество, сначала отключите агрессивное сжатие в профиле ScanSnap и выполняйте оптимизацию один раз после распознавания.
Обычные устройства используют системный механизм сканирования macOS. Если сканер не появляется, проблема чаще связана с подключением, драйвером или разрешениями, а не с самим документом. Проверьте устройство в Захвате изображений, переподключите USB, убедитесь, что сетевой сканер находится в той же сети, и только затем повторно откройте Scanner. Если системная утилита тоже не видит устройство, исправление нужно начинать на уровне драйвера.
Для потоковой работы удобно создать отдельный профиль: 300 dpi, оттенки серого, автоматическая подача, сохранение всех листов в открытый документ. После пачки выполняются четыре проверки: порядок, пустые страницы, поворот, наличие текста. Лишь после этого применяются PDF/A и сжатие. Такая последовательность уменьшает риск повторной оцифровки бумаги.
Сканирование камерой iPhone или iPad
Команда iPhone использует Continuity Camera и превращает мобильное устройство в сканер. На телефоне открывается режим захвата документа, который находит границы листа и передаёт результат в окно. Способ подходит для нескольких страниц, когда рядом нет планшетного сканера. Для длинной пачки он менее удобен: каждую страницу требуется ровно держать, контролировать свет и подтверждать кадр.
Перед съёмкой положите бумагу на контрастный однотонный фон, уберите блики и держите камеру параллельно листу. Автоматическое обнаружение границ не исправляет сильную кривизну книги и тени у корешка. Для разворотов лучше снимать страницы по отдельности, затем расположить их в правильном порядке по миниатюрам. Мелкий текст проверяют при увеличении до запуска OCR.
Если команда не показывает телефон, проверьте Wi‑Fi, Bluetooth, учётную запись Apple и разрешение на камеру. Устройства должны поддерживать функции непрерывности и находиться рядом. После восстановления связи закройте диалог сканирования и откройте его заново, потому что список доступных камер не всегда обновляется в уже открытом окне.
Когда OCR запускается автоматически
После добавления изображения или сканированной страницы PDFify проверяет, есть ли в ней доступный текст. При его отсутствии распознавание применяется автоматически согласно выбранному механизму и языкам. Готовый цифровой PDF с текстом обычно не требует повторной обработки: это сокращает время и не заменяет качественные символы распознанной копией.
Если страница содержит неправильный или неполный текстовый слой, автоматическая проверка может решить, что OCR не нужен. В таком случае нажимают OCR вручную и подтверждают повторное распознавание. Это характерно для старых сканов, где в файле присутствует невидимый текст с ошибками. После обработки нужно сравнить поиск по нескольким словам до и после, поскольку визуально страница может не измениться.
Повторный OCR полезен и при смене языка. Документ можно распознать сначала с одним набором, проверить фамилии и термины, затем вернуться к исходным изображениям и выполнить операцию с другой конфигурацией. Программа старается использовать исходные данные страниц, чтобы многократное действие не накапливало потери от повторного JPEG-сжатия.
Выбор между Apple Vision и Tesseract
Apple Vision удобен для быстрого распознавания документов с чёткой печатью и умеет автоматически определять язык. Он использует системные возможности, поэтому поведение зависит от установленной macOS и поддерживаемых ею языков. Для смешанного документа это уменьшает число ручных переключений, но автоматическое определение всё равно следует проверять на именах, индексах и коротких строках, где контекста мало.
Tesseract предназначен для более широкого набора языков и позволяет загрузить нужные языковые данные. В списке можно активировать несколько пакетов, однако чрезмерно широкий набор увеличивает неоднозначность: похожие буквы разных алфавитов начинают конкурировать. Для русско-английского договора выбирают русский и английский, а не десятки языков на всякий случай.
Сравнивать механизмы лучше на одной типичной странице, а не по абстрактной оценке. Выберите лист с мелким текстом, таблицей, номером договора и печатью, распознайте его каждым способом, затем скопируйте текст и сравните ключевые поля. Победителем считается не тот, кто дал красивый общий текст, а тот, кто точнее сохранил критичные значения вашего рабочего процесса.

Языковые данные Tesseract
В настройках языков рядом с каждым пакетом отображается состояние загрузки. Для часто используемых языков выбирают данные с подходящим балансом скорости и точности. Более точный набор занимает больше места и обрабатывается дольше; быстрый подходит для массовых однотипных страниц с хорошей печатью. После загрузки язык нужно не только установить, но и отметить активным.
Русский текст требует кириллического пакета. Если активен только English, слова будут превращаться в набор похожих латинских знаков, а поиск по русским запросам не сработает. Для форм, где встречаются латинские номера моделей и адреса электронной почты, добавляют English вторым языком. Для полностью русских чеков часто лучше оставить только русский, чтобы снизить путаницу между C/С, P/Р и H/Н.
После обновления или переноса настроек проверьте, сохранились ли языковые данные. Признак проблемы — пустой результат, сообщение о недоступном языке или неожиданное переключение на другой механизм. Откройте Text Recognition, убедитесь, что пакет отмечен как загруженный, затем повторите OCR на одной странице, прежде чем запускать сотни файлов.

Подготовка русскоязычных документов к распознаванию
Наибольший прирост точности даёт не переключатель, а качество страницы. Текст должен быть ориентирован горизонтально, занимать достаточную долю изображения и иметь ровный фон. Слабый серый шрифт на жёлтой бумаге распознаётся хуже, чем контрастная копия. Для термочеков помогает сканирование в оттенках серого с достаточным разрешением; для фотографий — равномерный свет без бликов.
Сложности создают печати поверх текста, рукописные пометки, декоративные шрифты и таблицы без чётких границ. PDFify создаёт текстовый слой для поиска и копирования, но не обещает восстановить исходную табличную структуру как в электронной таблице. Если задача требует дальнейших вычислений, после экспорта текста понадобится отдельная проверка колонок и чисел.
Для документов с дореформенной орфографией, редкими символами, формулами или смешением кириллицы и греческого алфавита нужно ожидать ручной корректировки. Практичный метод — составить перечень контрольных слов и чисел: фамилия, дата, сумма, номер, артикул. После OCR найти каждое из них. Такой тест быстрее полного чтения и выявляет системные ошибки выбранного языка.
Как проверить качество текстового слоя
Визуальная картинка после OCR обычно остаётся прежней, поэтому оценивать только страницу недостаточно. Нажмите Copy Text и вставьте содержимое в обычный текстовый редактор. Проверьте порядок абзацев, пробелы, переносы, цифры и знаки валют. Для многостолбцовой страницы текст может идти не в том порядке, в каком его читает человек; это влияет на экспорт, хотя поиск отдельных слов продолжает работать.
Второй тест — поиск средствами просмотра PDF. Введите редкое слово из середины, фамилию и последовательность цифр. Если слово выделяется в правильном месте, слой связан со страницей корректно. Если поиск находит невидимый текст в другой области, исходный файл мог содержать смещённый слой; повторный OCR обычно исправляет ситуацию, но результат нужно снова проверить.
Третий тест — увеличение. При сильном масштабе убедитесь, что исходное изображение не стало заметно хуже после сохранения. OCR сам по себе не обязан снижать качество, но при сохранении страницы изображения могут быть пересжаты согласно настройкам Squeeze. Для технических чертежей и мелких штрихкодов выберите щадящее сжатие или сначала сохраните контрольную копию.
Повторное распознавание, поворот и отмена
Поворот следует выполнять до OCR, потому что положение строк влияет на сегментацию. Если страница уже распознана, поверните её и запустите распознавание снова. Для документов, где часть листов перевёрнута, удобнее выделять и исправлять их по миниатюрам до массовой операции. Это быстрее, чем разбираться с перевёрнутым текстом в экспортированном TXT.
Undo возвращает изменения шаг за шагом, включая перестановку, удаление и операции обработки. Комбинация Command-Z отменяет действие, а Command-Shift-Z повторяет его. После серии преобразований следите, что именно отменяется: если между сжатием и OCR было несколько перестановок, одно нажатие вернёт лишь последний шаг. Для критичного набора сохраните промежуточную копию.
Повторное распознавание с другим механизмом — нормальная часть проверки сложных страниц. Сначала сохраните исходный файл, затем сравните Apple Vision и Tesseract на копии. Не судите по одному абзацу: механизм может лучше распознать обычный текст, но хуже таблицу или номера. Решение принимают по тем полям, которые реально будут искаться и извлекаться.
Копирование текста и чтение вслух
Copy Text помещает всё распознанное содержимое документа в буфер. Команда полезна для быстрого переноса письма в заметки, подготовки черновика ответа или проверки OCR. Она не является редактором PDF: изменения, сделанные в текстовом редакторе, не возвращаются автоматически на страницу. Для исправления внешнего вида понадобится программа, которая умеет редактировать содержимое PDF.
Read воспроизводит текст системным голосом. Это помогает прослушать длинный документ, проверить пропущенные слова и работать с текстом без постоянного взгляда на экран. Повторное нажатие останавливает чтение. Произношение зависит от выбранного в macOS голоса и языка; русскоязычный документ следует читать русским голосом, иначе даже правильно распознанные слова будут звучать искажённо.
Если Copy Text выдаёт пустой результат, сначала проверьте, существует ли текстовый слой. Запустите OCR, дождитесь завершения и повторите команду. Если текст есть только на части страниц, возможно, другие листы считались уже распознанными из-за дефектного слоя. Выберите проблемную страницу и выполните принудительное распознавание.
Экспорт в TXT и JSON
Через File → Export можно получить обычный TXT или структурированный JSON. TXT подходит для чтения, полнотекстового индексирования и передачи в редактор. Он не сохраняет расположение блоков, изображения и визуальную разметку. Поэтому его используют как содержимое, а не как замену оригиналу. Для договоров и отчётов храните PDF рядом с извлечённым текстом.
JSON полезен при автоматической обработке, поскольку позволяет передать текстовые данные в сценарий или систему учёта в структурированном виде. Точный набор полей следует проверить на тестовом документе перед интеграцией. Не стройте рабочий процесс на предположении, что каждая таблица станет массивом ячеек: OCR в первую очередь распознаёт текст и координатные данные, а смысловые поля определяет уже последующая логика.
Если экспорт содержит неправильный порядок строк, причина обычно в сложной геометрии страницы. Две колонки, боковые подписи и плавающие блоки могут читаться иначе. Для поиска это не критично, но для загрузки в базу потребуется разбиение по ключевым словам или ручная проверка. На однотипных бланках полезно заранее выбрать стабильную область и одинаковый способ сканирования.
Уменьшение размера PDF
Squeeze открывает параметры оптимизации. Важно различать уменьшение встроенных изображений и растеризацию страницы целиком. Первый подход сохраняет настоящий текст и векторные элементы, поэтому буквы остаются резкими при увеличении. Второй превращает страницу в картинку и может дать более сильное сокращение, но после него требуется OCR, чтобы документ снова был доступен для поиска.
Перед обработкой посмотрите размер в строке состояния и сохраните копию. После действия сравните не только мегабайты, но и мелкие элементы: штрихкоды, печати, тонкие линии, сноски. Слишком агрессивный профиль может выглядеть нормально на экране, но плохо печататься или распознаваться. Для рабочих документов качество важнее нескольких дополнительных мегабайт.
Сжатие уже хорошо оптимизированного цифрового PDF иногда почти ничего не даёт. В таком файле текст и векторная графика занимают мало места, а изображения уже сжаты. Повторная обработка может только ухудшить фотографии. Если размер после операции не уменьшился, вернитесь через Undo и оставьте исходный документ либо измените только самые тяжёлые изображения другим инструментом.

Четыре режима Squeeze
- Compress images only. Уменьшает встроенные изображения и старается сохранить текст и векторную графику без растеризации.
- Rasterize in color. Превращает страницы в цветные изображения; подходит для смешанных материалов, когда важны цветные отметки.
- Rasterize in grayscale. Удаляет цвет, сохраняя полутона; часто подходит для договоров, чеков и писем с серыми элементами.
- Rasterize in black and white. Создаёт однобитные страницы и даёт малый объём на чистом чёрно-белом тексте, но плохо подходит для фотографий и слабых печатей.
Выбор режима определяется содержимым, а не желанием получить минимальный файл любой ценой. Цифровой отчёт с графиками лучше начать с Compress images only. Скан обычного договора можно проверить в grayscale. Чистые машинописные листы на белой бумаге допускают black and white, но только после просмотра тонких символов. Цветные печати и выделения требуют color.
После растеризации сразу запускайте OCR и проверяйте поиск. Иначе документ визуально сохранится, но текст перестанет выделяться. Если исходный файл уже имел качественный слой, режим только для изображений предпочтительнее: он уменьшает фотографии, не разрушая данные, которые были созданы авторской программой.
Пользовательские профили и Guard
В пользовательском профиле задаются разрешение и качество. Более высокое dpi сохраняет мелкие детали, но увеличивает объём; более низкое подходит для экранного чтения. Качество JPEG влияет на фотографии и цветные области. Настраивать параметры нужно на типичной странице, затем распечатать или увеличить её до рабочего масштаба. Одной универсальной комбинации для чеков, чертежей и журналов нет.
Guard защищает от бессмысленного увеличения: если обработанный файл получается больше исходного, сохраняется оригинал. Функция особенно полезна при пакетной работе, где среди тяжёлых сканов встречаются уже оптимизированные документы. Без неё единый профиль мог бы уменьшить одни файлы и увеличить другие.
Для повторяющихся задач создайте несколько понятных профилей: текст для почты, цветные акты, долгое хранение. Название должно отражать назначение, а не абстрактное качество. После изменения параметров повторно проверьте один файл: небольшая поправка dpi может заметно изменить читаемость мелких цифр.
Размер страницы и единая компоновка
Импортированные изображения можно оставить в исходном размере либо вписать в стандартный лист. Доступны A3, A4, A5, US Letter, US Legal и Tabloid. Ограничение размера полезно, когда фотографии, сканы и снимки экрана имеют разные физические размеры и должны печататься предсказуемо. Без него одна страница может оказаться огромной, а следующая — слишком маленькой.
Для российских офисных документов чаще выбирают A4. A3 нужен для больших схем, A5 — для небольших бланков, американские форматы — для материалов, полученных от зарубежных партнёров. Вписывание не добавляет детализацию: маленькое исходное изображение, растянутое до A3, останется размытым. Сначала оценивают пиксельное разрешение, затем выбирают физический лист.
При стандартизации проверяйте поля и ориентацию. Горизонтальная таблица, автоматически вписанная в вертикальный A4, может стать слишком мелкой. В таком случае поверните страницу или оставьте исходный размер. Для печати полезно открыть системный предварительный просмотр и убедиться, что масштаб не обрезает края.
Подготовка PDF/A
PDF/A предназначен для долговременного хранения и ограничивает элементы, которые могут зависеть от внешней среды. PDFify умеет сохранять PDF/A-2u и показывает обнаруженный статус в нижней строке, например PDF/A-1b. Буква и номер имеют значение для требований организации, поэтому перед сдачей документа уточните, какой профиль принимает система.
При преобразовании могут удаляться ссылки, мультимедиа, шифрование и другие несовместимые возможности. Это не дефект, а следствие правил формата. Если интерактивность важна, сохраните обычный PDF отдельно. Для официального набора разумно хранить две копии: рабочую с ссылками и защищёнными элементами и PDF/A для передачи в систему хранения.
Некоторые шрифты мешают созданию соответствующего файла, если их нельзя встроить. В таком случае сначала попробуйте распечатать документ в новый PDF либо заменить проблемный материал на изображение страницы, понимая, что это уничтожит настоящий текст и потребует OCR. После сохранения проверьте статус, поиск и внешний вид нескольких страниц, а не только отсутствие сообщения об ошибке.
Линеаризованный PDF для быстрой загрузки
Линеаризация перестраивает внутреннее расположение данных так, чтобы первая страница могла отображаться до полной загрузки файла. Это полезно для больших инструкций, каталогов и отчётов, которые публикуются на сайте или передаются через медленное соединение. Визуальное содержание не меняется, но сервер и просмотрщик должны поддерживать поэтапную выдачу.
Линеаризация не заменяет сжатие. Большой файл может начать открываться быстрее, но его полный объём останется прежним. Для публикации сначала выберите подходящий профиль Squeeze, затем создайте линейное представление и проверьте результат. Не растеризуйте цифровой текст без необходимости: резкие векторные буквы быстрее передаются и лучше масштабируются.
После любого преобразования полезно повторно открыть файл в другом просмотрщике. Это выявляет ошибки структуры, которые не видны в окне, где документ уже находился в памяти. Проверьте первую страницу, переход к середине, поиск и печать одной страницы.
Быстрые действия Finder
Начиная с поддерживаемых выпусков macOS, Finder показывает Quick Actions для создания поискового PDF, преобразования в PDF/A и уменьшения размера. Файлы выделяются в папке, затем команда запускается из контекстного меню или панели предварительного просмотра. Это удобнее открытия каждого документа, когда параметры уже проверены на однотипной пачке.
Результаты могут получать суффиксы .searchable.pdf, .pdf-a.pdf и .min.pdf. Такой способ сохраняет исходники и помогает понять, что было сделано. Настройка замены исходного файла экономит место, но повышает риск: один неподходящий профиль применится ко всей выборке. До массовой замены протестируйте действие на копиях.
Быстрые действия используют настройки PDFify. Если вчера был выбран чёрно-белый профиль для договоров, а сегодня обрабатываются цветные сертификаты, Finder не спросит обо всех деталях заново. Поэтому перед каждой новой группой откройте настройки, проверьте механизм OCR, языки, режим Squeeze и политику имён.
Если действия не отображаются
- Откройте системные настройки расширений и убедитесь, что действия PDFify разрешены для Finder.
- Перезапустите Finder или выйдите из учётной записи после установки.
- Проверьте тип выделенного файла: команда появляется только там, где операция применима.
- Откройте PDFify хотя бы один раз, чтобы система зарегистрировала компоненты.
- Если пункт скрыт в меню Настроить, добавьте его в список доступных быстрых действий.
App Shortcuts, Spotlight и Siri
На системах с поддержкой App Shortcuts доступны команды Squeeze PDF, Make PDF Searchable, Convert PDF to PDF/A, Get PDF/A Status, Get Text from PDF и Export PDF Text Data as JSON. Их можно вызывать из Shortcuts, Spotlight и Siri. Основная ценность — связывание операций: взять файлы из папки, распознать, проверить статус, извлечь данные и переместить результат.
Сценарий следует собирать постепенно. Сначала передайте один PDF в Make PDF Searchable и убедитесь, что выходной файл существует. Затем добавьте Squeeze, после него проверку PDF/A и перемещение. Если включить все шаги сразу, трудно понять, где возникла ошибка или почему потерялся текстовый слой.
Для голосового запуска используйте короткое уникальное имя команды. Для массовых операций Siri менее удобна, чем папка или выбор Finder, потому что файлы нужно однозначно определить. Spotlight хорошо подходит для единичного документа, а Shortcuts — для повторяемого процесса с условиями и именованием.
Пакетная обработка без потери контроля
Пакетный процесс начинается с однородной группы. Не смешивайте в одном запуске цветные сертификаты, чистые текстовые сканы и цифровые отчёты: им нужны разные режимы. Разделите папку по типу, затем обработайте по одному тестовому файлу из каждой группы. Так параметры становятся воспроизводимыми, а результат легче проверять.
Для OCR выберите минимальный набор языков, для Squeeze — профиль, который сохраняет критичные детали, для PDF/A — требуемый стандарт. Сохраняйте исходники до окончания выборочной проверки. В каждой партии откройте первый, средний и последний файл, найдите контрольное слово и сравните размер. Если есть ошибки, остановитесь и измените параметры до обработки остальных.
Имена файлов должны позволять связать результат с исходником. Суффиксы быстрых действий подходят для этого лучше перезаписи. После подтверждения качества лишние копии можно удалить. Такой порядок занимает немного больше места, но предотвращает ситуацию, когда ошибочно растеризованные или обрезанные документы невозможно восстановить.
Практический процесс для чеков и квитанций
Чеки часто имеют слабую термопечать, нестандартную длину и мелкие цифры. Сканируйте их в оттенках серого при достаточном разрешении, выравнивайте лист и не используйте однобитный режим до проверки. Для длинного чека задайте исходный размер, иначе автоматическое вписывание на A4 уменьшит текст. После OCR ищите сумму, дату и ИНН или номер заказа.
Несколько чеков можно собрать в один PDF, но для бухгалтерского учёта удобнее один документ на операцию либо на отчётный период с понятными разделителями. Добавьте титульную страницу из текстового редактора, затем чеки по дате. Если оборот содержит условия гарантии, включите двустороннее сканирование или добавьте отдельный снимок.
Сжатие для чеков проверяют особенно внимательно: тонкие цифры 3, 5, 8 и 9 легко становятся похожими. Режим grayscale обычно безопаснее black and white. Если результат предназначен только для поиска и просмотра, умеренное снижение качества допустимо; для налоговой или гарантийной процедуры важнее сохранение исходной картинки.
Договоры, акты и служебная переписка
Договор обычно состоит из цифровой основной части и сканированных подписей. Добавьте цифровой PDF первым, затем приложения и листы с подписями. Используйте режим сжатия только изображений, чтобы не уничтожать настоящий текст основной части. OCR примените к сканам, затем найдите номер договора, фамилию и дату.
Для актов с печатями сохраняйте цвет, если оттенок имеет значение. Печать поверх подписи ухудшает распознавание, поэтому контроль проводят по соседним печатным строкам. Не полагайтесь на OCR для проверки подписи или подлинности: текстовый слой помогает искать, но не анализирует юридическую силу изображения.
Письма из почтового клиента лучше добавлять вместе с отдельными вложениями. После преобразования проверьте заголовки и переходы страниц. Если длинная цепочка содержит повторяющиеся подписи и цитаты, поиск будет находить несколько совпадений; для удобства можно сохранить только нужное письмо, предварительно открыв его отдельно.
Книги, инструкции и технические страницы
Для книги главная проблема — кривизна у корешка и тени. PDFify не выполняет сложное выпрямление разворота, поэтому качество определяется съёмкой или сканером. Разделяйте разворот на две страницы, прижимайте лист без повреждения переплёта и выбирайте разрешение, достаточное для сносок. После OCR проверяйте переносы слов и порядок колонок.
Технические инструкции содержат схемы, подписи и мелкие обозначения. Не применяйте агрессивную растеризацию и низкий dpi. Режим сжатия только изображений позволяет сохранить векторные линии и текст, если исходный PDF цифровой. Для скана используйте цвет или оттенки серого в зависимости от схем и маркеров.
Формулы и код требуют особой проверки. Обычный OCR может путать ноль и букву O, единицу и l, математические знаки и индексы. Для таких документов PDFify лучше использовать для поиска по словам и заголовкам, а не как средство точного переноса формул в редактор. Важные выражения сверяют по изображению.
Сохранение, печать и системная отправка
Save As создаёт файл под выбранным именем и оставляет исходник отдельно. Это предпочтительно после OCR, PDF/A или Squeeze, пока результат не проверен. Простая команда Save может обновить открытый документ; выбор зависит от того, требуется ли сохранить исходное состояние. Для важных бумаг используйте новое имя с понятным суффиксом.
Share открывает системное меню отправки. Доступные пункты зависят от настроенных приложений и служб: AirDrop, Mail, Messages и другие. Перед отправкой посмотрите размер и убедитесь, что адресат получит именно финальный файл, а не промежуточную копию. Для почты большой документ сначала сжимают, но не за счёт потери обязательных деталей.
Print использует стандартные параметры macOS. Проверьте формат бумаги, масштаб, ориентацию и двустороннюю печать. Документ с нестандартными размерами страниц может автоматически уменьшаться; если это нежелательно, заранее приведите изображения к A4 или другому целевому формату. Для PDF/A печать не является проверкой соответствия, она оценивает только внешний вид.
Настройки панели и строки состояния
Панель инструментов настраивается через контекстное меню. Оставьте часто используемые кнопки и уберите лишние, чтобы последовательность отражала ваш процесс: Add Pages, OCR, Squeeze, Save As. Для оператора сканирования полезнее Scanner и OCR, для сотрудника, который обрабатывает готовые файлы, — Actions и Share.
Строка состояния помогает не открывать отдельные свойства файла. Перед сжатием запишите исходный размер, после — сравните. Индикатор OCR показывает механизм и язык; это быстрый способ заметить, что вместо русского выбран английский. Статус PDF/A позволяет проверить преобразование, но при строгих требованиях дополнительно используют валидатор принимающей организации.
Настройки действуют не только в открытом окне, но и в Finder и Shortcuts. Поэтому изменение профиля имеет широкий эффект. После эксперимента верните рабочие значения или дайте профилю явное имя. Хорошая практика — хранить краткую инструкцию с рекомендуемыми параметрами для каждой группы документов.
Конфиденциальность и обработка документов
Apple указывает, что разработчик не собирает данные из приложения. Распознавание выполняется механизмами Apple Vision или Tesseract на устройстве, поэтому документы не нужно загружать в сторонний конвертер. Это полезно для договоров, медицинских бумаг и внутренних отчётов, однако пользователь всё равно отвечает за место сохранения, резервные копии и передачу файла.
Системная отправка может передать документ внешней службе, если пользователь выбрал почту, облако или мессенджер. Сам факт обработки в PDFify не делает последующую доставку закрытой. Перед Share проверьте адресата и политику организации. Для конфиденциальной папки разумно ограничить синхронизацию и настроить шифрование диска.
PDF/A не является шифрованием и обычно несовместим с защитой паролем. Если требуется долговременное хранение и ограничение доступа, меры применяются на уровне защищённого хранилища, прав доступа или контейнера. Не пытайтесь оценивать безопасность только по расширению PDF.
Большие документы и производительность
Время OCR зависит от числа страниц, разрешения, выбранного механизма и языков. Фотографии высокого разрешения требуют больше памяти, чем уже оптимизированные сканы. Для сотни страниц сначала протестируйте пять типичных листов и оцените скорость. Если Mac начинает активно использовать подкачку, разделите документ на части, распознайте их и объедините позже.
Во время длительной операции не запускайте параллельно несколько тяжёлых задач без необходимости. Это может увеличить время и затруднить понимание, какой процесс завершился. Следите за свободным местом: промежуточные изображения и новые копии требуют дополнительного объёма, особенно при цветном 600 dpi.
Если работа прерывается на одной странице, попробуйте открыть её отдельно. Повреждённое изображение, необычный JPEG или огромный физический размер могут быть причиной. Пересохраните проблемный лист в PNG или новый PDF, добавьте его обратно и продолжите. Такой подход лучше, чем повторять всю пачку без диагностики.
Совместимость с macOS и системными функциями
PDFify предназначен для Mac и требует macOS 10.14 или новее. Отдельные возможности зависят от более новых систем: быстрые действия Finder доступны на поддерживаемых выпусках начиная с macOS 11, App Shortcuts — с macOS 13, а переработанный диалог сканера — с macOS 14. На более ранней совместимой системе используется классическое окно сканирования.
Программа поддерживает компьютеры Intel и Apple Silicon. Tesseract оптимизирован для современных процессоров Apple, но фактическая скорость зависит от документа. Перед обновлением большого рабочего парка проверьте сканер, Finder Actions и сценарии Shortcuts на одном Mac, потому что драйверы оборудования могут иметь собственные ограничения.
Интерфейс доступен на английском и немецком; в новых сборках добавлен французский. Русской локализации нет, поэтому в статье используются оригинальные названия кнопок, которые видны на панели. Основные операции легко узнаются по пиктограммам, но сложные параметры OCR и Squeeze стоит один раз записать в внутреннюю инструкцию.
Бесплатные возможности и PDFify Pro
Без покупки доступны базовые способы добавления страниц, оба механизма OCR, работа со сканером, ScanSnap, буфером обмена, камерой iPhone, письмами и веб-страницами, а также копирование, чтение, печать, сохранение и отправка. Это позволяет проверить качество распознавания на реальных документах до оплаты дополнительных функций.
PDF/A, Squeeze, линеаризация, расширенные настройки точности и часть автоматизации относятся к платным возможностям. Состояние лицензии видно в настройках PDFify Pro. Если кнопка неактивна или появляется предложение разблокировки, сначала проверьте, входит ли действие в приобретённые возможности, а не переустанавливайте программу.
Покупку выбирают по рабочему сценарию. Для разового OCR нескольких сканов может хватить базовых инструментов. Регулярное уменьшение файлов, долговременное хранение и пакетные действия оправдывают Pro. Перед оплатой проверьте распознавание русского текста и совместимость со сканером, потому что лицензия не исправит качество исходных страниц.
Что делать, если OCR даёт ошибки
Сначала определите тип ошибки. Неверный алфавит указывает на язык; пропущенные тонкие буквы — на качество скана; перепутанный порядок — на сложную компоновку; пустой результат — на отсутствие языковых данных или сбой конкретной страницы. Менять все параметры одновременно нельзя: иначе невозможно понять, что помогло.
- Поверните страницу и обрежьте лишний фон.
- Выберите один основной язык и при необходимости один дополнительный.
- Сравните Apple Vision и Tesseract на той же странице.
- Увеличьте разрешение при повторном сканировании или используйте исходное изображение.
- Скопируйте текст и проверьте контрольные слова, цифры и фамилии.
- Сохраните отдельную копию только после подтверждения результата.
Если буквы выглядят правильно, но поиск не работает, проблема может быть в старом текстовом слое. Выполните принудительный OCR и сохраните под новым именем. Если текст находится не на той строке, пересоздание слоя обычно помогает. Для окончательной проверки откройте файл в Preview и выполните поиск там.
Ошибки сканера и камеры
Когда Scanner не видит устройство, проверьте его в системном Захвате изображений. Если там сканирование работает, закройте PDFify, переподключите устройство и откройте программу снова. Для сети проверьте один сегмент Wi‑Fi и отсутствие блокировки межклиентского обмена. Для USB замените кабель или порт.
Если предварительный просмотр есть, а скан обрезается, сбросьте сохранённую область или задайте размеры вручную. Настройка запоминается для устройства, поэтому прежний формат чека может случайно примениться к A4. При автоподатчике проверьте направляющие бумаги и не задавайте область уже физического листа.
Continuity Camera требует близости устройств, активных Wi‑Fi и Bluetooth и общей учётной записи. Если телефон отображается, но захват не начинается, разблокируйте его и повторно выберите команду. После съёмки дождитесь передачи страницы, прежде чем закрывать мобильный интерфейс.
Ошибки сжатия и качества изображения
Если файл стал больше, включите Guard и проверьте, не был ли исходник уже оптимизирован. Для цифрового PDF используйте режим только для изображений. Растеризация в высоком dpi может увеличить объём, потому что каждая векторная страница превращается в крупную картинку. Снижайте параметры постепенно и сравнивайте.
Если текст стал размытым, отмените действие и не растеризуйте страницу. Настоящий цифровой текст должен оставаться векторным. Для сканов поднимите dpi или качество JPEG. Чёрно-белый режим замените оттенками серого, если исчезают печати, тонкие линии или светлые буквы.
Если после Squeeze пропал поиск, страницы были растеризованы. Запустите OCR, выберите языки и сохраните новую копию. Для большого набора лучше изменить порядок сценария так, чтобы OCR выполнялся после растеризации автоматически или отдельным шагом Shortcuts.
Ошибки PDF/A и сохранения
Неудача PDF/A часто связана с шрифтами, шифрованием, мультимедиа или повреждённой структурой. Откройте документ в Preview и сохраните новую копию, затем повторите преобразование. Если важны ссылки и интерактивные элементы, сохраните обычный PDF отдельно, потому что соответствующий формат может их удалить.
Если сохранённый файл не открывается, проверьте свободное место и попробуйте другое имя в локальной папке пользователя. Сетевой диск или синхронизируемая папка могут временно блокировать запись. Сначала сохраните на Рабочий стол, откройте результат, затем переместите его.
Статус в строке состояния помогает проверить, распознан ли PDF/A. Для требований суда, бухгалтерской системы или государственного шлюза используйте их валидатор: разные системы принимают разные профили. Визуально одинаковый файл может не пройти формальную проверку.
Поддерживаемые входные материалы и ожидаемый результат
PDFify принимает существующие PDF, изображения JPG, PNG, TIF и GIF, HTML, письма, снимки экрана, данные сканера и страницы, снятые камерой iPhone. Для каждого типа действует своя логика. PDF открывается как набор готовых страниц, многостраничный TIFF раскладывается на все листы, одиночное изображение становится отдельной страницей, а HTML и письмо сначала получают печатное представление. Поэтому одинаковая команда добавления может дать разный физический размер листа и разное качество текста.
| Материал | Что проверить после добавления | Подходящая следующая операция |
|---|---|---|
| Цифровой PDF | Сохранились ли поиск, ссылки и резкость текста | Объединение, PDF/A или сжатие изображений |
| Сканированный PDF | Есть ли корректный текстовый слой | OCR, затем проверка и Squeeze |
| JPG или PNG | Ориентация, поля, разрешение и физический размер | OCR и выбор стандартного листа |
| Многостраничный TIF | Импортированы ли все страницы в правильном порядке | OCR всей группы |
| HTML или веб-страница | Полнота печатного представления и перенос таблиц | Сборка с другими страницами |
| Письмо | Заголовки, тело, цитаты и отдельные вложения | OCR при необходимости и сохранение |
Формат результата всегда выбирают по задаче. Для поиска достаточно обычного PDF с текстовым слоем. Для передачи небольшой копии применяют щадящий Squeeze. Для долгого хранения создают PDF/A, понимая ограничения ссылок, мультимедиа и защиты. TXT и JSON нужны для извлечения текста, но не сохраняют визуальную страницу и не должны заменять оригинал.
Масштаб, наложение и просмотр страницы
Дополнительное наложение PDF помогает управлять масштабом и представлением открытого листа. Оно полезно при проверке мелкой печати после сжатия: можно быстро приблизить участок, затем вернуть страницу целиком. Масштаб просмотра не меняет реальное разрешение файла, поэтому увеличение размытого скана не создаёт новых деталей; оно лишь помогает заметить проблему до сохранения.
При сравнении до и после обработки используйте одинаковый масштаб и одну и ту же область. Если исходник открыт целиком, а результат увеличен, субъективная оценка будет неверной. Для проверки выберите мелкую сноску, печать, штрихкод и диагональную линию. Сравните контуры и только затем принимайте профиль Squeeze для всей пачки.
Миниатюры не подходят для оценки резкости, зато хорошо показывают порядок, поворот и пустые страницы. Центральный просмотр используют для качества изображения, Copy Text — для содержимого, поиск — для привязки слоя, а строку состояния — для размера и PDF/A. Такое разделение проверок быстрее, чем попытка оценить всё по одному экрану.
Аннотации, ссылки и существующий текст
При OCR и сжатии PDFify стремится сохранять аннотации, однако режим полной растеризации меняет природу страницы. Видимые пометки могут остаться частью изображения, но их интерактивные свойства, всплывающие комментарии или возможность последующего редактирования следует проверять отдельно. Для файла с важными аннотациями сначала сделайте копию и начните с режима Compress images only.
Ссылки обычно сохраняются в обычном PDF, пока операция не требует соответствия PDF/A. При переводе в PDF/A несовместимые интерактивные элементы могут удаляться. Перед преобразованием откройте несколько ссылок и запишите, какие из них должны остаться рабочими; после сохранения повторите тест. Если ссылки нужны пользователю, передавайте рабочую копию параллельно с файлом для долгого хранения.
Наличие текста не означает его качество. Старый PDF может содержать слой с пропущенными буквами или неправильными координатами. Сначала попробуйте поиск и копирование. Если символы выделяются в стороне от видимой строки либо русские слова превращаются в латиницу, выполняйте принудительный OCR, а не считайте документ исправным только потому, что курсор позволяет выделить что-то на странице.
Диагностика проблем при импорте файлов
Если JPG не добавляется или обработка останавливается, пересохраните изображение в Preview как новый PNG или JPEG. Причиной может быть необычный профиль цвета, повреждённые метаданные или структура, которую декодер читает нестабильно. Пересохранение создаёт простой файл без изменения видимого содержимого. После этого добавьте одну страницу и проверьте OCR до возврата к пачке.
Для TIFF сначала выясните, сколько страниц содержит файл. Если добавился только один лист, убедитесь, что исходник действительно многостраничный, а не папка из отдельных изображений с расширением TIF. Откройте его в Preview и посмотрите боковую панель. При повреждении экспортируйте страницы в отдельные PNG и перетащите их с числовыми именами.
HTML может зависеть от шрифтов, сценариев и сетевых данных. Если страница пустая или неполная, сохраните её через системную печать в PDF, пока всё содержимое видно, и уже этот PDF добавьте в PDFify. Для письма аналогично: откройте сообщение отдельно и сформируйте печатную копию, если перетаскивание не передаёт нужные заголовки или вложения.
При массовом импорте ошибка сортировки обычно связана с именами: строка 10 может идти перед строкой 2. Используйте одинаковую длину числовой части — 001, 002, 010. После добавления найдите визуальные разделители и проверьте переходы между группами, потому что одна неверно расположенная страница может изменить смысл всего договора.
Тестовая матрица для выбора параметров
Вместо бесконечного изменения настроек подготовьте одну тестовую страницу, на которой есть обычный текст, мелкие цифры, таблица, печать и фотография. Сохраните несколько копий с понятными именами: Vision, Tesseract-RU, Gray-300, BW-300, Images-Only. Затем сравните четыре признака: точность контрольных слов, читаемость мелких элементов, итоговый размер и время обработки.
| Проверка | Как измерить | Недопустимый результат |
|---|---|---|
| Текст | Поиск пяти заранее выбранных слов | Не найдено критичное имя или номер |
| Цифры | Копирование суммы, даты и артикула | Подмена 0/O, 1/l, 3/8 |
| Картинка | Просмотр печати и штрихкода при увеличении | Слипшиеся линии и потеря полутона |
| Размер | Сравнение значения в строке состояния | Рост без улучшения качества |
| Скорость | Одинаковая страница на обоих механизмах | Время неприемлемо для всей партии |
Победивший набор сохраняют как рабочий профиль только для сходных документов. Тест для чека нельзя автоматически переносить на цветной сертификат или технический чертёж. Новая группа требует хотя бы одной контрольной страницы. Такой подход занимает несколько минут и предотвращает обработку сотен файлов неподходящими параметрами.
Точная настройка быстрых действий Finder
Перед включением замены исходников создайте небольшую папку из копий. Выделите один файл и примените Create Searchable PDF, затем второй — Convert to PDF/A, третий — Squeeze PDF. Проверьте суффиксы, место сохранения и поведение при совпадении имён. Только после этого используйте множественное выделение.
Когда исходник сохраняется, суффикс показывает назначение результата. .searchable.pdf означает добавление или обновление OCR-слоя, .pdf-a.pdf — преобразование для долгого хранения, .min.pdf — уменьшенную копию. Если цепочка выполняется несколько раз, имена могут становиться длинными; сценарий Shortcuts удобнее, когда нужно централизованно задать файлам новые имена после обработки.
Замена исходника оправдана только при воспроизводимом процессе и наличии резервной копии. Она не должна применяться к смешанной папке. Даже Guard защищает лишь от увеличения размера, но не оценивает потерю цвета, тонких линий или интерактивных элементов. Визуальная выборочная проверка остаётся обязательной.
Пример сценария Shortcuts для извлечения текста
Для папки входящих сканов можно построить последовательность: получить файлы, отфильтровать PDF, вызвать Make PDF Searchable, затем Get Text from PDF, сохранить TXT рядом и переместить обработанный PDF в другую папку. Сначала не добавляйте удаление исходника. После нескольких успешных запусков можно заменить ручное перемещение автоматическим.
Если требуется машинная обработка, вместо TXT вызывают Export PDF Text Data as JSON. Следующий шаг сценария может передать JSON вашему скрипту, но правила разбора должны учитывать страницы без текста и сложный порядок блоков. Записывайте имя исходного файла вместе с данными, иначе после пакетного запуска будет трудно связать ошибочную строку с конкретным PDF.
Условие Get PDF/A Status полезно перед преобразованием: уже подходящие файлы можно пропустить, а остальные направить в Convert PDF to PDF/A. Это сокращает лишнюю переработку. После ветвления проверьте, что обе группы попадают в ожидаемые папки и получают уникальные имена.
Разбор конкретных вопросов по PDFify
Можно ли исправить опечатку прямо в открытом PDF?
Нет. PDFify создаёт и использует текстовый слой, объединяет страницы и выполняет обработку, но не предлагает правку букв на самой странице. Скопируйте текст для внешнего редактирования либо откройте файл в полноценном редакторе PDF. После внешней правки снова проверьте поиск и при необходимости примените только сжатие изображений.
Почему поиск находит английское слово, но не русскую фамилию?
Вероятнее всего, распознавание выполнялось без русского языкового пакета либо дефектный текстовый слой уже присутствовал. Активируйте русский в Tesseract, оставьте английский только при реальной необходимости и запустите OCR принудительно. Затем сохраните копию и проверьте фамилию в Preview.
Почему после сжатия нельзя выделить текст?
Был выбран режим растеризации всей страницы. Он превращает содержимое в изображение. Запустите OCR после Squeeze или используйте Compress images only для цифрового документа, где настоящий текст нужно сохранить.
Можно ли сканировать несколько документов подряд в разные файлы?
Да. В диалоге Scanner отключайте добавление к открытому документу перед началом каждого нового набора. Для многостраничного документа включайте флажок, пока не получен последний лист. После сохранения очистите окно или создайте новый документ, чтобы следующая пачка не смешалась с предыдущей.
Как сохранить цветную печать и одновременно уменьшить размер?
Начните с режима сжатия только изображений либо цветной растеризации с умеренным dpi и качеством. Не используйте grayscale и black and white. Сравните печать при увеличении и на пробной распечатке, затем применяйте профиль к остальным страницам.
Нужно ли распознавать цифровой PDF повторно?
Обычно нет. Проверьте поиск и Copy Text. Повторный OCR требуется, если слой отсутствует, содержит ошибки, смещён относительно изображения или использует неправильный алфавит. Без причины операция может заменить качественный текст менее точным распознанным вариантом.
Почему PDF/A потерял пароль и ссылки?
Формат для долгого хранения ограничивает шифрование и некоторые интерактивные элементы. Сохраните обычную рабочую копию с нужными свойствами, а PDF/A используйте отдельно. Перед передачей проверьте требования принимающей системы.
Какой механизм лучше для русского языка?
Универсального победителя нет. Tesseract с русским пакетом даёт управляемый выбор языка, Apple Vision удобен автоматическим определением и системной интеграцией. Сравните оба на своей странице с фамилиями, цифрами и таблицей; решение принимайте по контрольным полям.
Можно ли применить один профиль к папке разных документов?
Технически да, но результат будет непредсказуемым. Разделите цветные, чёрно-белые, цифровые и сканированные материалы. Guard не заменяет визуальный контроль и не предотвращает потерю цвета. Один профиль используют только для однородной группы.
Почему файл обрабатывается долго?
Причинами бывают большое число страниц, высокое разрешение, несколько активных языков, точные данные Tesseract и нехватка памяти. Проверьте одну страницу, сократите языки, разделите документ и закройте тяжёлые задачи. Не снижайте качество до проверки критичных деталей.
Сравнение PDFify с аналогами
| Программа | Лучше подходит для | Главное ограничение |
|---|---|---|
| PDFify | OCR сканов, сборки страниц, PDF/A, сжатия и автоматизации на Mac | Нет редактирования текста страницы |
| PDF Commander | Правки текста и страниц, аннотаций и защиты PDF на Windows и Linux | Не предназначен для macOS |
| Adobe Acrobat Pro | Полного редактирования, форм, подписей, OCR и корпоративного обмена | Сложнее и требует подписки |
| ABBYY FineReader PDF | Точного OCR и экспорта распознанного содержания в офисные форматы | Коммерческий тяжёлый процесс |
| OCRmyPDF | Сценарной пакетной обработки и добавления OCR-слоя в терминале | Нет обычного графического окна |
| Preview | Просмотра, аннотаций, перестановки и объединения страниц на Mac | Нет сопоставимого пакетного OCR |
PDFify выбирают, когда основной поток состоит из сканов, фотографий, писем и готовых PDF, а результат должен стать поисковым, компактным и пригодным для долговременного хранения. PDF Commander удобнее для прямой правки содержания на Windows или Linux. Acrobat Pro подходит организациям, которым нужны формы, подписи и широкий набор инструментов. FineReader стоит рассматривать при приоритете точного переноса в DOCX или XLSX, OCRmyPDF — для сценариев командной строки, Preview — для простого объединения и аннотаций без развитого пакетного OCR.
Кому подходит PDFify
Программа особенно удобна владельцам Mac, которые регулярно получают бумажные документы и хотят находить их через поиск, не создавая сложную систему. Бухгалтер может объединять чеки, юрист — добавлять подписанные листы к цифровому договору, исследователь — превращать сканы в поисковый набор, а офисный сотрудник — пакетно обрабатывать папку из Finder.
PDFify не заменяет редактор содержимого. Если нужно исправлять слова прямо на странице, менять шрифт, создавать формы или редактировать изображения, понадобится другой инструмент. Здесь сильная сторона — получение страниц, OCR, оптимизация, PDF/A и автоматизация. Чёткое понимание границы экономит время и предотвращает ожидание несуществующих команд.
Для редкого одноразового документа сначала проверьте бесплатные функции. Для постоянной оцифровки настройте профили сканера, языки, быстрые действия и правила имён. Наибольшую пользу даёт не отдельная кнопка, а стабильная последовательность, при которой каждый результат проверяется по одинаковым признакам.
Пошаговый рабочий процесс без лишних повторов
- Скопируйте исходные файлы в отдельную папку и приведите имена к нужному порядку.
- Добавьте материалы в PDFify и проверьте миниатюры, поворот и пустые страницы.
- Выберите Apple Vision либо Tesseract и минимальный набор языков.
- Запустите OCR только для страниц без корректного текста или принудительно для дефектного слоя.
- Проверьте поиск по фамилии, дате, сумме и редкому слову.
- Выберите режим Squeeze по типу содержимого и сравните качество с исходником.
- При необходимости создайте PDF/A и проверьте отображаемый статус.
- Сохраните под новым именем, откройте файл повторно и только затем удаляйте промежуточные копии.
Такой порядок оставляет возможность вернуться к исходной странице на каждом важном этапе. Он также разделяет две операции, которые часто путают: OCR создаёт текстовый слой, а Squeeze меняет представление изображений. Если сначала агрессивно уменьшить плохой скан, потерянные детали уже нельзя восстановить распознаванием.
Для пакетной папки используйте те же этапы, но добавьте выборочную проверку. Откройте минимум три результата из разных частей списка. При однородных материалах этого достаточно, чтобы заметить неверный язык, поворот, обрезку или слишком сильное сжатие до удаления исходников.
Итоговая проверка перед передачей файла
- Все страницы присутствуют и расположены в правильном порядке.
- Пустые листы удалены, а обороты не потеряны.
- Ориентация правильная и миниатюры соответствуют содержимому.
- Поиск находит русские и латинские контрольные слова.
- Скопированный текст содержит корректные даты, суммы и номера.
- Мелкие символы, печати, штрихкоды и схемы читаемы при увеличении.
- Размер уменьшился без заметного ухудшения или оставлен исходным.
- PDF/A имеет требуемый профиль, если он нужен принимающей стороне.
- Файл повторно открыт после сохранения и печатается с правильным масштабом.
- Имя отличает финальный документ от исходника и промежуточных копий.
PDFify раскрывается лучше всего в дисциплинированном процессе: аккуратный импорт, правильный язык, контрольный OCR, щадящее сжатие и проверка результата в другом просмотрщике. При таком подходе сканы становятся доступными для поиска, смешанные страницы собираются в единый документ, а Finder и Shortcuts снимают повторяющиеся действия без потери контроля над качеством.