Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

На русском языке
Статьи/ Продукты

Как подготовить PDF для ИИ на Mac: текст, сканы и нужные страницы

Проверяем текстовый слой, отделяем нужные страницы в «Просмотре» и на учебном PDF разбираем, как теряются связи в таблицах.

ИнструкцияПроверка ·
Система
macOS 27.0
Программы
Python 3.12.14 · pypdf 6.10.0
Подробности проверки
  • macOS 27.0 arm64
  • Python 3.12.14
  • pypdf 6.10.0: учебный PDF, извлечение и разделение.
  • Preview UI и OCR не проверялись.
MacBook и бумажный блокнот на рабочем столе
Фото: Andrew Valdivia

Как подготовить PDF на Mac, чтобы ИИ получил нужный текст, а не перепутанные строки? Сначала стоит проверить сам файл: можно ли извлечь буквы, совпадает ли порядок чтения с экраном и какие страницы действительно нужны. Для небольшого документа достаточно «Просмотра» и текстового редактора. Загрузка в чат — уже следующий этап; здесь мы готовим проверенный исходник.

В результате у вас будут сохранённый оригинал, отдельный PDF с нужными страницами и текстовая копия с понятными границами разделов. Начните с учебного или открытого документа. Если в файле есть личные сведения, сначала решите, какие страницы вообще допустимо передавать выбранному помощнику. Простое удаление лишнего текста из запроса не меняет содержимое приложенного оригинала.

Сначала проверьте одну страницу

Откройте PDF в «Просмотре» и найдите короткий абзац с числом и именем. Выберите «Инструменты» → «Выбор текста», выделите несколько строк и скопируйте их. Вставьте в новый документ TextEdit в режиме обычного текста. Сравните результат с PDF: сохранились ли имя, дата, дробная часть числа, окончания строк? Проверка одного абзаца помогает обнаружить проблему раньше, чем вы передадите модели десятки страниц.

Apple отдельно описывает копирование текста и копирование области как изображения. Это разные операции: вставив картинку страницы, вы не получили текстовый исходник. Если выделяется прямоугольник целиком, сначала проверьте выбранный инструмент. Неудачное выделение само по себе ещё не доказывает, что перед вами скан. По документации Apple, копирование также может ограничиваться защитой PDF; доступ следует уточнить у владельца файла.

Не ограничивайтесь первой страницей. В одном документе могут соседствовать набранное оглавление, отсканированный акт и приложение с таблицей. Проверьте хотя бы по странице каждого вида. Если середина файла выглядит иначе, отметьте её отдельно: автоматическое извлечение способно вернуть текст только с части страниц, а итоговый файл при этом всё равно будет непустым.

Текстовый PDF, скан и распознанный скан

Текстовый PDF, скан без текста и скан после OCR
Фото: TheTimeAI
Открыть крупнее

В текстовом PDF символы записаны в самом файле. Скан без текстового слоя хранит изображение: человек видит слова, но обычному извлекателю нечего копировать. OCR — распознавание символов на картинке — добавляет ещё один этап. Скан после OCR может позволять выделять текст, хотя на экране по-прежнему выглядит как фотография бумаги. Значит, возможность копирования не гарантирует правильности букв и чисел.

Если извлечение пустое, проще сначала запросить исходный текстовый документ или его экспорт в PDF. Когда доступен только скан, понадобится распознавание, после которого следует заново сверить результат. Этот гайд не обещает, что «Просмотр» превратит любой многостраничный скан в корректный текст. Особенно внимательно проверяйте артикулы, отрицательные значения и похожие символы: единицу, латинскую I, букву O и ноль.

Не нужно превращать исправный текстовый PDF в картинки ради последующего распознавания. Это добавляет преобразование без очевидной пользы. Наша практическая цель — получить читаемый фрагмент с сохранённым смыслом. Иногда исходный файл уже подходит, иногда потребуется вручную восстановить одну небольшую таблицу, а иногда лучше остановиться и получить более качественную копию у отправителя.

Отделите нужные страницы в «Просмотре»

Сохраните оригинал и работайте с копией. В меню «Вид» включите миниатюры, выберите нужные страницы в боковой панели и перетащите их на рабочий стол. Apple документирует этот способ создания нового PDF. Откройте получившийся файл заново, задайте понятное имя и проверьте начало, конец и число страниц. В названии удобно сохранить диапазон исходника: например, materials-pages-02-03.pdf.

Когда выбранный диапазон содержит лишнюю страницу, удаляйте её только из рабочей копии через боковую панель. Если порядок нарушен, миниатюры можно переместить. Помните: удаление страницы удаляет и её аннотации. Отделять приложение удобнее по содержанию, чем механически по одинаковому числу листов: заголовок таблицы, её продолжение и поясняющая сноска должны остаться вместе.

Номер листа в файле может не совпадать с напечатанным номером страницы. Обложка и оглавление часто меняют счёт. Поэтому пометка «страница 2 файла, раздел “Материалы”» полезнее голого числа. После разделения новая первая страница может быть второй страницей оригинала; сохраните это соответствие в текстовой копии, иначе позже будет трудно найти подтверждение ответа ИИ.

Извлеките текст небольшими фрагментами

Для короткого документа копируйте разделы последовательно и вставляйте их в обычный текст. Перед каждым добавляйте свою служебную пометку: название файла, номер страницы файла и заголовок. Не выдавайте эту пометку за часть оригинала. Для таблицы отдельно сохраните названия столбцов и единицы измерения: число 149,50 без подписи «рублей за штуку» допускает неверное прочтение.

После вставки проверьте стыки страниц. Не оборвалось ли предложение? Не вклинился ли колонтитул посередине? Не повторилось ли название раздела? Исправляйте только очевидные технические разрывы, сохраняя смысл. Если слово не удалось прочитать, пометьте неопределённость и вернитесь к изображению. Просить ИИ угадать пропущенную цену — значит добавлять сведения, которых вы не проверили.

Сохранённый текст удобен ещё и как контрольная копия. Вы видите ровно те символы, которые собираетесь передать. Это не означает, что любой чат обработает все страницы целиком, но позволяет отделить ошибку подготовки от ошибки ответа. До проверки исходника эти две причины легко спутать и начать менять модель вместо исправления документа.

Проверьте таблицу по строкам

Пример потери связей между названиями и количеством при извлечении таблицы
Фото: TheTimeAI
Открыть крупнее

Таблица в PDF может быть набором надписей, размещённых по координатам. Внешне это аккуратные строки, а внутри порядок записи другой. В нашем учебном документе на второй странице стоят пары «Блокнот — 2», «Папка — 1», «Карандаш — 3». Извлекатель pypdf вернул сначала три названия, затем заголовок «Количество» и три числа. Символы сохранились, но связь между соседними ячейками перестала быть явной.

Перед передачей такой таблицы восстановите строки вручную и сверяйте каждую пару с оригиналом. Для трёх строк это быстрее, чем разбирать убедительную ошибку помощника. Если таблица большая, нужен отдельный способ извлечения с проверкой структуры; копирование всей страницы не следует считать готовым решением.

Сверяйте не только общую сумму. Два переставленных числа могут дать прежний итог, но оказаться у других товаров. Отдельно проверьте пустые клетки, минусы, десятичные разделители и сноски. Если таблица продолжается на следующей странице, убедитесь, что повторный заголовок не превратился в запись и последняя строка предыдущего листа не потерялась.

Что проверено в этой инструкции

9 сентября 2026 года мы создали на Mac с macOS 27.0 учебный PDF из трёх страниц и извлекли его текст через Python 3.12.14 и pypdf 6.10.0. Проверили сохранность «Кедр» и «149,50», воспроизвели описанный порядок колонок, записали отдельный двухстраничный PDF и повторно прочитали его страницы в порядке 2 → 3. Из растровой копии первой страницы тот же извлекатель получил ноль текстовых символов.

Это локальная проверка файлов и извлечения средствами Python. Перетаскивание миниатюр в интерфейсе «Просмотра» описано по официальной инструкции Apple, но в этом тесте не воспроизводилось. OCR и распознавание сложных сканов тоже не проверялись. Учебный пример показывает, что именно стоит сверять; он не измеряет качество всех PDF и не доказывает, что конкретный ИИ правильно прочитает ваш документ.

Перед загрузкой откройте итоговый файл ещё раз. Если в нём есть нужные страницы, подписи таблиц, исходные единицы и понятный порядок, подготовка завершена. Если остаётся хотя бы одна строка, которую вы сами не можете уверенно связать с оригиналом, сначала исправьте её или явно обозначьте пробел: следующий вопрос уже будет о содержании, а не о том, какие данные потерялись по дороге.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям