Как скопировать текст из PDF, в котором он не выделяется, на Mac
Автор: Eduard Bruch, разработчик Optic · Обновлено
PDF, в котором нельзя выделить текст, обычно является сканом: каждая страница — это изображение текста, а не сам текст. Чтобы скопировать из него на Mac, попробуйте выделить текст в «Просмотре» (Live Text может его распознать) или используйте приложение OCR экрана, чтобы считать с экрана нужную часть страницы.
Коротко: «Просмотр» с Live Text стоит попробовать один раз. Когда он не подхватывает текст, мой выбор — Optic, приложение для строки меню, которое копирует текст из любой выделенной на экране области (4,99 $ (разовая покупка) в Mac App Store).
Раскрытие информации: я делаю Optic.
Почему в некоторых PDF нет выделяемого текста
PDF может содержать настоящий текст, изображения или и то и другое. Отсканированные документы, фотографии страниц, факсы и некоторые экспортированные формы содержат только изображения страниц. Любой просмотрщик PDF видит одно и то же: пиксели в форме букв, под которыми нет символов для выделения.
Второй, более редкий случай — PDF, в котором автор ограничил копирование. Это решение владельца документа. Убедитесь, что вы вправе использовать текст повторно, прежде чем копировать его любым способом.
Сначала попробуйте «Просмотр»
Live Text работает там, где его поддерживает Apple: изображения в «Просмотре», «Фото», «Быстром просмотре» и Safari. Он не работает в произвольных окнах приложений, видеозвонках и тексте интерфейса.
- Откройте PDF в «Просмотре».
- Увеличьте масштаб, чтобы текст был крупным и чётким.
- Наведите указатель на строку. Если курсор стал текстовым, выделите и нажмите Command-C.
Сработает ли это, зависит от документа. Если ничего не выделяется, переходите к следующему варианту.
Скопируйте текст с экрана с Optic
Optic всё равно, как был создан PDF. Он читает то, что видно на экране, внутри рамки, которую вы рисуете.
- Откройте PDF в «Просмотре» или любом просмотрщике PDF и подберите удобный масштаб.
- Нажмите значок Optic в строке меню.
- Выберите Захватить текст и выделите рамкой нужный абзац.
- Вставьте сочетанием Command-V.
Распознавание выполняется на вашем Mac с помощью фреймворка Vision от Apple в его точном режиме, поэтому документ никогда не покидает ваш компьютер. Более крупный и чёткий текст на экране даёт лучшие результаты, поэтому увеличение масштаба перед захватом помогает при мелком шрифте и бледных сканах.
Более аккуратные абзацы
В отсканированных страницах строки часто обрываются посреди предложений. В настройках установите переносы строк в Умное объединение, чтобы склеить разбитые строки с сохранением концов предложений, или Удалять, чтобы получить одну длинную строку. Параметр «Удалять лишние пробелы» включён по умолчанию.
Работа с несколькими страницами
Optic захватывает одну область за раз. Для нескольких абзацев на разных страницах прокрутите, захватите, вставьте и повторите. История в строке меню хранит последние 20 захватов, если вы захотите вставить их позже в другом порядке.
Смешанные языки
Сканы на других языках работают, если язык входит в 21 язык, которые распознаёт Optic, например немецкий, французский, испанский, польский или японский. Каждый язык можно включить или выключить в настройках.
Извлечение текста из целого PDF на Mac
Если вам нужен весь текст PDF, а не отрывок, способ зависит от файла. PDF с текстовым слоем: откройте его в «Просмотре», нажмите Command-A, затем Command-C и вставьте. Отсканированному PDF без текстового слоя нужно приложение для OCR документов, которое открывает файлы и создаёт PDF с поиском. Optic решает другую задачу: он копирует отрывок, который вы видите, страница за страницей, и не обрабатывает весь файл.
Где Optic не подходит
Чётко определите задачу, прежде чем что-либо покупать:
- Он не открывает файл PDF. Страница должна быть видна на экране.
- Он не делает OCR целого документа. Нет режима целого документа, обработки папок и вывода в PDF с поиском. Если вам нужно превратить целую отсканированную книгу в файл с поиском, используйте специальное программное обеспечение для OCR PDF.
- Нет извлечения таблиц. Таблицы выходят строками текста.
- Рукописный текст не входит в обещанные функции. Он предназначен для печатного текста.
- Без перевода.
Optic подходит для обычного случая: вам нужно предложение, абзац, номер счёта или ссылка из скана прямо сейчас. О другом тексте на экране см. как скопировать текст из любого места экрана Mac и чего не умеет распознавание текста в «Просмотре». О сканах на других языках — OCR текста на иностранных языках на Mac; чтобы послушать захваченный отрывок, см. чтение текста вслух с экрана на Mac.
FAQ
Почему я не могу выделить текст в PDF на Mac?
Скорее всего, PDF содержит отсканированные изображения страниц, а не текст. Попробуйте Live Text в «Просмотре» или инструмент OCR экрана.
Как скопировать текст из отсканированного PDF на Mac?
Откройте его в «Просмотре» и попробуйте выделить текст. Если не получается, выделите текст рамкой в приложении OCR экрана вроде Optic и вставьте.
Как извлечь текст из PDF на Mac?
Если текст выделяется в «Просмотре», нажмите Command-A и Command-C. Если это скан, скопируйте нужные отрывки в приложении OCR экрана (мой выбор — Optic) или используйте приложение OCR документов для всего файла. Подробнее: лучшие приложения OCR экрана для Mac.
Может ли Optic сделать мой PDF доступным для поиска?
Нет. Optic копирует текст из выбранной области в буфер обмена. Он не изменяет и не создаёт файлы PDF.
Загружается ли PDF куда-либо?
Не в Optic. Распознавание происходит на вашем Mac, а у приложения нет доступа к сети.