Copiar texto de um PDF não selecionável no Mac
Por Eduard Bruch, desenvolvedor do Optic · Atualizado em
Um PDF que não deixa selecionar texto geralmente é uma digitalização: cada página é uma imagem de texto, não o texto em si. Para copiar dele no Mac, tente selecionar o texto no Preview (o Live Text pode reconhecê-lo) ou use um app de OCR de tela para ler na tela a parte da página de que você precisa.
Resposta curta: vale tentar uma vez o Preview com o Live Text. Quando ele não pega o texto, minha escolha é o Optic, um app da barra de menus que copia o texto de qualquer área que você arrastar na tela (US$ 4,99 (compra única) na Mac App Store).
Divulgação: eu desenvolvo o Optic.
Por que alguns PDFs não têm texto selecionável
Um PDF pode conter texto de verdade, imagens ou ambos. Documentos digitalizados, páginas fotografadas, faxes e alguns formulários exportados contêm apenas imagens das páginas. Todo visualizador de PDF vê a mesma coisa: pixels com formato de letras, sem caracteres por baixo para selecionar.
Um segundo caso, mais raro, é um PDF cujo autor restringiu a cópia. Essa é uma escolha do dono do documento. Certifique-se de ter o direito de reutilizar o texto antes de copiá-lo por qualquer caminho.
Tente primeiro o Preview
O Live Text funciona onde a Apple o suporta: imagens no Preview, no Fotos, no Quick Look e no Safari. Ele não funciona em janelas arbitrárias de apps, chamadas de vídeo ou texto da interface.
- Abra o PDF no Preview.
- Dê zoom para o texto ficar grande e nítido.
- Passe o ponteiro sobre uma linha. Se o cursor virar um cursor de texto, arraste para selecionar e pressione Command-C.
Se funciona ou não depende do documento. Se nada for destacado, passe para a próxima opção.
Copie o texto da tela com o Optic
O Optic não se importa com a forma como o PDF foi feito. Ele lê o que está visível na tela dentro de um retângulo que você desenha.
- Abra o PDF no Preview ou em qualquer visualizador de PDF e dê zoom até um tamanho confortável.
- Clique no ícone do Optic na barra de menus.
- Escolha Capturar Texto e arraste um retângulo sobre o parágrafo de que precisa.
- Cole com Command-V.
O reconhecimento roda no seu Mac com o framework Vision da Apple no nível preciso, então o documento nunca sai do seu computador. Texto maior e mais nítido na tela dá resultados melhores, então dar zoom antes de capturar ajuda com letras pequenas e digitalizações fracas.
Parágrafos mais limpos
Páginas digitalizadas costumam quebrar linhas no meio das frases. Nas Configurações, defina as quebras de linha como Mesclagem inteligente para unir linhas quebradas mantendo os finais de frase, ou Remover para obter uma linha longa. Remover espaços extras vem ativado por padrão.
Trabalhando com várias páginas
O Optic captura uma área por vez. Para alguns parágrafos espalhados por várias páginas, role, capture, cole e repita. O histórico da barra de menus guarda suas últimas 20 capturas, caso você queira colá-las depois em outra ordem.
Idiomas misturados
Digitalizações em outros idiomas funcionam desde que o idioma seja um dos 21 que o Optic reconhece, como alemão, francês, espanhol, polonês ou japonês. Cada idioma pode ser ativado ou desativado nas Configurações.
Extrair o texto de um PDF inteiro no Mac
Se você precisa de todo o texto de um PDF, e não de uma passagem, o caminho depende do arquivo. Um PDF com camada de texto: abra no Preview, pressione Command-A, depois Command-C, e cole. Um PDF digitalizado sem camada de texto precisa de um app de OCR de documentos que abra arquivos e crie um PDF pesquisável. O Optic é outro trabalho: ele copia a passagem que você vê, página por página, e não processa o arquivo inteiro.
Onde o Optic não se encaixa
Deixe o trabalho claro antes de comprar qualquer coisa:
- Ele não abre o arquivo PDF. A página precisa estar visível na tela.
- Ele não faz OCR de um documento inteiro. Não há modo de documento inteiro, nem processamento de pastas, nem saída em PDF pesquisável. Se você precisa transformar um livro digitalizado inteiro em um arquivo pesquisável, use um software de OCR de PDF dedicado.
- Sem extração de tabelas. As tabelas saem como linhas de texto.
- Escrita à mão não é um recurso prometido. Ele foi feito para texto impresso.
- Sem tradução.
O Optic atende ao caso comum: você precisa de uma frase, um parágrafo, um número de conta ou uma referência de uma digitalização, agora mesmo. Para outros textos na tela, veja copiar texto de qualquer lugar da tela do Mac e o que o reconhecimento de texto do Preview não consegue fazer. Para digitalizações em outros idiomas, veja OCR de texto em idioma estrangeiro no Mac; para ouvir uma passagem capturada, veja ler texto da tela em voz alta no Mac.
FAQ
Por que não consigo destacar texto num PDF no Mac?
O PDF provavelmente contém imagens digitalizadas das páginas, e não texto. Tente o Live Text no Preview ou uma ferramenta de OCR de tela.
Como copio texto de um PDF digitalizado no Mac?
Abra-o no Preview e tente selecionar o texto. Se falhar, arraste um retângulo sobre o texto com um app de OCR de tela como o Optic e cole.
Como extraio texto de um PDF no Mac?
Se o texto é selecionável no Preview, pressione Command-A e Command-C. Se for uma digitalização, copie as passagens de que precisa com um app de OCR de tela (minha escolha é o Optic) ou use um app de OCR de documentos para o arquivo inteiro. Mais em: melhores apps de OCR de tela para Mac.
O Optic pode tornar meu PDF pesquisável?
Não. O Optic copia texto da área que você seleciona para a área de transferência. Ele não altera nem cria arquivos PDF.
O PDF é enviado para algum lugar?
Não com o Optic. O reconhecimento acontece no seu Mac e o app não tem acesso à rede.