Text aus einem nicht markierbaren PDF auf dem Mac kopieren
Von Eduard Bruch, Entwickler von Optic · Aktualisiert am
Ein PDF, in dem du keinen Text markieren kannst, ist meist ein Scan: Jede Seite ist ein Bild von Text, nicht Text selbst. Um auf einem Mac daraus zu kopieren, versuche, den Text in der Vorschau zu markieren (Live Text erkennt ihn vielleicht), oder nutze eine Bildschirm-OCR-App, um den benötigten Teil der Seite vom Bildschirm zu lesen.
Kurze Antwort: Die Vorschau mit Live Text ist einen Versuch wert. Nimmt sie den Text nicht auf, ist meine Wahl Optic, eine Menüleisten-App, die den Text in jedem Bereich kopiert, über den du ein Rechteck ziehst (4,99 $ (Einmalkauf) im Mac App Store).
Offenlegung: Ich entwickle Optic.
Warum manche PDFs keinen markierbaren Text haben
Ein PDF kann echten Text enthalten, Bilder oder beides. Gescannte Dokumente, fotografierte Seiten, Faxe und manche exportierte Formulare enthalten nur Bilder der Seiten. Jeder PDF-Viewer sieht dasselbe: Pixel in Form von Buchstaben, ohne Zeichen darunter, die sich markieren ließen.
Ein zweiter, seltener vorkommender Fall ist ein PDF, dessen Urheber das Kopieren eingeschränkt hat. Das ist eine Entscheidung der Dokumentinhaberin. Stelle sicher, dass du das Recht hast, den Text weiterzuverwenden, bevor du ihn auf irgendeinem Weg kopierst.
Probiere zuerst die Vorschau
Live Text funktioniert dort, wo Apple es unterstützt: bei Bildern in Vorschau, Fotos, Übersicht und Safari. In beliebigen App-Fenstern, Videoanrufen oder Oberflächentext funktioniert es nicht.
- Öffne das PDF in der Vorschau.
- Zoome hinein, damit der Text groß und scharf ist.
- Fahre über eine Zeile. Wird der Zeiger zum Textcursor, ziehe zum Markieren und drücke Befehl-C.
Ob das klappt, hängt vom Dokument ab. Wird nichts hervorgehoben, geh zur nächsten Option.
Den Text vom Bildschirm kopieren mit Optic
Optic ist es egal, wie das PDF erstellt wurde. Es liest, was auf dem Bildschirm in einem von dir gezogenen Rechteck sichtbar ist.
- Öffne das PDF in der Vorschau oder einem beliebigen PDF-Viewer und zoome auf eine angenehme Größe.
- Klicke in der Menüleiste auf das Optic-Symbol.
- Wähle Text erfassen und ziehe ein Rechteck über den benötigten Absatz.
- Füge mit Befehl-V ein.
Die Erkennung läuft auf deinem Mac mit Apples Vision-Framework in der genauen Einstellung, das Dokument verlässt deinen Computer also nie. Größerer, schärferer Text auf dem Bildschirm liefert bessere Ergebnisse, daher hilft das Hineinzoomen vor der Erfassung bei Kleingedrucktem und blassen Scans.
Sauberere Absätze
Gescannte Seiten brechen Zeilen oft mitten im Satz um. Stelle die Zeilenumbrüche in den Einstellungen auf Intelligent zusammenführen, um umbrochene Zeilen zu verbinden und dabei Satzenden zu behalten, oder auf Entfernen, um eine lange Zeile zu bekommen. Leerzeichen entfernen ist standardmäßig eingeschaltet.
Mehrere Seiten durcharbeiten
Optic erfasst jeweils einen Bereich. Für ein paar Absätze über mehrere Seiten: scrollen, erfassen, einfügen und wiederholen. Der Verlauf in der Menüleiste behält deine letzten 20 Erfassungen, falls du sie später in anderer Reihenfolge einfügen willst.
Gemischte Sprachen
Scans in anderen Sprachen funktionieren, solange die Sprache zu den 21 gehört, die Optic erkennt, etwa Deutsch, Französisch, Spanisch, Polnisch oder Japanisch. Jede Sprache lässt sich in den Einstellungen ein- oder ausschalten.
Text aus einem ganzen PDF auf dem Mac extrahieren
Brauchst du den gesamten Text eines PDFs statt einer Passage, hängt der Weg von der Datei ab. Ein PDF mit Textebene: öffne es in der Vorschau, drücke Befehl-A, dann Befehl-C, und füge ein. Ein gescanntes PDF ohne Textebene braucht eine Dokument-OCR-App, die Dateien öffnet und ein durchsuchbares PDF erstellt. Optic ist die andere Aufgabe: Es kopiert die Passage, die du sehen kannst, Seite für Seite, und verarbeitet nicht die ganze Datei.
Wo Optic nicht passt
Mach dir die Aufgabe klar, bevor du etwas kaufst:
- Es öffnet die PDF-Datei nicht. Die Seite muss auf dem Bildschirm sichtbar sein.
- Es liest kein ganzes Dokument per OCR. Es gibt keinen Modus für ganze Dokumente, keine Ordnerverarbeitung und keine Ausgabe als durchsuchbares PDF. Wenn du ein ganzes gescanntes Buch in eine durchsuchbare Datei verwandeln musst, nutze spezielle PDF-OCR-Software.
- Keine Tabellenextraktion. Tabellen kommen als Textzeilen heraus.
- Handschrift ist keine zugesagte Funktion. Es ist für gedruckten Text gedacht.
- Keine Übersetzung.
Optic passt zum häufigen Fall: Du brauchst einen Satz, einen Absatz, eine Kontonummer oder ein Aktenzeichen aus einem Scan, und zwar jetzt. Für anderen Text auf dem Bildschirm siehe Text von überall auf deinem Mac-Bildschirm kopieren und was die Texterkennung der Vorschau nicht kann. Für Scans in anderen Sprachen siehe Fremdsprachigen Text auf dem Mac per OCR lesen; um eine erfasste Passage anzuhören, siehe Text vom Bildschirm auf dem Mac vorlesen lassen.
FAQ
Warum kann ich Text in einem PDF auf dem Mac nicht markieren?
Das PDF enthält höchstwahrscheinlich gescannte Bilder von Seiten statt Text. Probiere Live Text in der Vorschau oder ein Bildschirm-OCR-Werkzeug.
Wie kopiere ich Text aus einem gescannten PDF auf dem Mac?
Öffne es in der Vorschau und versuche, den Text zu markieren. Klappt das nicht, ziehe mit einer Bildschirm-OCR-App wie Optic ein Rechteck über den Text und füge ein.
Wie extrahiere ich Text aus einem PDF auf dem Mac?
Lässt sich der Text in der Vorschau markieren, drücke Befehl-A und Befehl-C. Ist es ein Scan, kopiere die benötigten Passagen mit einer Bildschirm-OCR-App (meine Wahl ist Optic) oder nutze eine Dokument-OCR-App für die ganze Datei. Mehr dazu: die besten Bildschirm-OCR-Apps für den Mac.
Kann Optic mein PDF durchsuchbar machen?
Nein. Optic kopiert Text aus dem ausgewählten Bereich in die Zwischenablage. Es ändert oder erstellt keine PDF-Dateien.
Wird das PDF irgendwohin hochgeladen?
Nicht mit Optic. Die Erkennung geschieht auf deinem Mac, und die App hat keinen Netzwerkzugriff.