BETA

Lokaler Arbeitsbereich für eingebetteten Text

Text aus PDF extrahieren

Eingebetteten Text aus gewählten PDF-Seiten extrahieren.

Verarbeitung
Nur im Browser
Konto
Nicht erforderlich
Aktuelle Grenze
Eine PDF · 100 MB · 250 Seiten
Ausgabe
UTF-8-Textdatei
Verarbeitung nur im Browser

Keine Dateiübertragung, Analyse, Werbung oder externen Verarbeitungsskripte in diesem Arbeitsbereich.

BEREIT

Lokale Extraktion eingebetteten Texts

Eine PDF wählen

PigPDF liest die eingebettete Textebene in Quellreihenfolge und erstellt eine separate UTF-8-Textdatei.

Eine PDF hier ablegen

oder eine Datei von diesem Gerät wählen

Eine PDF bis 100 MB und 250 Seiten · Scans benötigen OCR

Aktuelle Kompatibilität

Was diese Beta unterstützt

PigPDF liest den eingebetteten Textstrom ohne OCR. Die Ausgabe ist Klartext, keine Rekonstruktion des Seitenlayouts.

PDF in TextAktuelle Kompatibilität
EingabemerkmalAktuelles VerhaltenGrund
Eingebetteter SeitentextExtrahiertGewählte Seiten werden in Quellreihenfolge gelesen.
Reine BildscansKein TextOCR ist eine separate geplante Funktion.
Komplexe Spalten und LayoutsKönnen sich ändernDie PDF-Stream-Reihenfolge entspricht nicht immer der semantischen Lesereihenfolge.
Passwortschutz oder BeschädigungAbgelehntDiese Beta enthält keine Passwort- oder Reparaturfunktion.

Vor der Nutzung

Fragen und Grenzen

Verlässt meine Datei dieses Gerät?

Nein. Dieses Tool sendet keine Dateiinhalte. Die aktive Verarbeitung läuft in diesem Browser und wird durch einen automatisierten Egress-Test geprüft.

Verändert PigPDF meine Quelldatei?

Nein. Die Quelle bleibt unverändert und PigPDF erstellt eine separate Ausgabedatei.

Welche aktuellen Grenzen gelten?

Eine PDF bis 100 MB und 250 Seiten. Nur eingebetteter Text wird extrahiert; Scans benötigen OCR und die Lesereihenfolge kann mehrdeutig sein.