Lokaler Arbeitsbereich für eingebetteten Text
Text aus PDF extrahieren
Eingebetteten Text aus gewählten PDF-Seiten extrahieren.
- Verarbeitung
- Nur im Browser
- Konto
- Nicht erforderlich
- Aktuelle Grenze
- Eine PDF · 100 MB · 250 Seiten
- Ausgabe
- UTF-8-Textdatei
Keine Dateiübertragung, Analyse, Werbung oder externen Verarbeitungsskripte in diesem Arbeitsbereich.
Lokale Extraktion eingebetteten Texts
Eine PDF wählen
PigPDF liest die eingebettete Textebene in Quellreihenfolge und erstellt eine separate UTF-8-Textdatei.
oder eine Datei von diesem Gerät wählen
Aktuelle Kompatibilität
Was diese Beta unterstützt
PigPDF liest den eingebetteten Textstrom ohne OCR. Die Ausgabe ist Klartext, keine Rekonstruktion des Seitenlayouts.
| Eingabemerkmal | Aktuelles Verhalten | Grund |
|---|---|---|
| Eingebetteter Seitentext | Extrahiert | Gewählte Seiten werden in Quellreihenfolge gelesen. |
| Reine Bildscans | Kein Text | OCR ist eine separate geplante Funktion. |
| Komplexe Spalten und Layouts | Können sich ändern | Die PDF-Stream-Reihenfolge entspricht nicht immer der semantischen Lesereihenfolge. |
| Passwortschutz oder Beschädigung | Abgelehnt | Diese Beta enthält keine Passwort- oder Reparaturfunktion. |
Vor der Nutzung
Fragen und Grenzen
Verlässt meine Datei dieses Gerät?
Nein. Dieses Tool sendet keine Dateiinhalte. Die aktive Verarbeitung läuft in diesem Browser und wird durch einen automatisierten Egress-Test geprüft.
Verändert PigPDF meine Quelldatei?
Nein. Die Quelle bleibt unverändert und PigPDF erstellt eine separate Ausgabedatei.
Welche aktuellen Grenzen gelten?
Eine PDF bis 100 MB und 250 Seiten. Nur eingebetteter Text wird extrahiert; Scans benötigen OCR und die Lesereihenfolge kann mehrdeutig sein.